Process Reward Models: Ako AI hodnotí každý krok uvažovania

Process Reward Models (PRM) sú tréningová technika, ktorá AI hodnotí nielen správnosť finálneho výsledku, ale každý jednotlivý uvažovací krok — a práve toto je jeden z kľúčových pilierov dnešných reasoning modelov.


1. Problém s hodnotením len výsledku

Tradičné prístupy odmeňovania AI modelov fungujú jednoducho: model dostane úlohu, vygeneruje odpoveď a reward model rozhodne, či je správna. Tento prístup sa volá Outcome Reward Model (ORM) — zaujíma ho iba konečný výsledok.

Problém je zrejmý na príklade matematiky. Model môže dospieť k správnemu výsledku nesprávnym postupom — uhádnuť číslo, urobiť dve chyby, ktoré sa navzájom vyrušia, alebo použiť postup fungujúci na tomto konkrétnom príklade, ale zlyhávajúci vo všeobecnosti. ORM to nerozozná: výsledok je správny, model dostane odmenu, zlý postup sa posilní.

Process Reward Model rieši tento problém tým, že hodnotiaci model posudzuje každý jednotlivý krok v reťazci uvažovania (Chain-of-Thought). Každý medzistupeň dostane vlastné skóre — krok je buď správny, nesprávny alebo neutrálny. Model sa teda neučí len čo povedať na konci, ale ako správne uvažovať.

Kľúčový princíp v skratke:

  • ORM hodnotí odpoveď binárne: správna / nesprávna
  • PRM hodnotí každý krok granulárne: vlastné skóre pre každý medzivýsledok
  • PRM vidí nielen cieľ, ale aj celú cestu k nemu

2. Ako PRM funguje technicky

Tréning Process Reward Model prebieha v niekoľkých fázach:

Zbieranie dát Najprv sa generujú riešenia úloh s viditeľnými krokmi uvažovania. Ľudskí anotátori — alebo silnejší model — označia každý krok ako správny alebo nesprávny. Ide o nákladnú operáciu, preto výskumné tímy intenzívne hľadajú spôsoby jej automatizácie.

Tréning reward modelu Na označených dátach sa trénuje samostatný model, ktorý sa naučí priradiť skóre každému kroku. Vstupom je kontext úlohy spolu s doterajšími krokmi, výstupom je pravdepodobnosť správnosti aktuálneho kroku.

Použitie pri inference Natrénovaný PRM sa môže použiť dvoma hlavnými spôsobmi:

  • Best-of-N sampling — generuje sa N kandidátnych riešení, PRM vyberie to s najvyšším súhrnným skóre naprieč krokmi
  • Beam search / MCTS — PRM riadi prieskum priestoru uvažovania v reálnom čase a odstraňuje slepé vetvy ešte pred ich dokončením

Reinforcement Learning PRM môže slúžiť aj ako reward signal pri RL tréningu — model dostáva odmenu za každý dobrý krok, nie až po finálnej odpovedi.


3. PRM vs ORM — kedy čo použiť

Vlastnosť ORM (Outcome RM) PRM (Process RM)
Čo hodnotí Finálny výsledok Každý krok uvažovania
Náročnosť na dáta Nízka Vysoká
Odhalí zlý postup Nie Áno
Vhodné pre Faktuálne odpovede, klasifikácia Matematika, kód, viacstupňová logika
Použitie pri inference Best-of-N Best-of-N, MCTS, beam search
Výpočtová náročnosť Nízka Vyššia
Príklady nasadenia GPT-4 early RLHF OpenAI o1/o3/o4, DeepSeek-R1

Oba prístupy sa v praxi kombinujú: PRM za kroky uvažovania, ORM za finálnu odpoveď.


4. Kde PRM zmenili hru

OpenAI séria o1/o3/o4 Process Reward Models sú jedným z kľúčových pilierov reasoning série od OpenAI. Modely sa naučili nielen hľadať odpovede, ale krok po kroku overovať vlastné uvažovanie — vrátane spätného návratu (backtracking), keď v predchádzajúcom kroku odhalia chybu.

DeepSeek-R1 Čínsky model DeepSeek-R1 ukázal, že PRM kombinované s GRPO (Group Relative Policy Optimization) dokážu dosiahnuť frontier úroveň uvažovania aj s výrazne nižším rozpočtom na ľudskú anotáciu. Kľúčovú úlohu zohral Monte Carlo Tree Search riadený PRM skóre.

Matematické benchmarky Na benchmarkoch MATH a AIME PRM-trénované modely konzistentne prekonávajú ORM varianty s rovnakou základnou kapacitou. Rozdiel je najvýraznejší pri úlohách s viacerými krokmi, kde pravdepodobnosť kumulatívnej chyby v medzivýsledkoch rastie.

Verifikácia kódu V oblasti generovania kódu PRM pomáhajú identifikovať presný bod, kde logika zlyhá — nie len to, či finálny kód prejde testami. To umožňuje cielené opravy namiesto regenerovania celého riešenia od začiatku.


5. Limity a otvorené výzvy

Náklady na anotáciu Tvorba PRM tréningových dát je rádovo nákladnejšia ako ORM. Každý krok v každom riešení musí byť ohodnotený — a pri dlhých chain-of-thought sekvenciách to môže predstavovať desiatky krokov na jedno jediné riešenie.

Automatická anotácia Výskumníci z OpenAI aj DeepMind skúmajú process supervision via outcome — využitie Monte Carlo rolloutov na automatický odhad správnosti kroku bez ľudskej anotácie. Model simuluje tisíce pokračovaní z daného kroku a odhaduje, ako často vedú k správnemu výsledku. Táto technika výrazne znižuje náklady, no prináša vlastný šum.

Reward hacking Model sa môže naučiť písať kroky, ktoré vyzerajú správne pre PRM, no sú fakticky chybné. Tento jav — reward hacking — je reálnym rizikom, keď PRM skóre nahrádza skutočné overenie správnosti.

Granularita krokov Čo presne je „jeden krok"? Veta? Odsek? Matematická transformácia? Voľba granularity výrazne ovplyvňuje kvalitu PRM. Príliš hrubé kroky strácajú dôležitý signal, príliš jemné zbytočne zvyšujú náklady na anotáciu.

Škálovanie na dlhé reťazce Pri extrémne dlhom uvažovaní — stovky krokov — je evaluácia každého kroku výpočtovo nákladná. Efektívne implementácie preto používajú lazy evaluation alebo vzorkovanie kľúčových checkpointov namiesto úplného skenovania.


Zhrnutie: Process Reward Models posunuli tréning AI od hodnotenia výsledkov k hodnoteniu samotného procesu uvažovania — a práve táto zmena stojí za prelomovými schopnosťami dnešných reasoning modelov. Napriek vysokým nákladom na anotáciu sa PRM stávajú štandardnou súčasťou tréningových pipeline každého frontier modelu.