Chain of Thought, RLVR és test-time compute mérve
Ugyanaz a 24 feladat: 0% helyes 1,9 tokenből, 100% 145-ből. Self-consistency: pontosság visszavásárlása.
Ezen az oldalon
Huszonnégy kétlépéses szöveges feladat. Egy kis model — félmilliárd paraméterrel, ugyanaz, mint a 11. fejezetben — mindegyiket kétszer kapja meg.
Először csak a választ kérjük:
"...How many bolts are left? Reply with only the final number, nothing else."
0 / 24 correct 1.9 tokens per answerAztán a választ kérjük, de engedjük, hogy előbb dolgozzon rajta:
"...How many bolts are left? Think step by step, then give the final
number on its own line."
24 / 24 correct 145.2 tokens per answerNullától száz százalékig. Ugyanaz a model, ugyanazok a súlyok, ugyanazok a feladatok, ugyanaz a greedy decoding. Az egyetlen különbség az, hogy a második változat 143-mal több token kibocsátását kapta meg, mielőtt elköteleződött volna egy szám mellett.
Ez a fejezet erről a résről szól: mi ez valójában, meddig tart, mibe kerül, és mi történt, amikor a terület nem a promptban kezdte kérni, hanem belekezdte tanítani.
A model nem gondolkodik. Tovább számol.
Link a szakaszhoz: A model nem gondolkodik. Tovább számol.Nagy a kísértés azt mondani, hogy a második változat „elgondolkodott rajta”. Állj ellen ennek, mert a mechanizmus egyszerre egyszerűbb és hasznosabb ismerni.
Egy transformer fix mennyiségű számítást végez minden generált token után. Egy forward pass: ugyanazok a rétegek, ugyanazok a mátrixok, ugyanannyi művelet, függetlenül attól, hogy a kérdés az, hogy mennyi 2+2, vagy az, hogy bizonyítsd be ezt a tételt. A modelben nincs belső tekerő arra, hogy „ezen most jobban próbálkozz”.
Amikor tehát a modeltől azonnali választ kérünk, az összes rendelkezésére álló számítás egyetlen forward pass. Minden köztes mennyiségnek bele kell férnie ennek az egyetlen passnak az aktivációiba, és amit ott nem tud kiszámítani, azt nem tudja kiszámítani.
A token kibocsátása ezt megváltoztatja, méghozzá két, egymástól érdemes különválasztani módon:
- Több számítás. Minden generált token egy újabb teljes forward pass. Száznegyvenöt tokennyi munka száznegyvenötször annyi aritmetika, mint az azonnali válaszadás.
- Kiszervezett memória. A tokenek bekerülnek a contextbe, így a következő pass olvashatja őket. A
5 × 13 = 65ténnyé válik a bemenetben, nem olyan értékké, amelyet a modelnek egy aktivációban kell tartania és továbbvinnie. A model a saját kimenetét használja jegyzetfüzetként.
Ezt a második pontot szokták elszalasztani, és ez magyarázza, miért kell a munkát leírni ahhoz, hogy segítsen. Ha egy modelt arra kérsz, hogy „gondolkodjon rajta csendben, aztán válaszoljon”, nincs hova tennie a gondolatot.
Ehhez semmi misztikus nem kell, és határozott előrejelzést ad: a chain of thought leginkább a soros szerkezetű problémákon segít — ahol a második lépésnek szüksége van az első eredményére —, és legkevésbé azokon, amelyek egyetlen lekérdezésből állnak. Pontosan ezt találja a szakirodalom is, és ezért nem csinál semmit a „gondolkodj lépésről lépésre” arra, hogy mi Franciaország fővárosa.
Chain of thought mint prompting technika
Link a szakaszhoz: Chain of thought mint prompting technikaA technika 2022-ben két részben érkezett meg. Wei és munkatársai megmutatták, hogy ha kidolgozott példákat teszünk a promptba — olyan demonstrációkat, ahol a választ érvelés előzi meg —, az nagy javulást hoz aritmetikai és józan észre épülő benchmarkokon.1 Kojima és munkatársai ezután valami furcsábbat mutattak: nincs szükség a példákra. Ha egy zero-shot prompthoz hozzáfűzöd, hogy „Let's think step by step”, ugyanennek a nyereségnek a nagy része megjelenik.2
A második eredmény mondja meg, mi történik. Ha egy varázsmondat előhívja a viselkedést, akkor a viselkedés már benne volt a modelben — a pretraining tele van kidolgozott megoldásokkal, a mondat pedig mutató az eloszlásnak arra a régiójára. A chain of thought nem tanított semmit a modelnek. Kiválasztott valamit, ami már megvolt benne.
Ez a keretezés azt is előre jelzi, hogy a technika végül elavul, amihez a fejezet végén visszatérünk.
Self-consistency, és egy eredmény, ami meglepett
Link a szakaszhoz: Self-consistency, és egy eredmény, ami meglepettA kézenfekvő következő lépés: ha egy érvelési lánc lehet hibás, mintázzunk többet, és vegyük a többségi választ. Ez a self-consistency.3 Szigorúan nagyobb költés — egy helyett teljes generálás —, az intuíció pedig az, hogy a rossz válaszok szétszóródnak, míg a jók egyetértenek.
Ugyanebből a feladatsorból 16-on mérve, 0,8-as temperature mellett mintázva, többségi szavazással láncon:
| pontosság | kumulatív token | token feladatonként | |
|---|---|---|---|
| 1 | 81 % | 2,952 | 185 |
| 2 | 81 % | 5,618 | 351 |
| 3 | 100 % | 8,417 | 526 |
| 4 | 100 % | 11,103 | 694 |
| 5 | 100 % | 13,933 | 871 |
Tizenhat feladat kis nevező, és a 4. fejezet szabálya ugyanúgy vonatkozik erre a táblázatra, mint bármelyik másikra. 13 a 16-ból 81 %, 95 %-os Wilson-intervallummal: [57, 93]; 16 a 16-ból 100 %, intervallummal: [81, 100]. Ezek átfednek. A görbe alakját olvasd, ez a megállapítás; ne azt a pontos fokot, ahol ellaposodik, mert tizenhat feladat ezt nem tudja meghatározni.
Két dolog van ebben a táblázatban, és a második nem az, amire számítottam.
A görbe -nál ellaposodik. A harmadik mintára a pontosság eléri a plafont, a maradék két minta pedig semmit nem vesz, miközben egyenként 172 tokenbe kerül, együtt 345-be. Ez minden, a szakirodalomban közölt self-consistency görbe alakja, és sokkal korábban következik be, mint amit a „több minta = még jobb” keretezés sugall.
És a greedy decoding már eleve 100 %-on volt. Nézz vissza a fejezet elejére: egy lánc, sampling nélkül, 145 token, 24/24. A 0,8-as temperature melletti sampling 81 %-ra rontotta a pontosságot, a self-consistencynek pedig három generálás kellett, hogy visszamásszon oda, ahol egyetlen greedy pass már volt — 3,6-szor annyi tokennel, vagy hatszor annyival, ha a sweepet ötig futtatod anélkül, hogy tudnád, hol laposodik el.
Ez nem érv a self-consistency ellen. Pontos állítás arról, mit csinál: a temperature hibák beinjektálásával vásárol diverzitást, a szavazás pedig eltávolítja az imént beinjektált hibákat. Azokon a problémákon, ahol a greedy decoding elbukik — ahol az egyetlen legvalószínűbb lánc rossz helyre vezet, egy kevésbé valószínű viszont jó —, ez a csere megéri, és ezért létezik a technika. Azokon a problémákon, ahol a greedy már sikeres, ez egy mód arra, hogy hatszoros büdzséből nullszaldóra juss.
A második esetet senki nem publikálja, ezért érdemes a saját feladatodon mérni, mielőtt átveszed a technikát. Ezek könnyű kétlépéses feladatok egy kis model számára; ez az a rezsim, ahol így jön ki az eredmény.
Kéréstől tanításig
Link a szakaszhoz: Kéréstől tanításigEddig minden prompt időben történik egy olyan modellen, amelyet kifejezetten erre soha nem tanítottak. A mostani generációs reasoning modellekhez vezető váltás az volt, hogy ezt átvitték a tanításba — és a kulcs, amely ezt lehetővé tette, szűkebb, mint amilyennek hangzik.
A 11. fejezet post-trainingje emberi preferenciákat igényelt, mert arra, hogy „jó válasz volt-e ez?”, nincs programozható válasz. Bizonyos kérdéseknél viszont van. Egy matematikai válasz vagy megegyezik a helyes értékkel, vagy nem. A kód vagy átmegy a teszteken, vagy nem. Egy bizonyítás vagy ellenőrizhető, vagy nem.
Ezekben a domainekben a reward modelt lecserélheted egy verifierre, és minden downstream egyszerre javul: nincsenek annotátorok, nincs Bradley–Terry-illesztés, nincs olyan reward hacking, amilyet a 11. fejezet mért — mert egy unit testnek nem tudsz hízelegni. Ez a reinforcement learning from verifiable rewards, és erre a beállításra készült a GRPO: mintázz egy csoport megoldási kísérletet ugyanarra a problémára, ellenőrizd mindegyiket, és használd a csoport átlagpontszámát baselineként. Nincs critic, nincs annotátor, nincs reward model. Csak egy program, amely azt mondja: helyes vagy helytelen.
Outcome reward. Csak a végső választ pontozza. Olcsó — egy string-összehasonlítás —, és nyilvánvaló lyuk van rajta: egy megoldás, amely rossz érveléssel jut el a jó számhoz, pontosan ugyanúgy jutalmat kap, mint egy helyes, így a policy szabadon tanulhat hihetőnek tűnő zagyvaságot, amely történetesen célba ér.
Process reward. Minden lépést pontoz. Lightman és munkatársai5 800.000 ember által címkézett érvelési lépésből álló adatkészletet építettek egy ilyen model tanításához, és megmutatták, hogy nehéz matematikában érdemben felülmúlja az outcome supervisiont. Az ár benne van a névben: valakik 800.000 lépést címkéztek fel.
Az eredmény, amely átkeretezte a területet, a DeepSeektől érkezett 2025 elején.6 Fogtak egy base modelt, és közvetlenül reinforcement learninget alkalmaztak verifiable rewards mellett, előzetes supervised fine-tuning szakasz nélkül — anélkül a szakasz nélkül, amelyet a 11. fejezet mindennek az alapjaként mutat be. A hosszú érvelési láncok így is kialakultak. Ahogy olyan viselkedések is, amelyeket senki nem tanított: a model elkezdte újraellenőrizni a saját lépéseit, és a cikk legtöbbet idézett részében spontán újragondolt egy megközelítést a megoldás közepén.
Az őszinte olvasat nem az, hogy az érvelés varázslat. Hanem az, hogy amikor az egyetlen jutalmazott dolog az, hogy helyes legyen, és egy nehéz problémán helyesnek lenni azt igényli, hogy végig kell dolgozni, akkor az optimalizáló ezt találja meg — beleértve a végigdolgozásnak azokat a részeit is, amelyeket az emberek is csinálnak, mert ezeket a probléma követeli meg, nem pedig valaki tanította őket.
A reasoning tokenek sorok a számlán
Link a szakaszhoz: A reasoning tokenek sorok a számlánMindennek a gyakorlati következménye az, hogy egy reasoning model olyan tokeneket állít elő, amelyeket kértél, és olyanokat is, amelyeket nem, és mindkettőért fizetsz.
A providerek ezt eltérően kezelik, és a különbség számít:
- A legtöbb API a reasoning tokeneket beleérti az output token countba. A számlád és a
max_tokenslimited is tartalmazza azt a gondolkodást, amit soha nem látsz. - A Google Gemini a thinking tokeneket külön mezőként jelenti, a standard output counton kívül.
Ez valódi inkompatibilitás ugyanannak a dolognak a kétféle számolása között, és minden olyan kódnak, amely szolgáltatók között számít költséget vagy érvényesít büdzsét, normalizálnia kell. A 16. fejezetben ebből pénz lesz, a 23. fejezetben pedig kikényszeríthető büdzsé.
A másik következmény latency jellegű, és első alkalommal sokakat meglep. Egy reasoning model első látható tokenig tartó ideje magában foglalja az összes gondolkodását, így egy kérés, amely nyolc másodpercig semmit sem streamel, aztán egy másodperc alatt válaszol, nem beragadt kapcsolat — a model dolgozik. Minden olyan interface, amely nyolc másodpercig magyarázat nélküli spinnert mutat, designproblémával küzd, nem hálózatival.
Amikor a „gondolkodj lépésről lépésre” már nem segít
Link a szakaszhoz: Amikor a „gondolkodj lépésről lépésre” már nem segítZáró figyelmeztetés, mert ez a fejezet anyagának leggyakoribb félrealkalmazása.
Az első félben minden olyan technika, amellyel egy nem érvelésre tanított modellel mégis érvelést állíttatunk elő. Az RLVR-rel tanított modellek ezt már megteszik: kibocsátják a saját munkájukat, a saját hosszukban, a válasz előtt. Egy ilyen modelnek azt mondani, hogy gondolkodjon lépésről lépésre, legjobb esetben redundáns, legrosszabb esetben káros — előállíthat egy rövid, prompt alakú láncot annak a hosszabbnak a helyén, amelyet a model magától generált volna, és néhány provider pontosan ezt dokumentálja.
Ugyanez igaz az alkalmazáskódban épített bonyolult érvelési állványzatokra. Egy prompt, amely végigvezet egy modelt egy döntési fán, amelyet az már belsőleg bejár, a tokenjeidet arra költi, hogy korlátozzon egy betanított viselkedést. Ez az első megjelenése annak a témának, amely a kurzus hátralévő részén végigfut: a 2022-ben létfontosságú technikák 2025-re babonává váltak, és ma a saját modelednél csak úgy tudod megmondani, melyik melyik, ha mindkettőt méred.
A 15. fejezetben ez a mérés vélemény helyett fegyelemmé válik.
Merre megyünk tovább
Link a szakaszhoz: Merre megyünk továbbAz érvelésnek van egy kényelmetlen tulajdonsága: ez az egyetlen képesség, amelynek költsége együtt skálázódik azzal, mennyire nehéz a kérdés. Egy model, amely kilencszáz tokenen át gondolkodik, kilencszáz forward passt végez, mindegyikhez növekvő cache-t tart memóriában, és a teljes időre lefoglal egy GPU-t.
Ez a reasoning model kiszolgálásának közgazdaságát élesen rosszabbá teszi egy chat model kiszolgálásánál, és egy sor implementációs részletet a működőképes és a működésképtelen termék közötti különbséggé változtat: hogyan tároljuk és használjuk újra a korábbi kulcsok és értékek cache-ét, hány kérés osztozhat egy forward passon, és valójában mennyi precision kell a súlyoknak.
A 13. fejezet az utolsó, ahol a model még a memóriádban lévő objektum, nem pedig egy port mögötti szolgáltatás, és arról szól, hogyan tehető ez az objektum elég olcsóvá a kiszolgáláshoz. Bevált egy ígéretet is ebből a fejezetből: speculative decoding, amely több token állít elő nagyjából egy áráért úgy, hogy egy kis model tippel, egy nagy pedig ellenőriz — egy trükk, amelynek csak akkor van értelme, ha már láttad, mennyi időt tölt egy forward pass memória-várakozással aritmetika helyett.
Források és módszer
Link a szakaszhoz: Források és módszerA fejezet minden mérése a Qwen/Qwen2.5-0.5B-Instruct-ből származik, 24 generált kétlépéses szöveges feladaton, greedy decodinggal, kivéve ahol sampling szerepel, nulla csonkolt generálással a használt token capek mellett. Reprodukálhatók, és egy kis modelt mérnek könnyű feladatokon: a self-consistency eredményt a mechanizmus demonstrációjaként olvasd, ne benchmarkként. A CS229 előadásjegyzetek 18. fejezete és a Hugging Face LLM Course 12. fejezete egyaránt nagyobb modellekkel és rendes benchmarkokkal tárgyalja ezt az anyagot.
Hivatkozások
Link a szakaszhoz: Hivatkozások-
Wei, J. et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903 (2022). ↩
-
Kojima, T., Gu, S. S., Reid, M., Matsuo, Y. and Iwasawa, Y. Large Language Models are Zero-Shot Reasoners. arXiv:2205.11916 (2022). A „let's think step by step” eredmény. ↩
-
Wang, X. et al. Self-Consistency Improves Chain of Thought Reasoning in Language Models. arXiv:2203.11171 (2022). ↩
-
Yao, S. et al. Tree of Thoughts: Deliberate Problem Solving with Large Language Models. arXiv:2305.10601 (2023). ↩
-
Lightman, H. et al. Let's Verify Step by Step. arXiv:2305.20050 (2023). Bevezeti a PRM800K-t, a 800.000 lépéses process supervision adatkészletet. ↩
-
DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948 (2025). Az R1-Zero eredmény — reinforcement learning közvetlenül egy base modelre alkalmazva, supervised fine-tuning szakasz nélkül — a 2.2. szakaszban található. ↩
-
Snell, C., Lee, J., Xu, K. and Kumar, A. Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. arXiv:2408.03314 (2024). ↩