Hoppa till innehÄllet
12/30Kapitel 12 av 30

Chain of Thought, RLVR och Test-Time Compute, uppmÀtt

Samma 24 problem: 0 % rÀtt pÄ 1,9 tokens, 100 % rÀtt pÄ 145. Sedan self-consistency som köper tillbaka greedy decoding.

PÄ den hÀr sidan

Tjugofyra textproblem i tvĂ„ steg. En liten modell — en halv miljard parametrar, samma som i kapitel 11 — fĂ„r varje frĂ„ga tvĂ„ gĂ„nger.

Först ombeds den ge svaret:

TEXT
"...How many bolts are left?  Reply with only the final number, nothing else."

  0 / 24 correct        1.9 tokens per answer

Sedan ombeds den ge svaret, med tillÄtelse att arbeta först:

TEXT
"...How many bolts are left?  Think step by step, then give the final
 number on its own line."

  24 / 24 correct       145.2 tokens per answer

Noll till hundra procent. Samma modell, samma vikter, samma problem, samma greedy decoding. Den enda skillnaden Àr att den andra versionen fick avge 143 fler tokens innan den band sig vid ett tal.

Det hÀr kapitlet handlar om det gapet: vad det faktiskt Àr, hur lÄngt det rÀcker, vad det kostar och vad som hÀnde nÀr fÀltet slutade be om det i prompt och började trÀna in det.

Modellen tÀnker inte. Den berÀknar lÀngre.

LÀnk till avsnittet: Modellen tÀnker inte. Den berÀknar lÀngre.

Det Àr frestande att sÀga att den andra versionen "tÀnkte pÄ saken". MotstÄ det, eftersom mekanismen Àr bÄde enklare och mer anvÀndbar att kÀnna till.

En transformer gör en fast mÀngd berÀkning per genererad token. En forward pass: samma lager, samma matriser, samma antal operationer oavsett om frÄgan Àr vad Àr 2+2 eller bevisa denna sats. Det finns ingen ratt inne i modellen för "försök hÄrdare med just den hÀr".

SÄ nÀr en modell ombeds svara omedelbart Àr hela den tillgÀngliga berÀkningen en enda forward pass. Varje mellanliggande storhet mÄste fÄ plats i aktiveringarna i den enda passeringen, och allt den inte kan berÀkna dÀr kan den inte berÀkna.

Att avge tokens Àndrar det, och det Àndrar det pÄ tvÄ skilda sÀtt som Àr vÀrda att hÄlla isÀr:

  • Mer berĂ€kning. Varje genererad token Ă€r Ă€nnu en full forward pass. Hundrafyrtiofem tokens av arbetsgĂ„ng Ă€r hundrafyrtiofem gĂ„nger sĂ„ mycket aritmetik som att svara direkt.
  • Externaliserat minne. Tokens skrivs in i kontexten, sĂ„ nĂ€sta passering kan lĂ€sa dem. 5 × 13 = 65 blir ett faktum i indata, inte ett vĂ€rde som modellen mĂ„ste hĂ„lla i en aktivering och bĂ€ra vidare. Modellen anvĂ€nder sin egen output som kladdpapper.

Den andra punkten Àr den folk missar, och den förklarar varför arbetsgÄngen mÄste skrivas ned för att hjÀlpa. En modell som ombeds "tÀnka pÄ det tyst och sedan svara" har ingenstans att lÀgga tanken.

Inget av detta krĂ€ver nĂ„got mystiskt, och det ger en tydlig förutsĂ€gelse: chain of thought bör hjĂ€lpa mest pĂ„ problem med seriell struktur — dĂ€r steg tvĂ„ behöver resultatet frĂ„n steg ett — och minst pĂ„ problem som Ă€r en enkel uppslagning. Det Ă€r exakt vad litteraturen hittar, och det Ă€r dĂ€rför "think step by step" inte gör nĂ„got för vad Ă€r Frankrikes huvudstad.

Tekniken kom 2022 i tvĂ„ delar. Wei et al. visade att inkluderade genomarbetade exempel i prompt — demonstrationer dĂ€r svaret föregĂ„s av resonemang — gav stora förbĂ€ttringar pĂ„ aritmetiska benchmarks och commonsense-benchmarks.1 Kojima et al. visade sedan nĂ„got mĂ€rkligare: du behöver inte exemplen. Att lĂ€gga till "Let's think step by step" i en zero-shot prompt fĂ„ngar mycket av samma förbĂ€ttring.2

Det andra resultatet Ă€r det som sĂ€ger vad som pĂ„gĂ„r. Om en magisk fras lĂ„ser upp beteendet fanns beteendet redan i modellen — pretraining Ă€r full av genomarbetade lösningar, och frasen Ă€r en pekare till den delen av distributionen. Chain of thought lĂ€rde inte modellen nĂ„got. Det valde nĂ„got modellen redan hade.

Den inramningen förutsÀger ocksÄ teknikens slutliga förÄldring, som vi Äterkommer till i slutet av kapitlet.

Self-consistency och ett resultat som överraskade mig

LÀnk till avsnittet: Self-consistency och ett resultat som överraskade mig

NĂ€sta uppenbara steg: om en resonemangskedja kan vara fel, sampla flera och ta majoritetssvaret. Det Ă€r self-consistency.3 Det Ă€r en strikt större kostnad — nn fulla genereringar i stĂ€llet för en — och intuitionen Ă€r att fel svar sprids medan rĂ€tt svar samlas.

MÀtt pÄ 16 av samma problem, sampling vid temperature 0.8, majoritetsomröstning över nn kedjor:

nntrÀffsÀkerhetkumulativa tokenstokens per problem
181 %2,952185
281 %5,618351
3100 %8,417526
4100 %11,103694
5100 %13,933871

Sexton problem Àr en liten nÀmnare, och regeln frÄn kapitel 4 gÀller den hÀr tabellen lika mycket som alla andra. 13 av 16 Àr 81 % med ett 95-procentigt Wilson-intervall pÄ [57, 93]; 16 av 16 Àr 100 % med [81, 100]. De överlappar. LÀs kurvans form, vilket Àr fyndet; lÀs inte den exakta pinnen dÀr den planar ut, vilket sexton problem inte kan lokalisera.

TvÄ saker i den tabellen, och den andra var inte vad jag vÀntade mig.

Kurvan planar ut vid n=3n = 3. Vid tredje sampeln ligger trÀffsÀkerheten vid sitt tak och de ÄterstÄende tvÄ samplen köper ingenting men kostar 172 tokens var, 345 tillsammans. Det Àr formen pÄ varje self-consistency-kurva som rapporteras i litteraturen, och det sker mycket tidigare Àn inramningen "fler samples Àr mer bÀttre" antyder.

Och greedy decoding lĂ„g redan pĂ„ 100 %. Titta tillbaka pĂ„ kapitlets början: en kedja, ingen sampling, 145 tokens, 24/24. Sampling vid temperature 0.8 sĂ€nkte trĂ€ffsĂ€kerheten till 81 %, och self-consistency behövde tre genereringar för att klĂ€ttra tillbaka dit en enda greedy passering redan var — till 3,6 gĂ„nger sĂ„ mĂ„nga tokens, eller sex gĂ„nger om du kör svepet till fem utan att veta var det planar ut.

Det Ă€r inte ett argument mot self-consistency. Det Ă€r ett exakt pĂ„stĂ„ende om vad tekniken gör: temperature köper mĂ„ngfald genom att injicera fel, och röstning tar bort felen den just injicerade. PĂ„ problem dĂ€r greedy decoding misslyckas — dĂ€r den enskilt mest sannolika kedjan leder fel och en mindre sannolik Ă€r rĂ€tt — lönar sig den avvĂ€gningen, och det Ă€r dĂ€rför tekniken finns. PĂ„ problem dĂ€r greedy redan lyckas Ă€r det ett sĂ€tt att spendera sex gĂ„nger budgeten för att gĂ„ jĂ€mnt upp.

Ingen publicerar det andra fallet, och dÀrför Àr det vÀrt att mÀta pÄ din egen uppgift innan du inför tekniken. Det hÀr Àr enkla tvÄstegsproblem för en liten modell; det Àr den regimen dÀr svaret blir sÄ hÀr.

Allt hittills sker vid prompt-tid pĂ„ en modell som aldrig specifikt trĂ€nats för det. Skiftet som gav dagens generation av resonemangsmodeller var att flytta in det i trĂ€ningen — och nyckeln som gjorde det möjligt Ă€r smalare Ă€n den lĂ„ter.

Post-training i kapitel 11 behövde mÀnskliga preferenser, eftersom "var detta ett bra svar?" inte har nÄgot programmatiskt svar. Men för vissa frÄgor har det det. Ett matematiskt svar Àr antingen lika med rÀtt vÀrde eller inte. Kod klarar antingen testerna eller inte. Ett bevis kontrolleras antingen eller inte.

För de domĂ€nerna kan du ersĂ€tta belöningsmodellen med en verifierare, och allt nedströms blir bĂ€ttre pĂ„ en gĂ„ng: inga annoterare, ingen Bradley–Terry-anpassning, ingen reward hacking av den typ som mĂ€ttes i kapitel 11 — eftersom du inte kan smickra ett enhetstest. Det hĂ€r Ă€r reinforcement learning from verifiable rewards, och det Ă€r miljön GRPO byggdes för: sampla en grupp lösningsförsök pĂ„ samma problem, kontrollera vart och ett och anvĂ€nd gruppens medelpoĂ€ng som baseline. Ingen critic, ingen annoterare, ingen belöningsmodell. Bara ett program som sĂ€ger rĂ€tt eller fel.

Outcome reward. PoĂ€ngsĂ€tt bara det slutliga svaret. Billigt — en strĂ€ngjĂ€mförelse — och det har ett uppenbart hĂ„l: en lösning som nĂ„r rĂ€tt tal genom fel resonemang belönas exakt som en korrekt, sĂ„ policyn Ă€r fri att lĂ€ra sig plausibelt nonsens som rĂ„kar landa rĂ€tt.

Process reward. PoÀngsÀtt varje steg. Lightman et al.5 byggde ett dataset med 800 000 mÀnskligt mÀrkta resonemangssteg för att trÀna en modell som gör detta, och visade att det tydligt övertrÀffar outcome supervision pÄ svÄr matematik. Kostnaden ligger i namnet: nÄgon mÀrkte 800 000 steg.

Resultatet som omformade fĂ€ltet kom frĂ„n DeepSeek i början av 2025.6 De tog en basmodell och tillĂ€mpade reinforcement learning with verifiable rewards direkt, utan nĂ„got supervised fine-tuning-steg först — steget som kapitel 11 presenterar som grunden för allt. LĂ„nga resonemangskedjor uppstod Ă€ndĂ„. Det gjorde Ă€ven beteenden som ingen trĂ€nat för: modellen började kontrollera sina egna steg pĂ„ nytt och, i artikelns mest citerade passage, spontant ompröva ett angreppssĂ€tt mitt i lösningen.

Den Ă€rliga lĂ€sningen Ă€r inte att resonemang Ă€r magi. Den Ă€r att nĂ€r det enda som belönas Ă€r att ha rĂ€tt, och att ha rĂ€tt pĂ„ ett svĂ„rt problem krĂ€ver att man arbetar sig igenom det, dĂ„ Ă€r det att arbeta sig igenom det som optimeraren hittar — inklusive de delar av arbetet som mĂ€nniskor ocksĂ„ gör, eftersom de Ă€r vad problemet krĂ€ver snarare Ă€n vad nĂ„gon har lĂ€rt ut.

Den praktiska konsekvensen av allt detta Àr att en resonemangsmodell producerar tokens du bad om och tokens du inte bad om, och du betalar för bÄda.

Leverantörer hanterar detta olika, och skillnaden spelar roll:

  • De flesta API:er rĂ€knar resonemangs-tokens inuti antalet output tokens. Din faktura och din max_tokens-grĂ€ns inkluderar bĂ„da tĂ€nkandet du aldrig ser.
  • Googles Gemini rapporterar thinking tokens som ett separat fĂ€lt, utanför standardantalet output tokens.

Det Àr en verklig inkompatibilitet mellan tvÄ sÀtt att rÀkna samma sak, och all kod som berÀknar kostnad eller upprÀtthÄller en budget över leverantörer mÄste normalisera det. Kapitel 16 Àr dÀr det blir pengar, och kapitel 23 dÀr det blir en budget du kan upprÀtthÄlla.

Den andra konsekvensen Ă€r en latency-konsekvens som överraskar folk första gĂ„ngen. En resonemangsmodells tid till första synliga token inkluderar allt dess tĂ€nkande, sĂ„ en begĂ€ran som inte streamar nĂ„got pĂ„ Ă„tta sekunder och sedan svarar pĂ„ en Ă€r inte en hĂ€ngd anslutning — det Ă€r modellen som arbetar. Ett grĂ€nssnitt som visar en spinner utan förklaring i Ă„tta sekunder har ett designproblem, inte ett nĂ€tverksproblem.

En avslutande varning, eftersom detta Àr det vanligaste sÀttet som materialet i kapitlet anvÀnds fel.

Allt i första halvan Ă€r en teknik för att fĂ„ en modell som inte trĂ€nats att resonera att Ă€ndĂ„ producera resonemang. Modeller trĂ€nade med RLVR gör det redan: de avger sin egen arbetsgĂ„ng, i sin egen lĂ€ngd, innan de svarar. Att sĂ€ga Ă„t en sĂ„dan modell att tĂ€nka steg för steg Ă€r i bĂ€sta fall överflödigt och i vĂ€rsta fall skadligt — det kan producera en kort, prompt-formad kedja i stĂ€llet för den lĂ€ngre som modellen skulle ha genererat pĂ„ egen hand, och vissa leverantörer dokumenterar exakt detta.

Detsamma gÀller avancerade resonemangsstÀllningar byggda i applikationskod. En prompt som leder en modell genom ett beslutstrÀd den redan navigerar internt spenderar dina tokens pÄ att begrÀnsa ett beteende som trÀnats in. Detta Àr den första förekomsten av ett tema som löper genom resten av kursen: tekniker som var nödvÀndiga 2022 hade blivit vidskepelse 2025, och det enda sÀttet att veta vilket som Àr vilket för din modell, i dag, Àr att mÀta bÄda.

Kapitel 15 Àr dÀr den mÀtningen blir en disciplin snarare Àn en Äsikt.

Resonemang har en obekvÀm egenskap: det Àr den enda förmÄgan vars kostnad skalar med hur svÄr frÄgan Àr. En modell som tÀnker i niohundra tokens gör niohundra forward passes, hÄller en vÀxande cache i minnet för dem alla och hÄller en GPU under hela tiden.

Det gör ekonomin i att köra en resonemangsmodell markant sÀmre Àn att köra en chatmodell, och det förvandlar en uppsÀttning implementationsdetaljer till skillnaden mellan en livskraftig produkt och en olönsam: hur cachen av tidigare nycklar och vÀrden lagras och ÄteranvÀnds, hur mÄnga begÀranden som kan dela en forward pass och hur mycket precision vikterna faktiskt behöver.

Kapitel 13 Ă€r det sista dĂ€r modellen Ă€r ett objekt i ditt minne snarare Ă€n en tjĂ€nst bakom en port, och det handlar om att göra det objektet billigt nog att köra. Det löser ocksĂ„ in ett löfte frĂ„n detta kapitel: speculative decoding, som producerar flera tokens till ungefĂ€r priset av en genom att lĂ„ta en liten modell gissa och en stor kontrollera — ett knep som bara Ă€r begripligt nĂ€r du har sett hur mycket av en forward pass som gĂ„r Ă„t till att vĂ€nta pĂ„ minne snarare Ă€n att göra aritmetik.


Alla mÀtningar i detta kapitel kommer frÄn Qwen/Qwen2.5-0.5B-Instruct pÄ 24 genererade tvÄstegsproblem, greedy decoding utom dÀr sampling anges, med noll trunkerade genereringar vid de token-grÀnser som anvÀndes. De Àr reproducerbara, och de Àr en liten modell pÄ enkla problem: lÀs self-consistency-resultatet som en demonstration av mekanismen, inte som en benchmark. Kapitel 18 i CS229-förelÀsningsanteckningarna och kapitel 12 i Hugging Face LLM Course tÀcker bÄda detta material med större modeller och riktiga benchmarks.

  1. Wei, J. et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903 (2022). ↩

  2. Kojima, T., Gu, S. S., Reid, M., Matsuo, Y. and Iwasawa, Y. Large Language Models are Zero-Shot Reasoners. arXiv:2205.11916 (2022). Resultatet med "let's think step by step". ↩

  3. Wang, X. et al. Self-Consistency Improves Chain of Thought Reasoning in Language Models. arXiv:2203.11171 (2022). ↩

  4. Yao, S. et al. Tree of Thoughts: Deliberate Problem Solving with Large Language Models. arXiv:2305.10601 (2023). ↩

  5. Lightman, H. et al. Let's Verify Step by Step. arXiv:2305.20050 (2023). Introducerar PRM800K, datasetet för processövervakning med 800 000 steg. ↩

  6. DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948 (2025). R1-Zero-resultatet — reinforcement learning tillĂ€mpad direkt pĂ„ en basmodell, utan nĂ„got supervised fine-tuning-steg — finns i avsnitt 2.2. ↩

  7. Snell, C., Lee, J., Xu, K. and Kumar, A. Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. arXiv:2408.03314 (2024). ↩


Skapad av

David Vicente Campos

Grundare av NeuraLIA Labs och medgrundare av MyRealFood

Jag Àr dataingenjör frÄn Universitetet i León. Jag var med och grundade MyRealFood, dÀr jag som CTO byggde appen som miljontals mÀnniskor har anvÀnt för att Àta bÀttre, och jag grundade NeuraLIA Labs, dÀr jag bygger AI-produkter. HÀr skriver jag om det jag har behövt förstÄ lÀngs vÀgen, sÄ som jag önskar att nÄgon hade förklarat det för mig.

Mer om författaren

Publicerad av NeuraLIA Labs.

FÄ nya inlÀgg i din inkorg

AI-nyheter, guider och produktuppdateringar — ett kort mejl nĂ€r vi publicerar nĂ„got som Ă€r vĂ€rt din tid.

Kursindex

Abstract software decision engine with branching paths, probability nodes, and glowing gates.
jevLĂ€stid 11 min

Jevs AI-modell Àr byggd för beslut, inte prosa

TypeSafe AI:s Jev vÀcker uppmÀrksamhet eftersom den behandlar mjukvaruintelligens som ett sannolikhetsproblem: vÀlj rÀtt gren, lÀgg till konfidens och undvik att betala en LLM för att skriva text nÀr koden behöver ett beslut.

Abstract agent runtime sorting documents, memory blocks and pointer nodes inside a bounded context frame.
context-engineeringLĂ€stid 11 min

Kontextteknik för AI-agenter med lÄng horisont

LÄngkörande agenter misslyckas inte bara för att fönstret Àr litet. De misslyckas nÀr filer, verktygsutdata och gammal historik trÀnger undan uppgiften agenten skulle slutföra.

Redo att lÄta LIA vÀlja Ät dig?

Bygg med alla AI-modeller pĂ„ ett stĂ€lle – kom igĂ„ng gratis i dag.