İçeriğe geç
12/3030 bölümden 12. bölüm

Chain of Thought, RLVR ve Test-Time Compute: Ölçüm

Aynı 24 problem: 1,9 token ile %0 doğru, 145 token ile %100. Self-consistency, greedy decoding doğruluğunu geri satın alıyor.

Bu sayfada

Yirmi dört adet iki adımlı sözel problem. Küçük bir model — yarım milyar parametreli, Bölüm 11'deki modelin aynısı — her biri için iki kez sorgulanıyor.

Önce yalnızca yanıt isteniyor:

TEXT
"...How many bolts are left?  Reply with only the final number, nothing else."

  0 / 24 correct        1.9 tokens per answer

Sonra yanıt isteniyor, ama önce çalışmasına izin veriliyor:

TEXT
"...How many bolts are left?  Think step by step, then give the final
 number on its own line."

  24 / 24 correct       145.2 tokens per answer

Sıfırdan yüzde yüze. Aynı model, aynı weights, aynı problemler, aynı greedy decoding. Tek fark, ikinci sürümün bir sayıya karar vermeden önce 143 token daha üretmesine izin verilmiş olması.

Bu bölüm o aralıkla ilgili: gerçekte ne olduğu, ne kadar ileri gittiği, neye mal olduğu ve alan bunu prompt içinde istemeyi bırakıp eğitim sürecine katmaya başladığında ne olduğu.

Model düşünmez. Daha uzun süre hesaplar.

Bölüme bağlantı: Model düşünmez. Daha uzun süre hesaplar.

İkinci sürüm için “üzerine düşündü” demek cazip. Buna diren, çünkü mekanizma hem daha basit hem de bilmesi daha faydalı.

Bir transformer, üretilen her token için sabit miktarda hesaplama yapar. Bir forward pass: soru ister 2+2 kaçtır olsun ister bu teoremi kanıtla, aynı layers, aynı matrices, aynı operasyon sayısı. Modelin içinde “bu sefer daha çok uğraş” diye çevrilecek bir düğme yoktur.

Dolayısıyla bir modelden hemen yanıt istendiğinde, kullanabileceği tüm hesaplama tek bir forward pass ile sınırlıdır. Her ara nicelik o tek pass'in activation'larına sığmak zorundadır; orada hesaplayamadığı hiçbir şeyi hesaplayamaz.

Token üretmek bunu değiştirir ve ayırmaya değer iki ayrı biçimde değiştirir:

  • Daha fazla hesaplama. Üretilen her token bir tam forward pass daha demektir. Yüz kırk beş token'lık çalışma, doğrudan yanıtlamanın aritmetiğinin yüz kırk beş katıdır.
  • Dışsallaştırılmış bellek. Token'lar context içine yazılır, böylece bir sonraki pass onları okuyabilir. 5 × 13 = 65 artık modelin bir activation içinde tutup ileri taşıması gereken bir değer değil, input içinde bir olgu haline gelir. Model kendi çıktısını karalama kâğıdı gibi kullanır.

İnsanların kaçırdığı nokta ikincisidir ve çalışmanın yardımcı olması için neden yazıya dökülmesi gerektiğini açıklar. “Sessizce düşün ve sonra yanıtla” denilen bir modelin düşünceyi koyacak yeri yoktur.

Bunların hiçbirinde mistik bir şey yoktur ve net bir öngörü üretir: chain of thought en çok seri yapıya sahip problemlerde işe yaramalıdır — ikinci adımın birinci adımın sonucuna ihtiyaç duyduğu yerlerde — ve tek bir lookup olan problemlerde en az işe yaramalıdır. Literatürün bulduğu şey tam olarak budur; “adım adım düşün” ifadesinin Fransa'nın başkenti neresidir için hiçbir şey yapmamasının nedeni de budur.

Bir prompting tekniği olarak chain of thought

Bölüme bağlantı: Bir prompting tekniği olarak chain of thought

Teknik 2022'de iki parça halinde geldi. Wei ve arkadaşları, prompt içine çözümlü örnekler eklemenin — yanıtın öncesinde reasoning bulunan gösterimlerin — aritmetik ve sağduyu benchmark'larında büyük kazanımlar sağladığını gösterdi.1 Kojima ve arkadaşları ise daha tuhaf bir şey gösterdi: örneklere gerek yoktu. Zero-shot prompt sonuna "Let's think step by step" eklemek aynı kazanımın büyük bölümünü yakalıyordu.2

Neler olup bittiğini asıl anlatan ikinci sonuçtur. Eğer sihirli bir ifade davranışın kilidini açıyorsa, davranış modelin içinde zaten vardı — pretraining çözümlü örneklerle doludur ve bu ifade distribution'ın o bölgesine işaret eden bir pointer'dır. Chain of thought modele hiçbir şey öğretmedi. Modelin zaten sahip olduğu bir şeyi seçti.

Bu çerçeve, tekniğin sonunda kullanım dışı kalacağını da öngörür; bölümün sonunda buna geri döneceğiz.

Bariz bir sonraki hamle: tek bir reasoning zinciri yanlış olabiliyorsa, birkaç tane sample al ve çoğunluk yanıtını seç. Bu self-consistency'dir.3 Kesin olarak daha büyük bir harcamadır — bir yerine nn tam generation — ve sezgi şudur: yanlış yanıtlar dağılırken doğru yanıtlar aynı yerde buluşur.

Aynı problemlerin 16'sı üzerinde, temperature 0.8 ile sampling, nn zincir üzerinden çoğunluk oyu:

nndoğrulukkümülatif tokenproblem başına token
181 %2,952185
281 %5,618351
3100 %8,417526
4100 %11,103694
5100 %13,933871

On altı problem küçük bir paydadır ve Bölüm 4'ün kuralı bu tablo için de diğerleri kadar geçerlidir. 16'da 13, %81'dir ve %95 Wilson aralığı [57, 93]'tür; 16'da 16, %100'dür ve aralığı [81, 100]'dür. Bunlar örtüşür. Bulguyu oluşturan şey olan eğrinin şeklini oku; on altı problemin yerini belirleyemeyeceği tam düzleşme basamağını okuma.

Bu tabloda iki şey var; ikincisi beklediğim şey değildi.

Eğri n=3n = 3 noktasında düzleşiyor. Üçüncü sample'a gelindiğinde doğruluk tavanına ulaşmış durumda ve kalan iki sample hiçbir şey satın almıyor; buna karşılık her biri 172 token, ikisi birlikte 345 token harcıyor. Literatürde raporlanan her self-consistency eğrisinin şekli budur ve “daha fazla sample daha iyidir” çerçevesinin ima ettiğinden çok daha erken gelir.

Ve greedy decoding zaten %100'deydi. Bölümün başına geri bak: tek zincir, sampling yok, 145 token, 24/24. Temperature 0.8 ile sampling doğruluğu %81'e düşürdü ve self-consistency, tek bir greedy pass'in zaten olduğu yere geri tırmanmak için üç generation'a ihtiyaç duydu — token sayısının 3,6 katı, ya da nerede düzleştiğini bilmeden taramayı beşe kadar götürürsen altı katı.

Bu, self-consistency'ye karşı bir argüman değil. Yaptığı şeyi kesin biçimde ifade ediyor: temperature, çeşitliliği hatalar enjekte ederek satın alır; voting ise az önce enjekte ettiği hataları kaldırır. Greedy decoding'in başarısız olduğu problemlerde — en olası tek zincirin yanlış bir yere çıktığı, daha az olası bir zincirin doğru olduğu yerlerde — bu takas değerini öder; tekniğin var olma nedeni budur. Greedy'nin zaten başarılı olduğu problemlerde ise aynı noktaya gelmek için bütçenin altı katını harcama yoludur.

İkinci durumu kimse yayımlamaz; bu yüzden tekniği benimsemeden önce kendi task'ında ölçmeye değer. Bunlar küçük bir model için kolay iki adımlı problemler; yanıtın böyle çıktığı rejim budur.

Şimdiye kadarki her şey, bunun için özel olarak eğitilmemiş bir model üzerinde prompt zamanında gerçekleşiyor. Mevcut reasoning modelleri kuşağını üreten kayma, bunu eğitimin içine taşımaktı — ve bunu mümkün kılan anahtar kulağa geldiğinden daha dardır.

Bölüm 11'in post-training'i insan tercihleri gerektiriyordu, çünkü “bu iyi bir yanıt mıydı?” sorusunun programatik bir yanıtı yoktur. Ama bazı sorular için vardır. Matematiksel bir yanıt ya doğru değere eşittir ya değildir. Kod ya testleri geçer ya geçmez. Bir kanıt ya doğrulanır ya doğrulanmaz.

Bu domain'lerde reward model yerine bir verifier koyabilirsin ve downstream'deki her şey bir anda iyileşir: annotator yok, Bradley–Terry fitting yok, Bölüm 11'de ölçülen türden reward hacking yok — çünkü bir unit test'i pohpohlayamazsın. Bu verifiable rewards'tan reinforcement learning'dir ve GRPO'nun inşa edildiği setting budur: aynı probleme yönelik bir grup çözüm denemesi sample et, her birini kontrol et ve grubun ortalama skorunu baseline olarak kullan. Critic yok, annotator yok, reward model yok. Sadece doğru ya da yanlış diyen bir program var.

Outcome reward. Yalnızca final yanıtı puanla. Ucuzdur — bir string karşılaştırması — ve bariz bir boşluğu vardır: yanlış reasoning ile doğru sayıya ulaşan bir çözüm, doğru çözümle tamamen aynı şekilde ödüllendirilir; dolayısıyla policy, tesadüfen hedefe varan makul görünümlü saçmalıklar öğrenmekte özgürdür.

Process reward. Her adımı puanla. Lightman ve arkadaşları5 bunu yapan bir model eğitmek için 800.000 insan etiketli reasoning adımından oluşan bir dataset oluşturdu ve zor matematikte outcome supervision'ı kayda değer ölçüde geride bıraktığını gösterdi. Maliyet adında saklı: biri 800.000 adımı etiketledi.

Alanı yeniden çerçeveleyen sonuç 2025'in başında DeepSeek'ten geldi.6 Bir base model aldılar ve verifiable rewards ile reinforcement learning'i önce supervised fine-tuning aşaması olmadan doğrudan uyguladılar — Bölüm 11'in her şeyin temeli olarak sunduğu aşama olmadan. Uzun reasoning zincirleri yine de ortaya çıktı. Kimsenin eğitmediği davranışlar da ortaya çıktı: model kendi adımlarını yeniden kontrol etmeye başladı ve makalenin en çok alıntılanan pasajında, çözümün ortasında yaklaşımını kendiliğinden yeniden değerlendirdi.

Dürüst okuma, reasoning'in sihir olduğu değildir. Yalnızca ödüllendirilen şey doğru olmaksa ve zor bir problemde doğru olmak onu adım adım çalışmayı gerektiriyorsa, optimiser'ın bulduğu şey bu çalışmadır — insanların da yaptığı kısımlar dahil, çünkü bunlar birinin öğrettiği şeyler olmaktan ziyade problemin gerektirdiği şeylerdir.

Reasoning token'ları faturada bir satırdır

Bölüme bağlantı: Reasoning token'ları faturada bir satırdır

Bütün bunların pratik sonucu şudur: bir reasoning modeli, istediğin token'ları da istemediğin token'ları da üretir ve ikisi için de ödeme yaparsın.

Provider'lar bunu farklı şekilde ele alır ve fark önemlidir:

  • Çoğu API, reasoning token'larını output token sayısının içinde sayar. Faturan da max_tokens limitin de hiç görmediğin düşünmeyi içerir.
  • Google'ın Gemini'si thinking token'larını standart output sayısının dışında ayrı bir alan olarak raporlar.

Bu, aynı şeyi saymanın iki yolu arasında gerçek bir uyumsuzluktur ve provider'lar arasında maliyet hesaplayan ya da bütçe uygulayan her kod bunu normalize etmek zorundadır. Bunun paraya dönüştüğü yer Bölüm 16, uygulayabileceğin bir bütçeye dönüştüğü yer ise Bölüm 23'tür.

Diğer sonuç, insanları ilk seferinde şaşırtan bir latency sonucudur. Bir reasoning modelinin ilk görünür token'a kadar geçen süresi, tüm düşünme süresini içerir; bu yüzden sekiz saniye boyunca hiçbir şey stream etmeyip sonra bir saniyede yanıtlayan bir request, takılmış bir bağlantı değildir — model çalışıyordur. Sekiz saniye boyunca açıklamasız spinner gösteren herhangi bir interface'in problemi network değil, tasarımdır.

“Adım adım düşün” işe yaramayı bıraktığında

Bölüme bağlantı: “Adım adım düşün” işe yaramayı bıraktığında

Kapanış uyarısı, çünkü bu bölümdeki malzemenin en sık yanlış uygulandığı yer burası.

İlk yarıdaki her şey, reasoning için eğitilmemiş bir modelin yine de reasoning üretmesini sağlamaya yönelik bir tekniktir. RLVR ile eğitilmiş modeller bunu zaten yapar: yanıtlamadan önce kendi çalışmalarını, kendi uzunluklarında üretirler. Böyle bir modele adım adım düşünmesini söylemek en iyi ihtimalle gereksiz, en kötü ihtimalle zararlıdır — modelin kendi başına üreteceği daha uzun zincirin yerine kısa, prompt biçimli bir zincir üretebilir; bazı provider'lar bunu açıkça dokümante eder.

Aynı şey application code içinde kurulmuş ayrıntılı reasoning iskeleleri için de geçerlidir. Bir modeli zaten içeride dolaştığı bir decision tree üzerinden yürüten prompt, eğitilmiş bir davranışı kısıtlamak için token'larını harcar. Bu, kursun geri kalanında süren bir temanın ilk görünümüdür: 2022'de elzem olan teknikler 2025'te batıl inanca dönüştü ve bugün, kendi modelin için hangisinin hangisi olduğunu anlamanın tek yolu ikisini de ölçmektir.

Bölüm 15, bu ölçümün bir görüş olmaktan çıkıp disipline dönüştüğü yerdir.

Reasoning'in rahatsız edici bir özelliği vardır: maliyeti sorunun zorluğuyla ölçeklenen tek capability'dir. Dokuz yüz token boyunca düşünen bir model dokuz yüz forward pass yapar, bunların hepsi için bellekte büyüyen bir cache tutar ve süre boyunca bir GPU'yu meşgul eder.

Bu, bir reasoning modelini servis etmenin ekonomisini bir chat modelini servis etmeye göre keskin biçimde kötüleştirir ve bir dizi implementation detail'ı uygulanabilir bir ürün ile uygulanamaz bir ürün arasındaki farka dönüştürür: geçmiş key ve value cache'inin nasıl saklanıp yeniden kullanıldığı, kaç request'in bir forward pass'i paylaşabildiği ve weights'in gerçekte ne kadar precision'a ihtiyaç duyduğu.

Bölüm 13, modelin bir port arkasındaki service değil de belleğindeki bir object olduğu son bölümdür ve o object'i servis edilebilecek kadar ucuz hale getirmekle ilgilidir. Ayrıca bu bölümden gelen bir vaadi de tahsil eder: speculative decoding; küçük bir modelin tahmin edip büyük bir modelin kontrol etmesiyle birkaç token'ı yaklaşık tek token fiyatına üretir — bu numara, bir forward pass'in ne kadarının aritmetik yapmaktan çok belleği beklemeye harcandığını gördükten sonra anlam kazanır.


Bu bölümdeki tüm ölçümler Qwen/Qwen2.5-0.5B-Instruct ile 24 üretilmiş iki adımlı sözel problem üzerinde alınmıştır; sampling belirtilen yerler dışında greedy decoding kullanılmış, kullanılan token caps düzeylerinde sıfır truncated generation vardır. Yeniden üretilebilirler ve kolay problemler üzerinde küçük bir modeldir: self-consistency sonucunu bir benchmark olarak değil, mekanizmanın gösterimi olarak oku. CS229 ders notlarının 18. bölümü ve Hugging Face LLM Course'un 12. bölümü bu konuyu daha büyük modeller ve düzgün benchmark'larla ele alır.

  1. Wei, J. et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903 (2022).

  2. Kojima, T., Gu, S. S., Reid, M., Matsuo, Y. and Iwasawa, Y. Large Language Models are Zero-Shot Reasoners. arXiv:2205.11916 (2022). “let's think step by step” sonucu.

  3. Wang, X. et al. Self-Consistency Improves Chain of Thought Reasoning in Language Models. arXiv:2203.11171 (2022).

  4. Yao, S. et al. Tree of Thoughts: Deliberate Problem Solving with Large Language Models. arXiv:2305.10601 (2023).

  5. Lightman, H. et al. Let's Verify Step by Step. arXiv:2305.20050 (2023). PRM800K'i, 800.000 adımlı process supervision dataset'ini tanıtır.

  6. DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948 (2025). R1-Zero sonucu — supervised fine-tuning aşaması olmadan doğrudan bir base model'e uygulanan reinforcement learning — bölüm 2.2'dedir.

  7. Snell, C., Lee, J., Xu, K. and Kumar, A. Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. arXiv:2408.03314 (2024).


Hazırlayan

David Vicente Campos

NeuraLIA Labs kurucusu ve MyRealFood kurucu ortağı

León Üniversitesinden mezun bir bilgisayar mühendisiyim. MyRealFood’un kurucu ortaklarındanım; orada CTO olarak milyonlarca insanın daha iyi beslenmek için kullandığı uygulamayı geliştirdim. Ayrıca NeuraLIA Labs’i kurdum ve burada AI ürünleri geliştiriyorum. Bu sitede yol boyunca anlamak zorunda kaldığım şeyleri, keşke biri bana böyle anlatsaydı dediğim şekilde yazıyorum.

Yazar hakkında daha fazla

Yayımlayan: NeuraLIA Labs.

Yeni yazılar gelen kutuna gelsin

AI haberleri, rehberler ve ürün güncellemeleri — zamanına değecek bir şey yayımladığımızda kısa bir e-posta.

Mesajlaşmayı mı tercih ediyorsun? Aynı yazılar, burada:WhatsApp topluluğu (yeni sekmede açılır)Telegram kanalı (yeni sekmede açılır)

Kurs dizini

Abstract software decision engine with branching paths, probability nodes, and glowing gates.
jev10 dk okuma

Jev AI modeli düzyazı için değil, kararlar için tasarlandı

TypeSafe AI’ın Jev’i dikkat çekiyor çünkü yazılım zekâsını bir olasılık problemi olarak ele alıyor: doğru dalı seç, güven düzeyini ekle ve kodun bir karara ihtiyacı varken bir LLM’ye metin yazdırmak için ödeme yapma.

Abstract agent runtime sorting documents, memory blocks and pointer nodes inside a bounded context frame.
context-engineering10 dk okuma

Uzun süreli AI ajanları için bağlam mühendisliği

Uzun süre çalışan ajanlar yalnızca pencere küçük olduğu için başarısız olmaz. Dosyalar, araç çıktıları ve bayatlamış geçmiş, ajanın tamamlaması gereken görevi arka plana ittiğinde başarısız olurlar.

Seçimi LIA'ya bırakmaya hazır mısın?

Tüm yapay zeka modelleriyle tek yerde üret — bugün ücretsiz başla.