تخطَّ إلى المحتوى
12/30الفصل 12 من 30

Chain of Thought وRLVR وTest-Time Compute، بالأرقام

نفس 24 مسألة: 0% صحيحة في 1.9 token، و100% في 145. ثم self-consistency تستعيد دقة كان greedy decoding يملكها أصلًا.

في هذه الصفحة

أربع وعشرون مسألة كلامية من خطوتين. نموذج صغير — نصف مليار parameter، وهو نفسه من الفصل 11 — يُسأل كل مسألة مرتين.

أولًا، يُطلب منه الجواب:

TEXT
"...How many bolts are left?  Reply with only the final number, nothing else."

  0 / 24 correct        1.9 tokens per answer

ثم يُطلب منه الجواب، مع الإذن بأن يعمل أولًا:

TEXT
"...How many bolts are left?  Think step by step, then give the final
 number on its own line."

  24 / 24 correct       145.2 tokens per answer

من صفر إلى مئة في المئة. النموذج نفسه، والأوزان نفسها، والمسائل نفسها، وgreedy decoding نفسه. الفرق الوحيد هو أن النسخة الثانية سُمح لها بإخراج 143 token إضافيًا قبل الالتزام برقم.

هذا الفصل عن تلك الفجوة: ما هي فعلًا، إلى أي مدى تصل، كم تكلف، وما الذي حدث عندما توقف المجال عن طلبها في prompt وبدأ تدريبها داخل النموذج.

النموذج لا يفكر. إنه يحسب لمدة أطول.

رابط إلى القسم: النموذج لا يفكر. إنه يحسب لمدة أطول.

الإغراء هو أن نقول إن النسخة الثانية «فكرت في الأمر». قاوم ذلك، لأن الآلية أبسط وأكثر فائدة من أن تُفهم بهذه الطريقة.

ينفذ transformer مقدارًا ثابتًا من الحساب لكل token يتم توليده. تمريرة أمامية واحدة: الطبقات نفسها، والمصفوفات نفسها، وعدد العمليات نفسه، سواء كان السؤال ما ناتج 2+2 أو أثبت هذه المبرهنة. لا يوجد قرص داخل النموذج لـ«حاول بجدية أكبر في هذه المسألة».

لذلك عندما يُطلب من نموذج أن يعطي إجابة فورًا، يكون كل الحساب المتاح له هو تمريرة أمامية واحدة. يجب أن تتسع كل كمية وسيطة داخل activations لتلك التمريرة الواحدة، وأي شيء لا يستطيع حسابه هناك، لا يستطيع حسابه.

إخراج token يغير ذلك، ويغيره بطريقتين واضحتين يجب الفصل بينهما:

  • مزيد من الحساب. كل token مُولَّد هو تمريرة أمامية كاملة أخرى. مئة وخمسة وأربعون token من العمل تعني مئة وخمسة وأربعين ضعف حساب الإجابة مباشرة.
  • ذاكرة مُخرَجة إلى الخارج. تُكتب الـ token في context، بحيث تستطيع التمريرة التالية قراءتها. يصبح 5 × 13 = 65 حقيقة في المُدخل، لا قيمة يجب على النموذج الاحتفاظ بها داخل activation وحملها إلى الأمام. يستخدم النموذج مخرجاته الخاصة كدفتر ملاحظات.

النقطة الثانية هي ما يفوته الناس، وهي تفسر لماذا يجب أن يكون العمل مكتوبًا كي يساعد. النموذج الذي يُطلب منه «فكر في الأمر بصمت ثم أجب» لا يملك مكانًا يضع فيه الفكرة.

لا يتطلب أي من هذا شيئًا غامضًا، وهو يقود إلى تنبؤ صلب: ينبغي أن تساعد Chain of Thought أكثر في المسائل ذات البنية المتسلسلة — حيث تحتاج الخطوة الثانية إلى نتيجة الخطوة الأولى — وأقل ما تساعد في المسائل التي هي مجرد استرجاع واحد. وهذا بالضبط ما تجده الأدبيات، ولهذا لا تفعل عبارة «فكر خطوة بخطوة» شيئًا لسؤال ما عاصمة فرنسا.

وصلت التقنية في عام 2022 على جزأين. أظهر Wei وآخرون أن تضمين أمثلة محلولة في prompt — عروض تكون فيها الإجابة مسبوقة باستدلال — حقق مكاسب كبيرة على معايير الحساب والمنطق العام.1 ثم أظهر Kojima وآخرون شيئًا أغرب: لا تحتاج إلى الأمثلة. إضافة «Let's think step by step» إلى prompt صفري الالتقاط تلتقط جزءًا كبيرًا من المكسب نفسه.2

النتيجة الثانية هي التي تخبرك بما يحدث. إذا كانت عبارة سحرية تفتح السلوك، فالسلوك كان موجودًا أصلًا في النموذج — فمرحلة pretraining مليئة بالحلول المشروحة، والعبارة مؤشر إلى تلك المنطقة من التوزيع. لم تُعلّم Chain of Thought النموذج شيئًا. لقد اختارت شيئًا كان النموذج يملكه بالفعل.

هذا الإطار يتنبأ أيضًا بأن التقنية ستصبح يومًا ما زائدة عن الحاجة، وسنعود إلى ذلك في نهاية الفصل.

الخطوة التالية الواضحة: إذا كان مسار استدلال واحد قد يكون خاطئًا، فخذ عدة عينات وخذ إجابة الأغلبية. هذه هي self-consistency.3 إنها إنفاق أكبر قطعًا — nn توليدات كاملة بدلًا من واحدة — والحدس هو أن الإجابات الخاطئة تتشتت بينما تتفق الصحيحة.

قِيس ذلك على 16 من المسائل نفسها، مع sampling عند temperature 0.8، وتصويت أغلبية على nn مسارات:

nnالدقةcumulative tokenstoken لكل مسألة
181 %2,952185
281 %5,618351
3100 %8,417526
4100 %11,103694
5100 %13,933871

ست عشرة مسألة مقام صغير، وقاعدة الفصل 4 تنطبق على هذا الجدول كما تنطبق على غيره. 13 من 16 تساوي 81 % مع مجال Wilson بنسبة 95 % مقداره [57, 93]؛ و16 من 16 تساوي 100 % مع [81, 100]. هذان يتداخلان. اقرأ شكل المنحنى، فهو النتيجة؛ ولا تقرأ الدرجة الدقيقة التي يستقر عندها، فست عشرة مسألة لا تستطيع تحديدها.

شيئان في ذلك الجدول، والثاني ليس ما كنت أتوقعه.

يتسطح المنحنى عند n=3n = 3. بحلول العينة الثالثة تكون الدقة عند سقفها، والعينتان المتبقيتان لا تشتريان شيئًا بينما تكلف كل منهما 172 token، أي 345 بينهما. هذا هو شكل كل منحنى self-consistency منشور في الأدبيات، وهو أبكر بكثير مما يوحي به إطار «كلما زادت العينات كان ذلك أفضل».

وكان greedy decoding أصلًا عند 100 %. انظر إلى أعلى الفصل: مسار واحد، بلا sampling، 145 token، و24/24. أدّى sampling عند temperature 0.8 إلى خفض الدقة إلى 81 %، واحتاجت self-consistency إلى ثلاث توليدات لتعود إلى حيث كانت تمريرة greedy واحدة أصلًا — عند 3.6 أضعاف token، أو ستة أضعاف إذا شغّلت المسح حتى خمسة من دون أن تعرف أين يتسطح.

هذه ليست حجة ضد self-consistency. إنها بيان دقيق لما تفعله: temperature يشتري التنوع بحقن الأخطاء، والتصويت يزيل الأخطاء التي حقنها للتو. في المسائل التي يفشل فيها greedy decoding — حيث يقود المسار الأكثر احتمالًا وحده إلى مكان خاطئ ويكون مسار أقل احتمالًا صحيحًا — تؤتي هذه المقايضة ثمارها، ولهذا وُجدت التقنية. أما في المسائل التي ينجح فيها greedy أصلًا، فهي طريقة لإنفاق ستة أضعاف الميزانية كي تتعادل فقط.

لا أحد ينشر الحالة الثانية، ولهذا يستحق الأمر قياسه على مهمتك قبل تبني التقنية. هذه مسائل سهلة من خطوتين لنموذج صغير؛ وهذا هو النظام الذي تخرج فيه الإجابة بهذه الصورة.

كل ما سبق يحدث وقت prompt على نموذج لم يُدرَّب خصيصًا لهذا. التحول الذي أنتج الجيل الحالي من نماذج الاستدلال كان نقل ذلك إلى التدريب — والمفتاح الذي جعل هذا ممكنًا أضيق مما يبدو.

احتاج post-training في الفصل 11 إلى تفضيلات بشرية، لأن سؤال «هل كانت هذه إجابة جيدة؟» لا يملك جوابًا برمجيًا. لكن بعض الأسئلة تملكه. الإجابة الرياضية إما تساوي القيمة الصحيحة أو لا. الكود إما يجتاز الاختبارات أو لا. البرهان إما يتحقق أو لا.

في هذه المجالات يمكنك استبدال reward model بـ verifier، وكل ما بعد ذلك يتحسن دفعة واحدة: لا annotators، ولا ملاءمة Bradley–Terry، ولا reward hacking من النوع المقاس في الفصل 11 — لأنك لا تستطيع مجاملة اختبار وحدة. هذا هو reinforcement learning from verifiable rewards، وهو السياق الذي بُني له GRPO: خذ عينة من مجموعة محاولات حل للمسألة نفسها، افحص كل واحدة، واستخدم متوسط درجة المجموعة كخط أساس. لا critic، ولا annotator، ولا reward model. مجرد برنامج يقول صحيح أو خطأ.

Outcome reward. قيّم الإجابة النهائية فقط. رخيص — مقارنة string — وله ثغرة واضحة: حل يصل إلى الرقم الصحيح عبر استدلال خاطئ يُكافأ تمامًا كحل صحيح، ولذلك تكون policy حرة في تعلم هراء يبدو مقنعًا ويصادف أنه يصل.

Process reward. قيّم كل خطوة. بنى Lightman وآخرون5 مجموعة بيانات من 800,000 خطوة استدلال موسومة بشريًا لتدريب نموذج يفعل ذلك، وأظهروا أنه يتفوق كثيرًا على outcome supervision في الرياضيات الصعبة. التكلفة في الاسم: هناك من وسم 800,000 خطوة.

النتيجة التي أعادت صياغة المجال جاءت من DeepSeek في أوائل 2025.6 أخذوا نموذجًا أساسًا وطبقوا reinforcement learning with verifiable rewards مباشرة، من دون مرحلة supervised fine-tuning أولًا — وهي المرحلة التي يقدمها الفصل 11 بوصفها أساس كل شيء. ومع ذلك ظهرت سلاسل استدلال طويلة. وظهرت أيضًا سلوكيات لم يدرّبها أحد: بدأ النموذج يعيد فحص خطواته الخاصة، وفي أكثر مقطع مقتبس من الورقة، أعاد النظر تلقائيًا في نهجٍ ما في منتصف الحل.

القراءة الصادقة ليست أن الاستدلال سحر. بل إنه عندما يكون الشيء الوحيد المُكافأ هو أن تكون صحيحًا، وتتطلب الصحة في مسألة صعبة العمل عبرها، فإن العمل عبرها هو ما يجده المحسّن — بما في ذلك أجزاء العمل عبرها التي يفعلها البشر أيضًا، لأنها ما تتطلبه المسألة لا ما علّمه أحد.

النتيجة العملية لكل هذا هي أن نموذج الاستدلال ينتج token طلبتها وtoken لم تطلبها، وتدفع ثمن الاثنين.

يتعامل المزوّدون مع هذا بطرق مختلفة، والاختلاف مهم:

  • معظم APIs تعدّ reasoning tokens داخل عدد output token. فاتورتك وحد max_tokens لديك يشملان التفكير الذي لا تراه.
  • يبلغ Gemini من Google عن thinking tokens كحقل منفصل، خارج عدد output القياسي.

هذا عدم توافق حقيقي بين طريقتين لعد الشيء نفسه، وأي كود يحسب التكلفة أو يفرض ميزانية عبر مزوّدين يجب أن يطبّعه. الفصل 16 هو حيث يصبح ذلك مالًا، والفصل 23 حيث يصبح ميزانية يمكنك فرضها.

النتيجة الأخرى هي نتيجة latency تفاجئ الناس في المرة الأولى. وقت نموذج الاستدلال إلى أول token مرئي يشمل كل تفكيره، لذلك فالطلب الذي لا يبث شيئًا لثماني ثوانٍ ثم يجيب في ثانية ليس اتصالًا عالقًا — بل النموذج يعمل. أي واجهة تعرض مؤشر تحميل بلا تفسير لثماني ثوانٍ لديها مشكلة تصميم، لا مشكلة شبكة.

متى تتوقف عبارة «think step by step» عن المساعدة

رابط إلى القسم: متى تتوقف عبارة «think step by step» عن المساعدة

تحذير ختامي، لأنه أكثر الطرق شيوعًا لتطبيق مادة هذا الفصل تطبيقًا خاطئًا.

كل شيء في النصف الأول تقنية لجعل نموذج لم يُدرَّب على الاستدلال ينتج استدلالًا مع ذلك. النماذج المدرَّبة بـ RLVR تفعل ذلك أصلًا: فهي تخرج عملها الداخلي، بطولها الخاص، قبل الإجابة. إخبار نموذج كهذا أن يفكر خطوة بخطوة زائد عن الحاجة في أحسن الأحوال وضار في أسوئها — فقد ينتج سلسلة قصيرة على شكل prompt بدلًا من السلسلة الأطول التي كان النموذج سيولدها وحده، وبعض المزوّدين يوثقون هذا بالضبط.

ينطبق الأمر نفسه على هياكل الاستدلال المتقنة المبنية داخل كود التطبيق. prompt يمرّر النموذج عبر شجرة قرار يتنقل فيها داخليًا أصلًا ينفق token لديك لتقييد سلوك دُرّب داخل النموذج. هذا هو الظهور الأول لموضوع يمتد في بقية الدورة: تقنيات كانت أساسية في 2022 أصبحت خرافات بحلول 2025، والطريقة الوحيدة لمعرفة أيها أي، لنموذجك اليوم، هي قياس الاثنين.

الفصل 15 هو حيث يصبح ذلك القياس نظامًا لا رأيًا.

للاستدلال خاصية غير مريحة: إنه القدرة الوحيدة التي تتوسع تكلفتها مع صعوبة السؤال. النموذج الذي يفكر لتسعمئة token ينفذ تسعمئة تمريرة أمامية، ويحتفظ بـ cache متنامية في الذاكرة لكلها، ويمسك GPU طوال المدة.

هذا يجعل اقتصاديات تقديم نموذج استدلال أسوأ بحدة من تقديم نموذج chat، ويحوّل مجموعة من تفاصيل التنفيذ إلى الفرق بين منتج قابل للحياة وآخر غير قابل لها: كيف تُخزن cache الخاصة بالمفاتيح والقيم السابقة ويُعاد استخدامها، وكم طلبًا يستطيع مشاركة تمريرة أمامية واحدة، وكم precision تحتاجه الأوزان فعليًا.

الفصل 13 هو الفصل الأخير الذي يكون فيه النموذج كائنًا في ذاكرتك بدلًا من خدمة خلف منفذ، وهو عن جعل ذلك الكائن رخيصًا بما يكفي لتقديمه. كما يفي بوعد من هذا الفصل: speculative decoding، الذي ينتج عدة token بتكلفة تقارب تكلفة واحد عبر جعل نموذج صغير يخمّن ونموذج كبير يتحقق — خدعة لا تصبح منطقية إلا بعد أن ترى كم من التمريرة الأمامية يُنفق في انتظار الذاكرة بدلًا من إجراء الحساب.


كل القياسات في هذا الفصل تأتي من Qwen/Qwen2.5-0.5B-Instruct على 24 مسألة كلامية مُولَّدة من خطوتين، مع greedy decoding إلا حيث ذُكر sampling، ومن دون أي توليدات مقطوعة عند حدود token المستخدمة. وهي قابلة لإعادة الإنتاج، وهي نموذج صغير على مسائل سهلة: اقرأ نتيجة self-consistency كعرض للآلية، لا كمعيار أداء. يغطي الفصل 18 من ملاحظات محاضرات CS229 والفصل 12 من Hugging Face LLM Course هذه المادة بنماذج أكبر ومعايير أداء مناسبة.

  1. Wei, J. et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903 (2022).

  2. Kojima, T., Gu, S. S., Reid, M., Matsuo, Y. and Iwasawa, Y. Large Language Models are Zero-Shot Reasoners. arXiv:2205.11916 (2022). نتيجة «let's think step by step».

  3. Wang, X. et al. Self-Consistency Improves Chain of Thought Reasoning in Language Models. arXiv:2203.11171 (2022).

  4. Yao, S. et al. Tree of Thoughts: Deliberate Problem Solving with Large Language Models. arXiv:2305.10601 (2023).

  5. Lightman, H. et al. Let's Verify Step by Step. arXiv:2305.20050 (2023). يقدّم PRM800K، مجموعة بيانات process supervision ذات 800,000 خطوة.

  6. DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948 (2025). نتيجة R1-Zero — تطبيق reinforcement learning مباشرة على نموذج أساس، من دون مرحلة supervised fine-tuning — موجودة في القسم 2.2.

  7. Snell, C., Lee, J., Xu, K. and Kumar, A. Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. arXiv:2408.03314 (2024).


من إعداد

David Vicente Campos

مؤسس NeuraLIA Labs وشريك مؤسس MyRealFood

أنا مهندس حاسوب، خرّيج جامعة ليون الإسبانية. شاركت في تأسيس MyRealFood، حيث بنيت، بصفتي المدير التقني، التطبيق الذي استخدمه ملايين الأشخاص ليأكلوا بشكل أصحّ، وأسست NeuraLIA Labs، حيث أبني منتجات ذكاء اصطناعي. هنا أكتب عمّا كان عليّ فهمه على طول الطريق، بالطريقة التي تمنّيت لو شرحه لي أحدهم بها.

المزيد عن الكاتب

الناشر: NeuraLIA Labs.

احصل على المنشورات الجديدة في بريدك

أخبار الذكاء الاصطناعي وأدلة وتحديثات المنتج — رسالة قصيرة عندما ننشر ما يستحق وقتك.

فهرس الدورة

Abstract software decision engine with branching paths, probability nodes, and glowing gates.
jevقراءة 11 دقيقة

نموذج Jev للذكاء الاصطناعي صُمم للقرارات لا للنثر

يلفت Jev من TypeSafe AI الانتباه لأنه يتعامل مع ذكاء البرمجيات بوصفه مسألة احتمالات: اختر الفرع الصحيح، وأرفق الثقة، وتجنب الدفع لنموذج LLM ليكتب نصًا عندما تحتاج الشيفرة إلى قرار.

هل أنت مستعد لتترك الاختيار لـ LIA؟

ابنِ بكل نماذج الذكاء الاصطناعي في مكان واحد — ابدأ مجانًا اليوم.