تخطَّ إلى المحتوى
10/30الفصل 10 من 30

التدريب المسبق لـ LLM: البيانات والحوسبة وقوانين التوسع والتكلفة

عشرون نموذجًا دُرّبت على GPU حاسوب محمول لقياس قانون توسع والتحقق من تقدير 6ND للحوسبة بعداد FLOP حقيقي.

في هذه الصفحة

انتهى الفصل 9 بكتلة transformer قابلة للتدريب. ضع بضع كتل منها فوق بعضها، ووجّه خسارة الـ next-token من الفصل 8 إلى الخرج، ولن يبقى شيء لاختراعه. كل ما يتبقى هو شراء.

هذا تحوّل أكبر مما يبدو. كل فصل حتى الآن كان يسأل: هل يتعلّم؟ — سؤال نعم أو لا يحسمه حاسوب محمول في عشر دقائق. هذا الفصل يسأل سؤالًا فيه مال: إذا كان لدي مقدار ثابت من الحساب، فما أفضل نموذج يمكنني شراؤه؟ الجواب صيغة، ولم تكن بديهية لأحد في 2018.

إليك هذا السؤال مجابًا بالقياس، على GPU واحد في حاسوب محمول. دُرّب عشرون نموذجًا، من 98,624 إلى 15 مليون parameter، من الصفر على 174 مليون token من ويكيبيديا — vocabulary من نوع BPE بحجم 2,048 token دُرّبت بالطريقة التي يدرب بها الفصل 7 واحدة، وtransformer الفصل 9. حصلت كل تجربة على واحدة بالضبط من ثلاث ميزانيات حوسبة، ولا عملية واحدة أكثر، لذا فإن النموذج الأكبر يقرأ نصًا أقل بالضرورة. أفضل خسارة held-out بُلِغت عند كل ميزانية:

TEXT
budget C (FLOPs)   best loss   reached by a model of
       1.00e13       5.3531           98,624 params
       3.16e13       4.8638           98,624 params
       1.00e14       4.3383          295,808 params

fitted:  L = (Cc / C)^0.0913     over one decade of compute

عشرة أضعاف الحساب تخفض الخسارة 19 %، والنقاط الثلاث تقع على خط مستقيم في log-log. لا شيء في الفصول التسعة الأولى يتنبأ بذلك. لا توجد مبرهنة خلفه — إنه انتظام تجريبي، يصمد بأسّ مختلف عبر عشرة رتب مقدار بين هذا الحاسوب المحمول ومركز بيانات، وهو الملاحظة الوحيدة التي أقنعت صناعة كاملة بإنفاق ناتج دولة صغيرة على GPUs.

ما هو التدريب المسبق، وما الجديد فيه

رابط إلى القسم: ما هو التدريب المسبق، وما الجديد فيه

لا يتغير شيء في الهدف. ما زال النموذج يتنبأ بالـ token التالي، وما زالت الخسارة هي cross-entropy في الفصل 4 مطبقة على التحليل الاحتمالي من الفصل 8، وما زال المحسّن هو AdamW من الفصل 6. التدريب المسبق ليس خوارزمية جديدة؛ إنه الخوارزمية نفسها تُشغّل على corpus كبير بما يكفي ليصبح التشغيل مسألة ميزانية. شيئان يجعلان ذلك ممكنًا: التسميات مجانية، لأن الهدف للموضع tt هو الـ token عند t+1t+1 وهو موجود أصلًا في النص؛ والقسم الأخير من الفصل 6 أزال الاعتراض، لأن نموذجًا يملك parameters أكثر بكثير مما تسمح به القواعد الكلاسيكية لا ينهار، بل يتحسن. ما يخرج هو نموذج أساس — شيء يكمل النص بدل أن يجيب.

قبل أن تُرصد ميزانية لأي من هذا يجب عده، والمجال يعدّه بصيغة واحدة:

C6NDC \approx 6ND

حيث NN هو عدد parameters، وDD هو training tokens، وCC هو إجمالي عمليات floating-point. يشتقها Kaplan وآخرون في خطوتين.1 Forward: ‏2 FLOPs لكل parameter لكل token، لأن كل parameter في ضرب مصفوفات يُستخدم مرة واحدة لكل token، في عملية ضرب وعملية جمع. Backward: ضعف forward، لأن backward pass في الفصل 5 يحسب gradientين في كل طبقة — بالنسبة إلى مدخلات الطبقة، كي تستمر الإشارة في السفر، وبالنسبة إلى أوزانها — وكل واحد منهما ضرب مصفوفات بحجم forward، لذا 4N4N.

هذا هو الاشتقاق كله، ويستحق التحقق لا التصديق. تأتي PyTorch مع عداد FLOP حقيقي، torch.utils.flop_counter.FlopCounterMode، يعترض كل عملية يرسلها نموذج ويجمع العمل الفعلي. شغّله عبر أربع رتب مقدار، والأكبر على جهاز meta، الذي يخصص الأشكال ولا يخصص الذاكرة:

flops.pyPYTHON
from torch.utils.flop_counter import FlopCounterMode

counter = FlopCounterMode(display=False)
with counter:                       
    loss = model(x, targets)[1]     
    loss.backward()                 
measured = counter.get_total_flops()
print(measured / (6 * n_params * n_tokens))
configurationNN دون embeddingsNN الإجماليmeasured, fwd+bwd÷ 6ND6ND (الإجمالي NN)÷ 6ND6ND (دون emb.)fwd+bwd ÷ fwd
dd 128، 4 طبقات، TT 256788,7367,254,4004.60e101.0319.4853.000
dd 512، 8 طبقات، TT 25625,183,23251,045,8883.26e111.0382.1043.000
dd 768، 12 طبقة، TT 102484,973,056124,356,8641.75e121.1451.6763.000
dd 1600، 48 طبقة، TT 10241,474,870,4001,556,920,0002.10e131.1001.1613.000
dd 4096، 32 طبقة، TT 20486,442,983,4246,582,444,0328.74e131.0801.1043.000
dd 8192، 80 طبقة، TT 819264,427,147,26465,544,929,2803.75e151.1631.1833.000

نسبة forward+backward إلى forward هي 3.000، بالضبط، عند كل مقياس: ليست تقريبًا صادف أنه جيد، بل الهوية الحسابية أعلاه يعيدها كرقم مستدير عداد لا يعرف شيئًا عن الاشتقاق.

ثم يقع الإجمالي المقاس بين 3 % و17 % فوق 6ND6ND، عندما يعد NN مصفوفات embedding — وهذه الجملة مهمة، لأن الورقتين المؤسستين تعدّان NN بطرق مختلفة. يستبعد Kaplan «كل vocabulary وpositional embeddings» لأن ذلك «ينتج قوانين توسع أنظف بكثير» (§1.3)؛ ويقول ملحق Chinchilla F: «نعد أيضًا مصفوفات embeddings في إجمالي عدد parameters».2 مع vocabulary واسعة وبُعد مخفي ضيق، يختلف الاثنان بمعامل تسعة، كما يوضح الصف الأول.

الفجوة المتبقية هي ما تحذفه 6ND6ND عمدًا: درجات attention. تكتب معادلة Kaplan (2.2) تكلفة forward بصيغة 2N+2nlayernctxdmodel2N + 2\,n_{\text{layer}} n_{\text{ctx}} d_{\text{model}} وتحذف الحد الثاني لأن dmodelnctx/12d_{\text{model}} \gg n_{\text{ctx}}/12 — آمنًا في 2020، وأقل أمانًا الآن، وهو سبب انجراف النسبة صعودًا مع نمو T/dT/d — ولهذا يشترك صفان هنا في TT قدره 1,024 وتنخفض النسبة من 1.145 إلى 1.100 عندما ينتقل dd من 768 إلى 1,600. إنها تكلفة O(T2)O(T^2) التي قدّمها الفصل 9 ويحوّلها الفصل 16 إلى سعر.

الذاكرة: ما الذي يجب أن يتسع فعلًا

رابط إلى القسم: الذاكرة: ما الذي يجب أن يتسع فعلًا

تحدد الحوسبة كم يستغرق التشغيل؛ وتحدد الذاكرة هل يمكن أن يبدأ. درّب باستخدام fp32 AdamW عادي، وكل parameter يحمل أربعة أرقام: الوزن، وgradient الخاص به، ومتوسط Adam الجاري mm وتباينه vv — المتوسطان اللذان بنيناهما يدويًا في الفصل 6. أربعة أرقام بأربعة بايتات لكل منها تعني 16 بايت لكل parameter، قبل activation واحدة. مقاسًا على GPU حاسوب محمول بسعة 8 GB، مع أخذ التخصيص المقيم عند النقطة في الخطوة حيث لا يكون أي graph حيًا:

modelvocabularybatchNN16N16N متوقعمقيم مقاسذروة في خطوةالفرق
dd 512، 8 طبقات50,257851,045,888779 MB801 MB2,500 MB1,699 MB
dd 512، 8 طبقات4,096827,411,456418 MB426 MB1,043 MB617 MB
dd 256، 6 طبقات4,09685,839,36089 MB89 MB382 MB293 MB
dd 256، 6 طبقات4,096325,839,36089 MB89 MB1,259 MB1,170 MB
dd 256، 6 طبقات4,0961285,839,36089 MB89 MB4,771 MB4,681 MB

يتفق التنبؤ والقياس ضمن 3 %. المفاجأة في العمود الأخير: activations تبتلع النموذج. النموذج نفسه ذو 5.8 مليون parameter الذي يحتاج 89 MB من الحالة الدائمة يحتاج 4,681 MB من activations عند batch بحجم 128 — اثنين وخمسين ضعف النموذج — والكثير من ذلك ليس transformer أصلًا. إنه logits، متجه واحد بحجم vocabulary لكل token بأربعة بايتات للمدخل: 512 MB في الصف الأخير، و393 MB في الأول. اختير حجم vocabulary في الفصل 7، وما زال يقرر ما يتسع على البطاقة.

أي حد يهيمن يعتمد على شكل التشغيل، ولهذا يقول Micikevicius وآخرون إن الذاكرة «تهيمن عليها activations»3 بينما يقول ZeRO إن نموذجًا بـ 1.5 مليار parameter يحتاج «على الأقل 24 GB» من حالات النموذج وحدها.4 يصل ZeRO إلى نفس 16 بايت عبر طريق آخر — 2Ψ2\Psi لأوزان fp16، و2Ψ2\Psi لـ gradients بنمط fp16، و4Ψ4\Psi لكل من الأوزان الرئيسية fp32 ولحظتي Adam — وهذا يعني لـ 70 مليار parameter مقدار 1.12 تيرابايت، أي ما يعادل أربع عشرة GPU بسعة 80 GB قبل activation واحدة.

التوازي، في فقرة واحدة وتفويض واحد

رابط إلى القسم: التوازي، في فقرة واحدة وتفويض واحد

لا يتسع أي من ذلك على جهاز واحد عند مقياس frontier، لذا يُقسّم التشغيل بأربع طرق في الوقت نفسه. Data parallelism يضع نسخة من النموذج على كل GPU ويأخذ متوسط gradients — وهو الافتراضي، والذي يحسّنه ZeRO برفض الاحتفاظ بنسخ زائدة من حالة المحسّن. Tensor parallelism يقسم المصفوفات الفردية عبر الأجهزة. Pipeline parallelism يعطي كل جهاز مجموعة متجاورة من الطبقات. Context parallelism يقسم السلسلة نفسها، ولا يصبح ضروريًا إلا عندما يصبح TT طويلًا بما يكفي ليهيمن حد attention. يسرد جدول Llama 3 رقم 4 الأربعة معًا: tensor 8، وcontext حتى 16، وpipeline 16، وdata حتى 128، عبر 16,384 GPU من نوع H100.5 هذا كل ما سيقوله هذا المقرر عنه؛ هندسة التدريب الموزع فصل جامعي قائم بذاته، وStanford CS336 هو ذلك الفصل، المحاضرات 5 إلى 8، مع الكود.6 ما يبقى من التفويض هو رقم واحد، model FLOPs utilisation — نسبة ذروة الحساب في GPU التي يحققها تشغيل حقيقي — وهو ما يحوّل 6ND6ND الأنيقة إلى زمن ساعة حائط، وبالتالي إلى مال.

في يناير 2020، درّب Kaplan وآخرون شبكة من transformers ووجدوا أن خسارة الاختبار تتبع power law في كل مورد من الموارد الثلاثة عبر أكثر من ست رتب مقدار.1 يعطي §1.2 لديهم ثلاث قوانين ملائمة:

L(N)=(NcN)αN,αN0.076,Nc8.8×1013L(N) = \left(\frac{N_c}{N}\right)^{\alpha_N}, \qquad \alpha_N \approx 0.076, \qquad N_c \approx 8.8 \times 10^{13}

مع مرافقات αD0.095\alpha_D \approx 0.095 للبيانات وαCmin0.050\alpha_C^{\min} \approx 0.050 للحوسبة الموزعة على نحو أمثل. الثوابت ليست كونية، وتقول الورقة ذلك: «القيم العددية الدقيقة لـ NcN_c وCcminC_c^{\min} وDcD_c تعتمد على حجم vocabulary وtokenization، وبالتالي لا تحمل معنى أساسيًا».

الأسس صغيرة جدًا: عشرة أضعاف parameters تشتري معامل 100.0761.1910^{0.076} \approx 1.19 من الخسارة المتبقية. يبدو ذلك لا شيء، وهو أهم حقيقة هنا — العوائد رديئة ولا تتوقف أبدًا. يعد power law بأس صغير بأن رتبة المقدار التالية ستساعد، أقل مما ساعدت السابقة، إلى الأبد. شراء الحوسبة يتوقف عن كونه مقامرة ويصبح شراءً بسعر صرف منشور، وهذا بالضبط هو المنطق الذي فتح رأس المال.

ثم جاءت الوصفة، وهنا كانت الورقة مخطئة بطريقة كلّفت الصناعة مالًا كثيرًا. يعطي جدول Kaplan 6 NoptC0.73N_{\text{opt}} \propto C^{0.73} وDoptC0.27D_{\text{opt}} \propto C^{0.27}: عشرة أضعاف الحوسبة تعني نموذجًا أكبر 5.4 مرات يُطعم نصًا أكثر 1.9 مرة فقط. الملخص صريح — «التدريب الأمثل كفؤًا حاسوبيًا يتضمن تدريب نماذج كبيرة جدًا على كمية بيانات متواضعة نسبيًا والتوقف قبل التقارب بقدر كبير». فعل المجال ذلك بالضبط: GPT-3 هو 175 مليار parameter على 300 مليار token،7 وGopher هو 280 مليار على 300 مليار، وMegatron-Turing NLG هو 530 مليار على 270 مليار.2 نصف token إلى tokenين لكل parameter، في كل مكان.

في مارس 2022، درّب Hoffmann وآخرون أكثر من 400 نموذج من 70 مليونًا إلى 16 مليار parameter، ووصلوا إلى الخلاصة المعاكسة عبر ثلاث طرق مستقلة.2 يورد جدولهم 2 الأس aa في NoptCaN_{\text{opt}} \propto C^{a} بقيم 0.50 و0.49 و0.46، مقابل 0.73 لدى Kaplan. بعبارة بسيطة: ينبغي أن ينمو حجم النموذج وبيانات التدريب بالنسبة نفسها.

طريقتهم الثانية هي ما يعاد إنتاجه بالمسح في أعلى هذا الفصل، بمقياس أصغر بمليون مرة: ثبّت ميزانية، درّب أحجامًا كثيرة عند تلك الميزانية بالضبط، وارسم الخسارة النهائية مقابل حجم النموذج.

parametersC=1013C = 10^{13}C=3.16×1013C = 3.16 \times 10^{13}C=1014C = 10^{14}
98,6245.3531 (171)4.8638 (542)
150,3205.4636 (74)
194,2085.5041 (44)4.8730 (140)4.4040 (442)
295,8085.5550 (19)4.9029 (60)4.3383 (190)
665,2805.7849 (3.8)5.1254 (12)4.4192 (38)
1,280,7685.8174 (1.0)5.1751 (3.2)4.5003 (10)
3,101,5685.4686 (0.5)4.7768 (1.7)
5,315,0725.5894 (0.2)4.8514 (0.6)
15,053,5685.3534 (0.1)

خسارة held-out بوحدة nats لكل token، وtokens لكل parameter بين قوسين، والخط العريض لأفضل نموذج عند كل ميزانية؛ والشرطة نقطة لم تُشغّل، لأن الميزانية طلبت نصًا أكثر مما يحتويه corpus أو لأن الحجم خرج عن الأحجام الممسوحة هناك.

اقرأ نزولًا في عمود: تهبط الخسارة، تصل إلى قاع، ثم تصعد مجددًا. يمكن أن يكون النموذج كبيرًا أكثر من اللازم لميزانيته بسهولة أن يكون صغيرًا أكثر من اللازم — عند 101410^{14}، عقوبة اختيار 665,280 parameter بدل 295,808 هي 0.08 nats، وهي على الغلاف الملائم أعلاه الخسارة التي يبلغها نموذج بالحجم الصحيح بحوسبة أقل 18 %. اختيار الشكل الخاطئ يهدر خمس الميزانية. هذا هو شكل Chinchilla رقم 3 في عصر واحد على GPU واحد بدل أربعمئة نموذج.

الآن اقرأ أفقيًا. عند 101310^{13} أفضل نموذج هو أصغر ما شمله المسح؛ وعند 101410^{14} هو 295,808 parameter، محاطًا من الجانبين. تتحرك النقطة المثلى يمينًا مع نمو الميزانية، وهذا هو كامل مضمون التصحيح. لائم طريقة الورقة الثالثة — السطح L(N,D)=E+A/Nα+B/DβL(N,D) = E + A/N^{\alpha} + B/D^{\beta} فوق كل تجربة — وقلّل مع القيد C=6NDC = 6ND:

TEXT
L(N, D) = 24.7 / N^0.195 + 46.8 / D^0.169       (E fits to ~0; see below)
implied   N_opt ∝ C^0.464
  compare   Chinchilla 0.46-0.50 · Besiroglu 0.513 · Kaplan 0.73

0.46، من حاسوب محمول، مقابل 0.73 لدى Kaplan. الاتفاق إلى ثلاثة أرقام من ملاءمة بثلاث ميزانيات حظ؛ أما الاتفاق إلى الرقم الأول فليس حظًا. الأس ينتقل — والثابت لا ينتقل، لأن نسبة token إلى parameter عند هذه النقاط المثلى هي 170 إلى 540، لا 20. ثلاثة أسباب، وكلها مفيدة. EE يطابق صفرًا لأن الخسارة فوق 4 nats تعني أن التشغيل ليس قريبًا إطلاقًا من أرضية entropy التي تهيمن على ملاءمة Chinchilla. ثُبّت حجم batch ومعدل التعلم بدل ضبطهما لكل نقطة، وهذا يعيق التجارب التي تحصل على أقل عدد من الخطوات — وتلك هي النماذج الكبيرة: عند 101310^{13} FLOPs يحصل نموذج 1.28 مليون parameter على 159 خطوة محسّن إجمالًا، أقل بكثير من بضعة آلاف يقول حد SminS_{\min} لدى Kaplan إن أي نموذج يحتاجها. يُلائم قانون التوسع داخل نظام، وهذا النظام يقع ست رتب مقدار دون Chinchilla.

ومن هنا ملخص الورقة: «نماذج اللغة الكبيرة الحالية ناقصة التدريب بوضوح». Chinchilla هو البرهان — 70 مليار parameter على 1.4 تريليون token، وبـ نفس إجمالي الحوسبة مثل Gopher ذي 280 مليارًا على 300 مليار، ويتفوق عليه في 51 من 57 مهمة MMLU، 67.5 % مقابل 60 %.2 أصغر أربع مرات، ونص أكثر أربع مرات ونصف، نفس المال، نموذج أفضل.

تنبيهان حول تلك النسبة الشهيرة. «عشرون token لكل parameter» ليست جملة في الورقة، التي تقول فقط إن «كل تضاعف في حجم النموذج ينبغي أن يصاحبه تضاعف أيضًا في عدد training tokens»؛ والـ 20 استنتاج من جدول 3 ومن Chinchilla نفسه: 70 B على 1.4 T. ودقتها أسوأ مما نُشر: أعاد Besiroglu وآخرون الملاءمة من رقمنة شكل 4، ووجدوا أن parameters الأصلية «تلائم البيانات المعاد بناؤها على نحو رديء» مع فواصل «ضيقة على نحو غير معقول بالنظر إلى عدد نقاط البيانات»، ووضعوا المجال الصادق عند «بين 4 و40» token لكل parameter.8

تفصيل واحد في طريقة Chinchilla يفي بوعد قطعه الفصل 1 بشأن جداول معدلات التعلم. يجب مطابقة cosine schedule مع ميزانية الـ token. نموذج سيرى 10 ملايين token يجب أن يخفض معدل تعلمه إلى الصفر عند 10 ملايين token؛ أعطه schedule معدًا لـ 100 مليون، وأوقفه مبكرًا، وستقرأ خسارة في منتصف الهبوط عند معدل أعلى بكثير. يدرّب Chinchilla كل نموذج بأربعة أطوال دورات لضبط هذا تحديدًا؛ والمسح أعلاه يحدد schedule من الميزانية للسبب نفسه.

إنها أكثر نتيجة تجريبية فائدة في المجال، ويُبالغ في بيعها باستمرار. أربعة حدود.

إنها تتنبأ بالخسارة، لا بالقدرة. الطرف الأيسر هو cross-entropy على نص held-out. لا شيء في هذه الأوراق يجيز ادعاء حول ما إذا كان النموذج سيكتب SQL صحيحًا، أو يرفض طلبًا مؤذيًا، أو يستخدم أداة. هذا درس الفصل 5 مرة أخرى: تنبؤ بالخسارة ليس تنبؤًا بالسلوك الذي تدفع ثمنه.

إنها ملائمة، لا مشتقة. لا توجد نظرية تنتج αN=0.076\alpha_N = 0.076. تتحرك الثوابت مع tokenizer — ولهذا تكون مقارنة perplexity عبر tokenizerين بلا معنى، كما شرح الفصل 8 — ومع خليط البيانات، والبنية، والمحسّن. كل قانون منشور هو قانون للإعداد الذي أنتجه، ولهذا أعادت Meta ملاءمة قانونها قبل Llama 3.5

إنها تفترض token جديدًا لكل خطوة، وهذا يفترض ضمنًا corpus لا نهائيًا. قاس Muennighoff وآخرون ما يحدث عندما ينفد: حتى أربعة epochs من بيانات مكررة لا تكلف تقريبًا شيئًا — نموذج بـ 8.7 مليار parameter على 44 مليار token فريد رآها أربع مرات أنهى «بخسارة validation أعلى 0.5 % فقط» من النموذج نفسه على 178 مليار token فريد — بينما بعد نحو ستة عشر epoch لا تشتري الحوسبة الإضافية شيئًا.9

ولا أحد يدرب compute-optimal بعد الآن. يقلل Chinchilla تكلفة التدريب؛ ثم يدفع نموذج منشور تقريبًا 2N2N FLOPs لكل token مُولّد، إلى الأبد. قالت LLaMA 1 ذلك بوضوح: «بالنظر إلى مستوى أداء مستهدف، النموذج المفضل ليس الأسرع تدريبًا بل الأسرع في inference».10 صاغ Sardana وآخرون ذلك بتقليل 6NDtrain+2NDinference6ND_{\text{train}} + 2ND_{\text{inference}} بدلًا من ذلك، ووجدوا أن من يتوقع مليار طلب ينبغي أن يدرب «أصغر ولمدة أطول من Chinchilla-optimal».11 يوافق §9.1 في Llama 3: نماذجه الصغيرة تُدرّب «إلى ما بعد نقطة التدريب compute optimal بكثير، بما يبادل فعليًا حوسبة التدريب بكفاءة inference».5 النسبة ليست قديمة؛ إنها تجيب عن سؤال لم يعد هو السؤال المطروح.

القدرات الناشئة، والجدل حول ما إذا كانت حقيقية

رابط إلى القسم: القدرات الناشئة، والجدل حول ما إذا كانت حقيقية

تهبط الخسارة بسلاسة. نتائج الاختبارات أحيانًا لا تفعل. جمع Wei وآخرون حالات تبقى فيها مهمة عند مستوى الصدفة عبر رتب مقدار من training compute ثم تقفز — حساب بثلاث خانات يظهر في GPT-3 عند نحو 2×10222 \times 10^{22} FLOPs، وMMLU يرتفع فوق التخمين بين 33 و5×10235 \times 10^{23} — وسمّوا النمط: «تكون القدرة ناشئة إذا لم تكن موجودة في النماذج الأصغر لكنها موجودة في النماذج الأكبر».12 إذا كانت هذه خاصية حقيقية، فاستقراء التجارب الرخيصة غير آمن، لأن القدرة التي تشتريها قد لا توجد عند أي مقياس تستطيع اختباره.

جادل Schaeffer وMiranda وKoyejo بأن معظم ذلك أثر مصطنع من القياس، والآلية حسابية.13 تهبط خسارة كل token بسلاسة، لذا تتحسن احتمالية أن يكون token واحد صحيحًا، exp(L)\exp(-\mathcal{L})، تدريجيًا. قيّم النموذج باستخدام exact string match على إجابة من LL token فترفع تلك الاحتمالية إلى القوة LL — منحنى سلس مرفوع إلى قوة كبيرة يبدو كجرف. استبدل به مقياسًا يعد tokens بدل أن يطلبها كلها، على المخرجات نفسها، و«يتحسن أداء العائلة بسلاسة واستمرار وبشكل قابل للتنبؤ مع زيادة scale».

رقم تدقيقهم هو ما يجب تذكره — «من أصل 39 مقياسًا مفضلًا في BIG-Bench، يعرض 5 على الأكثر emergence»، مع مقياسين غير مستمرين يفسران أكثر من 92 % من الحالات المزعومة — وكذلك تحذيرهم: «لا ينبغي تفسير أي شيء في هذه الورقة على أنه يدعي أن large language models لا يمكن أن تعرض قدرات ناشئة». القفزة في مخطط دليل على المقياس إلى أن يثبت غير ذلك. الفصل 29 هو المكان الذي يصبح فيه ذلك مشكلتك، لأن اختيار مقياس بعتبة قاطعة قرار ستتخذه دون أن تلاحظ.

الـ corpus هو جزء تشغيل التدريب المسبق الذي لا ترتبط به معادلة، وحيث تعيش معظم القرارات ذات العواقب. المادة الخام هي زحف ويب: يحتوي أرشيف Common Crawl لشهر أغسطس 2026 على «2.14 مليار صفحة ويب أو 360 TiB من المحتوى غير المضغوط»، شهر واحد منه، متاح للتنزيل مجانًا.14 يكاد لا يكون أي منه صالحًا كما هو. تقول ورقة T5 إن الزحف «يتكون إلى حد كبير من هراء أو نصوص boiler-plate مثل القوائم ورسائل الخطأ أو النص المكرر»، وخط أنابيب C4 الذي قدمته قائمة heuristics فظة — احتفظ فقط بالأسطر المنتهية بعلامة ترقيم نهائية، وأسقط الصفحات التي تقل عن ثلاث جمل، وأسقط أي صفحة تحتوي على قوس معقوف أو كلمة من قائمة عامة للألفاظ البذيئة — فحوّل عشرين تيرابايت من النص الشهري إلى نحو 750 GB.15

فظة هي الكلمة. دقق Dodge وآخرون في ما تزيله تلك المرشحات ووجدوا أن قائمة حظر الألفاظ البذيئة تحذف 42 % من المستندات بالإنجليزية الأفريقية-الأمريكية و32 % بالإنجليزية المتوافقة مع الهسبان، مقابل 6.2 % من الإنجليزية المتوافقة مع البيض، تاركة corpus نسبته 97.8 % من الفئة الأخيرة.16 قاعدة بلا رأي عن اللهجة امتلكت رأيًا.

ثم deduplication، وهي ليست ترتيبًا منزليًا: وجد Lee وآخرون جملة من 61 كلمة مكررة 61,036 مرة في C4، وأظهروا أن deduplication يخفض معدل «إطلاق النماذج نصًا محفوظًا» عشرة أضعاف، من 1.9 % من tokens المولدة إلى 0.19 %.17 لكن المزيد ليس أفضل دائمًا — أجرى فريق FineWeb deduplication عالميًا عبر 96 زحفًا، وحصل على 4 تريليونات token بلا مكسب قابل للقياس، ثم أجرى deduplication لكل زحف على حدة، وحصل على 20 تريليونًا، وطابق أفضل corpus موجود.18

ثم التلوث. قاس Llama 3 تلوثه ونشره: 98 % من AGIEval، و95 % من BIG-Bench Hard، و85 % من HellaSwag تتداخل مع training set عبر 8-grams، وبالنسبة إلى MMLU كان التداخل عاليًا إلى درجة أنه «من المستحيل الحصول على تقدير جيد لمكسب الأداء».5 يورد §4 من GPT-3 خلل ترشيح ترك benchmarks داخل البيانات بلا طريق رجعة: «بسبب اعتبارات التكلفة كان من غير العملي إعادة تدريب النموذج».7

المصدرية هي الجزء غير المحسوم. تضمّن The Pile مكوّنًا حجمه 100.96 GiB اسمه Books3 — 12 % من corpus، وبحسب جدول موافقة الورقة نفسها، كتبًا من متتبع torrent خاص؛19 أُزيل من الإنترنت في أغسطس 2023 بعد شكوى حقوق نشر. الوضع القانوني حتى سبتمبر 2026 غير محسوم، والأحكام الأمريكية الثلاثة المستشهد بها كاتجاه تختلف فيما بينها. وجد Alsup أن التدريب على كتب مكتسبة قانونيًا «تحويلي للغاية» بينما اعتبر أن مكتبة بُنيت من نسخ مقرصنة ليست كذلك، وسوّت Anthropic ذلك النصف مقابل $1.5 مليار تغطي 482,460 عملًا، نحو $3,000 لكل منها، وأُقرت في 20 يوليو 2026.20 منح Chhabria حكمًا موجزًا لصالح Meta وهو يكتب أن حكمه «لا يقوم مقام القول إن استخدام Meta لمواد محمية بحقوق النشر لتدريب نماذجها اللغوية قانوني»، بل فقط أن «هؤلاء المدعين قدموا الحجج الخاطئة».21 لاحظ Bibas، في حكمه ضد Ross Intelligence، أن «الذكاء الاصطناعي غير التوليدي فقط معروض أمامي اليوم».22 لم تحكم أي محكمة استئناف أمريكية في السؤال.

الناس يفعلون الأجزاء التي لا تستطيع الخسارة فعلها. أفادت TIME في يناير 2023 أن عاملين يوسمون نصًا سامًا لصالح OpenAI عبر شركة Sama كانوا يتقاضون «بين نحو $1.32 و$2 في الساعة» وهم يقرؤون مقاطع تصف اعتداءً جنسيًا على أطفال وتعذيبًا وإيذاءً للنفس، بينما دفعت OpenAI لـ Sama مبلغ $12.50 في الساعة مقابل العمل؛ وتنازع Sama كلاً من نطاق الأجر والحصة.23 هذا هو الترشيح حول التدريب المسبق لا التدريب المسبق نفسه — لكنه على الفاتورة نفسها، وهناك يجلس إنسان.

الكهرباء حقيقية وغالبًا ما يُساء اقتباسها. أدق رقم منشور هو رقم BLOOM: ‏1,082,990 ساعة GPU، و433 MWh، و24.7 طنًا من مكافئ CO₂ للتشغيل، و50.5 عند احتساب التصنيع والعقد الخاملة؛24 ويضع Patterson وآخرون GPT-3 عند 1,287 MWh و552 طنًا.25 تنبيهان. أفضلية BLOOM هي الشبكة النووية الفرنسية عند 57 g CO₂ لكل kWh لا الكفاءة — فقد استخدم طاقة أكثر من OPT-175B. وأكثر رقم انبعاثات مقتبس في المجال، 626,155 رطلًا لدى Strubell وآخرين لبحث neural architecture search، تبيّن لاحقًا أنه أعلى 88 مرة من الصحيح، لأنه افترض أن البحث جرى بحجم النموذج الكامل بينما جرى على proxy.26 إطار LBNL هو القابل للدفاع عنه: استخدمت مراكز البيانات الأمريكية 192 TWh في 2024، أي 4.7 % من الكهرباء الوطنية — رقم ملتصق بصناعة، لا بتشغيل واحد.27

الخيط الناظم هو ما سمّاه Bender وآخرون documentation debt: «نضع أنفسنا في موقف تكون فيه datasets غير موثقة وكبيرة جدًا بحيث لا يمكن توثيقها بعد وقوع الأمر».28 كل حقيقة أعلاه موجودة لأن شخصًا ما نظر. أما corpora خلف النماذج التي يستخدمها معظم الناس، فلا يستطيع أحد ذلك.

الآن الحساب الذي يريده الجميع، من أربعة مدخلات موثقة، بحيث عندما تصبح قديمة يكون واضحًا ما الذي يجب استبداله.

تسرد صفحة H100 من NVIDIA مقدار 1,979 teraFLOPS من throughput لنوى tensor بنمط BF16 تحت حاشية تقول «with sparsity».29 لا يستخدم أي تشغيل تدريب مسبق sparsity منظّمًا، لذا فالرقم الكثيف نصفه: 989.5 TFLOP/s.

يورد جدول Llama 3 رقم 4 مقدار 38–43 % من BF16 model FLOPs utilisation. خذ 40 %: ‏395.8 TFLOP/s من الحساب المفيد لكل GPU.5

سعر Lambda عند الطلب لعقدة 8×H100 SXM، كما تم الوصول إليه في 2026-09-06: $3.99 لكل GPU-hour، أي $31.92 في الساعة للعقدة.30

نسبة Chinchilla، D=20ND = 20N، تعطي C=6ND=120N2C = 6ND = 120N^2 وبالتالي N=C/120N = \sqrt{C/120}.

budgetH100-hoursFLOPscompute-optimal paramstokensعلى عقدة 8×H100 واحدةGPUs للانتهاء في 90 يومًا
$100253.6e19546 M10.9 B3.1 h1
$1,0002513.6e201.73 B34.5 B31.3 h1
$10,0002,5063.6e215.46 B109 B13 يومًا2
$100,00025,0633.6e2217.3 B345 B131 يومًا12
$1,000,000250,6273.6e2354.6 B1.09 T4 سنوات116
$10,000,0002,506,2663.6e24173 B3.45 T36 سنة1,160
$100,000,00025,062,6573.6e25546 B10.9 T358 سنة11,603

اقرأ العمودين الأخيرين معًا. عند $10,000 تحصل على نموذج بخمسة مليارات parameter على عقدة مؤجرة واحدة خلال أسبوعين. عند $100,000,000 يقول الحساب 546 مليار parameter — واثنا عشر ألف H100 موصولة معًا لثلاثة أشهر، وهذا ليس شيئًا تستأجره ببطاقة ائتمان. بعد نحو $100,000 يتوقف القيد الملزم عن كونه المال ويصبح العنقود.

قبل الوثوق بجدول كهذا، اختبره على تشغيلات نُشرت تكلفتها الحقيقية — llm.c يعيد إنتاج GPT-2 124M في «~90 دقيقة» على عقدة 8×A100 «مقابل نحو $20»، وGPT-2 1.6B في 24 ساعة على عقدة 8×H100 مقابل $672.31

TEXT
$672, against what $672 actually bought (llm.c GPT-2 1.6B, one 8xH100 node, 24 h)
  this table predicts:      168 H100-hours   N = 1.41 B params   D = 28.3 B tokens
  what was actually run:    192 H100-hours   N = 1.558 B params  D = 33.6 B tokens

Llama 3 405B, against Meta's own published GPU-hours
  from the paper's 3.8e25 FLOPs at 40 % MFU:   26.67 M H100-hours
  published in Meta's Llama 3.1 model card:    30.84 M H100-hours    ratio 0.86

كلاهما ضمن نحو 15 %، وهذه تقريبًا الدقة التي يستحقها هذا النوع من التقدير، وأفضل بكثير من الدقة التي يُقتبس بها عادة.

المقارنة الرئيسية، مع التعريفين على الطاولة

رابط إلى القسم: المقارنة الرئيسية، مع التعريفين على الطاولة

أكثر رقم يتكرر في هذا الموضوع هو أن نموذجًا من فئة GPT-2 كلّف نحو $43,000 في 2019 يمكن إعادة إنتاجه اليوم مقابل بضع عشرات من الدولارات. النصف الحديث موثق جيدًا؛ والنصف التاريخي ليس كذلك.

اليوم. README الخاص بـ nanochat لدى Karpathy: «يمكنك تدريب GPT-2 capability LLM خاص بك ... مقابل $48 فقط (~ساعتان من عقدة 8XH100 GPU) ... على spot instance يمكن أن تكون التكلفة الإجمالية أقرب إلى ~$15».32 «GPT-2 capability» هنا دقيقة ومنشورة — التفوق على CORE score لـ GPT-2 البالغ 0.256525 — على leaderboard كان أفضل إدخال فيها بتاريخ 14 مارس 2026 هو 1.65 ساعة. تفترض $48 مبلغ $3 لكل GPU-hour، وهو دون قائمة Lambda البالغة $3.99؛ بسعر القائمة يقترب من $64.

في 2019. لا يوجد مصدر أولي: لم تنشر OpenAI مدة ولا تكلفة. السلسلة تمر عبر The Register في فبراير 2019، التي أوردت «256 Google TPU3 cores» بلا سعر ولا مدة؛ ثم Synced في يونيو 2019، التي لاحظت أن تكلفة العتاد $256 في الساعة على Google Cloud وصرّحت بوضوح أن «OpenAI لم تحدد مدة التدريب». مبلغ $43,008 هو $256 في الساعة مضروبًا في افتراض 168 ساعة لم يُسندها أحد قط.

إذًا العنوان الصادق هو: يمكن اليوم تدريب نموذج يطابق نتيجة benchmark المنشورة لـ GPT-2 بأقل بكثير من $100 على عتاد مؤجر، مقابل تكلفة 2019 لم تُنشر قط ويستند تقديرها الشهير إلى تخمين غير مسند بشأن المدة. الانهيار حقيقي والنصف الحديث قابل لإعادة الإنتاج من أي شخص لديه بطاقة ائتمان؛ أما النسبة فهي حساب على رقم غير موجود. هذا هو حال تكاليف التدريب المنشورة عمومًا. لا تحتوي ورقة GPT-3 على أي مبلغ بالدولار، بل فقط 3.14×10233.14 \times 10^{23} FLOPs في جدول D.1؛7 ولا تحتوي ورقة Llama 3 على أي مبلغ أيضًا.5 كل تكلفة تدريب قرأتها هي تقدير من عدد FLOP، وافتراض عتاد، وافتراض سعر — ويستحق دائمًا أن تسأل: افتراض من؟

ما يعرفه نموذج الأساس، ومتى توقف عن معرفته

رابط إلى القسم: ما يعرفه نموذج الأساس، ومتى توقف عن معرفته

ما يخرج يكون قد رأى corpus ثابتًا جُمّع في لحظة ثابتة، وتنتج عن ذلك خاصيتان.

الأولى هي knowledge cutoff. بعد تاريخ الجمع لا يعرف النموذج شيئًا — ليس «غير متأكد»، بل لا شيء — وسيختلق بطلاقة بدل أن يقول ذلك، لأن قول ذلك لم يكن يومًا سلوكًا دُرّب عليه. تعطي بطاقة نموذج Llama 3.1 ديسمبر 2023؛33 لكل نموذج تاريخ كهذا، وهو خاصية لبيانات التدريب لا للنشر. الالتفاف عليه مشكلة retrieval، وهذا هو الفصل 19.

الثانية أن نموذج الأساس يكمل بدل أن يجيب. أعطه «ما عاصمة فرنسا؟» وقد يكون الاستكمال المعقول سؤالًا آخر، لأن تلك السلسلة تظهر في corpus غالبًا في قائمة تمارين.

مكمّل النص ليس مساعدًا. لا يتبع التعليمات، لأن لا شيء في corpus أخبره أن الطلب ينبغي أن يُطاع بدل أن يُستكمل. ليست لديه فكرة عن محادثة بين مشاركين. سينتج بسعادة الاستكمال الأكثر احتمالًا لـ prompt مؤذٍ، لأن الاحتمال هو الشيء الوحيد الذي حُسّن من أجله.

تحويله إلى شيء يجيب يحتاج مرحلة ثانية تكلف جزءًا من واحد بالمئة من الأولى، وتتكون تقريبًا بالكامل من أن تريه أمثلة على السلوك الذي تريده ثم تقارن أزواجًا من مخرجاته. تلك المرحلة هي مصدر اتباع التعليمات، وchat templates، والرفض، و— وهذا يفاجئ الناس — القدرة على استدعاء أداة. الفصل 11 هو تلك المرحلة: supervised fine-tuning وRLHF وDPO وGRPO، وسؤال ماذا تعني «aligned» ومن يقرر.


يستحق القراءة أيضًا إلى جانب هذا الفصل: build-nanogpt الخاص بـ Karpathy والفيديو المرافق له، اللذان يشرحان إعادة إنتاج GPT-2 كاملة من البداية إلى النهاية بوتيرة لا يستطيع هذا الفصل بلوغها؛ وStanford CS324، Large Language Models، الذي تتعمق محاضراته عن البيانات والأثر البيئي أكثر من القسم أعلاه في مادة يعالجها هذا المقرر مرة واحدة ثم يفوضها.

  1. Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J. and Amodei, D. Scaling Laws for Neural Language Models. arXiv:2001.08361 (2020). قوانين power law الثلاثة هي المعادلات (1.1)–(1.3) في §1.2 والثوابت الكاملة في الملحق A، جدول 5؛ واشتقاق 6N6N في §2.1؛ وأسّات توزيع الحوسبة في جدول 6. لاحظ وجود قانوني حوسبة، αC=0.057\alpha_C = 0.057 عند batch ثابت وαCmin=0.050\alpha_C^{\min} = 0.050 عند batch أمثل؛ وتقول الورقة إن الأخير «ينبغي استخدامه لإجراء التنبؤات». 2

  2. Hoffmann, J., Borgeaud, S., Mensch, A., Buchatskaya, E., Cai, T., Rutherford, E. et al. Training Compute-Optimal Large Language Models. arXiv:2203.15556 (2022). الأسس في جدول 2، والميزانيات المسقطة في جدول 3، ومقارنة Gopher في §4، وعرف عدّ parameters في الملحق F. النثر أسفل جدول 3 يختلف مع جدول 3 نفسه لصفّي 175 B و280 B؛ الجدول هو النسخة التي ينبغي اقتباسها. 2 3 4

  3. Micikevicius, P., Narang, S., Alben, J., Diamos, G., Elsen, E., Garcia, D. et al. Mixed Precision Training. arXiv:1710.03740 (2017), ICLR 2018. أوزان FP32 الرئيسية في §3.1، وloss scaling في §3.2. 2

  4. Rajbhandari, S., Rajbhandari, S., Ruwase, O. and He, Y. ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054 (2019), SC20. حساب 16Ψ16\Psi في §3.1؛ وأرقام الحالة المتبقية لـ activations في §3.2.

  5. Grattafiori, A. et al. (Llama Team, AI @ Meta). The Llama 3 Herd of Models. arXiv:2407.21783 (2024). ميزانية الحوسبة وعدد tokens في §1، وقانون التوسع المعاد ملاءمته في §3.2.1، وإعداد التوازي وMFU في جدول 4، وتحليل التلوث في §5.1.4، وتصريح over-training في §9.1. لا تحتوي الورقة على أرقام بالدولار ولا جدول انبعاثات. 2 3 4 5 6

  6. Stanford CS336, Language Modeling from Scratch. تغطي المحاضرة 2 حساب الموارد، والمحاضرات 5–8 GPUs وkernels والتوازي، والمحاضرتان 9 و11 التوسع، والمحاضرتان 13–14 البيانات. إنه المقرر الذي يفوض إليه هذا الفصل هندسته، وهو عام.

  7. Brown, T. B. et al. Language Models are Few-Shot Learners. arXiv:2005.14165 (2020). الحوسبة في الملحق D، جدول D.1 — الذي يحتوي عمودًا عنوانه حرفيًا «flops per param per token»، وقيمته لكل صفوف GPT-3 هي 6. تحليل التلوث في §4. 2 3

  8. Besiroglu, T., Erdil, E., Barnett, M. and You, J. Chinchilla Scaling: A replication attempt. arXiv:2404.10102 (2024). يعيد بناء بيانات Chinchilla برقمنة الشكل 4، ويعيد الملاءمة، ويورد الأسس المصححة وفواصل أوسع بكثير.

  9. Muennighoff, N., Rush, A. M., Barak, B., Le Scao, T., Piktus, A., Tazi, N., Pyysalo, S., Wolf, T. and Raffel, C. Scaling Data-Constrained Language Models. arXiv:2305.16264 (2023), NeurIPS 2023. نتيجة الأربعة epochs في §6؛ ونصف عمر الستة عشر epoch هو RD15R_D^* \approx 15 الملائم.

  10. Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T. et al. LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 (2023). يذكر §1 حجة تكلفة inference ضد تدريب Chinchilla-optimal.

  11. Sardana, N., Portes, J., Doubov, S. and Frankle, J. Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws. arXiv:2401.00448 (2023), ICML 2024. يحتوي §5 لديهم أيضًا على الثقل المضاد: النماذج المدربة عند نسب token قصوى تستمر في التحسن، لكن «أبطأ مما تتنبأ به قوانين التوسع».

  12. Wei, J., Tay, Y., Bommasani, R., Raffel, C., Zoph, B., Borgeaud, S. et al. Emergent Abilities of Large Language Models. arXiv:2206.07682 (2022), TMLR. التعريف في §2، والأمثلة وعتبات الحوسبة في §3–4 وجدول 1.

  13. Schaeffer, R., Miranda, B. and Koyejo, S. Are Emergent Abilities of Large Language Models a Mirage? arXiv:2304.15004 (2023), NeurIPS 2023 outstanding paper. حجة المقياس في §2، وتحليل BIG-Bench الفوقي في §4، ومثال الرؤية المصطنع في §5.

  14. Common Crawl, August 2026 Crawl Archive Now Available (CC-MAIN-2026-34)، نُشر في 24 أغسطس 2026، وتم الوصول إليه في 2026-09-06. تدعي صفحته الرئيسية نفسها «أكثر من 300 مليار صفحة تمتد 15 عامًا»، «بإجمالي يزيد على 10 بيتابايت» — وهذا رقم للأرشيف كله، لا للزحف الشهري المسعّر هنا.

  15. Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W. and Liu, P. J. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683 (2019), JMLR 21(140). مرشحات C4 في §2.2. تعطي الورقة الأحجام بالبايتات، لا tokens؛ ورقم 156 مليار token المنسوب إليها على نطاق واسع يأتي من Dodge وآخرين أدناه.

  16. Dodge, J., Sap, M., Marasović, A., Agnew, W., Ilharco, G., Groeneveld, D., Mitchell, M. and Gardner, M. Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758 (2021), EMNLP 2021. معدلات إزالة اللهجات في §5.3؛ وتلوث benchmarks في C4 في §4.2.

  17. Lee, K., Ippolito, D., Nystrom, A., Zhang, C., Eck, D., Callison-Burch, C. and Carlini, N. Deduplicating Training Data Makes Language Models Better. arXiv:2107.06499 (2021), ACL 2022. التكرارات 61,036 في الحاشية 1؛ وأرقام الحفظ في §6.2، جدول 4، وهي نسب مئوية من tokens المولدة وفق معيار exact-match من 50 token.

  18. Penedo, G., Kydlíček, H., Ben Allal, L., Lozhkov, A., Mitchell, M., Raffel, C., Von Werra, L. and Wolf, T. The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale. arXiv:2406.17557 (2024), NeurIPS 2024 Datasets and Benchmarks. نتيجة deduplication في §3.4. نمت dataset المنشورة منذ ذلك الحين إلى ما بعد 15 تريليون token في الورقة.

  19. Gao, L., Biderman, S., Black, S. et al. The Pile: An 800GB Dataset of Diverse Text for Language Modeling. arXiv:2101.00027 (2020). Books3 في §2.3 وجدول 1؛ وجدول الموافقة هو جدول 5. يبلغ corpus ‏825.18 GiB، حتى العنوان نفسه تقريب إلى الأسفل.

  20. Bartz v. Anthropic, No. 4:24-cv-05417 (N.D. Cal.). أمر fair use في 23 يونيو 2025 (Dkt. 231)؛ واعتماد الفئة في 17 يوليو 2025؛ والموافقة والحكم النهائيان في 20 يوليو 2026 (Dkt. 680). التسوية تُبرئ المدخلات الماضية فقط، لا المخرجات ولا السلوك المستقبلي.

  21. Kadrey v. Meta, No. 3:23-cv-03417-VC (N.D. Cal.), summary judgment 25 يونيو 2025 (Dkt. 598). لاحظ أن دعوى التوزيع عبر torrenting لم تُحسم وما زالت قائمة.

  22. Thomson Reuters v. ROSS Intelligence, No. 1:20-cv-00613-SB (D. Del.), رأي منقح في 11 فبراير 2025 (Dkt. 770), Bibas J. قيد الاستئناف التمهيدي أمام الدائرة الثالثة (No. 25-2153)، نوقش في 11 يونيو 2026، ولم يُحسم وقت الكتابة.

  23. Perrigo, B. Exclusive: OpenAI Used Kenyan Workers on Less Than $2 Per Hour to Make ChatGPT Less Toxic. TIME، 18 يناير 2023. مبلغ $2 هو سقف للمراجعين الكبار الذين حققوا كل هدف؛ وكان المعلّمون المبتدئون، وهم الأغلبية، يتقاضون $1.32. رد Sama، المقتبس في المقالة نفسها، يعطي $1.46–$3.74 وحصة أدنى.

  24. Luccioni, A. S., Viguier, S. and Ligozat, A.-L. Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language Model. arXiv:2211.02001 (2022), JMLR 24(253). الجدولان 1 و3.

  25. Patterson, D., Gonzalez, J., Le, Q., Liang, C., Munguia, L.-M., Rothchild, D., So, D., Texier, M. and Dean, J. Carbon Emissions and Large Neural Network Training. arXiv:2104.10350 (2021). أرقام GPT-3 في جدول 4؛ وتصحيح تقدير NAS في §4.1.

  26. Strubell, E., Ganesh, A. and McCallum, A. Energy and Policy Considerations for Deep Learning in NLP. arXiv:1906.02243 (2019), ACL 2019. تستحق القراءة بدقة بسبب ما حدث لأكثر أرقامها اقتباسًا: الورقة حذرة، وتذكر استقراءها، ومع ذلك كانت مخطئة برتبتين من المقدار في السطر الوحيد الذي كرره الجميع.

  27. Smith, S. J., Hubbard, A., Newkirk, A., Ganeshalingam, M., Holecek, B., Sartor, D., Mills, M. and Shehabi, A. United States Data Center Energy Usage Report: 2025 Update. LBNL-2001758 (18 يونيو 2026). يراجع هذا التقرير السلسلة التاريخية نزولًا مقارنة بتقرير 2024 واسع الاقتباس؛ إذا كنت تقتبس رقم 176 TWh لعام 2023، فأنت تقتبس النسخة التي تجاوزها التحديث.

  28. Bender, E. M., Gebru, T., McMillan-Major, A. and Shmitchell, S. On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? FAccT '21, pp. 610–623. DOI 10.1145/3442188.3445922. «Documentation debt» في §4.4. لاحظ أن أرقام الكربون في الورقة نفسها مقتبسة من Strubell وآخرين وترث التصحيح أعلاه — وهذا توضيح لحجتها لا نقض لها.

  29. NVIDIA. NVIDIA H100 Tensor Core GPU product page, nvidia.com/en-us/data-center/h100/ (تم الوصول في 2026-09-06). كل صفوف tensor-core على تلك الصفحة باستثناء FP64 تحمل الحاشية «with sparsity»؛ ورقم BF16 الكثيف المستخدم هنا هو نصف 1,979 TFLOPS المنشورة.

  30. Lambda. GPU Cloud pricing, lambda.ai/pricing (تم الوصول في 2026-09-06). عند الطلب، لكل GPU في الساعة، قبل الضريبة. ستتقادم الأسعار في هذا القسم أسرع من أي شيء آخر في هذا المقرر؛ الحساب حولها لن يتقادم.

  31. Karpathy, A. karpathy/llm.c, discussion #481, Reproducing GPT-2 (124M) in llm.c in 90 minutes for $20 (28 مايو 2024)، وdiscussion #677، Let's reproduce GPT-2 (1.6B): one 8XH100 node, 24 hours, $672, in llm.c (11 يوليو 2024).

  32. Karpathy, A. karpathy/nanochat, README and "time to GPT-2" leaderboard (تم الوصول في 2026-09-06). رقم $48 وتعريف CORE-score لعبارة «GPT-2 capability» موجودان كلاهما في README؛ ويقول speedrun.sh الخاص بالمستودع نفسه «حوالي 1.5 ساعة»، لذا عامل رقم الساعتين كتقريب.

  33. Meta. Llama 3.1 model card, models/llama3_1/MODEL_CARD.md in meta-llama/llama-models (تم الوصول في 2026-09-06). مصدر 30.84 M H100-hours لنموذج 405 B، والإجمالي 39.3 M، ورقم 11,390 tCO2eq القائم على الموقع، وdata cutoff في ديسمبر 2023.


من إعداد

David Vicente Campos

مؤسس NeuraLIA Labs وشريك مؤسس MyRealFood

أنا مهندس حاسوب، خرّيج جامعة ليون الإسبانية. شاركت في تأسيس MyRealFood، حيث بنيت، بصفتي المدير التقني، التطبيق الذي استخدمه ملايين الأشخاص ليأكلوا بشكل أصحّ، وأسست NeuraLIA Labs، حيث أبني منتجات ذكاء اصطناعي. هنا أكتب عمّا كان عليّ فهمه على طول الطريق، بالطريقة التي تمنّيت لو شرحه لي أحدهم بها.

المزيد عن الكاتب

الناشر: NeuraLIA Labs.

احصل على المنشورات الجديدة في بريدك

أخبار الذكاء الاصطناعي وأدلة وتحديثات المنتج — رسالة قصيرة عندما ننشر ما يستحق وقتك.

فهرس الدورة

Abstract software decision engine with branching paths, probability nodes, and glowing gates.
jevقراءة 11 دقيقة

نموذج Jev للذكاء الاصطناعي صُمم للقرارات لا للنثر

يلفت Jev من TypeSafe AI الانتباه لأنه يتعامل مع ذكاء البرمجيات بوصفه مسألة احتمالات: اختر الفرع الصحيح، وأرفق الثقة، وتجنب الدفع لنموذج LLM ليكتب نصًا عندما تحتاج الشيفرة إلى قرار.

هل أنت مستعد لتترك الاختيار لـ LIA؟

ابنِ بكل نماذج الذكاء الاصطناعي في مكان واحد — ابدأ مجانًا اليوم.