پیشآموزش یک LLM: داده، محاسبه، قوانین مقیاسپذیری و هزینه
بیست مدل روی GPU لپتاپ برای سنجش قانون مقیاسپذیری، و برآورد 6ND compute با شمارنده واقعی FLOP بررسی شد.
در این صفحه
فصل 9 با یک بلوک transformer تمام شد که آموزش میبیند. چندتا از آنها را روی هم بگذارید، زیان next-token فصل 8 را به خروجی وصل کنید، و دیگر چیزی برای اختراع باقی نمیماند. هرچه میماند خرید است.
این تغییر بزرگتر از چیزی است که به نظر میرسد. هر فصل تا اینجا میپرسید آیا یاد میگیرد؟ — پرسشی بلهیاخیر که یک لپتاپ در ده دقیقه جوابش را میدهد. این فصل پرسشی میپرسد که پول در آن است: با مقدار ثابتی از حساب، بهترین مدلی که میتوانم بخرم چیست؟ پاسخ یک فرمول است، و در 2018 برای هیچکس بدیهی نبود.
اینجا همان پرسش با اندازهگیری، روی یک GPU لپتاپ، پاسخ داده شده است. بیست مدل، از 98,624 تا 15 میلیون پارامتر، از صفر روی 174 میلیون token ویکیپدیا آموزش داده شدند — یک واژگان BPE با 2,048 token که همانطور آموزش داده شد که فصل 7 یکی را آموزش میدهد، با transformer فصل 9. هر اجرا دقیقاً یکی از سه بودجه compute را گرفت و حتی یک عملیات بیشتر نه، پس مدل بزرگتر ناچاراً متن کمتری میخواند. بهترین زیان روی داده نگهداشتهشده در هر بودجه:
budget C (FLOPs) best loss reached by a model of
1.00e13 5.3531 98,624 params
3.16e13 4.8638 98,624 params
1.00e14 4.3383 295,808 params
fitted: L = (Cc / C)^0.0913 over one decade of computeده برابر حساب، 19٪ از زیان کم میکند، و سه نقطه روی خطی مستقیم در مقیاس log-log مینشینند. هیچچیز در نه فصل اول این را پیشبینی نمیکند. پشت آن قضیهای نیست — یک نظم تجربی است، با توانی متفاوت، که در ده مرتبه بزرگی میان این لپتاپ و یک datacentre برقرار میماند، و همان مشاهدهای است که یک صنعت را قانع کرد به اندازه GDP یک کشور کوچک برای GPU خرج کند.
pretraining چیست، و چه چیز تازهای در آن هست
لینک به بخش: pretraining چیست، و چه چیز تازهای در آن هستهیچچیز در هدف تغییر نمیکند. مدل همچنان token بعدی را پیشبینی میکند، زیان همچنان cross-entropy فصل 4 است که روی تجزیه فصل 8 اعمال شده، optimiser همچنان AdamW فصل 6 است. pretraining الگوریتم تازهای نیست؛ همان الگوریتم است که روی corpus آنقدر بزرگی اجرا میشود که باید برای اجرا بودجهبندی کرد. دو چیز این را ممکن میکند: labelها رایگاناند، چون هدف برای موقعیت همان token در است و از قبل در متن وجود دارد؛ و بخش آخر فصل 6 ایراد را برداشت، چون مدلی با پارامترهایی بسیار بیشتر از آنچه قواعد کلاسیک اجازه میدهند فرو نمیپاشد، بهتر میشود. خروجی یک مدل پایه است — چیزی که متن را ادامه میدهد، نه اینکه پاسخ بدهد.
شمردن compute پیش از خرج کردن آن: 6ND
لینک به بخش: شمردن compute پیش از خرج کردن آن: 6NDپیش از آنکه بتوان برای هرکدام از اینها بودجه گذاشت، باید شمرده شود، و این حوزه آن را با یک فرمول میشمارد:
که در آن تعداد پارامترها، tokenهای آموزش و کل عملیات floating-point است. Kaplan و همکاران آن را در دو گام به دست میآورند.1 Forward: 2 FLOP برای هر پارامتر در هر token، چون هر پارامتر در یک ضرب ماتریسی یکبار برای هر token استفاده میشود، در یک ضرب و یک جمع. Backward: دو برابر forward، چون گذر backward فصل 5 در هر لایه دو gradient محاسبه میکند — نسبت به ورودیهای لایه، تا سیگنال به حرکت ادامه دهد، و نسبت به وزنهای آن — که هرکدام ضرب ماتریسی هماندازه forward است، پس .
کل استنتاج همین است، و ارزش دارد بهجای باور کردن، آن را بررسی کنیم. PyTorch یک شمارنده واقعی FLOP دارد، torch.utils.flop_counter.FlopCounterMode، که هر عملیاتی را که مدل dispatch میکند intercept میکند و کار واقعی را جمع میزند. آن را در چهار مرتبه بزرگی اجرا کنید، بزرگترین مورد روی دستگاه meta، که شکلها را تخصیص میدهد و حافظهای نمیگیرد:
from torch.utils.flop_counter import FlopCounterMode
counter = FlopCounterMode(display=False)
with counter:
loss = model(x, targets)[1]
loss.backward()
measured = counter.get_total_flops()
print(measured / (6 * n_params * n_tokens))| پیکربندی | بدون embeddingها | کل | اندازهگیریشده، fwd+bwd | ÷ (کل ) | ÷ (بدون emb.) | fwd+bwd ÷ fwd |
|---|---|---|---|---|---|---|
| 128، 4 لایه، 256 | 788,736 | 7,254,400 | 4.60e10 | 1.031 | 9.485 | 3.000 |
| 512، 8 لایه، 256 | 25,183,232 | 51,045,888 | 3.26e11 | 1.038 | 2.104 | 3.000 |
| 768، 12 لایه، 1024 | 84,973,056 | 124,356,864 | 1.75e12 | 1.145 | 1.676 | 3.000 |
| 1600، 48 لایه، 1024 | 1,474,870,400 | 1,556,920,000 | 2.10e13 | 1.100 | 1.161 | 3.000 |
| 4096، 32 لایه، 2048 | 6,442,983,424 | 6,582,444,032 | 8.74e13 | 1.080 | 1.104 | 3.000 |
| 8192، 80 لایه، 8192 | 64,427,147,264 | 65,544,929,280 | 3.75e15 | 1.163 | 1.183 | 3.000 |
نسبت forward+backward به forward برابر 3.000 است، دقیقاً، در هر مقیاس: نه تقریبی که تصادفاً خوب از آب درآمده، بلکه هویت حسابی بالا که توسط شمارندهای که هیچچیز از استنتاج نمیداند به صورت عددی گرد برگردانده شده است.
سپس کل اندازهگیریشده بین 3٪ تا 17٪ بالاتر از مینشیند، وقتی ماتریسهای embedding را هم بشمارد — و این بند مهم است، چون دو مقاله بنیانگذار را متفاوت میشمارند. Kaplan «همه embeddingهای واژگان و موقعیتی» را کنار میگذارد چون این کار «قوانین مقیاسپذیری بهمراتب تمیزتری تولید میکند» (§1.3)؛ Appendix F در Chinchilla میگوید «ما ماتریسهای embedding را نیز در شمار کل پارامترها حساب میکنیم».2 برای واژگان عریض و بعد پنهان باریک، این دو با ضریب نه فرق دارند، همانطور که ردیف اول نشان میدهد.
شکاف باقیمانده همان چیزی است که عمداً حذف میکند: امتیازهای attention. معادله (2.2) Kaplan هزینه forward را به صورت مینویسد و جمله دوم را حذف میکند چون — در 2020 امن بود، امروز کمتر امن است، و دلیل اینکه نسبت با رشد رو به بالا میلغزد — و به همین دلیل است که دو ردیف اینجا مشترک 1,024 دارند و نسبت وقتی از 768 به 1,600 میرود کاهش مییابد، از 1.145 به 1.100. این همان هزینه است که فصل 9 معرفی کرد و فصل 16 آن را به قیمت تبدیل میکند.
حافظه: واقعاً چه چیزی باید جا شود
لینک به بخش: حافظه: واقعاً چه چیزی باید جا شودCompute تعیین میکند اجرا چقدر طول میکشد؛ حافظه تعیین میکند اصلاً میتواند شروع شود یا نه. با AdamW ساده fp32 آموزش بدهید و هر پارامتر چهار عدد با خود دارد: وزن، gradient آن، و میانگین جاری و واریانس در Adam — همان دو میانگینی که در فصل 6 دستی ساختیم. چهار عدد، هرکدام چهار بایت، یعنی 16 بایت برای هر پارامتر، پیش از حتی یک activation. اندازهگیریشده روی GPU لپتاپ 8 GB، با گرفتن تخصیص مقیم در نقطهای از step که هیچ graph زندهای نیست:
| مدل | واژگان | batch | پیشبینیشده | مقیم اندازهگیریشده | اوج در یک step | تفاوت | |
|---|---|---|---|---|---|---|---|
| 512، 8 لایه | 50,257 | 8 | 51,045,888 | 779 MB | 801 MB | 2,500 MB | 1,699 MB |
| 512، 8 لایه | 4,096 | 8 | 27,411,456 | 418 MB | 426 MB | 1,043 MB | 617 MB |
| 256، 6 لایه | 4,096 | 8 | 5,839,360 | 89 MB | 89 MB | 382 MB | 293 MB |
| 256، 6 لایه | 4,096 | 32 | 5,839,360 | 89 MB | 89 MB | 1,259 MB | 1,170 MB |
| 256، 6 لایه | 4,096 | 128 | 5,839,360 | 89 MB | 89 MB | 4,771 MB | 4,681 MB |
پیشبینی و اندازهگیری با اختلافی کمتر از 3٪ توافق دارند. شگفتی ستون آخر است: activationها مدل را کوچک جلوه میدهند. همان مدل 5.8 میلیون پارامتری که 89 MB حالت پایدار لازم دارد، در batch برابر 128 به 4,681 MB activation نیاز دارد — پنجاهودو برابر خود مدل — و بخش زیادی از آن اصلاً transformer نیست. logits است، یک بردار به اندازه واژگان برای هر token با چهار بایت برای هر درایه: 512 MB در ردیف آخر، 393 MB در ردیف اول. اندازه واژگان در فصل 7 انتخاب شد، و هنوز دارد تعیین میکند چه چیزی روی کارت جا میشود.
اینکه کدام جمله غالب میشود به شکل اجرا بستگی دارد، و به همین دلیل Micikevicius و همکاران میگویند حافظه «تحت سلطه activationهاست»3 درحالیکه ZeRO میگوید یک مدل 1.5 میلیارد پارامتری «حداقل 24 GB» فقط برای حالتهای مدل لازم دارد.4 ZeRO از مسیر دیگری به همان 16 بایت میرسد — برای وزنهای fp16، برای gradientهای fp16، هرکدام برای وزنهای master در fp32 و دو moment آدم — که برای 70 میلیارد پارامتر 1.12 ترابایت میشود، به اندازه چهارده GPU هشتاد گیگابایتی پیش از حتی یک activation.
موازیسازی، در یک پاراگراف و یک واگذاری
لینک به بخش: موازیسازی، در یک پاراگراف و یک واگذاریهیچکدام از آنها در مقیاس مرزی روی یک دستگاه جا نمیشود، پس اجرا همزمان به چهار شکل شکسته میشود. Data parallelism یک کپی از مدل را روی هر GPU میگذارد و gradientها را میانگین میگیرد — حالت پیشفرض، و همان که ZeRO با نگه نداشتن کپیهای زائد از حالت optimiser بهترش میکند. Tensor parallelism ماتریسهای منفرد را میان دستگاهها تقسیم میکند. Pipeline parallelism به هر دستگاه گروهی پیوسته از لایهها میدهد. Context parallelism خود توالی را میشکند، و فقط وقتی لازم میشود که آنقدر بلند باشد که جمله attention غالب شود. جدول 4 در Llama 3 هر چهار را با هم فهرست میکند: tensor برابر 8، context تا 16، pipeline برابر 16، data تا 128، روی 16,384 GPU از نوع H100.5 این دوره دربارهاش همینقدر خواهد گفت؛ مهندسی آموزش توزیعشده یک ترم مستقل است، و Stanford CS336 همان ترم است، درسهای 5 تا 8، همراه با کد.6 آنچه از این واگذاری باقی میماند یک عدد است، model FLOPs utilisation — کسری از حساب اوج GPU که یک اجرای واقعی به آن میرسد — و همین عدد است که مرتب را به زمان ساعت دیواری و بنابراین پول تبدیل میکند.
Kaplan، و شرطی که صنعت بست
لینک به بخش: Kaplan، و شرطی که صنعت بستدر ژانویه 2020، Kaplan و همکاران شبکهای از transformerها را آموزش دادند و دریافتند زیان آزمون در هرکدام از سه منبع، در بیش از شش مرتبه بزرگی، از power law پیروی میکند.1 §1.2 آنها سه قانون fitted میدهد:
با همراهانی مثل برای داده و برای compute تخصیصیافته بهینه. ثابتها جهانی نیستند، و خود مقاله هم میگوید: «مقادیر عددی دقیق ، و به اندازه واژگان و tokenization بستگی دارد و بنابراین معنای بنیادی ندارد.»
توانها کوچکاند: ده برابر پارامتر، ضریب از زیان باقیمانده کم میکند. این تقریباً هیچ به نظر میرسد، و همین مهمترین واقعیت اینجاست — بازدهها افتضاحاند و هرگز متوقف نمیشوند. power law با توان کوچک وعده میدهد که مرتبه بزرگی بعدی کمک خواهد کرد، کمتر از قبلی، تا ابد. خریدن compute از قمار بودن خارج میشود و به خریدی با نرخ تبدیل منتشرشده تبدیل میشود؛ دقیقاً همان استدلالی که سرمایه را آزاد کرد.
بعد نسخه تجویزی آمد، و اینجا جایی است که مقاله به شکلی غلط بود که برای صنعت پول زیادی هزینه داشت. جدول 6 در Kaplan مقادیر و را میدهد: ده برابر compute یعنی مدلی 5.4 برابر بزرگتر که فقط 1.9 برابر متن بیشتری میبیند. چکیده صریح است — «آموزش بهینه از نظر compute مستلزم آموزش مدلهای بسیار بزرگ روی مقدار نسبتاً modestی از داده و توقف بسیار پیش از همگرایی است.» حوزه دقیقاً همین کار را کرد: GPT-3 با 175 میلیارد پارامتر روی 300 میلیارد token،7 Gopher با 280 میلیارد روی 300 میلیارد، Megatron-Turing NLG با 530 میلیارد روی 270 میلیارد.2 نیم token تا دو token برای هر پارامتر، همهجا.
Chinchilla، و اینکه sweep بالا چه چیزی را اندازه میگرفت
لینک به بخش: Chinchilla، و اینکه sweep بالا چه چیزی را اندازه میگرفتدر مارس 2022، Hoffmann و همکاران بیش از 400 مدل از 70 میلیون تا 16 میلیارد پارامتر را آموزش دادند و از سه مسیر مستقل به نتیجه مخالف رسیدند.2 جدول 2 آنها توان را در برابر 0.50، 0.49 و 0.46 گزارش میکند، در برابر 0.73 در Kaplan. ساده بگوییم: اندازه مدل و داده آموزش باید به نسبت برابر رشد کنند.
رویکرد دوم آنها همان چیزی است که sweep ابتدای این فصل در یکمیلیونم مقیاس بازتولید کرد: بودجه را ثابت کن، اندازههای زیادی را دقیقاً با همان بودجه آموزش بده، زیان نهایی را در برابر اندازه مدل رسم کن.
| پارامترها | |||
|---|---|---|---|
| 98,624 | 5.3531 (171) | 4.8638 (542) | — |
| 150,320 | 5.4636 (74) | — | — |
| 194,208 | 5.5041 (44) | 4.8730 (140) | 4.4040 (442) |
| 295,808 | 5.5550 (19) | 4.9029 (60) | 4.3383 (190) |
| 665,280 | 5.7849 (3.8) | 5.1254 (12) | 4.4192 (38) |
| 1,280,768 | 5.8174 (1.0) | 5.1751 (3.2) | 4.5003 (10) |
| 3,101,568 | — | 5.4686 (0.5) | 4.7768 (1.7) |
| 5,315,072 | — | 5.5894 (0.2) | 4.8514 (0.6) |
| 15,053,568 | — | — | 5.3534 (0.1) |
زیان held-out بر حسب nat برای هر token، token برای هر پارامتر داخل پرانتز، پررنگ برای بهترین مدل در هر بودجه؛ خط تیره نقطهای است که اجرا نشده، چون بودجه متن بیشتری از corpus میخواست یا اندازه بیرون از محدوده sweep آنجا بود.
یک ستون را از بالا به پایین بخوانید: زیان کم میشود، به کف میرسد و دوباره بالا میرود. یک مدل میتواند برای بودجهاش دقیقاً به همان آسانی که بیش از حد کوچک است، بیش از حد بزرگ هم باشد — در جریمه انتخاب 665,280 پارامتر بهجای 295,808 برابر 0.08 nat است، که روی envelope fitted بالا همان زیانی است که یک مدل درستاندازه با 18٪ compute کمتر به آن میرسد. انتخاب شکل غلط یکپنجم بودجه را دور میریزد. این Figure 3 در Chinchilla است، در یک بعدازظهر روی یک GPU بهجای چهارصد مدل.
حالا افقی بخوانید. در بهترین مدل کوچکترین مدلی است که sweep شده؛ در برابر 295,808 پارامتر است، از دو طرف bracket شده. بهینه با رشد بودجه به راست حرکت میکند، و کل محتوای اصلاح همین است. رویکرد سوم مقاله را fit کنید — سطح روی همه اجراها — و تحت قید کمینه کنید:
L(N, D) = 24.7 / N^0.195 + 46.8 / D^0.169 (E fits to ~0; see below)
implied N_opt ∝ C^0.464
compare Chinchilla 0.46-0.50 · Besiroglu 0.513 · Kaplan 0.730.46، از یک لپتاپ، در برابر 0.73 در Kaplan. توافق تا سه رقم از fit سهبودجهای شانس است؛ توافق تا رقم اول شانس نیست. توان سفر میکند — ثابت نه، چون نسبت token به پارامتر در این بهینهها 170 تا 540 است، نه 20. سه دلیل، همه آموزنده. به صفر fit میشود چون در زیانی بالاتر از 4 nat اجرا هیچجا نزدیک کف entropy که بر fit Chinchilla غالب است نیست. batch size و learning rate بهجای tune شدن برای هر نقطه ثابت ماندهاند، که هر اجرایی را که step کمتری میگیرد زمین میزند — و آنها مدلهای بزرگاند: در FLOP، یک مدل 1.28 میلیون پارامتری در کل 159 step optimiser میگیرد، بسیار کمتر از چند هزار stepی که جمله در Kaplan میگوید هر مدلی لازم دارد. قانون مقیاسپذیری درون یک regime fit میشود، و این یکی شش مرتبه بزرگی پایینتر از Chinchilla است.
از همینجاست چکیده مقاله: «مدلهای زبانی بزرگ فعلی بهطور معناداری undertrained هستند». Chinchilla نمایش آن است — 70 میلیارد پارامتر روی 1.4 تریلیون token، با همان compute کل Gopher با 280 میلیارد روی 300 میلیارد، و بهتر از آن در 51 مورد از 57 وظیفه MMLU، 67.5٪ در برابر 60٪.2 چهار برابر کوچکتر، چهار و نیم برابر متن بیشتر، همان پول، مدل بهتر.
دو نکته درباره آن نسبت مشهور. «بیست token برای هر پارامتر» جملهای در مقاله نیست، مقاله فقط میگوید «برای هر دوبرابرشدن اندازه مدل، تعداد tokenهای آموزش نیز باید دو برابر شود»؛ عدد 20 استنباطی از جدول 3 و از خود Chinchilla با 70 B روی 1.4 T است. و دقتش از آنچه منتشر شده بدتر است: Besiroglu و همکاران دادهها را از digitization شکل 4 دوباره fit کردند، دیدند پارامترهای اصلی «با داده بازسازیشده بد fit میشوند» و بازهها «با توجه به تعداد نقاط داده نامحتمل تنگاند»، و دامنه صادقانه را «بین 4 و 40» token برای هر پارامتر گذاشتند.8
یک جزئیات از روش Chinchilla وعدهای را که فصل 1 درباره learning-rate schedule داده بود ادا میکند. cosine schedule باید با بودجه token جفت شود. مدلی که 10 میلیون token خواهد دید باید learning rate خود را در 10 میلیون token به صفر decay کند؛ اگر scheduleای به اندازه 100 میلیون به آن بدهید و زود متوقفش کنید، دارید زیانی را وسط فرود، با نرخی بسیار بیش از حد بالا، میخوانید. Chinchilla هر مدل را در چهار طول چرخه آموزش میدهد تا دقیقاً همین را کنترل کند؛ sweep بالا به همین دلیل schedule خود را از بودجه میگیرد.
قوانین مقیاسپذیری چه وعدهای نمیدهند
لینک به بخش: قوانین مقیاسپذیری چه وعدهای نمیدهندآنها مفیدترین نتیجه تجربی این حوزهاند و مرتب بیشازحد فروخته میشوند. چهار حد.
آنها زیان را پیشبینی میکنند، نه قابلیت را. سمت چپ cross-entropy روی متن held-out است. هیچچیز در این مقالهها مجوز ادعایی درباره اینکه مدل SQL درست خواهد نوشت، درخواست آسیبزا را رد خواهد کرد یا از tool استفاده خواهد کرد نمیدهد. این دوباره درس فصل 5 است: پیشبینی زیان پیشبینی رفتاری نیست که بابتش پول میدهید.
آنها fit شدهاند، نه derived. هیچ نظریهای تولید نمیکند. ثابتها با tokenizer حرکت میکنند — به همین دلیل مقایسه perplexity میان دو tokenizer بیمعناست، همانطور که فصل 8 توضیح داد — و با ترکیب داده، معماری و optimiser. هر قانون منتشرشده قانون setupی است که آن را تولید کرده، و به همین دلیل Meta پیش از Llama 3 قانون خودش را دوباره fit کرد.5
آنها برای هر step یک token تازه فرض میکنند، که بیسروصدا corpus نامتناهی را فرض میگیرد. Muennighoff و همکاران اندازه گرفتند وقتی corpus تمام میشود چه رخ میدهد: تا چهار epoch داده تکراری تقریباً هیچ هزینهای ندارد — یک مدل 8.7 میلیارد پارامتری روی 44 میلیارد token یکتا که چهار بار دیده شدند، فقط «0.5٪ زیان اعتبارسنجی بالاتر» از همان مدل روی 178 میلیارد token یکتا تمام شد — درحالیکه بعد از حدود شانزده epoch، compute اضافی دیگر چیزی نمیخرد.9
و دیگر هیچکس compute-optimal آموزش نمیدهد. Chinchilla هزینه آموزش را کمینه میکند؛ مدل deployشده سپس برای هر token تولیدشده، تا ابد، تقریباً FLOP میپردازد. LLaMA 1 صریح گفت: «با داشتن سطح هدفی از عملکرد، مدل ترجیحی سریعترین برای آموزش نیست، بلکه سریعترین در inference است».10 Sardana و همکاران آن را با کمینهکردن رسمی کردند، و دریافتند هرکس انتظار یک میلیارد درخواست دارد باید «کوچکتر و طولانیتر از Chinchilla-optimal» آموزش دهد.11 §9.1 در Llama 3 موافق است: مدلهای کوچک آن «بسیار فراتر از نقطه آموزش compute optimal آموزش میبینند، و عملاً compute آموزش را با کارایی inference معاوضه میکنند».5 نسبت منسوخ نیست؛ به پرسشی جواب میدهد که دیگر همان پرسش مطرحشده نیست.
تواناییهای emergent، و بحث اینکه آیا واقعیاند
لینک به بخش: تواناییهای emergent، و بحث اینکه آیا واقعیاندزیان نرم پایین میآید. امتیازهای benchmark گاهی نه. Wei و همکاران نمونههایی گرد آوردند که در آنها یک task در چندین مرتبه بزرگی از compute آموزش در حد شانس میماند و سپس میپرد — حساب سهرقمی در GPT-3 حوالی FLOP ظاهر میشود، MMLU میان و از حد حدس بالاتر میرود — و الگو را نامگذاری کردند: «یک توانایی emergent است اگر در مدلهای کوچکتر حاضر نباشد اما در مدلهای بزرگتر حاضر باشد».12 اگر این یک ویژگی واقعی باشد، extrapolate کردن از آزمایشهای ارزان ناامن است، چون قابلیتی که میخرید شاید در هیچ مقیاسی که توان آزمودنش را دارید وجود نداشته باشد.
Schaeffer، Miranda و Koyejo استدلال کردند که بیشتر آن artifact اندازهگیری است، و سازوکارش حساب است.13 زیان per-token نرم پایین میآید، پس احتمال درستبودن یک token، ، تدریجاً بهتر میشود. مدل را با exact string match روی پاسخی -tokenی امتیاز بدهید و آن احتمال را به توان میرسانید — منحنی نرم وقتی به توان بزرگ برسد شبیه پرتگاه میشود. روی همان خروجیها metricی بگذارید که بهجای طلبکردن همه آنها، tokenها را میشمارد، و «عملکرد خانواده با افزایش scale، نرم، پیوسته و پیشبینیپذیر بهتر میشود».
عدد مهم در audit آنها این است — «از 39 metric ترجیحی در BIG-Bench، حداکثر 5 مورد emergence نشان میدهند»، با دو metric ناپیوسته که بیش از 92٪ موارد ادعایی را توضیح میدهند — و هشدارشان هم مهم است: «هیچچیز در این مقاله نباید به این معنی تفسیر شود که مدلهای زبانی بزرگ نمیتوانند تواناییهای emergent نشان دهند». پرش در نمودار تا وقتی خلافش نشان داده نشده، شاهدی درباره metric است. فصل 29 جایی است که این مشکل شما میشود، چون انتخاب metric با hard-cutoff تصمیمی است که بیآنکه متوجه شوید خواهید گرفت.
داده از کجا میآید
لینک به بخش: داده از کجا میآیدcorpus بخشی از اجرای pretraining است که معادلهای به آن وصل نیست، و بیشتر تصمیمهای پیامددار همانجاست. ماده خام یک web crawl است: آرشیو August 2026 در Common Crawl «2.14 میلیارد صفحه وب یا 360 TiB محتوای فشردهنشده» دارد، یک ماه از آن، رایگان برای دانلود.14 تقریباً هیچکدام همانطور که هست قابل استفاده نیست. مقاله T5 میگوید crawl «تا حد زیادی از متنهای بیمعنا یا boiler-plate مثل منوها، پیامهای خطا، یا متن تکراری تشکیل شده»، و pipeline C4 که معرفی کرد فهرستی از heuristicهای زمخت است — فقط خطهایی را نگه دار که به نشانه punctuation پایانی ختم میشوند، صفحههای کمتر از سه جمله را حذف کن، هر صفحهای را که شامل آکولاد یا واژهای از یک فهرست عمومی دشنامهاست حذف کن — و بیست ترابایت متن ماهانه را به حدود 750 GB تبدیل میکند.15
زمخت، دقیقاً کلمه درست است. Dodge و همکاران بررسی کردند این فیلترها چه چیزی را حذف میکنند و دیدند blocklist دشنامها 42٪ از سندهای African-American English و 32٪ از Hispanic-aligned English را حذف میکند، در برابر 6.2٪ از White-aligned English، و corpusی میگذارد که 97.8٪ از دسته آخر است.16 قانونی که درباره dialect نظری نداشت، عملاً نظر داشت.
بعد deduplication، که خانهداری نیست: Lee و همکاران جملهای 61واژهای یافتند که در C4، 61,036 بار تکرار شده بود، و نشان دادند deduplication نرخ اینکه مدلها «متن حفظشده را بیرون بدهند» دهبرابر کم میکند، از 1.9٪ tokenهای تولیدشده به 0.19٪.17 بااینحال، بیشتر همیشه بهتر نیست — تیم FineWeb در 96 crawl بهصورت global deduplicate کرد، 4 تریلیون token گرفت و هیچ بهبود قابل اندازهگیری ندید، سپس هر crawl را جداگانه deduplicate کرد، 20 تریلیون گرفت و با بهترین corpus موجود برابری کرد.18
بعد contamination. Llama 3 contamination خودش را اندازه گرفت و منتشر کرد: 98٪ از AGIEval، 95٪ از BIG-Bench Hard و 85٪ از HellaSwag با مجموعه آموزش در 8-gram همپوشانی داشتند، و برای MMLU همپوشانی آنقدر بالا بود که «برآورد خوب از افزایش عملکرد ناممکن است».5 §4 در GPT-3 از باگ فیلترینگی خبر میدهد که benchmarkها را در داده جا گذاشت و راه برگشتی نبود: «بهدلیل ملاحظات هزینه، آموزش دوباره مدل infeasible بود».7
provenance بخش حلنشده است. The Pile یک مؤلفه 100.96 GiB به نام Books3 داشت — 12٪ از corpus و، طبق جدول consent خود مقاله، کتابهایی از یک torrent tracker خصوصی؛19 در اوت 2023 پس از شکایت copyright آفلاین شد. وضعیت حقوقی تا سپتامبر 2026 حلنشده است، و سه رأی US که بهعنوان trend نقل میشوند با هم اختلاف دارند. Alsup آموزش روی کتابهای بهطور قانونی بهدستآمده را «بهشدت transformative» دانست و در عین حال گفت کتابخانهای ساختهشده از نسخههای pirated چنین نیست، و Anthropic آن نیمه را با $1.5 میلیارد برای 482,460 اثر تسویه کرد، حدود $3,000 برای هر اثر، تأییدشده در 20 ژوئیه 2026.20 Chhabria به Meta summary judgment داد و همزمان نوشت رأی او «به معنای این گزاره نیست که استفاده Meta از مواد دارای copyright برای آموزش مدلهای زبانیاش قانونی است»، فقط اینکه «این plaintiffs استدلالهای غلطی مطرح کردند».21 Bibas، در رأی علیه Ross Intelligence، یادآور شد که «امروز فقط AI غیرمولد در برابر من است».22 هیچ دادگاه تجدیدنظر US درباره این پرسش رأی نداده است.
آدمها بخشهایی را انجام میدهند که زیان نمیتواند. TIME در ژانویه 2023 گزارش داد workerهایی که متن سمی را برای OpenAI از طریق شرکت Sama label میزدند، هنگام خواندن passageهایی درباره سوءاستفاده جنسی از کودک، شکنجه و خودآزاری، «بین حدود $1.32 و $2 در ساعت» دریافت میکردند، درحالیکه OpenAI برای کار به Sama ساعتی $12.50 میپرداخت؛ Sama هم محدوده دستمزد و هم quota را رد میکند.23 این فیلترینگ پیرامون pretraining است نه خود pretraining — اما روی همان invoice میآید، و همانجایی است که یک انسان نشسته است.
برق واقعی است و معمولاً بد نقل میشود. دقیقترین عدد منتشرشده برای BLOOM است: 1,082,990 GPU-hour، 433 MWh و 24.7 تن معادل CO₂ برای اجرا، و 50.5 با احتساب ساخت و گرههای idle؛24 Patterson و همکاران GPT-3 را 1,287 MWh و 552 تن گذاشتند.25 دو هشدار. برتری BLOOM از شبکه برق هستهای فرانسه با 57 g CO₂ برای هر kWh است نه از efficiency — انرژی بیشتری از OPT-175B مصرف کرد. و مشهورترین رقم انتشار این حوزه، 626,155 lb از Strubell و همکاران برای neural architecture search، بعداً نشان داده شد 88 برابر بیش از حد بالا بوده، چون فرض کرده بود search در اندازه کامل مدل اجرا شده درحالیکه روی proxy اجرا شده بود.26 framing قابل دفاع LBNL این است: data centreهای US در 2024، 192 TWh مصرف کردند، 4.7٪ برق ملی — عددی مربوط به یک صنعت، نه یک اجرای مشخص.27
خط مشترک همان چیزی است که Bender و همکاران documentation debt نامیدند: «قرار دادن خودمان در وضعیتی که datasetها هم undocumented هستند و هم آنقدر بزرگاند که پس از واقعه مستندسازیپذیر نیستند».28 هر واقعیت بالا وجود دارد چون کسی نگاه کرده است. برای corpusهای پشت مدلهایی که بیشتر مردم استفاده میکنند، هیچکس نمیتواند.
واقعاً چقدر هزینه دارد
لینک به بخش: واقعاً چقدر هزینه داردحالا حسابی که همه میخواهند، از چهار ورودی cited، تا وقتی stale شدند معلوم باشد کدام را باید عوض کرد.
Peak throughput
لینک به بخش: Peak throughputصفحه H100 شرکت NVIDIA، throughput برابر 1,979 teraFLOPS برای tensor-core BF16 را زیر footnoteی فهرست میکند که میگوید «with sparsity».29 هیچ اجرای pretraining از structured sparsity استفاده نمیکند، پس رقم dense نصف آن است: 989.5 TFLOP/s.
Utilisation
لینک به بخش: Utilisationجدول 4 در Llama 3، 38–43٪ BF16 model FLOPs utilisation گزارش میکند. 40٪ بگیرید: 395.8 TFLOP/s حساب مفید برای هر GPU.5
قیمت on-demand در Lambda برای یک node 8×H100 SXM، بازدیدشده در 2026-09-06: $3.99 برای هر GPU-hour، پس $31.92 در ساعت برای node.30
نسبت Chinchilla، ، مقدار و بنابراین را میدهد.
| بودجه | H100-hour | FLOP | پارامترهای compute-optimal | tokenها | روی یک node 8×H100 | GPUها برای پایان در 90 روز |
|---|---|---|---|---|---|---|
| $100 | 25 | 3.6e19 | 546 M | 10.9 B | 3.1 h | 1 |
| $1,000 | 251 | 3.6e20 | 1.73 B | 34.5 B | 31.3 h | 1 |
| $10,000 | 2,506 | 3.6e21 | 5.46 B | 109 B | 13 روز | 2 |
| $100,000 | 25,063 | 3.6e22 | 17.3 B | 345 B | 131 روز | 12 |
| $1,000,000 | 250,627 | 3.6e23 | 54.6 B | 1.09 T | 4 سال | 116 |
| $10,000,000 | 2,506,266 | 3.6e24 | 173 B | 3.45 T | 36 سال | 1,160 |
| $100,000,000 | 25,062,657 | 3.6e25 | 546 B | 10.9 T | 358 سال | 11,603 |
دو ستون آخر را با هم بخوانید. با $10,000 یک مدل 5 میلیارد پارامتری را روی یک node اجارهای در دو هفته میگیرید. با $100,000,000 حساب میگوید 546 میلیارد پارامتر — و دوازده هزار H100 که سه ماه به هم سیمکشی شدهاند، چیزی که با کارت اعتباری اجاره نمیکنید. بعد از حدود $100,000، قید binding دیگر پول نیست، cluster است.
پیش از اعتماد به چنین جدولی، آن را در برابر اجراهایی آزمایش کنید که هزینه واقعیشان منتشر شده — llm.c، GPT-2 124M را در «~90 دقیقه» روی یک node 8×A100 «با حدود $20» بازتولید میکند، و GPT-2 1.6B را در 24 ساعت روی یک node 8×H100 با $672.31
$672, against what $672 actually bought (llm.c GPT-2 1.6B, one 8xH100 node, 24 h)
this table predicts: 168 H100-hours N = 1.41 B params D = 28.3 B tokens
what was actually run: 192 H100-hours N = 1.558 B params D = 33.6 B tokens
Llama 3 405B, against Meta's own published GPU-hours
from the paper's 3.8e25 FLOPs at 40 % MFU: 26.67 M H100-hours
published in Meta's Llama 3.1 model card: 30.84 M H100-hours ratio 0.86هر دو در حدود 15٪، که تقریباً همان دقتی است که این نوع برآورد سزاوارش است و بهمراتب بهتر از دقتی است که معمولاً با آن نقل میشود.
مقایسه تیترساز، با هر دو تعریف روی میز
لینک به بخش: مقایسه تیترساز، با هر دو تعریف روی میزتکرارشوندهترین عدد در این موضوع این است که مدلی در کلاس GPT-2 که در 2019 حدود $43,000 هزینه داشت، امروز با چند ده دلار قابل بازتولید است. نیمه مدرن خوب مستند شده؛ نیمه تاریخی نه.
امروز. README مربوط به nanochat از Karpathy: «میتوانید LLM با توان GPT-2 خودتان را ... فقط با $48 آموزش دهید (~2 ساعت node 8XH100 GPU) ... روی spot instance، هزینه کل میتواند نزدیکتر به ~$15 باشد.»32 «توان GPT-2» اینجا دقیق و منتشرشده است — شکستدادن CORE score برابر 0.256525 در GPT-2 — روی leaderboardی که بهترین entry آن تا 14 مارس 2026 برابر 1.65 ساعت است. $48 قیمت $3 برای هر GPU-hour را فرض میکند، کمتر از فهرست $3.99 در Lambda؛ با قیمت فهرست نزدیکتر به $64 است.
در 2019. هیچ منبع اولیهای نیست: OpenAI هرگز duration یا cost منتشر نکرد. زنجیره از The Register، فوریه 2019، میگذرد که «256 Google TPU3 core» را بدون price و duration گزارش میکند؛ سپس Synced، ژوئن 2019، که مینویسد سختافزار روی Google Cloud ساعتی $256 هزینه داشته و صریحاً میگوید «OpenAI مدت آموزش را مشخص نکرد». $43,008 یعنی $256 در ساعت ضربدر 168 ساعت فرضی که هیچکس هرگز منبعش را نداده است.
پس تیتر صادقانه این است: مدلی که امتیاز benchmark منتشرشده GPT-2 را match میکند امروز با بسیار کمتر از $100 روی سختافزار اجارهای قابل آموزش است، در برابر هزینهای در 2019 که هرگز منتشر نشد و برآورد مشهورش بر حدسی بیمنبع درباره duration تکیه دارد. سقوط واقعی است و نیمه مدرن را هرکس کارت اعتباری داشته باشد میتواند بازتولید کند؛ نسبت حساب روی عددی است که وجود ندارد. این بهطور کلی وضعیت هزینههای منتشرشده آموزش است. مقاله GPT-3 اصلاً هیچ مبلغ دلاری ندارد، فقط FLOP در جدول D.1؛7 مقاله Llama 3 هم هیچکدام ندارد.5 هر هزینه آموزشی که خواندهاید برآوردی است از یک FLOP count، یک فرض سختافزاری و یک فرض قیمت — همیشه ارزش دارد بپرسید فرضِ چه کسی.
یک مدل پایه چه میداند، و چه زمانی دانستنش متوقف شد
لینک به بخش: یک مدل پایه چه میداند، و چه زمانی دانستنش متوقف شدآنچه بیرون میآید یک corpus ثابت را دیده که در لحظهای ثابت assembled شده، و دو ویژگی از آن دنبال میشود.
اولی knowledge cutoff است. پس از تاریخ گردآوری، مدل هیچچیز نمیداند — نه «نامطمئن است»، هیچچیز — و بهجای اینکه چنین بگوید، روان confabulate میکند، چون گفتن چنین چیزی هرگز رفتاری نبوده که روی آن آموزش دیده باشد. model card در Llama 3.1 دسامبر 2023 را میدهد؛33 هر مدل یکی دارد، و این ویژگی داده آموزش است، نه deployment. دورزدن آن مسئله retrieval است، که فصل 19 است.
دومی این است که مدل پایه کامل میکند نه پاسخ. به آن بدهید «پایتخت فرانسه چیست؟» و یک ادامه محتمل سؤال دیگری است، چون در corpus این رشته اغلب در فهرستی از تمرینها ظاهر میشود.
بعد به کجا میرود
لینک به بخش: بعد به کجا میرودیک کاملکننده متن assistant نیست. از دستورها پیروی نمیکند، چون هیچچیز در corpus به آن نگفته بود یک درخواست باید اطاعت شود نه ادامه داده شود. هیچ تصوری از گفتوگو با دو شرکتکننده ندارد. با خوشحالی محتملترین ادامه یک prompt آسیبزا را تولید میکند، چون محتمل تنها چیزی است که برایش optimise شده بود.
تبدیل آن به چیزی که پاسخ میدهد مرحله دومی میخواهد که کسری از یک درصد مرحله اول هزینه دارد، و تقریباً کامل از نشاندادن نمونههایی از رفتاری که میخواهید و سپس مقایسه جفتهایی از خروجیهای خودش تشکیل شده است. instruction following، chat templateها، refusalها و — چیزی که آدمها را غافلگیر میکند — توانایی call کردن tool همه از همان مرحله میآیند. فصل 11 همان مرحله است: supervised fine-tuning، RLHF، DPO و GRPO، و این پرسش که «aligned» یعنی چه و چه کسی تصمیم میگیرد.
منابع و روش
لینک به بخش: منابع و روشخواندن اینها در کنار این فصل هم ارزش دارد: build-nanogpt از Karpathy و ویدیوی همراهش، که یک بازتولید کامل GPT-2 را end to end با سرعتی طی میکنند که این فصل نمیتواند؛ و Stanford CS324، Large Language Models، که lectureهایش درباره داده و اثر زیستمحیطی از بخش بالا عمیقتر وارد موادی میشوند که این دوره یکبار به آنها میپردازد و سپس واگذار میکند.
ارجاعات
لینک به بخش: ارجاعات-
Kaplan، J.، McCandlish، S.، Henighan، T.، Brown، T. B.، Chess، B.، Child، R.، Gray، S.، Radford، A.، Wu، J. و Amodei، D. Scaling Laws for Neural Language Models. arXiv:2001.08361 (2020). سه power law معادلات (1.1)–(1.3) در §1.2 هستند و ثابتهای کامل در Appendix A، جدول 5؛ استنتاج در §2.1 است؛ توانهای compute-allocation در جدول 6. توجه کنید دو قانون compute وجود دارد، در batch size ثابت و در batch size بهینه؛ مقاله میگوید دومی «باید برای پیشبینی استفاده شود». ↩ ↩2
-
Hoffmann، J.، Borgeaud، S.، Mensch، A.، Buchatskaya، E.، Cai، T.، Rutherford، E. و همکاران. Training Compute-Optimal Large Language Models. arXiv:2203.15556 (2022). توانها در جدول 2، بودجههای projected در جدول 3، مقایسه Gopher در §4، convention شمارش پارامتر در Appendix F. prose زیر جدول 3 با خود جدول 3 برای ردیفهای 175 B و 280 B اختلاف دارد؛ نسخه قابل نقل جدول است. ↩ ↩2 ↩3 ↩4
-
Micikevicius، P.، Narang، S.، Alben، J.، Diamos، G.، Elsen، E.، Garcia، D. و همکاران. Mixed Precision Training. arXiv:1710.03740 (2017)، ICLR 2018. وزنهای master در FP32 در §3.1، loss scaling در §3.2. ↩ ↩2
-
Rajbhandari، S.، Rajbhandari، S.، Ruwase، O. و He، Y. ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054 (2019)، SC20. حسابداری در §3.1 است؛ ارقام حالت باقیمانده برای activationها در §3.2. ↩
-
Grattafiori، A. و همکاران. (Llama Team، AI @ Meta). The Llama 3 Herd of Models. arXiv:2407.21783 (2024). بودجه compute و شمار token در §1، قانون مقیاسپذیری refitted در §3.2.1، پیکربندی parallelism و MFU در جدول 4، تحلیل contamination در §5.1.4، بیان over-training در §9.1. مقاله هیچ رقم دلاری و هیچ جدول emissions ندارد. ↩ ↩2 ↩3 ↩4 ↩5 ↩6
-
Stanford CS336، Language Modeling from Scratch. Lecture 2 حسابداری منابع را پوشش میدهد، lectureهای 5–8 GPUها، kernelها و parallelism را، lectureهای 9 و 11 scaling را، lectureهای 13–14 داده را. این همان دورهای است که این فصل مهندسیاش را به آن واگذار میکند، و عمومی است. ↩
-
Brown، T. B. و همکاران. Language Models are Few-Shot Learners. arXiv:2005.14165 (2020). compute در Appendix D، جدول D.1 — که ستونی دارد با عنوان لفظی «flops per param per token»، و مقدارش برای هر ردیف GPT-3 برابر 6 است. تحلیل contamination در §4. ↩ ↩2 ↩3
-
Besiroglu، T.، Erdil، E.، Barnett، M. و You، J. Chinchilla Scaling: A replication attempt. arXiv:2404.10102 (2024). دادههای Chinchilla را با digitising شکل 4 بازسازی میکند، دوباره fit میکند، و توانهای اصلاحشده و بازههای بسیار عریضتر را گزارش میدهد. ↩
-
Muennighoff، N.، Rush، A. M.، Barak، B.، Le Scao، T.، Piktus، A.، Tazi، N.، Pyysalo، S.، Wolf، T. و Raffel، C. Scaling Data-Constrained Language Models. arXiv:2305.16264 (2023)، NeurIPS 2023. نتیجه چهار epoch در §6؛ نیمهعمر شانزده epoch همان fitted است. ↩
-
Touvron، H.، Lavril، T.، Izacard، G.، Martinet، X.، Lachaux، M.-A.، Lacroix، T. و همکاران. LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 (2023). §1 استدلال inference-cost علیه آموزش Chinchilla-optimal را بیان میکند. ↩
-
Sardana، N.، Portes، J.، Doubov، S. و Frankle، J. Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws. arXiv:2401.00448 (2023)، ICML 2024. §5 آنها counterweight را هم دارد: مدلهایی که با نسبتهای token بسیار شدید آموزش میبینند همچنان بهتر میشوند، اما «آهستهتر از آنچه قوانین مقیاسپذیری پیشبینی میکنند». ↩
-
Wei، J.، Tay، Y.، Bommasani، R.، Raffel، C.، Zoph، B.، Borgeaud، S. و همکاران. Emergent Abilities of Large Language Models. arXiv:2206.07682 (2022)، TMLR. تعریف در §2، نمونهها و آستانههای compute در §3–4 و جدول 1. ↩
-
Schaeffer، R.، Miranda، B. و Koyejo، S. Are Emergent Abilities of Large Language Models a Mirage? arXiv:2304.15004 (2023)، مقاله برجسته NeurIPS 2023. استدلال metric در §2، meta-analysis BIG-Bench در §4، مثال vision ساختهشده در §5. ↩
-
Common Crawl، August 2026 Crawl Archive Now Available (CC-MAIN-2026-34)، منتشرشده 24 اوت 2026، بازدید 2026-09-06. front page خودش ادعا میکند «بیش از 300 میلیارد صفحه در 15 سال»، «در مجموع بیش از 10 petabytes» — رقمی برای کل آرشیو، نه crawl ماهانه قیمتگذاریشده اینجا. ↩
-
Raffel، C.، Shazeer، N.، Roberts، A.، Lee، K.، Narang، S.، Matena، M.، Zhou، Y.، Li، W. و Liu، P. J. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683 (2019)، JMLR 21(140). فیلترهای C4 در §2.2 هستند. مقاله اندازهها را بر حسب byte میدهد، نه token؛ رقم 156 میلیارد token که زیاد به آن نسبت داده میشود از Dodge و همکاران زیر است. ↩
-
Dodge، J.، Sap، M.، Marasović، A.، Agnew، W.، Ilharco، G.، Groeneveld، D.، Mitchell، M. و Gardner، M. Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758 (2021)، EMNLP 2021. نرخهای حذف dialect در §5.3؛ benchmark contamination در C4 در §4.2. ↩
-
Lee، K.، Ippolito، D.، Nystrom، A.، Zhang، C.، Eck، D.، Callison-Burch، C. و Carlini، N. Deduplicating Training Data Makes Language Models Better. arXiv:2107.06499 (2021)، ACL 2022. 61,036 تکرار در footnote 1 است؛ ارقام memorisation در §6.2، جدول 4 هستند، و درصدی از tokenهای تولیدشده تحت معیار exact-match پنجاه tokenیاند. ↩
-
Penedo، G.، Kydlíček، H.، Ben Allal، L.، Lozhkov، A.، Mitchell، M.، Raffel، C.، Von Werra، L. و Wolf، T. The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale. arXiv:2406.17557 (2024)، NeurIPS 2024 Datasets and Benchmarks. نتیجه deduplication در §3.4 است. dataset منتشرشده از آن زمان از 15 تریلیون token مقاله گذشته است. ↩
-
Gao، L.، Biderman، S.، Black، S. و همکاران. The Pile: An 800GB Dataset of Diverse Text for Language Modeling. arXiv:2101.00027 (2020). Books3 در §2.3 و جدول 1 است؛ جدول consent، جدول 5 است. corpus برابر 825.18 GiB است، پس حتی عنوان هم رو به پایین گرد شده است. ↩
-
Bartz v. Anthropic، No. 4:24-cv-05417 (N.D. Cal.). دستور fair-use در 23 ژوئن 2025 (Dkt. 231)؛ class certification در 17 ژوئیه 2025؛ final approval and judgment در 20 ژوئیه 2026 (Dkt. 680). settlement فقط ورودیهای گذشته را آزاد میکند، نه خروجیها و نه رفتار آینده. ↩
-
Kadrey v. Meta، No. 3:23-cv-03417-VC (N.D. Cal.)، summary judgment در 25 ژوئن 2025 (Dkt. 598). توجه کنید ادعای distribution درباره torrenting تصمیمگیری نشد و همچنان live است. ↩
-
Thomson Reuters v. ROSS Intelligence، No. 1:20-cv-00613-SB (D. Del.)، revised opinion در 11 فوریه 2025 (Dkt. 770)، Bibas J. در interlocutory appeal به Third Circuit (No. 25-2153)، argued در 11 ژوئن 2026، در زمان نگارش undecided. ↩
-
Perrigo، B. Exclusive: OpenAI Used Kenyan Workers on Less Than $2 Per Hour to Make ChatGPT Less Toxic. TIME، 18 ژانویه 2023. $2 سقف برای reviewerهای ارشدی است که همه targetها را زده بودند؛ labellerهای junior، اکثریت، $1.32 دریافت میکردند. rebuttal شرکت Sama، نقلشده در همان مقاله، $1.46–$3.74 و quota پایینتری میدهد. ↩
-
Luccioni، A. S.، Viguier، S. و Ligozat، A.-L. Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language Model. arXiv:2211.02001 (2022)، JMLR 24(253). جدولهای 1 و 3. ↩
-
Patterson، D.، Gonzalez، J.، Le، Q.، Liang، C.، Munguia، L.-M.، Rothchild، D.، So، D.، Texier، M. و Dean، J. Carbon Emissions and Large Neural Network Training. arXiv:2104.10350 (2021). ارقام GPT-3 در جدول 4 هستند؛ اصلاح برآورد NAS در §4.1. ↩
-
Strubell، E.، Ganesh، A. و McCallum، A. Energy and Policy Considerations for Deep Learning in NLP. arXiv:1906.02243 (2019)، ACL 2019. دقیقاً بهخاطر اتفاقی که برای نقلشدهترین عددش افتاد ارزش خواندن دارد: مقاله دقیق است، extrapolation خود را بیان میکند، و بااینحال در همان خطی که همه تکرار کردند دو مرتبه بزرگی خطا داشت. ↩
-
Smith، S. J.، Hubbard، A.، Newkirk، A.، Ganeshalingam، M.، Holecek، B.، Sartor، D.، Mills، M. و Shehabi، A. United States Data Center Energy Usage Report: 2025 Update. LBNL-2001758 (18 ژوئن 2026). این گزارش سری تاریخی را نسبت به گزارش 2024 که زیاد نقل میشد رو به پایین بازبینی میکند؛ اگر رقم 176 TWh برای 2023 را نقل میکنید، دارید نسخه superseded را نقل میکنید. ↩
-
Bender، E. M.، Gebru، T.، McMillan-Major، A. و Shmitchell، S. On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? FAccT '21، pp. 610–623. DOI 10.1145/3442188.3445922. «documentation debt» در §4.4 است. توجه کنید ارقام carbon خود مقاله از Strubell و همکاران cited شده و اصلاح بالا را به ارث میبرد — که بیشتر illustration استدلال آن است تا refutation آن. ↩
-
NVIDIA. صفحه محصول NVIDIA H100 Tensor Core GPU،
nvidia.com/en-us/data-center/h100/(بازدید 2026-09-06). هر ردیف tensor-core در آن صفحه جز FP64 footnote «with sparsity» دارد؛ رقم dense BF16 که اینجا استفاده شده نصف 1,979 TFLOPS منتشرشده است. ↩ -
Lambda. GPU Cloud pricing،
lambda.ai/pricing(بازدید 2026-09-06). On-demand، برای هر GPU در هر ساعت، پیش از مالیات. قیمتها در این بخش سریعتر از هر چیز دیگری در این دوره stale میشوند؛ حساب پیرامونشان نه. ↩ -
Karpathy، A.
karpathy/llm.c، discussion #481، Reproducing GPT-2 (124M) in llm.c in 90 minutes for $20 (28 مه 2024)، و discussion #677، Let's reproduce GPT-2 (1.6B): one 8XH100 node, 24 hours, $672, in llm.c (11 ژوئیه 2024). ↩ -
Karpathy، A.
karpathy/nanochat، README و leaderboard «time to GPT-2» (بازدید 2026-09-06). رقم $48 و تعریف CORE-score از «GPT-2 capability» هر دو در README هستند؛ خودspeedrun.shمخزن میگوید «تقریباً 1.5 ساعت»، پس رقم دو ساعت را گرد شده بدانید. ↩ -
Meta. Llama 3.1 model card،
models/llama3_1/MODEL_CARD.mdدرmeta-llama/llama-models(بازدید 2026-09-06). منبع 30.84 M H100-hour برای مدل 405 B، کل 39.3 M، رقم 11,390 tCO2eq location-based، و data cutoff دسامبر 2023. ↩