پرش به محتوا
10/30فصل 10 از 30

پیش‌آموزش یک LLM: داده، محاسبه، قوانین مقیاس‌پذیری و هزینه

بیست مدل روی GPU لپ‌تاپ برای سنجش قانون مقیاس‌پذیری، و برآورد 6ND compute با شمارنده واقعی FLOP بررسی شد.

در این صفحه

فصل 9 با یک بلوک transformer تمام شد که آموزش می‌بیند. چندتا از آن‌ها را روی هم بگذارید، زیان next-token فصل 8 را به خروجی وصل کنید، و دیگر چیزی برای اختراع باقی نمی‌ماند. هرچه می‌ماند خرید است.

این تغییر بزرگ‌تر از چیزی است که به نظر می‌رسد. هر فصل تا اینجا می‌پرسید آیا یاد می‌گیرد؟ — پرسشی بله‌یاخیر که یک لپ‌تاپ در ده دقیقه جوابش را می‌دهد. این فصل پرسشی می‌پرسد که پول در آن است: با مقدار ثابتی از حساب، بهترین مدلی که می‌توانم بخرم چیست؟ پاسخ یک فرمول است، و در 2018 برای هیچ‌کس بدیهی نبود.

اینجا همان پرسش با اندازه‌گیری، روی یک GPU لپ‌تاپ، پاسخ داده شده است. بیست مدل، از 98,624 تا 15 میلیون پارامتر، از صفر روی 174 میلیون token ویکی‌پدیا آموزش داده شدند — یک واژگان BPE با 2,048 token که همان‌طور آموزش داده شد که فصل 7 یکی را آموزش می‌دهد، با transformer فصل 9. هر اجرا دقیقاً یکی از سه بودجه compute را گرفت و حتی یک عملیات بیشتر نه، پس مدل بزرگ‌تر ناچاراً متن کمتری می‌خواند. بهترین زیان روی داده نگه‌داشته‌شده در هر بودجه:

TEXT
budget C (FLOPs)   best loss   reached by a model of
       1.00e13       5.3531           98,624 params
       3.16e13       4.8638           98,624 params
       1.00e14       4.3383          295,808 params

fitted:  L = (Cc / C)^0.0913     over one decade of compute

ده برابر حساب، 19٪ از زیان کم می‌کند، و سه نقطه روی خطی مستقیم در مقیاس log-log می‌نشینند. هیچ‌چیز در نه فصل اول این را پیش‌بینی نمی‌کند. پشت آن قضیه‌ای نیست — یک نظم تجربی است، با توانی متفاوت، که در ده مرتبه بزرگی میان این لپ‌تاپ و یک datacentre برقرار می‌ماند، و همان مشاهده‌ای است که یک صنعت را قانع کرد به اندازه GDP یک کشور کوچک برای GPU خرج کند.

pretraining چیست، و چه چیز تازه‌ای در آن هست

لینک به بخش: pretraining چیست، و چه چیز تازه‌ای در آن هست

هیچ‌چیز در هدف تغییر نمی‌کند. مدل همچنان token بعدی را پیش‌بینی می‌کند، زیان همچنان cross-entropy فصل 4 است که روی تجزیه فصل 8 اعمال شده، optimiser همچنان AdamW فصل 6 است. pretraining الگوریتم تازه‌ای نیست؛ همان الگوریتم است که روی corpus آن‌قدر بزرگی اجرا می‌شود که باید برای اجرا بودجه‌بندی کرد. دو چیز این را ممکن می‌کند: labelها رایگان‌اند، چون هدف برای موقعیت tt همان token در t+1t+1 است و از قبل در متن وجود دارد؛ و بخش آخر فصل 6 ایراد را برداشت، چون مدلی با پارامترهایی بسیار بیشتر از آنچه قواعد کلاسیک اجازه می‌دهند فرو نمی‌پاشد، بهتر می‌شود. خروجی یک مدل پایه است — چیزی که متن را ادامه می‌دهد، نه اینکه پاسخ بدهد.

شمردن compute پیش از خرج کردن آن: 6ND

لینک به بخش: شمردن compute پیش از خرج کردن آن: 6ND

پیش از آنکه بتوان برای هرکدام از این‌ها بودجه گذاشت، باید شمرده شود، و این حوزه آن را با یک فرمول می‌شمارد:

C6NDC \approx 6ND

که در آن NN تعداد پارامترها، DD tokenهای آموزش و CC کل عملیات floating-point است. Kaplan و همکاران آن را در دو گام به دست می‌آورند.1 Forward: 2 FLOP برای هر پارامتر در هر token، چون هر پارامتر در یک ضرب ماتریسی یک‌بار برای هر token استفاده می‌شود، در یک ضرب و یک جمع. Backward: دو برابر forward، چون گذر backward فصل 5 در هر لایه دو gradient محاسبه می‌کند — نسبت به ورودی‌های لایه، تا سیگنال به حرکت ادامه دهد، و نسبت به وزن‌های آن — که هرکدام ضرب ماتریسی هم‌اندازه forward است، پس 4N4N.

کل استنتاج همین است، و ارزش دارد به‌جای باور کردن، آن را بررسی کنیم. PyTorch یک شمارنده واقعی FLOP دارد، torch.utils.flop_counter.FlopCounterMode، که هر عملیاتی را که مدل dispatch می‌کند intercept می‌کند و کار واقعی را جمع می‌زند. آن را در چهار مرتبه بزرگی اجرا کنید، بزرگ‌ترین مورد روی دستگاه meta، که شکل‌ها را تخصیص می‌دهد و حافظه‌ای نمی‌گیرد:

flops.pyPYTHON
from torch.utils.flop_counter import FlopCounterMode

counter = FlopCounterMode(display=False)
with counter:                       
    loss = model(x, targets)[1]     
    loss.backward()                 
measured = counter.get_total_flops()
print(measured / (6 * n_params * n_tokens))
پیکربندیNN بدون embeddingهاNN کلاندازه‌گیری‌شده، fwd+bwd÷ 6ND6ND (کل NN)÷ 6ND6ND (بدون emb.)fwd+bwd ÷ fwd
dd 128، 4 لایه، TT 256788,7367,254,4004.60e101.0319.4853.000
dd 512، 8 لایه، TT 25625,183,23251,045,8883.26e111.0382.1043.000
dd 768، 12 لایه، TT 102484,973,056124,356,8641.75e121.1451.6763.000
dd 1600، 48 لایه، TT 10241,474,870,4001,556,920,0002.10e131.1001.1613.000
dd 4096، 32 لایه، TT 20486,442,983,4246,582,444,0328.74e131.0801.1043.000
dd 8192، 80 لایه، TT 819264,427,147,26465,544,929,2803.75e151.1631.1833.000

نسبت forward+backward به forward برابر 3.000 است، دقیقاً، در هر مقیاس: نه تقریبی که تصادفاً خوب از آب درآمده، بلکه هویت حسابی بالا که توسط شمارنده‌ای که هیچ‌چیز از استنتاج نمی‌داند به صورت عددی گرد برگردانده شده است.

سپس کل اندازه‌گیری‌شده بین 3٪ تا 17٪ بالاتر از 6ND6ND می‌نشیند، وقتی NN ماتریس‌های embedding را هم بشمارد — و این بند مهم است، چون دو مقاله بنیان‌گذار NN را متفاوت می‌شمارند. Kaplan «همه embeddingهای واژگان و موقعیتی» را کنار می‌گذارد چون این کار «قوانین مقیاس‌پذیری به‌مراتب تمیزتری تولید می‌کند» (§1.3)؛ Appendix F در Chinchilla می‌گوید «ما ماتریس‌های embedding را نیز در شمار کل پارامترها حساب می‌کنیم».2 برای واژگان عریض و بعد پنهان باریک، این دو با ضریب نه فرق دارند، همان‌طور که ردیف اول نشان می‌دهد.

شکاف باقی‌مانده همان چیزی است که 6ND6ND عمداً حذف می‌کند: امتیازهای attention. معادله (2.2) Kaplan هزینه forward را به صورت 2N+2nlayernctxdmodel2N + 2\,n_{\text{layer}} n_{\text{ctx}} d_{\text{model}} می‌نویسد و جمله دوم را حذف می‌کند چون dmodelnctx/12d_{\text{model}} \gg n_{\text{ctx}}/12 — در 2020 امن بود، امروز کمتر امن است، و دلیل اینکه نسبت با رشد T/dT/d رو به بالا می‌لغزد — و به همین دلیل است که دو ردیف اینجا TT مشترک 1,024 دارند و نسبت وقتی dd از 768 به 1,600 می‌رود کاهش می‌یابد، از 1.145 به 1.100. این همان هزینه O(T2)O(T^2) است که فصل 9 معرفی کرد و فصل 16 آن را به قیمت تبدیل می‌کند.

حافظه: واقعاً چه چیزی باید جا شود

لینک به بخش: حافظه: واقعاً چه چیزی باید جا شود

Compute تعیین می‌کند اجرا چقدر طول می‌کشد؛ حافظه تعیین می‌کند اصلاً می‌تواند شروع شود یا نه. با AdamW ساده fp32 آموزش بدهید و هر پارامتر چهار عدد با خود دارد: وزن، gradient آن، و میانگین جاری mm و واریانس vv در Adam — همان دو میانگینی که در فصل 6 دستی ساختیم. چهار عدد، هرکدام چهار بایت، یعنی 16 بایت برای هر پارامتر، پیش از حتی یک activation. اندازه‌گیری‌شده روی GPU لپ‌تاپ 8 GB، با گرفتن تخصیص مقیم در نقطه‌ای از step که هیچ graph زنده‌ای نیست:

مدلواژگانbatchNN16N16N پیش‌بینی‌شدهمقیم اندازه‌گیری‌شدهاوج در یک stepتفاوت
dd 512، 8 لایه50,257851,045,888779 MB801 MB2,500 MB1,699 MB
dd 512، 8 لایه4,096827,411,456418 MB426 MB1,043 MB617 MB
dd 256، 6 لایه4,09685,839,36089 MB89 MB382 MB293 MB
dd 256، 6 لایه4,096325,839,36089 MB89 MB1,259 MB1,170 MB
dd 256، 6 لایه4,0961285,839,36089 MB89 MB4,771 MB4,681 MB

پیش‌بینی و اندازه‌گیری با اختلافی کمتر از 3٪ توافق دارند. شگفتی ستون آخر است: activationها مدل را کوچک جلوه می‌دهند. همان مدل 5.8 میلیون پارامتری که 89 MB حالت پایدار لازم دارد، در batch برابر 128 به 4,681 MB activation نیاز دارد — پنجاه‌ودو برابر خود مدل — و بخش زیادی از آن اصلاً transformer نیست. logits است، یک بردار به اندازه واژگان برای هر token با چهار بایت برای هر درایه: 512 MB در ردیف آخر، 393 MB در ردیف اول. اندازه واژگان در فصل 7 انتخاب شد، و هنوز دارد تعیین می‌کند چه چیزی روی کارت جا می‌شود.

اینکه کدام جمله غالب می‌شود به شکل اجرا بستگی دارد، و به همین دلیل Micikevicius و همکاران می‌گویند حافظه «تحت سلطه activationهاست»3 درحالی‌که ZeRO می‌گوید یک مدل 1.5 میلیارد پارامتری «حداقل 24 GB» فقط برای حالت‌های مدل لازم دارد.4 ZeRO از مسیر دیگری به همان 16 بایت می‌رسد — 2Ψ2\Psi برای وزن‌های fp16، 2Ψ2\Psi برای gradientهای fp16، هرکدام 4Ψ4\Psi برای وزن‌های master در fp32 و دو moment آدم — که برای 70 میلیارد پارامتر 1.12 ترابایت می‌شود، به اندازه چهارده GPU هشتاد گیگابایتی پیش از حتی یک activation.

موازی‌سازی، در یک پاراگراف و یک واگذاری

لینک به بخش: موازی‌سازی، در یک پاراگراف و یک واگذاری

هیچ‌کدام از آن‌ها در مقیاس مرزی روی یک دستگاه جا نمی‌شود، پس اجرا هم‌زمان به چهار شکل شکسته می‌شود. Data parallelism یک کپی از مدل را روی هر GPU می‌گذارد و gradientها را میانگین می‌گیرد — حالت پیش‌فرض، و همان که ZeRO با نگه نداشتن کپی‌های زائد از حالت optimiser بهترش می‌کند. Tensor parallelism ماتریس‌های منفرد را میان دستگاه‌ها تقسیم می‌کند. Pipeline parallelism به هر دستگاه گروهی پیوسته از لایه‌ها می‌دهد. Context parallelism خود توالی را می‌شکند، و فقط وقتی لازم می‌شود که TT آن‌قدر بلند باشد که جمله attention غالب شود. جدول 4 در Llama 3 هر چهار را با هم فهرست می‌کند: tensor برابر 8، context تا 16، pipeline برابر 16، data تا 128، روی 16,384 GPU از نوع H100.5 این دوره درباره‌اش همین‌قدر خواهد گفت؛ مهندسی آموزش توزیع‌شده یک ترم مستقل است، و Stanford CS336 همان ترم است، درس‌های 5 تا 8، همراه با کد.6 آنچه از این واگذاری باقی می‌ماند یک عدد است، model FLOPs utilisation — کسری از حساب اوج GPU که یک اجرای واقعی به آن می‌رسد — و همین عدد است که 6ND6ND مرتب را به زمان ساعت دیواری و بنابراین پول تبدیل می‌کند.

در ژانویه 2020، Kaplan و همکاران شبکه‌ای از transformerها را آموزش دادند و دریافتند زیان آزمون در هرکدام از سه منبع، در بیش از شش مرتبه بزرگی، از power law پیروی می‌کند.1 §1.2 آن‌ها سه قانون fitted می‌دهد:

L(N)=(NcN)αN,αN0.076,Nc8.8×1013L(N) = \left(\frac{N_c}{N}\right)^{\alpha_N}, \qquad \alpha_N \approx 0.076, \qquad N_c \approx 8.8 \times 10^{13}

با همراهانی مثل αD0.095\alpha_D \approx 0.095 برای داده و αCmin0.050\alpha_C^{\min} \approx 0.050 برای compute تخصیص‌یافته بهینه. ثابت‌ها جهانی نیستند، و خود مقاله هم می‌گوید: «مقادیر عددی دقیق NcN_c، CcminC_c^{\min} و DcD_c به اندازه واژگان و tokenization بستگی دارد و بنابراین معنای بنیادی ندارد.»

توان‌ها کوچک‌اند: ده برابر پارامتر، ضریب 100.0761.1910^{0.076} \approx 1.19 از زیان باقی‌مانده کم می‌کند. این تقریباً هیچ به نظر می‌رسد، و همین مهم‌ترین واقعیت اینجاست — بازده‌ها افتضاح‌اند و هرگز متوقف نمی‌شوند. power law با توان کوچک وعده می‌دهد که مرتبه بزرگی بعدی کمک خواهد کرد، کمتر از قبلی، تا ابد. خریدن compute از قمار بودن خارج می‌شود و به خریدی با نرخ تبدیل منتشرشده تبدیل می‌شود؛ دقیقاً همان استدلالی که سرمایه را آزاد کرد.

بعد نسخه تجویزی آمد، و اینجا جایی است که مقاله به شکلی غلط بود که برای صنعت پول زیادی هزینه داشت. جدول 6 در Kaplan مقادیر NoptC0.73N_{\text{opt}} \propto C^{0.73} و DoptC0.27D_{\text{opt}} \propto C^{0.27} را می‌دهد: ده برابر compute یعنی مدلی 5.4 برابر بزرگ‌تر که فقط 1.9 برابر متن بیشتری می‌بیند. چکیده صریح است — «آموزش بهینه از نظر compute مستلزم آموزش مدل‌های بسیار بزرگ روی مقدار نسبتاً modestی از داده و توقف بسیار پیش از همگرایی است.» حوزه دقیقاً همین کار را کرد: GPT-3 با 175 میلیارد پارامتر روی 300 میلیارد token،7 Gopher با 280 میلیارد روی 300 میلیارد، Megatron-Turing NLG با 530 میلیارد روی 270 میلیارد.2 نیم token تا دو token برای هر پارامتر، همه‌جا.

Chinchilla، و اینکه sweep بالا چه چیزی را اندازه می‌گرفت

لینک به بخش: Chinchilla، و اینکه sweep بالا چه چیزی را اندازه می‌گرفت

در مارس 2022، Hoffmann و همکاران بیش از 400 مدل از 70 میلیون تا 16 میلیارد پارامتر را آموزش دادند و از سه مسیر مستقل به نتیجه مخالف رسیدند.2 جدول 2 آن‌ها توان aa را در NoptCaN_{\text{opt}} \propto C^{a} برابر 0.50، 0.49 و 0.46 گزارش می‌کند، در برابر 0.73 در Kaplan. ساده بگوییم: اندازه مدل و داده آموزش باید به نسبت برابر رشد کنند.

رویکرد دوم آن‌ها همان چیزی است که sweep ابتدای این فصل در یک‌میلیونم مقیاس بازتولید کرد: بودجه را ثابت کن، اندازه‌های زیادی را دقیقاً با همان بودجه آموزش بده، زیان نهایی را در برابر اندازه مدل رسم کن.

پارامترهاC=1013C = 10^{13}C=3.16×1013C = 3.16 \times 10^{13}C=1014C = 10^{14}
98,6245.3531 (171)4.8638 (542)
150,3205.4636 (74)
194,2085.5041 (44)4.8730 (140)4.4040 (442)
295,8085.5550 (19)4.9029 (60)4.3383 (190)
665,2805.7849 (3.8)5.1254 (12)4.4192 (38)
1,280,7685.8174 (1.0)5.1751 (3.2)4.5003 (10)
3,101,5685.4686 (0.5)4.7768 (1.7)
5,315,0725.5894 (0.2)4.8514 (0.6)
15,053,5685.3534 (0.1)

زیان held-out بر حسب nat برای هر token، token برای هر پارامتر داخل پرانتز، پررنگ برای بهترین مدل در هر بودجه؛ خط تیره نقطه‌ای است که اجرا نشده، چون بودجه متن بیشتری از corpus می‌خواست یا اندازه بیرون از محدوده sweep آنجا بود.

یک ستون را از بالا به پایین بخوانید: زیان کم می‌شود، به کف می‌رسد و دوباره بالا می‌رود. یک مدل می‌تواند برای بودجه‌اش دقیقاً به همان آسانی که بیش از حد کوچک است، بیش از حد بزرگ هم باشد — در 101410^{14} جریمه انتخاب 665,280 پارامتر به‌جای 295,808 برابر 0.08 nat است، که روی envelope fitted بالا همان زیانی است که یک مدل درست‌اندازه با 18٪ compute کمتر به آن می‌رسد. انتخاب شکل غلط یک‌پنجم بودجه را دور می‌ریزد. این Figure 3 در Chinchilla است، در یک بعدازظهر روی یک GPU به‌جای چهارصد مدل.

حالا افقی بخوانید. در 101310^{13} بهترین مدل کوچک‌ترین مدلی است که sweep شده؛ در 101410^{14} برابر 295,808 پارامتر است، از دو طرف bracket شده. بهینه با رشد بودجه به راست حرکت می‌کند، و کل محتوای اصلاح همین است. رویکرد سوم مقاله را fit کنید — سطح L(N,D)=E+A/Nα+B/DβL(N,D) = E + A/N^{\alpha} + B/D^{\beta} روی همه اجراها — و تحت قید C=6NDC = 6ND کمینه کنید:

TEXT
L(N, D) = 24.7 / N^0.195 + 46.8 / D^0.169       (E fits to ~0; see below)
implied   N_opt ∝ C^0.464
  compare   Chinchilla 0.46-0.50 · Besiroglu 0.513 · Kaplan 0.73

0.46، از یک لپ‌تاپ، در برابر 0.73 در Kaplan. توافق تا سه رقم از fit سه‌بودجه‌ای شانس است؛ توافق تا رقم اول شانس نیست. توان سفر می‌کند — ثابت نه، چون نسبت token به پارامتر در این بهینه‌ها 170 تا 540 است، نه 20. سه دلیل، همه آموزنده. EE به صفر fit می‌شود چون در زیانی بالاتر از 4 nat اجرا هیچ‌جا نزدیک کف entropy که بر fit Chinchilla غالب است نیست. batch size و learning rate به‌جای tune شدن برای هر نقطه ثابت مانده‌اند، که هر اجرایی را که step کمتری می‌گیرد زمین می‌زند — و آن‌ها مدل‌های بزرگ‌اند: در 101310^{13} FLOP، یک مدل 1.28 میلیون پارامتری در کل 159 step optimiser می‌گیرد، بسیار کمتر از چند هزار stepی که جمله SminS_{\min} در Kaplan می‌گوید هر مدلی لازم دارد. قانون مقیاس‌پذیری درون یک regime fit می‌شود، و این یکی شش مرتبه بزرگی پایین‌تر از Chinchilla است.

از همین‌جاست چکیده مقاله: «مدل‌های زبانی بزرگ فعلی به‌طور معناداری undertrained هستند». Chinchilla نمایش آن است — 70 میلیارد پارامتر روی 1.4 تریلیون token، با همان compute کل Gopher با 280 میلیارد روی 300 میلیارد، و بهتر از آن در 51 مورد از 57 وظیفه MMLU، 67.5٪ در برابر 60٪.2 چهار برابر کوچک‌تر، چهار و نیم برابر متن بیشتر، همان پول، مدل بهتر.

دو نکته درباره آن نسبت مشهور. «بیست token برای هر پارامتر» جمله‌ای در مقاله نیست، مقاله فقط می‌گوید «برای هر دوبرابرشدن اندازه مدل، تعداد tokenهای آموزش نیز باید دو برابر شود»؛ عدد 20 استنباطی از جدول 3 و از خود Chinchilla با 70 B روی 1.4 T است. و دقتش از آنچه منتشر شده بدتر است: Besiroglu و همکاران داده‌ها را از digitization شکل 4 دوباره fit کردند، دیدند پارامترهای اصلی «با داده بازسازی‌شده بد fit می‌شوند» و بازه‌ها «با توجه به تعداد نقاط داده نامحتمل تنگ‌اند»، و دامنه صادقانه را «بین 4 و 40» token برای هر پارامتر گذاشتند.8

یک جزئیات از روش Chinchilla وعده‌ای را که فصل 1 درباره learning-rate schedule داده بود ادا می‌کند. cosine schedule باید با بودجه token جفت شود. مدلی که 10 میلیون token خواهد دید باید learning rate خود را در 10 میلیون token به صفر decay کند؛ اگر scheduleای به اندازه 100 میلیون به آن بدهید و زود متوقفش کنید، دارید زیانی را وسط فرود، با نرخی بسیار بیش از حد بالا، می‌خوانید. Chinchilla هر مدل را در چهار طول چرخه آموزش می‌دهد تا دقیقاً همین را کنترل کند؛ sweep بالا به همین دلیل schedule خود را از بودجه می‌گیرد.

قوانین مقیاس‌پذیری چه وعده‌ای نمی‌دهند

لینک به بخش: قوانین مقیاس‌پذیری چه وعده‌ای نمی‌دهند

آن‌ها مفیدترین نتیجه تجربی این حوزه‌اند و مرتب بیش‌ازحد فروخته می‌شوند. چهار حد.

آن‌ها زیان را پیش‌بینی می‌کنند، نه قابلیت را. سمت چپ cross-entropy روی متن held-out است. هیچ‌چیز در این مقاله‌ها مجوز ادعایی درباره اینکه مدل SQL درست خواهد نوشت، درخواست آسیب‌زا را رد خواهد کرد یا از tool استفاده خواهد کرد نمی‌دهد. این دوباره درس فصل 5 است: پیش‌بینی زیان پیش‌بینی رفتاری نیست که بابتش پول می‌دهید.

آن‌ها fit شده‌اند، نه derived. هیچ نظریه‌ای αN=0.076\alpha_N = 0.076 تولید نمی‌کند. ثابت‌ها با tokenizer حرکت می‌کنند — به همین دلیل مقایسه perplexity میان دو tokenizer بی‌معناست، همان‌طور که فصل 8 توضیح داد — و با ترکیب داده، معماری و optimiser. هر قانون منتشرشده قانون setupی است که آن را تولید کرده، و به همین دلیل Meta پیش از Llama 3 قانون خودش را دوباره fit کرد.5

آن‌ها برای هر step یک token تازه فرض می‌کنند، که بی‌سروصدا corpus نامتناهی را فرض می‌گیرد. Muennighoff و همکاران اندازه گرفتند وقتی corpus تمام می‌شود چه رخ می‌دهد: تا چهار epoch داده تکراری تقریباً هیچ هزینه‌ای ندارد — یک مدل 8.7 میلیارد پارامتری روی 44 میلیارد token یکتا که چهار بار دیده شدند، فقط «0.5٪ زیان اعتبارسنجی بالاتر» از همان مدل روی 178 میلیارد token یکتا تمام شد — درحالی‌که بعد از حدود شانزده epoch، compute اضافی دیگر چیزی نمی‌خرد.9

و دیگر هیچ‌کس compute-optimal آموزش نمی‌دهد. Chinchilla هزینه آموزش را کمینه می‌کند؛ مدل deployشده سپس برای هر token تولیدشده، تا ابد، تقریباً 2N2N FLOP می‌پردازد. LLaMA 1 صریح گفت: «با داشتن سطح هدفی از عملکرد، مدل ترجیحی سریع‌ترین برای آموزش نیست، بلکه سریع‌ترین در inference است».10 Sardana و همکاران آن را با کمینه‌کردن 6NDtrain+2NDinference6ND_{\text{train}} + 2ND_{\text{inference}} رسمی کردند، و دریافتند هرکس انتظار یک میلیارد درخواست دارد باید «کوچک‌تر و طولانی‌تر از Chinchilla-optimal» آموزش دهد.11 §9.1 در Llama 3 موافق است: مدل‌های کوچک آن «بسیار فراتر از نقطه آموزش compute optimal آموزش می‌بینند، و عملاً compute آموزش را با کارایی inference معاوضه می‌کنند».5 نسبت منسوخ نیست؛ به پرسشی جواب می‌دهد که دیگر همان پرسش مطرح‌شده نیست.

توانایی‌های emergent، و بحث اینکه آیا واقعی‌اند

لینک به بخش: توانایی‌های emergent، و بحث اینکه آیا واقعی‌اند

زیان نرم پایین می‌آید. امتیازهای benchmark گاهی نه. Wei و همکاران نمونه‌هایی گرد آوردند که در آن‌ها یک task در چندین مرتبه بزرگی از compute آموزش در حد شانس می‌ماند و سپس می‌پرد — حساب سه‌رقمی در GPT-3 حوالی 2×10222 \times 10^{22} FLOP ظاهر می‌شود، MMLU میان 33 و 5×10235 \times 10^{23} از حد حدس بالاتر می‌رود — و الگو را نام‌گذاری کردند: «یک توانایی emergent است اگر در مدل‌های کوچک‌تر حاضر نباشد اما در مدل‌های بزرگ‌تر حاضر باشد».12 اگر این یک ویژگی واقعی باشد، extrapolate کردن از آزمایش‌های ارزان ناامن است، چون قابلیتی که می‌خرید شاید در هیچ مقیاسی که توان آزمودنش را دارید وجود نداشته باشد.

Schaeffer، Miranda و Koyejo استدلال کردند که بیشتر آن artifact اندازه‌گیری است، و سازوکارش حساب است.13 زیان per-token نرم پایین می‌آید، پس احتمال درست‌بودن یک token، exp(L)\exp(-\mathcal{L})، تدریجاً بهتر می‌شود. مدل را با exact string match روی پاسخی LL-tokenی امتیاز بدهید و آن احتمال را به توان LL می‌رسانید — منحنی نرم وقتی به توان بزرگ برسد شبیه پرتگاه می‌شود. روی همان خروجی‌ها metricی بگذارید که به‌جای طلب‌کردن همه آن‌ها، tokenها را می‌شمارد، و «عملکرد خانواده با افزایش scale، نرم، پیوسته و پیش‌بینی‌پذیر بهتر می‌شود».

عدد مهم در audit آن‌ها این است — «از 39 metric ترجیحی در BIG-Bench، حداکثر 5 مورد emergence نشان می‌دهند»، با دو metric ناپیوسته که بیش از 92٪ موارد ادعایی را توضیح می‌دهند — و هشدارشان هم مهم است: «هیچ‌چیز در این مقاله نباید به این معنی تفسیر شود که مدل‌های زبانی بزرگ نمی‌توانند توانایی‌های emergent نشان دهند». پرش در نمودار تا وقتی خلافش نشان داده نشده، شاهدی درباره metric است. فصل 29 جایی است که این مشکل شما می‌شود، چون انتخاب metric با hard-cutoff تصمیمی است که بی‌آنکه متوجه شوید خواهید گرفت.

corpus بخشی از اجرای pretraining است که معادله‌ای به آن وصل نیست، و بیشتر تصمیم‌های پیامددار همان‌جاست. ماده خام یک web crawl است: آرشیو August 2026 در Common Crawl «2.14 میلیارد صفحه وب یا 360 TiB محتوای فشرده‌نشده» دارد، یک ماه از آن، رایگان برای دانلود.14 تقریباً هیچ‌کدام همان‌طور که هست قابل استفاده نیست. مقاله T5 می‌گوید crawl «تا حد زیادی از متن‌های بی‌معنا یا boiler-plate مثل منوها، پیام‌های خطا، یا متن تکراری تشکیل شده»، و pipeline C4 که معرفی کرد فهرستی از heuristicهای زمخت است — فقط خط‌هایی را نگه دار که به نشانه punctuation پایانی ختم می‌شوند، صفحه‌های کمتر از سه جمله را حذف کن، هر صفحه‌ای را که شامل آکولاد یا واژه‌ای از یک فهرست عمومی دشنام‌هاست حذف کن — و بیست ترابایت متن ماهانه را به حدود 750 GB تبدیل می‌کند.15

زمخت، دقیقاً کلمه درست است. Dodge و همکاران بررسی کردند این فیلترها چه چیزی را حذف می‌کنند و دیدند blocklist دشنام‌ها 42٪ از سندهای African-American English و 32٪ از Hispanic-aligned English را حذف می‌کند، در برابر 6.2٪ از White-aligned English، و corpusی می‌گذارد که 97.8٪ از دسته آخر است.16 قانونی که درباره dialect نظری نداشت، عملاً نظر داشت.

بعد deduplication، که خانه‌داری نیست: Lee و همکاران جمله‌ای 61واژه‌ای یافتند که در C4، 61,036 بار تکرار شده بود، و نشان دادند deduplication نرخ اینکه مدل‌ها «متن حفظ‌شده را بیرون بدهند» ده‌برابر کم می‌کند، از 1.9٪ tokenهای تولیدشده به 0.19٪.17 بااین‌حال، بیشتر همیشه بهتر نیست — تیم FineWeb در 96 crawl به‌صورت global deduplicate کرد، 4 تریلیون token گرفت و هیچ بهبود قابل اندازه‌گیری ندید، سپس هر crawl را جداگانه deduplicate کرد، 20 تریلیون گرفت و با بهترین corpus موجود برابری کرد.18

بعد contamination. Llama 3 contamination خودش را اندازه گرفت و منتشر کرد: 98٪ از AGIEval، 95٪ از BIG-Bench Hard و 85٪ از HellaSwag با مجموعه آموزش در 8-gram هم‌پوشانی داشتند، و برای MMLU هم‌پوشانی آن‌قدر بالا بود که «برآورد خوب از افزایش عملکرد ناممکن است».5 §4 در GPT-3 از باگ فیلترینگی خبر می‌دهد که benchmarkها را در داده جا گذاشت و راه برگشتی نبود: «به‌دلیل ملاحظات هزینه، آموزش دوباره مدل infeasible بود».7

provenance بخش حل‌نشده است. The Pile یک مؤلفه 100.96 GiB به نام Books3 داشت — 12٪ از corpus و، طبق جدول consent خود مقاله، کتاب‌هایی از یک torrent tracker خصوصی؛19 در اوت 2023 پس از شکایت copyright آفلاین شد. وضعیت حقوقی تا سپتامبر 2026 حل‌نشده است، و سه رأی US که به‌عنوان trend نقل می‌شوند با هم اختلاف دارند. Alsup آموزش روی کتاب‌های به‌طور قانونی به‌دست‌آمده را «به‌شدت transformative» دانست و در عین حال گفت کتابخانه‌ای ساخته‌شده از نسخه‌های pirated چنین نیست، و Anthropic آن نیمه را با $1.5 میلیارد برای 482,460 اثر تسویه کرد، حدود $3,000 برای هر اثر، تأییدشده در 20 ژوئیه 2026.20 Chhabria به Meta summary judgment داد و هم‌زمان نوشت رأی او «به معنای این گزاره نیست که استفاده Meta از مواد دارای copyright برای آموزش مدل‌های زبانی‌اش قانونی است»، فقط اینکه «این plaintiffs استدلال‌های غلطی مطرح کردند».21 Bibas، در رأی علیه Ross Intelligence، یادآور شد که «امروز فقط AI غیرمولد در برابر من است».22 هیچ دادگاه تجدیدنظر US درباره این پرسش رأی نداده است.

آدم‌ها بخش‌هایی را انجام می‌دهند که زیان نمی‌تواند. TIME در ژانویه 2023 گزارش داد workerهایی که متن سمی را برای OpenAI از طریق شرکت Sama label می‌زدند، هنگام خواندن passageهایی درباره سوءاستفاده جنسی از کودک، شکنجه و خودآزاری، «بین حدود $1.32 و $2 در ساعت» دریافت می‌کردند، درحالی‌که OpenAI برای کار به Sama ساعتی $12.50 می‌پرداخت؛ Sama هم محدوده دستمزد و هم quota را رد می‌کند.23 این فیلترینگ پیرامون pretraining است نه خود pretraining — اما روی همان invoice می‌آید، و همان‌جایی است که یک انسان نشسته است.

برق واقعی است و معمولاً بد نقل می‌شود. دقیق‌ترین عدد منتشرشده برای BLOOM است: 1,082,990 GPU-hour، 433 MWh و 24.7 تن معادل CO₂ برای اجرا، و 50.5 با احتساب ساخت و گره‌های idle؛24 Patterson و همکاران GPT-3 را 1,287 MWh و 552 تن گذاشتند.25 دو هشدار. برتری BLOOM از شبکه برق هسته‌ای فرانسه با 57 g CO₂ برای هر kWh است نه از efficiency — انرژی بیشتری از OPT-175B مصرف کرد. و مشهورترین رقم انتشار این حوزه، 626,155 lb از Strubell و همکاران برای neural architecture search، بعداً نشان داده شد 88 برابر بیش از حد بالا بوده، چون فرض کرده بود search در اندازه کامل مدل اجرا شده درحالی‌که روی proxy اجرا شده بود.26 framing قابل دفاع LBNL این است: data centreهای US در 2024، 192 TWh مصرف کردند، 4.7٪ برق ملی — عددی مربوط به یک صنعت، نه یک اجرای مشخص.27

خط مشترک همان چیزی است که Bender و همکاران documentation debt نامیدند: «قرار دادن خودمان در وضعیتی که datasetها هم undocumented هستند و هم آن‌قدر بزرگ‌اند که پس از واقعه مستندسازی‌پذیر نیستند».28 هر واقعیت بالا وجود دارد چون کسی نگاه کرده است. برای corpusهای پشت مدل‌هایی که بیشتر مردم استفاده می‌کنند، هیچ‌کس نمی‌تواند.

حالا حسابی که همه می‌خواهند، از چهار ورودی cited، تا وقتی stale شدند معلوم باشد کدام را باید عوض کرد.

صفحه H100 شرکت NVIDIA، throughput برابر 1,979 teraFLOPS برای tensor-core BF16 را زیر footnoteی فهرست می‌کند که می‌گوید «with sparsity».29 هیچ اجرای pretraining از structured sparsity استفاده نمی‌کند، پس رقم dense نصف آن است: 989.5 TFLOP/s.

جدول 4 در Llama 3، 38–43٪ BF16 model FLOPs utilisation گزارش می‌کند. 40٪ بگیرید: 395.8 TFLOP/s حساب مفید برای هر GPU.5

قیمت on-demand در Lambda برای یک node 8×H100 SXM، بازدیدشده در 2026-09-06: $3.99 برای هر GPU-hour، پس $31.92 در ساعت برای node.30

نسبت Chinchilla، D=20ND = 20N، مقدار C=6ND=120N2C = 6ND = 120N^2 و بنابراین N=C/120N = \sqrt{C/120} را می‌دهد.

بودجهH100-hourFLOPپارامترهای compute-optimaltokenهاروی یک node 8×H100GPUها برای پایان در 90 روز
$100253.6e19546 M10.9 B3.1 h1
$1,0002513.6e201.73 B34.5 B31.3 h1
$10,0002,5063.6e215.46 B109 B13 روز2
$100,00025,0633.6e2217.3 B345 B131 روز12
$1,000,000250,6273.6e2354.6 B1.09 T4 سال116
$10,000,0002,506,2663.6e24173 B3.45 T36 سال1,160
$100,000,00025,062,6573.6e25546 B10.9 T358 سال11,603

دو ستون آخر را با هم بخوانید. با $10,000 یک مدل 5 میلیارد پارامتری را روی یک node اجاره‌ای در دو هفته می‌گیرید. با $100,000,000 حساب می‌گوید 546 میلیارد پارامتر — و دوازده هزار H100 که سه ماه به هم سیم‌کشی شده‌اند، چیزی که با کارت اعتباری اجاره نمی‌کنید. بعد از حدود $100,000، قید binding دیگر پول نیست، cluster است.

پیش از اعتماد به چنین جدولی، آن را در برابر اجراهایی آزمایش کنید که هزینه واقعی‌شان منتشر شده — llm.c، GPT-2 124M را در «~90 دقیقه» روی یک node 8×A100 «با حدود $20» بازتولید می‌کند، و GPT-2 1.6B را در 24 ساعت روی یک node 8×H100 با $672.31

TEXT
$672, against what $672 actually bought (llm.c GPT-2 1.6B, one 8xH100 node, 24 h)
  this table predicts:      168 H100-hours   N = 1.41 B params   D = 28.3 B tokens
  what was actually run:    192 H100-hours   N = 1.558 B params  D = 33.6 B tokens

Llama 3 405B, against Meta's own published GPU-hours
  from the paper's 3.8e25 FLOPs at 40 % MFU:   26.67 M H100-hours
  published in Meta's Llama 3.1 model card:    30.84 M H100-hours    ratio 0.86

هر دو در حدود 15٪، که تقریباً همان دقتی است که این نوع برآورد سزاوارش است و به‌مراتب بهتر از دقتی است که معمولاً با آن نقل می‌شود.

مقایسه تیترساز، با هر دو تعریف روی میز

لینک به بخش: مقایسه تیترساز، با هر دو تعریف روی میز

تکرارشونده‌ترین عدد در این موضوع این است که مدلی در کلاس GPT-2 که در 2019 حدود $43,000 هزینه داشت، امروز با چند ده دلار قابل بازتولید است. نیمه مدرن خوب مستند شده؛ نیمه تاریخی نه.

امروز. README مربوط به nanochat از Karpathy: «می‌توانید LLM با توان GPT-2 خودتان را ... فقط با $48 آموزش دهید (~2 ساعت node 8XH100 GPU) ... روی spot instance، هزینه کل می‌تواند نزدیک‌تر به ~$15 باشد.»32 «توان GPT-2» اینجا دقیق و منتشرشده است — شکست‌دادن CORE score برابر 0.256525 در GPT-2 — روی leaderboardی که بهترین entry آن تا 14 مارس 2026 برابر 1.65 ساعت است. $48 قیمت $3 برای هر GPU-hour را فرض می‌کند، کمتر از فهرست $3.99 در Lambda؛ با قیمت فهرست نزدیک‌تر به $64 است.

در 2019. هیچ منبع اولیه‌ای نیست: OpenAI هرگز duration یا cost منتشر نکرد. زنجیره از The Register، فوریه 2019، می‌گذرد که «256 Google TPU3 core» را بدون price و duration گزارش می‌کند؛ سپس Synced، ژوئن 2019، که می‌نویسد سخت‌افزار روی Google Cloud ساعتی $256 هزینه داشته و صریحاً می‌گوید «OpenAI مدت آموزش را مشخص نکرد». $43,008 یعنی $256 در ساعت ضرب‌در 168 ساعت فرضی که هیچ‌کس هرگز منبعش را نداده است.

پس تیتر صادقانه این است: مدلی که امتیاز benchmark منتشرشده GPT-2 را match می‌کند امروز با بسیار کمتر از $100 روی سخت‌افزار اجاره‌ای قابل آموزش است، در برابر هزینه‌ای در 2019 که هرگز منتشر نشد و برآورد مشهورش بر حدسی بی‌منبع درباره duration تکیه دارد. سقوط واقعی است و نیمه مدرن را هرکس کارت اعتباری داشته باشد می‌تواند بازتولید کند؛ نسبت حساب روی عددی است که وجود ندارد. این به‌طور کلی وضعیت هزینه‌های منتشرشده آموزش است. مقاله GPT-3 اصلاً هیچ مبلغ دلاری ندارد، فقط 3.14×10233.14 \times 10^{23} FLOP در جدول D.1؛7 مقاله Llama 3 هم هیچ‌کدام ندارد.5 هر هزینه آموزشی که خوانده‌اید برآوردی است از یک FLOP count، یک فرض سخت‌افزاری و یک فرض قیمت — همیشه ارزش دارد بپرسید فرضِ چه کسی.

یک مدل پایه چه می‌داند، و چه زمانی دانستنش متوقف شد

لینک به بخش: یک مدل پایه چه می‌داند، و چه زمانی دانستنش متوقف شد

آنچه بیرون می‌آید یک corpus ثابت را دیده که در لحظه‌ای ثابت assembled شده، و دو ویژگی از آن دنبال می‌شود.

اولی knowledge cutoff است. پس از تاریخ گردآوری، مدل هیچ‌چیز نمی‌داند — نه «نامطمئن است»، هیچ‌چیز — و به‌جای اینکه چنین بگوید، روان confabulate می‌کند، چون گفتن چنین چیزی هرگز رفتاری نبوده که روی آن آموزش دیده باشد. model card در Llama 3.1 دسامبر 2023 را می‌دهد؛33 هر مدل یکی دارد، و این ویژگی داده آموزش است، نه deployment. دورزدن آن مسئله retrieval است، که فصل 19 است.

دومی این است که مدل پایه کامل می‌کند نه پاسخ. به آن بدهید «پایتخت فرانسه چیست؟» و یک ادامه محتمل سؤال دیگری است، چون در corpus این رشته اغلب در فهرستی از تمرین‌ها ظاهر می‌شود.

یک کامل‌کننده متن assistant نیست. از دستورها پیروی نمی‌کند، چون هیچ‌چیز در corpus به آن نگفته بود یک درخواست باید اطاعت شود نه ادامه داده شود. هیچ تصوری از گفت‌وگو با دو شرکت‌کننده ندارد. با خوشحالی محتمل‌ترین ادامه یک prompt آسیب‌زا را تولید می‌کند، چون محتمل تنها چیزی است که برایش optimise شده بود.

تبدیل آن به چیزی که پاسخ می‌دهد مرحله دومی می‌خواهد که کسری از یک درصد مرحله اول هزینه دارد، و تقریباً کامل از نشان‌دادن نمونه‌هایی از رفتاری که می‌خواهید و سپس مقایسه جفت‌هایی از خروجی‌های خودش تشکیل شده است. instruction following، chat templateها، refusalها و — چیزی که آدم‌ها را غافلگیر می‌کند — توانایی call کردن tool همه از همان مرحله می‌آیند. فصل 11 همان مرحله است: supervised fine-tuning، RLHF، DPO و GRPO، و این پرسش که «aligned» یعنی چه و چه کسی تصمیم می‌گیرد.


خواندن این‌ها در کنار این فصل هم ارزش دارد: build-nanogpt از Karpathy و ویدیوی همراهش، که یک بازتولید کامل GPT-2 را end to end با سرعتی طی می‌کنند که این فصل نمی‌تواند؛ و Stanford CS324، Large Language Models، که lectureهایش درباره داده و اثر زیست‌محیطی از بخش بالا عمیق‌تر وارد موادی می‌شوند که این دوره یک‌بار به آن‌ها می‌پردازد و سپس واگذار می‌کند.

  1. Kaplan، J.، McCandlish، S.، Henighan، T.، Brown، T. B.، Chess، B.، Child، R.، Gray، S.، Radford، A.، Wu، J. و Amodei، D. Scaling Laws for Neural Language Models. arXiv:2001.08361 (2020). سه power law معادلات (1.1)–(1.3) در §1.2 هستند و ثابت‌های کامل در Appendix A، جدول 5؛ استنتاج 6N6N در §2.1 است؛ توان‌های compute-allocation در جدول 6. توجه کنید دو قانون compute وجود دارد، αC=0.057\alpha_C = 0.057 در batch size ثابت و αCmin=0.050\alpha_C^{\min} = 0.050 در batch size بهینه؛ مقاله می‌گوید دومی «باید برای پیش‌بینی استفاده شود». 2

  2. Hoffmann، J.، Borgeaud، S.، Mensch، A.، Buchatskaya، E.، Cai، T.، Rutherford، E. و همکاران. Training Compute-Optimal Large Language Models. arXiv:2203.15556 (2022). توان‌ها در جدول 2، بودجه‌های projected در جدول 3، مقایسه Gopher در §4، convention شمارش پارامتر در Appendix F. prose زیر جدول 3 با خود جدول 3 برای ردیف‌های 175 B و 280 B اختلاف دارد؛ نسخه قابل نقل جدول است. 2 3 4

  3. Micikevicius، P.، Narang، S.، Alben، J.، Diamos، G.، Elsen، E.، Garcia، D. و همکاران. Mixed Precision Training. arXiv:1710.03740 (2017)، ICLR 2018. وزن‌های master در FP32 در §3.1، loss scaling در §3.2. 2

  4. Rajbhandari، S.، Rajbhandari، S.، Ruwase، O. و He، Y. ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054 (2019)، SC20. حسابداری 16Ψ16\Psi در §3.1 است؛ ارقام حالت باقی‌مانده برای activationها در §3.2.

  5. Grattafiori، A. و همکاران. (Llama Team، AI @ Meta). The Llama 3 Herd of Models. arXiv:2407.21783 (2024). بودجه compute و شمار token در §1، قانون مقیاس‌پذیری refitted در §3.2.1، پیکربندی parallelism و MFU در جدول 4، تحلیل contamination در §5.1.4، بیان over-training در §9.1. مقاله هیچ رقم دلاری و هیچ جدول emissions ندارد. 2 3 4 5 6

  6. Stanford CS336، Language Modeling from Scratch. Lecture 2 حسابداری منابع را پوشش می‌دهد، lectureهای 5–8 GPUها، kernelها و parallelism را، lectureهای 9 و 11 scaling را، lectureهای 13–14 داده را. این همان دوره‌ای است که این فصل مهندسی‌اش را به آن واگذار می‌کند، و عمومی است.

  7. Brown، T. B. و همکاران. Language Models are Few-Shot Learners. arXiv:2005.14165 (2020). compute در Appendix D، جدول D.1 — که ستونی دارد با عنوان لفظی «flops per param per token»، و مقدارش برای هر ردیف GPT-3 برابر 6 است. تحلیل contamination در §4. 2 3

  8. Besiroglu، T.، Erdil، E.، Barnett، M. و You، J. Chinchilla Scaling: A replication attempt. arXiv:2404.10102 (2024). داده‌های Chinchilla را با digitising شکل 4 بازسازی می‌کند، دوباره fit می‌کند، و توان‌های اصلاح‌شده و بازه‌های بسیار عریض‌تر را گزارش می‌دهد.

  9. Muennighoff، N.، Rush، A. M.، Barak، B.، Le Scao، T.، Piktus، A.، Tazi، N.، Pyysalo، S.، Wolf، T. و Raffel، C. Scaling Data-Constrained Language Models. arXiv:2305.16264 (2023)، NeurIPS 2023. نتیجه چهار epoch در §6؛ نیمه‌عمر شانزده epoch همان RD15R_D^* \approx 15 fitted است.

  10. Touvron، H.، Lavril، T.، Izacard، G.، Martinet، X.، Lachaux، M.-A.، Lacroix، T. و همکاران. LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 (2023). §1 استدلال inference-cost علیه آموزش Chinchilla-optimal را بیان می‌کند.

  11. Sardana، N.، Portes، J.، Doubov، S. و Frankle، J. Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws. arXiv:2401.00448 (2023)، ICML 2024. §5 آن‌ها counterweight را هم دارد: مدل‌هایی که با نسبت‌های token بسیار شدید آموزش می‌بینند همچنان بهتر می‌شوند، اما «آهسته‌تر از آنچه قوانین مقیاس‌پذیری پیش‌بینی می‌کنند».

  12. Wei، J.، Tay، Y.، Bommasani، R.، Raffel، C.، Zoph، B.، Borgeaud، S. و همکاران. Emergent Abilities of Large Language Models. arXiv:2206.07682 (2022)، TMLR. تعریف در §2، نمونه‌ها و آستانه‌های compute در §3–4 و جدول 1.

  13. Schaeffer، R.، Miranda، B. و Koyejo، S. Are Emergent Abilities of Large Language Models a Mirage? arXiv:2304.15004 (2023)، مقاله برجسته NeurIPS 2023. استدلال metric در §2، meta-analysis BIG-Bench در §4، مثال vision ساخته‌شده در §5.

  14. Common Crawl، August 2026 Crawl Archive Now Available (CC-MAIN-2026-34)، منتشرشده 24 اوت 2026، بازدید 2026-09-06. front page خودش ادعا می‌کند «بیش از 300 میلیارد صفحه در 15 سال»، «در مجموع بیش از 10 petabytes» — رقمی برای کل آرشیو، نه crawl ماهانه قیمت‌گذاری‌شده اینجا.

  15. Raffel، C.، Shazeer، N.، Roberts، A.، Lee، K.، Narang، S.، Matena، M.، Zhou، Y.، Li، W. و Liu، P. J. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683 (2019)، JMLR 21(140). فیلترهای C4 در §2.2 هستند. مقاله اندازه‌ها را بر حسب byte می‌دهد، نه token؛ رقم 156 میلیارد token که زیاد به آن نسبت داده می‌شود از Dodge و همکاران زیر است.

  16. Dodge، J.، Sap، M.، Marasović، A.، Agnew، W.، Ilharco، G.، Groeneveld، D.، Mitchell، M. و Gardner، M. Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758 (2021)، EMNLP 2021. نرخ‌های حذف dialect در §5.3؛ benchmark contamination در C4 در §4.2.

  17. Lee، K.، Ippolito، D.، Nystrom، A.، Zhang، C.، Eck، D.، Callison-Burch، C. و Carlini، N. Deduplicating Training Data Makes Language Models Better. arXiv:2107.06499 (2021)، ACL 2022. 61,036 تکرار در footnote 1 است؛ ارقام memorisation در §6.2، جدول 4 هستند، و درصدی از tokenهای تولیدشده تحت معیار exact-match پنجاه tokenی‌اند.

  18. Penedo، G.، Kydlíček، H.، Ben Allal، L.، Lozhkov، A.، Mitchell، M.، Raffel، C.، Von Werra، L. و Wolf، T. The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale. arXiv:2406.17557 (2024)، NeurIPS 2024 Datasets and Benchmarks. نتیجه deduplication در §3.4 است. dataset منتشرشده از آن زمان از 15 تریلیون token مقاله گذشته است.

  19. Gao، L.، Biderman، S.، Black، S. و همکاران. The Pile: An 800GB Dataset of Diverse Text for Language Modeling. arXiv:2101.00027 (2020). Books3 در §2.3 و جدول 1 است؛ جدول consent، جدول 5 است. corpus برابر 825.18 GiB است، پس حتی عنوان هم رو به پایین گرد شده است.

  20. Bartz v. Anthropic، No. 4:24-cv-05417 (N.D. Cal.). دستور fair-use در 23 ژوئن 2025 (Dkt. 231)؛ class certification در 17 ژوئیه 2025؛ final approval and judgment در 20 ژوئیه 2026 (Dkt. 680). settlement فقط ورودی‌های گذشته را آزاد می‌کند، نه خروجی‌ها و نه رفتار آینده.

  21. Kadrey v. Meta، No. 3:23-cv-03417-VC (N.D. Cal.)، summary judgment در 25 ژوئن 2025 (Dkt. 598). توجه کنید ادعای distribution درباره torrenting تصمیم‌گیری نشد و همچنان live است.

  22. Thomson Reuters v. ROSS Intelligence، No. 1:20-cv-00613-SB (D. Del.)، revised opinion در 11 فوریه 2025 (Dkt. 770)، Bibas J. در interlocutory appeal به Third Circuit (No. 25-2153)، argued در 11 ژوئن 2026، در زمان نگارش undecided.

  23. Perrigo، B. Exclusive: OpenAI Used Kenyan Workers on Less Than $2 Per Hour to Make ChatGPT Less Toxic. TIME، 18 ژانویه 2023. $2 سقف برای reviewerهای ارشدی است که همه targetها را زده بودند؛ labellerهای junior، اکثریت، $1.32 دریافت می‌کردند. rebuttal شرکت Sama، نقل‌شده در همان مقاله، $1.46–$3.74 و quota پایین‌تری می‌دهد.

  24. Luccioni، A. S.، Viguier، S. و Ligozat، A.-L. Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language Model. arXiv:2211.02001 (2022)، JMLR 24(253). جدول‌های 1 و 3.

  25. Patterson، D.، Gonzalez، J.، Le، Q.، Liang، C.، Munguia، L.-M.، Rothchild، D.، So، D.، Texier، M. و Dean، J. Carbon Emissions and Large Neural Network Training. arXiv:2104.10350 (2021). ارقام GPT-3 در جدول 4 هستند؛ اصلاح برآورد NAS در §4.1.

  26. Strubell، E.، Ganesh، A. و McCallum، A. Energy and Policy Considerations for Deep Learning in NLP. arXiv:1906.02243 (2019)، ACL 2019. دقیقاً به‌خاطر اتفاقی که برای نقل‌شده‌ترین عددش افتاد ارزش خواندن دارد: مقاله دقیق است، extrapolation خود را بیان می‌کند، و بااین‌حال در همان خطی که همه تکرار کردند دو مرتبه بزرگی خطا داشت.

  27. Smith، S. J.، Hubbard، A.، Newkirk، A.، Ganeshalingam، M.، Holecek، B.، Sartor، D.، Mills، M. و Shehabi، A. United States Data Center Energy Usage Report: 2025 Update. LBNL-2001758 (18 ژوئن 2026). این گزارش سری تاریخی را نسبت به گزارش 2024 که زیاد نقل می‌شد رو به پایین بازبینی می‌کند؛ اگر رقم 176 TWh برای 2023 را نقل می‌کنید، دارید نسخه superseded را نقل می‌کنید.

  28. Bender، E. M.، Gebru، T.، McMillan-Major، A. و Shmitchell، S. On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? FAccT '21، pp. 610–623. DOI 10.1145/3442188.3445922. «documentation debt» در §4.4 است. توجه کنید ارقام carbon خود مقاله از Strubell و همکاران cited شده و اصلاح بالا را به ارث می‌برد — که بیشتر illustration استدلال آن است تا refutation آن.

  29. NVIDIA. صفحه محصول NVIDIA H100 Tensor Core GPU، nvidia.com/en-us/data-center/h100/ (بازدید 2026-09-06). هر ردیف tensor-core در آن صفحه جز FP64 footnote «with sparsity» دارد؛ رقم dense BF16 که اینجا استفاده شده نصف 1,979 TFLOPS منتشرشده است.

  30. Lambda. GPU Cloud pricing، lambda.ai/pricing (بازدید 2026-09-06). On-demand، برای هر GPU در هر ساعت، پیش از مالیات. قیمت‌ها در این بخش سریع‌تر از هر چیز دیگری در این دوره stale می‌شوند؛ حساب پیرامونشان نه.

  31. Karpathy، A. karpathy/llm.c، discussion #481، Reproducing GPT-2 (124M) in llm.c in 90 minutes for $20 (28 مه 2024)، و discussion #677، Let's reproduce GPT-2 (1.6B): one 8XH100 node, 24 hours, $672, in llm.c (11 ژوئیه 2024).

  32. Karpathy، A. karpathy/nanochat، README و leaderboard «time to GPT-2» (بازدید 2026-09-06). رقم $48 و تعریف CORE-score از «GPT-2 capability» هر دو در README هستند؛ خود speedrun.sh مخزن می‌گوید «تقریباً 1.5 ساعت»، پس رقم دو ساعت را گرد شده بدانید.

  33. Meta. Llama 3.1 model card، models/llama3_1/MODEL_CARD.md در meta-llama/llama-models (بازدید 2026-09-06). منبع 30.84 M H100-hour برای مدل 405 B، کل 39.3 M، رقم 11,390 tCO2eq location-based، و data cutoff دسامبر 2023.


تهیه‌شده توسط

David Vicente Campos

بنیان‌گذار NeuraLIA Labs و هم‌بنیان‌گذار MyRealFood

من مهندس کامپیوتر و فارغ‌التحصیل دانشگاه لئون هستم. هم‌بنیان‌گذار MyRealFood بودم، جایی که به‌عنوان مدیر ارشد فناوری اپلیکیشنی را ساختم که میلیون‌ها نفر برای سالم‌تر غذا خوردن از آن استفاده کرده‌اند، و NeuraLIA Labs را بنیان‌گذاری کردم؛ جایی که محصولات هوش مصنوعی می‌سازم. اینجا از چیزهایی می‌نویسم که در طول مسیر باید می‌فهمیدم، همان‌طور که دوست داشتم کسی برایم توضیح می‌داد.

بیشتر درباره نویسنده

منتشرشده توسط NeuraLIA Labs.

پست‌های جدید را در ایمیل خود دریافت کنید

اخبار AI، راهنماها و به‌روزرسانی‌های محصول — هر وقت چیزی ارزشمند منتشر کنیم، یک ایمیل کوتاه می‌فرستیم.

فهرست دوره

Abstract software decision engine with branching paths, probability nodes, and glowing gates.
jev12 دقیقه مطالعه

مدل هوش مصنوعی Jev برای تصمیم ساخته شده، نه نثر

Jev از TypeSafe AI توجه‌ها را جلب کرده چون هوشمندی نرم‌افزار را مسئله‌ای احتمالاتی می‌بیند: شاخه درست را انتخاب کنید، میزان اطمینان را کنار آن بگذارید، و وقتی کد به یک تصمیم نیاز دارد برای نوشتن متن به یک LLM پول ندهید.

Abstract agent runtime sorting documents, memory blocks and pointer nodes inside a bounded context frame.
context-engineering13 دقیقه مطالعه

مهندسی کانتکست برای عامل‌های AI بلندافق

عامل‌های طولانی‌اجرا فقط به‌خاطر کوچک بودن پنجره شکست نمی‌خورند. وقتی فایل‌ها، خروجی ابزارها و تاریخچهٔ کهنه وظیفه‌ای را که عامل قرار بود تمام کند کنار می‌زنند، شکست رخ می‌دهد.

آماده‌اید انتخاب مدل را به LIA بسپارید؟

با همه مدل‌های هوش مصنوعی در یک جا بسازید — همین امروز رایگان شروع کنید.