Pretraining ל-LLM: נתונים, חישוב, חוקי scaling ועלות
עשרים מודלים אומנו על GPU של לפטופ כדי למדוד scaling law, ואומדן 6ND נבדק מול מונה FLOP אמיתי.
בעמוד הזה
פרק 9 הסתיים בבלוק transformer שמתאמן. עורמים כמה כאלה, מכוונים את אובדן ה-next-token של פרק 8 אל הפלט, ואין עוד מה להמציא. כל מה שנשאר הוא רכישה.
זה שינוי גדול יותר מכפי שזה נשמע. כל פרק עד עכשיו שאל האם זה לומד? — שאלה של כן או לא שלפטופ פותר בעשר דקות. הפרק הזה שואל שאלה שיש בה כסף: בהינתן כמות קבועה של אריתמטיקה, מהו המודל הטוב ביותר שאני יכול לקנות? התשובה היא נוסחה, וב-2018 היא לא הייתה מובנת מאליה לאיש.
הנה התשובה לשאלה הזאת, במדידה, על GPU אחד של לפטופ. עשרים מודלים, מ-98,624 עד 15 מיליון פרמטרים, אומנו מאפס על 174 מיליון tokens מוויקיפדיה — אוצר מילים BPE של 2,048 tokens שאומן כפי שפרק 7 מאמן אחד, וה-transformer של פרק 9. כל הרצה קיבלה בדיוק אחד משלושה תקציבי חישוב ולא פעולה אחת יותר, כך שמודל גדול יותר בהכרח קורא פחות טקסט. אובדן ה-held-out הטוב ביותר שהושג בכל תקציב:
budget C (FLOPs) best loss reached by a model of
1.00e13 5.3531 98,624 params
3.16e13 4.8638 98,624 params
1.00e14 4.3383 295,808 params
fitted: L = (Cc / C)^0.0913 over one decade of computeפי עשרה אריתמטיקה מורידים 19% מהאובדן, ושלוש הנקודות יושבות על קו ישר ב-log-log. שום דבר בתשעת הפרקים הראשונים לא חוזה את זה. אין מאחורי זה משפט מתמטי — זו סדירות אמפירית, עם מעריך אחר לאורך עשרה סדרי גודל בין הלפטופ הזה לבין datacentre, וזו התצפית היחידה ששכנעה תעשייה להוציא תמ״ג של מדינה קטנה על GPUs.
מהו pretraining, ומה חדש בו
קישור למקטע: מהו pretraining, ומה חדש בושום דבר במטרה לא משתנה. המודל עדיין חוזה את ה-token הבא, האובדן הוא עדיין ה-cross-entropy של פרק 4 המוחל על הפירוק של פרק 8, והאופטימייזר הוא עדיין AdamW של פרק 6. Pretraining אינו אלגוריתם חדש; זה אותו אלגוריתם שמורץ על קורפוס גדול מספיק כדי שההרצה תדרוש תקצוב. שני דברים מאפשרים זאת: התוויות בחינם, כי היעד עבור המיקום הוא ה-token ב- וכבר נמצא בטקסט; והסעיף האחרון בפרק 6 הסיר את ההתנגדות, מפני שמודל עם הרבה יותר פרמטרים ממה שהכללים הקלאסיים מאפשרים אינו מתפרק — הוא משתפר. מה שיוצא הוא מודל בסיס — דבר שממשיך טקסט ולא עונה.
ספירת החישוב לפני שמוציאים אותו: 6ND
קישור למקטע: ספירת החישוב לפני שמוציאים אותו: 6NDלפני שאפשר לתקצב משהו מכל זה צריך לספור אותו, והתחום סופר אותו בעזרת נוסחה אחת:
כאשר הוא מספר הפרמטרים, הוא מספר ה-training tokens ו- הוא סך פעולות הנקודה הצפה. Kaplan ואחרים גוזרים זאת בשני שלבים.1 Forward: 2 FLOPs לכל פרמטר לכל token, מכיוון שכל פרמטר בכפל מטריצות משמש פעם אחת לכל token, בכפל אחד ובחיבור אחד. Backward: פי שניים מה-forward, מכיוון שה-backward pass של פרק 5 מחשב שני gradients בכל שכבה — ביחס ל-קלטים של השכבה, כדי שהאות ימשיך לנוע, וביחס ל-משקלים שלה — כל אחד מהם כפל מטריצות בגודל של ה-forward, ולכן .
זו כל הגזירה, וכדאי לבדוק אותה ולא רק להאמין. PyTorch מגיעה עם מונה FLOP אמיתי, torch.utils.flop_counter.FlopCounterMode, שמיירט כל פעולה שמודל שולח ומסכם את העבודה בפועל. מריצים אותו על פני ארבעה סדרי גודל, הגדול שבהם על התקן meta, שמקצה צורות וללא זיכרון:
from torch.utils.flop_counter import FlopCounterMode
counter = FlopCounterMode(display=False)
with counter:
loss = model(x, targets)[1]
loss.backward()
measured = counter.get_total_flops()
print(measured / (6 * n_params * n_tokens))| תצורה | ללא embeddings | סך הכול | נמדד, fwd+bwd | ÷ (סך ) | ÷ (ללא emb.) | fwd+bwd ÷ fwd |
|---|---|---|---|---|---|---|
| 128, 4 שכבות, 256 | 788,736 | 7,254,400 | 4.60e10 | 1.031 | 9.485 | 3.000 |
| 512, 8 שכבות, 256 | 25,183,232 | 51,045,888 | 3.26e11 | 1.038 | 2.104 | 3.000 |
| 768, 12 שכבות, 1024 | 84,973,056 | 124,356,864 | 1.75e12 | 1.145 | 1.676 | 3.000 |
| 1600, 48 שכבות, 1024 | 1,474,870,400 | 1,556,920,000 | 2.10e13 | 1.100 | 1.161 | 3.000 |
| 4096, 32 שכבות, 2048 | 6,442,983,424 | 6,582,444,032 | 8.74e13 | 1.080 | 1.104 | 3.000 |
| 8192, 80 שכבות, 8192 | 64,427,147,264 | 65,544,929,280 | 3.75e15 | 1.163 | 1.183 | 3.000 |
היחס forward+backward על פני forward הוא 3.000, בדיוק, בכל קנה מידה: לא קירוב שבמקרה טוב, אלא הזהות האריתמטית שלמעלה מוחזרת כמספר עגול על ידי מונה שאינו יודע דבר על הגזירה.
לאחר מכן הסך הנמדד יושב בין 3% ל-17% מעל , ברגע ש- סופר את מטריצות ה-embedding — והסעיף הזה חשוב, כי שני המאמרים המייסדים סופרים את אחרת. Kaplan מוציא מן החשבון את ״כל ה-vocabulary וה-positional embeddings״ כי כך ״מתקבלים scaling laws נקיים משמעותית״ (§1.3); Appendix F של Chinchilla אומר ״אנחנו סופרים גם embedding matrices במספר הפרמטרים הכולל״.2 עבור vocabulary רחב וממד חבוי צר, ההבדל הוא פי תשעה, כפי שמראה השורה הראשונה.
הפער שנותר הוא מה ש- משמיט במכוון: ציוני ה-attention. משוואה (2.2) של Kaplan כותבת את עלות ה-forward כ- ומשמיטה את האיבר השני כי — בטוח ב-2020, פחות בטוח עכשיו, וזו הסיבה שהיחס מטפס כאשר גדל — ולכן שתי שורות כאן חולקות של 1,024 והיחס יורד, מ-1.145 ל-1.100, כאשר עולה מ-768 ל-1,600. זו עלות ה- שפרק 9 הציג ופרק 16 הופך למחיר.
זיכרון: מה באמת חייב להיכנס
קישור למקטע: זיכרון: מה באמת חייב להיכנסCompute קובע כמה זמן הרצה אורכת; זיכרון קובע אם היא יכולה להתחיל. מאמנים עם fp32 AdamW פשוט, וכל פרמטר נושא ארבעה מספרים: המשקל, ה-gradient שלו, והממוצע הנע והשונות של Adam — שני הממוצעים שבנינו ביד בפרק 6. ארבעה מספרים בארבעה בתים כל אחד הם 16 בתים לפרמטר, לפני activation יחיד. נמדד על GPU לפטופ של 8 GB, לפי ההקצאה התושבת בנקודה בצעד שבה אין גרף חי:
| מודל | vocabulary | batch | חזוי | תושב נמדד | שיא בצעד | ההפרש | |
|---|---|---|---|---|---|---|---|
| 512, 8 שכבות | 50,257 | 8 | 51,045,888 | 779 MB | 801 MB | 2,500 MB | 1,699 MB |
| 512, 8 שכבות | 4,096 | 8 | 27,411,456 | 418 MB | 426 MB | 1,043 MB | 617 MB |
| 256, 6 שכבות | 4,096 | 8 | 5,839,360 | 89 MB | 89 MB | 382 MB | 293 MB |
| 256, 6 שכבות | 4,096 | 32 | 5,839,360 | 89 MB | 89 MB | 1,259 MB | 1,170 MB |
| 256, 6 שכבות | 4,096 | 128 | 5,839,360 | 89 MB | 89 MB | 4,771 MB | 4,681 MB |
התחזית והמדידה מסכימות בטווח של 3%. ההפתעה היא העמודה האחרונה: ה-activations מגמדות את המודל. אותו מודל של 5.8 מיליון פרמטרים שצריך 89 MB של מצב מתמיד צריך 4,681 MB של activations ב-batch של 128 — פי חמישים ושניים מהמודל — והרבה מזה בכלל אינו ה-transformer. אלה ה-logits, וקטור אחד בגודל ה-vocabulary לכל token בארבעה בתים לכל כניסה: 512 MB בשורה האחרונה, 393 MB בראשונה. גודל ה-vocabulary נבחר בפרק 7, והוא עדיין קובע מה נכנס לכרטיס.
איזה איבר שולט תלוי בצורה של ההרצה, ולכן Micikevicius ואחרים אומרים שהזיכרון ״נשלט על ידי activations״3 ואילו ZeRO אומר שמודל של 1.5 מיליארד פרמטרים צריך ״לפחות 24 GB״ רק למצבי המודל.4 ZeRO מגיע לאותם 16 בתים במסלול אחר — למשקלי fp16, ל-gradients ב-fp16, כל אחד למשקלי master ב-fp32 ולשני המומנטים של Adam — וזה עבור 70 מיליארד פרמטרים הוא 1.12 טרה-בייט, ארבעה-עשר GPUs של 80 GB עוד לפני activation יחיד.
Parallelism, בפסקה אחת ובהאצלה אחת
קישור למקטע: Parallelism, בפסקה אחת ובהאצלה אחתשום דבר מזה לא נכנס להתקן אחד בקנה מידה חזיתי, ולכן ההרצה מפוצלת בארבע דרכים בבת אחת. Data parallelism שם עותק של המודל על כל GPU וממצע את ה-gradients — ברירת המחדל, וזו ש-ZeRO משפר בכך שהוא מסרב לשמור עותקים עודפים של מצב האופטימייזר. Tensor parallelism מפצל מטריצות יחידות בין התקנים. Pipeline parallelism נותן לכל התקן קבוצת שכבות רציפה. Context parallelism מפצל את הרצף עצמו, ונחוץ רק כש- ארוך מספיק כדי שאיבר ה-attention ישלוט. טבלה 4 של Llama 3 מונה את כל הארבע יחד: tensor 8, context עד 16, pipeline 16, data עד 128, על פני 16,384 GPUs מסוג H100.5 זה כל מה שהקורס הזה יאמר על כך; הנדסת training מבוזר היא סמסטר בפני עצמו, ו-CS336 של Stanford הוא הסמסטר הזה, הרצאות 5 עד 8, עם הקוד.6 מה שנשאר מההאצלה הוא מספר אחד, model FLOPs utilisation — החלק משיא האריתמטיקה של GPU שהרצה אמיתית משיגה — והוא מה שהופך את המסודר לזמן שעון ולכן לכסף.
Kaplan, וההימור שהתעשייה עשתה
קישור למקטע: Kaplan, וההימור שהתעשייה עשתהבינואר 2020, Kaplan ואחרים אימנו גריד של transformers ומצאו שאובדן הבדיקה עוקב אחרי חוק חזקה בכל אחד משלושת המשאבים על פני יותר משישה סדרי גודל.1 §1.2 שלהם נותן שלושה חוקים מותאמים:
עם בני לוויה לנתונים ו- ל-compute מוקצה אופטימלית. הקבועים אינם אוניברסליים, והמאמר אומר זאת: ״הערכים המספריים המדויקים של , ו- תלויים בגודל ה-vocabulary וב-tokenization ולכן אין להם משמעות יסודית.״
המעריכים זעירים: פי עשרה פרמטרים קונים גורם מהאובדן שנותר. זה נשמע כמו כלום, וזה העובדה החשובה ביותר כאן — התשואות גרועות והן לעולם לא נעצרות. חוק חזקה עם מעריך קטן מבטיח שסדר הגודל הבא יעזור, פחות מהקודם, לנצח. קניית compute מפסיקה להיות הימור והופכת לרכישה עם שער חליפין מפורסם, וזה בדיוק הטיעון ששחרר את ההון.
ואז בא המרשם, וכאן המאמר טעה באופן שעלה לתעשייה הרבה מאוד כסף. טבלה 6 של Kaplan נותנת ו-: פי עשרה compute פירושו מודל גדול פי 5.4 שמוזן רק פי 1.9 יותר טקסט. התקציר מפורש — ״training אופטימלי מבחינת compute כולל אימון מודלים גדולים מאוד על כמות נתונים צנועה יחסית ועצירה משמעותית לפני התכנסות.״ התחום עשה בדיוק את זה: GPT-3 הוא 175 מיליארד פרמטרים על 300 מיליארד tokens,7 Gopher 280 מיליארד על 300 מיליארד, Megatron-Turing NLG 530 מיליארד על 270 מיליארד.2 חצי token עד שני tokens לפרמטר, לכל אורך הדרך.
Chinchilla, ומה הסריקה שלמעלה מדדה
קישור למקטע: Chinchilla, ומה הסריקה שלמעלה מדדהבמרץ 2022, Hoffmann ואחרים אימנו יותר מ-400 מודלים מ-70 מיליון עד 16 מיליארד פרמטרים והגיעו למסקנה ההפוכה בשלושה מסלולים בלתי תלויים.2 טבלה 2 שלהם מדווחת על המעריך ב- כ-0.50, 0.49 ו-0.46, מול 0.73 של Kaplan. במילים פשוטות: גודל המודל ונתוני ה-training צריכים לגדול באותו יחס.
הגישה השנייה שלהם היא זו שמשוחזרת בסריקה שבראש הפרק הזה, במיליונית מקנה המידה: מקבעים תקציב, מאמנים גדלים רבים בדיוק בתקציב הזה, ומשרטטים אובדן סופי מול גודל מודל.
| פרמטרים | |||
|---|---|---|---|
| 98,624 | 5.3531 (171) | 4.8638 (542) | — |
| 150,320 | 5.4636 (74) | — | — |
| 194,208 | 5.5041 (44) | 4.8730 (140) | 4.4040 (442) |
| 295,808 | 5.5550 (19) | 4.9029 (60) | 4.3383 (190) |
| 665,280 | 5.7849 (3.8) | 5.1254 (12) | 4.4192 (38) |
| 1,280,768 | 5.8174 (1.0) | 5.1751 (3.2) | 4.5003 (10) |
| 3,101,568 | — | 5.4686 (0.5) | 4.7768 (1.7) |
| 5,315,072 | — | 5.5894 (0.2) | 4.8514 (0.6) |
| 15,053,568 | — | — | 5.3534 (0.1) |
אובדן held-out ב-nats לכל token, tokens לפרמטר בסוגריים, מודגש המודל הטוב ביותר בכל תקציב; קו מפריד הוא נקודה שלא הורצה, כי התקציב דרש יותר טקסט מכפי שהקורפוס מכיל או שהגודל היה מחוץ לטווח שנסרק שם.
קראו עמודה כלפי מטה: האובדן יורד, מגיע לתחתית ואז עולה שוב. מודל יכול להיות גדול מדי לתקציב שלו בדיוק באותה קלות שבה הוא יכול להיות קטן מדי — ב- הקנס על בחירת 665,280 פרמטרים במקום 295,808 הוא 0.08 nats, שעל המעטפת שהותאמה למעלה הוא האובדן שמודל בגודל נכון מגיע אליו עם 18% פחות compute. בחירת הצורה הלא נכונה זורקת חמישית מהתקציב. זו Figure 3 של Chinchilla אחר צהריים אחד על GPU יחיד במקום עם ארבע מאות מודלים.
עכשיו קראו לרוחב. ב- המודל הטוב ביותר הוא הקטן ביותר שנסרק; ב- הוא 295,808 פרמטרים, מוקף משני הצדדים. האופטימום זז ימינה כשהתקציב גדל, וזה כל תוכן התיקון. התאימו את הגישה השלישית של המאמר — המשטח על פני כל ההרצות — ומזערו בכפוף ל-:
L(N, D) = 24.7 / N^0.195 + 46.8 / D^0.169 (E fits to ~0; see below)
implied N_opt ∝ C^0.464
compare Chinchilla 0.46-0.50 · Besiroglu 0.513 · Kaplan 0.730.46, מלפטופ, מול 0.73 של Kaplan. התאמה לשלוש ספרות מתקציב של שלושה תקציבים היא מזל; התאמה לספרה הראשונה אינה. המעריך נוסע — הקבוע לא, כי יחס ה-token-לפרמטר באופטימות האלה הוא 170 עד 540, לא 20. שלוש סיבות, כולן מאלפות. מתאים לאפס כי באובדן מעל 4 nats ההרצה אינה קרובה לרצפת האנטרופיה ששולטת בהתאמה של Chinchilla. גודל ה-batch וקצב הלמידה היו קבועים ולא כוונו לכל נקודה, מה שמקשה על ההרצות שמקבלות הכי מעט צעדים — ואלה המודלים הגדולים: ב- FLOPs מודל של 1.28 מיליון פרמטרים מקבל 159 צעדי אופטימייזר בסך הכול, הרבה מתחת לכמה אלפים שאיבר של Kaplan אומר שכל מודל צריך. Scaling law מותאם בתוך משטר, וזה יושב שישה סדרי גודל מתחת ל-Chinchilla.
ומכאן תקציר המאמר: ״current large language models are significantly undertrained״. Chinchilla הוא ההדגמה — 70 מיליארד פרמטרים על 1.4 טריליון tokens, אותו compute כולל כמו Gopher עם 280 מיליארד על 300 מיליארד, ומנצח אותו ב-51 מתוך 57 משימות MMLU, 67.5% מול 60%.2 קטן פי ארבעה, טקסט רב פי ארבעה וחצי, אותו כסף, מודל טוב יותר.
שתי הסתייגויות לגבי היחס המפורסם הזה. ״עשרים tokens לפרמטר״ אינו משפט במאמר, שאומר רק ש״עבור כל הכפלה של גודל המודל גם מספר ה-training tokens צריך להיות מוכפל״; ה-20 הוא היסק מטבלה 3 ומ-70 B על 1.4 T של Chinchilla עצמו. והדיוק שלו גרוע מהמודפס: Besiroglu ואחרים התאימו מחדש מתוך דיגיטציה של Figure 4, מצאו שהפרמטרים המקוריים ״מתאימים לנתונים המשוחזרים בצורה גרועה״ עם רווחים ״צרים באופן בלתי סביר בהינתן מספר נקודות הנתונים״, והעמידו את הטווח הישר על ״בין 4 ל-40״ tokens לפרמטר.8
פרט אחד בשיטה של Chinchilla מקיים הבטחה שפרק 1 נתן לגבי schedules של קצב למידה. ה-cosine schedule חייב להיות מותאם לתקציב ה-token. מודל שיראה 10 מיליון tokens חייב לדעוך את קצב הלמידה שלו לאפס ב-10 מיליון tokens; תנו לו schedule בגודל 100 מיליון, עצרו אותו מוקדם, ואתם קוראים אובדן באמצע ירידה בקצב גבוה מדי. Chinchilla מאמן כל מודל בארבעה אורכי מחזור כדי לשלוט בדיוק בזה; הסריקה למעלה קובעת את ה-schedule שלה מהתקציב מאותה סיבה.
מה ה-scaling laws לא מבטיחים
קישור למקטע: מה ה-scaling laws לא מבטיחיםהם התוצאה האמפירית השימושית ביותר בתחום, ומוכרים אותם מעבר למה שהם אומרים. ארבע מגבלות.
הם חוזים אובדן, לא יכולת. אגף שמאל הוא cross-entropy על טקסט held-out. שום דבר במאמרים האלה לא מתיר טענה לגבי האם מודל יכתוב SQL נכון, יסרב לבקשה מזיקה או ישתמש בכלי. זה שוב הלקח של פרק 5: חיזוי של האובדן אינו חיזוי של ההתנהגות שעליה אתם משלמים.
הם מותאמים, לא נגזרים. אין תיאוריה שמייצרת את . הקבועים זזים עם ה-tokenizer — ולכן השוואת perplexity בין שני tokenizers היא חסרת משמעות, כפי שהסביר פרק 8 — ועם תערובת הנתונים, הארכיטקטורה והאופטימייזר. כל חוק מפורסם הוא חוק של ההתקנה שיצרה אותו, ולכן Meta התאימה מחדש את שלה לפני Llama 3.5
הם מניחים token טרי לכל צעד, מה שמניח בשקט קורפוס אינסופי. Muennighoff ואחרים מדדו מה קורה כשהוא נגמר: עד ארבע תקופות של נתונים חוזרים עולות כמעט כלום — מודל של 8.7 מיליארד פרמטרים על 44 מיליארד tokens ייחודיים שנראו ארבע פעמים סיים עם ״רק 0.5% יותר validation loss״ מאותו מודל על 178 מיליארד ייחודיים — בעוד שמעבר לכ-16 תקופות compute נוסף לא קונה כלום.9
ואף אחד כבר לא מאמן compute-optimal. Chinchilla ממזער את עלות ה-training; מודל פרוס משלם אחר כך בערך FLOPs לכל token שנוצר, לנצח. LLaMA 1 אמר זאת במפורש: ״בהינתן רמת ביצועים יעד, המודל המועדף אינו המהיר ביותר לאימון אלא המהיר ביותר ב-inference״.10 Sardana ואחרים ניסחו זאת פורמלית על ידי מזעור במקום זאת, ומצאו שמי שמצפה למיליארד בקשות צריך לאמן ״קטן יותר וארוך יותר מ-Chinchilla-optimal״.11 §9.1 של Llama 3 מסכים: המודלים הקטנים שלו מאומנים ״הרבה מעבר לנקודת ה-compute optimal training, ובפועל מחליפים training compute ביעילות inference״.5 היחס אינו מיושן; הוא עונה על שאלה שכבר אינה זו שנשאלת.
יכולות מתהוות, והוויכוח אם הן אמיתיות
קישור למקטע: יכולות מתהוות, והוויכוח אם הן אמיתיותהאובדן יורד בצורה חלקה. ציוני benchmark לפעמים לא. Wei ואחרים אספו מקרים שבהם משימה יושבת ברמת ניחוש לאורך סדרי גודל של training compute ואז קופצת — אריתמטיקה תלת-ספרתית שמופיעה ב-GPT-3 סביב FLOPs, MMLU עולה מעל ניחוש בין ל- — ונתנו לתבנית שם: ״יכולת היא emergent אם היא אינה קיימת במודלים קטנים יותר אך קיימת במודלים גדולים יותר״.12 אם זו תכונה אמיתית, אקסטרפולציה מניסויים זולים אינה בטוחה, כי היכולת שאתם קונים עלולה לא להתקיים בשום קנה מידה שאתם יכולים להרשות לעצמכם לבדוק.
Schaeffer, Miranda ו-Koyejo טענו שרוב זה הוא ארטיפקט של מדידה, והמנגנון הוא אריתמטי.13 אובדן per-token יורד בצורה חלקה, ולכן ההסתברות ש-token אחד יהיה נכון, , משתפרת בהדרגה. מדרגים את המודל עם exact string match על תשובה באורך tokens ומעלים את ההסתברות הזאת בחזקת — עקומה חלקה בחזקה גדולה נראית כמו צוק. החליפו למדד שסופר tokens במקום לדרוש את כולם, על אותם פלטים, ו״ביצועי המשפחה משתפרים בצורה חלקה, רציפה וצפויה עם הגדלת scale״.
הביקורת שלהם היא המספר שצריך לזכור — ״מתוך 39 המדדים המועדפים ב-BIG-Bench, לכל היותר 5 מציגים emergence״, כאשר שני מדדים לא רציפים אחראים ליותר מ-92% מהמקרים הנטענים — וכך גם האזהרה שלהם: ״אין לפרש דבר במאמר זה כטענה ש-large language models אינם יכולים להציג יכולות emergent״. קפיצה בתרשים היא ראיה על המדד עד שיוכח אחרת. פרק 29 הוא המקום שבו זה נהיה הבעיה שלכם, כי בחירת מדד עם cutoff קשיח היא החלטה שתקבלו בלי לשים לב.
מאיפה מגיעים הנתונים
קישור למקטע: מאיפה מגיעים הנתוניםהקורפוס הוא החלק בהרצת pretraining שאין לו משוואה צמודה, ושבו נמצאות רוב ההחלטות המשמעותיות. חומר הגלם הוא סריקת web: ארכיון אוגוסט 2026 של Common Crawl מחזיק ״2.14 מיליארד דפי web או 360 TiB של תוכן לא דחוס״, חודש אחד ממנו, בחינם להורדה.14 כמעט כלום מזה אינו שמיש כפי שהוא. מאמר T5 אומר שהסריקה ״מורכבת ברובה מג׳יבריש או מטקסט boiler-plate כמו תפריטים, הודעות שגיאה או טקסט כפול״, וצינור C4 שהציג הוא רשימת heuristics קהות — לשמור רק שורות שמסתיימות בפיסוק סופי, להשליך דפים עם פחות משלושה משפטים, להשליך כל דף שמכיל סוגר מסולסל או מילה מרשימה ציבורית של גסויות — ולהפוך עשרים טרה-בייט של טקסט חודשי לכ-750 GB.15
קהות היא המילה. Dodge ואחרים בדקו מה המסננים האלה מסירים ומצאו שרשימת החסימה של גסויות מוחקת 42% מהמסמכים באנגלית אפרו-אמריקאית ו-32% באנגלית המזוהה עם היספנים, לעומת 6.2% באנגלית המזוהה עם לבנים, ומשאירה קורפוס ש-97.8% ממנו בקטגוריה האחרונה.16 לכלל שלא הייתה לו דעה על דיאלקט הייתה אחת.
ואז deduplication, שאינה ניקיון: Lee ואחרים מצאו משפט בן 61 מילים שחזר 61,036 פעמים ב-C4, והראו ש-deduplication חותכת פי עשרה את הקצב שבו מודלים ״פולטים טקסט משונן״, מ-1.9% מה-generated tokens ל-0.19%.17 יותר אינו בהכרח טוב יותר — צוות FineWeb ביצע deduplication גלובלי על פני 96 סריקות, קיבל 4 טריליון tokens וללא שיפור מדיד, ואז ביצע deduplication לכל סריקה בנפרד, קיבל 20 טריליון, והשווה לקורפוס הקיים הטוב ביותר.18
ואז זיהום. Llama 3 מדד את שלו ופרסם אותו: 98% מ-AGIEval, 95% מ-BIG-Bench Hard ו-85% מ-HellaSwag חופפים לסט ה-training לפי 8-grams, ועבור MMLU חפיפה כה גבוהה ש״בלתי אפשרי לקבל אומדן טוב של שיפור ביצועים״.5 §4 של GPT-3 מדווח על באג סינון שהשאיר benchmarks בתוך הנתונים ללא דרך חזרה: ״בגלל שיקולי עלות לא היה מעשי לאמן מחדש את המודל״.7
Provenance הוא החלק הלא פתור. The Pile הגיע עם רכיב של 100.96 GiB בשם Books3 — 12% מהקורפוס, ולפי טבלת ההסכמה של המאמר עצמו, ספרים מ-tracker פרטי של torrents;19 הוא הורד מהרשת באוגוסט 2023 אחרי תלונת זכויות יוצרים. המצב המשפטי נכון לספטמבר 2026 אינו מוכרע, ושלוש הפסיקות האמריקאיות המצוטטות כמגמה אינן מסכימות זו עם זו. Alsup מצא ש-training על ספרים שנרכשו כדין הוא ״טרנספורמטיבי באופן יוצא דופן״ אך קבע שספרייה שנבנתה מעותקים פיראטיים אינה כזו, ו-Anthropic הסדירה את המחצית הזאת תמורת $1.5 מיליארד המכסים 482,460 יצירות, בערך $3,000 כל אחת, באישור 20 ביולי 2026.20 Chhabria נתן ל-Meta פסק דין מקוצר בעודו כותב שפסיקתו ״אינה עומדת בעד הטענה שהשימוש של Meta בחומרים מוגנים בזכויות יוצרים כדי לאמן את מודלי השפה שלה הוא חוקי״, אלא רק ש״התובעים האלה העלו את הטיעונים הלא נכונים״.21 Bibas, שפסק נגד Ross Intelligence, ציין ש״רק AI לא-גנרטיבי נמצא לפניי היום״.22 שום בית משפט לערעורים בארה״ב לא הכריע בשאלה.
אנשים עושים את החלקים שהאובדן לא יכול. TIME דיווח בינואר 2023 שעובדים שסימנו טקסט רעיל עבור OpenAI דרך חברת Sama לקחו הביתה ״בין כ-$1.32 ל-$2 לשעה״ בעודם קוראים קטעים המתארים פגיעה מינית בילדים, עינויים ופגיעה עצמית, בעוד OpenAI שילמה ל-Sama $12.50 לשעה עבור העבודה; Sama חולקת גם על טווח השכר וגם על המכסה.23 זה הסינון סביב pretraining ולא ה-pretraining עצמו — אבל הוא נמצא באותה חשבונית, ושם יושב אדם.
החשמל אמיתי ובדרך כלל מצוטט לא נכון. הנתון הזהיר ביותר שפורסם הוא של BLOOM: 1,082,990 שעות GPU, 433 MWh ו-24.7 טונות של שווה-ערך CO₂ להרצה, 50.5 כולל ייצור וצמתים במנוחה;24 Patterson ואחרים מציבים את GPT-3 על 1,287 MWh ו-552 טונות.25 שתי אזהרות. היתרון של BLOOM הוא רשת החשמל הגרעינית בצרפת ב-57 גרם CO₂ לקוט״ש ולא יעילות — הוא השתמש ביותר אנרגיה מ-OPT-175B. והמספר המצוטט ביותר בתחום לפליטות, 626,155 lb של Strubell ואחרים עבור neural architecture search, הוכח אחר כך כגבוה פי 88, כי הניחו שהחיפוש רץ בגודל מודל מלא כשבפועל רץ על proxy.26 המסגור של LBNL הוא המגן: datacentres בארה״ב השתמשו ב-192 TWh ב-2024, 4.7% מהחשמל הלאומי — מספר שמוצמד לתעשייה, לא להרצה יחידה.27
קו החיבור הוא מה ש-Bender ואחרים כינו חוב תיעוד: ״להכניס את עצמנו למצב שבו ה-datasets גם לא מתועדים וגם גדולים מכדי לתעד post hoc״.28 כל עובדה למעלה קיימת כי מישהו הסתכל. עבור הקורפוסים שמאחורי המודלים שרוב האנשים משתמשים בהם, אף אחד לא יכול.
כמה זה באמת עולה
קישור למקטע: כמה זה באמת עולהעכשיו האריתמטיקה שכולם רוצים, מארבעה קלטים מצוטטים, כך שכאשר הם יתיישנו יהיה ברור מה להחליף.
תפוקת שיא
קישור למקטע: תפוקת שיאעמוד H100 של NVIDIA מציין 1,979 teraFLOPS של תפוקת tensor-core ב-BF16 תחת הערת שוליים שאומרת ״with sparsity״.29 שום הרצת pretraining לא משתמשת ב-structured sparsity, ולכן הנתון הצפוף הוא חצי ממנו: 989.5 TFLOP/s.
Utilisation
קישור למקטע: Utilisationטבלה 4 של Llama 3 מדווחת על 38–43% BF16 model FLOPs utilisation. ניקח 40%: 395.8 TFLOP/s של אריתמטיקה שימושית לכל GPU.5
מחיר on-demand של Lambda לצומת 8×H100 SXM, נבדק ב-2026-09-06: $3.99 לכל שעת GPU, כלומר $31.92 לשעה לצומת.30
היחס של Chinchilla, , נותן ולכן .
| תקציב | שעות H100 | FLOPs | פרמטרים compute-optimal | tokens | על צומת 8×H100 אחד | GPUs לסיום ב-90 יום |
|---|---|---|---|---|---|---|
| $100 | 25 | 3.6e19 | 546 M | 10.9 B | 3.1 ש׳ | 1 |
| $1,000 | 251 | 3.6e20 | 1.73 B | 34.5 B | 31.3 ש׳ | 1 |
| $10,000 | 2,506 | 3.6e21 | 5.46 B | 109 B | 13 ימים | 2 |
| $100,000 | 25,063 | 3.6e22 | 17.3 B | 345 B | 131 ימים | 12 |
| $1,000,000 | 250,627 | 3.6e23 | 54.6 B | 1.09 T | 4 שנים | 116 |
| $10,000,000 | 2,506,266 | 3.6e24 | 173 B | 3.45 T | 36 שנים | 1,160 |
| $100,000,000 | 25,062,657 | 3.6e25 | 546 B | 10.9 T | 358 שנים | 11,603 |
קראו את שתי העמודות האחרונות יחד. ב-$10,000 מקבלים מודל של 5 מיליארד פרמטרים על צומת שכור אחד בתוך שבועיים. ב-$100,000,000 האריתמטיקה אומרת 546 מיליארד פרמטרים — ושנים-עשר אלף H100s מחווטים יחד לשלושה חודשים, וזה לא משהו ששוכרים בכרטיס אשראי. מעבר לכ-$100,000, האילוץ הכובל מפסיק להיות כסף והופך ל-cluster.
לפני שסומכים על טבלה כזאת, בדקו אותה מול הרצות שהעלות האמיתית שלהן פורסמה — llm.c משחזר GPT-2 124M ב-״~90 דקות״ על צומת 8×A100 ״בערך ב-$20״, ו-GPT-2 1.6B ב-24 שעות על צומת 8×H100 תמורת $672.31
$672, against what $672 actually bought (llm.c GPT-2 1.6B, one 8xH100 node, 24 h)
this table predicts: 168 H100-hours N = 1.41 B params D = 28.3 B tokens
what was actually run: 192 H100-hours N = 1.558 B params D = 33.6 B tokens
Llama 3 405B, against Meta's own published GPU-hours
from the paper's 3.8e25 FLOPs at 40 % MFU: 26.67 M H100-hours
published in Meta's Llama 3.1 model card: 30.84 M H100-hours ratio 0.86שניהם בטווח של כ-15%, שזה בערך הדיוק שאומדן כזה ראוי לו, וטוב בהרבה מהדיוק שבו הוא בדרך כלל מצוטט.
השוואת הכותרת, עם שתי ההגדרות על השולחן
קישור למקטע: השוואת הכותרת, עם שתי ההגדרות על השולחןהמספר החוזר ביותר בנושא הזה הוא שמודל מסוג GPT-2 שעלותו הייתה בערך $43,000 ב-2019 ניתן לשחזור היום בכמה עשרות דולרים. החצי המודרני מתועד היטב; החצי ההיסטורי לא.
היום. README של nanochat מאת Karpathy: ״אתם יכולים לאמן LLM משלכם ביכולת GPT-2 ... תמורת רק $48 (2 שעות של צומת GPU 8XH100) ... על spot instance, העלות הכוללת יכולה להיות קרובה יותר ל-$15.״32 ״יכולת GPT-2״ כאן מדויקת ומפורסמת — ניצחון על CORE score של GPT-2, 0.256525 — על leaderboard שהכניסה הטובה ביותר בו נכון ל-14 במרץ 2026 היא 1.65 שעות. ה-$48 מניח $3 לשעת GPU, מתחת למחיר הרשמי של Lambda, $3.99; במחיר הרשמי זה קרוב יותר ל-$64.
ב-2019. אין מקור ראשוני: OpenAI מעולם לא פרסמה משך או עלות. השרשרת עוברת דרך The Register, פברואר 2019, שדיווח על ״256 ליבות Google TPU3״ ללא מחיר וללא משך; ואז Synced, יוני 2019, שציין שהחומרה עלתה $256 לשעה ב-Google Cloud ואמר במפורש ש-״OpenAI didn't specify the training duration״. $43,008 הם $256 לשעה כפול 168 שעות משוערות שאיש מעולם לא ביסס.
לכן הכותרת הישרה היא: מודל התואם את ציון ה-benchmark המפורסם של GPT-2 ניתן לאימון היום בהרבה פחות מ-$100 על חומרה שכורה, מול עלות ב-2019 שמעולם לא פורסמה ושהאומדן המפורסם שלה נשען על ניחוש לא ממוסמך לגבי משך הזמן. הקריסה אמיתית והחצי המודרני ניתן לשחזור לכל מי שיש לו כרטיס אשראי; היחס הוא אריתמטיקה על מספר שאינו קיים. זה מצב עלויות ה-training המפורסמות בכלל. במאמר GPT-3 אין שום סכום בדולרים, רק FLOPs בטבלה D.1;7 גם במאמר Llama 3 אין.5 כל עלות training שקראתם היא אומדן מתוך ספירת FLOP, הנחת חומרה והנחת מחיר — תמיד כדאי לשאול של מי.
מה מודל בסיס יודע, ומתי הוא הפסיק לדעת את זה
קישור למקטע: מה מודל בסיס יודע, ומתי הוא הפסיק לדעת את זהמה שיוצא ראה קורפוס קבוע שנאסף ברגע קבוע, ומכך נובעות שתי תכונות.
הראשונה היא knowledge cutoff. אחרי תאריך האיסוף המודל לא יודע כלום — לא ״לא בטוח״, כלום — והוא ימציא בשטף במקום לומר זאת, כי לומר זאת מעולם לא היה התנהגות שעליה אומן. כרטיס המודל של Llama 3.1 נותן דצמבר 2023;33 לכל מודל יש אחד, והוא תכונה של נתוני ה-training, לא של הפריסה. עקיפה שלו היא בעיית retrieval, וזה פרק 19.
השנייה היא שמודל בסיס משלים ולא עונה. תנו לו ״מהי בירת צרפת?״ והמשך סביר הוא שאלה נוספת, כי בקורפוס המחרוזת הזאת מופיעה לרוב ברשימת תרגילים.
לאן ממשיכים מכאן
קישור למקטע: לאן ממשיכים מכאןמשלים טקסט אינו assistant. הוא לא פועל לפי הוראות, כי שום דבר בקורפוס לא אמר לו שבקשה צריכה להתבצע ולא להימשך. אין לו מושג של שיחה עם שני משתתפים. הוא יפיק בשמחה את ההמשך הסביר ביותר של prompt מזיק, כי סביר הוא הדבר היחיד שעליו הוא אי פעם עבר אופטימיזציה.
להפוך אותו למשהו שעונה דורש שלב שני שעולה שבריר אחוז מהראשון, ומורכב כמעט כולו מהצגת דוגמאות להתנהגות שאתם רוצים ואז השוואת זוגות של הפלטים שלו עצמו. השלב הזה הוא המקום שממנו מגיעים instruction following, chat templates, סירובים וגם — וזה מפתיע אנשים — היכולת לקרוא לכלי. פרק 11 הוא השלב הזה: supervised fine-tuning, RLHF, DPO ו-GRPO, והשאלה מה פירוש ״aligned״ ומי מחליט.
מקורות ושיטה
קישור למקטע: מקורות ושיטהכדאי לקרוא לצד הפרק הזה גם את build-nanogpt של Karpathy ואת הווידאו הנלווה אליו, שמוליכים שחזור מלא של GPT-2 מקצה לקצה בקצב שהפרק הזה לא יכול; וגם את Stanford CS324, Large Language Models, שההרצאות שלו על נתונים ועל השפעה סביבתית מעמיקות יותר מהסעיף שלמעלה בחומר שהקורס הזה מטפל בו פעם אחת ומאציל הלאה.
הפניות
קישור למקטע: הפניות-
Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J. and Amodei, D. Scaling Laws for Neural Language Models. arXiv:2001.08361 (2020). שלושת חוקי החזקה הם משוואות (1.1)–(1.3) ב-§1.2 והקבועים המלאים נמצאים ב-Appendix A, Table 5; גזירת היא §2.1; מעריכי הקצאת ה-compute הם Table 6. שימו לב שיש שני חוקי compute, בגודל batch קבוע ו- בגודל batch אופטימלי; המאמר אומר שהאחרון ״should be used to make predictions״. ↩ ↩2
-
Hoffmann, J., Borgeaud, S., Mensch, A., Buchatskaya, E., Cai, T., Rutherford, E. et al. Training Compute-Optimal Large Language Models. arXiv:2203.15556 (2022). מעריכים ב-Table 2, תקציבים חזויים ב-Table 3, השוואת Gopher ב-§4, מוסכמת ספירת הפרמטרים ב-Appendix F. הפרוזה מתחת ל-Table 3 אינה מסכימה עם Table 3 עצמו בשורות 175 B ו-280 B; הטבלה היא הגרסה שיש לצטט. ↩ ↩2 ↩3 ↩4
-
Micikevicius, P., Narang, S., Alben, J., Diamos, G., Elsen, E., Garcia, D. et al. Mixed Precision Training. arXiv:1710.03740 (2017), ICLR 2018. משקלי master ב-FP32 ב-§3.1, loss scaling ב-§3.2. ↩ ↩2
-
Rajbhandari, S., Rajbhandari, S., Ruwase, O. and He, Y. ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054 (2019), SC20. חשבונאות היא §3.1; נתוני המצב השיורי עבור activations הם §3.2. ↩
-
Grattafiori, A. et al. (Llama Team, AI @ Meta). The Llama 3 Herd of Models. arXiv:2407.21783 (2024). תקציב compute ומספר tokens ב-§1, ה-scaling law שהותאם מחדש ב-§3.2.1, תצורת ה-parallelism וה-MFU ב-Table 4, ניתוח הזיהום ב-§5.1.4, והצהרת ה-over-training ב-§9.1. המאמר אינו מכיל סכומי דולרים או טבלת פליטות. ↩ ↩2 ↩3 ↩4 ↩5 ↩6
-
Stanford CS336, Language Modeling from Scratch. הרצאה 2 מכסה חשבונאות משאבים, הרצאות 5–8 GPUs, kernels ו-parallelism, הרצאות 9 ו-11 scaling, והרצאות 13–14 נתונים. זה הקורס שהפרק הזה מאציל אליו את ההנדסה שלו, והוא ציבורי. ↩
-
Brown, T. B. et al. Language Models are Few-Shot Learners. arXiv:2005.14165 (2020). Compute ב-Appendix D, Table D.1 — שיש בה עמודה שכותרתה המילולית ״flops per param per token״, והערך שלה בכל שורת GPT-3 הוא 6. ניתוח זיהום ב-§4. ↩ ↩2 ↩3
-
Besiroglu, T., Erdil, E., Barnett, M. and You, J. Chinchilla Scaling: A replication attempt. arXiv:2404.10102 (2024). משחזר את הנתונים של Chinchilla באמצעות דיגיטציה של Figure 4, מתאים מחדש, ומדווח על המעריכים המתוקנים ועל רווחים רחבים בהרבה. ↩
-
Muennighoff, N., Rush, A. M., Barak, B., Le Scao, T., Piktus, A., Tazi, N., Pyysalo, S., Wolf, T. and Raffel, C. Scaling Data-Constrained Language Models. arXiv:2305.16264 (2023), NeurIPS 2023. תוצאת ארבע התקופות היא §6; מחצית החיים של שש-עשרה התקופות היא המותאם. ↩
-
Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T. et al. LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 (2023). §1 מציין את טיעון עלות ה-inference נגד training שהוא Chinchilla-optimal. ↩
-
Sardana, N., Portes, J., Doubov, S. and Frankle, J. Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws. arXiv:2401.00448 (2023), ICML 2024. §5 שלהם מכיל גם את משקל הנגד: מודלים שאומנו ביחסי token קיצוניים ממשיכים להשתפר, אבל ״more slowly than scaling laws predict״. ↩
-
Wei, J., Tay, Y., Bommasani, R., Raffel, C., Zoph, B., Borgeaud, S. et al. Emergent Abilities of Large Language Models. arXiv:2206.07682 (2022), TMLR. ההגדרה ב-§2, דוגמאות וספי compute ב-§3–4 וב-Table 1. ↩
-
Schaeffer, R., Miranda, B. and Koyejo, S. Are Emergent Abilities of Large Language Models a Mirage? arXiv:2304.15004 (2023), NeurIPS 2023 outstanding paper. טיעון המדד הוא §2, מטא-אנליזת BIG-Bench §4, ודוגמת הראייה הבנויה §5. ↩
-
Common Crawl, August 2026 Crawl Archive Now Available (CC-MAIN-2026-34), פורסם 24 באוגוסט 2026, נבדק 2026-09-06. עמוד הבית שלו עצמו טוען ״over 300 billion pages spanning 15 years״, ״totalling more than 10 petabytes״ — נתון לכל הארכיון, לא לסריקה החודשית שמתומחרת כאן. ↩
-
Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W. and Liu, P. J. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683 (2019), JMLR 21(140). מסנני C4 הם §2.2. המאמר נותן גדלים בבתים, לא ב-tokens; נתון 156 מיליארד ה-tokens שמיוחס לו לעיתים קרובות מגיע מ-Dodge ואחרים למטה. ↩
-
Dodge, J., Sap, M., Marasović, A., Agnew, W., Ilharco, G., Groeneveld, D., Mitchell, M. and Gardner, M. Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758 (2021), EMNLP 2021. שיעורי הסרת הדיאלקטים הם §5.3; זיהום benchmark ב-C4 הוא §4.2. ↩
-
Lee, K., Ippolito, D., Nystrom, A., Zhang, C., Eck, D., Callison-Burch, C. and Carlini, N. Deduplicating Training Data Makes Language Models Better. arXiv:2107.06499 (2021), ACL 2022. 61,036 החזרות הן footnote 1; נתוני השינון הם §6.2, Table 4, והם אחוזים מתוך generated tokens תחת קריטריון exact-match של 50 tokens. ↩
-
Penedo, G., Kydlíček, H., Ben Allal, L., Lozhkov, A., Mitchell, M., Raffel, C., Von Werra, L. and Wolf, T. The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale. arXiv:2406.17557 (2024), NeurIPS 2024 Datasets and Benchmarks. תוצאת ה-deduplication היא §3.4. ה-dataset ששוחרר גדל מאז מעבר ל-15 טריליון ה-tokens של המאמר. ↩
-
Gao, L., Biderman, S., Black, S. et al. The Pile: An 800GB Dataset of Diverse Text for Language Modeling. arXiv:2101.00027 (2020). Books3 הוא §2.3 ו-Table 1; טבלת ההסכמה היא Table 5. הקורפוס הוא 825.18 GiB, כך שאפילו הכותרת מעוגלת כלפי מטה. ↩
-
Bartz v. Anthropic, No. 4:24-cv-05417 (N.D. Cal.). צו שימוש הוגן 23 ביוני 2025 (Dkt. 231); אישור תובענה ייצוגית 17 ביולי 2025; אישור סופי ופסק דין 20 ביולי 2026 (Dkt. 680). ההסדר משחרר קלטים מן העבר בלבד, לא פלטים ולא התנהלות עתידית. ↩
-
Kadrey v. Meta, No. 3:23-cv-03417-VC (N.D. Cal.), פסק דין מקוצר 25 ביוני 2025 (Dkt. 598). שימו לב שטענת ההפצה סביב torrenting לא הוכרעה ונשארה תלויה ועומדת. ↩
-
Thomson Reuters v. ROSS Intelligence, No. 1:20-cv-00613-SB (D. Del.), חוות דעת מתוקנת 11 בפברואר 2025 (Dkt. 770), Bibas J. בערעור ביניים לבית המשפט לערעורים של המעגל השלישי (No. 25-2153), נטען 11 ביוני 2026, טרם הוכרע בעת הכתיבה. ↩
-
Perrigo, B. Exclusive: OpenAI Used Kenyan Workers on Less Than $2 Per Hour to Make ChatGPT Less Toxic. TIME, 18 בינואר 2023. ה-$2 הוא תקרה עבור בודקים בכירים שעמדו בכל יעד; מסמנים זוטרים, הרוב, לקחו הביתה $1.32. תגובת Sama, המצוטטת באותו מאמר, נותנת $1.46–$3.74 ומכסה נמוכה יותר. ↩
-
Luccioni, A. S., Viguier, S. and Ligozat, A.-L. Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language Model. arXiv:2211.02001 (2022), JMLR 24(253). טבלאות 1 ו-3. ↩
-
Patterson, D., Gonzalez, J., Le, Q., Liang, C., Munguia, L.-M., Rothchild, D., So, D., Texier, M. and Dean, J. Carbon Emissions and Large Neural Network Training. arXiv:2104.10350 (2021). נתוני GPT-3 הם Table 4; תיקון אומדן ה-NAS הוא §4.1. ↩
-
Strubell, E., Ganesh, A. and McCallum, A. Energy and Policy Considerations for Deep Learning in NLP. arXiv:1906.02243 (2019), ACL 2019. שווה לקרוא בדיוק בגלל מה שקרה למספר המצוטט ביותר שלו: המאמר זהיר, מציין את האקסטרפולציה שלו, ועדיין טעה בשני סדרי גודל בשורה היחידה שכולם חזרו עליה. ↩
-
Smith, S. J., Hubbard, A., Newkirk, A., Ganeshalingam, M., Holecek, B., Sartor, D., Mills, M. and Shehabi, A. United States Data Center Energy Usage Report: 2025 Update. LBNL-2001758 (18 ביוני 2026). זה מעדכן כלפי מטה את הדוח המצוטט נרחבות מ-2024 עבור הסדרה ההיסטורית; אם אתם מצטטים את נתון 176 TWh עבור 2023, אתם מצטטים את המהדורה שהוחלפה. ↩
-
Bender, E. M., Gebru, T., McMillan-Major, A. and Shmitchell, S. On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? FAccT '21, pp. 610–623. DOI 10.1145/3442188.3445922. ״Documentation debt״ הוא §4.4. שימו לב שנתוני הפחמן של המאמר עצמו מצוטטים מ-Strubell ואחרים ויורשים את התיקון שלמעלה — וזה איור לטיעון שלו יותר מאשר הפרכה שלו. ↩
-
NVIDIA. עמוד המוצר NVIDIA H100 Tensor Core GPU,
nvidia.com/en-us/data-center/h100/(נבדק 2026-09-06). כל שורת tensor-core בעמוד הזה למעט FP64 נושאת את הערת השוליים ״with sparsity״; נתון ה-BF16 הצפוף שמשמש כאן הוא חצי מ-1,979 TFLOPS שפורסמו. ↩ -
Lambda. GPU Cloud pricing,
lambda.ai/pricing(נבדק 2026-09-06). On-demand, לכל GPU לשעה, לפני מס. המחירים בסעיף הזה יתיישנו מהר יותר מכל דבר אחר בקורס; האריתמטיקה סביבם לא. ↩ -
Karpathy, A.
karpathy/llm.c, דיון #481, Reproducing GPT-2 (124M) in llm.c in 90 minutes for $20 (28 במאי 2024), ודיון #677, Let's reproduce GPT-2 (1.6B): one 8XH100 node, 24 hours, $672, in llm.c (11 ביולי 2024). ↩ -
Karpathy, A.
karpathy/nanochat, README ו-leaderboard ״time to GPT-2״ (נבדק 2026-09-06). נתון ה-$48 והגדרת CORE-score של ״GPT-2 capability״ נמצאים שניהם ב-README; ה-speedrun.shשל המאגר עצמו אומר ״approximately 1.5 hours״, לכן יש להתייחס לנתון שעתיים כמעוגל. ↩ -
Meta. Llama 3.1 model card,
models/llama3_1/MODEL_CARD.mdב-meta-llama/llama-models(נבדק 2026-09-06). מקור ל-30.84 M שעות H100 עבור מודל 405 B, לסך 39.3 M, לנתון 11,390 tCO2eq מבוסס-מיקום, ול-data cutoff של דצמבר 2023. ↩