דלג לתוכן
10/30פרק 10 מתוך 30

Pretraining ל-LLM: נתונים, חישוב, חוקי scaling ועלות

עשרים מודלים אומנו על GPU של לפטופ כדי למדוד scaling law, ואומדן 6ND נבדק מול מונה FLOP אמיתי.

בעמוד הזה

פרק 9 הסתיים בבלוק transformer שמתאמן. עורמים כמה כאלה, מכוונים את אובדן ה-next-token של פרק 8 אל הפלט, ואין עוד מה להמציא. כל מה שנשאר הוא רכישה.

זה שינוי גדול יותר מכפי שזה נשמע. כל פרק עד עכשיו שאל האם זה לומד? — שאלה של כן או לא שלפטופ פותר בעשר דקות. הפרק הזה שואל שאלה שיש בה כסף: בהינתן כמות קבועה של אריתמטיקה, מהו המודל הטוב ביותר שאני יכול לקנות? התשובה היא נוסחה, וב-2018 היא לא הייתה מובנת מאליה לאיש.

הנה התשובה לשאלה הזאת, במדידה, על GPU אחד של לפטופ. עשרים מודלים, מ-98,624 עד 15 מיליון פרמטרים, אומנו מאפס על 174 מיליון tokens מוויקיפדיה — אוצר מילים BPE של 2,048 tokens שאומן כפי שפרק 7 מאמן אחד, וה-transformer של פרק 9. כל הרצה קיבלה בדיוק אחד משלושה תקציבי חישוב ולא פעולה אחת יותר, כך שמודל גדול יותר בהכרח קורא פחות טקסט. אובדן ה-held-out הטוב ביותר שהושג בכל תקציב:

TEXT
budget C (FLOPs)   best loss   reached by a model of
       1.00e13       5.3531           98,624 params
       3.16e13       4.8638           98,624 params
       1.00e14       4.3383          295,808 params

fitted:  L = (Cc / C)^0.0913     over one decade of compute

פי עשרה אריתמטיקה מורידים 19% מהאובדן, ושלוש הנקודות יושבות על קו ישר ב-log-log. שום דבר בתשעת הפרקים הראשונים לא חוזה את זה. אין מאחורי זה משפט מתמטי — זו סדירות אמפירית, עם מעריך אחר לאורך עשרה סדרי גודל בין הלפטופ הזה לבין datacentre, וזו התצפית היחידה ששכנעה תעשייה להוציא תמ״ג של מדינה קטנה על GPUs.

שום דבר במטרה לא משתנה. המודל עדיין חוזה את ה-token הבא, האובדן הוא עדיין ה-cross-entropy של פרק 4 המוחל על הפירוק של פרק 8, והאופטימייזר הוא עדיין AdamW של פרק 6. Pretraining אינו אלגוריתם חדש; זה אותו אלגוריתם שמורץ על קורפוס גדול מספיק כדי שההרצה תדרוש תקצוב. שני דברים מאפשרים זאת: התוויות בחינם, כי היעד עבור המיקום tt הוא ה-token ב-t+1t+1 וכבר נמצא בטקסט; והסעיף האחרון בפרק 6 הסיר את ההתנגדות, מפני שמודל עם הרבה יותר פרמטרים ממה שהכללים הקלאסיים מאפשרים אינו מתפרק — הוא משתפר. מה שיוצא הוא מודל בסיס — דבר שממשיך טקסט ולא עונה.

ספירת החישוב לפני שמוציאים אותו: 6ND

קישור למקטע: ספירת החישוב לפני שמוציאים אותו: 6ND

לפני שאפשר לתקצב משהו מכל זה צריך לספור אותו, והתחום סופר אותו בעזרת נוסחה אחת:

C6NDC \approx 6ND

כאשר NN הוא מספר הפרמטרים, DD הוא מספר ה-training tokens ו-CC הוא סך פעולות הנקודה הצפה. Kaplan ואחרים גוזרים זאת בשני שלבים.1 Forward: 2 FLOPs לכל פרמטר לכל token, מכיוון שכל פרמטר בכפל מטריצות משמש פעם אחת לכל token, בכפל אחד ובחיבור אחד. Backward: פי שניים מה-forward, מכיוון שה-backward pass של פרק 5 מחשב שני gradients בכל שכבה — ביחס ל-קלטים של השכבה, כדי שהאות ימשיך לנוע, וביחס ל-משקלים שלה — כל אחד מהם כפל מטריצות בגודל של ה-forward, ולכן 4N4N.

זו כל הגזירה, וכדאי לבדוק אותה ולא רק להאמין. PyTorch מגיעה עם מונה FLOP אמיתי, torch.utils.flop_counter.FlopCounterMode, שמיירט כל פעולה שמודל שולח ומסכם את העבודה בפועל. מריצים אותו על פני ארבעה סדרי גודל, הגדול שבהם על התקן meta, שמקצה צורות וללא זיכרון:

flops.pyPYTHON
from torch.utils.flop_counter import FlopCounterMode

counter = FlopCounterMode(display=False)
with counter:                       
    loss = model(x, targets)[1]     
    loss.backward()                 
measured = counter.get_total_flops()
print(measured / (6 * n_params * n_tokens))
תצורהNN ללא embeddingsNN סך הכולנמדד, fwd+bwd÷ 6ND6ND (סך NN)÷ 6ND6ND (ללא emb.)fwd+bwd ÷ fwd
dd 128, 4 שכבות, TT 256788,7367,254,4004.60e101.0319.4853.000
dd 512, 8 שכבות, TT 25625,183,23251,045,8883.26e111.0382.1043.000
dd 768, 12 שכבות, TT 102484,973,056124,356,8641.75e121.1451.6763.000
dd 1600, 48 שכבות, TT 10241,474,870,4001,556,920,0002.10e131.1001.1613.000
dd 4096, 32 שכבות, TT 20486,442,983,4246,582,444,0328.74e131.0801.1043.000
dd 8192, 80 שכבות, TT 819264,427,147,26465,544,929,2803.75e151.1631.1833.000

היחס forward+backward על פני forward הוא 3.000, בדיוק, בכל קנה מידה: לא קירוב שבמקרה טוב, אלא הזהות האריתמטית שלמעלה מוחזרת כמספר עגול על ידי מונה שאינו יודע דבר על הגזירה.

לאחר מכן הסך הנמדד יושב בין 3% ל-17% מעל 6ND6ND, ברגע ש-NN סופר את מטריצות ה-embedding — והסעיף הזה חשוב, כי שני המאמרים המייסדים סופרים את NN אחרת. Kaplan מוציא מן החשבון את ״כל ה-vocabulary וה-positional embeddings״ כי כך ״מתקבלים scaling laws נקיים משמעותית״ (§1.3); Appendix F של Chinchilla אומר ״אנחנו סופרים גם embedding matrices במספר הפרמטרים הכולל״.2 עבור vocabulary רחב וממד חבוי צר, ההבדל הוא פי תשעה, כפי שמראה השורה הראשונה.

הפער שנותר הוא מה ש-6ND6ND משמיט במכוון: ציוני ה-attention. משוואה (2.2) של Kaplan כותבת את עלות ה-forward כ-2N+2nlayernctxdmodel2N + 2\,n_{\text{layer}} n_{\text{ctx}} d_{\text{model}} ומשמיטה את האיבר השני כי dmodelnctx/12d_{\text{model}} \gg n_{\text{ctx}}/12 — בטוח ב-2020, פחות בטוח עכשיו, וזו הסיבה שהיחס מטפס כאשר T/dT/d גדל — ולכן שתי שורות כאן חולקות TT של 1,024 והיחס יורד, מ-1.145 ל-1.100, כאשר dd עולה מ-768 ל-1,600. זו עלות ה-O(T2)O(T^2) שפרק 9 הציג ופרק 16 הופך למחיר.

זיכרון: מה באמת חייב להיכנס

קישור למקטע: זיכרון: מה באמת חייב להיכנס

Compute קובע כמה זמן הרצה אורכת; זיכרון קובע אם היא יכולה להתחיל. מאמנים עם fp32 AdamW פשוט, וכל פרמטר נושא ארבעה מספרים: המשקל, ה-gradient שלו, והממוצע הנע mm והשונות vv של Adam — שני הממוצעים שבנינו ביד בפרק 6. ארבעה מספרים בארבעה בתים כל אחד הם 16 בתים לפרמטר, לפני activation יחיד. נמדד על GPU לפטופ של 8 GB, לפי ההקצאה התושבת בנקודה בצעד שבה אין גרף חי:

מודלvocabularybatchNN16N16N חזויתושב נמדדשיא בצעדההפרש
dd 512, 8 שכבות50,257851,045,888779 MB801 MB2,500 MB1,699 MB
dd 512, 8 שכבות4,096827,411,456418 MB426 MB1,043 MB617 MB
dd 256, 6 שכבות4,09685,839,36089 MB89 MB382 MB293 MB
dd 256, 6 שכבות4,096325,839,36089 MB89 MB1,259 MB1,170 MB
dd 256, 6 שכבות4,0961285,839,36089 MB89 MB4,771 MB4,681 MB

התחזית והמדידה מסכימות בטווח של 3%. ההפתעה היא העמודה האחרונה: ה-activations מגמדות את המודל. אותו מודל של 5.8 מיליון פרמטרים שצריך 89 MB של מצב מתמיד צריך 4,681 MB של activations ב-batch של 128 — פי חמישים ושניים מהמודל — והרבה מזה בכלל אינו ה-transformer. אלה ה-logits, וקטור אחד בגודל ה-vocabulary לכל token בארבעה בתים לכל כניסה: 512 MB בשורה האחרונה, 393 MB בראשונה. גודל ה-vocabulary נבחר בפרק 7, והוא עדיין קובע מה נכנס לכרטיס.

איזה איבר שולט תלוי בצורה של ההרצה, ולכן Micikevicius ואחרים אומרים שהזיכרון ״נשלט על ידי activations״3 ואילו ZeRO אומר שמודל של 1.5 מיליארד פרמטרים צריך ״לפחות 24 GB״ רק למצבי המודל.4 ZeRO מגיע לאותם 16 בתים במסלול אחר — 2Ψ2\Psi למשקלי fp16, ‏2Ψ2\Psi ל-gradients ב-fp16, ‏4Ψ4\Psi כל אחד למשקלי master ב-fp32 ולשני המומנטים של Adam — וזה עבור 70 מיליארד פרמטרים הוא 1.12 טרה-בייט, ארבעה-עשר GPUs של 80 GB עוד לפני activation יחיד.

Parallelism, בפסקה אחת ובהאצלה אחת

קישור למקטע: Parallelism, בפסקה אחת ובהאצלה אחת

שום דבר מזה לא נכנס להתקן אחד בקנה מידה חזיתי, ולכן ההרצה מפוצלת בארבע דרכים בבת אחת. Data parallelism שם עותק של המודל על כל GPU וממצע את ה-gradients — ברירת המחדל, וזו ש-ZeRO משפר בכך שהוא מסרב לשמור עותקים עודפים של מצב האופטימייזר. Tensor parallelism מפצל מטריצות יחידות בין התקנים. Pipeline parallelism נותן לכל התקן קבוצת שכבות רציפה. Context parallelism מפצל את הרצף עצמו, ונחוץ רק כש-TT ארוך מספיק כדי שאיבר ה-attention ישלוט. טבלה 4 של Llama 3 מונה את כל הארבע יחד: tensor 8, context עד 16, pipeline 16, data עד 128, על פני 16,384 GPUs מסוג H100.5 זה כל מה שהקורס הזה יאמר על כך; הנדסת training מבוזר היא סמסטר בפני עצמו, ו-CS336 של Stanford הוא הסמסטר הזה, הרצאות 5 עד 8, עם הקוד.6 מה שנשאר מההאצלה הוא מספר אחד, model FLOPs utilisation — החלק משיא האריתמטיקה של GPU שהרצה אמיתית משיגה — והוא מה שהופך את 6ND6ND המסודר לזמן שעון ולכן לכסף.

Kaplan, וההימור שהתעשייה עשתה

קישור למקטע: Kaplan, וההימור שהתעשייה עשתה

בינואר 2020, Kaplan ואחרים אימנו גריד של transformers ומצאו שאובדן הבדיקה עוקב אחרי חוק חזקה בכל אחד משלושת המשאבים על פני יותר משישה סדרי גודל.1 §1.2 שלהם נותן שלושה חוקים מותאמים:

L(N)=(NcN)αN,αN0.076,Nc8.8×1013L(N) = \left(\frac{N_c}{N}\right)^{\alpha_N}, \qquad \alpha_N \approx 0.076, \qquad N_c \approx 8.8 \times 10^{13}

עם בני לוויה αD0.095\alpha_D \approx 0.095 לנתונים ו-αCmin0.050\alpha_C^{\min} \approx 0.050 ל-compute מוקצה אופטימלית. הקבועים אינם אוניברסליים, והמאמר אומר זאת: ״הערכים המספריים המדויקים של NcN_c, CcminC_c^{\min} ו-DcD_c תלויים בגודל ה-vocabulary וב-tokenization ולכן אין להם משמעות יסודית.״

המעריכים זעירים: פי עשרה פרמטרים קונים גורם 100.0761.1910^{0.076} \approx 1.19 מהאובדן שנותר. זה נשמע כמו כלום, וזה העובדה החשובה ביותר כאן — התשואות גרועות והן לעולם לא נעצרות. חוק חזקה עם מעריך קטן מבטיח שסדר הגודל הבא יעזור, פחות מהקודם, לנצח. קניית compute מפסיקה להיות הימור והופכת לרכישה עם שער חליפין מפורסם, וזה בדיוק הטיעון ששחרר את ההון.

ואז בא המרשם, וכאן המאמר טעה באופן שעלה לתעשייה הרבה מאוד כסף. טבלה 6 של Kaplan נותנת NoptC0.73N_{\text{opt}} \propto C^{0.73} ו-DoptC0.27D_{\text{opt}} \propto C^{0.27}: פי עשרה compute פירושו מודל גדול פי 5.4 שמוזן רק פי 1.9 יותר טקסט. התקציר מפורש — ״training אופטימלי מבחינת compute כולל אימון מודלים גדולים מאוד על כמות נתונים צנועה יחסית ועצירה משמעותית לפני התכנסות.״ התחום עשה בדיוק את זה: GPT-3 הוא 175 מיליארד פרמטרים על 300 מיליארד tokens,7 ‏Gopher 280 מיליארד על 300 מיליארד, ‏Megatron-Turing NLG 530 מיליארד על 270 מיליארד.2 חצי token עד שני tokens לפרמטר, לכל אורך הדרך.

Chinchilla, ומה הסריקה שלמעלה מדדה

קישור למקטע: Chinchilla, ומה הסריקה שלמעלה מדדה

במרץ 2022, Hoffmann ואחרים אימנו יותר מ-400 מודלים מ-70 מיליון עד 16 מיליארד פרמטרים והגיעו למסקנה ההפוכה בשלושה מסלולים בלתי תלויים.2 טבלה 2 שלהם מדווחת על המעריך aa ב-NoptCaN_{\text{opt}} \propto C^{a} כ-0.50, 0.49 ו-0.46, מול 0.73 של Kaplan. במילים פשוטות: גודל המודל ונתוני ה-training צריכים לגדול באותו יחס.

הגישה השנייה שלהם היא זו שמשוחזרת בסריקה שבראש הפרק הזה, במיליונית מקנה המידה: מקבעים תקציב, מאמנים גדלים רבים בדיוק בתקציב הזה, ומשרטטים אובדן סופי מול גודל מודל.

פרמטריםC=1013C = 10^{13}C=3.16×1013C = 3.16 \times 10^{13}C=1014C = 10^{14}
98,6245.3531 (171)4.8638 (542)
150,3205.4636 (74)
194,2085.5041 (44)4.8730 (140)4.4040 (442)
295,8085.5550 (19)4.9029 (60)4.3383 (190)
665,2805.7849 (3.8)5.1254 (12)4.4192 (38)
1,280,7685.8174 (1.0)5.1751 (3.2)4.5003 (10)
3,101,5685.4686 (0.5)4.7768 (1.7)
5,315,0725.5894 (0.2)4.8514 (0.6)
15,053,5685.3534 (0.1)

אובדן held-out ב-nats לכל token, ‏tokens לפרמטר בסוגריים, מודגש המודל הטוב ביותר בכל תקציב; קו מפריד הוא נקודה שלא הורצה, כי התקציב דרש יותר טקסט מכפי שהקורפוס מכיל או שהגודל היה מחוץ לטווח שנסרק שם.

קראו עמודה כלפי מטה: האובדן יורד, מגיע לתחתית ואז עולה שוב. מודל יכול להיות גדול מדי לתקציב שלו בדיוק באותה קלות שבה הוא יכול להיות קטן מדי — ב-101410^{14} הקנס על בחירת 665,280 פרמטרים במקום 295,808 הוא 0.08 nats, שעל המעטפת שהותאמה למעלה הוא האובדן שמודל בגודל נכון מגיע אליו עם 18% פחות compute. בחירת הצורה הלא נכונה זורקת חמישית מהתקציב. זו Figure 3 של Chinchilla אחר צהריים אחד על GPU יחיד במקום עם ארבע מאות מודלים.

עכשיו קראו לרוחב. ב-101310^{13} המודל הטוב ביותר הוא הקטן ביותר שנסרק; ב-101410^{14} הוא 295,808 פרמטרים, מוקף משני הצדדים. האופטימום זז ימינה כשהתקציב גדל, וזה כל תוכן התיקון. התאימו את הגישה השלישית של המאמר — המשטח L(N,D)=E+A/Nα+B/DβL(N,D) = E + A/N^{\alpha} + B/D^{\beta} על פני כל ההרצות — ומזערו בכפוף ל-C=6NDC = 6ND:

TEXT
L(N, D) = 24.7 / N^0.195 + 46.8 / D^0.169       (E fits to ~0; see below)
implied   N_opt ∝ C^0.464
  compare   Chinchilla 0.46-0.50 · Besiroglu 0.513 · Kaplan 0.73

0.46, מלפטופ, מול 0.73 של Kaplan. התאמה לשלוש ספרות מתקציב של שלושה תקציבים היא מזל; התאמה לספרה הראשונה אינה. המעריך נוסע — הקבוע לא, כי יחס ה-token-לפרמטר באופטימות האלה הוא 170 עד 540, לא 20. שלוש סיבות, כולן מאלפות. EE מתאים לאפס כי באובדן מעל 4 nats ההרצה אינה קרובה לרצפת האנטרופיה ששולטת בהתאמה של Chinchilla. גודל ה-batch וקצב הלמידה היו קבועים ולא כוונו לכל נקודה, מה שמקשה על ההרצות שמקבלות הכי מעט צעדים — ואלה המודלים הגדולים: ב-101310^{13} FLOPs מודל של 1.28 מיליון פרמטרים מקבל 159 צעדי אופטימייזר בסך הכול, הרבה מתחת לכמה אלפים שאיבר SminS_{\min} של Kaplan אומר שכל מודל צריך. Scaling law מותאם בתוך משטר, וזה יושב שישה סדרי גודל מתחת ל-Chinchilla.

ומכאן תקציר המאמר: ״current large language models are significantly undertrained״. Chinchilla הוא ההדגמה — 70 מיליארד פרמטרים על 1.4 טריליון tokens, אותו compute כולל כמו Gopher עם 280 מיליארד על 300 מיליארד, ומנצח אותו ב-51 מתוך 57 משימות MMLU, ‏67.5% מול 60%.2 קטן פי ארבעה, טקסט רב פי ארבעה וחצי, אותו כסף, מודל טוב יותר.

שתי הסתייגויות לגבי היחס המפורסם הזה. ״עשרים tokens לפרמטר״ אינו משפט במאמר, שאומר רק ש״עבור כל הכפלה של גודל המודל גם מספר ה-training tokens צריך להיות מוכפל״; ה-20 הוא היסק מטבלה 3 ומ-70 B על 1.4 T של Chinchilla עצמו. והדיוק שלו גרוע מהמודפס: Besiroglu ואחרים התאימו מחדש מתוך דיגיטציה של Figure 4, מצאו שהפרמטרים המקוריים ״מתאימים לנתונים המשוחזרים בצורה גרועה״ עם רווחים ״צרים באופן בלתי סביר בהינתן מספר נקודות הנתונים״, והעמידו את הטווח הישר על ״בין 4 ל-40״ tokens לפרמטר.8

פרט אחד בשיטה של Chinchilla מקיים הבטחה שפרק 1 נתן לגבי schedules של קצב למידה. ה-cosine schedule חייב להיות מותאם לתקציב ה-token. מודל שיראה 10 מיליון tokens חייב לדעוך את קצב הלמידה שלו לאפס ב-10 מיליון tokens; תנו לו schedule בגודל 100 מיליון, עצרו אותו מוקדם, ואתם קוראים אובדן באמצע ירידה בקצב גבוה מדי. Chinchilla מאמן כל מודל בארבעה אורכי מחזור כדי לשלוט בדיוק בזה; הסריקה למעלה קובעת את ה-schedule שלה מהתקציב מאותה סיבה.

הם התוצאה האמפירית השימושית ביותר בתחום, ומוכרים אותם מעבר למה שהם אומרים. ארבע מגבלות.

הם חוזים אובדן, לא יכולת. אגף שמאל הוא cross-entropy על טקסט held-out. שום דבר במאמרים האלה לא מתיר טענה לגבי האם מודל יכתוב SQL נכון, יסרב לבקשה מזיקה או ישתמש בכלי. זה שוב הלקח של פרק 5: חיזוי של האובדן אינו חיזוי של ההתנהגות שעליה אתם משלמים.

הם מותאמים, לא נגזרים. אין תיאוריה שמייצרת את αN=0.076\alpha_N = 0.076. הקבועים זזים עם ה-tokenizer — ולכן השוואת perplexity בין שני tokenizers היא חסרת משמעות, כפי שהסביר פרק 8 — ועם תערובת הנתונים, הארכיטקטורה והאופטימייזר. כל חוק מפורסם הוא חוק של ההתקנה שיצרה אותו, ולכן Meta התאימה מחדש את שלה לפני Llama 3.5

הם מניחים token טרי לכל צעד, מה שמניח בשקט קורפוס אינסופי. Muennighoff ואחרים מדדו מה קורה כשהוא נגמר: עד ארבע תקופות של נתונים חוזרים עולות כמעט כלום — מודל של 8.7 מיליארד פרמטרים על 44 מיליארד tokens ייחודיים שנראו ארבע פעמים סיים עם ״רק 0.5% יותר validation loss״ מאותו מודל על 178 מיליארד ייחודיים — בעוד שמעבר לכ-16 תקופות compute נוסף לא קונה כלום.9

ואף אחד כבר לא מאמן compute-optimal. Chinchilla ממזער את עלות ה-training; מודל פרוס משלם אחר כך בערך 2N2N FLOPs לכל token שנוצר, לנצח. LLaMA 1 אמר זאת במפורש: ״בהינתן רמת ביצועים יעד, המודל המועדף אינו המהיר ביותר לאימון אלא המהיר ביותר ב-inference״.10 Sardana ואחרים ניסחו זאת פורמלית על ידי מזעור 6NDtrain+2NDinference6ND_{\text{train}} + 2ND_{\text{inference}} במקום זאת, ומצאו שמי שמצפה למיליארד בקשות צריך לאמן ״קטן יותר וארוך יותר מ-Chinchilla-optimal״.11 §9.1 של Llama 3 מסכים: המודלים הקטנים שלו מאומנים ״הרבה מעבר לנקודת ה-compute optimal training, ובפועל מחליפים training compute ביעילות inference״.5 היחס אינו מיושן; הוא עונה על שאלה שכבר אינה זו שנשאלת.

יכולות מתהוות, והוויכוח אם הן אמיתיות

קישור למקטע: יכולות מתהוות, והוויכוח אם הן אמיתיות

האובדן יורד בצורה חלקה. ציוני benchmark לפעמים לא. Wei ואחרים אספו מקרים שבהם משימה יושבת ברמת ניחוש לאורך סדרי גודל של training compute ואז קופצת — אריתמטיקה תלת-ספרתית שמופיעה ב-GPT-3 סביב 2×10222 \times 10^{22} FLOPs, ‏MMLU עולה מעל ניחוש בין 33 ל-5×10235 \times 10^{23} — ונתנו לתבנית שם: ״יכולת היא emergent אם היא אינה קיימת במודלים קטנים יותר אך קיימת במודלים גדולים יותר״.12 אם זו תכונה אמיתית, אקסטרפולציה מניסויים זולים אינה בטוחה, כי היכולת שאתם קונים עלולה לא להתקיים בשום קנה מידה שאתם יכולים להרשות לעצמכם לבדוק.

Schaeffer, Miranda ו-Koyejo טענו שרוב זה הוא ארטיפקט של מדידה, והמנגנון הוא אריתמטי.13 אובדן per-token יורד בצורה חלקה, ולכן ההסתברות ש-token אחד יהיה נכון, exp(L)\exp(-\mathcal{L}), משתפרת בהדרגה. מדרגים את המודל עם exact string match על תשובה באורך LL tokens ומעלים את ההסתברות הזאת בחזקת LL — עקומה חלקה בחזקה גדולה נראית כמו צוק. החליפו למדד שסופר tokens במקום לדרוש את כולם, על אותם פלטים, ו״ביצועי המשפחה משתפרים בצורה חלקה, רציפה וצפויה עם הגדלת scale״.

הביקורת שלהם היא המספר שצריך לזכור — ״מתוך 39 המדדים המועדפים ב-BIG-Bench, לכל היותר 5 מציגים emergence״, כאשר שני מדדים לא רציפים אחראים ליותר מ-92% מהמקרים הנטענים — וכך גם האזהרה שלהם: ״אין לפרש דבר במאמר זה כטענה ש-large language models אינם יכולים להציג יכולות emergent״. קפיצה בתרשים היא ראיה על המדד עד שיוכח אחרת. פרק 29 הוא המקום שבו זה נהיה הבעיה שלכם, כי בחירת מדד עם cutoff קשיח היא החלטה שתקבלו בלי לשים לב.

הקורפוס הוא החלק בהרצת pretraining שאין לו משוואה צמודה, ושבו נמצאות רוב ההחלטות המשמעותיות. חומר הגלם הוא סריקת web: ארכיון אוגוסט 2026 של Common Crawl מחזיק ״2.14 מיליארד דפי web או 360 TiB של תוכן לא דחוס״, חודש אחד ממנו, בחינם להורדה.14 כמעט כלום מזה אינו שמיש כפי שהוא. מאמר T5 אומר שהסריקה ״מורכבת ברובה מג׳יבריש או מטקסט boiler-plate כמו תפריטים, הודעות שגיאה או טקסט כפול״, וצינור C4 שהציג הוא רשימת heuristics קהות — לשמור רק שורות שמסתיימות בפיסוק סופי, להשליך דפים עם פחות משלושה משפטים, להשליך כל דף שמכיל סוגר מסולסל או מילה מרשימה ציבורית של גסויות — ולהפוך עשרים טרה-בייט של טקסט חודשי לכ-750 GB.15

קהות היא המילה. Dodge ואחרים בדקו מה המסננים האלה מסירים ומצאו שרשימת החסימה של גסויות מוחקת 42% מהמסמכים באנגלית אפרו-אמריקאית ו-32% באנגלית המזוהה עם היספנים, לעומת 6.2% באנגלית המזוהה עם לבנים, ומשאירה קורפוס ש-97.8% ממנו בקטגוריה האחרונה.16 לכלל שלא הייתה לו דעה על דיאלקט הייתה אחת.

ואז deduplication, שאינה ניקיון: Lee ואחרים מצאו משפט בן 61 מילים שחזר 61,036 פעמים ב-C4, והראו ש-deduplication חותכת פי עשרה את הקצב שבו מודלים ״פולטים טקסט משונן״, מ-1.9% מה-generated tokens ל-0.19%.17 יותר אינו בהכרח טוב יותר — צוות FineWeb ביצע deduplication גלובלי על פני 96 סריקות, קיבל 4 טריליון tokens וללא שיפור מדיד, ואז ביצע deduplication לכל סריקה בנפרד, קיבל 20 טריליון, והשווה לקורפוס הקיים הטוב ביותר.18

ואז זיהום. Llama 3 מדד את שלו ופרסם אותו: 98% מ-AGIEval, ‏95% מ-BIG-Bench Hard ו-85% מ-HellaSwag חופפים לסט ה-training לפי 8-grams, ועבור MMLU חפיפה כה גבוהה ש״בלתי אפשרי לקבל אומדן טוב של שיפור ביצועים״.5 §4 של GPT-3 מדווח על באג סינון שהשאיר benchmarks בתוך הנתונים ללא דרך חזרה: ״בגלל שיקולי עלות לא היה מעשי לאמן מחדש את המודל״.7

Provenance הוא החלק הלא פתור. The Pile הגיע עם רכיב של 100.96 GiB בשם Books3 — 12% מהקורפוס, ולפי טבלת ההסכמה של המאמר עצמו, ספרים מ-tracker פרטי של torrents;19 הוא הורד מהרשת באוגוסט 2023 אחרי תלונת זכויות יוצרים. המצב המשפטי נכון לספטמבר 2026 אינו מוכרע, ושלוש הפסיקות האמריקאיות המצוטטות כמגמה אינן מסכימות זו עם זו. Alsup מצא ש-training על ספרים שנרכשו כדין הוא ״טרנספורמטיבי באופן יוצא דופן״ אך קבע שספרייה שנבנתה מעותקים פיראטיים אינה כזו, ו-Anthropic הסדירה את המחצית הזאת תמורת $1.5 מיליארד המכסים 482,460 יצירות, בערך $3,000 כל אחת, באישור 20 ביולי 2026.20 Chhabria נתן ל-Meta פסק דין מקוצר בעודו כותב שפסיקתו ״אינה עומדת בעד הטענה שהשימוש של Meta בחומרים מוגנים בזכויות יוצרים כדי לאמן את מודלי השפה שלה הוא חוקי״, אלא רק ש״התובעים האלה העלו את הטיעונים הלא נכונים״.21 Bibas, שפסק נגד Ross Intelligence, ציין ש״רק AI לא-גנרטיבי נמצא לפניי היום״.22 שום בית משפט לערעורים בארה״ב לא הכריע בשאלה.

אנשים עושים את החלקים שהאובדן לא יכול. TIME דיווח בינואר 2023 שעובדים שסימנו טקסט רעיל עבור OpenAI דרך חברת Sama לקחו הביתה ״בין כ-$1.32 ל-$2 לשעה״ בעודם קוראים קטעים המתארים פגיעה מינית בילדים, עינויים ופגיעה עצמית, בעוד OpenAI שילמה ל-Sama ‏$12.50 לשעה עבור העבודה; Sama חולקת גם על טווח השכר וגם על המכסה.23 זה הסינון סביב pretraining ולא ה-pretraining עצמו — אבל הוא נמצא באותה חשבונית, ושם יושב אדם.

החשמל אמיתי ובדרך כלל מצוטט לא נכון. הנתון הזהיר ביותר שפורסם הוא של BLOOM: ‏1,082,990 שעות GPU, ‏433 MWh ו-24.7 טונות של שווה-ערך CO₂ להרצה, 50.5 כולל ייצור וצמתים במנוחה;24 Patterson ואחרים מציבים את GPT-3 על 1,287 MWh ו-552 טונות.25 שתי אזהרות. היתרון של BLOOM הוא רשת החשמל הגרעינית בצרפת ב-57 גרם CO₂ לקוט״ש ולא יעילות — הוא השתמש ביותר אנרגיה מ-OPT-175B. והמספר המצוטט ביותר בתחום לפליטות, 626,155 lb של Strubell ואחרים עבור neural architecture search, הוכח אחר כך כגבוה פי 88, כי הניחו שהחיפוש רץ בגודל מודל מלא כשבפועל רץ על proxy.26 המסגור של LBNL הוא המגן: datacentres בארה״ב השתמשו ב-192 TWh ב-2024, ‏4.7% מהחשמל הלאומי — מספר שמוצמד לתעשייה, לא להרצה יחידה.27

קו החיבור הוא מה ש-Bender ואחרים כינו חוב תיעוד: ״להכניס את עצמנו למצב שבו ה-datasets גם לא מתועדים וגם גדולים מכדי לתעד post hoc״.28 כל עובדה למעלה קיימת כי מישהו הסתכל. עבור הקורפוסים שמאחורי המודלים שרוב האנשים משתמשים בהם, אף אחד לא יכול.

עכשיו האריתמטיקה שכולם רוצים, מארבעה קלטים מצוטטים, כך שכאשר הם יתיישנו יהיה ברור מה להחליף.

עמוד H100 של NVIDIA מציין 1,979 teraFLOPS של תפוקת tensor-core ב-BF16 תחת הערת שוליים שאומרת ״with sparsity״.29 שום הרצת pretraining לא משתמשת ב-structured sparsity, ולכן הנתון הצפוף הוא חצי ממנו: 989.5 TFLOP/s.

טבלה 4 של Llama 3 מדווחת על 38–43% BF16 model FLOPs utilisation. ניקח 40%: ‏395.8 TFLOP/s של אריתמטיקה שימושית לכל GPU.5

מחיר on-demand של Lambda לצומת 8×H100 SXM, נבדק ב-2026-09-06: $3.99 לכל שעת GPU, כלומר $31.92 לשעה לצומת.30

היחס של Chinchilla, ‏D=20ND = 20N, נותן C=6ND=120N2C = 6ND = 120N^2 ולכן N=C/120N = \sqrt{C/120}.

תקציבשעות H100FLOPsפרמטרים compute-optimaltokensעל צומת 8×H100 אחדGPUs לסיום ב-90 יום
$100253.6e19546 M10.9 B3.1 ש׳1
$1,0002513.6e201.73 B34.5 B31.3 ש׳1
$10,0002,5063.6e215.46 B109 B13 ימים2
$100,00025,0633.6e2217.3 B345 B131 ימים12
$1,000,000250,6273.6e2354.6 B1.09 T4 שנים116
$10,000,0002,506,2663.6e24173 B3.45 T36 שנים1,160
$100,000,00025,062,6573.6e25546 B10.9 T358 שנים11,603

קראו את שתי העמודות האחרונות יחד. ב-$10,000 מקבלים מודל של 5 מיליארד פרמטרים על צומת שכור אחד בתוך שבועיים. ב-$100,000,000 האריתמטיקה אומרת 546 מיליארד פרמטרים — ושנים-עשר אלף H100s מחווטים יחד לשלושה חודשים, וזה לא משהו ששוכרים בכרטיס אשראי. מעבר לכ-$100,000, האילוץ הכובל מפסיק להיות כסף והופך ל-cluster.

לפני שסומכים על טבלה כזאת, בדקו אותה מול הרצות שהעלות האמיתית שלהן פורסמה — llm.c משחזר GPT-2 124M ב-״~90 דקות״ על צומת 8×A100 ״בערך ב-$20״, ו-GPT-2 1.6B ב-24 שעות על צומת 8×H100 תמורת $672.31

TEXT
$672, against what $672 actually bought (llm.c GPT-2 1.6B, one 8xH100 node, 24 h)
  this table predicts:      168 H100-hours   N = 1.41 B params   D = 28.3 B tokens
  what was actually run:    192 H100-hours   N = 1.558 B params  D = 33.6 B tokens

Llama 3 405B, against Meta's own published GPU-hours
  from the paper's 3.8e25 FLOPs at 40 % MFU:   26.67 M H100-hours
  published in Meta's Llama 3.1 model card:    30.84 M H100-hours    ratio 0.86

שניהם בטווח של כ-15%, שזה בערך הדיוק שאומדן כזה ראוי לו, וטוב בהרבה מהדיוק שבו הוא בדרך כלל מצוטט.

השוואת הכותרת, עם שתי ההגדרות על השולחן

קישור למקטע: השוואת הכותרת, עם שתי ההגדרות על השולחן

המספר החוזר ביותר בנושא הזה הוא שמודל מסוג GPT-2 שעלותו הייתה בערך $43,000 ב-2019 ניתן לשחזור היום בכמה עשרות דולרים. החצי המודרני מתועד היטב; החצי ההיסטורי לא.

היום. README של nanochat מאת Karpathy: ״אתם יכולים לאמן LLM משלכם ביכולת GPT-2 ... תמורת רק $48 (2 שעות של צומת GPU ‏8XH100) ... על spot instance, העלות הכוללת יכולה להיות קרובה יותר ל-$15.״32 ״יכולת GPT-2״ כאן מדויקת ומפורסמת — ניצחון על CORE score של GPT-2, ‏0.256525 — על leaderboard שהכניסה הטובה ביותר בו נכון ל-14 במרץ 2026 היא 1.65 שעות. ה-$48 מניח $3 לשעת GPU, מתחת למחיר הרשמי של Lambda, ‏$3.99; במחיר הרשמי זה קרוב יותר ל-$64.

ב-2019. אין מקור ראשוני: OpenAI מעולם לא פרסמה משך או עלות. השרשרת עוברת דרך The Register, פברואר 2019, שדיווח על ״256 ליבות Google TPU3״ ללא מחיר וללא משך; ואז Synced, יוני 2019, שציין שהחומרה עלתה $256 לשעה ב-Google Cloud ואמר במפורש ש-״OpenAI didn't specify the training duration״. ‏$43,008 הם $256 לשעה כפול 168 שעות משוערות שאיש מעולם לא ביסס.

לכן הכותרת הישרה היא: מודל התואם את ציון ה-benchmark המפורסם של GPT-2 ניתן לאימון היום בהרבה פחות מ-$100 על חומרה שכורה, מול עלות ב-2019 שמעולם לא פורסמה ושהאומדן המפורסם שלה נשען על ניחוש לא ממוסמך לגבי משך הזמן. הקריסה אמיתית והחצי המודרני ניתן לשחזור לכל מי שיש לו כרטיס אשראי; היחס הוא אריתמטיקה על מספר שאינו קיים. זה מצב עלויות ה-training המפורסמות בכלל. במאמר GPT-3 אין שום סכום בדולרים, רק 3.14×10233.14 \times 10^{23} FLOPs בטבלה D.1;7 גם במאמר Llama 3 אין.5 כל עלות training שקראתם היא אומדן מתוך ספירת FLOP, הנחת חומרה והנחת מחיר — תמיד כדאי לשאול של מי.

מה מודל בסיס יודע, ומתי הוא הפסיק לדעת את זה

קישור למקטע: מה מודל בסיס יודע, ומתי הוא הפסיק לדעת את זה

מה שיוצא ראה קורפוס קבוע שנאסף ברגע קבוע, ומכך נובעות שתי תכונות.

הראשונה היא knowledge cutoff. אחרי תאריך האיסוף המודל לא יודע כלום — לא ״לא בטוח״, כלום — והוא ימציא בשטף במקום לומר זאת, כי לומר זאת מעולם לא היה התנהגות שעליה אומן. כרטיס המודל של Llama 3.1 נותן דצמבר 2023;33 לכל מודל יש אחד, והוא תכונה של נתוני ה-training, לא של הפריסה. עקיפה שלו היא בעיית retrieval, וזה פרק 19.

השנייה היא שמודל בסיס משלים ולא עונה. תנו לו ״מהי בירת צרפת?״ והמשך סביר הוא שאלה נוספת, כי בקורפוס המחרוזת הזאת מופיעה לרוב ברשימת תרגילים.

משלים טקסט אינו assistant. הוא לא פועל לפי הוראות, כי שום דבר בקורפוס לא אמר לו שבקשה צריכה להתבצע ולא להימשך. אין לו מושג של שיחה עם שני משתתפים. הוא יפיק בשמחה את ההמשך הסביר ביותר של prompt מזיק, כי סביר הוא הדבר היחיד שעליו הוא אי פעם עבר אופטימיזציה.

להפוך אותו למשהו שעונה דורש שלב שני שעולה שבריר אחוז מהראשון, ומורכב כמעט כולו מהצגת דוגמאות להתנהגות שאתם רוצים ואז השוואת זוגות של הפלטים שלו עצמו. השלב הזה הוא המקום שממנו מגיעים instruction following, chat templates, סירובים וגם — וזה מפתיע אנשים — היכולת לקרוא לכלי. פרק 11 הוא השלב הזה: supervised fine-tuning, ‏RLHF, ‏DPO ו-GRPO, והשאלה מה פירוש ״aligned״ ומי מחליט.


כדאי לקרוא לצד הפרק הזה גם את build-nanogpt של Karpathy ואת הווידאו הנלווה אליו, שמוליכים שחזור מלא של GPT-2 מקצה לקצה בקצב שהפרק הזה לא יכול; וגם את Stanford CS324, ‏Large Language Models, שההרצאות שלו על נתונים ועל השפעה סביבתית מעמיקות יותר מהסעיף שלמעלה בחומר שהקורס הזה מטפל בו פעם אחת ומאציל הלאה.

  1. Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J. and Amodei, D. Scaling Laws for Neural Language Models. arXiv:2001.08361 (2020). שלושת חוקי החזקה הם משוואות (1.1)–(1.3) ב-§1.2 והקבועים המלאים נמצאים ב-Appendix A, Table 5; גזירת 6N6N היא §2.1; מעריכי הקצאת ה-compute הם Table 6. שימו לב שיש שני חוקי compute, ‏αC=0.057\alpha_C = 0.057 בגודל batch קבוע ו-αCmin=0.050\alpha_C^{\min} = 0.050 בגודל batch אופטימלי; המאמר אומר שהאחרון ״should be used to make predictions״. 2

  2. Hoffmann, J., Borgeaud, S., Mensch, A., Buchatskaya, E., Cai, T., Rutherford, E. et al. Training Compute-Optimal Large Language Models. arXiv:2203.15556 (2022). מעריכים ב-Table 2, תקציבים חזויים ב-Table 3, השוואת Gopher ב-§4, מוסכמת ספירת הפרמטרים ב-Appendix F. הפרוזה מתחת ל-Table 3 אינה מסכימה עם Table 3 עצמו בשורות 175 B ו-280 B; הטבלה היא הגרסה שיש לצטט. 2 3 4

  3. Micikevicius, P., Narang, S., Alben, J., Diamos, G., Elsen, E., Garcia, D. et al. Mixed Precision Training. arXiv:1710.03740 (2017), ICLR 2018. משקלי master ב-FP32 ב-§3.1, loss scaling ב-§3.2. 2

  4. Rajbhandari, S., Rajbhandari, S., Ruwase, O. and He, Y. ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054 (2019), SC20. חשבונאות 16Ψ16\Psi היא §3.1; נתוני המצב השיורי עבור activations הם §3.2.

  5. Grattafiori, A. et al. (Llama Team, AI @ Meta). The Llama 3 Herd of Models. arXiv:2407.21783 (2024). תקציב compute ומספר tokens ב-§1, ה-scaling law שהותאם מחדש ב-§3.2.1, תצורת ה-parallelism וה-MFU ב-Table 4, ניתוח הזיהום ב-§5.1.4, והצהרת ה-over-training ב-§9.1. המאמר אינו מכיל סכומי דולרים או טבלת פליטות. 2 3 4 5 6

  6. Stanford CS336, Language Modeling from Scratch. הרצאה 2 מכסה חשבונאות משאבים, הרצאות 5–8 GPUs, ‏kernels ו-parallelism, הרצאות 9 ו-11 scaling, והרצאות 13–14 נתונים. זה הקורס שהפרק הזה מאציל אליו את ההנדסה שלו, והוא ציבורי.

  7. Brown, T. B. et al. Language Models are Few-Shot Learners. arXiv:2005.14165 (2020). Compute ב-Appendix D, Table D.1 — שיש בה עמודה שכותרתה המילולית ״flops per param per token״, והערך שלה בכל שורת GPT-3 הוא 6. ניתוח זיהום ב-§4. 2 3

  8. Besiroglu, T., Erdil, E., Barnett, M. and You, J. Chinchilla Scaling: A replication attempt. arXiv:2404.10102 (2024). משחזר את הנתונים של Chinchilla באמצעות דיגיטציה של Figure 4, מתאים מחדש, ומדווח על המעריכים המתוקנים ועל רווחים רחבים בהרבה.

  9. Muennighoff, N., Rush, A. M., Barak, B., Le Scao, T., Piktus, A., Tazi, N., Pyysalo, S., Wolf, T. and Raffel, C. Scaling Data-Constrained Language Models. arXiv:2305.16264 (2023), NeurIPS 2023. תוצאת ארבע התקופות היא §6; מחצית החיים של שש-עשרה התקופות היא RD15R_D^* \approx 15 המותאם.

  10. Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T. et al. LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 (2023). §1 מציין את טיעון עלות ה-inference נגד training שהוא Chinchilla-optimal.

  11. Sardana, N., Portes, J., Doubov, S. and Frankle, J. Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws. arXiv:2401.00448 (2023), ICML 2024. §5 שלהם מכיל גם את משקל הנגד: מודלים שאומנו ביחסי token קיצוניים ממשיכים להשתפר, אבל ״more slowly than scaling laws predict״.

  12. Wei, J., Tay, Y., Bommasani, R., Raffel, C., Zoph, B., Borgeaud, S. et al. Emergent Abilities of Large Language Models. arXiv:2206.07682 (2022), TMLR. ההגדרה ב-§2, דוגמאות וספי compute ב-§3–4 וב-Table 1.

  13. Schaeffer, R., Miranda, B. and Koyejo, S. Are Emergent Abilities of Large Language Models a Mirage? arXiv:2304.15004 (2023), NeurIPS 2023 outstanding paper. טיעון המדד הוא §2, מטא-אנליזת BIG-Bench §4, ודוגמת הראייה הבנויה §5.

  14. Common Crawl, August 2026 Crawl Archive Now Available (CC-MAIN-2026-34), פורסם 24 באוגוסט 2026, נבדק 2026-09-06. עמוד הבית שלו עצמו טוען ״over 300 billion pages spanning 15 years״, ״totalling more than 10 petabytes״ — נתון לכל הארכיון, לא לסריקה החודשית שמתומחרת כאן.

  15. Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W. and Liu, P. J. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683 (2019), JMLR 21(140). מסנני C4 הם §2.2. המאמר נותן גדלים בבתים, לא ב-tokens; נתון 156 מיליארד ה-tokens שמיוחס לו לעיתים קרובות מגיע מ-Dodge ואחרים למטה.

  16. Dodge, J., Sap, M., Marasović, A., Agnew, W., Ilharco, G., Groeneveld, D., Mitchell, M. and Gardner, M. Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758 (2021), EMNLP 2021. שיעורי הסרת הדיאלקטים הם §5.3; זיהום benchmark ב-C4 הוא §4.2.

  17. Lee, K., Ippolito, D., Nystrom, A., Zhang, C., Eck, D., Callison-Burch, C. and Carlini, N. Deduplicating Training Data Makes Language Models Better. arXiv:2107.06499 (2021), ACL 2022. ‏61,036 החזרות הן footnote 1; נתוני השינון הם §6.2, Table 4, והם אחוזים מתוך generated tokens תחת קריטריון exact-match של 50 tokens.

  18. Penedo, G., Kydlíček, H., Ben Allal, L., Lozhkov, A., Mitchell, M., Raffel, C., Von Werra, L. and Wolf, T. The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale. arXiv:2406.17557 (2024), NeurIPS 2024 Datasets and Benchmarks. תוצאת ה-deduplication היא §3.4. ה-dataset ששוחרר גדל מאז מעבר ל-15 טריליון ה-tokens של המאמר.

  19. Gao, L., Biderman, S., Black, S. et al. The Pile: An 800GB Dataset of Diverse Text for Language Modeling. arXiv:2101.00027 (2020). Books3 הוא §2.3 ו-Table 1; טבלת ההסכמה היא Table 5. הקורפוס הוא 825.18 GiB, כך שאפילו הכותרת מעוגלת כלפי מטה.

  20. Bartz v. Anthropic, No. 4:24-cv-05417 (N.D. Cal.). צו שימוש הוגן 23 ביוני 2025 (Dkt. 231); אישור תובענה ייצוגית 17 ביולי 2025; אישור סופי ופסק דין 20 ביולי 2026 (Dkt. 680). ההסדר משחרר קלטים מן העבר בלבד, לא פלטים ולא התנהלות עתידית.

  21. Kadrey v. Meta, No. 3:23-cv-03417-VC (N.D. Cal.), פסק דין מקוצר 25 ביוני 2025 (Dkt. 598). שימו לב שטענת ההפצה סביב torrenting לא הוכרעה ונשארה תלויה ועומדת.

  22. Thomson Reuters v. ROSS Intelligence, No. 1:20-cv-00613-SB (D. Del.), חוות דעת מתוקנת 11 בפברואר 2025 (Dkt. 770), Bibas J. בערעור ביניים לבית המשפט לערעורים של המעגל השלישי (No. 25-2153), נטען 11 ביוני 2026, טרם הוכרע בעת הכתיבה.

  23. Perrigo, B. Exclusive: OpenAI Used Kenyan Workers on Less Than $2 Per Hour to Make ChatGPT Less Toxic. TIME, 18 בינואר 2023. ה-$2 הוא תקרה עבור בודקים בכירים שעמדו בכל יעד; מסמנים זוטרים, הרוב, לקחו הביתה $1.32. תגובת Sama, המצוטטת באותו מאמר, נותנת $1.46–$3.74 ומכסה נמוכה יותר.

  24. Luccioni, A. S., Viguier, S. and Ligozat, A.-L. Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language Model. arXiv:2211.02001 (2022), JMLR 24(253). טבלאות 1 ו-3.

  25. Patterson, D., Gonzalez, J., Le, Q., Liang, C., Munguia, L.-M., Rothchild, D., So, D., Texier, M. and Dean, J. Carbon Emissions and Large Neural Network Training. arXiv:2104.10350 (2021). נתוני GPT-3 הם Table 4; תיקון אומדן ה-NAS הוא §4.1.

  26. Strubell, E., Ganesh, A. and McCallum, A. Energy and Policy Considerations for Deep Learning in NLP. arXiv:1906.02243 (2019), ACL 2019. שווה לקרוא בדיוק בגלל מה שקרה למספר המצוטט ביותר שלו: המאמר זהיר, מציין את האקסטרפולציה שלו, ועדיין טעה בשני סדרי גודל בשורה היחידה שכולם חזרו עליה.

  27. Smith, S. J., Hubbard, A., Newkirk, A., Ganeshalingam, M., Holecek, B., Sartor, D., Mills, M. and Shehabi, A. United States Data Center Energy Usage Report: 2025 Update. LBNL-2001758 (18 ביוני 2026). זה מעדכן כלפי מטה את הדוח המצוטט נרחבות מ-2024 עבור הסדרה ההיסטורית; אם אתם מצטטים את נתון 176 TWh עבור 2023, אתם מצטטים את המהדורה שהוחלפה.

  28. Bender, E. M., Gebru, T., McMillan-Major, A. and Shmitchell, S. On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? FAccT '21, pp. 610–623. DOI 10.1145/3442188.3445922. ״Documentation debt״ הוא §4.4. שימו לב שנתוני הפחמן של המאמר עצמו מצוטטים מ-Strubell ואחרים ויורשים את התיקון שלמעלה — וזה איור לטיעון שלו יותר מאשר הפרכה שלו.

  29. NVIDIA. עמוד המוצר NVIDIA H100 Tensor Core GPU, ‏nvidia.com/en-us/data-center/h100/ (נבדק 2026-09-06). כל שורת tensor-core בעמוד הזה למעט FP64 נושאת את הערת השוליים ״with sparsity״; נתון ה-BF16 הצפוף שמשמש כאן הוא חצי מ-1,979 TFLOPS שפורסמו.

  30. Lambda. GPU Cloud pricing, ‏lambda.ai/pricing (נבדק 2026-09-06). On-demand, לכל GPU לשעה, לפני מס. המחירים בסעיף הזה יתיישנו מהר יותר מכל דבר אחר בקורס; האריתמטיקה סביבם לא.

  31. Karpathy, A. karpathy/llm.c, דיון #481, Reproducing GPT-2 (124M) in llm.c in 90 minutes for $20 (28 במאי 2024), ודיון #677, Let's reproduce GPT-2 (1.6B): one 8XH100 node, 24 hours, $672, in llm.c (11 ביולי 2024).

  32. Karpathy, A. karpathy/nanochat, README ו-leaderboard ״time to GPT-2״ (נבדק 2026-09-06). נתון ה-$48 והגדרת CORE-score של ״GPT-2 capability״ נמצאים שניהם ב-README; ה-speedrun.sh של המאגר עצמו אומר ״approximately 1.5 hours״, לכן יש להתייחס לנתון שעתיים כמעוגל.

  33. Meta. Llama 3.1 model card, models/llama3_1/MODEL_CARD.md ב-meta-llama/llama-models (נבדק 2026-09-06). מקור ל-30.84 M שעות H100 עבור מודל 405 B, לסך 39.3 M, לנתון 11,390 tCO2eq מבוסס-מיקום, ול-data cutoff של דצמבר 2023.


נוצר על ידי

David Vicente Campos

מייסד NeuraLIA Labs ושותף-מייסד MyRealFood

אני מהנדס מחשבים, בוגר אוניברסיטת לאון. הייתי שותף בהקמת MyRealFood, שם, כסמנכ״ל טכנולוגיות, בניתי את האפליקציה שמיליוני אנשים השתמשו בה כדי לאכול בריא יותר, והקמתי את NeuraLIA Labs, שם אני בונה מוצרי בינה מלאכותית. כאן אני כותב על מה שהייתי צריך להבין לאורך הדרך, כפי שהייתי רוצה שמישהו היה מסביר לי בזמנו.

עוד על המחבר

פורסם על ידי NeuraLIA Labs.

פוסטים חדשים ישירות לתיבת הדואר

חדשות AI, מדריכים ועדכוני מוצר — מייל קצר כשאנחנו מפרסמים משהו ששווה את הזמן שלך.

תוכן הקורס

Abstract software decision engine with branching paths, probability nodes, and glowing gates.
jev10 דקות קריאה

מודל ה-AI Jev נבנה להחלטות, לא לפרוזה

Jev של TypeSafe AI מושך תשומת לב כי הוא מתייחס לאינטליגנציית תוכנה כאל בעיית הסתברות: לבחור את ההסתעפות הנכונה, להצמיד ביטחון, ולהימנע מתשלום ל-LLM כדי שיכתוב טקסט כשהקוד צריך החלטה.

Abstract agent runtime sorting documents, memory blocks and pointer nodes inside a bounded context frame.
context-engineering10 דקות קריאה

הנדסת הקשר לסוכני AI ארוכי־טווח

סוכנים שרצים לאורך זמן לא נכשלים רק כי החלון קטן. הם נכשלים כשקבצים, פלטי כלים והיסטוריה מיושנת דוחקים החוצה את המשימה שהסוכן היה אמור להשלים.

מוכנים לתת ל-LIA לבחור?

בנו עם כל מודלי ה-AI במקום אחד — התחילו בחינם עוד היום.