Egy LLM pretrainingje: adatok, compute, scaling laws és költség
20 modell egy laptop GPU-n: scaling law mérése és a 6ND compute-becslés ellenőrzése valódi FLOP-számlálóval.
Ezen az oldalon
9. fejezet egy olyan transformer blokknál ért véget, amely tanul. Rakj egymásra néhányat, irányítsd a 8. fejezet következő-token veszteségét a kimenetre, és nincs már mit feltalálni. Ami hátramarad, az mind vásárlás.
Ez nagyobb váltás, mint amilyennek hangzik. Eddig minden fejezet azt kérdezte: tanul-e? — igen-nem kérdés, amelyet egy laptop tíz perc alatt eldönt. Ez a fejezet olyan kérdést tesz fel, amelyben pénz van: adott mennyiségű aritmetikáért mi a legjobb modell, amit meg tudok venni? A válasz egy képlet, és 2018-ban ez senkinek sem volt magától értetődő.
Itt van ugyanennek a kérdésnek a méréssel adott válasza, egyetlen laptop GPU-n. Húsz modellt, 98 624-től 15 millió paraméterig, nulláról tanítottunk 174 millió Wikipedia-tokenen — 2 048-tokenes BPE szótárral, úgy tanítva, ahogy a 7. fejezet tanít egyet, a 9. fejezet transformerével. Minden futás pontosan a három compute-keret egyikét kapta, egyetlen művelettel sem többet, így a nagyobb modell szükségképpen kevesebb szöveget olvas. Az egyes kereteknél elért legjobb hold-out loss:
budget C (FLOPs) best loss reached by a model of
1.00e13 5.3531 98,624 params
3.16e13 4.8638 98,624 params
1.00e14 4.3383 295,808 params
fitted: L = (Cc / C)^0.0913 over one decade of computeTízszer annyi aritmetika 19%-ot vesz le a veszteségből, és a három pont log-log skálán egy egyenesre esik. Az első kilenc fejezetben semmi sem jósolja ezt meg. Nincs mögötte tétel — empirikus szabályszerűség, más kitevővel érvényes a laptop és egy adatközpont közötti tíz nagyságrenden át, és ez az egyetlen megfigyelés győzött meg egy iparágat arról, hogy egy kis ország GDP-jét költse GPU-kra.
Mi a pretraining, és mi benne az új
Link a szakaszhoz: Mi a pretraining, és mi benne az újA célfüggvényben semmi sem változik. A modell továbbra is a következő tokenre jósol, a loss továbbra is a 4. fejezet cross-entropyje a 8. fejezet faktorizációjára alkalmazva, az optimizer továbbra is a 6. fejezet AdamW-je. A pretraining nem új algoritmus; ugyanaz az algoritmus, csak akkora korpuszon futtatva, hogy a futást költségvetni kell. Két dolog teszi ezt lehetővé: a címkék ingyen vannak, mert a pozíció célja a helyen lévő token, és már benne van a szövegben; a 6. fejezet utolsó szakasza pedig elhárította az ellenvetést, mert egy a klasszikus szabályoknál jóval több paramétert tartalmazó modell nem esik szét, hanem javul. Ami kijön belőle, az egy base model — valami, ami szöveget folytat, nem válaszol.
A compute megszámolása költés előtt: 6ND
Link a szakaszhoz: A compute megszámolása költés előtt: 6NDMielőtt bármit költségvetni lehetne, meg kell számolni, és a terület ezt egyetlen képlettel számolja:
ahol a paraméterszám, a training tokenek száma, pedig az összes lebegőpontos művelet. Kaplan és mtsai. két lépésben vezetik le.1 Forward: paraméterenként és tokenenként 2 FLOP, mert mátrixszorzásban minden paraméter tokenenként egyszer szerepel, egy szorzásban és egy összeadásban. Backward: a forward kétszerese, mert az 5. fejezet backward passza minden rétegnél két gradientet számol — a réteg bemeneteire nézve, hogy a jel tovább haladjon, és a súlyaira nézve — mindkettő a forwarddal azonos méretű mátrixszorzás, tehát .
Ez a teljes levezetés, és érdemes ellenőrizni, nem csak elhinni. A PyTorch tartalmaz egy valódi FLOP-számlálót, torch.utils.flop_counter.FlopCounterMode, amely elfog minden műveletet, amit egy modell dispatch-el, és összesíti a tényleges munkát. Futtasd le négy nagyságrenden át, a legnagyobbat a meta eszközön, amely alakzatokat allokál, memóriát nem:
from torch.utils.flop_counter import FlopCounterMode
counter = FlopCounterMode(display=False)
with counter:
loss = model(x, targets)[1]
loss.backward()
measured = counter.get_total_flops()
print(measured / (6 * n_params * n_tokens))| konfiguráció | embeddingek nélkül | összesen | mért, fwd+bwd | ÷ (összes ) | ÷ (emb. nélkül) | fwd+bwd ÷ fwd |
|---|---|---|---|---|---|---|
| 128, 4 réteg, 256 | 788,736 | 7,254,400 | 4.60e10 | 1.031 | 9.485 | 3.000 |
| 512, 8 réteg, 256 | 25,183,232 | 51,045,888 | 3.26e11 | 1.038 | 2.104 | 3.000 |
| 768, 12 réteg, 1024 | 84,973,056 | 124,356,864 | 1.75e12 | 1.145 | 1.676 | 3.000 |
| 1600, 48 réteg, 1024 | 1,474,870,400 | 1,556,920,000 | 2.10e13 | 1.100 | 1.161 | 3.000 |
| 4096, 32 réteg, 2048 | 6,442,983,424 | 6,582,444,032 | 8.74e13 | 1.080 | 1.104 | 3.000 |
| 8192, 80 réteg, 8192 | 64,427,147,264 | 65,544,929,280 | 3.75e15 | 1.163 | 1.183 | 3.000 |
A forward+backward / forward arány 3.000, pontosan, minden skálán: nem egy történetesen jó közelítés, hanem a fenti aritmetikai azonosság, kerek számként visszaadva egy olyan számlálótól, amely semmit sem tud a levezetésről.
A mért összeg ezután 3% és 17% között fölötte van értékének, ha beleszámolja az embedding mátrixokat — és ez a kikötés számít, mert a két alapító cikk eltérően számolja értékét. Kaplan kizárja „az összes szótári és pozicionális embeddinget”, mert ez „lényegesen tisztább scaling laws”-t ad (§1.3); a Chinchilla F függeléke azt mondja: „az embedding mátrixokat is beleszámoljuk a teljes paraméterszámba”.2 Széles szótár és szűk hidden dimension esetén a kettő kilencszeres eltérést ad, ahogy az első sor mutatja.
A maradék rés az, amit szándékosan kihagy: az attention pontszámok. Kaplan (2.2) egyenlete a forward költséget alakban írja, és elhagyja a második tagot, mert — 2020-ban biztonságos volt, ma kevésbé, és ez az oka, hogy az arány felfelé sodródik, ahogy nő — ezért van itt két sor azonos, 1 024-es értékkel, és az arány csökken, 1.145-ről 1.100-ra, amikor 768-ról 1 600-ra nő. Ez az a költség, amelyet a 9. fejezet vezetett be, és amelyből a 16. fejezet árat csinál.
Memória: minek kell ténylegesen beférnie
Link a szakaszhoz: Memória: minek kell ténylegesen beférnieA compute azt dönti el, mennyi ideig tart egy futás; a memória azt, hogy el tud-e indulni. Taníts sima fp32 AdamW-vel, és minden paraméter négy számot hordoz: a súlyt, a gradientjét, valamint Adam futó átlagát és varianciáját — azt a két átlagot, amelyet a 6. fejezet kézzel épített fel. Négy szám, egyenként négy bájton: 16 bájt paraméterenként, még egyetlen activation előtt. 8 GB-os laptop GPU-n mérve, a lépésnek azon a pontján vett rezidens allokációval, amikor már nincs élő gráf:
| modell | szótár | batch | becsült | mért rezidens | csúcs egy lépésben | különbség | |
|---|---|---|---|---|---|---|---|
| 512, 8 réteg | 50,257 | 8 | 51,045,888 | 779 MB | 801 MB | 2,500 MB | 1,699 MB |
| 512, 8 réteg | 4,096 | 8 | 27,411,456 | 418 MB | 426 MB | 1,043 MB | 617 MB |
| 256, 6 réteg | 4,096 | 8 | 5,839,360 | 89 MB | 89 MB | 382 MB | 293 MB |
| 256, 6 réteg | 4,096 | 32 | 5,839,360 | 89 MB | 89 MB | 1,259 MB | 1,170 MB |
| 256, 6 réteg | 4,096 | 128 | 5,839,360 | 89 MB | 89 MB | 4,771 MB | 4,681 MB |
A becslés és a mérés 3%-on belül egyezik. A meglepetés az utolsó oszlop: az activationök eltörpítik magát a modellt. Ugyanaz az 5,8 millió paraméteres modell, amelynek 89 MB tartós állapot kell, 128-as batch mellett 4 681 MB activationt igényel — a modell ötvenkétszeresét —, és ennek nagy része egyáltalán nem a transformer. A logits az: tokenenként egy szótárméretű vektor, bejegyzésenként négy bájton. Az utolsó sorban 512 MB, az elsőben 393 MB. A szótárméretet a 7. fejezetben választottuk, és még mindig az dönti el, mi fér fel a kártyára.
Hogy melyik tag dominál, a futás alakjától függ; ezért mondják Micikevicius és mtsai., hogy a memóriát „az activationök dominálják”3, miközben a ZeRO szerint egy 1,5 milliárd paraméteres modellnek „legalább 24 GB” kell csak modellállapotokra.4 A ZeRO más úton jut ugyanahhoz a 16 bájthoz — fp16 súlyokra, fp16 gradientekre, egyenként az fp32 master súlyokra és Adam két momentumára — ami 70 milliárd paraméternél 1,12 terabájt, tizennégy darab 80 GB-os GPU-nyi mennyiség, még egyetlen activation előtt.
Párhuzamosítás egy bekezdésben és egy delegálással
Link a szakaszhoz: Párhuzamosítás egy bekezdésben és egy delegálássalFrontier skálán ebből semmi sem fér el egyetlen eszközön, ezért a futás egyszerre négyfelé oszlik. Data parallelism minden GPU-ra feltesz egy modellt, és átlagolja a gradienteket — ez az alapértelmezés, és ezt javítja a ZeRO azzal, hogy nem tart redundáns példányokat az optimizer állapotából. Tensor parallelism az egyes mátrixokat osztja szét eszközök között. Pipeline parallelism minden eszköznek rétegek összefüggő csoportját adja. Context parallelism magát a szekvenciát osztja fel, és csak akkor szükséges, ha elég hosszú ahhoz, hogy az attention-tag domináljon. A Llama 3 4. táblázata mind a négyet egyszerre sorolja: tensor 8, context akár 16, pipeline 16, data akár 128, összesen 16 384 H100 GPU-n.5 Ez minden, amit ez a kurzus erről mond; az elosztott tanítás mérnöki oldala önálló félév, és a Stanford CS336 ez a félév, az 5–8. előadásokkal és kóddal.6 Ami a delegálásból megmarad, az egyetlen szám: model FLOPs utilisation — egy GPU csúcsaritmetikájának az a hányada, amelyet egy valós futás elér —, ez alakítja a rendezett értéket falióraidővé, tehát pénzzé.
Kaplan, és a fogadás, amelyet az iparág megtett
Link a szakaszhoz: Kaplan, és a fogadás, amelyet az iparág megtett2020 januárjában Kaplan és mtsai. transformerek rácsát tanították, és azt találták, hogy a teszt loss a három erőforrás mindegyikében hat nagyságrendet meghaladó tartományon hatványtörvényt követ.1 Az §1.2 három illesztett törvényt ad:
társakkal: adatra és optimálisan allokált compute-ra. A konstansok nem univerzálisak, és ezt a cikk ki is mondja: „, és pontos numerikus értékei a szótármérettől és a tokenizationtől függenek, ezért nincs alapvető jelentésük.”
A kitevők aprók: tízszer annyi paraméter a maradék loss-ból faktort vesz le. Ez semminek hangzik, és itt ez a legfontosabb tény — a hozamok borzalmasak, és soha nem állnak le. Egy kis kitevőjű hatványtörvény azt ígéri, hogy a következő nagyságrend segíteni fog, kevesebbet, mint az előző, örökké. Compute-ot venni nem szerencsejáték többé, hanem vásárlás közzétett árfolyammal, és pontosan ez az érv nyitotta ki a tőkét.
Aztán jött az előírás, és itt tévedett a cikk úgy, hogy az iparágnak sok pénzébe került. Kaplan 6. táblázata és értéket ad: tízszeres compute 5,4-szer nagyobb modellt jelent, mindössze 1,9-szer annyi szöveggel etetve. Az absztrakt egyértelmű: „az optimálisan compute-hatékony tanítás nagyon nagy modellek viszonylag szerény mennyiségű adaton való tanítását jelenti, és jelentősen a konvergencia előtt megáll”. A terület pontosan ezt tette: GPT-3, 175 milliárd paraméter 300 milliárd tokenen,7 Gopher, 280 milliárd 300 milliárdon, Megatron-Turing NLG, 530 milliárd 270 milliárdon.2 Fél tokentől két tokenig paraméterenként, mindenhol.
Chinchilla, és mit mért a fenti sweep
Link a szakaszhoz: Chinchilla, és mit mért a fenti sweep2022 márciusában Hoffmann és mtsai. több mint 400 modellt tanítottak 70 milliótól 16 milliárd paraméterig, és három független úton az ellenkező következtetésre jutottak.2 A 2. táblázatban képlet kitevőjére 0.50, 0.49 és 0.46 szerepel, Kaplan 0.73 értékével szemben. Egyszerűen: a modellméretnek és a training adatnak azonos arányban kell nőnie.
A második megközelítés az, amelyet a fejezet tetején lévő sweep egymilliomod skálán reprodukál: rögzíts egy keretet, taníts sok méretet pontosan ezen a kereten, ábrázold a végső loss-t a modellméret függvényében.
| paraméterek | |||
|---|---|---|---|
| 98,624 | 5.3531 (171) | 4.8638 (542) | — |
| 150,320 | 5.4636 (74) | — | — |
| 194,208 | 5.5041 (44) | 4.8730 (140) | 4.4040 (442) |
| 295,808 | 5.5550 (19) | 4.9029 (60) | 4.3383 (190) |
| 665,280 | 5.7849 (3.8) | 5.1254 (12) | 4.4192 (38) |
| 1,280,768 | 5.8174 (1.0) | 5.1751 (3.2) | 4.5003 (10) |
| 3,101,568 | — | 5.4686 (0.5) | 4.7768 (1.7) |
| 5,315,072 | — | 5.5894 (0.2) | 4.8514 (0.6) |
| 15,053,568 | — | — | 5.3534 (0.1) |
Hold-out loss natban tokenenként, zárójelben a token/paraméter arány, félkövérrel az egyes keretek legjobb modellje; a gondolatjel nem futtatott pontot jelöl, mert a keret több szöveget követelt, mint amennyi a korpuszban van, vagy a méret kívül esett az ott végigsöpört tartományon.
Olvass lefelé egy oszlopban: a loss csökken, eléri az alját, majd újra nő. Egy modell pontosan ugyanolyan könnyen lehet túl nagy a keretéhez, mint túl kicsi — esetén 665 280 paraméter választása 295 808 helyett 0,08 nat büntetés, ami a fent illesztett burkolón annak a loss-nak felel meg, amelyet egy helyesen méretezett modell 18%-kal kevesebb compute-tal ér el. A rossz alak kiválasztása a keret ötödét dobja ki. Ez Chinchilla 3. ábrája egy délután alatt, egy GPU-n, nem négyszáz modellel.
Most olvass vízszintesen. esetén a legjobb modell a sweep legkisebbje; esetén 295 808 paraméter, mindkét oldalról bekeretezve. Az optimum jobbra mozdul, ahogy a keret nő, és ez a korrekció teljes tartalma. Illeszd a cikk harmadik megközelítését — a felületet minden futás felett —, és minimalizálj feltétel mellett:
L(N, D) = 24.7 / N^0.195 + 46.8 / D^0.169 (E fits to ~0; see below)
implied N_opt ∝ C^0.464
compare Chinchilla 0.46-0.50 · Besiroglu 0.513 · Kaplan 0.730.46, laptopról, Kaplan 0.73 értékével szemben. Háromjegyű egyezés három keretből illesztve szerencse; az első jegy egyezése nem az. A kitevő utazik — a konstans nem, mert ezeknél az optimumoknál a token/paraméter arány 170–540, nem 20. Három ok, mind tanulságos. nullára illeszkedik, mert 4 nat feletti loss mellett a futás sehol sincs annak az entrópia-padlónak a közelében, amely Chinchilla illesztését dominálja. A batch size és a learning rate fix volt, nem pontonként hangolt, ami azokat a futásokat bünteti, amelyek a legkevesebb lépést kapják — és ezek a nagy modellek: FLOP-nál egy 1,28 millió paraméteres modell összesen 159 optimizer-lépést kap, messze a néhány ezer alatt, amelyet Kaplan tagja szerint bármely modell igényel. Egy scaling law egy rezsimen belül illeszkedik, és ez hat nagyságrenddel Chinchilla alatt ül.
Ezért a cikk absztraktja: „a jelenlegi nagy language modellek jelentősen alultanítottak”. A Chinchilla a demonstráció — 70 milliárd paraméter 1,4 billió tokenen, ugyanazzal a teljes compute-tal, mint a Gopher 280 milliárdja 300 milliárdon, és 57 MMLU-feladatból 51-en megveri, 67,5% kontra 60%.2 Négyszer kisebb, négy és félszer több szöveg, ugyanannyi pénz, jobb modell.
Két fenntartás a híres arányhoz. A „húsz token paraméterenként” nem mondat a cikkben, amely csak azt mondja, hogy „a modellméret minden duplázásakor a training tokenek számát is duplázni kell”; a 20 a 3. táblázatból és Chinchilla saját 70 B / 1.4 T példájából következtetés. A pontossága pedig rosszabb a közöltnél: Besiroglu és mtsai. a 4. ábra digitalizálásából újraillesztették, azt találták, hogy az eredeti paraméterek „rosszul illeszkednek a rekonstruált adatokhoz”, az intervallumok „valószínűtlenül szűkek az adatpontok számához képest”, és a becsületes tartományt „4 és 40 között” token/paraméterre tették.8
Chinchilla módszerének egy részlete beváltja az 1. fejezet learning-rate schedule-ökről tett ígéretét. A cosine schedule-t a tokenkerethez kell igazítani. Annak a modellnek, amely 10 millió tokent fog látni, a learning rate-jét 10 millió tokennél kell nullára csökkentenie; adj neki 100 millióra méretezett schedule-t, állítsd meg korán, és egy olyan loss-t olvasol le a lejtő közepéről, amelynél a ráta túl magas. Chinchilla minden modellt négy ciklushosszon tanít pontosan ennek kontrollálására; a fenti sweep ugyanezért állítja a schedule-t a keretből.
Mit nem ígérnek a scaling laws
Link a szakaszhoz: Mit nem ígérnek a scaling lawsEzek a terület leghasznosabb empirikus eredményei, és rutinszerűen túlértékesítik őket. Négy korlát.
Loss-t jósolnak, nem képességet. A bal oldal hold-out szövegen mért cross-entropy. Ezekben a cikkekben semmi sem jogosít fel arra az állításra, hogy egy modell helyes SQL-t ír-e, visszautasít-e egy káros kérést, vagy használ-e toolt. Ez újra az 5. fejezet leckéje: a loss előrejelzése nem annak a viselkedésnek az előrejelzése, amiért fizetsz.
Illesztettek, nem levezetettek. Semmilyen elmélet nem állít elő értéket. A konstansok mozognak a tokenizerrel — ezért értelmetlen két tokenizer között perplexityt összehasonlítani, ahogy a 8. fejezet elmagyarázta —, továbbá az adatkeverékkel, architektúrával és optimizerrel. Minden publikált törvény annak a setupnak a törvénye, amely létrehozta, ezért illesztette újra a Meta a sajátját a Llama 3 előtt.5
Minden lépéshez friss tokent feltételeznek, ami csendben végtelen korpuszt feltételez. Muennighoff és mtsai. megmérték, mi történik, amikor elfogy: akár négy epoch ismételt adat szinte semmibe sem kerül — egy 8,7 milliárd paraméteres modell 44 milliárd egyedi tokenen négyszer végigmenve „csak 0,5%-kal magasabb validation loss”-szal végzett, mint ugyanaz a modell 178 milliárd egyedi tokenen —, míg körülbelül tizenhat epoch után a további compute már semmit sem vesz.9
És ma már senki sem tanít compute-optimálisan. A Chinchilla a tanítás költségét minimalizálja; egy deployolt modell ezután nagyjából FLOP-ot fizet generált tokenenként, örökké. A LLaMA 1 ezt egyenesen kimondta: „adott teljesítménycél mellett nem a leggyorsabban tanítható, hanem az inference-ben leggyorsabb modell a preferált”.10 Sardana és mtsai. ezt úgy formalizálták, hogy helyette értéket minimalizáltak, és azt találták, hogy aki egymilliárd kéréssel számol, annak „Chinchilla-optimálisnál kisebb és tovább tanított” modellt kell tanítania.11 A Llama 3 §9.1 egyetért: kis modelljeit „messze a compute-optimal training pontján túl” tanítják, ténylegesen training compute-ot cserélve inference-hatékonyságra.5 Az arány nem elavult; csak arra a kérdésre válaszol, amelyet már nem tesznek fel.
Emergent abilities, és a vita arról, valódiak-e
Link a szakaszhoz: Emergent abilities, és a vita arról, valódiak-eA loss simán csökken. A benchmark-pontszámok néha nem. Wei és mtsai. olyan eseteket gyűjtöttek, ahol egy feladat a training compute nagyságrendjein át véletlenszinten marad, majd ugrik — háromjegyű aritmetika megjelenése GPT-3-ban körülbelül FLOP-nál, MMLU a találgatás fölé emelkedik és között —, és nevet adtak a mintának: „egy képesség emergent, ha kisebb modellekben nincs jelen, nagyobb modellekben viszont igen”.12 Ha ez valódi tulajdonság, olcsó kísérletekből extrapolálni veszélyes, mert a képesség, amelyet megveszel, lehet, hogy semmilyen számodra tesztelhető skálán nem létezik.
Schaeffer, Miranda és Koyejo azt állították, hogy ennek nagy része mérési műtermék, és a mechanizmus aritmetika.13 A tokenenkénti loss simán csökken, így annak valószínűsége, hogy egy token helyes, , fokozatosan javul. Pontozd a modellt exact string match metrikával egy -tokenes válaszon, és ezt a valószínűséget hatványra emeled — egy sima görbe nagy hatványra emelve szakadéknak látszik. Cseréld le olyan metrikára, amely tokeneket számol ahelyett, hogy mindet megkövetelné, ugyanazon kimeneteken, és „a család teljesítménye simán, folytonosan és előrejelezhetően javul a skála növekedésével”.
Az auditjuk száma az, amit meg kell jegyezni — „a BIG-Bench 39 preferált metrikájából legfeljebb 5 mutat emergence-et”, és két diszkontinuus metrika felel a hivatkozott esetek több mint 92%-áért —, és a figyelmeztetésük is: „ebben a cikkben semmit sem szabad úgy értelmezni, hogy azt állítaná: a nagy language modellek nem mutathatnak emergent abilities-t”. Egy grafikonon látott ugrás a metrikáról szóló bizonyíték, amíg más be nem bizonyosodik. A 29. fejezet az, ahol ez a te problémáddá válik, mert a hard-cutoff metrika kiválasztása olyan döntés lesz, amelyet észrevétlenül hozol meg.
Honnan jön az adat
Link a szakaszhoz: Honnan jön az adatA korpusz a pretraining futásnak az a része, amelyhez nem tartozik egyenlet, és ahol a legtöbb következményekkel járó döntés lakik. A nyersanyag egy webcrawl: a Common Crawl 2026. augusztusi archívuma „2,14 milliárd weboldalt vagy 360 TiB tömörítetlen tartalmat” tartalmaz, egyetlen hónapot, ingyen letölthetően.14 Szinte semmi sem használható ebben a formában. A T5-cikk szerint a crawl „nagyrészt halandzsából vagy boilerplate szövegből, például menükből, hibaüzenetekből vagy duplikált szövegből áll”, és az általa bevezetett C4 pipeline nyers heurisztikák listája — csak a mondatzáró írásjellel végződő sorok megtartása, háromnál kevesebb mondatot tartalmazó oldalak eldobása, minden olyan oldal eldobása, amely kapcsos zárójelet vagy egy nyilvános trágárságlistán szereplő szót tartalmaz — így lesz havi húsz terabájt szövegből körülbelül 750 GB.15
A nyers a megfelelő szó. Dodge és mtsai. auditálták, mit távolítanak el ezek a szűrők, és azt találták, hogy a trágárság-blokklista az African-American English dokumentumok 42%-át és a Hispanic-aligned English dokumentumok 32%-át törli, szemben a White-aligned English 6,2%-ával, így a korpusz 97,8%-ban az utóbbi kategóriából marad.16 Egy szabálynak, amelynek nem volt véleménye dialektusról, lett.
Aztán deduplication, ami nem takarítás: Lee és mtsai. találtak egy 61 szavas mondatot, amely 61 036-szor ismétlődött a C4-ben, és megmutatták, hogy a deduplication tízszeresére csökkenti, milyen gyakran „bocsátanak ki memorizált szöveget” a modellek, a generált tokenek 1,9%-áról 0,19%-ra.17 A több azonban nem jobb: a FineWeb csapata globálisan, 96 crawlon át deduplikált, 4 billió tokent kapott, mérhető nyereség nélkül; aztán crawlonként külön deduplikált, 20 billiót kapott, és hozta a legjobb létező korpusz szintjét.18
Aztán contamination. A Llama 3 megmérte a sajátját, és közzétette: az AGIEval 98%-a, a BIG-Bench Hard 95%-a és a HellaSwag 85%-a 8-gramokon átfedett a training set-tel, MMLU esetén pedig olyan magas volt az átfedés, hogy „lehetetlen jó teljesítménynyereség-becslést kapni”.5 A GPT-3 §4 egy szűrési hibáról számol be, amely benchmarkokat hagyott az adatban úgy, hogy már nem volt visszaút: „költségmegfontolások miatt nem volt kivitelezhető a modell újratanítása”.7
A provenance a megoldatlan rész. A Pile egy 100,96 GiB-os Books3 nevű komponenst adott ki — a korpusz 12%-át, és a cikk saját hozzájárulási táblázata szerint privát torrent trackerről származó könyveket;19 2023 augusztusában szerzői jogi panasz után lekerült. A jogi helyzet 2026 szeptemberében rendezetlen, és a trendként idézett három amerikai döntés ellentmond egymásnak. Alsup szerint a jogszerűen megszerzett könyveken való tanítás „rendkívül transzformatív”, miközben kimondta, hogy a kalózmásolatokból épített könyvtár nem az; az Anthropic ezt a felét $1,5 milliárdért rendezte, 482 460 műre, darabonként nagyjából $3 000-ért, 2026. július 20-i jóváhagyással.20 Chhabria összegző ítéletet adott a Metának, miközben azt írta, hogy döntése „nem állítja azt a tételt, hogy a Meta szerzői joggal védett anyagok használata language modellek tanítására jogszerű”, csak azt, hogy „ezek a felperesek rossz érveket hoztak”.21 Bibas, a Ross Intelligence ellen döntve, megjegyezte, hogy „ma csak non-generative AI van előttem”.22 Egyetlen amerikai fellebbviteli bíróság sem döntött még a kérdésben.
Emberek végzik azokat a részeket, amelyeket a loss nem tud. A TIME 2023 januárjában arról számolt be, hogy az OpenAI számára, a Sama cégen keresztül toxikus szöveget címkéző dolgozók „körülbelül $1,32 és $2 közötti órabért” vittek haza, miközben gyermekek szexuális bántalmazását, kínzást és önsértést leíró részleteket olvastak; az OpenAI $12,50-t fizetett óránként a Samának a munkáért; a Sama vitatja mind a bérsávot, mind a kvótát.23 Ez a pretraining körüli szűrés, nem maga a pretraining — de ugyanazon a számlán van, és itt ül egy ember.
Az áram valódi, és általában rosszul idézik. A legóvatosabb publikált szám a BLOOM-é: 1 082 990 GPU-óra, 433 MWh és 24,7 tonna CO₂-egyenérték a futásra, 50,5 a gyártást és idle node-okat is beleszámolva;24 Patterson és mtsai. a GPT-3-at 1 287 MWh-ra és 552 tonnára teszik.25 Két figyelmeztetés. A BLOOM előnye a francia nukleáris hálózat 57 g CO₂/kWh értéke, nem a hatékonyság — több energiát használt, mint az OPT-175B. A terület legtöbbet idézett kibocsátási száma, Strubell és mtsai. 626 155 fontja egy neural architecture search-re, később 88-szor túl magasnak bizonyult, mert azt feltételezte, hogy a keresés teljes modellméreten futott, holott proxyn futott.26 Az LBNL keretezése a védhető: az amerikai adatközpontok 192 TWh-t használtak 2024-ben, a nemzeti villamosenergia 4,7%-át — ez egy iparághoz kötött szám, nem egyetlen futáshoz.27
A vezérfonal az, amit Bender és mtsai. documentation debt néven írtak le: „olyan helyzetbe hozzuk magunkat, ahol az adatkészletek egyszerre dokumentálatlanok és túl nagyok ahhoz, hogy utólag dokumentáljuk őket”.28 A fenti tények mind azért léteznek, mert valaki megnézte. A legtöbbek által használt modellek mögötti korpuszok esetében senki sem tudja.
Mennyibe kerül valójában
Link a szakaszhoz: Mennyibe kerül valójábanMost jön az az aritmetika, amelyet mindenki akar, négy idézett bemenetből, hogy amikor elavulnak, nyilvánvaló legyen, melyiket kell lecserélni.
Csúcsteljesítmény
Link a szakaszhoz: CsúcsteljesítményAz NVIDIA H100 oldala 1 979 teraFLOPS BF16 tensor-core throughputot sorol fel egy „with sparsity” lábjegyzet alatt.29 Strukturált sparsityt egyetlen pretraining futás sem használ, ezért a dense érték ennek fele: 989,5 TFLOP/s.
Kihasználtság
Link a szakaszhoz: KihasználtságA Llama 3 4. táblázata 38–43% BF16 model FLOPs utilisationt közöl. Vegyünk 40%-ot: GPU-nként 395,8 TFLOP/s hasznos aritmetika.5
A Lambda on-demand ára egy 8×H100 SXM node-ra, 2026-09-06-án elérve: $3,99 GPU-óránként, tehát $31,92 óránként a node-ra.30
Chinchilla aránya, , megadja értékét, és így értékét.
| keret | H100-órák | FLOPs | compute-optimális paraméterek | tokenek | egy 8×H100 node-on | GPU-k 90 napos befejezéshez |
|---|---|---|---|---|---|---|
| $100 | 25 | 3.6e19 | 546 M | 10.9 B | 3.1 h | 1 |
| $1,000 | 251 | 3.6e20 | 1.73 B | 34.5 B | 31.3 h | 1 |
| $10,000 | 2,506 | 3.6e21 | 5.46 B | 109 B | 13 nap | 2 |
| $100,000 | 25,063 | 3.6e22 | 17.3 B | 345 B | 131 nap | 12 |
| $1,000,000 | 250,627 | 3.6e23 | 54.6 B | 1.09 T | 4 év | 116 |
| $10,000,000 | 2,506,266 | 3.6e24 | 173 B | 3.45 T | 36 év | 1,160 |
| $100,000,000 | 25,062,657 | 3.6e25 | 546 B | 10.9 T | 358 év | 11,603 |
Olvasd együtt az utolsó két oszlopot. $10 000-ért kapsz egy 5 milliárd paraméteres modellt egy bérelt node-on két hét alatt. $100 000 000-nál az aritmetika 546 milliárd paramétert mond — és tizenkétezer H100-at, három hónapra összekötve, amit nem bérelsz ki bankkártyával. Nagyjából $100 000 fölött a kötő korlát már nem a pénz, hanem a cluster.
Mielőtt hinnél egy ilyen táblázatnak, teszteld olyan futásokkal szemben, amelyek valódi költsége publikált — llm.c reprodukálja a GPT-2 124M-et „~90 perc” alatt egy 8×A100 node-on „körülbelül $20-ért”, és a GPT-2 1.6B-t 24 óra alatt egy 8×H100 node-on $672-ért.31
$672, against what $672 actually bought (llm.c GPT-2 1.6B, one 8xH100 node, 24 h)
this table predicts: 168 H100-hours N = 1.41 B params D = 28.3 B tokens
what was actually run: 192 H100-hours N = 1.558 B params D = 33.6 B tokens
Llama 3 405B, against Meta's own published GPU-hours
from the paper's 3.8e25 FLOPs at 40 % MFU: 26.67 M H100-hours
published in Meta's Llama 3.1 model card: 30.84 M H100-hours ratio 0.86Mindkettő körülbelül 15%-on belül van, ami nagyjából az a pontosság, amit egy ilyen becslés megérdemel, és jóval jobb annál a pontosságnál, amellyel általában idézik.
A fő összehasonlítás, mindkét definícióval az asztalon
Link a szakaszhoz: A fő összehasonlítás, mindkét definícióval az asztalonA témában legtöbbet ismételt állítás az, hogy egy 2019-ben körülbelül $43 000-be kerülő GPT-2-osztályú modell ma néhány tíz dollárból reprodukálható. A modern fele jól dokumentált; a történeti fele nem.
Ma. Karpathy nanochat README-je: „you can train your own GPT-2 capability LLM ... for only $48 (~2 hours of 8XH100 GPU node) ... On a spot instance, the total cost can be closer to ~$15.”32 A „GPT-2 capability” itt pontos és publikált — a GPT-2 0.256525-ös CORE score-jának megverése — egy leaderboardon, amelynek legjobb bejegyzése 2026. március 14-én 1,65 óra. A $48 $3/GPU-órát feltételez, Lambda $3,99-os listaára alatt; listaáron inkább $64.
2019-ben. Nincs elsődleges forrás: az OpenAI soha nem publikált időtartamot vagy költséget. A lánc így néz ki: The Register, 2019. február, „256 Google TPU3 core”-t jelent ár és időtartam nélkül; majd Synced, 2019. június, megjegyzi, hogy a hardver $256/óra volt Google Cloudon, és kifejezetten leírja, hogy „OpenAI didn't specify the training duration”. A $43 008 úgy jön ki, hogy $256/óra szorozva egy feltételezett 168 órával, amelyre senki sem adott forrást.
A becsületes cím tehát: egy GPT-2 publikált benchmark-pontszámát elérő modell ma jóval $100 alatt betanítható bérelt hardveren, szemben egy 2019-es költséggel, amelyet soha nem publikáltak, és amelynek híres becslése forrás nélküli időtartam-feltételezésen nyugszik. Az összeomlás valódi, és a modern felet bárki reprodukálhatja bankkártyával; az arány egy nem létező számon végzett aritmetika. Általában ez a publikált tanítási költségek állapota. A GPT-3 cikkben egyáltalán nincs dollárösszeg, csak FLOP a D.1 táblázatban;7 a Llama 3 cikkben sincs.5 Minden training cost, amit olvastál, FLOP-számból, hardverfeltételezésből és árfeltételezésből származó becslés — mindig érdemes megkérdezni, kié.
Mit tud egy base model, és mikor állt meg a tudása
Link a szakaszhoz: Mit tud egy base model, és mikor állt meg a tudásaAmi kijön, egy rögzített pillanatban összeállított rögzített korpuszt látott, és ebből két tulajdonság következik.
Az első a knowledge cutoff. A gyűjtési dátum után a modell semmit sem tud — nem „bizonytalan”, hanem semmit —, és folyékonyan konfabulál majd ahelyett, hogy ezt mondaná, mert ezt a viselkedést soha nem tanították neki. A Llama 3.1 model card 2023 decemberét adja meg;33 minden modellnek van ilyenje, és ez a training adat tulajdonsága, nem a deploymenté. Megkerülni retrieval-probléma, ez a 19. fejezet.
A második, hogy egy base model kiegészít, nem válaszol. Add neki azt, hogy „Mi Franciaország fővárosa?”, és egy hihető folytatás lehet egy másik kérdés, mert a korpuszban ez a string leggyakrabban feladatlistákban jelenik meg.
Merre megyünk tovább
Link a szakaszhoz: Merre megyünk továbbEgy szövegkiegészítő nem assistant. Nem követ utasításokat, mert a korpuszban semmi sem mondta neki, hogy egy kérést teljesíteni kell, nem folytatni. Nincs fogalma két résztvevős beszélgetésről. Gond nélkül előállítja egy káros prompt legvalószínűbb folytatását, mert valaha csak a valószínűségre optimalizálták.
Ahhoz, hogy válaszoló valamivé alakuljon, kell egy második szakasz, amely az első költségének töredék százalékába kerül, és szinte teljesen abból áll, hogy példákat mutatunk neki a kívánt viselkedésre, majd saját kimeneteinek párjait hasonlítjuk össze. Ebből a szakaszból származik az utasításkövetés, a chat template-ek, a visszautasítások és — ez sokakat meglep — a tool hívásának képessége is. A 11. fejezet ez a szakasz: supervised fine-tuning, RLHF, DPO és GRPO, valamint az a kérdés, mit jelent az, hogy „aligned”, és ki dönt róla.
Források és módszer
Link a szakaszhoz: Források és módszerE fejezet mellé még érdemes olvasni: Karpathy build-nanogpt projektjét és a hozzá tartozó videót, amelyek egy teljes GPT-2-reprodukciót vezetnek végig elejétől végéig olyan tempóban, amire ez a fejezet nem képes; valamint a Stanford CS324, Large Language Models kurzust, amelynek adatokról és környezeti hatásról szóló előadásai mélyebbre mennek abban az anyagban, amelyet ez a kurzus egyszer tárgyal, majd delegál.
Hivatkozások
Link a szakaszhoz: Hivatkozások-
Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J. and Amodei, D. Scaling Laws for Neural Language Models. arXiv:2001.08361 (2020). A három hatványtörvény az §1.2 (1.1)–(1.3) egyenleteiben szerepel, a teljes konstansok az A függelék 5. táblázatában; a levezetés az §2.1; a compute-allokációs kitevők a 6. táblázatban. Megjegyzés: két compute-törvény van, fix batch size mellett és optimális batch size mellett; a cikk szerint az utóbbit „kell előrejelzésekhez használni”. ↩ ↩2
-
Hoffmann, J., Borgeaud, S., Mensch, A., Buchatskaya, E., Cai, T., Rutherford, E. et al. Training Compute-Optimal Large Language Models. arXiv:2203.15556 (2022). Kitevők a 2. táblázatban, tervezett keretek a 3. táblázatban, a Gopher-összehasonlítás a §4-ben, a paraméterszámlálási konvenció az F függelékben. A 3. táblázat alatti próza ellentmond magának a 3. táblázatnak a 175 B és 280 B soroknál; a táblázat az idézendő verzió. ↩ ↩2 ↩3 ↩4
-
Micikevicius, P., Narang, S., Alben, J., Diamos, G., Elsen, E., Garcia, D. et al. Mixed Precision Training. arXiv:1710.03740 (2017), ICLR 2018. FP32 master súlyok a §3.1-ben, loss scaling a §3.2-ben. ↩ ↩2
-
Rajbhandari, S., Rajbhandari, S., Ruwase, O. and He, Y. ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054 (2019), SC20. A elszámolás a §3.1-ben; a reziduális állapotok és activationök számai a §3.2-ben. ↩
-
Grattafiori, A. et al. (Llama Team, AI @ Meta). The Llama 3 Herd of Models. arXiv:2407.21783 (2024). Compute-keret és tokenmennyiség az §1-ben, az újraillesztett scaling law a §3.2.1-ben, a párhuzamosítási konfiguráció és MFU a 4. táblázatban, a contamination elemzés az §5.1.4-ben, az over-training állítás a §9.1-ben. A cikk nem tartalmaz dollárösszeget és kibocsátási táblázatot sem. ↩ ↩2 ↩3 ↩4 ↩5 ↩6
-
Stanford CS336, Language Modeling from Scratch. A 2. előadás erőforrás-elszámolást, az 5–8. előadások GPU-kat, kerneleket és párhuzamosítást, a 9. és 11. előadások scalinget, a 13–14. előadások adatot tárgyalnak. Ez az a kurzus, amelyre ez a fejezet az engineeringet delegálja, és nyilvános. ↩
-
Brown, T. B. et al. Language Models are Few-Shot Learners. arXiv:2005.14165 (2020). Compute a D függelék D.1 táblázatában — amelyben szó szerint „flops per param per token” fejlécű oszlop van, és ennek értéke minden GPT-3 sorban 6. Contamination elemzés a §4-ben. ↩ ↩2 ↩3
-
Besiroglu, T., Erdil, E., Barnett, M. and You, J. Chinchilla Scaling: A replication attempt. arXiv:2404.10102 (2024). A Chinchilla adatait a 4. ábra digitalizálásával rekonstruálja, újrailleszti, és korrigált kitevőket, valamint sokkal szélesebb intervallumokat közöl. ↩
-
Muennighoff, N., Rush, A. M., Barak, B., Le Scao, T., Piktus, A., Tazi, N., Pyysalo, S., Wolf, T. and Raffel, C. Scaling Data-Constrained Language Models. arXiv:2305.16264 (2023), NeurIPS 2023. A négy-epoch eredmény a §6-ban; a tizenhat-epoch felezési idő az illesztett . ↩
-
Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T. et al. LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 (2023). Az §1 mondja ki az inference-költség érvet a Chinchilla-optimális tanítással szemben. ↩
-
Sardana, N., Portes, J., Doubov, S. and Frankle, J. Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws. arXiv:2401.00448 (2023), ICML 2024. A §5 tartalmazza az ellenpontot is: extrém tokenarányokon tanított modellek tovább javulnak, de „lassabban, mint a scaling laws előre jelzik”. ↩
-
Wei, J., Tay, Y., Bommasani, R., Raffel, C., Zoph, B., Borgeaud, S. et al. Emergent Abilities of Large Language Models. arXiv:2206.07682 (2022), TMLR. Definíció a §2-ben, példák és compute-küszöbök a §3–4-ben és az 1. táblázatban. ↩
-
Schaeffer, R., Miranda, B. and Koyejo, S. Are Emergent Abilities of Large Language Models a Mirage? arXiv:2304.15004 (2023), NeurIPS 2023 outstanding paper. A metrikaérv a §2-ben, a BIG-Bench metaelemzés a §4-ben, a konstruált vision példa a §5-ben. ↩
-
Common Crawl, August 2026 Crawl Archive Now Available (CC-MAIN-2026-34), publikálva 2026. augusztus 24-én, elérve 2026-09-06. A saját címlapja „15 évet átfogó, több mint 300 milliárd oldalról”, „összesen több mint 10 petabájtról” beszél — ez a teljes archívum száma, nem az itt árazott havi crawlé. ↩
-
Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W. and Liu, P. J. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683 (2019), JMLR 21(140). A C4-szűrők a §2.2-ben vannak. A cikk bájtban ad méreteket, nem tokenben; a neki gyakran tulajdonított 156 milliárd-tokenes szám az alábbi Dodge és mtsai. munkából származik. ↩
-
Dodge, J., Sap, M., Marasović, A., Agnew, W., Ilharco, G., Groeneveld, D., Mitchell, M. and Gardner, M. Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758 (2021), EMNLP 2021. A dialektus-eltávolítási arányok a §5.3-ban; benchmark contamination a C4-ben a §4.2-ben. ↩
-
Lee, K., Ippolito, D., Nystrom, A., Zhang, C., Eck, D., Callison-Burch, C. and Carlini, N. Deduplicating Training Data Makes Language Models Better. arXiv:2107.06499 (2021), ACL 2022. A 61 036 ismétlés az 1. lábjegyzet; a memorizációs számok a §6.2-ben, a 4. táblázatban vannak, és a generált tokenek százalékai 50-tokenes exact-match kritérium mellett. ↩
-
Penedo, G., Kydlíček, H., Ben Allal, L., Lozhkov, A., Mitchell, M., Raffel, C., Von Werra, L. and Wolf, T. The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale. arXiv:2406.17557 (2024), NeurIPS 2024 Datasets and Benchmarks. A deduplication eredmény a §3.4-ben található. A kiadott dataset azóta túlnőtt a cikk 15 billió tokenjén. ↩
-
Gao, L., Biderman, S., Black, S. et al. The Pile: An 800GB Dataset of Diverse Text for Language Modeling. arXiv:2101.00027 (2020). A Books3 a §2.3-ban és az 1. táblázatban szerepel; a hozzájárulási táblázat az 5. táblázat. A korpusz 825,18 GiB, tehát még a cím is lefelé kerekít. ↩
-
Bartz v. Anthropic, No. 4:24-cv-05417 (N.D. Cal.). Fair-use végzés 2025. június 23. (Dkt. 231); class certification 2025. július 17.; végső jóváhagyás és ítélet 2026. július 20. (Dkt. 680). Az egyezség csak múltbeli inputokat enged el, outputokat és jövőbeli magatartást nem. ↩
-
Kadrey v. Meta, No. 3:23-cv-03417-VC (N.D. Cal.), összegző ítélet 2025. június 25. (Dkt. 598). Megjegyzés: a torrentezésen alapuló terjesztési igényről nem döntöttek, és továbbra is él. ↩
-
Thomson Reuters v. ROSS Intelligence, No. 1:20-cv-00613-SB (D. Del.), felülvizsgált vélemény 2025. február 11. (Dkt. 770), Bibas J. Közbenső fellebbezésen a Third Circuit előtt (No. 25-2153), 2026. június 11-én tárgyalva, az írás idején eldöntetlen. ↩
-
Perrigo, B. Exclusive: OpenAI Used Kenyan Workers on Less Than $2 Per Hour to Make ChatGPT Less Toxic. TIME, 2023. január 18. A $2 felső határ azoknál a senior reviewer-eknél, akik minden célt teljesítettek; a junior labellerek, vagyis a többség, $1,32-t vittek haza. A Sama ugyanebben a cikkben idézett cáfolata $1,46–$3,74-et és alacsonyabb kvótát ad meg. ↩
-
Luccioni, A. S., Viguier, S. and Ligozat, A.-L. Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language Model. arXiv:2211.02001 (2022), JMLR 24(253). 1. és 3. táblázat. ↩
-
Patterson, D., Gonzalez, J., Le, Q., Liang, C., Munguia, L.-M., Rothchild, D., So, D., Texier, M. and Dean, J. Carbon Emissions and Large Neural Network Training. arXiv:2104.10350 (2021). A GPT-3 számai a 4. táblázatban; a NAS-becslés korrekciója a §4.1-ben. ↩
-
Strubell, E., Ganesh, A. and McCallum, A. Energy and Policy Considerations for Deep Learning in NLP. arXiv:1906.02243 (2019), ACL 2019. Pontosan azért érdemes olvasni, ami a legtöbbet idézett számával történt: a cikk óvatos, kimondja az extrapolációját, és mégis két nagyságrenddel tévedett abban az egy sorban, amelyet mindenki ismételt. ↩
-
Smith, S. J., Hubbard, A., Newkirk, A., Ganeshalingam, M., Holecek, B., Sartor, D., Mills, M. and Shehabi, A. United States Data Center Energy Usage Report: 2025 Update. LBNL-2001758 (2026. június 18.). Ez a sokat idézett 2024-es jelentést lefelé módosítja a történeti sorozatra; ha a 2023-as 176 TWh-s számot idézed, a meghaladott kiadást idézed. ↩
-
Bender, E. M., Gebru, T., McMillan-Major, A. and Shmitchell, S. On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? FAccT '21, pp. 610–623. DOI 10.1145/3442188.3445922. A „documentation debt” a §4.4-ben van. Megjegyzés: a cikk saját karbonadatai Strubell és mtsai.-tól származnak, és öröklik a fenti korrekciót — ami inkább az érv illusztrációja, nem cáfolata. ↩
-
NVIDIA. NVIDIA H100 Tensor Core GPU termékoldal,
nvidia.com/en-us/data-center/h100/(elérve: 2026-09-06). Az FP64 kivételével az oldal minden tensor-core sora „with sparsity” lábjegyzetet hordoz; az itt használt dense BF16 érték a publikált 1 979 TFLOPS fele. ↩ -
Lambda. GPU Cloud pricing,
lambda.ai/pricing(elérve: 2026-09-06). On-demand, GPU-nként és óránként, adó előtt. Ennek a szakasznak az árai gyorsabban avulnak el, mint bármi más ebben a kurzusban; a körülöttük lévő aritmetika nem. ↩ -
Karpathy, A.
karpathy/llm.c, discussion #481, Reproducing GPT-2 (124M) in llm.c in 90 minutes for $20 (2024. május 28.), és discussion #677, Let's reproduce GPT-2 (1.6B): one 8XH100 node, 24 hours, $672, in llm.c (2024. július 11.). ↩ -
Karpathy, A.
karpathy/nanochat, README és „time to GPT-2” leaderboard (elérve: 2026-09-06). A $48-os szám és a „GPT-2 capability” CORE-score definíciója egyaránt a README-ben van; a repository sajátspeedrun.shfájlja „approximately 1.5 hours”-t ír, ezért a kétórás számot kerekítésként kezeld. ↩ -
Meta. Llama 3.1 model card,
models/llama3_1/MODEL_CARD.mdinmeta-llama/llama-models(elérve: 2026-09-06). A 405 B modell 30,84 M H100-órájának, a 39,3 M összesnek, a 11 390 tCO2eq location-based értéknek és a 2023. decemberi adat cutoffnak a forrása. ↩