Ugrás a tartalomra
10/3010/30. fejezet

Egy LLM pretrainingje: adatok, compute, scaling laws és költség

20 modell egy laptop GPU-n: scaling law mérése és a 6ND compute-becslés ellenőrzése valódi FLOP-számlálóval.

Ezen az oldalon

9. fejezet egy olyan transformer blokknál ért véget, amely tanul. Rakj egymásra néhányat, irányítsd a 8. fejezet következő-token veszteségét a kimenetre, és nincs már mit feltalálni. Ami hátramarad, az mind vásárlás.

Ez nagyobb váltás, mint amilyennek hangzik. Eddig minden fejezet azt kérdezte: tanul-e? — igen-nem kérdés, amelyet egy laptop tíz perc alatt eldönt. Ez a fejezet olyan kérdést tesz fel, amelyben pénz van: adott mennyiségű aritmetikáért mi a legjobb modell, amit meg tudok venni? A válasz egy képlet, és 2018-ban ez senkinek sem volt magától értetődő.

Itt van ugyanennek a kérdésnek a méréssel adott válasza, egyetlen laptop GPU-n. Húsz modellt, 98 624-től 15 millió paraméterig, nulláról tanítottunk 174 millió Wikipedia-tokenen — 2 048-tokenes BPE szótárral, úgy tanítva, ahogy a 7. fejezet tanít egyet, a 9. fejezet transformerével. Minden futás pontosan a három compute-keret egyikét kapta, egyetlen művelettel sem többet, így a nagyobb modell szükségképpen kevesebb szöveget olvas. Az egyes kereteknél elért legjobb hold-out loss:

TEXT
budget C (FLOPs)   best loss   reached by a model of
       1.00e13       5.3531           98,624 params
       3.16e13       4.8638           98,624 params
       1.00e14       4.3383          295,808 params

fitted:  L = (Cc / C)^0.0913     over one decade of compute

Tízszer annyi aritmetika 19%-ot vesz le a veszteségből, és a három pont log-log skálán egy egyenesre esik. Az első kilenc fejezetben semmi sem jósolja ezt meg. Nincs mögötte tétel — empirikus szabályszerűség, más kitevővel érvényes a laptop és egy adatközpont közötti tíz nagyságrenden át, és ez az egyetlen megfigyelés győzött meg egy iparágat arról, hogy egy kis ország GDP-jét költse GPU-kra.

A célfüggvényben semmi sem változik. A modell továbbra is a következő tokenre jósol, a loss továbbra is a 4. fejezet cross-entropyje a 8. fejezet faktorizációjára alkalmazva, az optimizer továbbra is a 6. fejezet AdamW-je. A pretraining nem új algoritmus; ugyanaz az algoritmus, csak akkora korpuszon futtatva, hogy a futást költségvetni kell. Két dolog teszi ezt lehetővé: a címkék ingyen vannak, mert a tt pozíció célja a t+1t+1 helyen lévő token, és már benne van a szövegben; a 6. fejezet utolsó szakasza pedig elhárította az ellenvetést, mert egy a klasszikus szabályoknál jóval több paramétert tartalmazó modell nem esik szét, hanem javul. Ami kijön belőle, az egy base model — valami, ami szöveget folytat, nem válaszol.

A compute megszámolása költés előtt: 6ND

Link a szakaszhoz: A compute megszámolása költés előtt: 6ND

Mielőtt bármit költségvetni lehetne, meg kell számolni, és a terület ezt egyetlen képlettel számolja:

C6NDC \approx 6ND

ahol NN a paraméterszám, DD a training tokenek száma, CC pedig az összes lebegőpontos művelet. Kaplan és mtsai. két lépésben vezetik le.1 Forward: paraméterenként és tokenenként 2 FLOP, mert mátrixszorzásban minden paraméter tokenenként egyszer szerepel, egy szorzásban és egy összeadásban. Backward: a forward kétszerese, mert az 5. fejezet backward passza minden rétegnél két gradientet számol — a réteg bemeneteire nézve, hogy a jel tovább haladjon, és a súlyaira nézve — mindkettő a forwarddal azonos méretű mátrixszorzás, tehát 4N4N.

Ez a teljes levezetés, és érdemes ellenőrizni, nem csak elhinni. A PyTorch tartalmaz egy valódi FLOP-számlálót, torch.utils.flop_counter.FlopCounterMode, amely elfog minden műveletet, amit egy modell dispatch-el, és összesíti a tényleges munkát. Futtasd le négy nagyságrenden át, a legnagyobbat a meta eszközön, amely alakzatokat allokál, memóriát nem:

flops.pyPYTHON
from torch.utils.flop_counter import FlopCounterMode

counter = FlopCounterMode(display=False)
with counter:                       
    loss = model(x, targets)[1]     
    loss.backward()                 
measured = counter.get_total_flops()
print(measured / (6 * n_params * n_tokens))
konfigurációNN embeddingek nélkülNN összesenmért, fwd+bwd÷ 6ND6ND (összes NN)÷ 6ND6ND (emb. nélkül)fwd+bwd ÷ fwd
dd 128, 4 réteg, TT 256788,7367,254,4004.60e101.0319.4853.000
dd 512, 8 réteg, TT 25625,183,23251,045,8883.26e111.0382.1043.000
dd 768, 12 réteg, TT 102484,973,056124,356,8641.75e121.1451.6763.000
dd 1600, 48 réteg, TT 10241,474,870,4001,556,920,0002.10e131.1001.1613.000
dd 4096, 32 réteg, TT 20486,442,983,4246,582,444,0328.74e131.0801.1043.000
dd 8192, 80 réteg, TT 819264,427,147,26465,544,929,2803.75e151.1631.1833.000

A forward+backward / forward arány 3.000, pontosan, minden skálán: nem egy történetesen jó közelítés, hanem a fenti aritmetikai azonosság, kerek számként visszaadva egy olyan számlálótól, amely semmit sem tud a levezetésről.

A mért összeg ezután 3% és 17% között fölötte van 6ND6ND értékének, ha NN beleszámolja az embedding mátrixokat — és ez a kikötés számít, mert a két alapító cikk eltérően számolja NN értékét. Kaplan kizárja „az összes szótári és pozicionális embeddinget”, mert ez „lényegesen tisztább scaling laws”-t ad (§1.3); a Chinchilla F függeléke azt mondja: „az embedding mátrixokat is beleszámoljuk a teljes paraméterszámba”.2 Széles szótár és szűk hidden dimension esetén a kettő kilencszeres eltérést ad, ahogy az első sor mutatja.

A maradék rés az, amit 6ND6ND szándékosan kihagy: az attention pontszámok. Kaplan (2.2) egyenlete a forward költséget 2N+2nlayernctxdmodel2N + 2\,n_{\text{layer}} n_{\text{ctx}} d_{\text{model}} alakban írja, és elhagyja a második tagot, mert dmodelnctx/12d_{\text{model}} \gg n_{\text{ctx}}/12 — 2020-ban biztonságos volt, ma kevésbé, és ez az oka, hogy az arány felfelé sodródik, ahogy T/dT/d nő — ezért van itt két sor azonos, 1 024-es TT értékkel, és az arány csökken, 1.145-ről 1.100-ra, amikor dd 768-ról 1 600-ra nő. Ez az a O(T2)O(T^2) költség, amelyet a 9. fejezet vezetett be, és amelyből a 16. fejezet árat csinál.

Memória: minek kell ténylegesen beférnie

Link a szakaszhoz: Memória: minek kell ténylegesen beférnie

A compute azt dönti el, mennyi ideig tart egy futás; a memória azt, hogy el tud-e indulni. Taníts sima fp32 AdamW-vel, és minden paraméter négy számot hordoz: a súlyt, a gradientjét, valamint Adam futó átlagát mm és varianciáját vv — azt a két átlagot, amelyet a 6. fejezet kézzel épített fel. Négy szám, egyenként négy bájton: 16 bájt paraméterenként, még egyetlen activation előtt. 8 GB-os laptop GPU-n mérve, a lépésnek azon a pontján vett rezidens allokációval, amikor már nincs élő gráf:

modellszótárbatchNN16N16N becsültmért rezidenscsúcs egy lépésbenkülönbség
dd 512, 8 réteg50,257851,045,888779 MB801 MB2,500 MB1,699 MB
dd 512, 8 réteg4,096827,411,456418 MB426 MB1,043 MB617 MB
dd 256, 6 réteg4,09685,839,36089 MB89 MB382 MB293 MB
dd 256, 6 réteg4,096325,839,36089 MB89 MB1,259 MB1,170 MB
dd 256, 6 réteg4,0961285,839,36089 MB89 MB4,771 MB4,681 MB

A becslés és a mérés 3%-on belül egyezik. A meglepetés az utolsó oszlop: az activationök eltörpítik magát a modellt. Ugyanaz az 5,8 millió paraméteres modell, amelynek 89 MB tartós állapot kell, 128-as batch mellett 4 681 MB activationt igényel — a modell ötvenkétszeresét —, és ennek nagy része egyáltalán nem a transformer. A logits az: tokenenként egy szótárméretű vektor, bejegyzésenként négy bájton. Az utolsó sorban 512 MB, az elsőben 393 MB. A szótárméretet a 7. fejezetben választottuk, és még mindig az dönti el, mi fér fel a kártyára.

Hogy melyik tag dominál, a futás alakjától függ; ezért mondják Micikevicius és mtsai., hogy a memóriát „az activationök dominálják”3, miközben a ZeRO szerint egy 1,5 milliárd paraméteres modellnek „legalább 24 GB” kell csak modellállapotokra.4 A ZeRO más úton jut ugyanahhoz a 16 bájthoz — 2Ψ2\Psi fp16 súlyokra, 2Ψ2\Psi fp16 gradientekre, 4Ψ4\Psi egyenként az fp32 master súlyokra és Adam két momentumára — ami 70 milliárd paraméternél 1,12 terabájt, tizennégy darab 80 GB-os GPU-nyi mennyiség, még egyetlen activation előtt.

Párhuzamosítás egy bekezdésben és egy delegálással

Link a szakaszhoz: Párhuzamosítás egy bekezdésben és egy delegálással

Frontier skálán ebből semmi sem fér el egyetlen eszközön, ezért a futás egyszerre négyfelé oszlik. Data parallelism minden GPU-ra feltesz egy modellt, és átlagolja a gradienteket — ez az alapértelmezés, és ezt javítja a ZeRO azzal, hogy nem tart redundáns példányokat az optimizer állapotából. Tensor parallelism az egyes mátrixokat osztja szét eszközök között. Pipeline parallelism minden eszköznek rétegek összefüggő csoportját adja. Context parallelism magát a szekvenciát osztja fel, és csak akkor szükséges, ha TT elég hosszú ahhoz, hogy az attention-tag domináljon. A Llama 3 4. táblázata mind a négyet egyszerre sorolja: tensor 8, context akár 16, pipeline 16, data akár 128, összesen 16 384 H100 GPU-n.5 Ez minden, amit ez a kurzus erről mond; az elosztott tanítás mérnöki oldala önálló félév, és a Stanford CS336 ez a félév, az 5–8. előadásokkal és kóddal.6 Ami a delegálásból megmarad, az egyetlen szám: model FLOPs utilisation — egy GPU csúcsaritmetikájának az a hányada, amelyet egy valós futás elér —, ez alakítja a rendezett 6ND6ND értéket falióraidővé, tehát pénzzé.

Kaplan, és a fogadás, amelyet az iparág megtett

Link a szakaszhoz: Kaplan, és a fogadás, amelyet az iparág megtett

2020 januárjában Kaplan és mtsai. transformerek rácsát tanították, és azt találták, hogy a teszt loss a három erőforrás mindegyikében hat nagyságrendet meghaladó tartományon hatványtörvényt követ.1 Az §1.2 három illesztett törvényt ad:

L(N)=(NcN)αN,αN0.076,Nc8.8×1013L(N) = \left(\frac{N_c}{N}\right)^{\alpha_N}, \qquad \alpha_N \approx 0.076, \qquad N_c \approx 8.8 \times 10^{13}

társakkal: αD0.095\alpha_D \approx 0.095 adatra és αCmin0.050\alpha_C^{\min} \approx 0.050 optimálisan allokált compute-ra. A konstansok nem univerzálisak, és ezt a cikk ki is mondja: „NcN_c, CcminC_c^{\min} és DcD_c pontos numerikus értékei a szótármérettől és a tokenizationtől függenek, ezért nincs alapvető jelentésük.”

A kitevők aprók: tízszer annyi paraméter a maradék loss-ból 100.0761.1910^{0.076} \approx 1.19 faktort vesz le. Ez semminek hangzik, és itt ez a legfontosabb tény — a hozamok borzalmasak, és soha nem állnak le. Egy kis kitevőjű hatványtörvény azt ígéri, hogy a következő nagyságrend segíteni fog, kevesebbet, mint az előző, örökké. Compute-ot venni nem szerencsejáték többé, hanem vásárlás közzétett árfolyammal, és pontosan ez az érv nyitotta ki a tőkét.

Aztán jött az előírás, és itt tévedett a cikk úgy, hogy az iparágnak sok pénzébe került. Kaplan 6. táblázata NoptC0.73N_{\text{opt}} \propto C^{0.73} és DoptC0.27D_{\text{opt}} \propto C^{0.27} értéket ad: tízszeres compute 5,4-szer nagyobb modellt jelent, mindössze 1,9-szer annyi szöveggel etetve. Az absztrakt egyértelmű: „az optimálisan compute-hatékony tanítás nagyon nagy modellek viszonylag szerény mennyiségű adaton való tanítását jelenti, és jelentősen a konvergencia előtt megáll”. A terület pontosan ezt tette: GPT-3, 175 milliárd paraméter 300 milliárd tokenen,7 Gopher, 280 milliárd 300 milliárdon, Megatron-Turing NLG, 530 milliárd 270 milliárdon.2 Fél tokentől két tokenig paraméterenként, mindenhol.

2022 márciusában Hoffmann és mtsai. több mint 400 modellt tanítottak 70 milliótól 16 milliárd paraméterig, és három független úton az ellenkező következtetésre jutottak.2 A 2. táblázatban NoptCaN_{\text{opt}} \propto C^{a} képlet aa kitevőjére 0.50, 0.49 és 0.46 szerepel, Kaplan 0.73 értékével szemben. Egyszerűen: a modellméretnek és a training adatnak azonos arányban kell nőnie.

A második megközelítés az, amelyet a fejezet tetején lévő sweep egymilliomod skálán reprodukál: rögzíts egy keretet, taníts sok méretet pontosan ezen a kereten, ábrázold a végső loss-t a modellméret függvényében.

paraméterekC=1013C = 10^{13}C=3.16×1013C = 3.16 \times 10^{13}C=1014C = 10^{14}
98,6245.3531 (171)4.8638 (542)
150,3205.4636 (74)
194,2085.5041 (44)4.8730 (140)4.4040 (442)
295,8085.5550 (19)4.9029 (60)4.3383 (190)
665,2805.7849 (3.8)5.1254 (12)4.4192 (38)
1,280,7685.8174 (1.0)5.1751 (3.2)4.5003 (10)
3,101,5685.4686 (0.5)4.7768 (1.7)
5,315,0725.5894 (0.2)4.8514 (0.6)
15,053,5685.3534 (0.1)

Hold-out loss natban tokenenként, zárójelben a token/paraméter arány, félkövérrel az egyes keretek legjobb modellje; a gondolatjel nem futtatott pontot jelöl, mert a keret több szöveget követelt, mint amennyi a korpuszban van, vagy a méret kívül esett az ott végigsöpört tartományon.

Olvass lefelé egy oszlopban: a loss csökken, eléri az alját, majd újra nő. Egy modell pontosan ugyanolyan könnyen lehet túl nagy a keretéhez, mint túl kicsi101410^{14} esetén 665 280 paraméter választása 295 808 helyett 0,08 nat büntetés, ami a fent illesztett burkolón annak a loss-nak felel meg, amelyet egy helyesen méretezett modell 18%-kal kevesebb compute-tal ér el. A rossz alak kiválasztása a keret ötödét dobja ki. Ez Chinchilla 3. ábrája egy délután alatt, egy GPU-n, nem négyszáz modellel.

Most olvass vízszintesen. 101310^{13} esetén a legjobb modell a sweep legkisebbje; 101410^{14} esetén 295 808 paraméter, mindkét oldalról bekeretezve. Az optimum jobbra mozdul, ahogy a keret nő, és ez a korrekció teljes tartalma. Illeszd a cikk harmadik megközelítését — a L(N,D)=E+A/Nα+B/DβL(N,D) = E + A/N^{\alpha} + B/D^{\beta} felületet minden futás felett —, és minimalizálj C=6NDC = 6ND feltétel mellett:

TEXT
L(N, D) = 24.7 / N^0.195 + 46.8 / D^0.169       (E fits to ~0; see below)
implied   N_opt ∝ C^0.464
  compare   Chinchilla 0.46-0.50 · Besiroglu 0.513 · Kaplan 0.73

0.46, laptopról, Kaplan 0.73 értékével szemben. Háromjegyű egyezés három keretből illesztve szerencse; az első jegy egyezése nem az. A kitevő utazik — a konstans nem, mert ezeknél az optimumoknál a token/paraméter arány 170–540, nem 20. Három ok, mind tanulságos. EE nullára illeszkedik, mert 4 nat feletti loss mellett a futás sehol sincs annak az entrópia-padlónak a közelében, amely Chinchilla illesztését dominálja. A batch size és a learning rate fix volt, nem pontonként hangolt, ami azokat a futásokat bünteti, amelyek a legkevesebb lépést kapják — és ezek a nagy modellek: 101310^{13} FLOP-nál egy 1,28 millió paraméteres modell összesen 159 optimizer-lépést kap, messze a néhány ezer alatt, amelyet Kaplan SminS_{\min} tagja szerint bármely modell igényel. Egy scaling law egy rezsimen belül illeszkedik, és ez hat nagyságrenddel Chinchilla alatt ül.

Ezért a cikk absztraktja: „a jelenlegi nagy language modellek jelentősen alultanítottak”. A Chinchilla a demonstráció — 70 milliárd paraméter 1,4 billió tokenen, ugyanazzal a teljes compute-tal, mint a Gopher 280 milliárdja 300 milliárdon, és 57 MMLU-feladatból 51-en megveri, 67,5% kontra 60%.2 Négyszer kisebb, négy és félszer több szöveg, ugyanannyi pénz, jobb modell.

Két fenntartás a híres arányhoz. A „húsz token paraméterenként” nem mondat a cikkben, amely csak azt mondja, hogy „a modellméret minden duplázásakor a training tokenek számát is duplázni kell”; a 20 a 3. táblázatból és Chinchilla saját 70 B / 1.4 T példájából következtetés. A pontossága pedig rosszabb a közöltnél: Besiroglu és mtsai. a 4. ábra digitalizálásából újraillesztették, azt találták, hogy az eredeti paraméterek „rosszul illeszkednek a rekonstruált adatokhoz”, az intervallumok „valószínűtlenül szűkek az adatpontok számához képest”, és a becsületes tartományt „4 és 40 között” token/paraméterre tették.8

Chinchilla módszerének egy részlete beváltja az 1. fejezet learning-rate schedule-ökről tett ígéretét. A cosine schedule-t a tokenkerethez kell igazítani. Annak a modellnek, amely 10 millió tokent fog látni, a learning rate-jét 10 millió tokennél kell nullára csökkentenie; adj neki 100 millióra méretezett schedule-t, állítsd meg korán, és egy olyan loss-t olvasol le a lejtő közepéről, amelynél a ráta túl magas. Chinchilla minden modellt négy ciklushosszon tanít pontosan ennek kontrollálására; a fenti sweep ugyanezért állítja a schedule-t a keretből.

Ezek a terület leghasznosabb empirikus eredményei, és rutinszerűen túlértékesítik őket. Négy korlát.

Loss-t jósolnak, nem képességet. A bal oldal hold-out szövegen mért cross-entropy. Ezekben a cikkekben semmi sem jogosít fel arra az állításra, hogy egy modell helyes SQL-t ír-e, visszautasít-e egy káros kérést, vagy használ-e toolt. Ez újra az 5. fejezet leckéje: a loss előrejelzése nem annak a viselkedésnek az előrejelzése, amiért fizetsz.

Illesztettek, nem levezetettek. Semmilyen elmélet nem állít elő αN=0.076\alpha_N = 0.076 értéket. A konstansok mozognak a tokenizerrel — ezért értelmetlen két tokenizer között perplexityt összehasonlítani, ahogy a 8. fejezet elmagyarázta —, továbbá az adatkeverékkel, architektúrával és optimizerrel. Minden publikált törvény annak a setupnak a törvénye, amely létrehozta, ezért illesztette újra a Meta a sajátját a Llama 3 előtt.5

Minden lépéshez friss tokent feltételeznek, ami csendben végtelen korpuszt feltételez. Muennighoff és mtsai. megmérték, mi történik, amikor elfogy: akár négy epoch ismételt adat szinte semmibe sem kerül — egy 8,7 milliárd paraméteres modell 44 milliárd egyedi tokenen négyszer végigmenve „csak 0,5%-kal magasabb validation loss”-szal végzett, mint ugyanaz a modell 178 milliárd egyedi tokenen —, míg körülbelül tizenhat epoch után a további compute már semmit sem vesz.9

És ma már senki sem tanít compute-optimálisan. A Chinchilla a tanítás költségét minimalizálja; egy deployolt modell ezután nagyjából 2N2N FLOP-ot fizet generált tokenenként, örökké. A LLaMA 1 ezt egyenesen kimondta: „adott teljesítménycél mellett nem a leggyorsabban tanítható, hanem az inference-ben leggyorsabb modell a preferált”.10 Sardana és mtsai. ezt úgy formalizálták, hogy helyette 6NDtrain+2NDinference6ND_{\text{train}} + 2ND_{\text{inference}} értéket minimalizáltak, és azt találták, hogy aki egymilliárd kéréssel számol, annak „Chinchilla-optimálisnál kisebb és tovább tanított” modellt kell tanítania.11 A Llama 3 §9.1 egyetért: kis modelljeit „messze a compute-optimal training pontján túl” tanítják, ténylegesen training compute-ot cserélve inference-hatékonyságra.5 Az arány nem elavult; csak arra a kérdésre válaszol, amelyet már nem tesznek fel.

Emergent abilities, és a vita arról, valódiak-e

Link a szakaszhoz: Emergent abilities, és a vita arról, valódiak-e

A loss simán csökken. A benchmark-pontszámok néha nem. Wei és mtsai. olyan eseteket gyűjtöttek, ahol egy feladat a training compute nagyságrendjein át véletlenszinten marad, majd ugrik — háromjegyű aritmetika megjelenése GPT-3-ban körülbelül 2×10222 \times 10^{22} FLOP-nál, MMLU a találgatás fölé emelkedik 33 és 5×10235 \times 10^{23} között —, és nevet adtak a mintának: „egy képesség emergent, ha kisebb modellekben nincs jelen, nagyobb modellekben viszont igen”.12 Ha ez valódi tulajdonság, olcsó kísérletekből extrapolálni veszélyes, mert a képesség, amelyet megveszel, lehet, hogy semmilyen számodra tesztelhető skálán nem létezik.

Schaeffer, Miranda és Koyejo azt állították, hogy ennek nagy része mérési műtermék, és a mechanizmus aritmetika.13 A tokenenkénti loss simán csökken, így annak valószínűsége, hogy egy token helyes, exp(L)\exp(-\mathcal{L}), fokozatosan javul. Pontozd a modellt exact string match metrikával egy LL-tokenes válaszon, és ezt a valószínűséget LL hatványra emeled — egy sima görbe nagy hatványra emelve szakadéknak látszik. Cseréld le olyan metrikára, amely tokeneket számol ahelyett, hogy mindet megkövetelné, ugyanazon kimeneteken, és „a család teljesítménye simán, folytonosan és előrejelezhetően javul a skála növekedésével”.

Az auditjuk száma az, amit meg kell jegyezni — „a BIG-Bench 39 preferált metrikájából legfeljebb 5 mutat emergence-et”, és két diszkontinuus metrika felel a hivatkozott esetek több mint 92%-áért —, és a figyelmeztetésük is: „ebben a cikkben semmit sem szabad úgy értelmezni, hogy azt állítaná: a nagy language modellek nem mutathatnak emergent abilities-t”. Egy grafikonon látott ugrás a metrikáról szóló bizonyíték, amíg más be nem bizonyosodik. A 29. fejezet az, ahol ez a te problémáddá válik, mert a hard-cutoff metrika kiválasztása olyan döntés lesz, amelyet észrevétlenül hozol meg.

A korpusz a pretraining futásnak az a része, amelyhez nem tartozik egyenlet, és ahol a legtöbb következményekkel járó döntés lakik. A nyersanyag egy webcrawl: a Common Crawl 2026. augusztusi archívuma „2,14 milliárd weboldalt vagy 360 TiB tömörítetlen tartalmat” tartalmaz, egyetlen hónapot, ingyen letölthetően.14 Szinte semmi sem használható ebben a formában. A T5-cikk szerint a crawl „nagyrészt halandzsából vagy boilerplate szövegből, például menükből, hibaüzenetekből vagy duplikált szövegből áll”, és az általa bevezetett C4 pipeline nyers heurisztikák listája — csak a mondatzáró írásjellel végződő sorok megtartása, háromnál kevesebb mondatot tartalmazó oldalak eldobása, minden olyan oldal eldobása, amely kapcsos zárójelet vagy egy nyilvános trágárságlistán szereplő szót tartalmaz — így lesz havi húsz terabájt szövegből körülbelül 750 GB.15

A nyers a megfelelő szó. Dodge és mtsai. auditálták, mit távolítanak el ezek a szűrők, és azt találták, hogy a trágárság-blokklista az African-American English dokumentumok 42%-át és a Hispanic-aligned English dokumentumok 32%-át törli, szemben a White-aligned English 6,2%-ával, így a korpusz 97,8%-ban az utóbbi kategóriából marad.16 Egy szabálynak, amelynek nem volt véleménye dialektusról, lett.

Aztán deduplication, ami nem takarítás: Lee és mtsai. találtak egy 61 szavas mondatot, amely 61 036-szor ismétlődött a C4-ben, és megmutatták, hogy a deduplication tízszeresére csökkenti, milyen gyakran „bocsátanak ki memorizált szöveget” a modellek, a generált tokenek 1,9%-áról 0,19%-ra.17 A több azonban nem jobb: a FineWeb csapata globálisan, 96 crawlon át deduplikált, 4 billió tokent kapott, mérhető nyereség nélkül; aztán crawlonként külön deduplikált, 20 billiót kapott, és hozta a legjobb létező korpusz szintjét.18

Aztán contamination. A Llama 3 megmérte a sajátját, és közzétette: az AGIEval 98%-a, a BIG-Bench Hard 95%-a és a HellaSwag 85%-a 8-gramokon átfedett a training set-tel, MMLU esetén pedig olyan magas volt az átfedés, hogy „lehetetlen jó teljesítménynyereség-becslést kapni”.5 A GPT-3 §4 egy szűrési hibáról számol be, amely benchmarkokat hagyott az adatban úgy, hogy már nem volt visszaút: „költségmegfontolások miatt nem volt kivitelezhető a modell újratanítása”.7

A provenance a megoldatlan rész. A Pile egy 100,96 GiB-os Books3 nevű komponenst adott ki — a korpusz 12%-át, és a cikk saját hozzájárulási táblázata szerint privát torrent trackerről származó könyveket;19 2023 augusztusában szerzői jogi panasz után lekerült. A jogi helyzet 2026 szeptemberében rendezetlen, és a trendként idézett három amerikai döntés ellentmond egymásnak. Alsup szerint a jogszerűen megszerzett könyveken való tanítás „rendkívül transzformatív”, miközben kimondta, hogy a kalózmásolatokból épített könyvtár nem az; az Anthropic ezt a felét $1,5 milliárdért rendezte, 482 460 műre, darabonként nagyjából $3 000-ért, 2026. július 20-i jóváhagyással.20 Chhabria összegző ítéletet adott a Metának, miközben azt írta, hogy döntése „nem állítja azt a tételt, hogy a Meta szerzői joggal védett anyagok használata language modellek tanítására jogszerű”, csak azt, hogy „ezek a felperesek rossz érveket hoztak”.21 Bibas, a Ross Intelligence ellen döntve, megjegyezte, hogy „ma csak non-generative AI van előttem”.22 Egyetlen amerikai fellebbviteli bíróság sem döntött még a kérdésben.

Emberek végzik azokat a részeket, amelyeket a loss nem tud. A TIME 2023 januárjában arról számolt be, hogy az OpenAI számára, a Sama cégen keresztül toxikus szöveget címkéző dolgozók „körülbelül $1,32 és $2 közötti órabért” vittek haza, miközben gyermekek szexuális bántalmazását, kínzást és önsértést leíró részleteket olvastak; az OpenAI $12,50-t fizetett óránként a Samának a munkáért; a Sama vitatja mind a bérsávot, mind a kvótát.23 Ez a pretraining körüli szűrés, nem maga a pretraining — de ugyanazon a számlán van, és itt ül egy ember.

Az áram valódi, és általában rosszul idézik. A legóvatosabb publikált szám a BLOOM-é: 1 082 990 GPU-óra, 433 MWh és 24,7 tonna CO₂-egyenérték a futásra, 50,5 a gyártást és idle node-okat is beleszámolva;24 Patterson és mtsai. a GPT-3-at 1 287 MWh-ra és 552 tonnára teszik.25 Két figyelmeztetés. A BLOOM előnye a francia nukleáris hálózat 57 g CO₂/kWh értéke, nem a hatékonyság — több energiát használt, mint az OPT-175B. A terület legtöbbet idézett kibocsátási száma, Strubell és mtsai. 626 155 fontja egy neural architecture search-re, később 88-szor túl magasnak bizonyult, mert azt feltételezte, hogy a keresés teljes modellméreten futott, holott proxyn futott.26 Az LBNL keretezése a védhető: az amerikai adatközpontok 192 TWh-t használtak 2024-ben, a nemzeti villamosenergia 4,7%-át — ez egy iparághoz kötött szám, nem egyetlen futáshoz.27

A vezérfonal az, amit Bender és mtsai. documentation debt néven írtak le: „olyan helyzetbe hozzuk magunkat, ahol az adatkészletek egyszerre dokumentálatlanok és túl nagyok ahhoz, hogy utólag dokumentáljuk őket”.28 A fenti tények mind azért léteznek, mert valaki megnézte. A legtöbbek által használt modellek mögötti korpuszok esetében senki sem tudja.

Most jön az az aritmetika, amelyet mindenki akar, négy idézett bemenetből, hogy amikor elavulnak, nyilvánvaló legyen, melyiket kell lecserélni.

Az NVIDIA H100 oldala 1 979 teraFLOPS BF16 tensor-core throughputot sorol fel egy „with sparsity” lábjegyzet alatt.29 Strukturált sparsityt egyetlen pretraining futás sem használ, ezért a dense érték ennek fele: 989,5 TFLOP/s.

A Llama 3 4. táblázata 38–43% BF16 model FLOPs utilisationt közöl. Vegyünk 40%-ot: GPU-nként 395,8 TFLOP/s hasznos aritmetika.5

A Lambda on-demand ára egy 8×H100 SXM node-ra, 2026-09-06-án elérve: $3,99 GPU-óránként, tehát $31,92 óránként a node-ra.30

Chinchilla aránya, D=20ND = 20N, megadja C=6ND=120N2C = 6ND = 120N^2 értékét, és így N=C/120N = \sqrt{C/120} értékét.

keretH100-órákFLOPscompute-optimális paraméterektokenekegy 8×H100 node-onGPU-k 90 napos befejezéshez
$100253.6e19546 M10.9 B3.1 h1
$1,0002513.6e201.73 B34.5 B31.3 h1
$10,0002,5063.6e215.46 B109 B13 nap2
$100,00025,0633.6e2217.3 B345 B131 nap12
$1,000,000250,6273.6e2354.6 B1.09 T4 év116
$10,000,0002,506,2663.6e24173 B3.45 T36 év1,160
$100,000,00025,062,6573.6e25546 B10.9 T358 év11,603

Olvasd együtt az utolsó két oszlopot. $10 000-ért kapsz egy 5 milliárd paraméteres modellt egy bérelt node-on két hét alatt. $100 000 000-nál az aritmetika 546 milliárd paramétert mond — és tizenkétezer H100-at, három hónapra összekötve, amit nem bérelsz ki bankkártyával. Nagyjából $100 000 fölött a kötő korlát már nem a pénz, hanem a cluster.

Mielőtt hinnél egy ilyen táblázatnak, teszteld olyan futásokkal szemben, amelyek valódi költsége publikált — llm.c reprodukálja a GPT-2 124M-et „~90 perc” alatt egy 8×A100 node-on „körülbelül $20-ért”, és a GPT-2 1.6B-t 24 óra alatt egy 8×H100 node-on $672-ért.31

TEXT
$672, against what $672 actually bought (llm.c GPT-2 1.6B, one 8xH100 node, 24 h)
  this table predicts:      168 H100-hours   N = 1.41 B params   D = 28.3 B tokens
  what was actually run:    192 H100-hours   N = 1.558 B params  D = 33.6 B tokens

Llama 3 405B, against Meta's own published GPU-hours
  from the paper's 3.8e25 FLOPs at 40 % MFU:   26.67 M H100-hours
  published in Meta's Llama 3.1 model card:    30.84 M H100-hours    ratio 0.86

Mindkettő körülbelül 15%-on belül van, ami nagyjából az a pontosság, amit egy ilyen becslés megérdemel, és jóval jobb annál a pontosságnál, amellyel általában idézik.

A fő összehasonlítás, mindkét definícióval az asztalon

Link a szakaszhoz: A fő összehasonlítás, mindkét definícióval az asztalon

A témában legtöbbet ismételt állítás az, hogy egy 2019-ben körülbelül $43 000-be kerülő GPT-2-osztályú modell ma néhány tíz dollárból reprodukálható. A modern fele jól dokumentált; a történeti fele nem.

Ma. Karpathy nanochat README-je: „you can train your own GPT-2 capability LLM ... for only $48 (~2 hours of 8XH100 GPU node) ... On a spot instance, the total cost can be closer to ~$15.”32 A „GPT-2 capability” itt pontos és publikált — a GPT-2 0.256525-ös CORE score-jának megverése — egy leaderboardon, amelynek legjobb bejegyzése 2026. március 14-én 1,65 óra. A $48 $3/GPU-órát feltételez, Lambda $3,99-os listaára alatt; listaáron inkább $64.

2019-ben. Nincs elsődleges forrás: az OpenAI soha nem publikált időtartamot vagy költséget. A lánc így néz ki: The Register, 2019. február, „256 Google TPU3 core”-t jelent ár és időtartam nélkül; majd Synced, 2019. június, megjegyzi, hogy a hardver $256/óra volt Google Cloudon, és kifejezetten leírja, hogy „OpenAI didn't specify the training duration”. A $43 008 úgy jön ki, hogy $256/óra szorozva egy feltételezett 168 órával, amelyre senki sem adott forrást.

A becsületes cím tehát: egy GPT-2 publikált benchmark-pontszámát elérő modell ma jóval $100 alatt betanítható bérelt hardveren, szemben egy 2019-es költséggel, amelyet soha nem publikáltak, és amelynek híres becslése forrás nélküli időtartam-feltételezésen nyugszik. Az összeomlás valódi, és a modern felet bárki reprodukálhatja bankkártyával; az arány egy nem létező számon végzett aritmetika. Általában ez a publikált tanítási költségek állapota. A GPT-3 cikkben egyáltalán nincs dollárösszeg, csak 3.14×10233.14 \times 10^{23} FLOP a D.1 táblázatban;7 a Llama 3 cikkben sincs.5 Minden training cost, amit olvastál, FLOP-számból, hardverfeltételezésből és árfeltételezésből származó becslés — mindig érdemes megkérdezni, kié.

Mit tud egy base model, és mikor állt meg a tudása

Link a szakaszhoz: Mit tud egy base model, és mikor állt meg a tudása

Ami kijön, egy rögzített pillanatban összeállított rögzített korpuszt látott, és ebből két tulajdonság következik.

Az első a knowledge cutoff. A gyűjtési dátum után a modell semmit sem tud — nem „bizonytalan”, hanem semmit —, és folyékonyan konfabulál majd ahelyett, hogy ezt mondaná, mert ezt a viselkedést soha nem tanították neki. A Llama 3.1 model card 2023 decemberét adja meg;33 minden modellnek van ilyenje, és ez a training adat tulajdonsága, nem a deploymenté. Megkerülni retrieval-probléma, ez a 19. fejezet.

A második, hogy egy base model kiegészít, nem válaszol. Add neki azt, hogy „Mi Franciaország fővárosa?”, és egy hihető folytatás lehet egy másik kérdés, mert a korpuszban ez a string leggyakrabban feladatlistákban jelenik meg.

Egy szövegkiegészítő nem assistant. Nem követ utasításokat, mert a korpuszban semmi sem mondta neki, hogy egy kérést teljesíteni kell, nem folytatni. Nincs fogalma két résztvevős beszélgetésről. Gond nélkül előállítja egy káros prompt legvalószínűbb folytatását, mert valaha csak a valószínűségre optimalizálták.

Ahhoz, hogy válaszoló valamivé alakuljon, kell egy második szakasz, amely az első költségének töredék százalékába kerül, és szinte teljesen abból áll, hogy példákat mutatunk neki a kívánt viselkedésre, majd saját kimeneteinek párjait hasonlítjuk össze. Ebből a szakaszból származik az utasításkövetés, a chat template-ek, a visszautasítások és — ez sokakat meglep — a tool hívásának képessége is. A 11. fejezet ez a szakasz: supervised fine-tuning, RLHF, DPO és GRPO, valamint az a kérdés, mit jelent az, hogy „aligned”, és ki dönt róla.


E fejezet mellé még érdemes olvasni: Karpathy build-nanogpt projektjét és a hozzá tartozó videót, amelyek egy teljes GPT-2-reprodukciót vezetnek végig elejétől végéig olyan tempóban, amire ez a fejezet nem képes; valamint a Stanford CS324, Large Language Models kurzust, amelynek adatokról és környezeti hatásról szóló előadásai mélyebbre mennek abban az anyagban, amelyet ez a kurzus egyszer tárgyal, majd delegál.

  1. Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J. and Amodei, D. Scaling Laws for Neural Language Models. arXiv:2001.08361 (2020). A három hatványtörvény az §1.2 (1.1)–(1.3) egyenleteiben szerepel, a teljes konstansok az A függelék 5. táblázatában; a 6N6N levezetés az §2.1; a compute-allokációs kitevők a 6. táblázatban. Megjegyzés: két compute-törvény van, αC=0.057\alpha_C = 0.057 fix batch size mellett és αCmin=0.050\alpha_C^{\min} = 0.050 optimális batch size mellett; a cikk szerint az utóbbit „kell előrejelzésekhez használni”. 2

  2. Hoffmann, J., Borgeaud, S., Mensch, A., Buchatskaya, E., Cai, T., Rutherford, E. et al. Training Compute-Optimal Large Language Models. arXiv:2203.15556 (2022). Kitevők a 2. táblázatban, tervezett keretek a 3. táblázatban, a Gopher-összehasonlítás a §4-ben, a paraméterszámlálási konvenció az F függelékben. A 3. táblázat alatti próza ellentmond magának a 3. táblázatnak a 175 B és 280 B soroknál; a táblázat az idézendő verzió. 2 3 4

  3. Micikevicius, P., Narang, S., Alben, J., Diamos, G., Elsen, E., Garcia, D. et al. Mixed Precision Training. arXiv:1710.03740 (2017), ICLR 2018. FP32 master súlyok a §3.1-ben, loss scaling a §3.2-ben. 2

  4. Rajbhandari, S., Rajbhandari, S., Ruwase, O. and He, Y. ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054 (2019), SC20. A 16Ψ16\Psi elszámolás a §3.1-ben; a reziduális állapotok és activationök számai a §3.2-ben.

  5. Grattafiori, A. et al. (Llama Team, AI @ Meta). The Llama 3 Herd of Models. arXiv:2407.21783 (2024). Compute-keret és tokenmennyiség az §1-ben, az újraillesztett scaling law a §3.2.1-ben, a párhuzamosítási konfiguráció és MFU a 4. táblázatban, a contamination elemzés az §5.1.4-ben, az over-training állítás a §9.1-ben. A cikk nem tartalmaz dollárösszeget és kibocsátási táblázatot sem. 2 3 4 5 6

  6. Stanford CS336, Language Modeling from Scratch. A 2. előadás erőforrás-elszámolást, az 5–8. előadások GPU-kat, kerneleket és párhuzamosítást, a 9. és 11. előadások scalinget, a 13–14. előadások adatot tárgyalnak. Ez az a kurzus, amelyre ez a fejezet az engineeringet delegálja, és nyilvános.

  7. Brown, T. B. et al. Language Models are Few-Shot Learners. arXiv:2005.14165 (2020). Compute a D függelék D.1 táblázatában — amelyben szó szerint „flops per param per token” fejlécű oszlop van, és ennek értéke minden GPT-3 sorban 6. Contamination elemzés a §4-ben. 2 3

  8. Besiroglu, T., Erdil, E., Barnett, M. and You, J. Chinchilla Scaling: A replication attempt. arXiv:2404.10102 (2024). A Chinchilla adatait a 4. ábra digitalizálásával rekonstruálja, újrailleszti, és korrigált kitevőket, valamint sokkal szélesebb intervallumokat közöl.

  9. Muennighoff, N., Rush, A. M., Barak, B., Le Scao, T., Piktus, A., Tazi, N., Pyysalo, S., Wolf, T. and Raffel, C. Scaling Data-Constrained Language Models. arXiv:2305.16264 (2023), NeurIPS 2023. A négy-epoch eredmény a §6-ban; a tizenhat-epoch felezési idő az illesztett RD15R_D^* \approx 15.

  10. Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T. et al. LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 (2023). Az §1 mondja ki az inference-költség érvet a Chinchilla-optimális tanítással szemben.

  11. Sardana, N., Portes, J., Doubov, S. and Frankle, J. Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws. arXiv:2401.00448 (2023), ICML 2024. A §5 tartalmazza az ellenpontot is: extrém tokenarányokon tanított modellek tovább javulnak, de „lassabban, mint a scaling laws előre jelzik”.

  12. Wei, J., Tay, Y., Bommasani, R., Raffel, C., Zoph, B., Borgeaud, S. et al. Emergent Abilities of Large Language Models. arXiv:2206.07682 (2022), TMLR. Definíció a §2-ben, példák és compute-küszöbök a §3–4-ben és az 1. táblázatban.

  13. Schaeffer, R., Miranda, B. and Koyejo, S. Are Emergent Abilities of Large Language Models a Mirage? arXiv:2304.15004 (2023), NeurIPS 2023 outstanding paper. A metrikaérv a §2-ben, a BIG-Bench metaelemzés a §4-ben, a konstruált vision példa a §5-ben.

  14. Common Crawl, August 2026 Crawl Archive Now Available (CC-MAIN-2026-34), publikálva 2026. augusztus 24-én, elérve 2026-09-06. A saját címlapja „15 évet átfogó, több mint 300 milliárd oldalról”, „összesen több mint 10 petabájtról” beszél — ez a teljes archívum száma, nem az itt árazott havi crawlé.

  15. Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W. and Liu, P. J. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683 (2019), JMLR 21(140). A C4-szűrők a §2.2-ben vannak. A cikk bájtban ad méreteket, nem tokenben; a neki gyakran tulajdonított 156 milliárd-tokenes szám az alábbi Dodge és mtsai. munkából származik.

  16. Dodge, J., Sap, M., Marasović, A., Agnew, W., Ilharco, G., Groeneveld, D., Mitchell, M. and Gardner, M. Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758 (2021), EMNLP 2021. A dialektus-eltávolítási arányok a §5.3-ban; benchmark contamination a C4-ben a §4.2-ben.

  17. Lee, K., Ippolito, D., Nystrom, A., Zhang, C., Eck, D., Callison-Burch, C. and Carlini, N. Deduplicating Training Data Makes Language Models Better. arXiv:2107.06499 (2021), ACL 2022. A 61 036 ismétlés az 1. lábjegyzet; a memorizációs számok a §6.2-ben, a 4. táblázatban vannak, és a generált tokenek százalékai 50-tokenes exact-match kritérium mellett.

  18. Penedo, G., Kydlíček, H., Ben Allal, L., Lozhkov, A., Mitchell, M., Raffel, C., Von Werra, L. and Wolf, T. The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale. arXiv:2406.17557 (2024), NeurIPS 2024 Datasets and Benchmarks. A deduplication eredmény a §3.4-ben található. A kiadott dataset azóta túlnőtt a cikk 15 billió tokenjén.

  19. Gao, L., Biderman, S., Black, S. et al. The Pile: An 800GB Dataset of Diverse Text for Language Modeling. arXiv:2101.00027 (2020). A Books3 a §2.3-ban és az 1. táblázatban szerepel; a hozzájárulási táblázat az 5. táblázat. A korpusz 825,18 GiB, tehát még a cím is lefelé kerekít.

  20. Bartz v. Anthropic, No. 4:24-cv-05417 (N.D. Cal.). Fair-use végzés 2025. június 23. (Dkt. 231); class certification 2025. július 17.; végső jóváhagyás és ítélet 2026. július 20. (Dkt. 680). Az egyezség csak múltbeli inputokat enged el, outputokat és jövőbeli magatartást nem.

  21. Kadrey v. Meta, No. 3:23-cv-03417-VC (N.D. Cal.), összegző ítélet 2025. június 25. (Dkt. 598). Megjegyzés: a torrentezésen alapuló terjesztési igényről nem döntöttek, és továbbra is él.

  22. Thomson Reuters v. ROSS Intelligence, No. 1:20-cv-00613-SB (D. Del.), felülvizsgált vélemény 2025. február 11. (Dkt. 770), Bibas J. Közbenső fellebbezésen a Third Circuit előtt (No. 25-2153), 2026. június 11-én tárgyalva, az írás idején eldöntetlen.

  23. Perrigo, B. Exclusive: OpenAI Used Kenyan Workers on Less Than $2 Per Hour to Make ChatGPT Less Toxic. TIME, 2023. január 18. A $2 felső határ azoknál a senior reviewer-eknél, akik minden célt teljesítettek; a junior labellerek, vagyis a többség, $1,32-t vittek haza. A Sama ugyanebben a cikkben idézett cáfolata $1,46–$3,74-et és alacsonyabb kvótát ad meg.

  24. Luccioni, A. S., Viguier, S. and Ligozat, A.-L. Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language Model. arXiv:2211.02001 (2022), JMLR 24(253). 1. és 3. táblázat.

  25. Patterson, D., Gonzalez, J., Le, Q., Liang, C., Munguia, L.-M., Rothchild, D., So, D., Texier, M. and Dean, J. Carbon Emissions and Large Neural Network Training. arXiv:2104.10350 (2021). A GPT-3 számai a 4. táblázatban; a NAS-becslés korrekciója a §4.1-ben.

  26. Strubell, E., Ganesh, A. and McCallum, A. Energy and Policy Considerations for Deep Learning in NLP. arXiv:1906.02243 (2019), ACL 2019. Pontosan azért érdemes olvasni, ami a legtöbbet idézett számával történt: a cikk óvatos, kimondja az extrapolációját, és mégis két nagyságrenddel tévedett abban az egy sorban, amelyet mindenki ismételt.

  27. Smith, S. J., Hubbard, A., Newkirk, A., Ganeshalingam, M., Holecek, B., Sartor, D., Mills, M. and Shehabi, A. United States Data Center Energy Usage Report: 2025 Update. LBNL-2001758 (2026. június 18.). Ez a sokat idézett 2024-es jelentést lefelé módosítja a történeti sorozatra; ha a 2023-as 176 TWh-s számot idézed, a meghaladott kiadást idézed.

  28. Bender, E. M., Gebru, T., McMillan-Major, A. and Shmitchell, S. On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? FAccT '21, pp. 610–623. DOI 10.1145/3442188.3445922. A „documentation debt” a §4.4-ben van. Megjegyzés: a cikk saját karbonadatai Strubell és mtsai.-tól származnak, és öröklik a fenti korrekciót — ami inkább az érv illusztrációja, nem cáfolata.

  29. NVIDIA. NVIDIA H100 Tensor Core GPU termékoldal, nvidia.com/en-us/data-center/h100/ (elérve: 2026-09-06). Az FP64 kivételével az oldal minden tensor-core sora „with sparsity” lábjegyzetet hordoz; az itt használt dense BF16 érték a publikált 1 979 TFLOPS fele.

  30. Lambda. GPU Cloud pricing, lambda.ai/pricing (elérve: 2026-09-06). On-demand, GPU-nként és óránként, adó előtt. Ennek a szakasznak az árai gyorsabban avulnak el, mint bármi más ebben a kurzusban; a körülöttük lévő aritmetika nem.

  31. Karpathy, A. karpathy/llm.c, discussion #481, Reproducing GPT-2 (124M) in llm.c in 90 minutes for $20 (2024. május 28.), és discussion #677, Let's reproduce GPT-2 (1.6B): one 8XH100 node, 24 hours, $672, in llm.c (2024. július 11.).

  32. Karpathy, A. karpathy/nanochat, README és „time to GPT-2” leaderboard (elérve: 2026-09-06). A $48-os szám és a „GPT-2 capability” CORE-score definíciója egyaránt a README-ben van; a repository saját speedrun.sh fájlja „approximately 1.5 hours”-t ír, ezért a kétórás számot kerekítésként kezeld.

  33. Meta. Llama 3.1 model card, models/llama3_1/MODEL_CARD.md in meta-llama/llama-models (elérve: 2026-09-06). A 405 B modell 30,84 M H100-órájának, a 39,3 M összesnek, a 11 390 tCO2eq location-based értéknek és a 2023. decemberi adat cutoffnak a forrása.


Készítette

David Vicente Campos

A NeuraLIA Labs alapítója és a MyRealFood társalapítója

Mérnökinformatikus vagyok, a Leóni Egyetemen végeztem. Társalapítottam a MyRealFoodot, ahol CTO-ként felépítettem azt az alkalmazást, amelyet emberek milliói használtak arra, hogy egészségesebben táplálkozzanak, és megalapítottam a NeuraLIA Labst, ahol AI-termékeket fejlesztek. Itt arról írok, amit menet közben meg kellett értenem, úgy, ahogy szerettem volna, hogy valaki elmagyarázza nekem.

Továbbiak a szerzőről

Közzétette a NeuraLIA Labs.

Kapj új bejegyzéseket a postaládádba

AI-hírek, útmutatók és termékfrissítések — rövid email, amikor valami igazán hasznosat publikálunk.

Kurzusindex

Abstract software decision engine with branching paths, probability nodes, and glowing gates.
jev11 perc olvasás

A Jev AI-modell döntésekre készült, nem prózára

A TypeSafe AI Jev modellje azért kap figyelmet, mert a szoftveres intelligenciát valószínűségi problémaként kezeli: válaszd ki a megfelelő ágat, rendelj hozzá bizalmi szintet, és ne fizess egy LLM-nek szövegírásért, amikor a kódnak döntésre van szüksége.

Abstract agent runtime sorting documents, memory blocks and pointer nodes inside a bounded context frame.
context-engineering11 perc olvasás

Kontextustervezés hosszú távú AI-ügynökökhöz

A hosszú ideig futó ügynökök nem csak azért vallanak kudarcot, mert kicsi az ablak. Akkor hibáznak, amikor a fájlok, eszközkimenetek és elavult előzmények kiszorítják azt a feladatot, amelyet az ügynöknek be kellett volna fejeznie.

Készen állsz, hogy a LIA válasszon helyetted?

Építs az összes AI-modellel egy helyen – kezdd el ma, ingyen.