LLM:n esikoulutus: data, laskenta, scaling laws ja kustannus
20 mallia yhdellä läppärin GPU:lla: scaling law mitattuna ja 6ND-laskenta-arvio tarkistettuna oikealla FLOP-laskurilla.
Tällä sivulla
Luku 9 päättyi transformer-lohkoon, joka oppii. Pinoa niitä muutama, ohjaa luvun 8 next-token loss ulostuloon, eikä mitään tarvitse enää keksiä. Kaikki jäljelle jäävä on ostamista.
Se on suurempi muutos kuin miltä kuulostaa. Jokainen tähänastinen luku kysyi oppiiko se? — kyllä tai ei -kysymys, jonka läppäri ratkaisee kymmenessä minuutissa. Tämä kysyy kysymyksen, jossa on rahaa mukana: kun aritmetiikkaa on kiinteä määrä, mikä on paras malli jonka voin ostaa? Vastaus on kaava, eikä se ollut kenellekään ilmeinen vuonna 2018.
Tässä tuo kysymys vastattuna mittaamalla, yhdellä läppärin GPU:lla. Kaksikymmentä mallia, 98 624 parametrista 15 miljoonaan parametriin, koulutettiin tyhjästä 174 miljoonalla Wikipedia-tokenilla — 2 048-token BPE-sanasto, koulutettu kuten luku 7 sellaisen kouluttaa, luvun 9 transformer. Jokainen ajo sai täsmälleen yhden kolmesta laskentabudjetista eikä operaatiotakaan enempää, joten suurempi malli lukee väistämättä vähemmän tekstiä. Paras hold-out loss kussakin budjetissa:
budget C (FLOPs) best loss reached by a model of
1.00e13 5.3531 98,624 params
3.16e13 4.8638 98,624 params
1.00e14 4.3383 295,808 params
fitted: L = (Cc / C)^0.0913 over one decade of computeKymmenkertainen aritmetiikka leikkaa lossista 19 %, ja kolme pistettä osuvat suoralle log-log-asteikolla. Mikään ensimmäisissä yhdeksässä luvussa ei ennusta tätä. Sen takana ei ole teoreemaa — se on empiirinen säännönmukaisuus, joka pätee eri eksponentilla kymmenen kertaluokan matkalla tästä läppäristä datakeskukseen, ja se on yksittäinen havainto, joka sai kokonaisen toimialan käyttämään pienen maan BKT:n verran rahaa GPU:ihin.
Mitä pretraining on ja mikä siinä on uutta
Linkki osioon: Mitä pretraining on ja mikä siinä on uuttaObjektiivissa ei muutu mikään. Malli ennustaa yhä seuraavan tokenin, loss on yhä luvun 4 cross-entropy sovellettuna luvun 8 faktorisointiin, optimointimenetelmä on yhä luvun 6 AdamW. Pretraining ei ole uusi algoritmi; se on sama algoritmi ajettuna korpuksella, joka on niin suuri, että ajo on budjetoitava. Kaksi asiaa tekee tämän mahdolliseksi: labelit ovat ilmaisia, koska kohdan target on token kohdassa ja on jo tekstissä; ja luvun 6 viimeinen osio poisti vastalauseen, koska malli, jossa on paljon enemmän parametreja kuin klassiset säännöt sallivat, ei hajoa vaan paranee. Lopputuloksena on base model — jokin, joka jatkaa tekstiä sen sijaan että vastaisi.
Laskennan laskeminen ennen rahankäyttöä: 6ND
Linkki osioon: Laskennan laskeminen ennen rahankäyttöä: 6NDEnnen kuin tätä voi budjetoida, se on laskettava, ja ala laskee sen yhdellä kaavalla:
missä on parametrien määrä, training tokens ja floating-point-operaatioiden kokonaismäärä. Kaplan et al. johtavat sen kahdessa vaiheessa.1 Forward: 2 FLOPia per parametri per token, koska jokaista matriisikertolaskun parametria käytetään kerran per token, yhdessä kertolaskussa ja yhdessä yhteenlaskussa. Backward: kaksi kertaa forward, koska luvun 5 backward pass laskee jokaisessa kerroksessa kaksi gradienttia — kerroksen inputeille, jotta signaali jatkaa kulkuaan, ja sen painoille — kumpikin forwardin kokoisena matriisikertolaskuna, joten .
Siinä on koko johtaminen, ja se kannattaa tarkistaa eikä vain uskoa. PyTorchin mukana tulee oikea FLOP-laskuri, torch.utils.flop_counter.FlopCounterMode, joka sieppaa jokaisen operaation, jonka malli lähettää, ja summaa todellisen työn. Aja se neljän kertaluokan yli, suurin meta-laitteella, joka varaa muodot mutta ei muistia:
from torch.utils.flop_counter import FlopCounterMode
counter = FlopCounterMode(display=False)
with counter:
loss = model(x, targets)[1]
loss.backward()
measured = counter.get_total_flops()
print(measured / (6 * n_params * n_tokens))| konfiguraatio | ilman embeddings | yhteensä | mitattu, fwd+bwd | ÷ (yhteensä ) | ÷ (ei emb.) | fwd+bwd ÷ fwd |
|---|---|---|---|---|---|---|
| 128, 4 kerrosta, 256 | 788,736 | 7,254,400 | 4.60e10 | 1.031 | 9.485 | 3.000 |
| 512, 8 kerrosta, 256 | 25,183,232 | 51,045,888 | 3.26e11 | 1.038 | 2.104 | 3.000 |
| 768, 12 kerrosta, 1024 | 84,973,056 | 124,356,864 | 1.75e12 | 1.145 | 1.676 | 3.000 |
| 1600, 48 kerrosta, 1024 | 1,474,870,400 | 1,556,920,000 | 2.10e13 | 1.100 | 1.161 | 3.000 |
| 4096, 32 kerrosta, 2048 | 6,442,983,424 | 6,582,444,032 | 8.74e13 | 1.080 | 1.104 | 3.000 |
| 8192, 80 kerrosta, 8192 | 64,427,147,264 | 65,544,929,280 | 3.75e15 | 1.163 | 1.183 | 3.000 |
Forward+backward suhteessa forwardiin on 3.000, täsmälleen, jokaisessa skaalassa: ei approksimaatio, joka sattuu olemaan hyvä, vaan yllä oleva aritmeettinen identiteetti pyöreänä lukuna laskurilta, joka ei tiedä johtamisesta mitään.
Mitattu kokonaismäärä on sitten 3–17 % yli , kun laskee embedding-matriisit mukaan — ja sillä lisäyksellä on väliä, koska kaksi perustavaa paperia laskevat eri tavalla. Kaplan jättää pois ”all vocabulary and positional embeddings”, koska se ”produces significantly cleaner scaling laws” (§1.3); Chinchillan liite F sanoo ”we also count embeddings matrices in the total parameter count”.2 Laajalla sanastolla ja kapealla hidden dimensionilla ero on yhdeksänkertainen, kuten ensimmäinen rivi näyttää.
Jäljelle jäävä ero on se, minkä tarkoituksella jättää pois: attention-pisteet. Kaplanin yhtälö (2.2) kirjoittaa forward-kustannuksen muodossa ja pudottaa toisen termin, koska — turvallista vuonna 2020, vähemmän turvallista nyt, ja syy siihen miksi suhde valuu ylöspäin kun kasvaa — minkä vuoksi kahdella rivillä tässä on sama eli 1 024 ja suhde laskee, 1.145:stä 1.100:aan, kun kasvaa 768:sta 1 600:aan. Se on -kustannus, jonka luku 9 esitteli ja jonka luku 16 muuttaa hinnaksi.
Muisti: minkä oikeasti täytyy mahtua
Linkki osioon: Muisti: minkä oikeasti täytyy mahtuaCompute ratkaisee, kuinka kauan ajo kestää; muisti ratkaisee, voiko se alkaa. Kouluta tavallisella fp32 AdamW:llä, ja jokaiseen parametriin liittyy neljä lukua: paino, sen gradientti sekä Adamin juokseva keskiarvo ja varianssi — ne kaksi keskiarvoa, jotka rakennettiin käsin luvussa 6. Neljä lukua neljän tavun kokoisina on 16 tavua per parametri, ennen ensimmäistäkään activationia. Mitattuna 8 GB:n läppäri-GPU:lla, resident-varaus siinä stepin kohdassa, jossa graafia ei ole elossa:
| malli | sanasto | batch | ennustettu | resident mitattu | huippu stepissä | ero | |
|---|---|---|---|---|---|---|---|
| 512, 8 kerrosta | 50,257 | 8 | 51,045,888 | 779 MB | 801 MB | 2,500 MB | 1,699 MB |
| 512, 8 kerrosta | 4,096 | 8 | 27,411,456 | 418 MB | 426 MB | 1,043 MB | 617 MB |
| 256, 6 kerrosta | 4,096 | 8 | 5,839,360 | 89 MB | 89 MB | 382 MB | 293 MB |
| 256, 6 kerrosta | 4,096 | 32 | 5,839,360 | 89 MB | 89 MB | 1,259 MB | 1,170 MB |
| 256, 6 kerrosta | 4,096 | 128 | 5,839,360 | 89 MB | 89 MB | 4,771 MB | 4,681 MB |
Ennuste ja mittaus ovat 3 %:n sisällä toisistaan. Yllätys on viimeinen sarake: activationit peittävät mallin alleen. Sama 5,8 miljoonan parametrin malli, joka tarvitsee 89 MB pysyvää tilaa, tarvitsee 4 681 MB activationeja batchilla 128 — viisikymmentäkaksi kertaa mallin verran — eikä suuri osa siitä ole transformer lainkaan. Se on logits, yksi sanaston kokoinen vektori per token neljän tavun alkioilla: viimeisellä rivillä 512 MB, ensimmäisellä 393 MB. Sanaston koko valittiin luvussa 7, ja se päättää yhä, mikä mahtuu kortille.
Se, mikä termi dominoi, riippuu ajon muodosta, minkä vuoksi Micikevicius et al. sanovat muistin olevan ”dominated by activations”3, kun taas ZeRO sanoo 1,5 miljardin parametrin mallin tarvitsevan ”at least 24 GB” pelkkiin model states -tiloihin.4 ZeRO päätyy samoihin 16 tavuun toista reittiä — fp16-painoille, fp16-gradienttien, kullekin fp32 master weights -kopiolle ja Adamin kahdelle momentille — mikä 70 miljardilla parametrilla on 1,12 teratavua, neljäntoista 80 GB:n GPU:n verran ennen ensimmäistäkään activationia.
Parallelism yhdessä kappaleessa ja yhdellä delegoinnilla
Linkki osioon: Parallelism yhdessä kappaleessa ja yhdellä delegoinnillaMikään tästä ei mahdu yhdelle laitteelle frontier-skaalassa, joten ajo jaetaan neljällä tavalla yhtä aikaa. Data parallelism laittaa mallin kopion jokaiselle GPU:lle ja keskiarvoistaa gradientit — oletusratkaisu, jota ZeRO parantaa kieltäytymällä pitämästä ylimääräisiä kopioita optimiser-tilasta. Tensor parallelism jakaa yksittäiset matriisit laitteiden kesken. Pipeline parallelism antaa jokaiselle laitteelle yhtenäisen ryhmän kerroksia. Context parallelism jakaa itse sekvenssin, tarpeellinen vasta kun on tarpeeksi pitkä, jotta attention-termi dominoi. Llama 3:n taulukko 4 luettelee kaikki neljä yhtä aikaa: tensor 8, context enintään 16, pipeline 16, data enintään 128, yhteensä 16 384 H100-GPU:lla.5 Tämä kurssi ei sano siitä enempää; hajautetun koulutuksen engineering on oma lukukautensa, ja Stanfordin CS336 on se lukukausi, luennot 5–8, koodin kanssa.6 Delegoinnista jää jäljelle yksi luku, model FLOPs utilisation — osuus GPU:n huippuaritmetiikasta, jonka oikea ajo saavuttaa — joka muuttaa siistin :n seinäkellon ajaksi ja siten rahaksi.
Kaplan ja veto, jonka ala löi
Linkki osioon: Kaplan ja veto, jonka ala löiTammikuussa 2020 Kaplan et al. kouluttivat ruudukon transformereita ja havaitsivat, että test loss noudattaa power law -lakia kullekin kolmesta resurssista yli kuuden kertaluokan alueella.1 Heidän §1.2 antaa kolme sovitettua lakia:
kumppaneinaan datalle ja optimaalisesti allokoidulle computelle. Vakiot eivät ole universaaleja, ja paperi sanoo sen: ”the precise numerical values of , and depend on the vocabulary size and tokenization and hence do not have a fundamental meaning.”
Eksponentit ovat pieniä: kymmenkertaiset parametrit ostavat jäljellä olevasta lossista pois kertoimen . Se kuulostaa olemattomalta, ja se on tämän tärkein fakta — tuotot ovat surkeita eivätkä ne koskaan lopu. Power law pienellä eksponentilla lupaa, että seuraava kertaluokka auttaa, vähemmän kuin edellinen, ikuisesti. Computen ostaminen lakkaa olemasta uhkapeli ja muuttuu ostokseksi, jolla on julkaistu vaihtokurssi, mikä on täsmälleen se argumentti, joka avasi pääoman.
Sitten tuli ohjeistus, ja tässä paperi oli väärässä tavalla, joka maksoi alalle paljon rahaa. Kaplanin taulukko 6 antaa ja : kymmenkertainen compute tarkoittaa 5,4 kertaa suurempaa mallia, jolle syötetään vain 1,9 kertaa enemmän tekstiä. Abstrakti on suora — ”optimally compute-efficient training involves training very large models on a relatively modest amount of data and stopping significantly before convergence.” Ala teki täsmälleen näin: GPT-3 on 175 miljardia parametria 300 miljardilla tokenilla,7 Gopher 280 miljardia 300 miljardilla, Megatron-Turing NLG 530 miljardia 270 miljardilla.2 Puolesta tokenista kahteen tokeniin per parametri, kautta linjan.
Chinchilla ja mitä yllä oleva sweep mittasi
Linkki osioon: Chinchilla ja mitä yllä oleva sweep mittasiMaaliskuussa 2022 Hoffmann et al. kouluttivat yli 400 mallia 70 miljoonasta 16 miljardiin parametriin ja päätyivät päinvastaiseen johtopäätökseen kolmella riippumattomalla tavalla.2 Heidän taulukkonsa 2 raportoi eksponentin yhtälössä arvoina 0.50, 0.49 ja 0.46, Kaplanin 0.73:aa vastaan. Selkokielellä: mallin koon ja training datan tulisi kasvaa samassa suhteessa.
Heidän toinen lähestymistapansa on se, jonka tämän luvun alun sweep toisti miljoonasosassa mittakaavasta: kiinnitä budjetti, kouluta monta kokoa täsmälleen sillä budjetilla, piirrä lopullinen loss mallin kokoa vasten.
| parametrit | |||
|---|---|---|---|
| 98,624 | 5.3531 (171) | 4.8638 (542) | — |
| 150,320 | 5.4636 (74) | — | — |
| 194,208 | 5.5041 (44) | 4.8730 (140) | 4.4040 (442) |
| 295,808 | 5.5550 (19) | 4.9029 (60) | 4.3383 (190) |
| 665,280 | 5.7849 (3.8) | 5.1254 (12) | 4.4192 (38) |
| 1,280,768 | 5.8174 (1.0) | 5.1751 (3.2) | 4.5003 (10) |
| 3,101,568 | — | 5.4686 (0.5) | 4.7768 (1.7) |
| 5,315,072 | — | 5.5894 (0.2) | 4.8514 (0.6) |
| 15,053,568 | — | — | 5.3534 (0.1) |
Hold-out loss nat-yksiköissä per token, tokens per parametri suluissa, lihavointi kunkin budjetin parhaalle mallille; viiva on piste, jota ei ajettu, koska budjetti vaati enemmän tekstiä kuin korpuksessa on tai koko jäi kyseisen sweepin ulkopuolelle.
Lue saraketta alas: loss laskee, osuu pohjaan ja nousee taas. Malli voi olla budjetilleen liian suuri täsmälleen yhtä helposti kuin liian pieni — kohdassa rangaistus 665 280 parametrin valinnasta 295 808:n sijaan on 0,08 natia, mikä yllä sovitetulla käyrällä on loss, jonka oikein mitoitettu malli saavuttaa 18 % pienemmällä computella. Väärän muodon valinta heittää pois viidesosan budjetista. Se on Chinchillan kuva 3 iltapäivässä yhdellä GPU:lla neljänsadan mallin sijaan.
Lue nyt poikittain. Kohdassa paras malli on pienin sweepattu; kohdassa se on 295 808 parametria, molemmin puolin haarukoituna. Optimi liikkuu oikealle budjetin kasvaessa, mikä on koko korjauksen sisältö. Sovita paperin kolmas lähestymistapa — pinta kaikkien ajojen yli — ja minimoi ehdolla :
L(N, D) = 24.7 / N^0.195 + 46.8 / D^0.169 (E fits to ~0; see below)
implied N_opt ∝ C^0.464
compare Chinchilla 0.46-0.50 · Besiroglu 0.513 · Kaplan 0.730.46, läppäriltä, Kaplanin 0.73:aa vastaan. Kolmen numeron yhteensopivuus kolmen budjetin sovituksesta on tuuria; ensimmäisen numeron yhteensopivuus ei ole. Eksponentti kulkee mukana — vakio ei, koska token-per-parametri-suhde näissä optimeissa on 170–540, ei 20. Kolme syytä, kaikki opettavaisia. sovittuu nollaan, koska yli 4 natin lossissa ajo ei ole lähelläkään entropialattiaa, joka dominoi Chinchillan sovitetta. Batch size ja learning rate pidettiin kiinteinä eikä viritetty jokaiselle pisteelle, mikä haittaa ajoja, jotka saavat vähiten steppejä — ja ne ovat suuret mallit: kohdassa FLOPs 1,28 miljoonan parametrin malli saa yhteensä 159 optimiser-stepiä, kaukana alle niiden muutaman tuhannen, jotka Kaplanin -termi sanoo minkä tahansa mallin tarvitsevan. Scaling law sovitetaan yhden regiimin sisällä, ja tämä on kuusi kertaluokkaa Chinchillan alapuolella.
Siksi paperin abstrakti: ”current large language models are significantly undertrained”. Chinchilla on demonstraatio — 70 miljardia parametria 1,4 biljoonalla tokenilla, sama kokonaiscompute kuin Gopherin 280 miljardia 300 miljardilla, ja parempi 51:ssä 57 MMLU-tehtävästä, 67,5 % vastaan 60 %.2 Neljä kertaa pienempi, neljä ja puoli kertaa enemmän tekstiä, sama raha, parempi malli.
Kaksi varausta tuohon kuuluisaan suhteeseen. ”Kaksikymmentä tokenia per parametri” ei ole lause paperissa, joka sanoo vain, että ”for every doubling of model size the number of training tokens should also be doubled”; 20 on päätelmä taulukosta 3 ja Chinchillan omasta 70 B:stä 1,4 T:llä. Ja sen tarkkuus on huonompi kuin julkaistu: Besiroglu et al. sovittivat uudelleen kuvan 4 digitoinnista, havaitsivat alkuperäisten parametrien ”fit the reconstructed data poorly” ja intervallien olevan ”implausibly tight given the number of data points”, ja asettivat rehellisen haarukan välille ”between 4 and 40” tokenia per parametri.8
Yksi Chinchillan menetelmän yksityiskohta lunastaa lupauksen, jonka luku 1 teki learning-rate scheduleista. Cosine schedule on sovitettava token-budjettiin. Mallin, joka näkee 10 miljoonaa tokenia, on laskettava learning rate nollaan 10 miljoonan tokenin kohdalla; anna sille 100 miljoonalle mitoitettu schedule, pysäytä se aikaisin, ja luet lossia kesken laskun aivan liian suurella rate-arvolla. Chinchilla kouluttaa jokaisen mallin neljällä cycle lengthillä juuri tämän kontrolloimiseksi; yllä oleva sweep asettaa schedulensa budjetista samasta syystä.
Mitä scaling laws eivät lupaa
Linkki osioon: Mitä scaling laws eivät lupaaNe ovat alan hyödyllisin empiirinen tulos, ja niitä ylimyydään jatkuvasti. Neljä rajaa.
Ne ennustavat lossia, eivät capabilityä. Vasemmalla puolella on cross-entropy hold-out-tekstillä. Mikään näissä papereissa ei oikeuta väitettä siitä, kirjoittaako malli oikein SQL:ää, kieltäytyykö se haitallisesta pyynnöstä tai käyttääkö se työkalua. Tämä on taas luvun 5 oppi: lossin ennuste ei ole ennuste käytöksestä, josta maksat.
Ne sovitetaan, niitä ei johdeta. Mikään teoria ei tuota . Vakiot liikkuvat tokenizerin mukana — siksi perplexity-vertailu kahden tokenizerin välillä on merkityksetön, kuten luku 8 selitti — sekä data mixin, arkkitehtuurin ja optimointimenetelmän mukana. Jokainen julkaistu laki on laki siitä asetelmasta, joka sen tuotti, minkä vuoksi Meta sovitti omansa uudelleen ennen Llama 3:a.5
Ne olettavat tuoreen tokenin jokaiselle stepille, mikä olettaa hiljaa äärettömän korpuksen. Muennighoff et al. mittasivat, mitä tapahtuu kun se loppuu: jopa neljä epochia toistettua dataa maksaa lähes mitään — 8,7 miljardin parametrin malli 44 miljardilla uniikilla tokenilla nähtynä neljä kertaa päätyi ”only 0.5 % higher validation loss” kuin sama malli 178 miljardilla uniikilla — kun taas noin kuudentoista epochin jälkeen lisäcompute ei osta mitään.9
Eikä kukaan enää kouluta compute-optimaalisesti. Chinchilla minimoi koulutuksen kustannuksen; tuotantoon viety malli maksaa sen jälkeen suunnilleen FLOPs per generoitu token, ikuisesti. LLaMA 1 sanoi sen suoraan: ”given a target level of performance, the preferred model is not the fastest to train but the fastest at inference”.10 Sardana et al. formalisoivat sen minimoimalla sen sijaan , ja havaitsivat, että miljardin pyynnön odottajan kannattaa kouluttaa ”smaller and longer than Chinchilla-optimal”.11 Llama 3:n §9.1 on samaa mieltä: sen pienet mallit koulutetaan ”far beyond the point of compute optimal training, effectively trading training compute for inference efficiency”.5 Suhde ei ole vanhentunut; se vastaa kysymykseen, joka ei enää ole se jota kysytään.
Emergent abilities ja kiista siitä, ovatko ne todellisia
Linkki osioon: Emergent abilities ja kiista siitä, ovatko ne todellisiaLoss laskee tasaisesti. Benchmark-pisteet eivät aina. Wei et al. keräsivät tapauksia, joissa tehtävä pysyy sattuman tasolla useiden training compute -kertaluokkien yli ja sitten hyppää — kolminumeroinen aritmetiikka ilmestyy GPT-3:ssa noin FLOPs kohdalla, MMLU nousee arvailun yläpuolelle :n ja välillä — ja nimesivät kuvion: ”an ability is emergent if it is not present in smaller models but is present in larger models”.12 Jos se on todellinen ominaisuus, halvoista kokeista ekstrapolointi on vaarallista, koska capability, jonka ostat, ei ehkä ole olemassa missään skaalassa, jota pystyt testaamaan.
Schaeffer, Miranda ja Koyejo väittivät, että suurin osa siitä on mittauksen artefakti, ja mekanismi on aritmeettinen.13 Per-token loss laskee tasaisesti, joten todennäköisyys, että yksi token on oikein, , paranee vähitellen. Pisteytä malli exact string match -mittarilla -token-vastaukselle ja korotat tuon todennäköisyyden potenssiin — sileä käyrä suureen potenssiin korotettuna näyttää jyrkänteeltä. Vaihda mittariin, joka laskee tokenit sen sijaan että vaatisi kaikkien onnistuvan, samoilla ulostuloilla, ja ”the family's performance smoothly, continuously and predictably improves with increasing scale”.
Heidän auditointinsa on muistettava luku — ”of the 39 preferred metrics in BIG-Bench, at most 5 display emergence”, ja kaksi epäjatkuvaa mittaria selittää yli 92 % väitetyistä tapauksista — samoin heidän varoituksensa: ”nothing in this paper should be interpreted as claiming that large language models cannot display emergent abilities”. Hyppy kaaviossa on todistusaineistoa mittarista, kunnes toisin osoitetaan. Luku 29 on se kohta, jossa tästä tulee sinun ongelmasi, koska kovakatkaisevan mittarin valinta on päätös, jonka teet huomaamatta.
Mistä data tulee
Linkki osioon: Mistä data tuleeKorpus on pretraining-ajon osa, johon ei liity yhtälöä, ja jossa suurin osa seurauksellisista päätöksistä asuu. Raaka-aine on web crawl: Common Crawlin elokuun 2026 arkistossa on ”2.14 billion web pages or 360 TiB of uncompressed content”, yhden kuukauden verran, ladattavissa ilmaiseksi.14 Lähes mikään siitä ei kelpaa sellaisenaan. T5-paperi sanoo crawlin ”largely comprises gibberish or boiler-plate text like menus, error messages, or duplicate text”, ja sen esittelemä C4-pipeline on lista karkeita heuristiikkoja — pidä vain rivit, jotka päättyvät lopetusvälimerkkiin, pudota sivut joissa on alle kolme virkettä, pudota jokainen sivu jossa on aaltosulje tai sana julkiselta kirosanalistalta — muuttaen kaksikymmentä teratavua kuukausittaista tekstiä noin 750 GB:ksi.15
Karkea on oikea sana. Dodge et al. auditoivat, mitä nuo suodattimet poistavat, ja havaitsivat, että kirosanojen estolista poistaa 42 % African-American English -dokumenteista ja 32 % Hispanic-aligned English -dokumenteista, verrattuna 6,2 %:iin White-aligned English -dokumenteista, jättäen korpuksen, josta 97,8 % on viimeistä luokkaa.16 Säännöllä, jolla ei ollut mielipidettä murteesta, oli sellainen.
Sitten deduplication, joka ei ole siivousta: Lee et al. löysivät C4:stä 61-sanaisen virkkeen toistettuna 61 036 kertaa ja osoittivat, että deduplication leikkaa nopeuden, jolla mallit ”emit memorized text”, kymmenesosaan, 1,9 %:sta generoiduista tokeneista 0,19 %:iin.17 Enemmän ei silti ole parempi — FineWebin tiimi deduplikoi globaalisti 96 crawlin yli, sai 4 biljoonaa tokenia eikä mitattavaa hyötyä, sitten deduplikoi jokaisen crawlin erikseen, sai 20 biljoonaa ja vastasi parasta olemassa olevaa korpusta.18
Sitten contamination. Llama 3 mittasi omansa ja julkaisi sen: 98 % AGIEvalista, 95 % BIG-Bench Hardista ja 85 % HellaSwagista overlapasi training setin kanssa 8-grammeina, ja MMLU:n osalta overlap oli niin korkea, että ”it is impossible to get a good performance gain estimate”.5 GPT-3:n §4 raportoi suodatusbugin, joka jätti benchmarkit dataan ilman paluuta: ”because of cost considerations it was infeasible to retrain the model”.7
Provenance on ratkaisematon osa. The Pilen mukana tuli 100,96 GiB:n komponentti nimeltä Books3 — 12 % korpuksesta ja paperin oman suostumustaulukon mukaan kirjoja yksityiseltä torrent-trackerilta;19 se poistettiin verkosta elokuussa 2023 tekijänoikeusvalituksen jälkeen. Oikeudellinen tilanne syyskuussa 2026 on auki, ja kolme trendinä siteerattua yhdysvaltalaista ratkaisua ovat keskenään eri mieltä. Alsup katsoi laillisesti hankituilla kirjoilla kouluttamisen olevan ”exceedingly transformative” samalla kun piti piratoiduista kopioista rakennettua kirjastoa ei-sallittuna, ja Anthropic sovitteli tuon puolikkaan $1,5 miljardilla, joka kattaa 482 460 teosta, noin $3 000 kappaleelta, hyväksytty 20. heinäkuuta 2026.20 Chhabria myönsi Metalle summary judgment -ratkaisun kirjoittaen samalla, että hänen ratkaisunsa ”does not stand for the proposition that Meta's use of copyrighted materials to train its language models is lawful”, vaan ainoastaan että ”these plaintiffs made the wrong arguments”.21 Bibas, ratkaistessaan Ross Intelligenceä vastaan, huomautti, että ”only non-generative AI is before me today”.22 Yksikään Yhdysvaltain vetoomustuomioistuin ei ole ratkaissut kysymystä.
Ihmiset tekevät ne osat, joita loss ei voi tehdä. TIME raportoi tammikuussa 2023, että työntekijät, jotka labeloivat toksista tekstiä OpenAI:lle Sama-yhtiön kautta, saivat käteen ”between around $1.32 and $2 per hour” lukiessaan kohtia, jotka kuvasivat lasten seksuaalista hyväksikäyttöä, kidutusta ja itsensä vahingoittamista, kun OpenAI maksoi Samalle työstä $12.50 tunnilta; Sama kiistää sekä palkkahaarukan että kiintiön.23 Se on pretrainingin ympärillä olevaa suodatusta eikä pretraining itse — mutta se on samalla laskulla, ja siinä kohdassa istuu ihminen.
Sähkö on todellista ja yleensä väärin siteerattua. Huolellisin julkaistu luku on BLOOMin: 1 082 990 GPU-tuntia, 433 MWh ja 24,7 tonnia CO₂-ekvivalenttia ajolle, 50,5 kun valmistus ja idle-solmut lasketaan mukaan;24 Patterson et al. arvioivat GPT-3:lle 1 287 MWh ja 552 tonnia.25 Kaksi varoitusta. BLOOMin etu on Ranskan ydinvoimavaltainen verkko, 57 g CO₂ per kWh, ei tehokkuus — se käytti enemmän energiaa kuin OPT-175B. Ja alan eniten siteerattu päästöluku, Strubell et al.:n 626 155 lb neural architecture searchille, osoitettiin myöhemmin 88 kertaa liian suureksi, koska oli oletettu haun ajaneen täyden mallin koossa, vaikka se ajettiin proxylla.26 LBNL:n kehystys on puolustettava: Yhdysvaltain datakeskukset käyttivät 192 TWh vuonna 2024, 4,7 % maan sähköstä — luku, joka kuuluu toimialalle, ei yhdellekään ajolle.27
Punainen lanka on se, minkä Bender et al. nimesivät documentation debtiksi: ”putting ourselves in a situation where the datasets are both undocumented and too large to document post hoc”.28 Jokainen yllä oleva fakta on olemassa, koska joku katsoi. Niiden korpusten kohdalla, joiden takana ovat useimpien käyttämät mallit, kukaan ei voi.
Mitä se oikeasti maksaa
Linkki osioon: Mitä se oikeasti maksaaNyt aritmetiikka, jonka kaikki haluavat, neljästä siteeratusta inputista, jotta niiden vanhentuessa on selvää, mikä pitää vaihtaa.
Huippuläpimeno
Linkki osioon: HuippuläpimenoNVIDIAn H100-sivu listaa 1 979 teraFLOPS BF16 tensor-core -läpimenoa alaviitteellä ”with sparsity”.29 Yksikään pretraining-ajo ei käytä structured sparsityä, joten dense-luku on puolet siitä: 989,5 TFLOP/s.
Utilisation
Linkki osioon: UtilisationLlama 3:n taulukko 4 raportoi 38–43 % BF16 model FLOPs utilisationin. Käytä 40 %: 395,8 TFLOP/s hyödyllistä aritmetiikkaa per GPU.5
Hinta
Linkki osioon: HintaLambdan on-demand-hinta 8×H100 SXM -solmulle, haettu 2026-09-06: $3.99 per GPU-tunti, eli $31.92 tunnilta solmulle.30
Muoto
Linkki osioon: MuotoChinchillan suhde, , antaa ja siksi .
| budjetti | H100-tunnit | FLOPs | compute-optimaaliset parametrit | tokens | yhdellä 8×H100-solmulla | GPU:t 90 päivässä valmistumiseen |
|---|---|---|---|---|---|---|
| $100 | 25 | 3.6e19 | 546 M | 10.9 B | 3.1 h | 1 |
| $1,000 | 251 | 3.6e20 | 1.73 B | 34.5 B | 31.3 h | 1 |
| $10,000 | 2,506 | 3.6e21 | 5.46 B | 109 B | 13 päivää | 2 |
| $100,000 | 25,063 | 3.6e22 | 17.3 B | 345 B | 131 päivää | 12 |
| $1,000,000 | 250,627 | 3.6e23 | 54.6 B | 1.09 T | 4 vuotta | 116 |
| $10,000,000 | 2,506,266 | 3.6e24 | 173 B | 3.45 T | 36 vuotta | 1,160 |
| $100,000,000 | 25,062,657 | 3.6e25 | 546 B | 10.9 T | 358 vuotta | 11,603 |
Lue kaksi viimeistä saraketta yhdessä. $10 000:lla saat 5 miljardin parametrin mallin yhdellä vuokratulla solmulla kahdessa viikossa. $100 000 000:n kohdalla aritmetiikka sanoo 546 miljardia parametria — ja kaksitoista tuhatta H100:aa kytkettynä yhteen kolmeksi kuukaudeksi, mikä ei ole asia, jonka vuokraat luottokortilla. Noin $100 000:n jälkeen sitova rajoite lakkaa olemasta raha ja muuttuu klusteriksi.
Ennen kuin luotat tällaiseen taulukkoon, testaa sitä ajoja vasten, joiden todellinen kustannus on julkaistu — llm.c toistaa GPT-2 124M:n ”~90 minutes” 8×A100-solmulla ”for about $20”, ja GPT-2 1.6B:n 24 tunnissa 8×H100-solmulla hintaan $672.31
$672, against what $672 actually bought (llm.c GPT-2 1.6B, one 8xH100 node, 24 h)
this table predicts: 168 H100-hours N = 1.41 B params D = 28.3 B tokens
what was actually run: 192 H100-hours N = 1.558 B params D = 33.6 B tokens
Llama 3 405B, against Meta's own published GPU-hours
from the paper's 3.8e25 FLOPs at 40 % MFU: 26.67 M H100-hours
published in Meta's Llama 3.1 model card: 30.84 M H100-hours ratio 0.86Molemmat noin 15 %:n sisällä, mikä on suunnilleen se tarkkuus, jonka tällainen arvio ansaitsee, ja huomattavasti parempi kuin tarkkuus, jolla sitä yleensä siteerataan.
Otsikkovertailu, molemmat määritelmät pöydällä
Linkki osioon: Otsikkovertailu, molemmat määritelmät pöydälläTämän aiheen toistetuin luku on, että GPT-2-luokan malli, joka maksoi noin $43 000 vuonna 2019, voidaan toistaa nykyään muutamalla kymmenellä dollarilla. Moderni puolisko on hyvin dokumentoitu; historiallinen puolisko ei ole.
Nykyään. Karpathyn nanochat README: ”you can train your own GPT-2 capability LLM ... for only $48 (~2 hours of 8XH100 GPU node) ... On a spot instance, the total cost can be closer to ~$15.”32 ”GPT-2 capability” tässä on täsmällinen ja julkaistu — GPT-2:n CORE-pistemäärän 0.256525 voittaminen — leaderboardilla, jonka paras merkintä 14. maaliskuuta 2026 oli 1,65 tuntia. $48 olettaa $3 per GPU-tunti, alle Lambdan listahinnan $3.99; listahinnalla se on lähempänä $64.
Vuonna 2019. Ensisijaista lähdettä ei ole: OpenAI ei koskaan julkaissut kestoa eikä kustannusta. Ketju kulkee The Registerin kautta, helmikuu 2019, joka raportoi ”256 Google TPU3 cores” ilman hintaa ja kestoa; sitten Synced, kesäkuu 2019, huomauttaa että laitteisto maksoi $256 tunnilta Google Cloudissa ja sanoo eksplisiittisesti, että ”OpenAI didn't specify the training duration”. $43 008 on $256 tunnilta kertaa oletettu 168 tuntia, jota kukaan ei ole koskaan lähteistänyt.
Rehellinen otsikko on siis: malli, joka vastaa GPT-2:n julkaistua benchmark-pistemäärää, voidaan kouluttaa nykyään reilusti alle $100:lla vuokratulla laitteistolla, verrattuna vuoden 2019 kustannukseen, jota ei koskaan julkaistu ja jonka kuuluisa arvio lepää lähteistämättömällä arvauksella kestosta. Romahdus on todellinen, ja moderni puolisko on kenen tahansa luottokortillisen toistettavissa; suhde on aritmetiikkaa luvulla, jota ei ole olemassa. Tämä on julkaistujen koulutuskustannusten tila yleisesti. GPT-3-paperissa ei ole lainkaan dollarimäärää, vain FLOPs taulukossa D.1;7 Llama 3 -paperissa ei ole sellaista myöskään.5 Jokainen lukemasi koulutuskustannus on arvio FLOP-määrästä, laitteisto-oletuksesta ja hinta-oletuksesta — aina kannattaa kysyä, kenen.
Mitä base model tietää ja milloin se lakkasi tietämästä
Linkki osioon: Mitä base model tietää ja milloin se lakkasi tietämästäUlos tulee malli, joka on nähnyt kiinteän korpuksen koottuna kiinteänä hetkenä, ja siitä seuraa kaksi ominaisuutta.
Ensimmäinen on knowledge cutoff. Keräyspäivän jälkeen malli ei tiedä mitään — ei ”on epävarma”, vaan ei mitään — ja se sepittää sujuvasti sen sijaan että sanoisi niin, koska sen sanominen ei koskaan ollut käytös, johon sitä koulutettiin. Llama 3.1:n model card antaa joulukuun 2023;33 jokaisella mallilla on sellainen, ja se on training datan ominaisuus, ei käyttöönoton. Sen kiertäminen on retrieval-ongelma, joka on luku 19.
Toinen on, että base model täydentää eikä vastaa. Anna sille ”Mikä on Ranskan pääkaupunki?” ja uskottava jatko on toinen kysymys, koska korpuksessa tuo merkkijono esiintyy useimmiten harjoituslistassa.
Minne tästä mennään seuraavaksi
Linkki osioon: Minne tästä mennään seuraavaksiTekstin täydentäjä ei ole assistant. Se ei noudata ohjeita, koska mikään korpuksessa ei kertonut sille, että pyyntö pitäisi totella eikä jatkaa. Sillä ei ole käsitystä kahden osallistujan keskustelusta. Se tuottaa mielellään haitallisen promptin todennäköisimmän jatkon, koska todennäköinen on ainoa asia, jota varten se koskaan optimoitiin.
Sen muuttaminen joksikin, joka vastaa, vaatii toisen vaiheen, joka maksaa murto-osan ensimmäisestä prosentista ja koostuu lähes kokonaan esimerkkien näyttämisestä haluamastasi käytöksestä ja sitten sen omien ulostulojen parien vertailusta. Siinä vaiheessa syntyvät instruction following, chat templates, refusals ja — tämä yllättää ihmiset — kyky kutsua työkalua. Luku 11 on tuo vaihe: supervised fine-tuning, RLHF, DPO ja GRPO, sekä kysymys siitä, mitä ”aligned” tarkoittaa ja kuka päättää.
Lähteet ja menetelmä
Linkki osioon: Lähteet ja menetelmäTämän luvun rinnalla kannattaa lukea myös Karpathyn build-nanogpt ja siihen kuuluva video, jotka käyvät kokonaisen GPT-2-toiston läpi alusta loppuun tahdissa, johon tämä luku ei pysty; sekä Stanford CS324, Large Language Models, jonka datan ja ympäristövaikutusten luennot menevät syvemmälle materiaaliin, jota tämä kurssi käsittelee kerran ja delegoi.
Viitteet
Linkki osioon: Viitteet-
Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J. and Amodei, D. Scaling Laws for Neural Language Models. arXiv:2001.08361 (2020). Kolme power law -lakia ovat yhtälöt (1.1)–(1.3) §1.2:ssa ja täydet vakiot liitteessä A, taulukko 5; -johtaminen on §2.1; compute-allokoinnin eksponentit ovat taulukossa 6. Huomaa, että compute-lakeja on kaksi, kiinteällä batch size -arvolla ja optimaalisella batch size -arvolla; paperi sanoo, että jälkimmäistä ”should be used to make predictions”. ↩ ↩2
-
Hoffmann, J., Borgeaud, S., Mensch, A., Buchatskaya, E., Cai, T., Rutherford, E. et al. Training Compute-Optimal Large Language Models. arXiv:2203.15556 (2022). Eksponentit taulukossa 2, projisoidut budjetit taulukossa 3, Gopher-vertailu §4:ssä, parametrien laskentakäytäntö liitteessä F. Taulukon 3 alla oleva proosa on ristiriidassa itse taulukon 3 kanssa 175 B:n ja 280 B:n riveillä; taulukko on se versio, jota kannattaa siteerata. ↩ ↩2 ↩3 ↩4
-
Micikevicius, P., Narang, S., Alben, J., Diamos, G., Elsen, E., Garcia, D. et al. Mixed Precision Training. arXiv:1710.03740 (2017), ICLR 2018. FP32 master weights §3.1:ssä, loss scaling §3.2:ssa. ↩ ↩2
-
Rajbhandari, S., Rajbhandari, S., Ruwase, O. and He, Y. ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054 (2019), SC20. -kirjanpito on §3.1:ssä; activations-osuuden residual-state-luvut ovat §3.2:ssa. ↩
-
Grattafiori, A. et al. (Llama Team, AI @ Meta). The Llama 3 Herd of Models. arXiv:2407.21783 (2024). Compute budget ja token-määrä §1:ssä, uudelleen sovitettu scaling law §3.2.1:ssä, parallelism-konfiguraatio ja MFU taulukossa 4, contamination-analyysi §5.1.4:ssä, over-training-lausunto §9.1:ssä. Paperissa ei ole dollarilukuja eikä päästötaulukkoa. ↩ ↩2 ↩3 ↩4 ↩5 ↩6
-
Stanford CS336, Language Modeling from Scratch. Luento 2 käsittelee resource accountingia, luennot 5–8 GPU:ita, kerneleitä ja parallelismia, luennot 9 ja 11 scalingia, luennot 13–14 dataa. Se on kurssi, jolle tämä luku delegoi engineeringin, ja se on julkinen. ↩
-
Brown, T. B. et al. Language Models are Few-Shot Learners. arXiv:2005.14165 (2020). Compute liitteessä D, taulukko D.1 — jossa on sarake kirjaimellisesti otsikolla ”flops per param per token”, jonka arvo jokaisella GPT-3-rivillä on 6. Contamination-analyysi §4:ssä. ↩ ↩2 ↩3
-
Besiroglu, T., Erdil, E., Barnett, M. and You, J. Chinchilla Scaling: A replication attempt. arXiv:2404.10102 (2024). Rekonstruoi Chinchillan datan digitoimalla sen kuvan 4, sovittaa uudelleen ja raportoi korjatut eksponentit sekä paljon leveämmät intervallit. ↩
-
Muennighoff, N., Rush, A. M., Barak, B., Le Scao, T., Piktus, A., Tazi, N., Pyysalo, S., Wolf, T. and Raffel, C. Scaling Data-Constrained Language Models. arXiv:2305.16264 (2023), NeurIPS 2023. Neljän epochin tulos on §6:ssa; kuudentoista epochin puoliintumisaika on sovitettu . ↩
-
Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T. et al. LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 (2023). §1 esittää inference-kustannusargumentin Chinchilla-optimaalista koulutusta vastaan. ↩
-
Sardana, N., Portes, J., Doubov, S. and Frankle, J. Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws. arXiv:2401.00448 (2023), ICML 2024. Heidän §5 sisältää myös vastapainon: äärimmäisillä token-suhteilla koulutetut mallit paranevat edelleen, mutta ”more slowly than scaling laws predict”. ↩
-
Wei, J., Tay, Y., Bommasani, R., Raffel, C., Zoph, B., Borgeaud, S. et al. Emergent Abilities of Large Language Models. arXiv:2206.07682 (2022), TMLR. Määritelmä §2:ssa, esimerkit ja compute-kynnykset §3–4:ssä ja taulukossa 1. ↩
-
Schaeffer, R., Miranda, B. and Koyejo, S. Are Emergent Abilities of Large Language Models a Mirage? arXiv:2304.15004 (2023), NeurIPS 2023 outstanding paper. Mittariargumentti on §2:ssa, BIG-Bench-meta-analyysi §4:ssä, rakennettu vision-esimerkki §5:ssä. ↩
-
Common Crawl, August 2026 Crawl Archive Now Available (CC-MAIN-2026-34), julkaistu 24. elokuuta 2026, haettu 2026-09-06. Sen oma etusivu väittää ”over 300 billion pages spanning 15 years”, ”totalling more than 10 petabytes” — luku koko arkistolle, ei tässä hinnoitellulle kuukausittaiselle crawlille. ↩
-
Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W. and Liu, P. J. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683 (2019), JMLR 21(140). C4-suodattimet ovat §2.2:ssa. Paperi antaa koot tavuina, ei tokeneina; siihen laajasti liitetty 156 miljardin tokenin luku on alla mainitulta Dodge et al.:lta. ↩
-
Dodge, J., Sap, M., Marasović, A., Agnew, W., Ilharco, G., Groeneveld, D., Mitchell, M. and Gardner, M. Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758 (2021), EMNLP 2021. Murteiden poistoprosentit ovat §5.3:ssa; benchmark contamination C4:ssä on §4.2:ssa. ↩
-
Lee, K., Ippolito, D., Nystrom, A., Zhang, C., Eck, D., Callison-Burch, C. and Carlini, N. Deduplicating Training Data Makes Language Models Better. arXiv:2107.06499 (2021), ACL 2022. 61 036 toistoa ovat alaviitteessä 1; memorisation-luvut ovat §6.2:ssa, taulukossa 4, ja ovat prosentteja generoiduista tokeneista 50-token exact-match -kriteerillä. ↩
-
Penedo, G., Kydlíček, H., Ben Allal, L., Lozhkov, A., Mitchell, M., Raffel, C., Von Werra, L. and Wolf, T. The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale. arXiv:2406.17557 (2024), NeurIPS 2024 Datasets and Benchmarks. Deduplication-tulos on §3.4:ssä. Julkaistu dataset on sittemmin kasvanut paperin 15 biljoonan tokenin yli. ↩
-
Gao, L., Biderman, S., Black, S. et al. The Pile: An 800GB Dataset of Diverse Text for Language Modeling. arXiv:2101.00027 (2020). Books3 on §2.3:ssa ja taulukossa 1; suostumustaulukko on taulukko 5. Korpus on 825,18 GiB, joten jopa otsikko pyöristää alaspäin. ↩
-
Bartz v. Anthropic, No. 4:24-cv-05417 (N.D. Cal.). Fair-use order 23. kesäkuuta 2025 (Dkt. 231); class certification 17. heinäkuuta 2025; final approval and judgment 20. heinäkuuta 2026 (Dkt. 680). Sovinto vapauttaa vain aiemmat inputit, ei outputeja eikä tulevaa toimintaa. ↩
-
Kadrey v. Meta, No. 3:23-cv-03417-VC (N.D. Cal.), summary judgment 25. kesäkuuta 2025 (Dkt. 598). Huomaa, että torrent-jakelua koskevaa väitettä ei ratkaistu ja se on yhä vireillä. ↩
-
Thomson Reuters v. ROSS Intelligence, No. 1:20-cv-00613-SB (D. Del.), revised opinion 11. helmikuuta 2025 (Dkt. 770), Bibas J. Interlocutory appeal Third Circuitissä (No. 25-2153), käsitelty suullisesti 11. kesäkuuta 2026, ratkaisematta kirjoitushetkellä. ↩
-
Perrigo, B. Exclusive: OpenAI Used Kenyan Workers on Less Than $2 Per Hour to Make ChatGPT Less Toxic. TIME, 18. tammikuuta 2023. $2 on yläraja senior-arvioijille, jotka täyttivät jokaisen tavoitteen; junior labelerit, enemmistö, saivat käteen $1.32. Saman vastine, siteerattuna samassa artikkelissa, antaa $1.46–$3.74 ja alemman kiintiön. ↩
-
Luccioni, A. S., Viguier, S. and Ligozat, A.-L. Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language Model. arXiv:2211.02001 (2022), JMLR 24(253). Taulukot 1 ja 3. ↩
-
Patterson, D., Gonzalez, J., Le, Q., Liang, C., Munguia, L.-M., Rothchild, D., So, D., Texier, M. and Dean, J. Carbon Emissions and Large Neural Network Training. arXiv:2104.10350 (2021). GPT-3:n luvut ovat taulukossa 4; NAS-arvion korjaus on §4.1:ssä. ↩
-
Strubell, E., Ganesh, A. and McCallum, A. Energy and Policy Considerations for Deep Learning in NLP. arXiv:1906.02243 (2019), ACL 2019. Kannattaa lukea juuri sen vuoksi, mitä sen eniten siteeratulle luvulle tapahtui: paperi on huolellinen, kertoo ekstrapolaationsa, ja oli silti väärässä kaksi kertaluokkaa sillä yhdellä rivillä, jota kaikki toistivat. ↩
-
Smith, S. J., Hubbard, A., Newkirk, A., Ganeshalingam, M., Holecek, B., Sartor, D., Mills, M. and Shehabi, A. United States Data Center Energy Usage Report: 2025 Update. LBNL-2001758 (18. kesäkuuta 2026). Tämä tarkistaa laajasti siteeratun vuoden 2024 raportin historiallista sarjaa alaspäin; jos siteeraat 176 TWh:n lukua vuodelle 2023, siteeraat korvattua painosta. ↩
-
Bender, E. M., Gebru, T., McMillan-Major, A. and Shmitchell, S. On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? FAccT '21, s. 610–623. DOI 10.1145/3442188.3445922. ”Documentation debt” on §4.4:ssä. Huomaa, että paperin omat hiililuvut on siteerattu Strubell et al.:lta ja perivät yllä olevan korjauksen — mikä on pikemminkin esimerkki sen argumentista kuin sen kumous. ↩
-
NVIDIA. NVIDIA H100 Tensor Core GPU -tuotesivu,
nvidia.com/en-us/data-center/h100/(haettu 2026-09-06). Jokaisella tensor-core-rivillä tuolla sivulla FP64:ää lukuun ottamatta on alaviite ”with sparsity”; tässä käytetty dense BF16 -luku on puolet julkaistusta 1 979 TFLOPS:sta. ↩ -
Lambda. GPU Cloud pricing,
lambda.ai/pricing(haettu 2026-09-06). On-demand, per GPU per tunti, ennen veroja. Tämän osion hinnat vanhenevat nopeammin kuin mikään muu tällä kurssilla; niitä ympäröivä aritmetiikka ei. ↩ -
Karpathy, A.
karpathy/llm.c, keskustelu #481, Reproducing GPT-2 (124M) in llm.c in 90 minutes for $20 (28. toukokuuta 2024), ja keskustelu #677, Let's reproduce GPT-2 (1.6B): one 8XH100 node, 24 hours, $672, in llm.c (11. heinäkuuta 2024). ↩ -
Karpathy, A.
karpathy/nanochat, README ja ”time to GPT-2” leaderboard (haettu 2026-09-06). $48-luku ja ”GPT-2 capability” -määritelmä CORE-pistemäärällä ovat molemmat README:ssä; repositorion omaspeedrun.shsanoo ”approximately 1.5 hours”, joten käsittele kahden tunnin lukua pyöristettynä. ↩ -
Meta. Llama 3.1 model card,
models/llama3_1/MODEL_CARD.mdkohdassameta-llama/llama-models(haettu 2026-09-06). Lähde 405 B -mallin 30,84 M H100-tunnille, 39,3 M kokonaismäärälle, 11 390 tCO2eq location-based -luvulle ja joulukuun 2023 data cutoffille. ↩