Preentrenar un LLM: dades, còmput, lleis d’escala i cost
Vint models entrenats en una GPU de portàtil per mesurar una llei d’escala i validar l’estimació 6ND amb un comptador FLOP real.
En aquesta pàgina
El capítol 9 acabava amb un bloc transformer que entrena. Apila’n uns quants, apunta la pèrdua de next-token del capítol 8 a la sortida, i ja no queda res per inventar. Tot el que queda és una compra.
És un canvi més gran del que sembla. Fins ara, cada capítol preguntava aprèn? — una pregunta de sí o no que un portàtil resol en deu minuts. Aquest en fa una amb diners a dins: donada una quantitat fixa d’aritmètica, quin és el millor model que puc comprar? La resposta és una fórmula, i el 2018 no era evident per a ningú.
Aquí tens aquesta pregunta resposta amb mesures, en una sola GPU de portàtil. Vint models, de 98.624 a 15 milions de paràmetres, es van entrenar des de zero amb 174 milions de tokens de Wikipedia — un vocabulari BPE de 2.048 tokens entrenat tal com el capítol 7 n’entrena un, el transformer del capítol 9. Cada execució va rebre exactament un de tres pressupostos de còmput i ni una operació més, de manera que un model més gran necessàriament llegeix menys text. La millor pèrdua en dades reservades assolida a cada pressupost:
budget C (FLOPs) best loss reached by a model of
1.00e13 5.3531 98,624 params
3.16e13 4.8638 98,624 params
1.00e14 4.3383 295,808 params
fitted: L = (Cc / C)^0.0913 over one decade of computeDeu vegades més aritmètica retalla un 19 % de la pèrdua, i els tres punts cauen sobre una línia recta en log-log. Res dels nou primers capítols prediu això. No hi ha cap teorema al darrere: és una regularitat empírica, que es manté amb un exponent diferent al llarg dels deu ordres de magnitud entre aquest portàtil i un centre de dades, i és l’observació única que va convèncer una indústria de gastar-se el PIB d’un país petit en GPUs.
Què és el preentrenament, i què té de nou
Enllaç a la secció: Què és el preentrenament, i què té de nouNo canvia res en l’objectiu. El model continua predient el token següent, la pèrdua continua sent la cross-entropy del capítol 4 aplicada a la factorització del capítol 8, l’optimitzador continua sent l’AdamW del capítol 6. El preentrenament no és un algorisme nou; és el mateix algorisme executat sobre un corpus prou gran perquè l’execució s’hagi de pressupostar. Dues coses ho fan possible: les etiquetes són de franc, perquè l’objectiu per a la posició és el token a i ja és dins del text; i l’última secció del capítol 6 va eliminar l’objecció, perquè un model amb molts més paràmetres del que permeten les regles clàssiques no s’ensorra, millora. El que en surt és un model base: una cosa que continua text més que no pas respon.
Comptar el còmput abans de gastar-lo: 6ND
Enllaç a la secció: Comptar el còmput abans de gastar-lo: 6NDAbans que res d’això es pugui pressupostar, s’ha de comptar, i el camp ho compta amb una fórmula:
on és el nombre de paràmetres, els tokens d’entrenament i el total d’operacions de coma flotant. Kaplan et al. la deriven en dos passos.1 Forward: 2 FLOPs per paràmetre per token, perquè cada paràmetre d’una multiplicació de matrius s’utilitza una vegada per token, en una multiplicació i una suma. Backward: el doble del forward, perquè el backward pass del capítol 5 calcula dos gradients a cada capa — respecte dels inputs de la capa, perquè el senyal continuï viatjant, i respecte dels seus weights — cadascun una multiplicació de matrius de la mida del forward, de manera que .
Aquesta és tota la derivació, i val la pena comprovar-la en lloc de creure-se-la. PyTorch inclou un comptador FLOP real, torch.utils.flop_counter.FlopCounterMode, que intercepta cada operació que un model envia i suma la feina real. Executa’l al llarg de quatre ordres de magnitud, el més gran al dispositiu meta, que assigna formes i no memòria:
from torch.utils.flop_counter import FlopCounterMode
counter = FlopCounterMode(display=False)
with counter:
loss = model(x, targets)[1]
loss.backward()
measured = counter.get_total_flops()
print(measured / (6 * n_params * n_tokens))| configuració | sense embeddings | total | mesurat, fwd+bwd | ÷ ( total) | ÷ (sense emb.) | fwd+bwd ÷ fwd |
|---|---|---|---|---|---|---|
| 128, 4 capes, 256 | 788,736 | 7,254,400 | 4.60e10 | 1.031 | 9.485 | 3.000 |
| 512, 8 capes, 256 | 25,183,232 | 51,045,888 | 3.26e11 | 1.038 | 2.104 | 3.000 |
| 768, 12 capes, 1024 | 84,973,056 | 124,356,864 | 1.75e12 | 1.145 | 1.676 | 3.000 |
| 1600, 48 capes, 1024 | 1,474,870,400 | 1,556,920,000 | 2.10e13 | 1.100 | 1.161 | 3.000 |
| 4096, 32 capes, 2048 | 6,442,983,424 | 6,582,444,032 | 8.74e13 | 1.080 | 1.104 | 3.000 |
| 8192, 80 capes, 8192 | 64,427,147,264 | 65,544,929,280 | 3.75e15 | 1.163 | 1.183 | 3.000 |
La ràtio de forward+backward sobre forward és 3.000, exactament, a cada escala: no és una aproximació que casualment sigui bona, sinó la identitat aritmètica anterior retornada com a nombre rodó per un comptador que no sap res de la derivació.
El total mesurat queda llavors entre un 3 % i un 17 % per sobre de , un cop compta les matrius d’embedding — i aquesta clàusula importa, perquè els dos articles fundacionals compten de manera diferent. Kaplan exclou «all vocabulary and positional embeddings» perquè fer-ho «produces significantly cleaner scaling laws» (§1.3); l’apèndix F de Chinchilla diu «we also count embeddings matrices in the total parameter count».2 Per a un vocabulari ample i una dimensió oculta estreta, les dues opcions difereixen per un factor de nou, com mostra la primera fila.
La bretxa residual és el que omet deliberadament: les puntuacions d’attention. L’Eq. (2.2) de Kaplan escriu el cost forward com i descarta el segon terme perquè — segur el 2020, menys segur ara, i el motiu pel qual la ràtio deriva cap amunt a mesura que creix — i per això dues files aquí comparteixen una de 1.024 i la ràtio cau, de 1.145 a 1.100, quan passa de 768 a 1.600. És el cost que el capítol 9 va introduir i que el capítol 16 converteix en preu.
Memòria: què ha d’encaixar de debò
Enllaç a la secció: Memòria: què ha d’encaixar de debòEl còmput decideix quant dura una execució; la memòria decideix si pot començar. Entrena amb AdamW fp32 senzill i cada paràmetre porta quatre nombres: el weight, el seu gradient, i la mitjana mòbil i la variància d’Adam — les dues mitjanes construïdes a mà al capítol 6. Quatre nombres a quatre bytes cadascun són 16 bytes per paràmetre, abans d’una sola activació. Mesurat en una GPU de portàtil de 8 GB, prenent l’assignació resident en el punt del pas on no hi ha cap graf viu:
| model | vocabulari | batch | predit | resident mesurat | pic en un pas | diferència | |
|---|---|---|---|---|---|---|---|
| 512, 8 capes | 50,257 | 8 | 51,045,888 | 779 MB | 801 MB | 2,500 MB | 1,699 MB |
| 512, 8 capes | 4,096 | 8 | 27,411,456 | 418 MB | 426 MB | 1,043 MB | 617 MB |
| 256, 6 capes | 4,096 | 8 | 5,839,360 | 89 MB | 89 MB | 382 MB | 293 MB |
| 256, 6 capes | 4,096 | 32 | 5,839,360 | 89 MB | 89 MB | 1,259 MB | 1,170 MB |
| 256, 6 capes | 4,096 | 128 | 5,839,360 | 89 MB | 89 MB | 4,771 MB | 4,681 MB |
La predicció i la mesura concorden dins d’un 3 %. La sorpresa és l’última columna: les activacions empetiteixen el model. El mateix model de 5,8 milions de paràmetres que necessita 89 MB d’estat persistent necessita 4.681 MB d’activacions amb un batch de 128 — cinquanta-dues vegades el model — i bona part d’això ni tan sols és el transformer. Són els logits, un vector de mida vocabulari per token a quatre bytes per entrada: 512 MB a l’última fila, 393 MB a la primera. La mida del vocabulari es va triar al capítol 7, i encara decideix què cap a la targeta.
Quin terme domina depèn de la forma de l’execució, i per això Micikevicius et al. diuen que la memòria «is dominated by activations»3 mentre ZeRO diu que un model de 1,5 mil milions de paràmetres necessita «at least 24 GB» només d’estats del model.4 ZeRO arriba als mateixos 16 bytes per una altra ruta — per als weights fp16, per als gradients fp16, cadascun per als master weights fp32 i els dos moments d’Adam — cosa que per a 70 mil milions de paràmetres són 1,12 terabytes, l’equivalent de catorze GPUs de 80 GB abans d’una sola activació.
Paral·lelisme, en un paràgraf i una delegació
Enllaç a la secció: Paral·lelisme, en un paràgraf i una delegacióRes d’això cap en un sol dispositiu a escala frontier, de manera que l’execució es divideix de quatre maneres alhora. Paral·lelisme de dades posa una còpia del model a cada GPU i fa la mitjana dels gradients — el predeterminat, i el que ZeRO millora negant-se a mantenir còpies redundants de l’estat de l’optimitzador. Paral·lelisme tensorial divideix matrius individuals entre dispositius. Paral·lelisme de pipeline dona a cada dispositiu un grup contigu de capes. Paral·lelisme de context divideix la seqüència mateixa, necessari només quan és prou llarg perquè el terme d’attention domini. La taula 4 de Llama 3 enumera tots quatre alhora: tensor 8, context fins a 16, pipeline 16, dades fins a 128, sobre 16.384 GPUs H100.5 Això és tot el que aquest curs en dirà; l’enginyeria d’entrenament distribuït és un semestre propi, i Stanford CS336 és aquest semestre, classes 5 a 8, amb el codi.6 El que sobreviu a la delegació és un sol nombre, utilització de FLOPs del model: la fracció del pic aritmètic d’una GPU que una execució real aconsegueix, que és el que converteix el endreçat en temps de rellotge i, per tant, en diners.
Kaplan, i l’aposta que va fer la indústria
Enllaç a la secció: Kaplan, i l’aposta que va fer la indústriaEl gener de 2020, Kaplan et al. van entrenar una graella de transformers i van trobar que la pèrdua de test segueix una llei potencial en cadascun dels tres recursos al llarg de més de sis ordres de magnitud.1 La seva §1.2 dona tres lleis ajustades:
amb companyes per a les dades i per al còmput assignat òptimament. Les constants no són universals, i l’article ho diu: «the precise numerical values of , and depend on the vocabulary size and tokenization and hence do not have a fundamental meaning.»
Els exponents són diminuts: deu vegades més paràmetres compra un factor de reducció de la pèrdua restant. Sembla poca cosa, i és el fet més important aquí: els retorns són terribles i no s’aturen mai. Una llei potencial amb un exponent petit promet que el següent ordre de magnitud ajudarà, menys que l’anterior, per sempre. Comprar còmput deixa de ser una aposta i passa a ser una compra amb un tipus de canvi publicat, que és exactament l’argument que va desbloquejar el capital.
Després va venir la prescripció, i aquí és on l’article es va equivocar d’una manera que va costar molts diners a la indústria. La taula 6 de Kaplan dona i : deu vegades el còmput vol dir un model 5,4 vegades més gran alimentat amb només 1,9 vegades més text. L’abstract és explícit: «optimally compute-efficient training involves training very large models on a relatively modest amount of data and stopping significantly before convergence.» El camp va fer exactament això: GPT-3 són 175 mil milions de paràmetres amb 300 mil milions de tokens,7 Gopher 280 mil milions amb 300 mil milions, Megatron-Turing NLG 530 mil milions amb 270 mil milions.2 De mig token a dos tokens per paràmetre, a tot arreu.
Chinchilla, i què mesurava l’escombratge de dalt
Enllaç a la secció: Chinchilla, i què mesurava l’escombratge de daltEl març de 2022, Hoffmann et al. van entrenar més de 400 models de 70 milions a 16 mil milions de paràmetres i van arribar a la conclusió contrària per tres rutes independents.2 La seva taula 2 informa que l’exponent en és 0.50, 0.49 i 0.46, contra el 0.73 de Kaplan. En termes planers: la mida del model i les dades d’entrenament haurien de créixer en la mateixa proporció.
El seu segon enfocament és el que reprodueix l’escombratge de l’inici d’aquest capítol, a una milionèsima part de l’escala: fixa un pressupost, entrena moltes mides exactament amb aquest pressupost, dibuixa la pèrdua final contra la mida del model.
| paràmetres | |||
|---|---|---|---|
| 98,624 | 5.3531 (171) | 4.8638 (542) | — |
| 150,320 | 5.4636 (74) | — | — |
| 194,208 | 5.5041 (44) | 4.8730 (140) | 4.4040 (442) |
| 295,808 | 5.5550 (19) | 4.9029 (60) | 4.3383 (190) |
| 665,280 | 5.7849 (3.8) | 5.1254 (12) | 4.4192 (38) |
| 1,280,768 | 5.8174 (1.0) | 5.1751 (3.2) | 4.5003 (10) |
| 3,101,568 | — | 5.4686 (0.5) | 4.7768 (1.7) |
| 5,315,072 | — | 5.5894 (0.2) | 4.8514 (0.6) |
| 15,053,568 | — | — | 5.3534 (0.1) |
Pèrdua en dades reservades en nats per token, tokens per paràmetre entre parèntesis, negreta per al millor model a cada pressupost; un guió és un punt no executat, perquè el pressupost exigia més text del que conté el corpus o la mida quedava fora de les explorades allà.
Llegeix una columna cap avall: la pèrdua baixa, toca fons i torna a pujar. Un model pot ser massa gran per al seu pressupost exactament amb la mateixa facilitat que pot ser massa petit — a , la penalització per triar 665.280 paràmetres en lloc de 295.808 és 0,08 nats, que a l’envolupant ajustada més amunt és la pèrdua que un model amb la mida correcta assoleix amb un 18 % menys de còmput. Triar la forma equivocada llença una cinquena part del pressupost. Això és la figura 3 de Chinchilla en una tarda amb una GPU en lloc de quatre-cents models.
Ara llegeix en horitzontal. A el millor model és el més petit dels explorats; a és de 295.808 paràmetres, emmarcat pels dos costats. L’òptim es mou cap a la dreta a mesura que el pressupost creix, que és tot el contingut de la correcció. Ajusta el tercer enfocament de l’article — la superfície sobre cada execució — i minimitza subjecte a :
L(N, D) = 24.7 / N^0.195 + 46.8 / D^0.169 (E fits to ~0; see below)
implied N_opt ∝ C^0.464
compare Chinchilla 0.46-0.50 · Besiroglu 0.513 · Kaplan 0.730.46, des d’un portàtil, contra el 0.73 de Kaplan. La concordança a tres dígits d’un ajust amb tres pressupostos és sort; la concordança al primer no ho és. L’exponent viatja — la constant no, perquè la ràtio token-paràmetre en aquests òptims és de 170 a 540, no 20. Tres motius, tots instructius. s’ajusta a zero perquè, amb una pèrdua per sobre de 4 nats, l’execució no és enlloc prop del sòl d’entropia que domina l’ajust de Chinchilla. El batch size i el learning rate es van fixar en lloc d’ajustar-se per punt, cosa que perjudica les execucions que reben menys passos — i aquestes són els models grans: a FLOPs, un model d’1,28 milions de paràmetres rep 159 passos d’optimitzador en total, molt per sota dels pocs milers que el terme de Kaplan diu que qualsevol model necessita. Una llei d’escala s’ajusta dins d’un règim, i aquesta és sis ordres de magnitud per sota de Chinchilla.
D’aquí l’abstract de l’article: «current large language models are significantly undertrained». Chinchilla és la demostració: 70 mil milions de paràmetres amb 1,4 bilions de tokens, el mateix còmput total que Gopher amb 280 mil milions sobre 300 mil milions, superant-lo en 51 de 57 tasques MMLU, 67,5 % contra 60 %.2 Quatre vegades més petit, quatre vegades i mitja més text, mateixos diners, millor model.
Dos matisos sobre aquella ràtio famosa. «Vint tokens per paràmetre» no és una frase de l’article, que només diu que «for every doubling of model size the number of training tokens should also be doubled»; el 20 és una inferència de la taula 3 i del mateix Chinchilla de 70 B sobre 1,4 T. I la seva precisió és pitjor que la publicada: Besiroglu et al. van reajustar a partir d’una digitalització de la figura 4, van trobar que els paràmetres originals «fit the reconstructed data poorly» amb intervals «implausibly tight given the number of data points», i van situar el rang honest entre «between 4 and 40» tokens per paràmetre.8
Un detall del mètode de Chinchilla compleix una promesa que el capítol 1 va fer sobre els horaris de learning rate. El cosine schedule s’ha de casar amb el pressupost de tokens. Un model que veurà 10 milions de tokens ha de fer decaure el seu learning rate fins a zero als 10 milions de tokens; dona-li un schedule dimensionat per a 100 milions, atura’l aviat, i estàs llegint una pèrdua a mig descens amb una taxa massa alta. Chinchilla entrena cada model amb quatre longituds de cicle per controlar exactament això; l’escombratge de dalt estableix el seu schedule a partir del pressupost pel mateix motiu.
Què no prometen les scaling laws
Enllaç a la secció: Què no prometen les scaling lawsSón el resultat empíric més útil del camp i s’exageren rutinàriament. Quatre límits.
Prediuen pèrdua, no capacitat. El costat esquerre és cross-entropy sobre text reservat. Res d’aquests articles autoritza una afirmació sobre si un model escriurà SQL correcte, rebutjarà una petició perjudicial o farà servir una eina. És la lliçó del capítol 5 una altra vegada: una predicció de la pèrdua no és una predicció del comportament pel qual pagues.
S’ajusten, no es deriven. Cap teoria produeix . Les constants es mouen amb el tokenizer — i per això una comparació de perplexitat entre dos tokenizers no té sentit, com explicava el capítol 8 — i amb la barreja de dades, l’arquitectura i l’optimitzador. Cada llei publicada és una llei de la configuració que la va produir, i per això Meta va reajustar la seva abans de Llama 3.5
Assumeixen un token fresc a cada pas, cosa que pressuposa en silenci un corpus infinit. Muennighoff et al. van mesurar què passa quan s’acaba: fins a quatre èpoques de dades repetides costen gairebé res — un model de 8,7 mil milions de paràmetres sobre 44 mil milions de tokens únics vistos quatre vegades va acabar amb una «only 0.5 % higher validation loss» que el mateix model sobre 178 mil milions d’únics — mentre que més enllà d’unes setze èpoques el còmput addicional no compra res.9
I ja ningú no entrena compute-optimal. Chinchilla minimitza el cost d’entrenar; un model desplegat després paga aproximadament FLOPs per token generat, per sempre. LLaMA 1 ho deia clarament: «given a target level of performance, the preferred model is not the fastest to train but the fastest at inference».10 Sardana et al. ho van formalitzar minimitzant en lloc d’això, i van trobar que qualsevol que esperi mil milions de peticions hauria d’entrenar «smaller and longer than Chinchilla-optimal».11 La §9.1 de Llama 3 hi està d’acord: els seus models petits entrenen «far beyond the point of compute optimal training, effectively trading training compute for inference efficiency».5 La ràtio no és obsoleta; respon una pregunta que ja no és la que s’està fent.
Capacitats emergents, i l’argument sobre si són reals
Enllaç a la secció: Capacitats emergents, i l’argument sobre si són realsLa pèrdua baixa de manera suau. Les puntuacions de benchmarks de vegades no. Wei et al. van recopilar casos en què una tasca es queda a l’atzar al llarg d’ordres de magnitud de còmput d’entrenament i després salta — aritmètica de tres dígits que apareix a GPT-3 cap a FLOPs, MMLU pujant per sobre de l’endevinalla entre i — i van posar nom al patró: «an ability is emergent if it is not present in smaller models but is present in larger models».12 Si això és una propietat real, extrapolar a partir d’experiments barats és insegur, perquè la capacitat que compres potser no existeix a cap escala que et puguis permetre provar.
Schaeffer, Miranda i Koyejo van argumentar que la major part és un artefacte de mesura, i el mecanisme és aritmètic.13 La pèrdua per token baixa suaument, de manera que la probabilitat que un token sigui correcte, , millora gradualment. Avalua el model amb coincidència exacta de cadena sobre una resposta de tokens i eleves aquella probabilitat a la potència — una corba suau elevada a una potència gran sembla un precipici. Canvia a una mètrica que compta tokens en lloc d’exigir-los tots, sobre les mateixes sortides, i «the family's performance smoothly, continuously and predictably improves with increasing scale».
La seva auditoria és el nombre que cal recordar — «of the 39 preferred metrics in BIG-Bench, at most 5 display emergence», amb dues mètriques discontínues que expliquen més del 92 % dels casos afirmats — i també ho és la seva cautela: «nothing in this paper should be interpreted as claiming that large language models cannot display emergent abilities». Un salt en un gràfic és evidència sobre la mètrica fins que es demostri el contrari. El capítol 29 és on això es converteix en el teu problema, perquè triar una mètrica amb tall dur és una decisió que prendràs sense adonar-te’n.
D’on surten les dades
Enllaç a la secció: D’on surten les dadesEl corpus és la part d’una execució de preentrenament sense cap equació associada, i on viuen la majoria de decisions amb conseqüències. El material brut és un rastreig web: l’arxiu d’agost de 2026 de Common Crawl conté «2.14 billion web pages or 360 TiB of uncompressed content», un mes, gratis per descarregar.14 Gairebé res no és usable tal com ve. L’article de T5 diu que el rastreig «largely comprises gibberish or boiler-plate text like menus, error messages, or duplicate text», i el pipeline C4 que va introduir és una llista d’heurístiques contundents — conservar només línies acabades en puntuació terminal, descartar pàgines amb menys de tres frases, descartar qualsevol pàgina que contingui una clau o una paraula d’una llista pública d’obscenitats — que converteix vint terabytes de text mensual en uns 750 GB.15
Contundent és la paraula. Dodge et al. van auditar què eliminen aquests filtres i van trobar que la blocklist d’obscenitats elimina el 42 % dels documents en anglès afroamericà i el 32 % en anglès alineat amb hispans, contra el 6,2 % de l’anglès alineat amb blancs, deixant un corpus amb un 97,8 % de l’última categoria.16 Una regla sense opinió sobre el dialecte en tenia una.
Després deduplicació, que no és endreça: Lee et al. van trobar una frase de 61 paraules repetida 61.036 vegades a C4, i van mostrar que deduplicar retalla per deu la taxa amb què els models «emit memorized text», de l’1,9 % dels tokens generats al 0,19 %.17 Més no és millor, però: l’equip de FineWeb va deduplicar globalment al llarg de 96 rastrejos, va obtenir 4 bilions de tokens i cap guany mesurable, després va deduplicar cada rastreig per separat, en va obtenir 20 bilions i va igualar el millor corpus existent.18
Després contaminació. Llama 3 va mesurar la seva i la va publicar: el 98 % d’AGIEval, el 95 % de BIG-Bench Hard i el 85 % de HellaSwag se solapaven amb el conjunt d’entrenament per 8-grams, i per a MMLU un solapament tan alt que «it is impossible to get a good performance gain estimate».5 La §4 de GPT-3 informa d’un error de filtratge que va deixar benchmarks dins de les dades sense camí de tornada: «because of cost considerations it was infeasible to retrain the model».7
La procedència és la part no resolta. The Pile va enviar un component de 100,96 GiB anomenat Books3 — el 12 % del corpus i, segons la pròpia taula de consentiment de l’article, llibres d’un tracker torrent privat;19 es va retirar l’agost de 2023 després d’una queixa per copyright. La posició legal a setembre de 2026 no està resolta, i les tres sentències dels EUA citades com a tendència discrepen entre si. Alsup va considerar que entrenar amb llibres adquirits legalment era «exceedingly transformative» mentre sostenia que una biblioteca construïda amb còpies pirates no ho era, i Anthropic va tancar aquella meitat amb un acord de $1.5 billion que cobria 482.460 obres, uns $3.000 cadascuna, aprovat el 20 de juliol de 2026.20 Chhabria va concedir judici sumari a Meta mentre escrivia que la seva decisió «does not stand for the proposition that Meta's use of copyrighted materials to train its language models is lawful», només que «these plaintiffs made the wrong arguments».21 Bibas, resolent contra Ross Intelligence, va assenyalar que «only non-generative AI is before me today».22 Cap tribunal d’apel·lació dels EUA no s’ha pronunciat sobre la qüestió.
Les persones fan les parts que la pèrdua no pot fer. TIME va informar el gener de 2023 que treballadors que etiquetaven text tòxic per a OpenAI a través de l’empresa Sama s’enduien a casa «between around $1.32 and $2 per hour» llegint passatges que descrivien abús sexual infantil, tortura i autolesions, mentre OpenAI pagava a Sama $12.50 l’hora per la feina; Sama disputa tant el rang salarial com la quota.23 Això és el filtratge al voltant del preentrenament més que el preentrenament mateix — però és a la mateixa factura, i és on hi seu una persona.
L’electricitat és real i sovint se cita malament. La xifra publicada més acurada és la de BLOOM: 1.082.990 GPU-hores, 433 MWh i 24,7 tones de CO₂ equivalent per a l’execució, 50,5 comptant fabricació i nodes ociosos;24 Patterson et al. situen GPT-3 en 1.287 MWh i 552 tones.25 Dos avisos. L’avantatge de BLOOM és la xarxa nuclear francesa a 57 g CO₂ per kWh, no l’eficiència: va consumir més energia que OPT-175B. I la xifra d’emissions més citada del camp, les 626.155 lb de Strubell et al. per a una cerca d’arquitectura neural, després es va demostrar que era 88 vegades massa alta, perquè assumia que la cerca s’executava a mida completa de model quan s’executava sobre un proxy.26 L’enquadrament de LBNL és el defensable: els centres de dades dels EUA van consumir 192 TWh el 2024, el 4,7 % de l’electricitat nacional — una xifra associada a una indústria, no a cap execució concreta.27
El fil conductor és el que Bender et al. van anomenar deute de documentació: «putting ourselves in a situation where the datasets are both undocumented and too large to document post hoc».28 Cada fet de dalt existeix perquè algú va mirar. En els corpus darrere dels models que fa servir la majoria, ningú no pot.
Què costa realment
Enllaç a la secció: Què costa realmentAra l’aritmètica que tothom vol, a partir de quatre inputs citats, perquè quan quedin obsolets sigui evident quin cal substituir.
Rendiment màxim
Enllaç a la secció: Rendiment màximLa pàgina de l’H100 de NVIDIA enumera 1.979 teraFLOPS de rendiment BF16 amb tensor cores sota una nota que diu «with sparsity».29 Cap execució de preentrenament fa servir sparsity estructurada, així que la xifra densa és la meitat: 989,5 TFLOP/s.
Utilització
Enllaç a la secció: UtilitzacióLa taula 4 de Llama 3 informa d’un 38–43 % d’utilització de FLOPs del model BF16. Pren 40 %: 395,8 TFLOP/s d’aritmètica útil per GPU.5
El preu on-demand de Lambda per a un node 8×H100 SXM, consultat el 2026-09-06: $3.99 per GPU-hora, és a dir, $31.92 l’hora pel node.30
La ràtio de Chinchilla, , dona i per tant .
| pressupost | H100-hores | FLOPs | paràmetres compute-optimal | tokens | en un node 8×H100 | GPUs per acabar en 90 dies |
|---|---|---|---|---|---|---|
| $100 | 25 | 3.6e19 | 546 M | 10.9 B | 3.1 h | 1 |
| $1,000 | 251 | 3.6e20 | 1.73 B | 34.5 B | 31.3 h | 1 |
| $10,000 | 2,506 | 3.6e21 | 5.46 B | 109 B | 13 dies | 2 |
| $100,000 | 25,063 | 3.6e22 | 17.3 B | 345 B | 131 dies | 12 |
| $1,000,000 | 250,627 | 3.6e23 | 54.6 B | 1.09 T | 4 anys | 116 |
| $10,000,000 | 2,506,266 | 3.6e24 | 173 B | 3.45 T | 36 anys | 1,160 |
| $100,000,000 | 25,062,657 | 3.6e25 | 546 B | 10.9 T | 358 anys | 11,603 |
Llegeix les dues últimes columnes juntes. Amb $10.000 obtens un model de 5 mil milions de paràmetres en un node llogat en quinze dies. Amb $100.000.000, l’aritmètica diu 546 mil milions de paràmetres — i dotze mil H100 cablejades durant tres mesos, que no és una cosa que es llogui amb una targeta de crèdit. Passat aproximadament $100.000, la restricció vinculant deixa de ser els diners i passa a ser el clúster.
Abans de confiar en una taula així, prova-la contra execucions amb cost real publicat: llm.c reprodueix GPT-2 124M en «~90 minutes» en un node 8×A100 «for about $20», i GPT-2 1.6B en 24 hores en un node 8×H100 per $672.31
$672, against what $672 actually bought (llm.c GPT-2 1.6B, one 8xH100 node, 24 h)
this table predicts: 168 H100-hours N = 1.41 B params D = 28.3 B tokens
what was actually run: 192 H100-hours N = 1.558 B params D = 33.6 B tokens
Llama 3 405B, against Meta's own published GPU-hours
from the paper's 3.8e25 FLOPs at 40 % MFU: 26.67 M H100-hours
published in Meta's Llama 3.1 model card: 30.84 M H100-hours ratio 0.86Totes dues dins d’aproximadament un 15 %, que és més o menys la precisió que mereix aquest tipus d’estimació i força millor que la precisió amb què se sol citar.
La comparació titular, amb totes dues definicions sobre la taula
Enllaç a la secció: La comparació titular, amb totes dues definicions sobre la taulaLa xifra més repetida en aquest tema és que un model de classe GPT-2 que costava uns $43.000 el 2019 es pot reproduir avui per unes desenes de dòlars. La meitat moderna està ben documentada; la meitat històrica, no.
Avui. El README de nanochat de Karpathy: «you can train your own GPT-2 capability LLM ... for only $48 (~2 hours of 8XH100 GPU node) ... On a spot instance, the total cost can be closer to ~$15.»32 «GPT-2 capability» aquí és precís i publicat — superar la puntuació CORE de GPT-2 de 0.256525 — en un leaderboard l’entrada millor del qual, a 14 de març de 2026, és 1,65 hores. Els $48 assumeixen $3 per GPU-hora, per sota dels $3.99 de llista de Lambda; a preu de llista s’acosta a $64.
El 2019. No hi ha cap font primària: OpenAI no va publicar mai ni durada ni cost. La cadena passa per The Register, febrer de 2019, que informa de «256 Google TPU3 cores» sense preu ni durada; després Synced, juny de 2019, assenyala que el maquinari costava $256 l’hora a Google Cloud i afirma explícitament que «OpenAI didn't specify the training duration». $43.008 són $256 l’hora multiplicats per unes 168 hores assumides que ningú no ha documentat mai.
Així que el titular honest és: un model que iguala la puntuació publicada de benchmark de GPT-2 es pot entrenar avui per molt menys de $100 en maquinari llogat, contra un cost de 2019 que no es va publicar mai i l’estimació famosa del qual descansa sobre una conjectura sense font sobre la durada. L’enfonsament és real i la meitat moderna és reproduïble per qualsevol persona amb targeta de crèdit; la ràtio és aritmètica sobre un nombre que no existeix. Aquest és l’estat dels costos d’entrenament publicats en general. L’article de GPT-3 no conté cap quantitat en dòlars, només FLOPs a la taula D.1;7 l’article de Llama 3 tampoc no en conté cap.5 Cada cost d’entrenament que has llegit és una estimació a partir d’un recompte de FLOPs, una hipòtesi de maquinari i una hipòtesi de preu — sempre val la pena preguntar de qui.
Què sap un model base, i quan va deixar de saber-ho
Enllaç a la secció: Què sap un model base, i quan va deixar de saber-hoEl que en surt ha vist un corpus fix muntat en un moment fix, i d’això se’n deriven dues propietats.
La primera és el knowledge cutoff. Després de la data de recopilació el model no sap res — no «n’està incert», res — i confabularà amb fluïdesa en lloc de dir-ho, perquè dir-ho mai va ser un comportament en què se l’entrenés. La targeta de model de Llama 3.1 dona desembre de 2023;33 cada model en té una, i és una propietat de les dades d’entrenament, no del deployment. Esquivar-ho és un problema de retrieval, que és el capítol 19.
La segona és que un model base completa més que no pas respon. Dona-li «Quina és la capital de França?» i una continuació plausible és una altra pregunta, perquè en el corpus aquesta cadena apareix més sovint en una llista d’exercicis.
Cap on va això ara
Enllaç a la secció: Cap on va això araUn completador de text no és un assistent. No segueix instruccions, perquè res del corpus li deia que una petició s’hagués d’obeir en lloc de continuar. No té cap noció d’una conversa amb dos participants. Produirà encantat la continuació més probable d’un prompt perjudicial, perquè probable és l’única cosa per a la qual es va optimitzar mai.
Convertir-lo en una cosa que respon requereix una segona etapa que costa una fracció d’un u per cent de la primera, i que consisteix gairebé del tot a mostrar-li exemples del comportament que vols i després comparar parelles de les seves pròpies sortides. Aquesta etapa és d’on surten el seguiment d’instruccions, les chat templates, els refusos i — això sorprèn la gent — la capacitat de cridar una eina. El capítol 11 és aquesta etapa: supervised fine-tuning, RLHF, DPO i GRPO, i la pregunta de què vol dir «aligned» i qui ho decideix.
Fonts i mètode
Enllaç a la secció: Fonts i mètodeTambé val la pena llegir al costat d’aquest capítol: build-nanogpt de Karpathy i el vídeo que l’acompanya, que recorren una reproducció completa de GPT-2 de cap a cap a un ritme que aquest capítol no pot; i Stanford CS324, Large Language Models, les classes del qual sobre dades i impacte ambiental aprofundeixen més que la secció anterior en material que aquest curs tracta una vegada i delega.
Referències
Enllaç a la secció: Referències-
Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J. and Amodei, D. Scaling Laws for Neural Language Models. arXiv:2001.08361 (2020). Les tres lleis potencials són les Eqs. (1.1)–(1.3) a §1.2 i les constants completes són a l’apèndix A, taula 5; la derivació de és §2.1; els exponents d’assignació de còmput són a la taula 6. Tingues en compte que hi ha dues lleis de còmput, amb batch size fix i amb batch size òptim; l’article diu que aquesta última «should be used to make predictions». ↩ ↩2
-
Hoffmann, J., Borgeaud, S., Mensch, A., Buchatskaya, E., Cai, T., Rutherford, E. et al. Training Compute-Optimal Large Language Models. arXiv:2203.15556 (2022). Exponents a la taula 2, pressupostos projectats a la taula 3, la comparació amb Gopher a §4, la convenció de recompte de paràmetres a l’apèndix F. La prosa sota la taula 3 discrepa de la mateixa taula 3 per a les files de 175 B i 280 B; la taula és la versió que cal citar. ↩ ↩2 ↩3 ↩4
-
Micikevicius, P., Narang, S., Alben, J., Diamos, G., Elsen, E., Garcia, D. et al. Mixed Precision Training. arXiv:1710.03740 (2017), ICLR 2018. Master weights FP32 a §3.1, loss scaling a §3.2. ↩ ↩2
-
Rajbhandari, S., Rajbhandari, S., Ruwase, O. and He, Y. ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054 (2019), SC20. La comptabilitat és §3.1; les xifres d’estat residual per a activacions són §3.2. ↩
-
Grattafiori, A. et al. (Llama Team, AI @ Meta). The Llama 3 Herd of Models. arXiv:2407.21783 (2024). Pressupost de còmput i nombre de tokens a §1, la scaling law reajustada a §3.2.1, la configuració de paral·lelisme i MFU a la taula 4, l’anàlisi de contaminació a §5.1.4, l’afirmació de sobreentrenament a §9.1. L’article no conté xifres en dòlars ni taula d’emissions. ↩ ↩2 ↩3 ↩4 ↩5 ↩6
-
Stanford CS336, Language Modeling from Scratch. La classe 2 cobreix la comptabilitat de recursos, les classes 5–8 GPUs, kernels i paral·lelisme, les classes 9 i 11 scaling, les classes 13–14 dades. És el curs al qual aquest capítol delega la seva enginyeria, i és públic. ↩
-
Brown, T. B. et al. Language Models are Few-Shot Learners. arXiv:2005.14165 (2020). Còmput a l’apèndix D, taula D.1 — que té una columna literalment encapçalada «flops per param per token», el valor de la qual per a cada fila de GPT-3 és 6. Anàlisi de contaminació a §4. ↩ ↩2 ↩3
-
Besiroglu, T., Erdil, E., Barnett, M. and You, J. Chinchilla Scaling: A replication attempt. arXiv:2404.10102 (2024). Reconstrueix les dades de Chinchilla digitalitzant-ne la figura 4, reajusta, i informa dels exponents corregits i d’intervals molt més amplis. ↩
-
Muennighoff, N., Rush, A. M., Barak, B., Le Scao, T., Piktus, A., Tazi, N., Pyysalo, S., Wolf, T. and Raffel, C. Scaling Data-Constrained Language Models. arXiv:2305.16264 (2023), NeurIPS 2023. El resultat de quatre èpoques és §6; la semivida de setze èpoques és el ajustat. ↩
-
Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T. et al. LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 (2023). §1 exposa l’argument de cost d’inferència contra l’entrenament Chinchilla-optimal. ↩
-
Sardana, N., Portes, J., Doubov, S. and Frankle, J. Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws. arXiv:2401.00448 (2023), ICML 2024. La seva §5 també conté el contrapès: els models entrenats amb ràtios de tokens extremes continuen millorant, però «more slowly than scaling laws predict». ↩
-
Wei, J., Tay, Y., Bommasani, R., Raffel, C., Zoph, B., Borgeaud, S. et al. Emergent Abilities of Large Language Models. arXiv:2206.07682 (2022), TMLR. Definició a §2, exemples i llindars de còmput a §3–4 i taula 1. ↩
-
Schaeffer, R., Miranda, B. and Koyejo, S. Are Emergent Abilities of Large Language Models a Mirage? arXiv:2304.15004 (2023), article destacat NeurIPS 2023. L’argument de la mètrica és §2, la metaanàlisi de BIG-Bench §4, l’exemple visual construït §5. ↩
-
Common Crawl, August 2026 Crawl Archive Now Available (CC-MAIN-2026-34), publicat el 24 d’agost de 2026, consultat el 2026-09-06. La seva pròpia portada afirma «over 300 billion pages spanning 15 years», «totalling more than 10 petabytes» — una xifra per a tot l’arxiu, no per al rastreig mensual pressupostat aquí. ↩
-
Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W. and Liu, P. J. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683 (2019), JMLR 21(140). Els filtres de C4 són §2.2. L’article dona mides en bytes, no en tokens; la xifra de 156 mil milions de tokens àmpliament atribuïda a l’article ve de Dodge et al. més avall. ↩
-
Dodge, J., Sap, M., Marasović, A., Agnew, W., Ilharco, G., Groeneveld, D., Mitchell, M. and Gardner, M. Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758 (2021), EMNLP 2021. Les taxes d’eliminació per dialecte són §5.3; la contaminació de benchmarks a C4 és §4.2. ↩
-
Lee, K., Ippolito, D., Nystrom, A., Zhang, C., Eck, D., Callison-Burch, C. and Carlini, N. Deduplicating Training Data Makes Language Models Better. arXiv:2107.06499 (2021), ACL 2022. Les 61.036 repeticions són a la nota 1; les xifres de memorització són §6.2, taula 4, i són percentatges de tokens generats sota un criteri de coincidència exacta de 50 tokens. ↩
-
Penedo, G., Kydlíček, H., Ben Allal, L., Lozhkov, A., Mitchell, M., Raffel, C., Von Werra, L. and Wolf, T. The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale. arXiv:2406.17557 (2024), NeurIPS 2024 Datasets and Benchmarks. El resultat de deduplicació és §3.4. El dataset publicat des d’aleshores ha crescut més enllà dels 15 bilions de tokens de l’article. ↩
-
Gao, L., Biderman, S., Black, S. et al. The Pile: An 800GB Dataset of Diverse Text for Language Modeling. arXiv:2101.00027 (2020). Books3 és §2.3 i taula 1; la taula de consentiment és la taula 5. El corpus és de 825,18 GiB, de manera que fins i tot el títol arrodoneix a la baixa. ↩
-
Bartz v. Anthropic, núm. 4:24-cv-05417 (N.D. Cal.). Ordre de fair use del 23 de juny de 2025 (Dkt. 231); certificació de classe del 17 de juliol de 2025; aprovació final i sentència del 20 de juliol de 2026 (Dkt. 680). L’acord allibera només inputs passats, no outputs ni conducta futura. ↩
-
Kadrey v. Meta, núm. 3:23-cv-03417-VC (N.D. Cal.), judici sumari del 25 de juny de 2025 (Dkt. 598). Tingues en compte que la reclamació de distribució per torrenting no es va decidir i continua viva. ↩
-
Thomson Reuters v. ROSS Intelligence, núm. 1:20-cv-00613-SB (D. Del.), opinió revisada de l’11 de febrer de 2025 (Dkt. 770), Bibas J. En apel·lació interlocutòria davant el Third Circuit (núm. 25-2153), argumentada l’11 de juny de 2026, sense decisió en el moment d’escriure. ↩
-
Perrigo, B. Exclusive: OpenAI Used Kenyan Workers on Less Than $2 Per Hour to Make ChatGPT Less Toxic. TIME, 18 de gener de 2023. Els $2 són un sostre per a revisors sèniors que complien tots els objectius; els etiquetadors júniors, la majoria, s’enduien $1.32. La rèplica de Sama, citada en el mateix article, dona $1.46–$3.74 i una quota inferior. ↩
-
Luccioni, A. S., Viguier, S. and Ligozat, A.-L. Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language Model. arXiv:2211.02001 (2022), JMLR 24(253). Taules 1 i 3. ↩
-
Patterson, D., Gonzalez, J., Le, Q., Liang, C., Munguia, L.-M., Rothchild, D., So, D., Texier, M. and Dean, J. Carbon Emissions and Large Neural Network Training. arXiv:2104.10350 (2021). Les xifres de GPT-3 són a la taula 4; la correcció de l’estimació NAS és §4.1. ↩
-
Strubell, E., Ganesh, A. and McCallum, A. Energy and Policy Considerations for Deep Learning in NLP. arXiv:1906.02243 (2019), ACL 2019. Val la pena llegir-lo precisament pel que va passar amb el seu nombre més citat: l’article és curós, declara la seva extrapolació, i tot i així es va equivocar de dos ordres de magnitud en la línia que tothom va repetir. ↩
-
Smith, S. J., Hubbard, A., Newkirk, A., Ganeshalingam, M., Holecek, B., Sartor, D., Mills, M. and Shehabi, A. United States Data Center Energy Usage Report: 2025 Update. LBNL-2001758 (18 de juny de 2026). Això revisa la sèrie històrica a la baixa respecte de l’informe de 2024 àmpliament citat; si cites la xifra de 176 TWh per a 2023, cites l’edició substituïda. ↩
-
Bender, E. M., Gebru, T., McMillan-Major, A. and Shmitchell, S. On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? FAccT '21, pp. 610–623. DOI 10.1145/3442188.3445922. «Documentation debt» és §4.4. Tingues en compte que les pròpies xifres de carboni de l’article se citen de Strubell et al. i hereten la correcció anterior — cosa que és una il·lustració del seu argument més que no pas una refutació. ↩
-
NVIDIA. Pàgina de producte NVIDIA H100 Tensor Core GPU,
nvidia.com/en-us/data-center/h100/(consultada el 2026-09-06). Cada fila de tensor cores d’aquesta pàgina excepte FP64 porta la nota «with sparsity»; la xifra BF16 densa utilitzada aquí és la meitat dels 1.979 TFLOPS publicats. ↩ -
Lambda. GPU Cloud pricing,
lambda.ai/pricing(consultat el 2026-09-06). On-demand, per GPU i hora, abans d’impostos. Els preus d’aquesta secció quedaran obsolets més ràpid que qualsevol altra cosa d’aquest curs; l’aritmètica al seu voltant, no. ↩ -
Karpathy, A.
karpathy/llm.c, discussió #481, Reproducing GPT-2 (124M) in llm.c in 90 minutes for $20 (28 de maig de 2024), i discussió #677, Let's reproduce GPT-2 (1.6B): one 8XH100 node, 24 hours, $672, in llm.c (11 de juliol de 2024). ↩ -
Karpathy, A.
karpathy/nanochat, README i leaderboard «time to GPT-2» (consultat el 2026-09-06). La xifra de $48 i la definició de «GPT-2 capability» per CORE-score són totes dues al README; el propispeedrun.shdel repositori diu «approximately 1.5 hours», així que tracta la xifra de dues hores com a arrodonida. ↩ -
Meta. Llama 3.1 model card,
models/llama3_1/MODEL_CARD.mdameta-llama/llama-models(consultat el 2026-09-06). Font dels 30,84 M H100-hores per al model 405 B, el total de 39,3 M, la xifra location-based d’11.390 tCO2eq, i el data cutoff de desembre de 2023. ↩