Preadestrar un LLM: datos, cómputo, leis de escala e custo
Vinte modelos adestrados nunha GPU de portátil para medir unha lei de escala e comprobar a estimación 6ND cun contador FLOP real.
Nesta páxina
O capítulo 9 rematou cun bloque transformer que adestra. Empilla uns cantos, apunta a perda de seguinte token do capítulo 8 á saída, e xa non queda nada por inventar. Todo o que queda é unha compra.
É un cambio maior do que parece. Todos os capítulos ata agora preguntaban aprende? — unha pregunta de si ou non que un portátil resolve en dez minutos. Este fai unha pregunta con cartos dentro: dada unha cantidade fixa de aritmética, cal é o mellor modelo que podo mercar? A resposta é unha fórmula, e en 2018 non era evidente para ninguén.
Aquí tes esa pregunta respondida por medición, nunha soa GPU de portátil. Vinte modelos, de 98.624 a 15 millóns de parámetros, adestráronse desde cero sobre 174 millóns de tokens de Wikipedia — un vocabulario BPE de 2.048-token adestrado como se adestra un no capítulo 7, o transformer do capítulo 9. Cada execución recibiu exactamente un dos tres orzamentos de cómputo e nin unha operación máis, así que un modelo máis grande necesariamente le menos texto. A mellor perda held-out acadada en cada orzamento:
budget C (FLOPs) best loss reached by a model of
1.00e13 5.3531 98,624 params
3.16e13 4.8638 98,624 params
1.00e14 4.3383 295,808 params
fitted: L = (Cc / C)^0.0913 over one decade of computeDez veces máis aritmética quítalle un 19 % á perda, e os tres puntos caen nunha recta en log-log. Nada dos nove primeiros capítulos predí iso. Non hai ningún teorema detrás: é unha regularidade empírica, que se mantén cun expoñente distinto ao longo das dez ordes de magnitude entre este portátil e un centro de datos, e é a observación única que convenceu unha industria para gastar o PIB dun país pequeno en GPUs.
Que é o pretraining, e que ten de novo
Ligazón á sección: Que é o pretraining, e que ten de novoNada cambia no obxectivo. O modelo segue predicindo o seguinte token, a perda segue sendo a entropía cruzada do capítulo 4 aplicada á factorización do capítulo 8, o optimizador segue sendo o AdamW do capítulo 6. O pretraining non é un algoritmo novo; é o mesmo algoritmo executado sobre un corpus o bastante grande como para que a execución teña que orzarse. Dúas cousas fan iso posible: as etiquetas son gratis, xa que o obxectivo para a posición é o token en e xa está no texto; e a última sección do capítulo 6 eliminou a obxección, porque un modelo con moitos máis parámetros dos que permiten as regras clásicas non se desmorona, mellora. O que sae é un modelo base: algo que continúa texto, non que responde.
Contar o cómputo antes de gastalo: 6ND
Ligazón á sección: Contar o cómputo antes de gastalo: 6NDAntes de poder orzar nada disto hai que contalo, e o campo cóntao cunha fórmula:
onde é o número de parámetros, os training tokens e o total de operacións de coma flotante. Kaplan et al. derívaa en dous pasos.1 Forward: 2 FLOPs por parámetro por token, xa que cada parámetro nunha multiplicación de matrices úsase unha vez por token, nunha multiplicación e unha suma. Backward: dúas veces o forward, xa que o backward pass do capítulo 5 calcula dous gradientes en cada capa — con respecto ás entradas da capa, para que o sinal siga viaxando, e con respecto aos seus pesos — cada un unha multiplicación de matrices do tamaño da forward, así que .
Esa é toda a derivación, e paga a pena comprobala en vez de crer nela. PyTorch trae un contador FLOP real, torch.utils.flop_counter.FlopCounterMode, que intercepta cada operación que despacha un modelo e suma o traballo real. Execútao ao longo de catro ordes de magnitude, a maior no dispositivo meta, que asigna formas e ningunha memoria:
from torch.utils.flop_counter import FlopCounterMode
counter = FlopCounterMode(display=False)
with counter:
loss = model(x, targets)[1]
loss.backward()
measured = counter.get_total_flops()
print(measured / (6 * n_params * n_tokens))| configuración | sen embeddings | total | medido, fwd+bwd | ÷ ( total) | ÷ (sen emb.) | fwd+bwd ÷ fwd |
|---|---|---|---|---|---|---|
| 128, 4 capas, 256 | 788,736 | 7,254,400 | 4.60e10 | 1.031 | 9.485 | 3.000 |
| 512, 8 capas, 256 | 25,183,232 | 51,045,888 | 3.26e11 | 1.038 | 2.104 | 3.000 |
| 768, 12 capas, 1024 | 84,973,056 | 124,356,864 | 1.75e12 | 1.145 | 1.676 | 3.000 |
| 1600, 48 capas, 1024 | 1,474,870,400 | 1,556,920,000 | 2.10e13 | 1.100 | 1.161 | 3.000 |
| 4096, 32 capas, 2048 | 6,442,983,424 | 6,582,444,032 | 8.74e13 | 1.080 | 1.104 | 3.000 |
| 8192, 80 capas, 8192 | 64,427,147,264 | 65,544,929,280 | 3.75e15 | 1.163 | 1.183 | 3.000 |
A razón forward+backward sobre forward é 3.000, exactamente, en todas as escalas: non unha aproximación que casualmente é boa, senón a identidade aritmética anterior devolta como un número redondo por un contador que non sabe nada da derivación.
O total medido queda entón entre un 3 % e un 17 % por riba de , unha vez que conta as matrices de embedding — e esa cláusula importa, porque os dous artigos fundacionais contan de maneira distinta. Kaplan exclúe «todos os embeddings de vocabulario e posicionais» porque facelo «produce scaling laws significativamente máis limpas» (§1.3); o apéndice F de Chinchilla di «tamén contamos as matrices de embeddings no reconto total de parámetros».2 Cun vocabulario amplo e unha dimensión oculta estreita, ambas cousas difiren por un factor de nove, como mostra a primeira fila.
A fenda residual é o que omite deliberadamente: as puntuacións de attention. A ecuación (2.2) de Kaplan escribe o custo forward como e elimina o segundo termo porque — seguro en 2020, menos seguro agora, e a razón pola que a razón sobe a medida que medra — polo que dúas filas aquí comparten un de 1.024 e a razón baixa, de 1.145 a 1.100, cando pasa de 768 a 1.600. É o custo que introduciu o capítulo 9 e que o capítulo 16 converte nun prezo.
Memoria: o que realmente ten que caber
Ligazón á sección: Memoria: o que realmente ten que caberO cómputo decide canto tarda unha execución; a memoria decide se pode empezar. Adestra con AdamW fp32 simple e cada parámetro leva catro números: o peso, o seu gradiente, e a media móbil e a varianza de Adam — as dúas medias construídas á man no capítulo 6. Catro números a catro bytes cada un son 16 bytes por parámetro, antes dunha soa activación. Medido nunha GPU de portátil de 8 GB, tomando a asignación residente no punto do paso onde non hai grafo vivo:
| modelo | vocabulario | batch | previsto | residente medido | pico nun paso | a diferenza | |
|---|---|---|---|---|---|---|---|
| 512, 8 capas | 50,257 | 8 | 51,045,888 | 779 MB | 801 MB | 2,500 MB | 1,699 MB |
| 512, 8 capas | 4,096 | 8 | 27,411,456 | 418 MB | 426 MB | 1,043 MB | 617 MB |
| 256, 6 capas | 4,096 | 8 | 5,839,360 | 89 MB | 89 MB | 382 MB | 293 MB |
| 256, 6 capas | 4,096 | 32 | 5,839,360 | 89 MB | 89 MB | 1,259 MB | 1,170 MB |
| 256, 6 capas | 4,096 | 128 | 5,839,360 | 89 MB | 89 MB | 4,771 MB | 4,681 MB |
Predición e medición concordan dentro dun 3 %. A sorpresa está na última columna: as activacións empequenecen o modelo. O mesmo modelo de 5,8 millóns de parámetros que necesita 89 MB de estado persistente necesita 4.681 MB de activacións cun batch de 128 — cincuenta e dúas veces o modelo — e boa parte diso nin sequera é o transformer. Son os logits, un vector do tamaño do vocabulario por token, a catro bytes por entrada: 512 MB na última fila, 393 MB na primeira. O tamaño do vocabulario escolleuse no capítulo 7, e segue decidindo que cabe na tarxeta.
Que termo domina depende da forma da execución, por iso Micikevicius et al. din que a memoria «está dominada polas activacións»3 mentres que ZeRO di que un modelo de 1.500 millóns de parámetros precisa «polo menos 24 GB» só de estados do modelo.4 ZeRO chega aos mesmos 16 bytes por outra ruta — para pesos fp16, para gradientes fp16, cada un para os pesos mestres fp32 e os dous momentos de Adam — o que para 70.000 millóns de parámetros son 1,12 terabytes, o equivalente a catorce GPUs de 80 GB antes dunha soa activación.
Paralelismo, nun parágrafo e unha delegación
Ligazón á sección: Paralelismo, nun parágrafo e unha delegaciónNada diso cabe nun só dispositivo a escala fronteira, así que a execución divídese de catro maneiras á vez. Data parallelism pon unha copia do modelo en cada GPU e media os gradientes — o estándar, e o que ZeRO mellora negándose a manter copias redundantes do estado do optimizador. Tensor parallelism divide matrices individuais entre dispositivos. Pipeline parallelism dálle a cada dispositivo un grupo contiguo de capas. Context parallelism divide a propia secuencia, necesario só cando é longo dabondo para que o termo de attention domine. A táboa 4 de Llama 3 lista os catro á vez: tensor 8, context ata 16, pipeline 16, data ata 128, sobre 16.384 GPUs H100.5 Isto é todo o que este curso dirá sobre iso; a enxeñaría de adestramento distribuído é un semestre enteiro por si soa, e Stanford CS336 é ese semestre, clases 5 a 8, con código.6 O que sobrevive á delegación é un único número, model FLOPs utilisation: a fracción da aritmética pico dunha GPU que unha execución real acada, que é o que converte o ordenado en tempo de reloxo e polo tanto en cartos.
Kaplan, e a aposta que fixo a industria
Ligazón á sección: Kaplan, e a aposta que fixo a industriaEn xaneiro de 2020, Kaplan et al. adestraron unha grella de transformers e descubriron que a perda de test segue unha lei de potencia en cada un dos tres recursos ao longo de máis de seis ordes de magnitude.1 O seu §1.2 dá tres leis axustadas:
con compañeiras para datos e para cómputo asignado de maneira óptima. As constantes non son universais, e o artigo dio: «os valores numéricos precisos de , e dependen do tamaño do vocabulario e da tokenization e polo tanto non teñen un significado fundamental».
Os expoñentes son diminutos: dez veces máis parámetros compran un factor sobre a perda restante. Iso soa a nada, e é o feito máis importante aquí: os rendementos son terribles e nunca paran. Unha lei de potencia cun expoñente pequeno promete que a seguinte orde de magnitude axudará, menos do que axudou a anterior, para sempre. Mercar cómputo deixa de ser unha aposta e convértese nunha compra cun tipo de cambio publicado, que é exactamente o argumento que desbloqueou o capital.
Logo veu a prescrición, e aquí é onde o artigo se equivocou dun xeito que lle custou moitísimos cartos á industria. A táboa 6 de Kaplan dá e : dez veces o cómputo implica un modelo 5,4 veces máis grande alimentado con só 1,9 veces máis texto. O resumo é explícito: «o adestramento óptimo en eficiencia de cómputo implica adestrar modelos moi grandes cunha cantidade relativamente modesta de datos e parar bastante antes da converxencia». O campo fixo exactamente iso: GPT-3 ten 175.000 millóns de parámetros sobre 300.000 millóns de tokens,7 Gopher 280.000 millóns sobre 300.000 millóns, Megatron-Turing NLG 530.000 millóns sobre 270.000 millóns.2 De medio token a dous tokens por parámetro, en todos os casos.
Chinchilla, e o que medía o varrido anterior
Ligazón á sección: Chinchilla, e o que medía o varrido anteriorEn marzo de 2022, Hoffmann et al. adestraron máis de 400 modelos de 70 millóns a 16.000 millóns de parámetros e chegaron á conclusión oposta por tres rutas independentes.2 A súa táboa 2 informa do expoñente en como 0,50, 0,49 e 0,46, fronte ao 0,73 de Kaplan. En termos simples: o tamaño do modelo e os datos de adestramento deberían medrar na mesma proporción.
O seu segundo enfoque é o que reproduce o varrido do comezo deste capítulo, a unha millonésima da escala: fixa un orzamento, adestra moitos tamaños exactamente con ese orzamento, debuxa a perda final contra o tamaño do modelo.
| parámetros | |||
|---|---|---|---|
| 98,624 | 5.3531 (171) | 4.8638 (542) | — |
| 150,320 | 5.4636 (74) | — | — |
| 194,208 | 5.5041 (44) | 4.8730 (140) | 4.4040 (442) |
| 295,808 | 5.5550 (19) | 4.9029 (60) | 4.3383 (190) |
| 665,280 | 5.7849 (3.8) | 5.1254 (12) | 4.4192 (38) |
| 1,280,768 | 5.8174 (1.0) | 5.1751 (3.2) | 4.5003 (10) |
| 3,101,568 | — | 5.4686 (0.5) | 4.7768 (1.7) |
| 5,315,072 | — | 5.5894 (0.2) | 4.8514 (0.6) |
| 15,053,568 | — | — | 5.3534 (0.1) |
Perda held-out en nats por token, tokens por parámetro entre parénteses, negra para o mellor modelo en cada orzamento; un guión é un punto non executado, porque o orzamento esixía máis texto do que contén o corpus ou o tamaño caía fóra dos varridos alí.
Le cara abaixo nunha columna: a perda cae, toca fondo e volve subir. Un modelo pode ser demasiado grande para o seu orzamento exactamente coa mesma facilidade que pode ser demasiado pequeno: en a penalización por escoller 665.280 parámetros fronte a 295.808 é de 0,08 nats, que na envolvente axustada enriba é a perda que un modelo co tamaño correcto acada cun 18 % menos de cómputo. Escoller a forma incorrecta tira pola borda unha quinta parte do orzamento. Iso é a figura 3 de Chinchilla nunha tarde nunha GPU en vez de con catrocentos modelos.
Agora le en horizontal. En o mellor modelo é o máis pequeno dos varridos; en son 295.808 parámetros, acoutados por ambos lados. O óptimo móvese á dereita cando medra o orzamento, que é todo o contido da corrección. Axusta o terceiro enfoque do artigo — a superficie sobre cada execución — e minimiza suxeito a :
L(N, D) = 24.7 / N^0.195 + 46.8 / D^0.169 (E fits to ~0; see below)
implied N_opt ∝ C^0.464
compare Chinchilla 0.46-0.50 · Besiroglu 0.513 · Kaplan 0.730,46, desde un portátil, fronte ao 0,73 de Kaplan. Concordar a tres díxitos desde un axuste de tres orzamentos é sorte; concordar ao primeiro non o é. O expoñente viaxa; a constante non, xa que a razón token-parámetro nestes óptimos é de 170 a 540, non 20. Tres razóns, todas instrutivas. axústase a cero porque cunha perda por riba de 4 nats a execución non está nin preto do chan de entropía que domina o axuste de Chinchilla. O tamaño de batch e a learning rate fixáronse en vez de axustarse por punto, o que prexudica as execucións con menos pasos — e esas son as dos modelos grandes: en FLOPs, un modelo de 1,28 millóns de parámetros recibe 159 pasos de optimizador en total, moi por debaixo dos poucos milleiros que o termo de Kaplan di que necesita calquera modelo. Unha lei de escala axústase dentro dun réxime, e esta está seis ordes de magnitude por debaixo da de Chinchilla.
De aí o resumo do artigo: «os large language models actuais están significativamente infraadestrados». Chinchilla é a demostración: 70.000 millóns de parámetros sobre 1,4 billóns de tokens, o mesmo cómputo total que Gopher con 280.000 millóns sobre 300.000 millóns, superándoo en 51 de 57 tarefas MMLU, 67,5 % contra 60 %.2 Catro veces máis pequeno, catro veces e media máis texto, o mesmo diñeiro, mellor modelo.
Dúas advertencias sobre esa famosa razón. «Vinte tokens por parámetro» non é unha frase do artigo, que só di que «por cada duplicación do tamaño do modelo, o número de training tokens tamén debería duplicarse»; o 20 é unha inferencia da táboa 3 e do propio Chinchilla, 70 B sobre 1,4 T. E a súa precisión é peor do publicado: Besiroglu et al. reaxustaron a partir dunha dixitalización da figura 4, descubriron que os parámetros orixinais «axustan mal os datos reconstruídos» con intervalos «implausiblemente estreitos dado o número de puntos de datos», e puxeron o rango honesto en «entre 4 e 40» tokens por parámetro.8
Un detalle do método de Chinchilla cumpre unha promesa que fixo o capítulo 1 sobre os calendarios de learning rate. O calendario coseno ten que coincidir co orzamento de tokens. Un modelo que verá 10 millóns de tokens debe facer decaer a súa learning rate a cero en 10 millóns de tokens; dálle un calendario dimensionado para 100 millóns, páralo cedo, e estarás lendo unha perda a metade da baixada cunha taxa demasiado alta. Chinchilla adestra cada modelo con catro lonxitudes de ciclo para controlar exactamente isto; o varrido anterior fixa o seu calendario a partir do orzamento pola mesma razón.
O que non prometen as scaling laws
Ligazón á sección: O que non prometen as scaling lawsSon o resultado empírico máis útil do campo e véndense por riba do que din con frecuencia. Catro límites.
Predín perda, non capacidade. O lado esquerdo é entropía cruzada sobre texto held-out. Nada nestes artigos autoriza unha afirmación sobre se un modelo escribirá SQL correcto, rexeitará unha petición daniña ou usará unha ferramenta. É de novo a lección do capítulo 5: unha predición da perda non é unha predición do comportamento polo que estás pagando.
Axústanse, non se derivan. Ningunha teoría produce . As constantes móvense co tokenizer — por iso unha comparación de perplexidade entre dous tokenizers non significa nada, como explicou o capítulo 8 — e coa mestura de datos, a arquitectura e o optimizador. Toda lei publicada é unha lei da configuración que a produciu, por iso Meta reaxustou a súa antes de Llama 3.5
Asumen un token novo para cada paso, o que en silencio asume un corpus infinito. Muennighoff et al. mediron que pasa cando se esgota: ata catro épocas de datos repetidos case non custan nada — un modelo de 8.700 millóns de parámetros sobre 44.000 millóns de tokens únicos vistos catro veces rematou con «só un 0,5 % máis de perda de validación» ca o mesmo modelo sobre 178.000 millóns de tokens únicos — mentres que pasado arredor de dezaseis épocas o cómputo adicional non compra nada.9
E xa ninguén adestra en óptimo de cómputo. Chinchilla minimiza o custo de adestrar; un modelo despregado paga logo arredor de FLOPs por token xerado, para sempre. LLaMA 1 díxoo claramente: «dado un nivel obxectivo de rendemento, o modelo preferido non é o máis rápido de adestrar senón o máis rápido en inferencia».10 Sardana et al. formalizárono minimizando no seu lugar, e descubriron que quen espere mil millóns de peticións debería adestrar «máis pequeno e máis tempo ca o óptimo de Chinchilla».11 O §9.1 de Llama 3 concorda: os seus modelos pequenos adéstranse «moito máis alá do punto de adestramento óptimo en cómputo, intercambiando efectivamente cómputo de adestramento por eficiencia de inferencia».5 A razón non está obsoleta; responde unha pregunta que xa non é a que se está facendo.
Capacidades emerxentes, e a discusión sobre se son reais
Ligazón á sección: Capacidades emerxentes, e a discusión sobre se son reaisA perda cae suavemente. As puntuacións en benchmarks ás veces non. Wei et al. recompilaron casos onde unha tarefa queda ao nivel do azar ao longo de ordes de magnitude de training compute e logo salta — a aritmética de tres díxitos aparecendo en GPT-3 arredor de FLOPs, MMLU subindo por riba de adiviñar entre e — e puxéronlle nome ao patrón: «unha capacidade é emerxente se non está presente en modelos máis pequenos pero si en modelos máis grandes».12 Se iso é unha propiedade real, extrapolar desde experimentos baratos é inseguro, porque a capacidade que mercas pode non existir en ningunha escala que poidas permitirte probar.
Schaeffer, Miranda e Koyejo argumentaron que a maior parte é un artefacto da medición, e o mecanismo é aritmético.13 A perda por token cae suavemente, así que a probabilidade de que un token sexa correcto, , mellora gradualmente. Puntúa o modelo con coincidencia exacta de cadea sobre unha resposta de tokens e elevas esa probabilidade á potencia : unha curva suave elevada a unha potencia grande semella un cantil. Cambia a unha métrica que conte tokens en vez de esixilos todos, sobre as mesmas saídas, e «o rendemento da familia mellora de maneira suave, continua e predicible coa escala crecente».
A súa auditoría é o número que hai que lembrar: «das 39 métricas preferidas en BIG-Bench, como moito 5 amosan emerxencia», con dúas métricas descontinuas responsables de máis do 92 % dos casos alegados; e tamén o é a súa cautela: «nada neste artigo debería interpretarse como unha afirmación de que os large language models non poidan amosar capacidades emerxentes». Un salto nunha gráfica é evidencia sobre a métrica ata que se demostre o contrario. O capítulo 29 é onde iso se converte no teu problema, porque escoller unha métrica de corte duro é unha decisión que tomarás sen darte conta.
De onde veñen os datos
Ligazón á sección: De onde veñen os datosO corpus é a parte dunha execución de pretraining sen ecuación asociada, e onde viven a maioría das decisións importantes. A materia prima é un rastrexo web: o arquivo de agosto de 2026 de Common Crawl contén «2,14 mil millóns de páxinas web ou 360 TiB de contido sen comprimir», un mes del, gratis para descargar.14 Case nada é usable tal como vén. O artigo de T5 di que o rastrexo «consiste en gran medida en texto sen sentido ou boilerplate como menús, mensaxes de erro ou texto duplicado», e o pipeline C4 que introduciu é unha lista de heurísticas contundentes: manter só liñas que rematen en puntuación terminal, descartar páxinas con menos de tres frases, descartar calquera páxina que conteña unha chave ou unha palabra dunha lista pública de obscenidades; así, vinte terabytes de texto mensual convértense nuns 750 GB.15
Contundentes é a palabra. Dodge et al. auditaron o que eliminan eses filtros e descubriron que a lista de bloqueo de obscenidades borra o 42 % dos documentos en inglés afroamericano e o 32 % en inglés aliñado con persoas hispanas, fronte ao 6,2 % do inglés aliñado con persoas brancas, deixando un corpus cun 97,8 % da última categoría.16 Unha regra sen opinión sobre o dialecto tiña unha.
Logo deduplicación, que non é limpeza doméstica: Lee et al. atoparon unha frase de 61 palabras repetida 61.036 veces en C4, e demostraron que deduplicar reduce por dez a taxa á que os modelos «emiten texto memorizado», do 1,9 % dos tokens xerados ao 0,19 %.17 Máis non é mellor, porén: o equipo de FineWeb deduplicou globalmente ao longo de 96 rastrexos, obtivo 4 billóns de tokens e ningunha mellora medible; logo deduplicou cada rastrexo por separado, obtivo 20 billóns, e igualou o mellor corpus existente.18
Logo contaminación. Llama 3 mediu a súa e publicouna: 98 % de AGIEval, 95 % de BIG-Bench Hard e 85 % de HellaSwag solapándose co conxunto de adestramento por 8-grams, e para MMLU un solapamento tan alto que «é imposible obter unha boa estimación da ganancia de rendemento».5 O §4 de GPT-3 informa dun erro de filtrado que deixou benchmarks nos datos sen marcha atrás: «por consideracións de custo era inviable readestrar o modelo».7
A procedencia é a parte sen resolver. The Pile distribuíu un compoñente de 100,96 GiB chamado Books3 — o 12 % do corpus e, segundo a propia táboa de consentimento do artigo, libros dun tracker torrent privado;19 retirouse en agosto de 2023 tras unha reclamación de copyright. A posición legal a setembro de 2026 segue sen resolverse, e as tres decisións estadounidenses citadas como tendencia discrepan entre si. Alsup considerou que adestrar sobre libros adquiridos legalmente era «extraordinariamente transformativo» mentres sostiña que unha biblioteca construída a partir de copias pirateadas non o era, e Anthropic pactou esa metade por $1.500 millóns cubrindo 482.460 obras, arredor de $3.000 cada unha, aprobado o 20 de xullo de 2026.20 Chhabria concedeu a Meta xuízo sumario mentres escribía que a súa decisión «non sostén a proposición de que o uso de materiais protexidos por copyright por parte de Meta para adestrar os seus modelos de linguaxe sexa lícito», senón só que «estes demandantes fixeron os argumentos incorrectos».21 Bibas, fallando contra Ross Intelligence, sinalou que «só a IA non xerativa está diante de min hoxe».22 Ningún tribunal federal de apelación dos EUA decidiu sobre a cuestión.
As persoas fan as partes que a perda non pode facer. TIME informou en xaneiro de 2023 de que traballadores que etiquetaban texto tóxico para OpenAI a través da firma Sama levaban para a casa «entre arredor de $1,32 e $2 por hora» lendo pasaxes que describían abuso sexual infantil, tortura e autolesión, mentres OpenAI pagaba a Sama $12,50 por hora polo traballo; Sama discute tanto o rango salarial como a cota.23 Iso é o filtrado arredor do pretraining máis que o pretraining en si, pero está na mesma factura, e é onde se senta unha persoa.
A electricidade é real e adoita citarse mal. A cifra publicada máis coidadosa é a de BLOOM: 1.082.990 horas-GPU, 433 MWh e 24,7 toneladas de CO₂ equivalente para a execución, 50,5 contando fabricación e nodos inactivos;24 Patterson et al. sitúan GPT-3 en 1.287 MWh e 552 toneladas.25 Dúas cautelas. A vantaxe de BLOOM é a rede nuclear francesa a 57 g CO₂ por kWh, non a eficiencia: usou máis enerxía ca OPT-175B. E a cifra de emisións máis citada do campo, as 626.155 lb de Strubell et al. para unha procura de arquitectura neural, demostrouse máis tarde que era 88 veces demasiado alta, por asumir que a procura se executaba co tamaño completo do modelo cando se executaba sobre un proxy.26 O marco de LBNL é o defendible: os centros de datos dos EUA usaron 192 TWh en 2024, o 4,7 % da electricidade nacional; un número asociado a unha industria, non a unha execución concreta.27
O fío condutor é o que Bender et al. chamaron débeda de documentación: «poñernos nunha situación na que os datasets están á vez sen documentar e son demasiado grandes para documentalos post hoc».28 Cada feito anterior existe porque alguén mirou. Para os corpus detrás dos modelos que usa a maioría da xente, ninguén pode facelo.
O que custa de verdade
Ligazón á sección: O que custa de verdadeAgora a aritmética que todo o mundo quere, a partir de catro entradas citadas, para que cando caduquen sexa obvio cal substituír.
Rendemento pico
Ligazón á sección: Rendemento picoA páxina da H100 de NVIDIA lista 1.979 teraFLOPS de throughput BF16 de tensor-core baixo unha nota ao pé que di «con sparsity».29 Ningunha execución de pretraining usa sparsity estruturada, así que a cifra densa é a metade: 989,5 TFLOP/s.
Utilización
Ligazón á sección: UtilizaciónA táboa 4 de Llama 3 informa dun 38–43 % de model FLOPs utilisation BF16. Toma 40 %: 395,8 TFLOP/s de aritmética útil por GPU.5
O prezo baixo demanda de Lambda para un nodo 8×H100 SXM, consultado o 2026-09-06: $3,99 por hora-GPU, así que $31,92 por hora para o nodo.30
A razón de Chinchilla, , dá e polo tanto .
| orzamento | horas-H100 | FLOPs | parámetros compute-optimal | tokens | nun nodo 8×H100 | GPUs para rematar en 90 días |
|---|---|---|---|---|---|---|
| $100 | 25 | 3.6e19 | 546 M | 10.9 B | 3.1 h | 1 |
| $1,000 | 251 | 3.6e20 | 1.73 B | 34.5 B | 31.3 h | 1 |
| $10,000 | 2,506 | 3.6e21 | 5.46 B | 109 B | 13 días | 2 |
| $100,000 | 25,063 | 3.6e22 | 17.3 B | 345 B | 131 días | 12 |
| $1,000,000 | 250,627 | 3.6e23 | 54.6 B | 1.09 T | 4 anos | 116 |
| $10,000,000 | 2,506,266 | 3.6e24 | 173 B | 3.45 T | 36 anos | 1,160 |
| $100,000,000 | 25,062,657 | 3.6e25 | 546 B | 10.9 T | 358 anos | 11,603 |
Le as dúas últimas columnas xuntas. Con $10.000 obtés un modelo de 5.000 millóns de parámetros nun nodo alugado nunha quincena. Con $100.000.000, a aritmética di 546.000 millóns de parámetros — e doce mil H100 conectadas durante tres meses, que non é algo que alugues cunha tarxeta de crédito. Pasados arredor de $100.000, a restrición vinculante deixa de ser o diñeiro e pasa a ser o clúster.
Antes de confiar nunha táboa así, próbaa contra execucións cuxo custo real está publicado: llm.c reproduce GPT-2 124M en «~90 minutos» nun nodo 8×A100 «por arredor de $20», e GPT-2 1.6B en 24 horas nun nodo 8×H100 por $672.31
$672, against what $672 actually bought (llm.c GPT-2 1.6B, one 8xH100 node, 24 h)
this table predicts: 168 H100-hours N = 1.41 B params D = 28.3 B tokens
what was actually run: 192 H100-hours N = 1.558 B params D = 33.6 B tokens
Llama 3 405B, against Meta's own published GPU-hours
from the paper's 3.8e25 FLOPs at 40 % MFU: 26.67 M H100-hours
published in Meta's Llama 3.1 model card: 30.84 M H100-hours ratio 0.86Ambos dentro de arredor dun 15 %, que é aproximadamente a precisión que merece este tipo de estimación e bastante mellor ca a precisión coa que adoita citarse.
A comparación titular, coas dúas definicións sobre a mesa
Ligazón á sección: A comparación titular, coas dúas definicións sobre a mesaA cifra máis repetida neste tema é que un modelo da clase GPT-2 que custaba arredor de $43.000 en 2019 pode reproducirse hoxe por unhas poucas decenas de dólares. A metade moderna está ben documentada; a histórica non.
Hoxe. README de nanochat de Karpathy: «podes adestrar o teu propio LLM con capacidade GPT-2 ... por só $48 (~2 horas de nodo GPU 8XH100) ... Nunha instancia spot, o custo total pode achegarse máis a ~$15».32 «Capacidade GPT-2» aquí é preciso e publicado: superar a puntuación CORE de GPT-2 de 0,256525, nun leaderboard cuxa mellor entrada a 14 de marzo de 2026 é 1,65 horas. Os $48 asumen $3 por hora-GPU, por debaixo dos $3,99 de lista de Lambda; a prezo de lista achégase máis a $64.
En 2019. Non hai fonte primaria: OpenAI nunca publicou unha duración nin un custo. A cadea pasa por The Register, febreiro de 2019, informando de «256 núcleos Google TPU3» sen prezo nin duración; logo Synced, xuño de 2019, sinalando que o hardware custaba $256 por hora en Google Cloud e afirmando explicitamente que «OpenAI non especificou a duración do adestramento». $43.008 son $256 por hora multiplicados por unhas 168 horas supostas que ninguén citou nunca.
Así que o titular honesto é: un modelo que iguala a puntuación de benchmark publicada de GPT-2 pode adestrarse hoxe por bastante menos de $100 en hardware alugado, fronte a un custo de 2019 que nunca se publicou e cuxa famosa estimación descansa nunha suposición sen fonte sobre a duración. O colapso é real e a metade moderna pode reproducila calquera cunha tarxeta de crédito; a razón é aritmética sobre un número que non existe. Ese é o estado dos custos de adestramento publicados en xeral. O artigo de GPT-3 non contén ningunha cantidade en dólares, só FLOPs na táboa D.1;7 o artigo de Llama 3 tampouco contén ningunha.5 Todo custo de adestramento que liches é unha estimación a partir dun reconto FLOP, unha suposición de hardware e unha suposición de prezo; sempre paga a pena preguntar de quen.
Que sabe un modelo base, e cando deixou de sabelo
Ligazón á sección: Que sabe un modelo base, e cando deixou de sabeloO que sae viu un corpus fixo ensamblado nun momento fixo, e diso despréndense dúas propiedades.
A primeira é o knowledge cutoff. Despois da data de recollida, o modelo non sabe nada — non «está inseguro», nada — e confabulará con fluidez en vez de dicilo, porque dicilo nunca foi un comportamento no que se adestrase. A model card de Llama 3.1 dá decembro de 2023;33 todo modelo ten unha, e é unha propiedade dos datos de adestramento, non do deployment. Rodealo é un problema de recuperación, que é o capítulo 19.
A segunda é que un modelo base completa máis ca responde. Dálle «Cal é a capital de Francia?» e unha continuación plausible é outra pregunta, porque no corpus esa cadea aparece máis a miúdo nunha lista de exercicios.
Cara a onde vai isto agora
Ligazón á sección: Cara a onde vai isto agoraUn completador de texto non é un asistente. Non segue instrucións, porque nada no corpus lle dixo que unha petición debe obedecerse en vez de continuarse. Non ten noción dunha conversa con dous participantes. Producirá encantado a continuación máis probable dun prompt daniño, porque probable é o único para o que foi optimizado.
Convertelo en algo que responde require unha segunda etapa que custa unha fracción de punto porcentual da primeira, e que consiste case por completo en amosarlle exemplos do comportamento que queres e logo comparar pares das súas propias saídas. Esa etapa é de onde veñen seguir instrucións, chat templates, rexeitamentos e — isto sorprende a xente — a capacidade de chamar unha ferramenta. O capítulo 11 é esa etapa: supervised fine-tuning, RLHF, DPO e GRPO, e a pregunta de que significa «aliñado» e quen o decide.
Fontes e método
Ligazón á sección: Fontes e métodoTamén paga a pena ler xunto a este capítulo o build-nanogpt de Karpathy e o seu vídeo acompañante, que percorren unha reprodución completa de GPT-2 de principio a fin a un ritmo que este capítulo non pode; e Stanford CS324, Large Language Models, cuxas clases sobre datos e impacto ambiental afondan máis ca a sección anterior nun material que este curso trata unha vez e delega.
Referencias
Ligazón á sección: Referencias-
Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J. and Amodei, D. Scaling Laws for Neural Language Models. arXiv:2001.08361 (2020). As tres leis de potencia son as ecuacións (1.1)–(1.3) en §1.2 e as constantes completas están no apéndice A, táboa 5; a derivación de está en §2.1; os expoñentes de asignación de cómputo están na táboa 6. Ten en conta que hai dúas leis de cómputo, con tamaño de batch fixo e con tamaño de batch óptimo; o artigo di que a segunda «debería usarse para facer predicións». ↩ ↩2
-
Hoffmann, J., Borgeaud, S., Mensch, A., Buchatskaya, E., Cai, T., Rutherford, E. et al. Training Compute-Optimal Large Language Models. arXiv:2203.15556 (2022). Expoñentes na táboa 2, orzamentos proxectados na táboa 3, a comparación con Gopher en §4, a convención de reconto de parámetros no apéndice F. A prosa baixo a táboa 3 discrepa coa propia táboa 3 para as filas de 175 B e 280 B; a táboa é a versión que hai que citar. ↩ ↩2 ↩3 ↩4
-
Micikevicius, P., Narang, S., Alben, J., Diamos, G., Elsen, E., Garcia, D. et al. Mixed Precision Training. arXiv:1710.03740 (2017), ICLR 2018. Pesos mestres FP32 en §3.1, loss scaling en §3.2. ↩ ↩2
-
Rajbhandari, S., Rajbhandari, S., Ruwase, O. and He, Y. ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054 (2019), SC20. A contabilidade está en §3.1; as cifras de estado residual para activacións están en §3.2. ↩
-
Grattafiori, A. et al. (Llama Team, AI @ Meta). The Llama 3 Herd of Models. arXiv:2407.21783 (2024). Orzamento de cómputo e reconto de tokens en §1, a scaling law reaxustada en §3.2.1, a configuración de paralelismo e MFU na táboa 4, a análise de contaminación en §5.1.4, a declaración de sobre-adestramento en §9.1. O artigo non contén cifras en dólares nin táboa de emisións. ↩ ↩2 ↩3 ↩4 ↩5 ↩6
-
Stanford CS336, Language Modeling from Scratch. A clase 2 cobre a contabilidade de recursos, as clases 5–8 GPUs, kernels e paralelismo, as clases 9 e 11 escala, as clases 13–14 datos. É o curso ao que este capítulo delega a súa enxeñaría, e é público. ↩
-
Brown, T. B. et al. Language Models are Few-Shot Learners. arXiv:2005.14165 (2020). Cómputo no apéndice D, táboa D.1 — que ten unha columna literalmente titulada «flops per param per token», cuxo valor para cada fila de GPT-3 é 6. Análise de contaminación en §4. ↩ ↩2 ↩3
-
Besiroglu, T., Erdil, E., Barnett, M. and You, J. Chinchilla Scaling: A replication attempt. arXiv:2404.10102 (2024). Reconstrúe os datos de Chinchilla dixitalizando a súa figura 4, reaxusta, e informa dos expoñentes corrixidos e intervalos moito máis amplos. ↩
-
Muennighoff, N., Rush, A. M., Barak, B., Le Scao, T., Piktus, A., Tazi, N., Pyysalo, S., Wolf, T. and Raffel, C. Scaling Data-Constrained Language Models. arXiv:2305.16264 (2023), NeurIPS 2023. O resultado de catro épocas está en §6; a vida media de dezaseis épocas é o axustado. ↩
-
Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T. et al. LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 (2023). §1 formula o argumento do custo de inferencia contra o adestramento óptimo de Chinchilla. ↩
-
Sardana, N., Portes, J., Doubov, S. and Frankle, J. Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws. arXiv:2401.00448 (2023), ICML 2024. O seu §5 tamén contén o contrapeso: os modelos adestrados con razóns extremas de tokens seguen mellorando, pero «máis amodo do que predín as scaling laws». ↩
-
Wei, J., Tay, Y., Bommasani, R., Raffel, C., Zoph, B., Borgeaud, S. et al. Emergent Abilities of Large Language Models. arXiv:2206.07682 (2022), TMLR. Definición en §2, exemplos e limiares de cómputo en §3–4 e táboa 1. ↩
-
Schaeffer, R., Miranda, B. and Koyejo, S. Are Emergent Abilities of Large Language Models a Mirage? arXiv:2304.15004 (2023), artigo destacado de NeurIPS 2023. O argumento da métrica está en §2, a metaanálise de BIG-Bench en §4, o exemplo visual construído en §5. ↩
-
Common Crawl, August 2026 Crawl Archive Now Available (CC-MAIN-2026-34), publicado o 24 de agosto de 2026, consultado o 2026-09-06. A súa propia portada afirma «over 300 billion pages spanning 15 years», «totalling more than 10 petabytes»: unha cifra para todo o arquivo, non para o rastrexo mensual valorado aquí. ↩
-
Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W. and Liu, P. J. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683 (2019), JMLR 21(140). Os filtros de C4 están en §2.2. O artigo dá tamaños en bytes, non en tokens; a cifra de 156.000 millóns de tokens amplamente atribuída a el vén de Dodge et al. abaixo. ↩
-
Dodge, J., Sap, M., Marasović, A., Agnew, W., Ilharco, G., Groeneveld, D., Mitchell, M. and Gardner, M. Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758 (2021), EMNLP 2021. As taxas de eliminación por dialecto están en §5.3; a contaminación de benchmarks en C4 está en §4.2. ↩
-
Lee, K., Ippolito, D., Nystrom, A., Zhang, C., Eck, D., Callison-Burch, C. and Carlini, N. Deduplicating Training Data Makes Language Models Better. arXiv:2107.06499 (2021), ACL 2022. As 61.036 repeticións están na nota ao pé 1; as cifras de memorización están en §6.2, táboa 4, e son porcentaxes de tokens xerados baixo un criterio de coincidencia exacta de 50-token. ↩
-
Penedo, G., Kydlíček, H., Ben Allal, L., Lozhkov, A., Mitchell, M., Raffel, C., Von Werra, L. and Wolf, T. The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale. arXiv:2406.17557 (2024), NeurIPS 2024 Datasets and Benchmarks. O resultado de deduplicación está en §3.4. O dataset publicado medrou desde entón máis alá dos 15 billóns de tokens do artigo. ↩
-
Gao, L., Biderman, S., Black, S. et al. The Pile: An 800GB Dataset of Diverse Text for Language Modeling. arXiv:2101.00027 (2020). Books3 está en §2.3 e táboa 1; a táboa de consentimento é a táboa 5. O corpus ten 825,18 GiB, así que mesmo o título redondea á baixa. ↩
-
Bartz v. Anthropic, No. 4:24-cv-05417 (N.D. Cal.). Orde de fair use do 23 de xuño de 2025 (Dkt. 231); certificación de clase do 17 de xullo de 2025; aprobación final e sentenza do 20 de xullo de 2026 (Dkt. 680). O acordo libera só entradas pasadas, non saídas nin conduta futura. ↩
-
Kadrey v. Meta, No. 3:23-cv-03417-VC (N.D. Cal.), xuízo sumario do 25 de xuño de 2025 (Dkt. 598). Ten en conta que a reclamación de distribución por torrenting non se decidiu e segue viva. ↩
-
Thomson Reuters v. ROSS Intelligence, No. 1:20-cv-00613-SB (D. Del.), opinión revisada do 11 de febreiro de 2025 (Dkt. 770), Bibas J. En apelación interlocutoria ante o Third Circuit (No. 25-2153), argumentada o 11 de xuño de 2026, sen decidir no momento da escrita. ↩
-
Perrigo, B. Exclusive: OpenAI Used Kenyan Workers on Less Than $2 Per Hour to Make ChatGPT Less Toxic. TIME, 18 de xaneiro de 2023. Os $2 son un teito para revisores sénior que cumprían todos os obxectivos; os etiquetadores júnior, a maioría, levaban para a casa $1,32. A réplica de Sama, citada no mesmo artigo, dá $1,46–$3,74 e unha cota menor. ↩
-
Luccioni, A. S., Viguier, S. and Ligozat, A.-L. Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language Model. arXiv:2211.02001 (2022), JMLR 24(253). Táboas 1 e 3. ↩
-
Patterson, D., Gonzalez, J., Le, Q., Liang, C., Munguia, L.-M., Rothchild, D., So, D., Texier, M. and Dean, J. Carbon Emissions and Large Neural Network Training. arXiv:2104.10350 (2021). As cifras de GPT-3 están na táboa 4; a corrección da estimación NAS está en §4.1. ↩
-
Strubell, E., Ganesh, A. and McCallum, A. Energy and Policy Considerations for Deep Learning in NLP. arXiv:1906.02243 (2019), ACL 2019. Paga a pena lelo precisamente polo que lle pasou ao seu número máis citado: o artigo é coidadoso, expón a súa extrapolación, e aínda así errou en dúas ordes de magnitude na liña que todo o mundo repetiu. ↩
-
Smith, S. J., Hubbard, A., Newkirk, A., Ganeshalingam, M., Holecek, B., Sartor, D., Mills, M. and Shehabi, A. United States Data Center Energy Usage Report: 2025 Update. LBNL-2001758 (18 de xuño de 2026). Isto revisa á baixa o informe de 2024 amplamente citado para a serie histórica; se estás citando a cifra de 176 TWh para 2023, estás citando a edición superada. ↩
-
Bender, E. M., Gebru, T., McMillan-Major, A. and Shmitchell, S. On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? FAccT '21, pp. 610–623. DOI 10.1145/3442188.3445922. «Documentation debt» está en §4.4. Ten en conta que as propias cifras de carbono do artigo se citan de Strubell et al. e herdan a corrección anterior, o que é unha ilustración do seu argumento máis ca unha refutación. ↩
-
NVIDIA. Páxina de produto NVIDIA H100 Tensor Core GPU,
nvidia.com/en-us/data-center/h100/(consultada o 2026-09-06). Todas as filas tensor-core desa páxina agás FP64 levan a nota ao pé «with sparsity»; a cifra BF16 densa usada aquí é a metade dos 1.979 TFLOPS publicados. ↩ -
Lambda. GPU Cloud pricing,
lambda.ai/pricing(consultado o 2026-09-06). Baixo demanda, por GPU por hora, antes de impostos. Os prezos desta sección caducarán máis axiña ca calquera outra cousa deste curso; a aritmética arredor deles non. ↩ -
Karpathy, A.
karpathy/llm.c, discusión #481, Reproducing GPT-2 (124M) in llm.c in 90 minutes for $20 (28 de maio de 2024), e discusión #677, Let's reproduce GPT-2 (1.6B): one 8XH100 node, 24 hours, $672, in llm.c (11 de xullo de 2024). ↩ -
Karpathy, A.
karpathy/nanochat, README e leaderboard «time to GPT-2» (consultado o 2026-09-06). A cifra de $48 e a definición por puntuación CORE de «capacidade GPT-2» están ambas no README; o propiospeedrun.shdo repositorio di «aproximadamente 1,5 horas», así que trata a cifra de dúas horas como redondeada. ↩ -
Meta. Llama 3.1 model card,
models/llama3_1/MODEL_CARD.mdenmeta-llama/llama-models(consultado o 2026-09-06). Fonte das 30,84 M horas-H100 para o modelo 405 B, o total de 39,3 M, a cifra location-based de 11.390 tCO2eq, e o data cutoff de decembro de 2023. ↩