Pretraining eines LLM: Daten, Compute, Scaling Laws und Kosten
Zwanzig Modelle auf einer Laptop-GPU: eine scaling law gemessen und die 6ND-Compute-Schätzung mit einem echten FLOP-Zähler geprüft.
Auf dieser Seite
Kapitel 9 endete mit einem transformer-Block, der trainiert. Staple ein paar davon, richte den Next-token-Loss aus Kapitel 8 auf die Ausgabe, und es bleibt nichts mehr zu erfinden. Alles, was übrig bleibt, ist ein Kauf.
Das ist ein größerer Umschwung, als es klingt. Jedes Kapitel bisher fragte: Lernt es? — eine Ja-oder-Nein-Frage, die ein Laptop in zehn Minuten klärt. Dieses Kapitel stellt eine Frage, in der Geld steckt: Wenn eine feste Menge an Arithmetik gegeben ist, was ist das beste Modell, das ich kaufen kann? Die Antwort ist eine Formel, und 2018 war sie für niemanden offensichtlich.
Hier ist diese Frage durch Messung beantwortet, auf einer einzigen Laptop-GPU. Zwanzig Modelle, von 98.624 bis 15 Millionen Parametern, wurden von Grund auf auf 174 Millionen token aus Wikipedia trainiert — ein BPE-Vokabular mit 2.048 token, trainiert so, wie Kapitel 7 eines trainiert, der transformer aus Kapitel 9. Jeder Lauf bekam genau eines von drei Compute-Budgets und keine Operation mehr, sodass ein größeres Modell notwendigerweise weniger Text liest. Der beste Held-out-Loss, der bei jedem Budget erreicht wurde:
budget C (FLOPs) best loss reached by a model of
1.00e13 5.3531 98,624 params
3.16e13 4.8638 98,624 params
1.00e14 4.3383 295,808 params
fitted: L = (Cc / C)^0.0913 over one decade of computeZehnmal so viel Arithmetik senkt den Loss um 19 %, und die drei Punkte liegen in log-log auf einer geraden Linie. Nichts in den ersten neun Kapiteln sagt das voraus. Es gibt keinen Satz dahinter — es ist eine empirische Regelmäßigkeit, die mit einem anderen Exponenten über die zehn Größenordnungen zwischen diesem Laptop und einem Rechenzentrum hinweg gilt, und es ist die eine Beobachtung, die eine Branche davon überzeugt hat, das BIP eines kleinen Landes für GPUs auszugeben.
Was pretraining ist und was daran neu ist
Link zum Abschnitt: Was pretraining ist und was daran neu istAm Ziel ändert sich nichts. Das Modell sagt weiterhin den nächsten token voraus, der Loss ist weiterhin die Cross-Entropy aus Kapitel 4, angewandt auf die Faktorisierung aus Kapitel 8, der Optimierer ist weiterhin AdamW aus Kapitel 6. Pretraining ist kein neuer Algorithmus; es ist derselbe Algorithmus, ausgeführt auf einem Korpus, der groß genug ist, dass der Lauf budgetiert werden muss. Zwei Dinge machen das möglich: Die Labels sind kostenlos, weil das Ziel für Position der token bei ist und bereits im Text steht; und der letzte Abschnitt von Kapitel 6 hat den Einwand beseitigt, denn ein Modell mit weit mehr Parametern, als die klassischen Regeln erlauben, fällt nicht auseinander, sondern wird besser. Heraus kommt ein Basismodell — etwas, das Text fortsetzt, statt zu antworten.
Compute zählen, bevor man ihn ausgibt: 6ND
Link zum Abschnitt: Compute zählen, bevor man ihn ausgibt: 6NDBevor irgendetwas budgetiert werden kann, muss es gezählt werden, und das Feld zählt es mit einer Formel:
wobei die Parameterzahl ist, die Training-token und die gesamten Floating-Point-Operationen. Kaplan et al. leiten sie in zwei Schritten her.1 Forward: 2 FLOPs pro Parameter pro token, weil jeder Parameter in einer Matrixmultiplikation einmal pro token verwendet wird, in einer Multiplikation und einer Addition. Backward: doppelt so viel wie Forward, weil der Backward-Pass aus Kapitel 5 in jeder Schicht zwei Gradienten berechnet — in Bezug auf die Eingaben der Schicht, damit das Signal weiterläuft, und in Bezug auf ihre Gewichte — jeweils eine Matrixmultiplikation in der Größe der Forward-Multiplikation, also .
Das ist die ganze Herleitung, und es lohnt sich, sie zu prüfen, statt sie zu glauben. PyTorch bringt einen echten FLOP-Zähler mit, torch.utils.flop_counter.FlopCounterMode, der jede Operation abfängt, die ein Modell ausführt, und die tatsächliche Arbeit aufsummiert. Führt man ihn über vier Größenordnungen aus, die größte auf dem meta-Device, das Shapes, aber keinen Speicher alloziert:
from torch.utils.flop_counter import FlopCounterMode
counter = FlopCounterMode(display=False)
with counter:
loss = model(x, targets)[1]
loss.backward()
measured = counter.get_total_flops()
print(measured / (6 * n_params * n_tokens))| Konfiguration | ohne embeddings | gesamt | gemessen, fwd+bwd | ÷ (gesamt ) | ÷ (ohne emb.) | fwd+bwd ÷ fwd |
|---|---|---|---|---|---|---|
| 128, 4 Schichten, 256 | 788.736 | 7.254.400 | 4.60e10 | 1.031 | 9.485 | 3.000 |
| 512, 8 Schichten, 256 | 25.183.232 | 51.045.888 | 3.26e11 | 1.038 | 2.104 | 3.000 |
| 768, 12 Schichten, 1024 | 84.973.056 | 124.356.864 | 1.75e12 | 1.145 | 1.676 | 3.000 |
| 1600, 48 Schichten, 1024 | 1.474.870.400 | 1.556.920.000 | 2.10e13 | 1.100 | 1.161 | 3.000 |
| 4096, 32 Schichten, 2048 | 6.442.983.424 | 6.582.444.032 | 8.74e13 | 1.080 | 1.104 | 3.000 |
| 8192, 80 Schichten, 8192 | 64.427.147.264 | 65.544.929.280 | 3.75e15 | 1.163 | 1.183 | 3.000 |
Das Verhältnis von Forward+Backward zu Forward ist 3.000, exakt, in jeder Größenordnung: keine Näherung, die zufällig gut ist, sondern die arithmetische Identität oben, als runde Zahl von einem Zähler zurückgegeben, der nichts über die Herleitung weiß.
Die gemessene Gesamtsumme liegt dann zwischen 3 % und 17 % über , sobald die embedding-Matrizen mitzählt — und dieser Nebensatz ist wichtig, weil die beiden Gründungspapiere unterschiedlich zählen. Kaplan schließt „all vocabulary and positional embeddings“ aus, weil das „produces significantly cleaner scaling laws“ (§1.3); Chinchillas Appendix F sagt: „we also count embeddings matrices in the total parameter count“.2 Bei einem breiten Vokabular und einer schmalen Hidden-Dimension unterscheiden sich die beiden um den Faktor neun, wie die erste Zeile zeigt.
Die verbleibende Lücke ist das, was absichtlich auslässt: die attention-Scores. Kaplans Gl. (2.2) schreibt die Forward-Kosten als und lässt den zweiten Term fallen, weil — 2020 sicher, heute weniger sicher, und der Grund, warum das Verhältnis nach oben driftet, wenn wächst — weshalb zwei Zeilen hier ein von 1.024 teilen und das Verhältnis fällt, von 1.145 auf 1.100, wenn von 768 auf 1.600 steigt. Es sind die -Kosten, die Kapitel 9 eingeführt hat und die Kapitel 16 in einen Preis verwandelt.
Speicher: was wirklich hineinpassen muss
Link zum Abschnitt: Speicher: was wirklich hineinpassen mussCompute entscheidet, wie lange ein Lauf dauert; Speicher entscheidet, ob er starten kann. Trainiert man mit schlichtem fp32 AdamW, trägt jeder Parameter vier Zahlen: das Gewicht, seinen Gradienten und Adams laufenden Mittelwert und Varianz — die zwei Mittelwerte, die Kapitel 6 von Hand aufgebaut hat. Vier Zahlen zu je vier Bytes sind 16 Bytes pro Parameter, noch vor einer einzigen Aktivierung. Gemessen auf einer 8-GB-Laptop-GPU, mit der residenten Allokation an dem Punkt im Schritt, an dem kein Graph mehr lebt:
| Modell | Vokabular | batch | vorhergesagt | resident gemessen | Peak in einem Schritt | die Differenz | |
|---|---|---|---|---|---|---|---|
| 512, 8 Schichten | 50.257 | 8 | 51.045.888 | 779 MB | 801 MB | 2.500 MB | 1.699 MB |
| 512, 8 Schichten | 4.096 | 8 | 27.411.456 | 418 MB | 426 MB | 1.043 MB | 617 MB |
| 256, 6 Schichten | 4.096 | 8 | 5.839.360 | 89 MB | 89 MB | 382 MB | 293 MB |
| 256, 6 Schichten | 4.096 | 32 | 5.839.360 | 89 MB | 89 MB | 1.259 MB | 1.170 MB |
| 256, 6 Schichten | 4.096 | 128 | 5.839.360 | 89 MB | 89 MB | 4.771 MB | 4.681 MB |
Vorhersage und Messung stimmen auf 3 % genau überein. Die Überraschung ist die letzte Spalte: Die Aktivierungen stellen das Modell in den Schatten. Dasselbe Modell mit 5,8 Millionen Parametern, das 89 MB persistenten Zustand braucht, benötigt bei einem batch von 128 ganze 4.681 MB Aktivierungen — zweiundfünfzigmal so viel wie das Modell — und vieles davon ist gar nicht der transformer. Es sind die logits, ein Vektor in Vokabulargröße pro token zu vier Bytes je Eintrag: 512 MB in der letzten Zeile, 393 MB in der ersten. Die Vokabulargröße wurde in Kapitel 7 gewählt, und sie entscheidet immer noch, was auf die Karte passt.
Welcher Term dominiert, hängt von der Form des Laufs ab; deshalb sagen Micikevicius et al., Speicher werde „is dominated by activations“3, während ZeRO sagt, ein Modell mit 1,5 Milliarden Parametern brauche „at least 24 GB“ allein für Modellzustände.4 ZeRO kommt auf anderem Weg zu denselben 16 Bytes — für fp16-Gewichte, für fp16-Gradienten, jeweils für die fp32-Master-Gewichte und Adams zwei Momente — was bei 70 Milliarden Parametern 1,12 Terabyte ergibt, vierzehn 80-GB-GPUs wert, noch vor einer einzigen Aktivierung.
Parallelismus, in einem Absatz und einer Delegation
Link zum Abschnitt: Parallelismus, in einem Absatz und einer DelegationNichts davon passt auf Frontier-Skala auf ein einzelnes Device, also wird der Lauf gleichzeitig auf vier Arten aufgeteilt. Data parallelism legt eine Kopie des Modells auf jede GPU und mittelt die Gradienten — der Standardfall und der, den ZeRO verbessert, indem es sich weigert, redundante Kopien des Optimiererzustands zu halten. Tensor parallelism teilt einzelne Matrizen auf Devices auf. Pipeline parallelism gibt jedem Device eine zusammenhängende Gruppe von Schichten. Context parallelism teilt die Sequenz selbst auf, nötig erst dann, wenn lang genug ist, dass der attention-Term dominiert. Tabelle 4 von Llama 3 listet alle vier gleichzeitig: tensor 8, context bis 16, pipeline 16, data bis 128, über 16.384 H100-GPUs.5 Mehr wird dieser Kurs dazu nicht sagen; Engineering für verteiltes Training ist ein eigenes Semester, und Stanfords CS336 ist dieses Semester, Vorlesungen 5 bis 8, samt Code.6 Was nach der Delegation übrig bleibt, ist eine einzige Zahl, model FLOPs utilisation — der Anteil der Peak-Arithmetik einer GPU, den ein echter Lauf erreicht — und sie verwandelt das ordentliche in Wanduhrzeit und damit in Geld.
Kaplan und die Wette, die die Branche einging
Link zum Abschnitt: Kaplan und die Wette, die die Branche eingingIm Januar 2020 trainierten Kaplan et al. ein Raster von transformers und fanden, dass der Test-Loss über mehr als sechs Größenordnungen einem Potenzgesetz in jeder der drei Ressourcen folgt.1 Ihr §1.2 gibt drei gefittete Gesetze:
mit Begleitern für Daten und für optimal zugeteilten Compute. Die Konstanten sind nicht universell, und das Paper sagt das auch: „the precise numerical values of , and depend on the vocabulary size and tokenization and hence do not have a fundamental meaning.“
Die Exponenten sind winzig: Zehnmal so viele Parameter kaufen einen Faktor vom verbleibenden Loss herunter. Das klingt nach nichts, und genau das ist hier die wichtigste Tatsache — die Erträge sind miserabel, und sie hören nie auf. Ein Potenzgesetz mit kleinem Exponenten verspricht, dass die nächste Größenordnung hilft, weniger als die letzte, aber für immer. Compute zu kaufen hört auf, ein Glücksspiel zu sein, und wird zu einem Kauf mit veröffentlichtem Wechselkurs; genau dieses Argument hat das Kapital freigesetzt.
Dann kam die Vorschrift, und hier lag das Paper auf eine Weise falsch, die die Branche sehr viel Geld kostete. Kaplans Tabelle 6 gibt und : Zehnmal so viel Compute bedeutet ein 5,4-mal größeres Modell, gefüttert mit nur 1,9-mal so viel Text. Das Abstract ist ausdrücklich — „optimally compute-efficient training involves training very large models on a relatively modest amount of data and stopping significantly before convergence.“ Das Feld tat genau das: GPT-3 hat 175 Milliarden Parameter auf 300 Milliarden token,7 Gopher 280 Milliarden auf 300 Milliarden, Megatron-Turing NLG 530 Milliarden auf 270 Milliarden.2 Ein halber token bis zwei token pro Parameter, überall.
Chinchilla und was der Sweep oben gemessen hat
Link zum Abschnitt: Chinchilla und was der Sweep oben gemessen hatIm März 2022 trainierten Hoffmann et al. über 400 Modelle von 70 Millionen bis 16 Milliarden Parametern und kamen auf drei unabhängigen Wegen zum gegenteiligen Schluss.2 Ihre Tabelle 2 berichtet den Exponenten in als 0,50, 0,49 und 0,46, gegenüber Kaplans 0,73. Klar gesagt: Modellgröße und Trainingsdaten sollten im gleichen Verhältnis wachsen.
Ihr zweiter Ansatz ist der, den der Sweep am Anfang dieses Kapitels in einem Millionstel der Größenordnung reproduziert: ein Budget fixieren, viele Größen exakt mit diesem Budget trainieren, den finalen Loss gegen die Modellgröße plotten.
| Parameter | |||
|---|---|---|---|
| 98.624 | 5.3531 (171) | 4.8638 (542) | — |
| 150.320 | 5.4636 (74) | — | — |
| 194.208 | 5.5041 (44) | 4.8730 (140) | 4.4040 (442) |
| 295.808 | 5.5550 (19) | 4.9029 (60) | 4.3383 (190) |
| 665.280 | 5.7849 (3.8) | 5.1254 (12) | 4.4192 (38) |
| 1.280.768 | 5.8174 (1.0) | 5.1751 (3.2) | 4.5003 (10) |
| 3.101.568 | — | 5.4686 (0.5) | 4.7768 (1.7) |
| 5.315.072 | — | 5.5894 (0.2) | 4.8514 (0.6) |
| 15.053.568 | — | — | 5.3534 (0.1) |
Held-out-Loss in nats pro token, token pro Parameter in Klammern, fett für das beste Modell bei jedem Budget; ein Strich ist ein nicht ausgeführter Punkt, weil das Budget mehr Text verlangte, als der Korpus enthält, oder die Größe außerhalb der dort gesweepten lag.
Lies eine Spalte hinunter: Der Loss fällt, erreicht ein Minimum und steigt wieder. Ein Modell kann für sein Budget genauso leicht zu groß sein wie zu klein — bei beträgt die Strafe dafür, 665.280 Parameter statt 295.808 zu wählen, 0,08 nats; auf der oben gefitteten Hüllkurve ist das der Loss, den ein korrekt dimensioniertes Modell mit 18 % weniger Compute erreicht. Die falsche Form zu wählen wirft ein Fünftel des Budgets weg. Das ist Chinchillas Abbildung 3 an einem Nachmittag auf einer GPU statt mit vierhundert Modellen.
Jetzt lies quer. Bei ist das beste Modell das kleinste im Sweep; bei hat es 295.808 Parameter, auf beiden Seiten eingerahmt. Das Optimum wandert nach rechts, wenn das Budget wächst, und das ist der gesamte Inhalt der Korrektur. Fitte den dritten Ansatz des Papers — die Fläche über alle Läufe — und minimiere unter der Nebenbedingung :
L(N, D) = 24.7 / N^0.195 + 46.8 / D^0.169 (E fits to ~0; see below)
implied N_opt ∝ C^0.464
compare Chinchilla 0.46-0.50 · Besiroglu 0.513 · Kaplan 0.730,46, von einem Laptop, gegenüber Kaplans 0,73. Übereinstimmung auf drei Stellen aus einem Drei-Budget-Fit ist Glück; Übereinstimmung auf die erste ist es nicht. Der Exponent reist — die Konstante nicht, denn das token-zu-Parameter-Verhältnis an diesen Optima liegt bei 170 bis 540, nicht 20. Drei Gründe, alle lehrreich. fittet auf null, weil der Lauf bei einem Loss über 4 nats nirgendwo in der Nähe des Entropiebodens liegt, der Chinchillas Fit dominiert. Batchgröße und Lernrate wurden fixiert, statt pro Punkt getunt, was die Läufe benachteiligt, die die wenigsten Schritte bekommen — und das sind die großen Modelle: Bei FLOPs bekommt ein Modell mit 1,28 Millionen Parametern insgesamt 159 Optimierer-Schritte, weit unter den paar tausend, die Kaplans -Term jedem Modell zuschreibt. Eine scaling law wird innerhalb eines Regimes gefittet, und diese hier liegt sechs Größenordnungen unter Chinchilla.
Daher das Abstract des Papers: „current large language models are significantly undertrained“. Chinchilla ist die Demonstration — 70 Milliarden Parameter auf 1,4 Billionen token, derselbe Gesamt-Compute wie Gophers 280 Milliarden auf 300 Milliarden, und besser in 51 von 57 MMLU-Aufgaben, 67,5 % gegen 60 %.2 Viermal kleiner, viereinhalbmal mehr Text, gleiches Geld, besseres Modell.
Zwei Vorbehalte zu diesem berühmten Verhältnis. „Zwanzig token pro Parameter“ ist kein Satz im Paper, das nur sagt, dass „for every doubling of model size the number of training tokens should also be doubled“; die 20 ist eine Schlussfolgerung aus Tabelle 3 und aus Chinchillas eigenen 70 B auf 1,4 T. Und ihre Präzision ist schlechter als veröffentlicht: Besiroglu et al. refitteten anhand einer Digitalisierung von Abbildung 4, fanden, dass die ursprünglichen Parameter „fit the reconstructed data poorly“ mit Intervallen, die „implausibly tight given the number of data points“ seien, und setzten den ehrlichen Bereich auf „between 4 and 40“ token pro Parameter.8
Ein Detail von Chinchillas Methode löst ein Versprechen ein, das Kapitel 1 zu Lernraten-Schedules gegeben hat. Der Cosine-Schedule muss zum token-Budget passen. Ein Modell, das 10 Millionen token sehen wird, muss seine Lernrate bei 10 Millionen token auf null absenken; gib ihm einen Schedule für 100 Millionen, stoppe ihn früh, und du liest einen Loss mitten im Abstieg bei einer viel zu hohen Rate. Chinchilla trainiert jedes Modell mit vier Zykluslängen, um genau das zu kontrollieren; der Sweep oben setzt seinen Schedule aus demselben Grund aus dem Budget.
Was scaling laws nicht versprechen
Link zum Abschnitt: Was scaling laws nicht versprechenSie sind das nützlichste empirische Ergebnis im Feld und werden regelmäßig überverkauft. Vier Grenzen.
Sie sagen Loss voraus, nicht Fähigkeit. Die linke Seite ist Cross-Entropy auf Held-out-Text. Nichts in diesen Papers legitimiert eine Behauptung darüber, ob ein Modell korrektes SQL schreibt, eine schädliche Anfrage ablehnt oder ein Tool benutzt. Das ist wieder die Lektion aus Kapitel 5: Eine Vorhersage des Loss ist keine Vorhersage des Verhaltens, für das du bezahlst.
Sie sind gefittet, nicht hergeleitet. Keine Theorie erzeugt . Die Konstanten bewegen sich mit dem tokenizer — weshalb ein Perplexity-Vergleich über zwei tokenizer hinweg bedeutungslos ist, wie Kapitel 8 erklärt hat — und mit Datenmischung, Architektur und Optimierer. Jedes veröffentlichte Gesetz ist ein Gesetz des Setups, das es erzeugt hat, weshalb Meta vor Llama 3 sein eigenes neu gefittet hat.5
Sie nehmen für jeden Schritt einen frischen token an, was stillschweigend einen unendlichen Korpus voraussetzt. Muennighoff et al. maßen, was passiert, wenn er ausgeht: Bis zu vier Epochen wiederholter Daten kosten fast nichts — ein Modell mit 8,7 Milliarden Parametern auf 44 Milliarden einzigartigen token, viermal gesehen, endete mit „only 0.5 % higher validation loss“ als dasselbe Modell auf 178 Milliarden einzigartigen token — während nach etwa sechzehn Epochen zusätzlicher Compute nichts mehr kauft.9
Und niemand trainiert mehr compute-optimal. Chinchilla minimiert die Kosten des Trainings; ein deploytes Modell zahlt danach ungefähr FLOPs pro generiertem token, für immer. LLaMA 1 sagte es klar: „given a target level of performance, the preferred model is not the fastest to train but the fastest at inference“.10 Sardana et al. formalisierten es, indem sie stattdessen minimierten, und fanden, dass jeder, der eine Milliarde Anfragen erwartet, „smaller and longer than Chinchilla-optimal“ trainieren sollte.11 Llama 3s §9.1 stimmt zu: Seine kleinen Modelle trainieren „far beyond the point of compute optimal training, effectively trading training compute for inference efficiency“.5 Das Verhältnis ist nicht obsolet; es beantwortet eine Frage, die nicht mehr die gestellte ist.
Emergente Fähigkeiten und der Streit darüber, ob sie real sind
Link zum Abschnitt: Emergente Fähigkeiten und der Streit darüber, ob sie real sindLoss fällt glatt. Benchmark-Scores tun das manchmal nicht. Wei et al. sammelten Fälle, in denen eine Aufgabe über Größenordnungen von Trainings-Compute hinweg auf Zufallsniveau bleibt und dann springt — dreistellige Arithmetik, die in GPT-3 bei etwa FLOPs erscheint, MMLU, das zwischen und über Rateniveau steigt — und gaben dem Muster einen Namen: „an ability is emergent if it is not present in smaller models but is present in larger models“.12 Wenn das eine reale Eigenschaft ist, ist Extrapolation aus billigen Experimenten unsicher, denn die Fähigkeit, die du kaufst, existiert vielleicht in keiner Größenordnung, die du dir zu testen leisten kannst.
Schaeffer, Miranda und Koyejo argumentierten, dass das meiste davon ein Messartefakt ist, und der Mechanismus ist Arithmetik.13 Per-token-Loss fällt glatt, also verbessert sich die Wahrscheinlichkeit, dass ein token richtig ist, , graduell. Bewertet man das Modell mit exact string match über eine Antwort mit token und erhebt diese Wahrscheinlichkeit zur Potenz — eine glatte Kurve, auf eine große Potenz gehoben, sieht aus wie eine Klippe. Ersetzt man sie auf denselben Ausgaben durch eine Metrik, die token zählt, statt alle zu verlangen, dann „the family's performance smoothly, continuously and predictably improves with increasing scale“.
Ihr Audit ist die Zahl, die man behalten sollte — „of the 39 preferred metrics in BIG-Bench, at most 5 display emergence“, wobei zwei diskontinuierliche Metriken über 92 % der behaupteten Fälle ausmachen — und ebenso ihre Warnung: „nothing in this paper should be interpreted as claiming that large language models cannot display emergent abilities“. Ein Sprung in einem Diagramm ist zunächst Evidenz über die Metrik, bis anderes gezeigt wird. Kapitel 29 ist der Ort, an dem das zu deinem Problem wird, weil die Wahl einer Hard-Cutoff-Metrik eine Entscheidung ist, die du treffen wirst, ohne es zu merken.
Woher die Daten kommen
Link zum Abschnitt: Woher die Daten kommenDer Korpus ist der Teil eines pretraining-Laufs, an dem keine Gleichung hängt, und der Ort, an dem die meisten folgenreichen Entscheidungen liegen. Das Rohmaterial ist ein Web-Crawl: Common Crawls Archiv vom August 2026 enthält „2.14 billion web pages or 360 TiB of uncompressed content“, einen Monat davon, kostenlos herunterladbar.14 Fast nichts davon ist in diesem Zustand brauchbar. Das T5-Paper sagt, der Crawl „largely comprises gibberish or boiler-plate text like menus, error messages, or duplicate text“, und die darin eingeführte C4-Pipeline ist eine Liste grober Heuristiken — nur Zeilen behalten, die mit Satzschlusszeichen enden, Seiten mit weniger als drei Sätzen verwerfen, jede Seite mit einer geschweiften Klammer oder einem Wort aus einer öffentlichen Obszönitätenliste verwerfen — wodurch aus zwanzig Terabyte monatlichem Text etwa 750 GB werden.15
Grob ist das Wort. Dodge et al. auditierten, was diese Filter entfernen, und fanden, dass die Obszönitäten-Blockliste 42 % der Dokumente in African-American English und 32 % in Hispanic-aligned English löscht, gegenüber 6,2 % von White-aligned English, wodurch ein Korpus zurückbleibt, der zu 97,8 % aus der letzten Kategorie besteht.16 Eine Regel ohne Meinung über Dialekt hatte eine.
Dann Deduplication, die keine Haushaltsführung ist: Lee et al. fanden einen Satz mit 61 Wörtern, der in C4 61.036-mal wiederholt wurde, und zeigten, dass deduplication die Rate, mit der Modelle „emit memorized text“, um den Faktor zehn senkt, von 1,9 % der generierten token auf 0,19 %.17 Mehr ist jedoch nicht besser — das FineWeb-Team deduplizierte global über 96 Crawls, erhielt 4 Billionen token und keinen messbaren Gewinn; dann deduplizierte es jeden Crawl separat, erhielt 20 Billionen und erreichte den besten bestehenden Korpus.18
Dann Kontamination. Llama 3 maß seine eigene und veröffentlichte sie: 98 % von AGIEval, 95 % von BIG-Bench Hard und 85 % von HellaSwag überlappten per 8-Gramme mit dem Trainingsset, und bei MMLU war die Überlappung so hoch, dass „it is impossible to get a good performance gain estimate“.5 GPT-3s §4 berichtet von einem Filterbug, der Benchmarks in den Daten ließ, ohne Weg zurück: „because of cost considerations it was infeasible to retrain the model“.7
Provenienz ist der ungelöste Teil. The Pile enthielt eine 100,96-GiB-Komponente namens Books3 — 12 % des Korpus und, laut Einwilligungstabelle des Papers selbst, Bücher aus einem privaten Torrent-Tracker;19 sie wurde im August 2023 nach einer Urheberrechtsbeschwerde offline genommen. Die Rechtslage im September 2026 ist ungeklärt, und die drei als Trend zitierten US-Entscheidungen widersprechen einander. Alsup befand, Training auf rechtmäßig erworbenen Büchern sei „exceedingly transformative“, hielt aber eine aus raubkopierten Kopien gebaute Bibliothek für nicht rechtmäßig, und Anthropic verglich diesen Teil für $1,5 Milliarden für 482.460 Werke, ungefähr $3.000 je Werk, genehmigt am 20. Juli 2026.20 Chhabria gewährte Meta summary judgment, schrieb aber, seine Entscheidung „does not stand for the proposition that Meta's use of copyrighted materials to train its language models is lawful“, sondern nur, dass „these plaintiffs made the wrong arguments“.21 Bibas, der gegen Ross Intelligence entschied, merkte an, dass „only non-generative AI is before me today“.22 Kein US-Berufungsgericht hat über die Frage entschieden.
Menschen erledigen die Teile, die der Loss nicht kann. TIME berichtete im Januar 2023, dass Arbeiter, die toxischen Text für OpenAI über die Firma Sama labelten, „between around $1.32 and $2 per hour“ mit nach Hause nahmen, während sie Passagen über sexuellen Kindesmissbrauch, Folter und Selbstverletzung lasen, während OpenAI Sama $12,50 pro Stunde für die Arbeit zahlte; Sama bestreitet sowohl die Lohnspanne als auch die Quote.23 Das ist die Filterung rund um pretraining, nicht pretraining selbst — aber sie steht auf derselben Rechnung, und dort sitzt ein Mensch.
Der Strom ist real und wird meist falsch zitiert. Die sorgfältigste veröffentlichte Zahl ist BLOOMs: 1.082.990 GPU-Stunden, 433 MWh und 24,7 Tonnen CO₂-Äquivalent für den Lauf, 50,5 inklusive Herstellung und idle Nodes;24 Patterson et al. setzen GPT-3 auf 1.287 MWh und 552 Tonnen.25 Zwei Warnungen. BLOOMs Vorteil ist das französische Atomstromnetz mit 57 g CO₂ pro kWh, nicht Effizienz — es verbrauchte mehr Energie als OPT-175B. Und die meistzitierte Emissionszahl des Feldes, Strubell et al.s 626.155 lb für eine Neural Architecture Search, wurde später als 88-mal zu hoch gezeigt, weil angenommen worden war, die Suche sei mit voller Modellgröße gelaufen, obwohl sie auf einem Proxy lief.26 LBNLs Rahmung ist die vertretbare: US-Rechenzentren verbrauchten 2024 192 TWh, 4,7 % des nationalen Stroms — eine Zahl, die an einer Branche hängt, nicht an irgendeinem einzelnen Lauf.27
Der rote Faden ist das, was Bender et al. documentation debt nannten: „putting ourselves in a situation where the datasets are both undocumented and too large to document post hoc“.28 Jede Tatsache oben existiert, weil jemand hingesehen hat. Bei den Korpora hinter den Modellen, die die meisten Menschen verwenden, kann niemand das tun.
Was es tatsächlich kostet
Link zum Abschnitt: Was es tatsächlich kostetJetzt die Arithmetik, die alle wollen, aus vier zitierten Eingaben, damit klar ist, welche ersetzt werden müssen, wenn sie veralten.
Peak-Durchsatz
Link zum Abschnitt: Peak-DurchsatzNVIDIAs H100-Seite listet 1.979 teraFLOPS BF16-Tensor-Core-Durchsatz unter einer Fußnote „with sparsity“.29 Kein pretraining-Lauf nutzt strukturierte Sparsity, also ist die dichte Zahl die Hälfte davon: 989,5 TFLOP/s.
Auslastung
Link zum Abschnitt: AuslastungLlama 3s Tabelle 4 berichtet 38–43 % BF16 model FLOPs utilisation. Nimm 40 %: 395,8 TFLOP/s nützliche Arithmetik pro GPU.5
Lambdas On-demand-Preis für einen 8×H100-SXM-Node, abgerufen am 2026-09-06: $3,99 pro GPU-Stunde, also $31,92 pro Stunde für den Node.30
Chinchillas Verhältnis, , ergibt und damit .
| Budget | H100-Stunden | FLOPs | compute-optimale Parameter | token | auf einem 8×H100-Node | GPUs für Abschluss in 90 Tagen |
|---|---|---|---|---|---|---|
| $100 | 25 | 3.6e19 | 546 M | 10.9 B | 3,1 h | 1 |
| $1.000 | 251 | 3.6e20 | 1.73 B | 34.5 B | 31,3 h | 1 |
| $10.000 | 2.506 | 3.6e21 | 5.46 B | 109 B | 13 Tage | 2 |
| $100.000 | 25.063 | 3.6e22 | 17.3 B | 345 B | 131 Tage | 12 |
| $1.000.000 | 250.627 | 3.6e23 | 54.6 B | 1.09 T | 4 Jahre | 116 |
| $10.000.000 | 2.506.266 | 3.6e24 | 173 B | 3.45 T | 36 Jahre | 1.160 |
| $100.000.000 | 25.062.657 | 3.6e25 | 546 B | 10.9 T | 358 Jahre | 11.603 |
Lies die letzten beiden Spalten zusammen. Für $10.000 bekommst du ein Modell mit 5 Milliarden Parametern auf einem gemieteten Node in zwei Wochen. Bei $100.000.000 sagt die Arithmetik 546 Milliarden Parameter — und zwölftausend H100s, drei Monate lang zusammengeschaltet, was man nicht mit Kreditkarte mietet. Ab etwa $100.000 hört die bindende Nebenbedingung auf, Geld zu sein, und wird zum Cluster.
Bevor du einer solchen Tabelle vertraust, teste sie gegen Läufe, deren reale Kosten veröffentlicht sind — llm.c reproduziert GPT-2 124M in „~90 minutes“ auf einem 8×A100-Node „for about $20“ und GPT-2 1.6B in 24 Stunden auf einem 8×H100-Node für $672.31
$672, against what $672 actually bought (llm.c GPT-2 1.6B, one 8xH100 node, 24 h)
this table predicts: 168 H100-hours N = 1.41 B params D = 28.3 B tokens
what was actually run: 192 H100-hours N = 1.558 B params D = 33.6 B tokens
Llama 3 405B, against Meta's own published GPU-hours
from the paper's 3.8e25 FLOPs at 40 % MFU: 26.67 M H100-hours
published in Meta's Llama 3.1 model card: 30.84 M H100-hours ratio 0.86Beide liegen innerhalb von etwa 15 %, was ungefähr die Genauigkeit ist, die diese Art von Schätzung verdient, und erheblich besser als die Genauigkeit, mit der sie üblicherweise zitiert wird.
Der Headline-Vergleich, mit beiden Definitionen auf dem Tisch
Link zum Abschnitt: Der Headline-Vergleich, mit beiden Definitionen auf dem TischDie am häufigsten wiederholte Zahl in diesem Thema ist, dass ein GPT-2-Klasse-Modell, das 2019 etwa $43.000 kostete, heute für ein paar Dutzend Dollar reproduziert werden kann. Die moderne Hälfte ist gut dokumentiert; die historische Hälfte nicht.
Heute. Karpathys nanochat-README: „you can train your own GPT-2 capability LLM ... for only $48 (~2 hours of 8XH100 GPU node) ... On a spot instance, the total cost can be closer to ~$15.“32 „GPT-2 capability“ ist hier präzise und veröffentlicht — besser als GPT-2s CORE-Score von 0.256525 — auf einem Leaderboard, dessen bester Eintrag am 14. März 2026 bei 1,65 Stunden liegt. Die $48 setzen $3 pro GPU-Stunde voraus, unter Lambdas Listenpreis von $3,99; zum Listenpreis sind es eher $64.
2019. Es gibt keine Primärquelle: OpenAI hat nie eine Dauer oder Kosten veröffentlicht. Die Kette läuft über The Register, Februar 2019, mit „256 Google TPU3 cores“ ohne Preis und ohne Dauer; dann Synced, Juni 2019, mit dem Hinweis, dass die Hardware $256 pro Stunde auf Google Cloud kostete, und der ausdrücklichen Aussage, dass „OpenAI didn't specify the training duration“. $43.008 sind $256 pro Stunde mal angenommene 168 Stunden, für die noch nie eine Quelle genannt wurde.
Die ehrliche Headline lautet also: Ein Modell, das GPT-2s veröffentlichten Benchmark-Score erreicht, kann heute für deutlich unter $100 auf gemieteter Hardware trainiert werden, gegenüber einem Kostenpunkt von 2019, der nie veröffentlicht wurde und dessen berühmte Schätzung auf einer unbelegten Annahme über die Dauer beruht. Der Kollaps ist real, und die moderne Hälfte ist für jeden mit Kreditkarte reproduzierbar; das Verhältnis ist Arithmetik auf einer Zahl, die nicht existiert. Das ist generell der Stand veröffentlichter Trainingskosten. Das GPT-3-Paper enthält überhaupt keinen Dollarbetrag, nur FLOPs in Tabelle D.1;7 das Llama-3-Paper ebenfalls nicht.5 Jeder Trainingspreis, den du gelesen hast, ist eine Schätzung aus FLOP-Zahl, Hardware-Annahme und Preisannahme — immer wert zu fragen, von wem.
Was ein Basismodell weiß und wann es aufgehört hat, es zu wissen
Link zum Abschnitt: Was ein Basismodell weiß und wann es aufgehört hat, es zu wissenWas herauskommt, hat einen festen Korpus gesehen, der zu einem festen Zeitpunkt zusammengestellt wurde, und daraus folgen zwei Eigenschaften.
Die erste ist der knowledge cutoff. Nach dem Sammeldatum weiß das Modell nichts — nicht „ist unsicher“, sondern nichts — und es wird flüssig konfabulieren, statt das zu sagen, weil dieses Verhalten nie trainiert wurde. Llama 3.1s Model Card nennt Dezember 2023;33 jedes Modell hat so etwas, und es ist eine Eigenschaft der Trainingsdaten, nicht des Deployments. Der Workaround dafür ist ein Retrieval-Problem, und das ist Kapitel 19.
Die zweite ist, dass ein Basismodell vervollständigt, statt zu antworten. Gib ihm „Was ist die Hauptstadt von Frankreich?“ und eine plausible Fortsetzung ist eine weitere Frage, weil diese Zeichenkette im Korpus meistens in Aufgabenlisten vorkommt.
Wohin es als Nächstes geht
Link zum Abschnitt: Wohin es als Nächstes gehtEin Textvervollständiger ist kein Assistent. Er folgt keinen Anweisungen, weil nichts im Korpus ihm gesagt hat, dass eine Anfrage befolgt statt fortgesetzt werden soll. Er hat keinen Begriff von einem Gespräch mit zwei Beteiligten. Er wird bereitwillig die wahrscheinlichste Fortsetzung eines schädlichen prompt produzieren, weil wahrscheinlich das Einzige ist, worauf er jemals optimiert wurde.
Ihn in etwas zu verwandeln, das antwortet, braucht eine zweite Stufe, die einen Bruchteil eines Prozents der ersten kostet und fast vollständig daraus besteht, ihm Beispiele für das gewünschte Verhalten zu zeigen und dann Paare seiner eigenen Ausgaben zu vergleichen. Aus dieser Stufe kommen Instruction Following, Chat-Templates, Ablehnungen und — das überrascht viele — die Fähigkeit, ein Tool aufzurufen. Kapitel 11 ist diese Stufe: supervised fine-tuning, RLHF, DPO und GRPO sowie die Frage, was „aligned“ bedeutet und wer das entscheidet.
Quellen und Methode
Link zum Abschnitt: Quellen und MethodeEbenfalls lesenswert neben diesem Kapitel: Karpathys build-nanogpt und das begleitende Video, die eine vollständige GPT-2-Reproduktion von Anfang bis Ende in einem Tempo durchgehen, das dieses Kapitel nicht leisten kann; und Stanford CS324, Large Language Models, dessen Vorlesungen zu Daten und Umweltwirkungen tiefer in Material einsteigen, das dieser Kurs einmal behandelt und dann delegiert.
Referenzen
Link zum Abschnitt: Referenzen-
Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J. and Amodei, D. Scaling Laws for Neural Language Models. arXiv:2001.08361 (2020). Die drei Potenzgesetze sind Gl. (1.1)–(1.3) in §1.2 und die vollständigen Konstanten stehen in Appendix A, Tabelle 5; die -Herleitung ist §2.1; die Compute-Allokations-Exponenten stehen in Tabelle 6. Beachte, dass es zwei Compute-Gesetze gibt, bei fixer Batchgröße und bei optimaler Batchgröße; das Paper sagt, Letzteres „should be used to make predictions“. ↩ ↩2
-
Hoffmann, J., Borgeaud, S., Mensch, A., Buchatskaya, E., Cai, T., Rutherford, E. et al. Training Compute-Optimal Large Language Models. arXiv:2203.15556 (2022). Exponenten in Tabelle 2, projizierte Budgets in Tabelle 3, der Gopher-Vergleich in §4, die Konvention zur Parameterzählung in Appendix F. Der Fließtext unter Tabelle 3 widerspricht Tabelle 3 selbst für die 175-B- und 280-B-Zeilen; die Tabelle ist die zitierfähige Version. ↩ ↩2 ↩3 ↩4
-
Micikevicius, P., Narang, S., Alben, J., Diamos, G., Elsen, E., Garcia, D. et al. Mixed Precision Training. arXiv:1710.03740 (2017), ICLR 2018. FP32-Master-Gewichte in §3.1, Loss Scaling in §3.2. ↩ ↩2
-
Rajbhandari, S., Rajbhandari, S., Ruwase, O. and He, Y. ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054 (2019), SC20. Die -Buchhaltung ist §3.1; die Restzustandszahlen für Aktivierungen sind §3.2. ↩
-
Grattafiori, A. et al. (Llama Team, AI @ Meta). The Llama 3 Herd of Models. arXiv:2407.21783 (2024). Compute-Budget und token-Zahl in §1, die neu gefittete scaling law in §3.2.1, die Parallelismus-Konfiguration und MFU in Tabelle 4, die Kontaminationsanalyse in §5.1.4, die Over-Training-Aussage in §9.1. Das Paper enthält keine Dollarzahlen und keine Emissionstabelle. ↩ ↩2 ↩3 ↩4 ↩5 ↩6
-
Stanford CS336, Language Modeling from Scratch. Vorlesung 2 behandelt Ressourcenbuchhaltung, Vorlesungen 5–8 GPUs, Kernels und Parallelismus, Vorlesungen 9 und 11 Scaling, Vorlesungen 13–14 Daten. Es ist der Kurs, an den dieses Kapitel sein Engineering delegiert, und er ist öffentlich. ↩
-
Brown, T. B. et al. Language Models are Few-Shot Learners. arXiv:2005.14165 (2020). Compute in Appendix D, Tabelle D.1 — die eine Spalte hat, die wörtlich „flops per param per token“ heißt und deren Wert für jede GPT-3-Zeile 6 ist. Kontaminationsanalyse in §4. ↩ ↩2 ↩3
-
Besiroglu, T., Erdil, E., Barnett, M. and You, J. Chinchilla Scaling: A replication attempt. arXiv:2404.10102 (2024). Rekonstruiert Chinchillas Daten durch Digitalisierung von Abbildung 4, fittet neu und berichtet die korrigierten Exponenten und deutlich breitere Intervalle. ↩
-
Muennighoff, N., Rush, A. M., Barak, B., Le Scao, T., Piktus, A., Tazi, N., Pyysalo, S., Wolf, T. and Raffel, C. Scaling Data-Constrained Language Models. arXiv:2305.16264 (2023), NeurIPS 2023. Das Vier-Epochen-Ergebnis ist §6; die Sechzehn-Epochen-Halbwertszeit ist das gefittete . ↩
-
Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T. et al. LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 (2023). §1 nennt das Inferenzkosten-Argument gegen Chinchilla-optimales Training. ↩
-
Sardana, N., Portes, J., Doubov, S. and Frankle, J. Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws. arXiv:2401.00448 (2023), ICML 2024. Ihr §5 enthält auch das Gegengewicht: Modelle, die mit extremen token-Verhältnissen trainiert werden, verbessern sich weiter, aber „more slowly than scaling laws predict“. ↩
-
Wei, J., Tay, Y., Bommasani, R., Raffel, C., Zoph, B., Borgeaud, S. et al. Emergent Abilities of Large Language Models. arXiv:2206.07682 (2022), TMLR. Definition in §2, Beispiele und Compute-Schwellen in §3–4 und Tabelle 1. ↩
-
Schaeffer, R., Miranda, B. and Koyejo, S. Are Emergent Abilities of Large Language Models a Mirage? arXiv:2304.15004 (2023), NeurIPS 2023 outstanding paper. Das Metrikargument ist §2, die BIG-Bench-Metaanalyse §4, das konstruierte Vision-Beispiel §5. ↩
-
Common Crawl, August 2026 Crawl Archive Now Available (CC-MAIN-2026-34), veröffentlicht am 24. August 2026, abgerufen 2026-09-06. Die eigene Startseite behauptet „over 300 billion pages spanning 15 years“, „totalling more than 10 petabytes“ — eine Zahl für das gesamte Archiv, nicht für den hier bepreisten monatlichen Crawl. ↩
-
Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W. and Liu, P. J. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683 (2019), JMLR 21(140). Die C4-Filter sind §2.2. Das Paper gibt Größen in Bytes an, nicht in token; die ihm oft zugeschriebene Zahl von 156 Milliarden token stammt von Dodge et al. unten. ↩
-
Dodge, J., Sap, M., Marasović, A., Agnew, W., Ilharco, G., Groeneveld, D., Mitchell, M. and Gardner, M. Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758 (2021), EMNLP 2021. Dialekt-Entfernungsraten sind §5.3; Benchmark-Kontamination in C4 ist §4.2. ↩
-
Lee, K., Ippolito, D., Nystrom, A., Zhang, C., Eck, D., Callison-Burch, C. and Carlini, N. Deduplicating Training Data Makes Language Models Better. arXiv:2107.06499 (2021), ACL 2022. Die 61.036 Wiederholungen sind Fußnote 1; die Memorierungszahlen sind §6.2, Tabelle 4, und sind Prozentsätze generierter token unter einem 50-token-exact-match-Kriterium. ↩
-
Penedo, G., Kydlíček, H., Ben Allal, L., Lozhkov, A., Mitchell, M., Raffel, C., Von Werra, L. and Wolf, T. The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale. arXiv:2406.17557 (2024), NeurIPS 2024 Datasets and Benchmarks. Das Deduplication-Ergebnis ist §3.4. Der veröffentlichte Datensatz ist seitdem über die 15 Billionen token des Papers hinausgewachsen. ↩
-
Gao, L., Biderman, S., Black, S. et al. The Pile: An 800GB Dataset of Diverse Text for Language Modeling. arXiv:2101.00027 (2020). Books3 ist §2.3 und Tabelle 1; die Einwilligungstabelle ist Tabelle 5. Der Korpus umfasst 825,18 GiB, also ist sogar der Titel abgerundet. ↩
-
Bartz v. Anthropic, No. 4:24-cv-05417 (N.D. Cal.). Fair-Use-Order 23. Juni 2025 (Dkt. 231); class certification 17. Juli 2025; final approval and judgment 20. Juli 2026 (Dkt. 680). Der Vergleich umfasst nur vergangene Inputs, nicht Outputs und nicht zukünftiges Verhalten. ↩
-
Kadrey v. Meta, No. 3:23-cv-03417-VC (N.D. Cal.), summary judgment 25. Juni 2025 (Dkt. 598). Beachte, dass der Distributionsanspruch über Torrenting nicht entschieden wurde und weiterhin anhängig ist. ↩
-
Thomson Reuters v. ROSS Intelligence, No. 1:20-cv-00613-SB (D. Del.), revised opinion 11. Februar 2025 (Dkt. 770), Bibas J. Im interlocutory appeal beim Third Circuit (No. 25-2153), verhandelt am 11. Juni 2026, zum Zeitpunkt des Schreibens unentschieden. ↩
-
Perrigo, B. Exclusive: OpenAI Used Kenyan Workers on Less Than $2 Per Hour to Make ChatGPT Less Toxic. TIME, 18. Januar 2023. Die $2 sind eine Obergrenze für Senior-Reviewer, die jedes Ziel erreichten; Junior-Labeler, die Mehrheit, nahmen $1,32 mit nach Hause. Samas im selben Artikel zitierte Erwiderung nennt $1,46–$3,74 und eine niedrigere Quote. ↩
-
Luccioni, A. S., Viguier, S. and Ligozat, A.-L. Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language Model. arXiv:2211.02001 (2022), JMLR 24(253). Tabellen 1 und 3. ↩
-
Patterson, D., Gonzalez, J., Le, Q., Liang, C., Munguia, L.-M., Rothchild, D., So, D., Texier, M. and Dean, J. Carbon Emissions and Large Neural Network Training. arXiv:2104.10350 (2021). GPT-3s Zahlen sind Tabelle 4; die Korrektur der NAS-Schätzung ist §4.1. ↩
-
Strubell, E., Ganesh, A. and McCallum, A. Energy and Policy Considerations for Deep Learning in NLP. arXiv:1906.02243 (2019), ACL 2019. Gerade wegen dessen, was mit seiner meistzitierten Zahl passiert ist, lohnt es sich, das Paper genau zu lesen: Es ist sorgfältig, benennt seine Extrapolation und lag bei der einen Zeile, die alle wiederholten, trotzdem um zwei Größenordnungen falsch. ↩
-
Smith, S. J., Hubbard, A., Newkirk, A., Ganeshalingam, M., Holecek, B., Sartor, D., Mills, M. and Shehabi, A. United States Data Center Energy Usage Report: 2025 Update. LBNL-2001758 (18. Juni 2026). Dies revidiert den vielzitierten Bericht von 2024 für die historische Reihe nach unten; wenn du die Zahl von 176 TWh für 2023 zitierst, zitierst du die überholte Ausgabe. ↩
-
Bender, E. M., Gebru, T., McMillan-Major, A. and Shmitchell, S. On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? FAccT '21, pp. 610–623. DOI 10.1145/3442188.3445922. „Documentation debt“ ist §4.4. Beachte, dass die eigenen Kohlenstoffzahlen des Papers von Strubell et al. zitiert sind und die Korrektur oben erben — was eher eine Illustration seines Arguments ist als eine Widerlegung. ↩
-
NVIDIA. NVIDIA H100 Tensor Core GPU Produktseite,
nvidia.com/en-us/data-center/h100/(abgerufen 2026-09-06). Jede Tensor-Core-Zeile auf dieser Seite außer FP64 trägt die Fußnote „with sparsity“; die hier verwendete dichte BF16-Zahl ist die Hälfte der veröffentlichten 1.979 TFLOPS. ↩ -
Lambda. GPU Cloud pricing,
lambda.ai/pricing(abgerufen 2026-09-06). On-demand, pro GPU und Stunde, vor Steuern. Preise in diesem Abschnitt veralten schneller als alles andere in diesem Kurs; die Arithmetik darum nicht. ↩ -
Karpathy, A.
karpathy/llm.c, Diskussion #481, Reproducing GPT-2 (124M) in llm.c in 90 minutes for $20 (28. Mai 2024), und Diskussion #677, Let's reproduce GPT-2 (1.6B): one 8XH100 node, 24 hours, $672, in llm.c (11. Juli 2024). ↩ -
Karpathy, A.
karpathy/nanochat, README und „time to GPT-2“-Leaderboard (abgerufen 2026-09-06). Die $48-Zahl und die CORE-Score-Definition von „GPT-2 capability“ stehen beide im README; das eigenespeedrun.shdes Repositorys sagt „approximately 1.5 hours“, also behandle die Zwei-Stunden-Zahl als gerundet. ↩ -
Meta. Llama 3.1 model card,
models/llama3_1/MODEL_CARD.mdinmeta-llama/llama-models(abgerufen 2026-09-06). Quelle der 30,84 M H100-Stunden für das 405-B-Modell, der insgesamt 39,3 M, der standortbasierten 11.390-tCO2eq-Zahl und des Daten-cutoffs Dezember 2023. ↩