Zum Inhalt springen
10/30Kapitel 10 von 30

Pretraining eines LLM: Daten, Compute, Scaling Laws und Kosten

Zwanzig Modelle auf einer Laptop-GPU: eine scaling law gemessen und die 6ND-Compute-Schätzung mit einem echten FLOP-Zähler geprüft.

Auf dieser Seite

Kapitel 9 endete mit einem transformer-Block, der trainiert. Staple ein paar davon, richte den Next-token-Loss aus Kapitel 8 auf die Ausgabe, und es bleibt nichts mehr zu erfinden. Alles, was übrig bleibt, ist ein Kauf.

Das ist ein größerer Umschwung, als es klingt. Jedes Kapitel bisher fragte: Lernt es? — eine Ja-oder-Nein-Frage, die ein Laptop in zehn Minuten klärt. Dieses Kapitel stellt eine Frage, in der Geld steckt: Wenn eine feste Menge an Arithmetik gegeben ist, was ist das beste Modell, das ich kaufen kann? Die Antwort ist eine Formel, und 2018 war sie für niemanden offensichtlich.

Hier ist diese Frage durch Messung beantwortet, auf einer einzigen Laptop-GPU. Zwanzig Modelle, von 98.624 bis 15 Millionen Parametern, wurden von Grund auf auf 174 Millionen token aus Wikipedia trainiert — ein BPE-Vokabular mit 2.048 token, trainiert so, wie Kapitel 7 eines trainiert, der transformer aus Kapitel 9. Jeder Lauf bekam genau eines von drei Compute-Budgets und keine Operation mehr, sodass ein größeres Modell notwendigerweise weniger Text liest. Der beste Held-out-Loss, der bei jedem Budget erreicht wurde:

TEXT
budget C (FLOPs)   best loss   reached by a model of
       1.00e13       5.3531           98,624 params
       3.16e13       4.8638           98,624 params
       1.00e14       4.3383          295,808 params

fitted:  L = (Cc / C)^0.0913     over one decade of compute

Zehnmal so viel Arithmetik senkt den Loss um 19 %, und die drei Punkte liegen in log-log auf einer geraden Linie. Nichts in den ersten neun Kapiteln sagt das voraus. Es gibt keinen Satz dahinter — es ist eine empirische Regelmäßigkeit, die mit einem anderen Exponenten über die zehn Größenordnungen zwischen diesem Laptop und einem Rechenzentrum hinweg gilt, und es ist die eine Beobachtung, die eine Branche davon überzeugt hat, das BIP eines kleinen Landes für GPUs auszugeben.

Am Ziel ändert sich nichts. Das Modell sagt weiterhin den nächsten token voraus, der Loss ist weiterhin die Cross-Entropy aus Kapitel 4, angewandt auf die Faktorisierung aus Kapitel 8, der Optimierer ist weiterhin AdamW aus Kapitel 6. Pretraining ist kein neuer Algorithmus; es ist derselbe Algorithmus, ausgeführt auf einem Korpus, der groß genug ist, dass der Lauf budgetiert werden muss. Zwei Dinge machen das möglich: Die Labels sind kostenlos, weil das Ziel für Position tt der token bei t+1t+1 ist und bereits im Text steht; und der letzte Abschnitt von Kapitel 6 hat den Einwand beseitigt, denn ein Modell mit weit mehr Parametern, als die klassischen Regeln erlauben, fällt nicht auseinander, sondern wird besser. Heraus kommt ein Basismodell — etwas, das Text fortsetzt, statt zu antworten.

Compute zählen, bevor man ihn ausgibt: 6ND

Link zum Abschnitt: Compute zählen, bevor man ihn ausgibt: 6ND

Bevor irgendetwas budgetiert werden kann, muss es gezählt werden, und das Feld zählt es mit einer Formel:

C6NDC \approx 6ND

wobei NN die Parameterzahl ist, DD die Training-token und CC die gesamten Floating-Point-Operationen. Kaplan et al. leiten sie in zwei Schritten her.1 Forward: 2 FLOPs pro Parameter pro token, weil jeder Parameter in einer Matrixmultiplikation einmal pro token verwendet wird, in einer Multiplikation und einer Addition. Backward: doppelt so viel wie Forward, weil der Backward-Pass aus Kapitel 5 in jeder Schicht zwei Gradienten berechnet — in Bezug auf die Eingaben der Schicht, damit das Signal weiterläuft, und in Bezug auf ihre Gewichte — jeweils eine Matrixmultiplikation in der Größe der Forward-Multiplikation, also 4N4N.

Das ist die ganze Herleitung, und es lohnt sich, sie zu prüfen, statt sie zu glauben. PyTorch bringt einen echten FLOP-Zähler mit, torch.utils.flop_counter.FlopCounterMode, der jede Operation abfängt, die ein Modell ausführt, und die tatsächliche Arbeit aufsummiert. Führt man ihn über vier Größenordnungen aus, die größte auf dem meta-Device, das Shapes, aber keinen Speicher alloziert:

flops.pyPYTHON
from torch.utils.flop_counter import FlopCounterMode

counter = FlopCounterMode(display=False)
with counter:                       
    loss = model(x, targets)[1]     
    loss.backward()                 
measured = counter.get_total_flops()
print(measured / (6 * n_params * n_tokens))
KonfigurationNN ohne embeddingsNN gesamtgemessen, fwd+bwd÷ 6ND6ND (gesamt NN)÷ 6ND6ND (ohne emb.)fwd+bwd ÷ fwd
dd 128, 4 Schichten, TT 256788.7367.254.4004.60e101.0319.4853.000
dd 512, 8 Schichten, TT 25625.183.23251.045.8883.26e111.0382.1043.000
dd 768, 12 Schichten, TT 102484.973.056124.356.8641.75e121.1451.6763.000
dd 1600, 48 Schichten, TT 10241.474.870.4001.556.920.0002.10e131.1001.1613.000
dd 4096, 32 Schichten, TT 20486.442.983.4246.582.444.0328.74e131.0801.1043.000
dd 8192, 80 Schichten, TT 819264.427.147.26465.544.929.2803.75e151.1631.1833.000

Das Verhältnis von Forward+Backward zu Forward ist 3.000, exakt, in jeder Größenordnung: keine Näherung, die zufällig gut ist, sondern die arithmetische Identität oben, als runde Zahl von einem Zähler zurückgegeben, der nichts über die Herleitung weiß.

Die gemessene Gesamtsumme liegt dann zwischen 3 % und 17 % über 6ND6ND, sobald NN die embedding-Matrizen mitzählt — und dieser Nebensatz ist wichtig, weil die beiden Gründungspapiere NN unterschiedlich zählen. Kaplan schließt „all vocabulary and positional embeddings“ aus, weil das „produces significantly cleaner scaling laws“ (§1.3); Chinchillas Appendix F sagt: „we also count embeddings matrices in the total parameter count“.2 Bei einem breiten Vokabular und einer schmalen Hidden-Dimension unterscheiden sich die beiden um den Faktor neun, wie die erste Zeile zeigt.

Die verbleibende Lücke ist das, was 6ND6ND absichtlich auslässt: die attention-Scores. Kaplans Gl. (2.2) schreibt die Forward-Kosten als 2N+2nlayernctxdmodel2N + 2\,n_{\text{layer}} n_{\text{ctx}} d_{\text{model}} und lässt den zweiten Term fallen, weil dmodelnctx/12d_{\text{model}} \gg n_{\text{ctx}}/12 — 2020 sicher, heute weniger sicher, und der Grund, warum das Verhältnis nach oben driftet, wenn T/dT/d wächst — weshalb zwei Zeilen hier ein TT von 1.024 teilen und das Verhältnis fällt, von 1.145 auf 1.100, wenn dd von 768 auf 1.600 steigt. Es sind die O(T2)O(T^2)-Kosten, die Kapitel 9 eingeführt hat und die Kapitel 16 in einen Preis verwandelt.

Compute entscheidet, wie lange ein Lauf dauert; Speicher entscheidet, ob er starten kann. Trainiert man mit schlichtem fp32 AdamW, trägt jeder Parameter vier Zahlen: das Gewicht, seinen Gradienten und Adams laufenden Mittelwert mm und Varianz vv — die zwei Mittelwerte, die Kapitel 6 von Hand aufgebaut hat. Vier Zahlen zu je vier Bytes sind 16 Bytes pro Parameter, noch vor einer einzigen Aktivierung. Gemessen auf einer 8-GB-Laptop-GPU, mit der residenten Allokation an dem Punkt im Schritt, an dem kein Graph mehr lebt:

ModellVokabularbatchNN16N16N vorhergesagtresident gemessenPeak in einem Schrittdie Differenz
dd 512, 8 Schichten50.257851.045.888779 MB801 MB2.500 MB1.699 MB
dd 512, 8 Schichten4.096827.411.456418 MB426 MB1.043 MB617 MB
dd 256, 6 Schichten4.09685.839.36089 MB89 MB382 MB293 MB
dd 256, 6 Schichten4.096325.839.36089 MB89 MB1.259 MB1.170 MB
dd 256, 6 Schichten4.0961285.839.36089 MB89 MB4.771 MB4.681 MB

Vorhersage und Messung stimmen auf 3 % genau überein. Die Überraschung ist die letzte Spalte: Die Aktivierungen stellen das Modell in den Schatten. Dasselbe Modell mit 5,8 Millionen Parametern, das 89 MB persistenten Zustand braucht, benötigt bei einem batch von 128 ganze 4.681 MB Aktivierungen — zweiundfünfzigmal so viel wie das Modell — und vieles davon ist gar nicht der transformer. Es sind die logits, ein Vektor in Vokabulargröße pro token zu vier Bytes je Eintrag: 512 MB in der letzten Zeile, 393 MB in der ersten. Die Vokabulargröße wurde in Kapitel 7 gewählt, und sie entscheidet immer noch, was auf die Karte passt.

Welcher Term dominiert, hängt von der Form des Laufs ab; deshalb sagen Micikevicius et al., Speicher werde „is dominated by activations“3, während ZeRO sagt, ein Modell mit 1,5 Milliarden Parametern brauche „at least 24 GB“ allein für Modellzustände.4 ZeRO kommt auf anderem Weg zu denselben 16 Bytes — 2Ψ2\Psi für fp16-Gewichte, 2Ψ2\Psi für fp16-Gradienten, jeweils 4Ψ4\Psi für die fp32-Master-Gewichte und Adams zwei Momente — was bei 70 Milliarden Parametern 1,12 Terabyte ergibt, vierzehn 80-GB-GPUs wert, noch vor einer einzigen Aktivierung.

Parallelismus, in einem Absatz und einer Delegation

Link zum Abschnitt: Parallelismus, in einem Absatz und einer Delegation

Nichts davon passt auf Frontier-Skala auf ein einzelnes Device, also wird der Lauf gleichzeitig auf vier Arten aufgeteilt. Data parallelism legt eine Kopie des Modells auf jede GPU und mittelt die Gradienten — der Standardfall und der, den ZeRO verbessert, indem es sich weigert, redundante Kopien des Optimiererzustands zu halten. Tensor parallelism teilt einzelne Matrizen auf Devices auf. Pipeline parallelism gibt jedem Device eine zusammenhängende Gruppe von Schichten. Context parallelism teilt die Sequenz selbst auf, nötig erst dann, wenn TT lang genug ist, dass der attention-Term dominiert. Tabelle 4 von Llama 3 listet alle vier gleichzeitig: tensor 8, context bis 16, pipeline 16, data bis 128, über 16.384 H100-GPUs.5 Mehr wird dieser Kurs dazu nicht sagen; Engineering für verteiltes Training ist ein eigenes Semester, und Stanfords CS336 ist dieses Semester, Vorlesungen 5 bis 8, samt Code.6 Was nach der Delegation übrig bleibt, ist eine einzige Zahl, model FLOPs utilisation — der Anteil der Peak-Arithmetik einer GPU, den ein echter Lauf erreicht — und sie verwandelt das ordentliche 6ND6ND in Wanduhrzeit und damit in Geld.

Kaplan und die Wette, die die Branche einging

Link zum Abschnitt: Kaplan und die Wette, die die Branche einging

Im Januar 2020 trainierten Kaplan et al. ein Raster von transformers und fanden, dass der Test-Loss über mehr als sechs Größenordnungen einem Potenzgesetz in jeder der drei Ressourcen folgt.1 Ihr §1.2 gibt drei gefittete Gesetze:

L(N)=(NcN)αN,αN0.076,Nc8.8×1013L(N) = \left(\frac{N_c}{N}\right)^{\alpha_N}, \qquad \alpha_N \approx 0.076, \qquad N_c \approx 8.8 \times 10^{13}

mit Begleitern αD0.095\alpha_D \approx 0.095 für Daten und αCmin0.050\alpha_C^{\min} \approx 0.050 für optimal zugeteilten Compute. Die Konstanten sind nicht universell, und das Paper sagt das auch: „the precise numerical values of NcN_c, CcminC_c^{\min} and DcD_c depend on the vocabulary size and tokenization and hence do not have a fundamental meaning.“

Die Exponenten sind winzig: Zehnmal so viele Parameter kaufen einen Faktor 100.0761.1910^{0.076} \approx 1.19 vom verbleibenden Loss herunter. Das klingt nach nichts, und genau das ist hier die wichtigste Tatsache — die Erträge sind miserabel, und sie hören nie auf. Ein Potenzgesetz mit kleinem Exponenten verspricht, dass die nächste Größenordnung hilft, weniger als die letzte, aber für immer. Compute zu kaufen hört auf, ein Glücksspiel zu sein, und wird zu einem Kauf mit veröffentlichtem Wechselkurs; genau dieses Argument hat das Kapital freigesetzt.

Dann kam die Vorschrift, und hier lag das Paper auf eine Weise falsch, die die Branche sehr viel Geld kostete. Kaplans Tabelle 6 gibt NoptC0.73N_{\text{opt}} \propto C^{0.73} und DoptC0.27D_{\text{opt}} \propto C^{0.27}: Zehnmal so viel Compute bedeutet ein 5,4-mal größeres Modell, gefüttert mit nur 1,9-mal so viel Text. Das Abstract ist ausdrücklich — „optimally compute-efficient training involves training very large models on a relatively modest amount of data and stopping significantly before convergence.“ Das Feld tat genau das: GPT-3 hat 175 Milliarden Parameter auf 300 Milliarden token,7 Gopher 280 Milliarden auf 300 Milliarden, Megatron-Turing NLG 530 Milliarden auf 270 Milliarden.2 Ein halber token bis zwei token pro Parameter, überall.

Chinchilla und was der Sweep oben gemessen hat

Link zum Abschnitt: Chinchilla und was der Sweep oben gemessen hat

Im März 2022 trainierten Hoffmann et al. über 400 Modelle von 70 Millionen bis 16 Milliarden Parametern und kamen auf drei unabhängigen Wegen zum gegenteiligen Schluss.2 Ihre Tabelle 2 berichtet den Exponenten aa in NoptCaN_{\text{opt}} \propto C^{a} als 0,50, 0,49 und 0,46, gegenüber Kaplans 0,73. Klar gesagt: Modellgröße und Trainingsdaten sollten im gleichen Verhältnis wachsen.

Ihr zweiter Ansatz ist der, den der Sweep am Anfang dieses Kapitels in einem Millionstel der Größenordnung reproduziert: ein Budget fixieren, viele Größen exakt mit diesem Budget trainieren, den finalen Loss gegen die Modellgröße plotten.

ParameterC=1013C = 10^{13}C=3.16×1013C = 3.16 \times 10^{13}C=1014C = 10^{14}
98.6245.3531 (171)4.8638 (542)
150.3205.4636 (74)
194.2085.5041 (44)4.8730 (140)4.4040 (442)
295.8085.5550 (19)4.9029 (60)4.3383 (190)
665.2805.7849 (3.8)5.1254 (12)4.4192 (38)
1.280.7685.8174 (1.0)5.1751 (3.2)4.5003 (10)
3.101.5685.4686 (0.5)4.7768 (1.7)
5.315.0725.5894 (0.2)4.8514 (0.6)
15.053.5685.3534 (0.1)

Held-out-Loss in nats pro token, token pro Parameter in Klammern, fett für das beste Modell bei jedem Budget; ein Strich ist ein nicht ausgeführter Punkt, weil das Budget mehr Text verlangte, als der Korpus enthält, oder die Größe außerhalb der dort gesweepten lag.

Lies eine Spalte hinunter: Der Loss fällt, erreicht ein Minimum und steigt wieder. Ein Modell kann für sein Budget genauso leicht zu groß sein wie zu klein — bei 101410^{14} beträgt die Strafe dafür, 665.280 Parameter statt 295.808 zu wählen, 0,08 nats; auf der oben gefitteten Hüllkurve ist das der Loss, den ein korrekt dimensioniertes Modell mit 18 % weniger Compute erreicht. Die falsche Form zu wählen wirft ein Fünftel des Budgets weg. Das ist Chinchillas Abbildung 3 an einem Nachmittag auf einer GPU statt mit vierhundert Modellen.

Jetzt lies quer. Bei 101310^{13} ist das beste Modell das kleinste im Sweep; bei 101410^{14} hat es 295.808 Parameter, auf beiden Seiten eingerahmt. Das Optimum wandert nach rechts, wenn das Budget wächst, und das ist der gesamte Inhalt der Korrektur. Fitte den dritten Ansatz des Papers — die Fläche L(N,D)=E+A/Nα+B/DβL(N,D) = E + A/N^{\alpha} + B/D^{\beta} über alle Läufe — und minimiere unter der Nebenbedingung C=6NDC = 6ND:

TEXT
L(N, D) = 24.7 / N^0.195 + 46.8 / D^0.169       (E fits to ~0; see below)
implied   N_opt ∝ C^0.464
  compare   Chinchilla 0.46-0.50 · Besiroglu 0.513 · Kaplan 0.73

0,46, von einem Laptop, gegenüber Kaplans 0,73. Übereinstimmung auf drei Stellen aus einem Drei-Budget-Fit ist Glück; Übereinstimmung auf die erste ist es nicht. Der Exponent reist — die Konstante nicht, denn das token-zu-Parameter-Verhältnis an diesen Optima liegt bei 170 bis 540, nicht 20. Drei Gründe, alle lehrreich. EE fittet auf null, weil der Lauf bei einem Loss über 4 nats nirgendwo in der Nähe des Entropiebodens liegt, der Chinchillas Fit dominiert. Batchgröße und Lernrate wurden fixiert, statt pro Punkt getunt, was die Läufe benachteiligt, die die wenigsten Schritte bekommen — und das sind die großen Modelle: Bei 101310^{13} FLOPs bekommt ein Modell mit 1,28 Millionen Parametern insgesamt 159 Optimierer-Schritte, weit unter den paar tausend, die Kaplans SminS_{\min}-Term jedem Modell zuschreibt. Eine scaling law wird innerhalb eines Regimes gefittet, und diese hier liegt sechs Größenordnungen unter Chinchilla.

Daher das Abstract des Papers: „current large language models are significantly undertrained“. Chinchilla ist die Demonstration — 70 Milliarden Parameter auf 1,4 Billionen token, derselbe Gesamt-Compute wie Gophers 280 Milliarden auf 300 Milliarden, und besser in 51 von 57 MMLU-Aufgaben, 67,5 % gegen 60 %.2 Viermal kleiner, viereinhalbmal mehr Text, gleiches Geld, besseres Modell.

Zwei Vorbehalte zu diesem berühmten Verhältnis. „Zwanzig token pro Parameter“ ist kein Satz im Paper, das nur sagt, dass „for every doubling of model size the number of training tokens should also be doubled“; die 20 ist eine Schlussfolgerung aus Tabelle 3 und aus Chinchillas eigenen 70 B auf 1,4 T. Und ihre Präzision ist schlechter als veröffentlicht: Besiroglu et al. refitteten anhand einer Digitalisierung von Abbildung 4, fanden, dass die ursprünglichen Parameter „fit the reconstructed data poorly“ mit Intervallen, die „implausibly tight given the number of data points“ seien, und setzten den ehrlichen Bereich auf „between 4 and 40“ token pro Parameter.8

Ein Detail von Chinchillas Methode löst ein Versprechen ein, das Kapitel 1 zu Lernraten-Schedules gegeben hat. Der Cosine-Schedule muss zum token-Budget passen. Ein Modell, das 10 Millionen token sehen wird, muss seine Lernrate bei 10 Millionen token auf null absenken; gib ihm einen Schedule für 100 Millionen, stoppe ihn früh, und du liest einen Loss mitten im Abstieg bei einer viel zu hohen Rate. Chinchilla trainiert jedes Modell mit vier Zykluslängen, um genau das zu kontrollieren; der Sweep oben setzt seinen Schedule aus demselben Grund aus dem Budget.

Sie sind das nützlichste empirische Ergebnis im Feld und werden regelmäßig überverkauft. Vier Grenzen.

Sie sagen Loss voraus, nicht Fähigkeit. Die linke Seite ist Cross-Entropy auf Held-out-Text. Nichts in diesen Papers legitimiert eine Behauptung darüber, ob ein Modell korrektes SQL schreibt, eine schädliche Anfrage ablehnt oder ein Tool benutzt. Das ist wieder die Lektion aus Kapitel 5: Eine Vorhersage des Loss ist keine Vorhersage des Verhaltens, für das du bezahlst.

Sie sind gefittet, nicht hergeleitet. Keine Theorie erzeugt αN=0.076\alpha_N = 0.076. Die Konstanten bewegen sich mit dem tokenizer — weshalb ein Perplexity-Vergleich über zwei tokenizer hinweg bedeutungslos ist, wie Kapitel 8 erklärt hat — und mit Datenmischung, Architektur und Optimierer. Jedes veröffentlichte Gesetz ist ein Gesetz des Setups, das es erzeugt hat, weshalb Meta vor Llama 3 sein eigenes neu gefittet hat.5

Sie nehmen für jeden Schritt einen frischen token an, was stillschweigend einen unendlichen Korpus voraussetzt. Muennighoff et al. maßen, was passiert, wenn er ausgeht: Bis zu vier Epochen wiederholter Daten kosten fast nichts — ein Modell mit 8,7 Milliarden Parametern auf 44 Milliarden einzigartigen token, viermal gesehen, endete mit „only 0.5 % higher validation loss“ als dasselbe Modell auf 178 Milliarden einzigartigen token — während nach etwa sechzehn Epochen zusätzlicher Compute nichts mehr kauft.9

Und niemand trainiert mehr compute-optimal. Chinchilla minimiert die Kosten des Trainings; ein deploytes Modell zahlt danach ungefähr 2N2N FLOPs pro generiertem token, für immer. LLaMA 1 sagte es klar: „given a target level of performance, the preferred model is not the fastest to train but the fastest at inference“.10 Sardana et al. formalisierten es, indem sie stattdessen 6NDtrain+2NDinference6ND_{\text{train}} + 2ND_{\text{inference}} minimierten, und fanden, dass jeder, der eine Milliarde Anfragen erwartet, „smaller and longer than Chinchilla-optimal“ trainieren sollte.11 Llama 3s §9.1 stimmt zu: Seine kleinen Modelle trainieren „far beyond the point of compute optimal training, effectively trading training compute for inference efficiency“.5 Das Verhältnis ist nicht obsolet; es beantwortet eine Frage, die nicht mehr die gestellte ist.

Emergente Fähigkeiten und der Streit darüber, ob sie real sind

Link zum Abschnitt: Emergente Fähigkeiten und der Streit darüber, ob sie real sind

Loss fällt glatt. Benchmark-Scores tun das manchmal nicht. Wei et al. sammelten Fälle, in denen eine Aufgabe über Größenordnungen von Trainings-Compute hinweg auf Zufallsniveau bleibt und dann springt — dreistellige Arithmetik, die in GPT-3 bei etwa 2×10222 \times 10^{22} FLOPs erscheint, MMLU, das zwischen 33 und 5×10235 \times 10^{23} über Rateniveau steigt — und gaben dem Muster einen Namen: „an ability is emergent if it is not present in smaller models but is present in larger models“.12 Wenn das eine reale Eigenschaft ist, ist Extrapolation aus billigen Experimenten unsicher, denn die Fähigkeit, die du kaufst, existiert vielleicht in keiner Größenordnung, die du dir zu testen leisten kannst.

Schaeffer, Miranda und Koyejo argumentierten, dass das meiste davon ein Messartefakt ist, und der Mechanismus ist Arithmetik.13 Per-token-Loss fällt glatt, also verbessert sich die Wahrscheinlichkeit, dass ein token richtig ist, exp(L)\exp(-\mathcal{L}), graduell. Bewertet man das Modell mit exact string match über eine Antwort mit LL token und erhebt diese Wahrscheinlichkeit zur Potenz LL — eine glatte Kurve, auf eine große Potenz gehoben, sieht aus wie eine Klippe. Ersetzt man sie auf denselben Ausgaben durch eine Metrik, die token zählt, statt alle zu verlangen, dann „the family's performance smoothly, continuously and predictably improves with increasing scale“.

Ihr Audit ist die Zahl, die man behalten sollte — „of the 39 preferred metrics in BIG-Bench, at most 5 display emergence“, wobei zwei diskontinuierliche Metriken über 92 % der behaupteten Fälle ausmachen — und ebenso ihre Warnung: „nothing in this paper should be interpreted as claiming that large language models cannot display emergent abilities“. Ein Sprung in einem Diagramm ist zunächst Evidenz über die Metrik, bis anderes gezeigt wird. Kapitel 29 ist der Ort, an dem das zu deinem Problem wird, weil die Wahl einer Hard-Cutoff-Metrik eine Entscheidung ist, die du treffen wirst, ohne es zu merken.

Der Korpus ist der Teil eines pretraining-Laufs, an dem keine Gleichung hängt, und der Ort, an dem die meisten folgenreichen Entscheidungen liegen. Das Rohmaterial ist ein Web-Crawl: Common Crawls Archiv vom August 2026 enthält „2.14 billion web pages or 360 TiB of uncompressed content“, einen Monat davon, kostenlos herunterladbar.14 Fast nichts davon ist in diesem Zustand brauchbar. Das T5-Paper sagt, der Crawl „largely comprises gibberish or boiler-plate text like menus, error messages, or duplicate text“, und die darin eingeführte C4-Pipeline ist eine Liste grober Heuristiken — nur Zeilen behalten, die mit Satzschlusszeichen enden, Seiten mit weniger als drei Sätzen verwerfen, jede Seite mit einer geschweiften Klammer oder einem Wort aus einer öffentlichen Obszönitätenliste verwerfen — wodurch aus zwanzig Terabyte monatlichem Text etwa 750 GB werden.15

Grob ist das Wort. Dodge et al. auditierten, was diese Filter entfernen, und fanden, dass die Obszönitäten-Blockliste 42 % der Dokumente in African-American English und 32 % in Hispanic-aligned English löscht, gegenüber 6,2 % von White-aligned English, wodurch ein Korpus zurückbleibt, der zu 97,8 % aus der letzten Kategorie besteht.16 Eine Regel ohne Meinung über Dialekt hatte eine.

Dann Deduplication, die keine Haushaltsführung ist: Lee et al. fanden einen Satz mit 61 Wörtern, der in C4 61.036-mal wiederholt wurde, und zeigten, dass deduplication die Rate, mit der Modelle „emit memorized text“, um den Faktor zehn senkt, von 1,9 % der generierten token auf 0,19 %.17 Mehr ist jedoch nicht besser — das FineWeb-Team deduplizierte global über 96 Crawls, erhielt 4 Billionen token und keinen messbaren Gewinn; dann deduplizierte es jeden Crawl separat, erhielt 20 Billionen und erreichte den besten bestehenden Korpus.18

Dann Kontamination. Llama 3 maß seine eigene und veröffentlichte sie: 98 % von AGIEval, 95 % von BIG-Bench Hard und 85 % von HellaSwag überlappten per 8-Gramme mit dem Trainingsset, und bei MMLU war die Überlappung so hoch, dass „it is impossible to get a good performance gain estimate“.5 GPT-3s §4 berichtet von einem Filterbug, der Benchmarks in den Daten ließ, ohne Weg zurück: „because of cost considerations it was infeasible to retrain the model“.7

Provenienz ist der ungelöste Teil. The Pile enthielt eine 100,96-GiB-Komponente namens Books3 — 12 % des Korpus und, laut Einwilligungstabelle des Papers selbst, Bücher aus einem privaten Torrent-Tracker;19 sie wurde im August 2023 nach einer Urheberrechtsbeschwerde offline genommen. Die Rechtslage im September 2026 ist ungeklärt, und die drei als Trend zitierten US-Entscheidungen widersprechen einander. Alsup befand, Training auf rechtmäßig erworbenen Büchern sei „exceedingly transformative“, hielt aber eine aus raubkopierten Kopien gebaute Bibliothek für nicht rechtmäßig, und Anthropic verglich diesen Teil für $1,5 Milliarden für 482.460 Werke, ungefähr $3.000 je Werk, genehmigt am 20. Juli 2026.20 Chhabria gewährte Meta summary judgment, schrieb aber, seine Entscheidung „does not stand for the proposition that Meta's use of copyrighted materials to train its language models is lawful“, sondern nur, dass „these plaintiffs made the wrong arguments“.21 Bibas, der gegen Ross Intelligence entschied, merkte an, dass „only non-generative AI is before me today“.22 Kein US-Berufungsgericht hat über die Frage entschieden.

Menschen erledigen die Teile, die der Loss nicht kann. TIME berichtete im Januar 2023, dass Arbeiter, die toxischen Text für OpenAI über die Firma Sama labelten, „between around $1.32 and $2 per hour“ mit nach Hause nahmen, während sie Passagen über sexuellen Kindesmissbrauch, Folter und Selbstverletzung lasen, während OpenAI Sama $12,50 pro Stunde für die Arbeit zahlte; Sama bestreitet sowohl die Lohnspanne als auch die Quote.23 Das ist die Filterung rund um pretraining, nicht pretraining selbst — aber sie steht auf derselben Rechnung, und dort sitzt ein Mensch.

Der Strom ist real und wird meist falsch zitiert. Die sorgfältigste veröffentlichte Zahl ist BLOOMs: 1.082.990 GPU-Stunden, 433 MWh und 24,7 Tonnen CO₂-Äquivalent für den Lauf, 50,5 inklusive Herstellung und idle Nodes;24 Patterson et al. setzen GPT-3 auf 1.287 MWh und 552 Tonnen.25 Zwei Warnungen. BLOOMs Vorteil ist das französische Atomstromnetz mit 57 g CO₂ pro kWh, nicht Effizienz — es verbrauchte mehr Energie als OPT-175B. Und die meistzitierte Emissionszahl des Feldes, Strubell et al.s 626.155 lb für eine Neural Architecture Search, wurde später als 88-mal zu hoch gezeigt, weil angenommen worden war, die Suche sei mit voller Modellgröße gelaufen, obwohl sie auf einem Proxy lief.26 LBNLs Rahmung ist die vertretbare: US-Rechenzentren verbrauchten 2024 192 TWh, 4,7 % des nationalen Stroms — eine Zahl, die an einer Branche hängt, nicht an irgendeinem einzelnen Lauf.27

Der rote Faden ist das, was Bender et al. documentation debt nannten: „putting ourselves in a situation where the datasets are both undocumented and too large to document post hoc“.28 Jede Tatsache oben existiert, weil jemand hingesehen hat. Bei den Korpora hinter den Modellen, die die meisten Menschen verwenden, kann niemand das tun.

Jetzt die Arithmetik, die alle wollen, aus vier zitierten Eingaben, damit klar ist, welche ersetzt werden müssen, wenn sie veralten.

NVIDIAs H100-Seite listet 1.979 teraFLOPS BF16-Tensor-Core-Durchsatz unter einer Fußnote „with sparsity“.29 Kein pretraining-Lauf nutzt strukturierte Sparsity, also ist die dichte Zahl die Hälfte davon: 989,5 TFLOP/s.

Llama 3s Tabelle 4 berichtet 38–43 % BF16 model FLOPs utilisation. Nimm 40 %: 395,8 TFLOP/s nützliche Arithmetik pro GPU.5

Lambdas On-demand-Preis für einen 8×H100-SXM-Node, abgerufen am 2026-09-06: $3,99 pro GPU-Stunde, also $31,92 pro Stunde für den Node.30

Chinchillas Verhältnis, D=20ND = 20N, ergibt C=6ND=120N2C = 6ND = 120N^2 und damit N=C/120N = \sqrt{C/120}.

BudgetH100-StundenFLOPscompute-optimale Parametertokenauf einem 8×H100-NodeGPUs für Abschluss in 90 Tagen
$100253.6e19546 M10.9 B3,1 h1
$1.0002513.6e201.73 B34.5 B31,3 h1
$10.0002.5063.6e215.46 B109 B13 Tage2
$100.00025.0633.6e2217.3 B345 B131 Tage12
$1.000.000250.6273.6e2354.6 B1.09 T4 Jahre116
$10.000.0002.506.2663.6e24173 B3.45 T36 Jahre1.160
$100.000.00025.062.6573.6e25546 B10.9 T358 Jahre11.603

Lies die letzten beiden Spalten zusammen. Für $10.000 bekommst du ein Modell mit 5 Milliarden Parametern auf einem gemieteten Node in zwei Wochen. Bei $100.000.000 sagt die Arithmetik 546 Milliarden Parameter — und zwölftausend H100s, drei Monate lang zusammengeschaltet, was man nicht mit Kreditkarte mietet. Ab etwa $100.000 hört die bindende Nebenbedingung auf, Geld zu sein, und wird zum Cluster.

Bevor du einer solchen Tabelle vertraust, teste sie gegen Läufe, deren reale Kosten veröffentlicht sind — llm.c reproduziert GPT-2 124M in „~90 minutes“ auf einem 8×A100-Node „for about $20“ und GPT-2 1.6B in 24 Stunden auf einem 8×H100-Node für $672.31

TEXT
$672, against what $672 actually bought (llm.c GPT-2 1.6B, one 8xH100 node, 24 h)
  this table predicts:      168 H100-hours   N = 1.41 B params   D = 28.3 B tokens
  what was actually run:    192 H100-hours   N = 1.558 B params  D = 33.6 B tokens

Llama 3 405B, against Meta's own published GPU-hours
  from the paper's 3.8e25 FLOPs at 40 % MFU:   26.67 M H100-hours
  published in Meta's Llama 3.1 model card:    30.84 M H100-hours    ratio 0.86

Beide liegen innerhalb von etwa 15 %, was ungefähr die Genauigkeit ist, die diese Art von Schätzung verdient, und erheblich besser als die Genauigkeit, mit der sie üblicherweise zitiert wird.

Der Headline-Vergleich, mit beiden Definitionen auf dem Tisch

Link zum Abschnitt: Der Headline-Vergleich, mit beiden Definitionen auf dem Tisch

Die am häufigsten wiederholte Zahl in diesem Thema ist, dass ein GPT-2-Klasse-Modell, das 2019 etwa $43.000 kostete, heute für ein paar Dutzend Dollar reproduziert werden kann. Die moderne Hälfte ist gut dokumentiert; die historische Hälfte nicht.

Heute. Karpathys nanochat-README: „you can train your own GPT-2 capability LLM ... for only $48 (~2 hours of 8XH100 GPU node) ... On a spot instance, the total cost can be closer to ~$15.“32 „GPT-2 capability“ ist hier präzise und veröffentlicht — besser als GPT-2s CORE-Score von 0.256525 — auf einem Leaderboard, dessen bester Eintrag am 14. März 2026 bei 1,65 Stunden liegt. Die $48 setzen $3 pro GPU-Stunde voraus, unter Lambdas Listenpreis von $3,99; zum Listenpreis sind es eher $64.

2019. Es gibt keine Primärquelle: OpenAI hat nie eine Dauer oder Kosten veröffentlicht. Die Kette läuft über The Register, Februar 2019, mit „256 Google TPU3 cores“ ohne Preis und ohne Dauer; dann Synced, Juni 2019, mit dem Hinweis, dass die Hardware $256 pro Stunde auf Google Cloud kostete, und der ausdrücklichen Aussage, dass „OpenAI didn't specify the training duration“. $43.008 sind $256 pro Stunde mal angenommene 168 Stunden, für die noch nie eine Quelle genannt wurde.

Die ehrliche Headline lautet also: Ein Modell, das GPT-2s veröffentlichten Benchmark-Score erreicht, kann heute für deutlich unter $100 auf gemieteter Hardware trainiert werden, gegenüber einem Kostenpunkt von 2019, der nie veröffentlicht wurde und dessen berühmte Schätzung auf einer unbelegten Annahme über die Dauer beruht. Der Kollaps ist real, und die moderne Hälfte ist für jeden mit Kreditkarte reproduzierbar; das Verhältnis ist Arithmetik auf einer Zahl, die nicht existiert. Das ist generell der Stand veröffentlichter Trainingskosten. Das GPT-3-Paper enthält überhaupt keinen Dollarbetrag, nur 3.14×10233.14 \times 10^{23} FLOPs in Tabelle D.1;7 das Llama-3-Paper ebenfalls nicht.5 Jeder Trainingspreis, den du gelesen hast, ist eine Schätzung aus FLOP-Zahl, Hardware-Annahme und Preisannahme — immer wert zu fragen, von wem.

Was ein Basismodell weiß und wann es aufgehört hat, es zu wissen

Link zum Abschnitt: Was ein Basismodell weiß und wann es aufgehört hat, es zu wissen

Was herauskommt, hat einen festen Korpus gesehen, der zu einem festen Zeitpunkt zusammengestellt wurde, und daraus folgen zwei Eigenschaften.

Die erste ist der knowledge cutoff. Nach dem Sammeldatum weiß das Modell nichts — nicht „ist unsicher“, sondern nichts — und es wird flüssig konfabulieren, statt das zu sagen, weil dieses Verhalten nie trainiert wurde. Llama 3.1s Model Card nennt Dezember 2023;33 jedes Modell hat so etwas, und es ist eine Eigenschaft der Trainingsdaten, nicht des Deployments. Der Workaround dafür ist ein Retrieval-Problem, und das ist Kapitel 19.

Die zweite ist, dass ein Basismodell vervollständigt, statt zu antworten. Gib ihm „Was ist die Hauptstadt von Frankreich?“ und eine plausible Fortsetzung ist eine weitere Frage, weil diese Zeichenkette im Korpus meistens in Aufgabenlisten vorkommt.

Ein Textvervollständiger ist kein Assistent. Er folgt keinen Anweisungen, weil nichts im Korpus ihm gesagt hat, dass eine Anfrage befolgt statt fortgesetzt werden soll. Er hat keinen Begriff von einem Gespräch mit zwei Beteiligten. Er wird bereitwillig die wahrscheinlichste Fortsetzung eines schädlichen prompt produzieren, weil wahrscheinlich das Einzige ist, worauf er jemals optimiert wurde.

Ihn in etwas zu verwandeln, das antwortet, braucht eine zweite Stufe, die einen Bruchteil eines Prozents der ersten kostet und fast vollständig daraus besteht, ihm Beispiele für das gewünschte Verhalten zu zeigen und dann Paare seiner eigenen Ausgaben zu vergleichen. Aus dieser Stufe kommen Instruction Following, Chat-Templates, Ablehnungen und — das überrascht viele — die Fähigkeit, ein Tool aufzurufen. Kapitel 11 ist diese Stufe: supervised fine-tuning, RLHF, DPO und GRPO sowie die Frage, was „aligned“ bedeutet und wer das entscheidet.


Ebenfalls lesenswert neben diesem Kapitel: Karpathys build-nanogpt und das begleitende Video, die eine vollständige GPT-2-Reproduktion von Anfang bis Ende in einem Tempo durchgehen, das dieses Kapitel nicht leisten kann; und Stanford CS324, Large Language Models, dessen Vorlesungen zu Daten und Umweltwirkungen tiefer in Material einsteigen, das dieser Kurs einmal behandelt und dann delegiert.

  1. Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J. and Amodei, D. Scaling Laws for Neural Language Models. arXiv:2001.08361 (2020). Die drei Potenzgesetze sind Gl. (1.1)–(1.3) in §1.2 und die vollständigen Konstanten stehen in Appendix A, Tabelle 5; die 6N6N-Herleitung ist §2.1; die Compute-Allokations-Exponenten stehen in Tabelle 6. Beachte, dass es zwei Compute-Gesetze gibt, αC=0.057\alpha_C = 0.057 bei fixer Batchgröße und αCmin=0.050\alpha_C^{\min} = 0.050 bei optimaler Batchgröße; das Paper sagt, Letzteres „should be used to make predictions“. 2

  2. Hoffmann, J., Borgeaud, S., Mensch, A., Buchatskaya, E., Cai, T., Rutherford, E. et al. Training Compute-Optimal Large Language Models. arXiv:2203.15556 (2022). Exponenten in Tabelle 2, projizierte Budgets in Tabelle 3, der Gopher-Vergleich in §4, die Konvention zur Parameterzählung in Appendix F. Der Fließtext unter Tabelle 3 widerspricht Tabelle 3 selbst für die 175-B- und 280-B-Zeilen; die Tabelle ist die zitierfähige Version. 2 3 4

  3. Micikevicius, P., Narang, S., Alben, J., Diamos, G., Elsen, E., Garcia, D. et al. Mixed Precision Training. arXiv:1710.03740 (2017), ICLR 2018. FP32-Master-Gewichte in §3.1, Loss Scaling in §3.2. 2

  4. Rajbhandari, S., Rajbhandari, S., Ruwase, O. and He, Y. ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054 (2019), SC20. Die 16Ψ16\Psi-Buchhaltung ist §3.1; die Restzustandszahlen für Aktivierungen sind §3.2.

  5. Grattafiori, A. et al. (Llama Team, AI @ Meta). The Llama 3 Herd of Models. arXiv:2407.21783 (2024). Compute-Budget und token-Zahl in §1, die neu gefittete scaling law in §3.2.1, die Parallelismus-Konfiguration und MFU in Tabelle 4, die Kontaminationsanalyse in §5.1.4, die Over-Training-Aussage in §9.1. Das Paper enthält keine Dollarzahlen und keine Emissionstabelle. 2 3 4 5 6

  6. Stanford CS336, Language Modeling from Scratch. Vorlesung 2 behandelt Ressourcenbuchhaltung, Vorlesungen 5–8 GPUs, Kernels und Parallelismus, Vorlesungen 9 und 11 Scaling, Vorlesungen 13–14 Daten. Es ist der Kurs, an den dieses Kapitel sein Engineering delegiert, und er ist öffentlich.

  7. Brown, T. B. et al. Language Models are Few-Shot Learners. arXiv:2005.14165 (2020). Compute in Appendix D, Tabelle D.1 — die eine Spalte hat, die wörtlich „flops per param per token“ heißt und deren Wert für jede GPT-3-Zeile 6 ist. Kontaminationsanalyse in §4. 2 3

  8. Besiroglu, T., Erdil, E., Barnett, M. and You, J. Chinchilla Scaling: A replication attempt. arXiv:2404.10102 (2024). Rekonstruiert Chinchillas Daten durch Digitalisierung von Abbildung 4, fittet neu und berichtet die korrigierten Exponenten und deutlich breitere Intervalle.

  9. Muennighoff, N., Rush, A. M., Barak, B., Le Scao, T., Piktus, A., Tazi, N., Pyysalo, S., Wolf, T. and Raffel, C. Scaling Data-Constrained Language Models. arXiv:2305.16264 (2023), NeurIPS 2023. Das Vier-Epochen-Ergebnis ist §6; die Sechzehn-Epochen-Halbwertszeit ist das gefittete RD15R_D^* \approx 15.

  10. Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T. et al. LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 (2023). §1 nennt das Inferenzkosten-Argument gegen Chinchilla-optimales Training.

  11. Sardana, N., Portes, J., Doubov, S. and Frankle, J. Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws. arXiv:2401.00448 (2023), ICML 2024. Ihr §5 enthält auch das Gegengewicht: Modelle, die mit extremen token-Verhältnissen trainiert werden, verbessern sich weiter, aber „more slowly than scaling laws predict“.

  12. Wei, J., Tay, Y., Bommasani, R., Raffel, C., Zoph, B., Borgeaud, S. et al. Emergent Abilities of Large Language Models. arXiv:2206.07682 (2022), TMLR. Definition in §2, Beispiele und Compute-Schwellen in §3–4 und Tabelle 1.

  13. Schaeffer, R., Miranda, B. and Koyejo, S. Are Emergent Abilities of Large Language Models a Mirage? arXiv:2304.15004 (2023), NeurIPS 2023 outstanding paper. Das Metrikargument ist §2, die BIG-Bench-Metaanalyse §4, das konstruierte Vision-Beispiel §5.

  14. Common Crawl, August 2026 Crawl Archive Now Available (CC-MAIN-2026-34), veröffentlicht am 24. August 2026, abgerufen 2026-09-06. Die eigene Startseite behauptet „over 300 billion pages spanning 15 years“, „totalling more than 10 petabytes“ — eine Zahl für das gesamte Archiv, nicht für den hier bepreisten monatlichen Crawl.

  15. Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W. and Liu, P. J. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683 (2019), JMLR 21(140). Die C4-Filter sind §2.2. Das Paper gibt Größen in Bytes an, nicht in token; die ihm oft zugeschriebene Zahl von 156 Milliarden token stammt von Dodge et al. unten.

  16. Dodge, J., Sap, M., Marasović, A., Agnew, W., Ilharco, G., Groeneveld, D., Mitchell, M. and Gardner, M. Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758 (2021), EMNLP 2021. Dialekt-Entfernungsraten sind §5.3; Benchmark-Kontamination in C4 ist §4.2.

  17. Lee, K., Ippolito, D., Nystrom, A., Zhang, C., Eck, D., Callison-Burch, C. and Carlini, N. Deduplicating Training Data Makes Language Models Better. arXiv:2107.06499 (2021), ACL 2022. Die 61.036 Wiederholungen sind Fußnote 1; die Memorierungszahlen sind §6.2, Tabelle 4, und sind Prozentsätze generierter token unter einem 50-token-exact-match-Kriterium.

  18. Penedo, G., Kydlíček, H., Ben Allal, L., Lozhkov, A., Mitchell, M., Raffel, C., Von Werra, L. and Wolf, T. The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale. arXiv:2406.17557 (2024), NeurIPS 2024 Datasets and Benchmarks. Das Deduplication-Ergebnis ist §3.4. Der veröffentlichte Datensatz ist seitdem über die 15 Billionen token des Papers hinausgewachsen.

  19. Gao, L., Biderman, S., Black, S. et al. The Pile: An 800GB Dataset of Diverse Text for Language Modeling. arXiv:2101.00027 (2020). Books3 ist §2.3 und Tabelle 1; die Einwilligungstabelle ist Tabelle 5. Der Korpus umfasst 825,18 GiB, also ist sogar der Titel abgerundet.

  20. Bartz v. Anthropic, No. 4:24-cv-05417 (N.D. Cal.). Fair-Use-Order 23. Juni 2025 (Dkt. 231); class certification 17. Juli 2025; final approval and judgment 20. Juli 2026 (Dkt. 680). Der Vergleich umfasst nur vergangene Inputs, nicht Outputs und nicht zukünftiges Verhalten.

  21. Kadrey v. Meta, No. 3:23-cv-03417-VC (N.D. Cal.), summary judgment 25. Juni 2025 (Dkt. 598). Beachte, dass der Distributionsanspruch über Torrenting nicht entschieden wurde und weiterhin anhängig ist.

  22. Thomson Reuters v. ROSS Intelligence, No. 1:20-cv-00613-SB (D. Del.), revised opinion 11. Februar 2025 (Dkt. 770), Bibas J. Im interlocutory appeal beim Third Circuit (No. 25-2153), verhandelt am 11. Juni 2026, zum Zeitpunkt des Schreibens unentschieden.

  23. Perrigo, B. Exclusive: OpenAI Used Kenyan Workers on Less Than $2 Per Hour to Make ChatGPT Less Toxic. TIME, 18. Januar 2023. Die $2 sind eine Obergrenze für Senior-Reviewer, die jedes Ziel erreichten; Junior-Labeler, die Mehrheit, nahmen $1,32 mit nach Hause. Samas im selben Artikel zitierte Erwiderung nennt $1,46–$3,74 und eine niedrigere Quote.

  24. Luccioni, A. S., Viguier, S. and Ligozat, A.-L. Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language Model. arXiv:2211.02001 (2022), JMLR 24(253). Tabellen 1 und 3.

  25. Patterson, D., Gonzalez, J., Le, Q., Liang, C., Munguia, L.-M., Rothchild, D., So, D., Texier, M. and Dean, J. Carbon Emissions and Large Neural Network Training. arXiv:2104.10350 (2021). GPT-3s Zahlen sind Tabelle 4; die Korrektur der NAS-Schätzung ist §4.1.

  26. Strubell, E., Ganesh, A. and McCallum, A. Energy and Policy Considerations for Deep Learning in NLP. arXiv:1906.02243 (2019), ACL 2019. Gerade wegen dessen, was mit seiner meistzitierten Zahl passiert ist, lohnt es sich, das Paper genau zu lesen: Es ist sorgfältig, benennt seine Extrapolation und lag bei der einen Zeile, die alle wiederholten, trotzdem um zwei Größenordnungen falsch.

  27. Smith, S. J., Hubbard, A., Newkirk, A., Ganeshalingam, M., Holecek, B., Sartor, D., Mills, M. and Shehabi, A. United States Data Center Energy Usage Report: 2025 Update. LBNL-2001758 (18. Juni 2026). Dies revidiert den vielzitierten Bericht von 2024 für die historische Reihe nach unten; wenn du die Zahl von 176 TWh für 2023 zitierst, zitierst du die überholte Ausgabe.

  28. Bender, E. M., Gebru, T., McMillan-Major, A. and Shmitchell, S. On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? FAccT '21, pp. 610–623. DOI 10.1145/3442188.3445922. „Documentation debt“ ist §4.4. Beachte, dass die eigenen Kohlenstoffzahlen des Papers von Strubell et al. zitiert sind und die Korrektur oben erben — was eher eine Illustration seines Arguments ist als eine Widerlegung.

  29. NVIDIA. NVIDIA H100 Tensor Core GPU Produktseite, nvidia.com/en-us/data-center/h100/ (abgerufen 2026-09-06). Jede Tensor-Core-Zeile auf dieser Seite außer FP64 trägt die Fußnote „with sparsity“; die hier verwendete dichte BF16-Zahl ist die Hälfte der veröffentlichten 1.979 TFLOPS.

  30. Lambda. GPU Cloud pricing, lambda.ai/pricing (abgerufen 2026-09-06). On-demand, pro GPU und Stunde, vor Steuern. Preise in diesem Abschnitt veralten schneller als alles andere in diesem Kurs; die Arithmetik darum nicht.

  31. Karpathy, A. karpathy/llm.c, Diskussion #481, Reproducing GPT-2 (124M) in llm.c in 90 minutes for $20 (28. Mai 2024), und Diskussion #677, Let's reproduce GPT-2 (1.6B): one 8XH100 node, 24 hours, $672, in llm.c (11. Juli 2024).

  32. Karpathy, A. karpathy/nanochat, README und „time to GPT-2“-Leaderboard (abgerufen 2026-09-06). Die $48-Zahl und die CORE-Score-Definition von „GPT-2 capability“ stehen beide im README; das eigene speedrun.sh des Repositorys sagt „approximately 1.5 hours“, also behandle die Zwei-Stunden-Zahl als gerundet.

  33. Meta. Llama 3.1 model card, models/llama3_1/MODEL_CARD.md in meta-llama/llama-models (abgerufen 2026-09-06). Quelle der 30,84 M H100-Stunden für das 405-B-Modell, der insgesamt 39,3 M, der standortbasierten 11.390-tCO2eq-Zahl und des Daten-cutoffs Dezember 2023.


Erstellt von

David Vicente Campos

Gründer von NeuraLIA Labs & Mitgründer von MyRealFood

Ich bin Informatikingenieur mit Abschluss an der Universität León. Ich habe MyRealFood mitgegründet, wo ich als CTO die App gebaut habe, die Millionen Menschen genutzt haben, um sich besser zu ernähren, und ich habe NeuraLIA Labs gegründet, wo ich KI-Produkte entwickle. Hier schreibe ich über das, was ich unterwegs verstehen musste, so wie ich mir gewünscht hätte, dass es mir jemand erklärt.

Mehr über den Autor

Veröffentlicht von NeuraLIA Labs.

Neue Beiträge direkt in dein Postfach

AI-News, Guides und Produktupdates — eine kurze E-Mail, wenn wir etwas veröffentlichen, das deine Zeit wert ist.

Kursübersicht

Abstract software decision engine with branching paths, probability nodes, and glowing gates.
jev11 Min. Lesezeit

Das Jev-KI-Modell ist für Entscheidungen gebaut, nicht für Prosa

TypeSafe AIs Jev sorgt für Aufmerksamkeit, weil es Software-Intelligenz als Wahrscheinlichkeitsproblem behandelt: den richtigen Zweig wählen, Konfidenz anhängen und vermeiden, ein LLM für Text zu bezahlen, wenn Code eine Entscheidung braucht.

Abstract agent runtime sorting documents, memory blocks and pointer nodes inside a bounded context frame.
context-engineering11 Min. Lesezeit

Context Engineering für KI-Agenten mit langem Zeithorizont

Lang laufende Agenten scheitern nicht nur, weil das Fenster klein ist. Sie scheitern, wenn Dateien, Tool-Ausgaben und veraltete Historie die Aufgabe verdrängen, die der Agent eigentlich erledigen sollte.

Bereit, LIA die Wahl zu überlassen?

Bau mit jedem KI-Modell an einem Ort — starte heute kostenlos.