Pretraining ενός LLM: δεδομένα, compute, scaling laws και κόστος
20 μοντέλα σε GPU laptop για μέτρηση scaling law και έλεγχο της εκτίμησης 6ND compute με πραγματικό FLOP counter.
Σε αυτή τη σελίδα
Κεφάλαιο 9 τελείωσε με ένα transformer block που εκπαιδεύεται. Στοιβάξτε μερικά από αυτά, στρέψτε το next-token loss του Κεφαλαίου 8 στην έξοδο, και δεν μένει τίποτα να εφευρεθεί. Ό,τι απομένει είναι αγορά.
Αυτή είναι μεγαλύτερη μετατόπιση απ’ όσο ακούγεται. Κάθε κεφάλαιο μέχρι τώρα ρωτούσε μαθαίνει; — μια ερώτηση ναι ή όχι που ένα laptop λύνει σε δέκα λεπτά. Αυτό εδώ ρωτά μια ερώτηση που περιέχει χρήμα: με δεδομένο ένα σταθερό ποσό αριθμητικής, ποιο είναι το καλύτερο μοντέλο που μπορώ να αγοράσω; Η απάντηση είναι ένας τύπος, και δεν ήταν προφανής σε κανέναν το 2018.
Να αυτή η ερώτηση απαντημένη με μέτρηση, σε μία GPU laptop. Είκοσι μοντέλα, από 98.624 έως 15 εκατομμύρια παραμέτρους, εκπαιδεύτηκαν από το μηδέν σε 174 εκατομμύρια tokens της Wikipedia — ένα BPE λεξιλόγιο 2.048-token εκπαιδευμένο όπως εκπαιδεύει ένα το Κεφάλαιο 7, ο transformer του Κεφαλαίου 9. Κάθε run πήρε ακριβώς έναν από τρεις compute budgets και ούτε μία πράξη παραπάνω, άρα ένα μεγαλύτερο μοντέλο αναγκαστικά διαβάζει λιγότερο κείμενο. Το καλύτερο held-out loss που επιτεύχθηκε σε κάθε budget:
budget C (FLOPs) best loss reached by a model of
1.00e13 5.3531 98,624 params
3.16e13 4.8638 98,624 params
1.00e14 4.3383 295,808 params
fitted: L = (Cc / C)^0.0913 over one decade of computeΔέκα φορές περισσότερη αριθμητική αφαιρεί 19 % από το loss, και τα τρία σημεία πέφτουν σε ευθεία γραμμή σε log-log. Τίποτα στα πρώτα εννέα κεφάλαια δεν το προβλέπει αυτό. Δεν υπάρχει θεώρημα πίσω του — είναι μια εμπειρική κανονικότητα, που κρατά με διαφορετικό εκθέτη στα δέκα orders of magnitude ανάμεσα σε αυτό το laptop και ένα datacentre, και είναι η μοναδική παρατήρηση που έπεισε μια βιομηχανία να ξοδέψει το ΑΕΠ μιας μικρής χώρας σε GPUs.
Τι είναι το pretraining και τι νέο έχει
Σύνδεσμος στην ενότητα: Τι είναι το pretraining και τι νέο έχειΤίποτα στον στόχο δεν αλλάζει. Το μοντέλο εξακολουθεί να προβλέπει το επόμενο token, το loss εξακολουθεί να είναι η cross-entropy του Κεφαλαίου 4 εφαρμοσμένη στην παραγοντοποίηση του Κεφαλαίου 8, ο optimizer εξακολουθεί να είναι το AdamW του Κεφαλαίου 6. Το pretraining δεν είναι νέος αλγόριθμος· είναι ο ίδιος αλγόριθμος που τρέχει σε corpus αρκετά μεγάλο ώστε το run να πρέπει να προϋπολογιστεί. Δύο πράγματα το κάνουν αυτό δυνατό: οι ετικέτες είναι δωρεάν, αφού ο στόχος για τη θέση είναι το token στο και υπάρχει ήδη στο κείμενο· και η τελευταία ενότητα του Κεφαλαίου 6 αφαίρεσε την ένσταση, επειδή ένα μοντέλο με πολύ περισσότερες παραμέτρους απ’ όσες επιτρέπουν οι κλασικοί κανόνες δεν διαλύεται, βελτιώνεται. Αυτό που προκύπτει είναι ένα base model — κάτι που συνεχίζει κείμενο αντί να απαντά.
Μέτρηση του compute πριν δαπανηθεί: 6ND
Σύνδεσμος στην ενότητα: Μέτρηση του compute πριν δαπανηθεί: 6NDΠριν μπορέσει να προϋπολογιστεί οτιδήποτε από αυτά πρέπει να μετρηθεί, και ο κλάδος το μετρά με έναν τύπο:
όπου είναι ο αριθμός παραμέτρων, τα training tokens και οι συνολικές floating-point operations. Οι Kaplan et al. το παράγουν σε δύο βήματα.1 Forward: 2 FLOPs ανά παράμετρο ανά token, αφού κάθε παράμετρος σε έναν matrix multiply χρησιμοποιείται μία φορά ανά token, σε έναν πολλαπλασιασμό και μία πρόσθεση. Backward: διπλάσιο του forward, αφού το backward pass του Κεφαλαίου 5 υπολογίζει δύο gradients σε κάθε layer — ως προς τα inputs του layer, ώστε το σήμα να συνεχίσει να ταξιδεύει, και ως προς τα weights του — το καθένα ένας matrix multiply στο μέγεθος του forward, άρα .
Αυτή είναι όλη η παραγωγή, και αξίζει να την ελέγξετε αντί να την πιστέψετε. Το PyTorch διαθέτει έναν πραγματικό FLOP counter, torch.utils.flop_counter.FlopCounterMode, που παρεμβάλλεται σε κάθε operation που dispatch κάνει ένα μοντέλο και αθροίζει την πραγματική δουλειά. Τρέξτε το σε τέσσερα orders of magnitude, το μεγαλύτερο στη συσκευή meta, που δεσμεύει shapes και όχι μνήμη:
from torch.utils.flop_counter import FlopCounterMode
counter = FlopCounterMode(display=False)
with counter:
loss = model(x, targets)[1]
loss.backward()
measured = counter.get_total_flops()
print(measured / (6 * n_params * n_tokens))| διαμόρφωση | χωρίς embeddings | σύνολο | μετρημένο, fwd+bwd | ÷ (σύνολο ) | ÷ (χωρίς emb.) | fwd+bwd ÷ fwd |
|---|---|---|---|---|---|---|
| 128, 4 layers, 256 | 788.736 | 7.254.400 | 4.60e10 | 1.031 | 9.485 | 3.000 |
| 512, 8 layers, 256 | 25.183.232 | 51.045.888 | 3.26e11 | 1.038 | 2.104 | 3.000 |
| 768, 12 layers, 1024 | 84.973.056 | 124.356.864 | 1.75e12 | 1.145 | 1.676 | 3.000 |
| 1600, 48 layers, 1024 | 1.474.870.400 | 1.556.920.000 | 2.10e13 | 1.100 | 1.161 | 3.000 |
| 4096, 32 layers, 2048 | 6.442.983.424 | 6.582.444.032 | 8.74e13 | 1.080 | 1.104 | 3.000 |
| 8192, 80 layers, 8192 | 64.427.147.264 | 65.544.929.280 | 3.75e15 | 1.163 | 1.183 | 3.000 |
Ο λόγος forward+backward προς forward είναι 3.000, ακριβώς, σε κάθε κλίμακα: όχι μια προσέγγιση που τυχαίνει να είναι καλή, αλλά η αριθμητική ταυτότητα παραπάνω επιστρεφόμενη ως στρογγυλός αριθμός από έναν counter που δεν ξέρει τίποτα για την παραγωγή.
Το μετρημένο σύνολο κάθεται έπειτα μεταξύ 3 % και 17 % πάνω από , μόλις το μετρήσει τους embedding πίνακες — και αυτή η πρόταση έχει σημασία, επειδή τα δύο ιδρυτικά papers μετρούν το διαφορετικά. Ο Kaplan αποκλείει «all vocabulary and positional embeddings» επειδή έτσι «produces significantly cleaner scaling laws» (§1.3)· το Appendix F του Chinchilla λέει «we also count embeddings matrices in the total parameter count».2 Για ένα ευρύ λεξιλόγιο και ένα στενό hidden dimension τα δύο διαφέρουν κατά παράγοντα εννέα, όπως δείχνει η πρώτη σειρά.
Το υπόλοιπο κενό είναι αυτό που το σκόπιμα παραλείπει: τα attention scores. Η Eq. (2.2) του Kaplan γράφει το forward cost ως και πετά τον δεύτερο όρο επειδή — ασφαλές το 2020, λιγότερο ασφαλές τώρα, και ο λόγος που ο λόγος παρασύρεται προς τα πάνω καθώς το μεγαλώνει — γι’ αυτό δύο σειρές εδώ μοιράζονται ένα ίσο με 1.024 και ο λόγος πέφτει, από 1.145 σε 1.100, όταν το πηγαίνει από 768 σε 1.600. Είναι το κόστος που εισήγαγε το Κεφάλαιο 9 και το Κεφάλαιο 16 μετατρέπει σε τιμή.
Μνήμη: τι πρέπει πραγματικά να χωρέσει
Σύνδεσμος στην ενότητα: Μνήμη: τι πρέπει πραγματικά να χωρέσειΤο compute αποφασίζει πόσο θα διαρκέσει ένα run· η μνήμη αποφασίζει αν μπορεί να αρχίσει. Εκπαιδεύστε με απλό fp32 AdamW και κάθε παράμετρος κουβαλά τέσσερις αριθμούς: το weight, το gradient του, και τον τρέχοντα μέσο και τη διακύμανση του Adam — τους δύο μέσους που χτίστηκαν με το χέρι στο Κεφάλαιο 6. Τέσσερις αριθμοί των τεσσάρων bytes ο καθένας είναι 16 bytes ανά παράμετρο, πριν από ένα και μόνο activation. Μετρημένο σε GPU laptop 8 GB, παίρνοντας τη resident allocation στο σημείο του step όπου δεν υπάρχει ζωντανό graph:
| μοντέλο | λεξιλόγιο | batch | προβλεπόμενο | resident μετρημένο | peak σε step | η διαφορά | |
|---|---|---|---|---|---|---|---|
| 512, 8 layers | 50.257 | 8 | 51.045.888 | 779 MB | 801 MB | 2.500 MB | 1.699 MB |
| 512, 8 layers | 4.096 | 8 | 27.411.456 | 418 MB | 426 MB | 1.043 MB | 617 MB |
| 256, 6 layers | 4.096 | 8 | 5.839.360 | 89 MB | 89 MB | 382 MB | 293 MB |
| 256, 6 layers | 4.096 | 32 | 5.839.360 | 89 MB | 89 MB | 1.259 MB | 1.170 MB |
| 256, 6 layers | 4.096 | 128 | 5.839.360 | 89 MB | 89 MB | 4.771 MB | 4.681 MB |
Η πρόβλεψη και η μέτρηση συμφωνούν εντός 3 %. Η έκπληξη είναι η τελευταία στήλη: τα activations επισκιάζουν το μοντέλο. Το ίδιο μοντέλο 5,8 εκατομμυρίων παραμέτρων που χρειάζεται 89 MB persistent state χρειάζεται 4.681 MB activations σε batch 128 — πενήντα δύο φορές το μοντέλο — και μεγάλο μέρος αυτού δεν είναι καθόλου ο transformer. Είναι τα logits, ένα διάνυσμα μεγέθους λεξιλογίου ανά token στα τέσσερα bytes ανά entry: 512 MB στην τελευταία σειρά, 393 MB στην πρώτη. Το μέγεθος λεξιλογίου επιλέχθηκε στο Κεφάλαιο 7, και ακόμη αποφασίζει τι χωρά στην κάρτα.
Ποιος όρος κυριαρχεί εξαρτάται από το shape του run, γι’ αυτό οι Micikevicius et al. λένε ότι η μνήμη «is dominated by activations»3 ενώ το ZeRO λέει ότι ένα μοντέλο 1,5 δισεκατομμυρίου παραμέτρων χρειάζεται «at least 24 GB» μόνο σε model states.4 Το ZeRO φτάνει στα ίδια 16 bytes από άλλη διαδρομή — για fp16 weights, για fp16 gradients, το καθένα για τα fp32 master weights και τις δύο moments του Adam — που για 70 δισεκατομμύρια παραμέτρους είναι 1,12 terabytes, δεκατέσσερις GPUs των 80 GB πριν από ένα και μόνο activation.
Parallelism, σε μία παράγραφο και μία ανάθεση
Σύνδεσμος στην ενότητα: Parallelism, σε μία παράγραφο και μία ανάθεσηΤίποτα από αυτά δεν χωρά σε μία συσκευή σε frontier scale, οπότε το run χωρίζεται με τέσσερις τρόπους ταυτόχρονα. Data parallelism βάζει ένα αντίγραφο του μοντέλου σε κάθε GPU και μέσους όρους των gradients — η προεπιλογή, και εκείνο που βελτιώνει το ZeRO αρνούμενο να κρατά redundant αντίγραφα του optimizer state. Tensor parallelism χωρίζει μεμονωμένους πίνακες ανάμεσα σε συσκευές. Pipeline parallelism δίνει σε κάθε συσκευή μια συνεχόμενη ομάδα layers. Context parallelism χωρίζει την ίδια την ακολουθία, απαραίτητο μόνο όταν το γίνει αρκετά μακρύ ώστε να κυριαρχήσει ο όρος attention. Ο Πίνακας 4 του Llama 3 παραθέτει και τα τέσσερα ταυτόχρονα: tensor 8, context έως 16, pipeline 16, data έως 128, σε 16.384 H100 GPUs.5 Αυτό είναι όλο που θα πει αυτό το μάθημα γι’ αυτό· η μηχανική distributed training είναι ένα δικό της εξάμηνο, και το CS336 του Stanford είναι αυτό το εξάμηνο, διαλέξεις 5 έως 8, με τον κώδικα.6 Αυτό που επιβιώνει από την ανάθεση είναι ένας μόνο αριθμός, model FLOPs utilisation — το κλάσμα της peak αριθμητικής μιας GPU που επιτυγχάνει ένα πραγματικό run — που είναι αυτό που μετατρέπει το τακτοποιημένο σε wall-clock χρόνο και επομένως σε χρήμα.
Kaplan, και το στοίχημα που έβαλε η βιομηχανία
Σύνδεσμος στην ενότητα: Kaplan, και το στοίχημα που έβαλε η βιομηχανίαΤον Ιανουάριο του 2020, οι Kaplan et al. εκπαίδευσαν ένα grid από transformers και βρήκαν ότι το test loss ακολουθεί power law σε καθέναν από τους τρεις πόρους για περισσότερα από έξι orders of magnitude.1 Το §1.2 τους δίνει τρεις fitted laws:
με συνοδούς για data και για optimally allocated compute. Οι σταθερές δεν είναι καθολικές, και το paper το λέει: «the precise numerical values of , and depend on the vocabulary size and tokenization and hence do not have a fundamental meaning.»
Οι εκθέτες είναι μικροσκοπικοί: δέκα φορές περισσότερες παράμετροι αγοράζουν έναν παράγοντα από το υπόλοιπο loss. Αυτό ακούγεται σαν τίποτα, και είναι το πιο σημαντικό γεγονός εδώ — οι αποδόσεις είναι απαίσιες και δεν σταματούν ποτέ. Ένα power law με μικρό εκθέτη υπόσχεται ότι το επόμενο order of magnitude θα βοηθήσει, λιγότερο από το προηγούμενο, για πάντα. Η αγορά compute παύει να είναι τζόγος και γίνεται αγορά με δημοσιευμένη ισοτιμία, που είναι ακριβώς το επιχείρημα που ξεκλείδωσε το κεφάλαιο.
Μετά ήρθε η συνταγή, και εδώ το paper έκανε λάθος με τρόπο που κόστισε στη βιομηχανία πολλά χρήματα. Ο Πίνακας 6 του Kaplan δίνει και : δέκα φορές το compute σημαίνει μοντέλο 5,4 φορές μεγαλύτερο που τροφοδοτείται με μόνο 1,9 φορές περισσότερο κείμενο. Το abstract είναι ρητό — «optimally compute-efficient training involves training very large models on a relatively modest amount of data and stopping significantly before convergence.» Ο κλάδος έκανε ακριβώς αυτό: GPT-3 είναι 175 δισεκατομμύρια παράμετροι σε 300 δισεκατομμύρια tokens,7 Gopher 280 δισεκατομμύρια σε 300 δισεκατομμύρια, Megatron-Turing NLG 530 δισεκατομμύρια σε 270 δισεκατομμύρια.2 Μισό token έως δύο tokens ανά παράμετρο, παντού.
Chinchilla, και τι μετρούσε το sweep παραπάνω
Σύνδεσμος στην ενότητα: Chinchilla, και τι μετρούσε το sweep παραπάνωΤον Μάρτιο του 2022, οι Hoffmann et al. εκπαίδευσαν πάνω από 400 μοντέλα από 70 εκατομμύρια έως 16 δισεκατομμύρια παραμέτρους και έφτασαν στο αντίθετο συμπέρασμα από τρεις ανεξάρτητες διαδρομές.2 Ο Πίνακας 2 τους αναφέρει τον εκθέτη στο ως 0.50, 0.49 και 0.46, έναντι του 0.73 του Kaplan. Με απλά λόγια: το μέγεθος του μοντέλου και τα training data πρέπει να μεγαλώνουν στην ίδια αναλογία.
Η δεύτερη προσέγγισή τους είναι εκείνη που αναπαράγεται από το sweep στην κορυφή αυτού του κεφαλαίου, στο ένα εκατομμυριοστό της κλίμακας: ορίστε ένα budget, εκπαιδεύστε πολλά μεγέθη ακριβώς σε αυτό το budget, σχεδιάστε το final loss ως προς το μέγεθος του μοντέλου.
| παράμετροι | |||
|---|---|---|---|
| 98.624 | 5.3531 (171) | 4.8638 (542) | — |
| 150.320 | 5.4636 (74) | — | — |
| 194.208 | 5.5041 (44) | 4.8730 (140) | 4.4040 (442) |
| 295.808 | 5.5550 (19) | 4.9029 (60) | 4.3383 (190) |
| 665.280 | 5.7849 (3.8) | 5.1254 (12) | 4.4192 (38) |
| 1.280.768 | 5.8174 (1.0) | 5.1751 (3.2) | 4.5003 (10) |
| 3.101.568 | — | 5.4686 (0.5) | 4.7768 (1.7) |
| 5.315.072 | — | 5.5894 (0.2) | 4.8514 (0.6) |
| 15.053.568 | — | — | 5.3534 (0.1) |
Held-out loss σε nats ανά token, tokens ανά παράμετρο σε αγκύλες, έντονα για το καλύτερο μοντέλο σε κάθε budget· η παύλα είναι σημείο που δεν τρέχτηκε, επειδή το budget απαιτούσε περισσότερο κείμενο από όσο χωρά το corpus ή το μέγεθος έπεφτε έξω από εκείνα που σαρώθηκαν εκεί.
Διαβάστε προς τα κάτω σε μια στήλη: το loss πέφτει, βρίσκει πάτο και ξανανεβαίνει. Ένα μοντέλο μπορεί να είναι υπερβολικά μεγάλο για το budget του εξίσου εύκολα όσο και υπερβολικά μικρό — στο η ποινή για την επιλογή 665.280 παραμέτρων αντί 295.808 είναι 0,08 nats, που στο envelope που fit έγινε παραπάνω είναι το loss που ένα σωστά μεγέθους μοντέλο φτάνει με 18 % λιγότερο compute. Η επιλογή λάθος shape πετά ένα πέμπτο του budget. Αυτό είναι το Figure 3 του Chinchilla σε ένα απόγευμα σε μία GPU αντί με τετρακόσια μοντέλα.
Τώρα διαβάστε οριζόντια. Στο το καλύτερο μοντέλο είναι το μικρότερο που σαρώθηκε· στο είναι 295.808 παράμετροι, με σημεία και από τις δύο πλευρές. Το optimum μετακινείται δεξιά καθώς το budget μεγαλώνει, που είναι όλο το περιεχόμενο της διόρθωσης. Fit στην τρίτη προσέγγιση του paper — την επιφάνεια πάνω από κάθε run — και ελαχιστοποιήστε με περιορισμό :
L(N, D) = 24.7 / N^0.195 + 46.8 / D^0.169 (E fits to ~0; see below)
implied N_opt ∝ C^0.464
compare Chinchilla 0.46-0.50 · Besiroglu 0.513 · Kaplan 0.730.46, από ένα laptop, έναντι του 0.73 του Kaplan. Συμφωνία σε τρία ψηφία από fit τριών budgets είναι τύχη· συμφωνία στο πρώτο δεν είναι. Ο εκθέτης ταξιδεύει — η σταθερά όχι, αφού ο λόγος token-προς-παράμετρο σε αυτά τα optima είναι 170 έως 540, όχι 20. Τρεις λόγοι, όλοι διδακτικοί. Το fit-άρει στο μηδέν επειδή σε loss πάνω από 4 nats το run δεν είναι πουθενά κοντά στο entropy floor που κυριαρχεί στο fit του Chinchilla. Το batch size και το learning rate κρατήθηκαν σταθερά αντί να γίνουν tuned ανά σημείο, κάτι που δυσκολεύει όποια runs παίρνουν τα λιγότερα steps — και αυτά είναι τα μεγάλα μοντέλα: στο FLOPs ένα μοντέλο 1,28 εκατομμυρίων παραμέτρων παίρνει 159 optimizer steps συνολικά, πολύ κάτω από τις λίγες χιλιάδες που ο όρος του Kaplan λέει ότι χρειάζεται κάθε μοντέλο. Ένα scaling law fit-άρεται μέσα σε ένα καθεστώς, και αυτό εδώ κάθεται έξι orders of magnitude κάτω από του Chinchilla.
Εξ ου και το abstract του paper: «current large language models are significantly undertrained». Το Chinchilla είναι η επίδειξη — 70 δισεκατομμύρια παράμετροι σε 1,4 τρισεκατομμύρια tokens, το ίδιο συνολικό compute με το Gopher των 280 δισεκατομμυρίων σε 300 δισεκατομμύρια, να το κερδίζει σε 51 από 57 MMLU tasks, 67,5 % έναντι 60 %.2 Τέσσερις φορές μικρότερο, τεσσερισήμισι φορές περισσότερο κείμενο, ίδια χρήματα, καλύτερο μοντέλο.
Δύο επιφυλάξεις για εκείνη τη διάσημη αναλογία. «Είκοσι tokens ανά παράμετρο» δεν είναι πρόταση στο paper, που λέει μόνο ότι «for every doubling of model size the number of training tokens should also be doubled»· το 20 είναι συμπέρασμα από τον Πίνακα 3 και από το ίδιο το Chinchilla των 70 B σε 1,4 T. Και η ακρίβειά του είναι χειρότερη από τη δημοσιευμένη: οι Besiroglu et al. έκαναν refit από digitisation του Figure 4, βρήκαν ότι οι αρχικές παράμετροι «fit the reconstructed data poorly» με intervals «implausibly tight given the number of data points», και έβαλαν το ειλικρινές εύρος στο «between 4 and 40» tokens ανά παράμετρο.8
Μια λεπτομέρεια της μεθόδου του Chinchilla εξαργυρώνει μια υπόσχεση που έδωσε το Κεφάλαιο 1 για learning-rate schedules. Το cosine schedule πρέπει να ταιριάζει με το token budget. Ένα μοντέλο που θα δει 10 εκατομμύρια tokens πρέπει να κατεβάσει το learning rate του στο μηδέν στα 10 εκατομμύρια tokens· δώστε του schedule μεγέθους 100 εκατομμυρίων, σταματήστε το νωρίς, και διαβάζετε loss μεσούσης της καθόδου σε rate πολύ υπερβολικά υψηλό. Το Chinchilla εκπαιδεύει κάθε μοντέλο σε τέσσερα cycle lengths για να ελέγξει ακριβώς αυτό· το sweep παραπάνω ορίζει το schedule του από το budget για τον ίδιο λόγο.
Τι δεν υπόσχονται τα scaling laws
Σύνδεσμος στην ενότητα: Τι δεν υπόσχονται τα scaling lawsΕίναι το πιο χρήσιμο εμπειρικό αποτέλεσμα στον κλάδο και υπερπουλιούνται συστηματικά. Τέσσερα όρια.
Προβλέπουν loss, όχι ικανότητα. Η αριστερή πλευρά είναι cross-entropy σε held-out κείμενο. Τίποτα σε αυτά τα papers δεν νομιμοποιεί ισχυρισμό για το αν ένα μοντέλο θα γράψει σωστό SQL, θα αρνηθεί ένα επιβλαβές αίτημα ή θα χρησιμοποιήσει tool. Αυτό είναι ξανά το μάθημα του Κεφαλαίου 5: μια πρόβλεψη του loss δεν είναι πρόβλεψη της συμπεριφοράς για την οποία πληρώνετε.
Είναι fitted, όχι derived. Καμία θεωρία δεν παράγει . Οι σταθερές μετακινούνται με τον tokenizer — γι’ αυτό μια σύγκριση perplexity ανάμεσα σε δύο tokenizers είναι χωρίς νόημα, όπως εξήγησε το Κεφάλαιο 8 — και με το μείγμα δεδομένων, την αρχιτεκτονική και τον optimizer. Κάθε δημοσιευμένος νόμος είναι νόμος του setup που τον παρήγαγε, γι’ αυτό η Meta έκανε refit το δικό της πριν από το Llama 3.5
Υποθέτουν ένα φρέσκο token για κάθε step, που σιωπηλά υποθέτει ένα άπειρο corpus. Οι Muennighoff et al. μέτρησαν τι συμβαίνει όταν αυτό τελειώσει: έως τέσσερα epochs επαναλαμβανόμενων δεδομένων κοστίζουν σχεδόν τίποτα — ένα μοντέλο 8,7 δισεκατομμυρίων παραμέτρων σε 44 δισεκατομμύρια μοναδικά tokens που τα είδε τέσσερις φορές τελείωσε «only 0.5 % higher validation loss» από το ίδιο μοντέλο σε 178 δισεκατομμύρια μοναδικά — ενώ μετά από περίπου δεκαέξι epochs το πρόσθετο compute δεν αγοράζει τίποτα.9
Και κανείς δεν εκπαιδεύει compute-optimal πια. Το Chinchilla ελαχιστοποιεί το κόστος του training· ένα deployed μοντέλο έπειτα πληρώνει περίπου FLOPs ανά παραγόμενο token, για πάντα. Το LLaMA 1 το είπε καθαρά: «given a target level of performance, the preferred model is not the fastest to train but the fastest at inference».10 Οι Sardana et al. το τυποποίησαν ελαχιστοποιώντας αντί γι’ αυτό , και βρήκαν ότι όποιος περιμένει ένα δισεκατομμύριο requests πρέπει να εκπαιδεύει «smaller and longer than Chinchilla-optimal».11 Το §9.1 του Llama 3 συμφωνεί: τα μικρά μοντέλα του εκπαιδεύονται «far beyond the point of compute optimal training, effectively trading training compute for inference efficiency».5 Η αναλογία δεν είναι παρωχημένη· απαντά μια ερώτηση που δεν είναι πλέον αυτή που τίθεται.
Emergent abilities, και το επιχείρημα για το αν είναι πραγματικές
Σύνδεσμος στην ενότητα: Emergent abilities, και το επιχείρημα για το αν είναι πραγματικέςΤο loss πέφτει ομαλά. Τα benchmark scores μερικές φορές όχι. Οι Wei et al. συνέλεξαν περιπτώσεις όπου ένα task κάθεται στο chance σε orders of magnitude training compute και μετά πηδά — τριψήφια αριθμητική που εμφανίζεται στο GPT-3 περίπου στα FLOPs, MMLU που ανεβαίνει πάνω από την τύχη μεταξύ και — και ονόμασαν το pattern: «an ability is emergent if it is not present in smaller models but is present in larger models».12 Αν αυτό είναι πραγματική ιδιότητα, η παρέκταση από φθηνά πειράματα είναι μη ασφαλής, επειδή η ικανότητα που αγοράζετε μπορεί να μην υπάρχει σε καμία κλίμακα που μπορείτε να αντέξετε να δοκιμάσετε.
Οι Schaeffer, Miranda και Koyejo υποστήριξαν ότι το μεγαλύτερο μέρος του είναι artefact της μέτρησης, και ο μηχανισμός είναι αριθμητικός.13 Το per-token loss πέφτει ομαλά, άρα η πιθανότητα ένα token να είναι σωστό, , βελτιώνεται σταδιακά. Βαθμολογήστε το μοντέλο με exact string match πάνω σε απάντηση -token και υψώνετε αυτή την πιθανότητα στη δύναμη — μια ομαλή καμπύλη υψωμένη σε μεγάλη δύναμη μοιάζει με γκρεμό. Αλλάξτε σε metric που μετρά tokens αντί να απαιτεί όλα τους, στις ίδιες εξόδους, και «the family's performance smoothly, continuously and predictably improves with increasing scale».
Το audit τους είναι ο αριθμός που πρέπει να θυμάστε — «of the 39 preferred metrics in BIG-Bench, at most 5 display emergence», με δύο discontinuous metrics να ευθύνονται για πάνω από 92 % των claimed cases — και το ίδιο και η προειδοποίησή τους: «nothing in this paper should be interpreted as claiming that large language models cannot display emergent abilities». Ένα άλμα σε γράφημα είναι απόδειξη για το metric μέχρι να φανεί το αντίθετο. Το Κεφάλαιο 29 είναι εκεί όπου αυτό γίνεται δικό σας πρόβλημα, επειδή η επιλογή ενός hard-cutoff metric είναι απόφαση που θα πάρετε χωρίς να το καταλάβετε.
Από πού προέρχονται τα δεδομένα
Σύνδεσμος στην ενότητα: Από πού προέρχονται τα δεδομέναΤο corpus είναι το μέρος ενός pretraining run χωρίς εξίσωση συνδεδεμένη μαζί του, και εκεί όπου ζουν οι περισσότερες αποφάσεις με συνέπειες. Η πρώτη ύλη είναι ένα web crawl: το αρχείο Αυγούστου 2026 του Common Crawl περιέχει «2.14 billion web pages or 360 TiB of uncompressed content», έναν μήνα του, δωρεάν για download.14 Σχεδόν τίποτα δεν είναι χρησιμοποιήσιμο όπως είναι. Το paper του T5 λέει ότι το crawl «largely comprises gibberish or boiler-plate text like menus, error messages, or duplicate text», και το C4 pipeline που εισήγαγε είναι μια λίστα από ωμές heuristics — κρατήστε μόνο γραμμές που τελειώνουν σε terminal punctuation, πετάξτε σελίδες με λιγότερες από τρεις προτάσεις, πετάξτε κάθε σελίδα που περιέχει άγκιστρο ή λέξη από δημόσια λίστα βωμολοχιών — μετατρέποντας είκοσι terabytes μηνιαίου κειμένου σε περίπου 750 GB.15
Ωμές είναι η λέξη. Οι Dodge et al. έκαναν audit στο τι αφαιρούν αυτά τα filters και βρήκαν ότι η blocklist βωμολοχιών διαγράφει 42 % των εγγράφων σε African-American English και 32 % σε Hispanic-aligned English, έναντι 6,2 % σε White-aligned English, αφήνοντας ένα corpus 97,8 % της τελευταίας κατηγορίας.16 Ένας κανόνας χωρίς άποψη για διάλεκτο είχε μία.
Μετά deduplication, που δεν είναι νοικοκύρεμα: οι Lee et al. βρήκαν μια πρόταση 61 λέξεων επαναλαμβανόμενη 61.036 φορές στο C4, και έδειξαν ότι το deduplicating κόβει δεκαπλάσια τον ρυθμό με τον οποίο τα μοντέλα «emit memorized text», από 1,9 % των generated tokens σε 0,19 %.17 Το περισσότερο δεν είναι καλύτερο, όμως — η ομάδα του FineWeb έκανε deduplication global σε 96 crawls, πήρε 4 τρισεκατομμύρια tokens και καμία μετρήσιμη βελτίωση, μετά έκανε deduplication σε κάθε crawl χωριστά, πήρε 20 τρισεκατομμύρια, και ταίριαξε το καλύτερο υπάρχον corpus.18
Μετά contamination. Το Llama 3 μέτρησε το δικό του και το δημοσίευσε: 98 % του AGIEval, 95 % του BIG-Bench Hard και 85 % του HellaSwag επικαλύπτονταν με το training set κατά 8-grams, και για το MMLU overlap τόσο υψηλό ώστε «it is impossible to get a good performance gain estimate».5 Το §4 του GPT-3 αναφέρει ένα filtering bug που άφησε benchmarks στα δεδομένα χωρίς επιστροφή: «because of cost considerations it was infeasible to retrain the model».7
Η provenance είναι το άλυτο μέρος. Το Pile κυκλοφόρησε ένα component 100,96 GiB με όνομα Books3 — 12 % του corpus και, σύμφωνα με τον πίνακα consent του ίδιου του paper, βιβλία από ιδιωτικό torrent tracker·19 κατέβηκε offline τον Αύγουστο του 2023 μετά από καταγγελία copyright. Η νομική θέση τον Σεπτέμβριο του 2026 παραμένει αβέβαιη, και οι τρεις αποφάσεις στις ΗΠΑ που αναφέρονται ως τάση διαφωνούν μεταξύ τους. Ο Alsup βρήκε ότι το training σε νόμιμα αποκτημένα βιβλία ήταν «exceedingly transformative» ενώ έκρινε ότι μια βιβλιοθήκη φτιαγμένη από πειρατικά αντίγραφα δεν ήταν, και η Anthropic συμβιβάστηκε για εκείνο το μισό με $1,5 δισεκατομμύριο καλύπτοντας 482.460 έργα, περίπου $3.000 το καθένα, εγκεκριμένο στις 20 Ιουλίου 2026.20 Ο Chhabria granted summary judgment στη Meta ενώ έγραφε ότι η απόφασή του «does not stand for the proposition that Meta's use of copyrighted materials to train its language models is lawful», μόνο ότι «these plaintiffs made the wrong arguments».21 Ο Bibas, αποφασίζοντας κατά της Ross Intelligence, σημείωσε ότι «only non-generative AI is before me today».22 Κανένα US appellate court δεν έχει αποφανθεί επί του ερωτήματος.
Άνθρωποι κάνουν τα κομμάτια που το loss δεν μπορεί. Το TIME ανέφερε τον Ιανουάριο του 2023 ότι εργαζόμενοι που επισήμαιναν toxic κείμενο για την OpenAI μέσω της εταιρείας Sama έπαιρναν καθαρά «between around $1.32 and $2 per hour» διαβάζοντας αποσπάσματα που περιέγραφαν σεξουαλική κακοποίηση παιδιών, βασανιστήρια και αυτοτραυματισμό, ενώ η OpenAI πλήρωνε τη Sama $12,50 την ώρα για τη δουλειά· η Sama αμφισβητεί τόσο το εύρος αμοιβής όσο και την quota.23 Αυτό είναι το filtering γύρω από το pretraining και όχι το ίδιο το pretraining — αλλά βρίσκεται στο ίδιο τιμολόγιο, και εκεί κάθεται ένας άνθρωπος.
Το ρεύμα είναι πραγματικό και συνήθως παρατίθεται λάθος. Το πιο προσεκτικό δημοσιευμένο νούμερο είναι του BLOOM: 1.082.990 GPU-hours, 433 MWh και 24,7 τόνοι ισοδύναμου CO₂ για το run, 50,5 με κατασκευή και idle nodes·24 οι Patterson et al. βάζουν το GPT-3 στα 1.287 MWh και 552 τόνους.25 Δύο προειδοποιήσεις. Το πλεονέκτημα του BLOOM είναι το γαλλικό πυρηνικό grid στα 57 g CO₂ ανά kWh και όχι η αποδοτικότητα — χρησιμοποίησε περισσότερη ενέργεια από το OPT-175B. Και το πιο πολυπαρατεθειμένο emissions figure του κλάδου, τα 626.155 lb των Strubell et al. για neural architecture search, αργότερα αποδείχθηκε 88 φορές υπερβολικά υψηλό, επειδή υπέθεσε ότι η αναζήτηση έτρεξε σε πλήρες model size ενώ έτρεξε σε proxy.26 Το framing του LBNL είναι το υπερασπίσιμο: τα US data centres χρησιμοποίησαν 192 TWh το 2024, 4,7 % της εθνικής ηλεκτρικής ενέργειας — αριθμός συνδεδεμένος με μια βιομηχανία, όχι με οποιοδήποτε ένα run.27
Το νήμα είναι αυτό που οι Bender et al. ονόμασαν documentation debt: «putting ourselves in a situation where the datasets are both undocumented and too large to document post hoc».28 Κάθε γεγονός παραπάνω υπάρχει επειδή κάποιος κοίταξε. Για τα corpora πίσω από τα μοντέλα που χρησιμοποιούν οι περισσότεροι, κανείς δεν μπορεί.
Τι κοστίζει πραγματικά
Σύνδεσμος στην ενότητα: Τι κοστίζει πραγματικάΤώρα η αριθμητική που όλοι θέλουν, από τέσσερα cited inputs, ώστε όταν παλιώσουν να είναι προφανές ποιο πρέπει να αντικατασταθεί.
Peak throughput
Σύνδεσμος στην ενότητα: Peak throughputΗ σελίδα H100 της NVIDIA παραθέτει 1.979 teraFLOPS BF16 tensor-core throughput κάτω από υποσημείωση που γράφει «with sparsity».29 Κανένα pretraining run δεν χρησιμοποιεί structured sparsity, άρα ο dense αριθμός είναι ο μισός: 989,5 TFLOP/s.
Utilisation
Σύνδεσμος στην ενότητα: UtilisationΟ Πίνακας 4 του Llama 3 αναφέρει 38–43 % BF16 model FLOPs utilisation. Πάρτε 40 %: 395,8 TFLOP/s χρήσιμης αριθμητικής ανά GPU.5
Η on-demand τιμή της Lambda για 8×H100 SXM node, προσπελασμένη 2026-09-06: $3,99 ανά GPU-hour, άρα $31,92 την ώρα για το node.30
Η αναλογία του Chinchilla, , δίνει και επομένως .
| budget | H100-hours | FLOPs | compute-optimal παράμετροι | tokens | σε ένα 8×H100 node | GPUs για ολοκλήρωση σε 90 ημέρες |
|---|---|---|---|---|---|---|
| $100 | 25 | 3.6e19 | 546 M | 10.9 B | 3,1 h | 1 |
| $1.000 | 251 | 3.6e20 | 1,73 B | 34,5 B | 31,3 h | 1 |
| $10.000 | 2.506 | 3.6e21 | 5,46 B | 109 B | 13 ημέρες | 2 |
| $100.000 | 25.063 | 3.6e22 | 17,3 B | 345 B | 131 ημέρες | 12 |
| $1.000.000 | 250.627 | 3.6e23 | 54,6 B | 1,09 T | 4 χρόνια | 116 |
| $10.000.000 | 2.506.266 | 3.6e24 | 173 B | 3,45 T | 36 χρόνια | 1.160 |
| $100.000.000 | 25.062.657 | 3.6e25 | 546 B | 10,9 T | 358 χρόνια | 11.603 |
Διαβάστε τις δύο τελευταίες στήλες μαζί. Με $10.000 παίρνετε ένα μοντέλο 5 δισεκατομμυρίων παραμέτρων σε ένα rented node σε δεκαπέντε μέρες. Με $100.000.000 η αριθμητική λέει 546 δισεκατομμύρια παράμετροι — και δώδεκα χιλιάδες H100s καλωδιωμένες μαζί για τρεις μήνες, που δεν είναι κάτι που νοικιάζετε με πιστωτική κάρτα. Πέρα από περίπου $100.000 ο δεσμευτικός περιορισμός παύει να είναι το χρήμα και γίνεται το cluster.
Πριν εμπιστευτείτε έναν τέτοιο πίνακα, δοκιμάστε τον απέναντι σε runs των οποίων το πραγματικό κόστος έχει δημοσιευτεί — το llm.c αναπαράγει το GPT-2 124M σε «~90 minutes» σε 8×A100 node «for about $20», και το GPT-2 1.6B σε 24 ώρες σε 8×H100 node για $672.31
$672, against what $672 actually bought (llm.c GPT-2 1.6B, one 8xH100 node, 24 h)
this table predicts: 168 H100-hours N = 1.41 B params D = 28.3 B tokens
what was actually run: 192 H100-hours N = 1.558 B params D = 33.6 B tokens
Llama 3 405B, against Meta's own published GPU-hours
from the paper's 3.8e25 FLOPs at 40 % MFU: 26.67 M H100-hours
published in Meta's Llama 3.1 model card: 30.84 M H100-hours ratio 0.86Και τα δύο εντός περίπου 15 %, που είναι περίπου η ακρίβεια που αξίζει αυτό το είδος εκτίμησης και σημαντικά καλύτερη από την ακρίβεια με την οποία συνήθως παρατίθεται.
Η headline σύγκριση, με τους δύο ορισμούς στο τραπέζι
Σύνδεσμος στην ενότητα: Η headline σύγκριση, με τους δύο ορισμούς στο τραπέζιΤο πιο επαναλαμβανόμενο νούμερο σε αυτό το θέμα είναι ότι ένα μοντέλο κλάσης GPT-2 που κόστιζε περίπου $43.000 το 2019 μπορεί σήμερα να αναπαραχθεί για μερικές δεκάδες δολάρια. Το σύγχρονο μισό είναι καλά τεκμηριωμένο· το ιστορικό μισό όχι.
Σήμερα. Το README του nanochat του Karpathy: «you can train your own GPT-2 capability LLM ... for only $48 (~2 hours of 8XH100 GPU node) ... On a spot instance, the total cost can be closer to ~$15.»32 Το «GPT-2 capability» εδώ είναι ακριβές και δημοσιευμένο — ξεπερνά το CORE score του GPT-2, 0.256525 — σε leaderboard του οποίου η καλύτερη εγγραφή στις 14 Μαρτίου 2026 είναι 1,65 ώρες. Τα $48 υποθέτουν $3 ανά GPU-hour, κάτω από την τιμή καταλόγου $3,99 της Lambda· στην τιμή καταλόγου είναι πιο κοντά στα $64.
Το 2019. Δεν υπάρχει primary source: η OpenAI δεν δημοσίευσε ποτέ διάρκεια ή κόστος. Η αλυσίδα περνά από The Register, Φεβρουάριος 2019, που ανέφερε «256 Google TPU3 cores» χωρίς τιμή και χωρίς διάρκεια· μετά Synced, Ιούνιος 2019, που σημείωσε ότι το hardware κόστιζε $256 την ώρα στο Google Cloud και δήλωσε ρητά ότι «OpenAI didn't specify the training duration». Τα $43.008 είναι $256 την ώρα επί μια υποτιθέμενη διάρκεια 168 ωρών που κανείς δεν έχει ποτέ τεκμηριώσει.
Άρα ο ειλικρινής τίτλος είναι: ένα μοντέλο που ταιριάζει με το δημοσιευμένο benchmark score του GPT-2 μπορεί σήμερα να εκπαιδευτεί για πολύ κάτω από $100 σε rented hardware, έναντι κόστους του 2019 που δεν δημοσιεύτηκε ποτέ και του οποίου η διάσημη εκτίμηση στηρίζεται σε ατεκμηρίωτη εικασία για τη διάρκεια. Η κατάρρευση είναι πραγματική και το σύγχρονο μισό αναπαράγεται από οποιονδήποτε με πιστωτική κάρτα· ο λόγος είναι αριθμητική πάνω σε αριθμό που δεν υπάρχει. Αυτή είναι η κατάσταση των δημοσιευμένων training costs γενικά. Το paper του GPT-3 δεν περιέχει κανένα ποσό σε δολάρια, μόνο FLOPs στον Πίνακα D.1·7 ούτε το paper του Llama 3 περιέχει.5 Κάθε training cost που έχετε διαβάσει είναι εκτίμηση από FLOP count, hardware assumption και price assumption — αξίζει πάντα να ρωτάτε ποιανού.
Τι γνωρίζει ένα base model, και πότε σταμάτησε να το γνωρίζει
Σύνδεσμος στην ενότητα: Τι γνωρίζει ένα base model, και πότε σταμάτησε να το γνωρίζειΑυτό που προκύπτει έχει δει ένα σταθερό corpus συναρμολογημένο σε μια σταθερή στιγμή, και ακολουθούν δύο ιδιότητες.
Η πρώτη είναι το knowledge cutoff. Μετά την ημερομηνία συλλογής το μοντέλο δεν ξέρει τίποτα — όχι «είναι αβέβαιο», τίποτα — και θα επινοήσει με ευφράδεια αντί να το πει, επειδή το να το πει δεν ήταν ποτέ συμπεριφορά στην οποία εκπαιδεύτηκε. Το model card του Llama 3.1 δίνει Δεκέμβριο 2023·33 κάθε μοντέλο έχει ένα, και είναι ιδιότητα των training data, όχι του deployment. Η παράκαμψή του είναι πρόβλημα retrieval, που είναι το Κεφάλαιο 19.
Η δεύτερη είναι ότι ένα base model συμπληρώνει αντί να απαντά. Δώστε του «Ποια είναι η πρωτεύουσα της Γαλλίας;» και μια πιθανή συνέχεια είναι μια άλλη ερώτηση, επειδή στο corpus αυτό το string εμφανίζεται συχνότερα σε λίστα ασκήσεων.
Πού πηγαίνει αυτό μετά
Σύνδεσμος στην ενότητα: Πού πηγαίνει αυτό μετάΈνας text completer δεν είναι assistant. Δεν ακολουθεί οδηγίες, επειδή τίποτα στο corpus δεν του είπε ότι ένα αίτημα πρέπει να υπακουστεί αντί να συνεχιστεί. Δεν έχει έννοια συζήτησης με δύο συμμετέχοντες. Θα παράγει ευχαρίστως τη πιθανότερη συνέχεια ενός επιβλαβούς prompt, επειδή το πιθανό είναι το μόνο πράγμα για το οποίο έγινε ποτέ optimized.
Η μετατροπή του σε κάτι που απαντά απαιτεί ένα δεύτερο στάδιο που κοστίζει κλάσμα του ενός τοις εκατό του πρώτου, και αποτελείται σχεδόν εξ ολοκλήρου από το να του δείξετε παραδείγματα της συμπεριφοράς που θέλετε και μετά να συγκρίνετε ζεύγη από τις δικές του εξόδους. Αυτό το στάδιο είναι από όπου προέρχονται το instruction following, τα chat templates, οι refusals και — αυτό εκπλήσσει τους ανθρώπους — η δυνατότητα να κάνει call ένα tool. Το Κεφάλαιο 11 είναι αυτό το στάδιο: supervised fine-tuning, RLHF, DPO και GRPO, και το ερώτημα τι σημαίνει «aligned» και ποιος αποφασίζει.
Πηγές και μέθοδος
Σύνδεσμος στην ενότητα: Πηγές και μέθοδοςΑξίζει επίσης να διαβαστούν μαζί με αυτό το κεφάλαιο: το build-nanogpt του Karpathy και το συνοδευτικό video του, που περπατούν μια πλήρη αναπαραγωγή GPT-2 από άκρη σε άκρη με ρυθμό που αυτό το κεφάλαιο δεν μπορεί· και το Stanford CS324, Large Language Models, του οποίου οι διαλέξεις για data και environmental impact πηγαίνουν βαθύτερα από την παραπάνω ενότητα σε υλικό που αυτό το μάθημα αντιμετωπίζει μία φορά και αναθέτει.
Παραπομπές
Σύνδεσμος στην ενότητα: Παραπομπές-
Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J. and Amodei, D. Scaling Laws for Neural Language Models. arXiv:2001.08361 (2020). Οι τρεις power laws είναι οι Eqs. (1.1)–(1.3) στο §1.2 και οι πλήρεις σταθερές βρίσκονται στο Appendix A, Table 5· η παραγωγή είναι το §2.1· οι εκθέτες compute-allocation είναι ο Table 6. Σημειώστε ότι υπάρχουν δύο compute laws, σε σταθερό batch size και σε optimal batch size· το paper λέει ότι το δεύτερο «should be used to make predictions». ↩ ↩2
-
Hoffmann, J., Borgeaud, S., Mensch, A., Buchatskaya, E., Cai, T., Rutherford, E. et al. Training Compute-Optimal Large Language Models. arXiv:2203.15556 (2022). Εκθέτες στον Table 2, projected budgets στον Table 3, η σύγκριση Gopher στο §4, η σύμβαση parameter-counting στο Appendix F. Το πεζό κείμενο κάτω από τον Table 3 διαφωνεί με τον ίδιο τον Table 3 για τις σειρές 175 B και 280 B· ο πίνακας είναι η εκδοχή που πρέπει να παραθέτετε. ↩ ↩2 ↩3 ↩4
-
Micikevicius, P., Narang, S., Alben, J., Diamos, G., Elsen, E., Garcia, D. et al. Mixed Precision Training. arXiv:1710.03740 (2017), ICLR 2018. FP32 master weights στο §3.1, loss scaling στο §3.2. ↩ ↩2
-
Rajbhandari, S., Rajbhandari, S., Ruwase, O. and He, Y. ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054 (2019), SC20. Η λογιστική είναι το §3.1· τα residual-state figures για activations είναι το §3.2. ↩
-
Grattafiori, A. et al. (Llama Team, AI @ Meta). The Llama 3 Herd of Models. arXiv:2407.21783 (2024). Compute budget και token count στο §1, το refitted scaling law στο §3.2.1, η parallelism configuration και MFU στον Table 4, το contamination analysis στο §5.1.4, η over-training statement στο §9.1. Το paper δεν περιέχει dollar figures και emissions table. ↩ ↩2 ↩3 ↩4 ↩5 ↩6
-
Stanford CS336, Language Modeling from Scratch. Η Lecture 2 καλύπτει resource accounting, οι lectures 5–8 GPUs, kernels και parallelism, οι lectures 9 και 11 scaling, οι lectures 13–14 data. Είναι το μάθημα στο οποίο αυτό το κεφάλαιο αναθέτει τη μηχανική του, και είναι δημόσιο. ↩
-
Brown, T. B. et al. Language Models are Few-Shot Learners. arXiv:2005.14165 (2020). Compute στο Appendix D, Table D.1 — που έχει στήλη κυριολεκτικά με επικεφαλίδα «flops per param per token», της οποίας η τιμή για κάθε σειρά GPT-3 είναι 6. Contamination analysis στο §4. ↩ ↩2 ↩3
-
Besiroglu, T., Erdil, E., Barnett, M. and You, J. Chinchilla Scaling: A replication attempt. arXiv:2404.10102 (2024). Ανασυνθέτει τα δεδομένα του Chinchilla κάνοντας digitising το Figure 4, κάνει refit, και αναφέρει τους διορθωμένους εκθέτες και πολύ ευρύτερα intervals. ↩
-
Muennighoff, N., Rush, A. M., Barak, B., Le Scao, T., Piktus, A., Tazi, N., Pyysalo, S., Wolf, T. and Raffel, C. Scaling Data-Constrained Language Models. arXiv:2305.16264 (2023), NeurIPS 2023. Το αποτέλεσμα τεσσάρων epochs είναι το §6· το half-life των δεκαέξι epochs είναι το fitted . ↩
-
Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T. et al. LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 (2023). Το §1 διατυπώνει το inference-cost argument ενάντια στο Chinchilla-optimal training. ↩
-
Sardana, N., Portes, J., Doubov, S. and Frankle, J. Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws. arXiv:2401.00448 (2023), ICML 2024. Το §5 τους περιέχει επίσης το counterweight: μοντέλα εκπαιδευμένα σε extreme token ratios συνεχίζουν να βελτιώνονται, αλλά «more slowly than scaling laws predict». ↩
-
Wei, J., Tay, Y., Bommasani, R., Raffel, C., Zoph, B., Borgeaud, S. et al. Emergent Abilities of Large Language Models. arXiv:2206.07682 (2022), TMLR. Ορισμός στο §2, παραδείγματα και compute thresholds στα §3–4 και Table 1. ↩
-
Schaeffer, R., Miranda, B. and Koyejo, S. Are Emergent Abilities of Large Language Models a Mirage? arXiv:2304.15004 (2023), NeurIPS 2023 outstanding paper. Το metric argument είναι το §2, το BIG-Bench meta-analysis §4, το constructed vision example §5. ↩
-
Common Crawl, August 2026 Crawl Archive Now Available (CC-MAIN-2026-34), published 24 August 2026, accessed 2026-09-06. Η δική του front page ισχυρίζεται «over 300 billion pages spanning 15 years», «totalling more than 10 petabytes» — figure για όλο το archive, όχι για το monthly crawl που κοστολογείται εδώ. ↩
-
Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W. and Liu, P. J. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683 (2019), JMLR 21(140). Τα C4 filters είναι το §2.2. Το paper δίνει μεγέθη σε bytes, όχι tokens· το figure των 156 δισεκατομμυρίων-token που αποδίδεται ευρέως σε αυτό προέρχεται από τους Dodge et al. παρακάτω. ↩
-
Dodge, J., Sap, M., Marasović, A., Agnew, W., Ilharco, G., Groeneveld, D., Mitchell, M. and Gardner, M. Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758 (2021), EMNLP 2021. Τα dialect removal rates είναι το §5.3· benchmark contamination στο C4 είναι το §4.2. ↩
-
Lee, K., Ippolito, D., Nystrom, A., Zhang, C., Eck, D., Callison-Burch, C. and Carlini, N. Deduplicating Training Data Makes Language Models Better. arXiv:2107.06499 (2021), ACL 2022. Οι 61.036 επαναλήψεις είναι το footnote 1· τα memorisation figures είναι το §6.2, Table 4, και είναι ποσοστά generated tokens υπό 50-token exact-match criterion. ↩
-
Penedo, G., Kydlíček, H., Ben Allal, L., Lozhkov, A., Mitchell, M., Raffel, C., Von Werra, L. and Wolf, T. The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale. arXiv:2406.17557 (2024), NeurIPS 2024 Datasets and Benchmarks. Το αποτέλεσμα deduplication είναι το §3.4. Το released dataset έχει έκτοτε μεγαλώσει πέρα από τα 15 τρισεκατομμύρια tokens του paper. ↩
-
Gao, L., Biderman, S., Black, S. et al. The Pile: An 800GB Dataset of Diverse Text for Language Modeling. arXiv:2101.00027 (2020). Books3 είναι το §2.3 και Table 1· ο consent table είναι Table 5. Το corpus είναι 825,18 GiB, άρα ακόμη και ο τίτλος είναι στρογγυλοποίηση προς τα κάτω. ↩
-
Bartz v. Anthropic, No. 4:24-cv-05417 (N.D. Cal.). Fair-use order 23 June 2025 (Dkt. 231); class certification 17 July 2025; final approval and judgment 20 July 2026 (Dkt. 680). Ο συμβιβασμός releases past inputs only, όχι outputs και όχι future conduct. ↩
-
Kadrey v. Meta, No. 3:23-cv-03417-VC (N.D. Cal.), summary judgment 25 June 2025 (Dkt. 598). Σημειώστε ότι το distribution claim για torrenting δεν αποφασίστηκε και παραμένει live. ↩
-
Thomson Reuters v. ROSS Intelligence, No. 1:20-cv-00613-SB (D. Del.), revised opinion 11 February 2025 (Dkt. 770), Bibas J. On interlocutory appeal to the Third Circuit (No. 25-2153), argued 11 June 2026, undecided at the time of writing. ↩
-
Perrigo, B. Exclusive: OpenAI Used Kenyan Workers on Less Than $2 Per Hour to Make ChatGPT Less Toxic. TIME, 18 January 2023. Τα $2 είναι ceiling για senior reviewers που πέτυχαν κάθε target· junior labellers, η πλειονότητα, έπαιρναν καθαρά $1,32. Η rebuttal της Sama, quoted στο ίδιο article, δίνει $1,46–$3,74 και χαμηλότερη quota. ↩
-
Luccioni, A. S., Viguier, S. and Ligozat, A.-L. Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language Model. arXiv:2211.02001 (2022), JMLR 24(253). Tables 1 και 3. ↩
-
Patterson, D., Gonzalez, J., Le, Q., Liang, C., Munguia, L.-M., Rothchild, D., So, D., Texier, M. and Dean, J. Carbon Emissions and Large Neural Network Training. arXiv:2104.10350 (2021). Τα figures του GPT-3 είναι στον Table 4· η διόρθωση της NAS estimate είναι το §4.1. ↩
-
Strubell, E., Ganesh, A. and McCallum, A. Energy and Policy Considerations for Deep Learning in NLP. arXiv:1906.02243 (2019), ACL 2019. Αξίζει να διαβαστεί ακριβώς λόγω του τι συνέβη στο πιο πολυπαρατεθειμένο νούμερό του: το paper είναι προσεκτικό, δηλώνει την extrapolation του, και παρ’ όλα αυτά έκανε λάθος κατά δύο orders of magnitude στη μία γραμμή που όλοι επανέλαβαν. ↩
-
Smith, S. J., Hubbard, A., Newkirk, A., Ganeshalingam, M., Holecek, B., Sartor, D., Mills, M. and Shehabi, A. United States Data Center Energy Usage Report: 2025 Update. LBNL-2001758 (18 June 2026). Αυτό αναθεωρεί το ευρέως cited 2024 report προς τα κάτω για την historical series· αν παραθέτετε το figure των 176 TWh για το 2023, παραθέτετε την superseded edition. ↩
-
Bender, E. M., Gebru, T., McMillan-Major, A. and Shmitchell, S. On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? FAccT '21, pp. 610–623. DOI 10.1145/3442188.3445922. Το «Documentation debt» είναι το §4.4. Σημειώστε ότι τα δικά του carbon figures του paper παρατίθενται από τους Strubell et al. και κληρονομούν τη διόρθωση παραπάνω — κάτι που είναι illustration του επιχειρήματός του και όχι refutation του. ↩
-
NVIDIA. NVIDIA H100 Tensor Core GPU product page,
nvidia.com/en-us/data-center/h100/(accessed 2026-09-06). Κάθε tensor-core row σε εκείνη τη σελίδα εκτός από FP64 φέρει την υποσημείωση «with sparsity»· το dense BF16 figure που χρησιμοποιείται εδώ είναι το μισό του δημοσιευμένου 1.979 TFLOPS. ↩ -
Lambda. GPU Cloud pricing,
lambda.ai/pricing(accessed 2026-09-06). On-demand, ανά GPU ανά ώρα, πριν από φόρους. Οι τιμές σε αυτή την ενότητα θα παλιώσουν γρηγορότερα από οτιδήποτε άλλο σε αυτό το μάθημα· η αριθμητική γύρω τους όχι. ↩ -
Karpathy, A.
karpathy/llm.c, discussion #481, Reproducing GPT-2 (124M) in llm.c in 90 minutes for $20 (28 May 2024), and discussion #677, Let's reproduce GPT-2 (1.6B): one 8XH100 node, 24 hours, $672, in llm.c (11 July 2024). ↩ -
Karpathy, A.
karpathy/nanochat, README και «time to GPT-2» leaderboard (accessed 2026-09-06). Το figure των $48 και ο CORE-score ορισμός του «GPT-2 capability» βρίσκονται και τα δύο στο README· το δικό τουspeedrun.shτου repository λέει «approximately 1.5 hours», οπότε αντιμετωπίστε το figure των δύο ωρών ως στρογγυλεμένο. ↩ -
Meta. Llama 3.1 model card,
models/llama3_1/MODEL_CARD.mdστοmeta-llama/llama-models(accessed 2026-09-06). Πηγή των 30,84 M H100-hours για το μοντέλο 405 B, των 39,3 M συνολικά, του location-based figure 11.390 tCO2eq, και του data cutoff Δεκεμβρίου 2023. ↩