Przejdź do treści
10/30Rozdział 10 z 30

Pretraining LLM-a: dane, obliczenia, prawa skalowania i koszt

Dwadzieścia modeli trenowanych na GPU laptopa, by zmierzyć prawo skalowania i sprawdzić estymację 6ND realnym licznikiem FLOP.

Na tej stronie

Rozdział 9 kończył się blokiem transformer, który się trenuje. Ułóż kilka takich bloków jeden na drugim, skieruj stratę next-token z Rozdziału 8 na wyjście i nie zostaje nic do wynalezienia. Wszystko, co pozostaje, jest zakupem.

To większa zmiana, niż brzmi. Każdy dotychczasowy rozdział pytał: czy to się uczy? — pytanie tak-nie, które laptop rozstrzyga w dziesięć minut. Ten rozdział zadaje pytanie, w którym są pieniądze: przy stałej ilości arytmetyki, jaki najlepszy model mogę kupić? Odpowiedzią jest wzór, a w 2018 roku nie była ona dla nikogo oczywista.

Oto odpowiedź na to pytanie uzyskana pomiarem, na jednym GPU laptopa. Dwadzieścia modeli, od 98 624 do 15 milionów parametrów, wytrenowano od zera na 174 milionach tokenów z Wikipedii — ze słownikiem BPE 2 048-token trenowanym tak, jak robi to Rozdział 7, i transformerem z Rozdziału 9. Każdy przebieg dostał dokładnie jeden z trzech budżetów obliczeniowych i ani jednej operacji więcej, więc większy model z konieczności czytał mniej tekstu. Najlepsza strata na zbiorze held-out osiągnięta w każdym budżecie:

TEXT
budget C (FLOPs)   best loss   reached by a model of
       1.00e13       5.3531           98,624 params
       3.16e13       4.8638           98,624 params
       1.00e14       4.3383          295,808 params

fitted:  L = (Cc / C)^0.0913     over one decade of compute

Dziesięć razy więcej arytmetyki obniża stratę o 19%, a trzy punkty leżą na prostej w skali log-log. Nic w pierwszych dziewięciu rozdziałach tego nie przewiduje. Nie stoi za tym żadne twierdzenie — to empiryczna regularność, z innym wykładnikiem utrzymująca się przez dziesięć rzędów wielkości między tym laptopem a centrum danych, i pojedyncza obserwacja, która przekonała branżę, by wydać PKB małego kraju na GPU.

Czym jest pretraining i co jest w nim nowego

Link do sekcji: Czym jest pretraining i co jest w nim nowego

Cel się nie zmienia. Model nadal przewiduje następny token, strata nadal jest cross-entropy z Rozdziału 4 zastosowaną do faktoryzacji z Rozdziału 8, optymalizator nadal jest AdamW z Rozdziału 6. Pretraining nie jest nowym algorytmem; to ten sam algorytm uruchomiony na korpusie tak dużym, że przebieg trzeba zabudżetować. Umożliwiają to dwie rzeczy: etykiety są darmowe, bo celem dla pozycji tt jest token w t+1t+1 i już znajduje się w tekście; a ostatnia sekcja Rozdziału 6 usunęła zastrzeżenie, ponieważ model z dużo większą liczbą parametrów, niż pozwalałyby klasyczne reguły, nie rozpada się, tylko się poprawia. Wynikiem jest model bazowy — coś, co kontynuuje tekst, zamiast odpowiadać.

Liczenie compute przed jego wydaniem: 6ND

Link do sekcji: Liczenie compute przed jego wydaniem: 6ND

Zanim cokolwiek z tego da się zabudżetować, trzeba to policzyć, a dziedzina liczy to jednym wzorem:

C6NDC \approx 6ND

gdzie NN to liczba parametrów, DD to tokeny treningowe, a CC to całkowita liczba operacji zmiennoprzecinkowych. Kaplan i in. wyprowadzają to w dwóch krokach.1 Forward: 2 FLOP-y na parametr na token, ponieważ każdy parametr w mnożeniu macierzy jest używany raz na token, w jednym mnożeniu i jednym dodawaniu. Backward: dwa razy forward, ponieważ przebieg wsteczny z Rozdziału 5 oblicza dwa gradienty w każdej warstwie — względem wejść warstwy, żeby sygnał mógł iść dalej, oraz względem jej wag — każdy jako mnożenie macierzy rozmiaru forward, więc 4N4N.

To całe wyprowadzenie i warto je sprawdzić, zamiast przyjmować na wiarę. PyTorch dostarcza prawdziwy licznik FLOP, torch.utils.flop_counter.FlopCounterMode, który przechwytuje każdą operację wysyłaną przez model i sumuje faktyczną pracę. Uruchom go przez cztery rzędy wielkości, największy na urządzeniu meta, które przydziela kształty, ale nie pamięć:

flops.pyPYTHON
from torch.utils.flop_counter import FlopCounterMode

counter = FlopCounterMode(display=False)
with counter:                       
    loss = model(x, targets)[1]     
    loss.backward()                 
measured = counter.get_total_flops()
print(measured / (6 * n_params * n_tokens))
konfiguracjaNN bez embeddingsNN łączniezmierzone, fwd+bwd÷ 6ND6ND (łącznie NN)÷ 6ND6ND (bez emb.)fwd+bwd ÷ fwd
dd 128, 4 warstwy, TT 256788,7367,254,4004.60e101.0319.4853.000
dd 512, 8 warstw, TT 25625,183,23251,045,8883.26e111.0382.1043.000
dd 768, 12 warstw, TT 102484,973,056124,356,8641.75e121.1451.6763.000
dd 1600, 48 warstw, TT 10241,474,870,4001,556,920,0002.10e131.1001.1613.000
dd 4096, 32 warstwy, TT 20486,442,983,4246,582,444,0328.74e131.0801.1043.000
dd 8192, 80 warstw, TT 819264,427,147,26465,544,929,2803.75e151.1631.1833.000

Stosunek forward+backward do forward wynosi 3.000, dokładnie, w każdej skali: to nie przybliżenie, które akurat jest dobre, lecz powyższa tożsamość arytmetyczna zwrócona jako okrągła liczba przez licznik, który nic nie wie o wyprowadzeniu.

Zmierzone sumy leżą potem od 3% do 17% powyżej 6ND6ND, gdy NN liczy macierze embedding — i ta klauzula ma znaczenie, bo dwa założycielskie artykuły liczą NN inaczej. Kaplan wyklucza „all vocabulary and positional embeddings”, ponieważ to „produces significantly cleaner scaling laws” (§1.3); Appendix F Chinchilli mówi „we also count embeddings matrices in the total parameter count”.2 Przy szerokim słowniku i wąskim wymiarze ukrytym różnica wynosi czynnik dziewięć, jak pokazuje pierwszy wiersz.

Pozostała luka jest tym, co 6ND6ND celowo pomija: wyniki attention. Równanie (2.2) Kaplana zapisuje koszt forward jako 2N+2nlayernctxdmodel2N + 2\,n_{\text{layer}} n_{\text{ctx}} d_{\text{model}} i odrzuca drugi składnik, ponieważ dmodelnctx/12d_{\text{model}} \gg n_{\text{ctx}}/12 — bezpieczne w 2020 roku, mniej bezpieczne dziś, i powód, dla którego stosunek dryfuje w górę, gdy rośnie T/dT/d — dlatego dwa wiersze tutaj mają wspólne TT równe 1 024, a stosunek spada, z 1.145 do 1.100, gdy dd rośnie z 768 do 1 600. To koszt O(T2)O(T^2), który wprowadził Rozdział 9, a Rozdział 16 zamienia w cenę.

Pamięć: co naprawdę musi się zmieścić

Link do sekcji: Pamięć: co naprawdę musi się zmieścić

Compute decyduje, jak długo trwa przebieg; pamięć decyduje, czy może się zacząć. Trenuj zwykłym fp32 AdamW, a każdy parametr niesie cztery liczby: wagę, jej gradient oraz bieżącą średnią mm i wariancję vv Adama — dwie średnie zbudowane ręcznie w Rozdziale 6. Cztery liczby po cztery bajty każda to 16 bajtów na parametr, zanim pojawi się choć jedna activation. Pomiar na GPU laptopa 8 GB, z użyciem rezydentnej alokacji w punkcie kroku, w którym żaden graf nie jest żywy:

modelsłownictwobatchNN16N16N przewidywanerezydentne zmierzoneszczyt w krokuróżnica
dd 512, 8 warstw50,257851,045,888779 MB801 MB2,500 MB1,699 MB
dd 512, 8 warstw4,096827,411,456418 MB426 MB1,043 MB617 MB
dd 256, 6 warstw4,09685,839,36089 MB89 MB382 MB293 MB
dd 256, 6 warstw4,096325,839,36089 MB89 MB1,259 MB1,170 MB
dd 256, 6 warstw4,0961285,839,36089 MB89 MB4,771 MB4,681 MB

Przewidywanie i pomiar zgadzają się w granicach 3%. Zaskoczeniem jest ostatnia kolumna: activations przytłaczają model. Ten sam model 5,8 miliona parametrów, który potrzebuje 89 MB stanu trwałego, potrzebuje 4 681 MB activations przy batch 128 — pięćdziesiąt dwa razy więcej niż model — i duża część tego wcale nie jest transformerem. To logits, jeden wektor rozmiaru słownictwa na token, po cztery bajty na wpis: 512 MB w ostatnim wierszu, 393 MB w pierwszym. Rozmiar słownictwa został wybrany w Rozdziale 7 i nadal decyduje, co mieści się na karcie.

To, który składnik dominuje, zależy od kształtu przebiegu, dlatego Micikevicius i in. mówią, że pamięć „is dominated by activations”3, podczas gdy ZeRO mówi, że model 1,5 miliarda parametrów potrzebuje „at least 24 GB” samych stanów modelu.4 ZeRO dochodzi do tych samych 16 bajtów inną drogą — 2Ψ2\Psi dla wag fp16, 2Ψ2\Psi dla gradientów fp16, po 4Ψ4\Psi dla głównych wag fp32 i dwóch momentów Adama — co dla 70 miliardów parametrów daje 1,12 terabajta, równowartość czternastu GPU 80 GB, zanim pojawi się choć jedna activation.

Parallelism, w jednym akapicie i jednej delegacji

Link do sekcji: Parallelism, w jednym akapicie i jednej delegacji

Nic z tego nie mieści się na jednym urządzeniu w skali frontier, więc przebieg dzieli się naraz na cztery sposoby. Data parallelism umieszcza kopię modelu na każdym GPU i uśrednia gradienty — to domyślne podejście, które ZeRO ulepsza, odmawiając trzymania redundantnych kopii stanu optymalizatora. Tensor parallelism dzieli pojedyncze macierze między urządzenia. Pipeline parallelism daje każdemu urządzeniu ciągłą grupę warstw. Context parallelism dzieli samą sekwencję, potrzebne dopiero wtedy, gdy TT jest dość długie, by składnik attention dominował. Tabela 4 Llama 3 wymienia wszystkie cztery naraz: tensor 8, context do 16, pipeline 16, data do 128, na 16 384 GPU H100.5 To wszystko, co ten kurs o tym powie; inżynieria treningu rozproszonego to osobny semestr, a Stanford CS336 jest tym semestrem, wykłady 5 do 8, z kodem.6 Po delegacji zostaje jedna liczba, model FLOPs utilisation — ułamek szczytowej arytmetyki GPU, jaki osiąga rzeczywisty przebieg — która zamienia schludne 6ND6ND w czas zegarowy, a więc w pieniądze.

Kaplan i zakład, który postawiła branża

Link do sekcji: Kaplan i zakład, który postawiła branża

W styczniu 2020 roku Kaplan i in. wytrenowali siatkę transformerów i odkryli, że strata testowa podąża za prawem potęgowym względem każdego z trzech zasobów przez ponad sześć rzędów wielkości.1 Ich §1.2 podaje trzy dopasowane prawa:

L(N)=(NcN)αN,αN0.076,Nc8.8×1013L(N) = \left(\frac{N_c}{N}\right)^{\alpha_N}, \qquad \alpha_N \approx 0.076, \qquad N_c \approx 8.8 \times 10^{13}

z towarzyszącymi αD0.095\alpha_D \approx 0.095 dla danych i αCmin0.050\alpha_C^{\min} \approx 0.050 dla optymalnie przydzielonego compute. Stałe nie są uniwersalne i artykuł mówi to wprost: „the precise numerical values of NcN_c, CcminC_c^{\min} and DcD_c depend on the vocabulary size and tokenization and hence do not have a fundamental meaning.”

Wykładniki są maleńkie: dziesięć razy więcej parametrów kupuje czynnik 100.0761.1910^{0.076} \approx 1.19 z pozostałej straty. Brzmi jak nic, i to jest tutaj najważniejszy fakt — zwroty są fatalne i nigdy się nie kończą. Prawo potęgowe z małym wykładnikiem obiecuje, że następny rząd wielkości pomoże, mniej niż poprzedni, zawsze. Kupowanie compute przestaje być hazardem i staje się zakupem z opublikowanym kursem wymiany, co jest dokładnie argumentem, który odblokował kapitał.

Potem przyszła recepta i tu artykuł mylił się w sposób, który kosztował branżę bardzo dużo pieniędzy. Tabela 6 Kaplana podaje NoptC0.73N_{\text{opt}} \propto C^{0.73} i DoptC0.27D_{\text{opt}} \propto C^{0.27}: dziesięć razy więcej compute oznacza model 5,4 raza większy, karmiony tylko 1,9 raza większą ilością tekstu. Abstrakt mówi wprost — „optimally compute-efficient training involves training very large models on a relatively modest amount of data and stopping significantly before convergence.” Dziedzina zrobiła dokładnie to: GPT-3 to 175 miliardów parametrów na 300 miliardach tokenów,7 Gopher 280 miliardów na 300 miliardach, Megatron-Turing NLG 530 miliardów na 270 miliardach.2 Od połowy tokena do dwóch tokenów na parametr, wszędzie.

Chinchilla i co mierzył sweep powyżej

Link do sekcji: Chinchilla i co mierzył sweep powyżej

W marcu 2022 roku Hoffmann i in. wytrenowali ponad 400 modeli od 70 milionów do 16 miliardów parametrów i doszli do przeciwnego wniosku trzema niezależnymi drogami.2 Ich Tabela 2 raportuje wykładnik aa w NoptCaN_{\text{opt}} \propto C^{a} jako 0.50, 0.49 i 0.46, wobec 0.73 Kaplana. Mówiąc prosto: rozmiar modelu i dane treningowe powinny rosnąć w tej samej proporcji.

Ich drugie podejście jest tym, co reprodukuje sweep z początku tego rozdziału, w milionowej części skali: ustal budżet, trenuj wiele rozmiarów dokładnie w tym budżecie, narysuj końcową stratę względem rozmiaru modelu.

parametryC=1013C = 10^{13}C=3.16×1013C = 3.16 \times 10^{13}C=1014C = 10^{14}
98,6245.3531 (171)4.8638 (542)
150,3205.4636 (74)
194,2085.5041 (44)4.8730 (140)4.4040 (442)
295,8085.5550 (19)4.9029 (60)4.3383 (190)
665,2805.7849 (3.8)5.1254 (12)4.4192 (38)
1,280,7685.8174 (1.0)5.1751 (3.2)4.5003 (10)
3,101,5685.4686 (0.5)4.7768 (1.7)
5,315,0725.5894 (0.2)4.8514 (0.6)
15,053,5685.3534 (0.1)

Strata held-out w natach na token, tokeny na parametr w nawiasach, pogrubienie dla najlepszego modelu w każdym budżecie; kreska to punkt nieuruchomiony, ponieważ budżet wymagał więcej tekstu, niż mieści korpus, albo rozmiar wypadał poza badany tam zakres.

Czytaj w dół kolumny: strata spada, osiąga minimum i znowu rośnie. Model może być zbyt duży na swój budżet równie łatwo, jak zbyt mały — przy 101410^{14} kara za wybór 665 280 parametrów zamiast 295 808 wynosi 0,08 nata, co na obwiedni dopasowanej powyżej jest stratą, jaką poprawnie dobrany model osiąga przy 18% mniejszym compute. Wybranie złego kształtu wyrzuca jedną piątą budżetu. To Rysunek 3 Chinchilli w jedno popołudnie na jednym GPU, zamiast z czterystoma modelami.

Teraz czytaj w poprzek. Przy 101310^{13} najlepszy model jest najmniejszym z badanych; przy 101410^{14} ma 295 808 parametrów, ograniczony z obu stron. Optimum przesuwa się w prawo wraz ze wzrostem budżetu, i to jest cała treść korekty. Dopasuj trzecie podejście z artykułu — powierzchnię L(N,D)=E+A/Nα+B/DβL(N,D) = E + A/N^{\alpha} + B/D^{\beta} po wszystkich przebiegach — i zminimalizuj przy warunku C=6NDC = 6ND:

TEXT
L(N, D) = 24.7 / N^0.195 + 46.8 / D^0.169       (E fits to ~0; see below)
implied   N_opt ∝ C^0.464
  compare   Chinchilla 0.46-0.50 · Besiroglu 0.513 · Kaplan 0.73

0.46, z laptopa, wobec 0.73 Kaplana. Zgodność do trzech cyfr z dopasowania trzech budżetów to szczęście; zgodność do pierwszej nie. Wykładnik podróżuje — stała nie, bo stosunek tokenów do parametrów w tych optimach wynosi 170 do 540, nie 20. Trzy powody, wszystkie pouczające. EE dopasowuje się do zera, bo przy stracie powyżej 4 natów przebieg nie jest nawet blisko podłogi entropii, która dominuje dopasowanie Chinchilli. Batch size i learning rate były stałe, zamiast strojone dla każdego punktu, co krzywdzi te przebiegi, które dostają najmniej kroków — a są to duże modele: przy 101310^{13} FLOP-ach model 1,28 miliona parametrów dostaje łącznie 159 kroków optymalizatora, daleko poniżej kilku tysięcy, które składnik SminS_{\min} Kaplana mówi, że potrzebuje każdy model. Prawo skalowania jest dopasowywane wewnątrz reżimu, a to siedzi sześć rzędów wielkości poniżej Chinchilli.

Stąd abstrakt artykułu: „current large language models are significantly undertrained”. Chinchilla jest demonstracją — 70 miliardów parametrów na 1,4 biliona tokenów, ten sam łączny compute co Gopher 280 miliardów na 300 miliardach, i wygrywa z nim w 51 z 57 zadań MMLU, 67,5% wobec 60%.2 Cztery razy mniejszy, cztery i pół raza więcej tekstu, te same pieniądze, lepszy model.

Dwa zastrzeżenia do tego słynnego stosunku. „Dwadzieścia tokenów na parametr” nie jest zdaniem z artykułu, który mówi tylko, że „for every doubling of model size the number of training tokens should also be doubled”; 20 to wniosek z Tabeli 3 i z własnych 70 B na 1,4 T Chinchilli. A jego precyzja jest gorsza niż opublikowana: Besiroglu i in. ponownie dopasowali dane z digitalizacji Rysunku 4, odkryli, że oryginalne parametry „fit the reconstructed data poorly” z przedziałami „implausibly tight given the number of data points”, i uczciwy zakres umieścili na „between 4 and 40” tokenów na parametr.8

Jeden szczegół metody Chinchilli spłaca obietnicę, którą Rozdział 1 złożył w sprawie harmonogramów learning rate. Harmonogram cosinusowy musi być dopasowany do budżetu tokenów. Model, który zobaczy 10 milionów tokenów, musi wygasić learning rate do zera przy 10 milionach tokenów; daj mu harmonogram przygotowany na 100 milionów, zatrzymaj go wcześnie, a będziesz odczytywać stratę w połowie zejścia, przy zdecydowanie zbyt wysokiej wartości. Chinchilla trenuje każdy model przy czterech długościach cyklu, by dokładnie to kontrolować; sweep powyżej z tego samego powodu ustawia harmonogram z budżetu.

Czego prawa skalowania nie obiecują

Link do sekcji: Czego prawa skalowania nie obiecują

Są najbardziej użytecznym wynikiem empirycznym w tej dziedzinie i rutynowo sprzedaje się je za drogo. Cztery ograniczenia.

Przewidują stratę, nie capability. Lewą stroną jest cross-entropy na tekście held-out. Nic w tych artykułach nie upoważnia do twierdzenia, czy model napisze poprawny SQL, odmówi szkodliwego żądania albo użyje narzędzia. To znowu lekcja z Rozdziału 5: predykcja straty nie jest predykcją zachowania, za które płacisz.

Są dopasowane, nie wyprowadzone. Żadna teoria nie produkuje αN=0.076\alpha_N = 0.076. Stałe zmieniają się wraz z tokenizatorem — dlatego porównanie perplexity między dwoma tokenizerami jest bez sensu, jak wyjaśniał Rozdział 8 — oraz z mieszanką danych, architekturą i optymalizatorem. Każde opublikowane prawo jest prawem setupu, który je wytworzył, dlatego Meta dopasowała własne przed Llama 3.5

Zakładają świeży token w każdym kroku, co po cichu zakłada nieskończony korpus. Muennighoff i in. zmierzyli, co się dzieje, gdy go zabraknie: do czterech epok powtarzanych danych kosztuje prawie nic — model 8,7 miliarda parametrów na 44 miliardach unikalnych tokenów widzianych cztery razy skończył z „only 0.5 % higher validation loss” niż ten sam model na 178 miliardach unikalnych — podczas gdy po około szesnastu epokach dodatkowy compute nie kupuje nic.9

I nikt już nie trenuje compute-optimal. Chinchilla minimalizuje koszt treningu; wdrożony model płaci potem około 2N2N FLOP-ów na wygenerowany token, w nieskończoność. LLaMA 1 powiedziała to wprost: „given a target level of performance, the preferred model is not the fastest to train but the fastest at inference”.10 Sardana i in. sformalizowali to, minimalizując zamiast tego 6NDtrain+2NDinference6ND_{\text{train}} + 2ND_{\text{inference}}, i odkryli, że każdy, kto oczekuje miliarda zapytań, powinien trenować „smaller and longer than Chinchilla-optimal”.11 §9.1 Llama 3 się zgadza: jej małe modele trenują „far beyond the point of compute optimal training, effectively trading training compute for inference efficiency”.5 Stosunek nie jest przestarzały; odpowiada na pytanie, które nie jest już tym zadawanym.

Emergent abilities i spór o to, czy są realne

Link do sekcji: Emergent abilities i spór o to, czy są realne

Strata spada gładko. Wyniki benchmarków czasem nie. Wei i in. zebrali przypadki, w których zadanie pozostaje na poziomie losowym przez rzędy wielkości treningowego compute, a potem skacze — arytmetyka trzycyfrowa pojawiająca się w GPT-3 przy około 2×10222 \times 10^{22} FLOP-ach, MMLU rosnące powyżej zgadywania między 33 a 5×10235 \times 10^{23} — i nazwali wzorzec: „an ability is emergent if it is not present in smaller models but is present in larger models”.12 Jeśli to realna własność, ekstrapolacja z tanich eksperymentów jest niebezpieczna, bo capability, którą kupujesz, może nie istnieć w żadnej skali, którą stać cię przetestować.

Schaeffer, Miranda i Koyejo argumentowali, że większość tego to artefakt pomiaru, a mechanizm jest arytmetyczny.13 Strata per-token spada gładko, więc prawdopodobieństwo, że jeden token będzie poprawny, exp(L)\exp(-\mathcal{L}), poprawia się stopniowo. Oceń model przez exact string match dla odpowiedzi o LL tokenach, a podnosisz to prawdopodobieństwo do potęgi LL — gładka krzywa podniesiona do dużej potęgi wygląda jak urwisko. Zamień metrykę na taką, która liczy tokeny, zamiast wymagać wszystkich naraz, na tych samych wyjściach, a „the family's performance smoothly, continuously and predictably improves with increasing scale”.

Ich audyt jest liczbą do zapamiętania — „of the 39 preferred metrics in BIG-Bench, at most 5 display emergence”, z dwiema nieciągłymi metrykami odpowiadającymi za ponad 92% zgłaszanych przypadków — podobnie jak ich ostrożność: „nothing in this paper should be interpreted as claiming that large language models cannot display emergent abilities”. Skok na wykresie jest dowodem dotyczącym metryki, dopóki nie pokazano inaczej. Rozdział 29 to miejsce, w którym staje się to twoim problemem, bo wybór metryki z twardym progiem jest decyzją, którą podejmiesz, nie zauważając tego.

Korpus jest częścią przebiegu pretraining, do której nie jest przypisane żadne równanie, i miejscem, gdzie żyje większość decyzji o konsekwencjach. Surowcem jest web crawl: archiwum Common Crawl z sierpnia 2026 zawiera „2.14 billion web pages or 360 TiB of uncompressed content”, jeden miesiąc, za darmo do pobrania.14 Prawie nic z tego nie nadaje się do użycia w takim stanie. Artykuł T5 mówi, że crawl „largely comprises gibberish or boiler-plate text like menus, error messages, or duplicate text”, a pipeline C4, który wprowadził, jest listą tępych heurystyk — zachowuj tylko linie kończące się interpunkcją końcową, odrzucaj strony z mniej niż trzema zdaniami, odrzucaj każdą stronę zawierającą nawias klamrowy albo słowo z publicznej listy obsceniczności — zamieniając dwadzieścia terabajtów miesięcznego tekstu w około 750 GB.15

„Tępe” to właściwe słowo. Dodge i in. przeaudytowali, co te filtry usuwają, i odkryli, że bloklista obsceniczności kasuje 42% dokumentów w African-American English i 32% w Hispanic-aligned English, wobec 6,2% w White-aligned English, zostawiając korpus w 97,8% z ostatniej kategorii.16 Reguła bez opinii o dialekcie miała opinię.

Potem deduplikacja, która nie jest sprzątaniem: Lee i in. znaleźli 61-wyrazowe zdanie powtórzone 61 036 razy w C4 i pokazali, że deduplikacja dziesięciokrotnie obcina tempo, w jakim modele „emit memorized text”, z 1,9% wygenerowanych tokenów do 0,19%.17 Więcej nie znaczy jednak lepiej — zespół FineWeb zdeduplikował globalnie przez 96 crawli, dostał 4 biliony tokenów i brak mierzalnej poprawy, potem zdeduplikował każdy crawl osobno, dostał 20 bilionów i dorównał najlepszemu istniejącemu korpusowi.18

Potem kontaminacja. Llama 3 zmierzyła własną i ją opublikowała: 98% AGIEval, 95% BIG-Bench Hard i 85% HellaSwag pokrywało się ze zbiorem treningowym po 8-gramach, a dla MMLU overlap był tak wysoki, że „it is impossible to get a good performance gain estimate”.5 §4 GPT-3 raportuje błąd filtrowania, który zostawił benchmarki w danych bez drogi powrotu: „because of cost considerations it was infeasible to retrain the model”.7

Proweniencja jest nierozwiązaną częścią. The Pile zawierał komponent 100,96 GiB o nazwie Books3 — 12% korpusu i, według własnej tabeli zgód artykułu, książki z prywatnego trackera torrentów;19 został zdjęty z sieci w sierpniu 2023 po skardze dotyczącej praw autorskich. Stan prawny na wrzesień 2026 pozostaje nierozstrzygnięty, a trzy amerykańskie orzeczenia cytowane jako trend nie zgadzają się ze sobą. Alsup uznał trening na legalnie pozyskanych książkach za „exceedingly transformative”, jednocześnie stwierdzając, że biblioteka zbudowana z pirackich kopii taka nie była, a Anthropic ugodził tę połowę za $1,5 miliarda, obejmując 482 460 utworów, około $3 000 za każdy, zatwierdzone 20 lipca 2026.20 Chhabria przyznał Meta summary judgment, pisząc jednocześnie, że jego orzeczenie „does not stand for the proposition that Meta's use of copyrighted materials to train its language models is lawful”, tylko że „these plaintiffs made the wrong arguments”.21 Bibas, orzekając przeciw Ross Intelligence, zauważył, że „only non-generative AI is before me today”.22 Żaden amerykański sąd apelacyjny nie orzekł w tej sprawie.

Ludzie robią części, których strata nie potrafi. TIME raportował w styczniu 2023, że pracownicy oznaczający toksyczny tekst dla OpenAI przez firmę Sama dostawali do ręki „between around $1.32 and $2 per hour” za czytanie fragmentów opisujących seksualne wykorzystywanie dzieci, tortury i samookaleczenia, podczas gdy OpenAI płaciło Sama $12,50 za godzinę tej pracy; Sama kwestionuje zarówno zakres płac, jak i normę.23 To filtrowanie wokół pretraining, a nie sam pretraining — ale jest na tej samej fakturze i tam siedzi człowiek.

Elektryczność jest realna i zwykle źle cytowana. Najstaranniejsza opublikowana liczba to BLOOM: 1 082 990 GPU-godzin, 433 MWh i 24,7 tony ekwiwalentu CO₂ za przebieg, 50,5 po doliczeniu produkcji i bezczynnych węzłów;24 Patterson i in. podają GPT-3 jako 1 287 MWh i 552 tony.25 Dwa zastrzeżenia. Przewaga BLOOM wynika z francuskiej sieci jądrowej na poziomie 57 g CO₂ na kWh, nie z efektywności — zużył więcej energii niż OPT-175B. A najczęściej cytowana liczba emisji w tej dziedzinie, 626 155 lb Strubell i in. dla neural architecture search, okazała się później 88 razy za wysoka, bo zakładała, że search działał w pełnym rozmiarze modelu, gdy działał na proxy.26 Ujęcie LBNL jest tym defensywnym: amerykańskie centra danych zużyły 192 TWh w 2024 roku, 4,7% krajowej elektryczności — liczba przypisana do branży, nie do żadnego pojedynczego przebiegu.27

Myśl przewodnia jest tym, co Bender i in. nazwali długiem dokumentacyjnym: „putting ourselves in a situation where the datasets are both undocumented and too large to document post hoc”. Każdy powyższy fakt istnieje, bo ktoś spojrzał. Dla korpusów stojących za modelami, których używa większość ludzi, nikt nie może.

Teraz arytmetyka, której wszyscy chcą, z czterech cytowanych wejść, żeby gdy się zestarzeją, było oczywiste, co wymienić.

Strona NVIDIA H100 podaje 1 979 teraFLOPS przepustowości tensor-core BF16 pod przypisem „with sparsity”.28 Żaden przebieg pretraining nie używa structured sparsity, więc wartość dense to połowa: 989,5 TFLOP/s.

Tabela 4 Llama 3 raportuje 38–43% BF16 model FLOPs utilisation. Przyjmij 40%: 395,8 TFLOP/s użytecznej arytmetyki na GPU.5

Cena on-demand Lambda za węzeł 8×H100 SXM, odczytana 2026-09-06: $3.99 za GPU-godzinę, czyli $31.92 za godzinę węzła.29

Stosunek Chinchilli, D=20ND = 20N, daje C=6ND=120N2C = 6ND = 120N^2, a więc N=C/120N = \sqrt{C/120}.

budżetH100-godzinyFLOPscompute-optimal parametrytokenyna jednym węźle 8×H100GPU do ukończenia w 90 dni
$100253.6e19546 M10.9 B3.1 h1
$1,0002513.6e201.73 B34.5 B31.3 h1
$10,0002,5063.6e215.46 B109 B13 dni2
$100,00025,0633.6e2217.3 B345 B131 dni12
$1,000,000250,6273.6e2354.6 B1.09 T4 lata116
$10,000,0002,506,2663.6e24173 B3.45 T36 lat1,160
$100,000,00025,062,6573.6e25546 B10.9 T358 lat11,603

Czytaj dwie ostatnie kolumny razem. Za $10 000 dostajesz model 5 miliardów parametrów na jednym wynajętym węźle w dwa tygodnie. Przy $100 000 000 arytmetyka mówi 546 miliardów parametrów — i dwanaście tysięcy H100 połączonych razem na trzy miesiące, czego nie wynajmuje się kartą kredytową. Powyżej około $100 000 ograniczeniem przestają być pieniądze, a staje się nim klaster.

Zanim zaufasz takiej tabeli, przetestuj ją na przebiegach, których realny koszt jest opublikowany — llm.c reprodukuje GPT-2 124M w „~90 minutes” na węźle 8×A100 „for about $20”, oraz GPT-2 1.6B w 24 godziny na węźle 8×H100 za $672.30

TEXT
$672, against what $672 actually bought (llm.c GPT-2 1.6B, one 8xH100 node, 24 h)
  this table predicts:      168 H100-hours   N = 1.41 B params   D = 28.3 B tokens
  what was actually run:    192 H100-hours   N = 1.558 B params  D = 33.6 B tokens

Llama 3 405B, against Meta's own published GPU-hours
  from the paper's 3.8e25 FLOPs at 40 % MFU:   26.67 M H100-hours
  published in Meta's Llama 3.1 model card:    30.84 M H100-hours    ratio 0.86

Oba mieszczą się w około 15%, co jest mniej więcej dokładnością, na jaką zasługuje tego rodzaju estymacja, i znacznie lepszą niż dokładność, z jaką zwykle się ją cytuje.

Porównanie nagłówkowe, z obiema definicjami na stole

Link do sekcji: Porównanie nagłówkowe, z obiema definicjami na stole

Najczęściej powtarzana liczba w tym temacie mówi, że model klasy GPT-2 kosztujący około $43 000 w 2019 roku można dziś odtworzyć za kilkadziesiąt dolarów. Współczesna połowa jest dobrze udokumentowana; historyczna nie.

Dziś. README Karpathy'ego nanochat: „you can train your own GPT-2 capability LLM ... for only $48 (~2 hours of 8XH100 GPU node) ... On a spot instance, the total cost can be closer to ~$15.”31 „GPT-2 capability” ma tu precyzyjne, opublikowane znaczenie — pobicie wyniku CORE GPT-2 na poziomie 0.256525 — na leaderboardzie, którego najlepszy wpis na 14 marca 2026 wynosi 1,65 godziny. $48 zakłada $3 za GPU-godzinę, poniżej cennikowego $3.99 Lambda; według cennika to bliżej $64.

W 2019. Nie ma źródła pierwotnego: OpenAI nigdy nie opublikowało czasu trwania ani kosztu. Łańcuch wygląda tak: The Register, luty 2019, raportuje „256 Google TPU3 cores” bez ceny i bez czasu trwania; potem Synced, czerwiec 2019, zauważa, że sprzęt kosztował $256 za godzinę w Google Cloud, i wyraźnie stwierdza, że „OpenAI didn't specify the training duration”. $43 008 to $256 za godzinę razy założone 168 godzin, których nikt nigdy nie uźródłowił.

Uczciwy nagłówek brzmi więc: model dorównujący opublikowanemu wynikowi benchmarkowemu GPT-2 można dziś wytrenować za znacznie poniżej $100 na wynajętym sprzęcie, wobec kosztu z 2019 roku, który nigdy nie został opublikowany i którego słynna estymacja opiera się na nieuźródłowionym zgadywaniu czasu trwania. Załamanie kosztów jest realne, a współczesną połowę może odtworzyć każdy z kartą kredytową; stosunek to arytmetyka na liczbie, która nie istnieje. Taki jest ogólny stan opublikowanych kosztów treningu. Artykuł GPT-3 nie zawiera żadnej kwoty w dolarach, tylko 3.14×10233.14 \times 10^{23} FLOP-ów w Tabeli D.1;7 artykuł Llama 3 również żadnej nie zawiera.5 Każdy koszt treningu, jaki czytałeś, jest estymacją z liczby FLOP, założenia sprzętowego i założenia cenowego — zawsze warto pytać, czyich.

Co wie model bazowy i kiedy przestał to wiedzieć

Link do sekcji: Co wie model bazowy i kiedy przestał to wiedzieć

To, co wychodzi, widziało stały korpus złożony w stałym momencie, i wynikają z tego dwie własności.

Pierwsza to knowledge cutoff. Po dacie zbioru model nie wie nic — nie „jest niepewny”, tylko nic — i będzie płynnie konfabulował, zamiast tak powiedzieć, ponieważ mówienie tego nigdy nie było zachowaniem, na którym go trenowano. Model card Llama 3.1 podaje grudzień 2023;32 każdy model ma taką datę i jest to własność danych treningowych, nie wdrożenia. Obejście tego jest problemem retrieval, którym zajmuje się Rozdział 19.

Druga jest taka, że model bazowy uzupełnia, a nie odpowiada. Daj mu „Jaka jest stolica Francji?”, a wiarygodną kontynuacją będzie kolejne pytanie, bo w korpusie taki ciąg najczęściej pojawia się na liście ćwiczeń.

Uzupełniacz tekstu nie jest asystentem. Nie wykonuje instrukcji, bo nic w korpusie nie powiedziało mu, że prośbę należy spełnić, zamiast kontynuować. Nie ma pojęcia o rozmowie z dwiema stronami. Chętnie wygeneruje najbardziej prawdopodobną kontynuację szkodliwego prompt, bo prawdopodobieństwo było jedyną rzeczą, pod którą kiedykolwiek go optymalizowano.

Zamiana go w coś, co odpowiada, wymaga drugiego etapu kosztującego ułamek procenta pierwszego i składającego się niemal w całości z pokazywania mu przykładów zachowania, którego chcesz, a potem porównywania par jego własnych wyjść. To etap, z którego biorą się instruction following, chat templates, odmowy i — co zaskakuje ludzi — zdolność do wywołania narzędzia. Rozdział 11 jest tym etapem: supervised fine-tuning, RLHF, DPO i GRPO, oraz pytanie, co znaczy „aligned” i kto o tym decyduje.


Warto czytać obok tego rozdziału także build-nanogpt Karpathy'ego i towarzyszące mu wideo, które przeprowadzają pełną reprodukcję GPT-2 od końca do końca w tempie, na które ten rozdział nie może sobie pozwolić; oraz Stanford CS324, Large Language Models, którego wykłady o danych i wpływie środowiskowym wchodzą głębiej w materiał, który ten kurs omawia raz i deleguje.

  1. Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J. and Amodei, D. Scaling Laws for Neural Language Models. arXiv:2001.08361 (2020). Trzy prawa potęgowe to równania (1.1)–(1.3) w §1.2, a pełne stałe są w Appendix A, Table 5; wyprowadzenie 6N6N to §2.1; wykładniki alokacji compute są w Table 6. Zwróć uwagę, że są dwa prawa compute, αC=0.057\alpha_C = 0.057 przy stałym batch size i αCmin=0.050\alpha_C^{\min} = 0.050 przy optymalnym batch size; artykuł mówi, że to drugie „should be used to make predictions”. 2

  2. Hoffmann, J., Borgeaud, S., Mensch, A., Buchatskaya, E., Cai, T., Rutherford, E. et al. Training Compute-Optimal Large Language Models. arXiv:2203.15556 (2022). Wykładniki w Table 2, prognozowane budżety w Table 3, porównanie z Gopherem w §4, konwencja liczenia parametrów w Appendix F. Proza pod Table 3 nie zgadza się z samą Table 3 dla wierszy 175 B i 280 B; cytować należy tabelę. 2 3 4

  3. Micikevicius, P., Narang, S., Alben, J., Diamos, G., Elsen, E., Garcia, D. et al. Mixed Precision Training. arXiv:1710.03740 (2017), ICLR 2018. Główne wagi FP32 w §3.1, loss scaling w §3.2. 2

  4. Rajbhandari, S., Rajbhandari, S., Ruwase, O. and He, Y. ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054 (2019), SC20. Rachunek 16Ψ16\Psi jest w §3.1; liczby stanów rezydualnych dla activations są w §3.2.

  5. Grattafiori, A. et al. (Llama Team, AI @ Meta). The Llama 3 Herd of Models. arXiv:2407.21783 (2024). Budżet compute i liczba tokenów w §1, ponownie dopasowane prawo skalowania w §3.2.1, konfiguracja parallelism i MFU w Table 4, analiza kontaminacji w §5.1.4, stwierdzenie o over-training w §9.1. Artykuł nie zawiera kwot w dolarach ani tabeli emisji. 2 3 4 5 6

  6. Stanford CS336, Language Modeling from Scratch. Lecture 2 obejmuje rachunek zasobów, lectures 5–8 GPU, kernele i parallelism, lectures 9 i 11 scaling, lectures 13–14 dane. To kurs, któremu ten rozdział deleguje swoją inżynierię, i jest publiczny.

  7. Brown, T. B. et al. Language Models are Few-Shot Learners. arXiv:2005.14165 (2020). Compute w Appendix D, Table D.1 — która ma kolumnę dosłownie zatytułowaną „flops per param per token”, a jej wartość dla każdego wiersza GPT-3 wynosi 6. Analiza kontaminacji w §4. 2 3

  8. Besiroglu, T., Erdil, E., Barnett, M. and You, J. Chinchilla Scaling: A replication attempt. arXiv:2404.10102 (2024). Rekonstruuje dane Chinchilli przez digitalizację jej Figure 4, ponownie dopasowuje i raportuje skorygowane wykładniki oraz znacznie szersze przedziały.

  9. Muennighoff, N., Rush, A. M., Barak, B., Le Scao, T., Piktus, A., Tazi, N., Pyysalo, S., Wolf, T. and Raffel, C. Scaling Data-Constrained Language Models. arXiv:2305.16264 (2023), NeurIPS 2023. Wynik czterech epok jest w §6; półokres szesnastu epok to dopasowane RD15R_D^* \approx 15.

  10. Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T. et al. LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 (2023). §1 podaje argument kosztu inference przeciw treningowi Chinchilla-optimal.

  11. Sardana, N., Portes, J., Doubov, S. and Frankle, J. Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws. arXiv:2401.00448 (2023), ICML 2024. Ich §5 zawiera też przeciwwagę: modele trenowane przy ekstremalnych stosunkach tokenów nadal się poprawiają, ale „more slowly than scaling laws predict”.

  12. Wei, J., Tay, Y., Bommasani, R., Raffel, C., Zoph, B., Borgeaud, S. et al. Emergent Abilities of Large Language Models. arXiv:2206.07682 (2022), TMLR. Definicja w §2, przykłady i progi compute w §3–4 oraz Table 1.

  13. Schaeffer, R., Miranda, B. and Koyejo, S. Are Emergent Abilities of Large Language Models a Mirage? arXiv:2304.15004 (2023), NeurIPS 2023 outstanding paper. Argument metryczny to §2, metaanaliza BIG-Bench §4, skonstruowany przykład wizyjny §5.

  14. Common Crawl, August 2026 Crawl Archive Now Available (CC-MAIN-2026-34), opublikowane 24 sierpnia 2026, dostęp 2026-09-06. Jego własna strona główna twierdzi „over 300 billion pages spanning 15 years”, „totalling more than 10 petabytes” — liczba dla całego archiwum, nie dla miesięcznego crawlu wycenianego tutaj.

  15. Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W. and Liu, P. J. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683 (2019), JMLR 21(140). Filtry C4 są w §2.2. Artykuł podaje rozmiary w bajtach, nie tokenach; liczba 156 miliardów tokenów powszechnie mu przypisywana pochodzi od Dodge i in. poniżej.

  16. Dodge, J., Sap, M., Marasović, A., Agnew, W., Ilharco, G., Groeneveld, D., Mitchell, M. and Gardner, M. Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758 (2021), EMNLP 2021. Wskaźniki usuwania dialektów są w §5.3; kontaminacja benchmarków w C4 jest w §4.2.

  17. Lee, K., Ippolito, D., Nystrom, A., Zhang, C., Eck, D., Callison-Burch, C. and Carlini, N. Deduplicating Training Data Makes Language Models Better. arXiv:2107.06499 (2021), ACL 2022. 61 036 powtórzeń to footnote 1; liczby memorisation są w §6.2, Table 4, i są procentami wygenerowanych tokenów przy kryterium 50-token exact-match.

  18. Penedo, G., Kydlíček, H., Ben Allal, L., Lozhkov, A., Mitchell, M., Raffel, C., Von Werra, L. and Wolf, T. The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale. arXiv:2406.17557 (2024), NeurIPS 2024 Datasets and Benchmarks. Wynik deduplikacji jest w §3.4. Udostępniony dataset urósł od tego czasu ponad 15 bilionów tokenów z artykułu.

  19. Gao, L., Biderman, S., Black, S. et al. The Pile: An 800GB Dataset of Diverse Text for Language Modeling. arXiv:2101.00027 (2020). Books3 jest w §2.3 i Table 1; tabela zgód to Table 5. Korpus ma 825,18 GiB, więc nawet tytuł zaokrągla w dół.

  20. Bartz v. Anthropic, No. 4:24-cv-05417 (N.D. Cal.). Postanowienie fair-use 23 czerwca 2025 (Dkt. 231); certyfikacja klasy 17 lipca 2025; ostateczne zatwierdzenie i wyrok 20 lipca 2026 (Dkt. 680). Ugoda zwalnia tylko przeszłe wejścia, nie wyjścia i nie przyszłe działania.

  21. Kadrey v. Meta, No. 3:23-cv-03417-VC (N.D. Cal.), summary judgment 25 czerwca 2025 (Dkt. 598). Zwróć uwagę, że roszczenie dystrybucyjne dotyczące torrentów nie zostało rozstrzygnięte i pozostaje żywe.

  22. Thomson Reuters v. ROSS Intelligence, No. 1:20-cv-00613-SB (D. Del.), zmieniona opinia 11 lutego 2025 (Dkt. 770), Bibas J. W apelacji interlocutory do Third Circuit (No. 25-2153), argumentowano 11 czerwca 2026, nierozstrzygnięte w chwili pisania.

  23. Perrigo, B. Exclusive: OpenAI Used Kenyan Workers on Less Than $2 Per Hour to Make ChatGPT Less Toxic. TIME, 18 stycznia 2023. $2 to pułap dla senior reviewers, którzy spełnili każdy cel; junior labellers, większość, dostawali do ręki $1.32. Sprostowanie Sama, cytowane w tym samym artykule, podaje $1.46–$3.74 i niższą normę.

  24. Luccioni, A. S., Viguier, S. and Ligozat, A.-L. Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language Model. arXiv:2211.02001 (2022), JMLR 24(253). Tables 1 i 3.

  25. Patterson, D., Gonzalez, J., Le, Q., Liang, C., Munguia, L.-M., Rothchild, D., So, D., Texier, M. and Dean, J. Carbon Emissions and Large Neural Network Training. arXiv:2104.10350 (2021). Liczby GPT-3 są w Table 4; korekta estymacji NAS jest w §4.1.

  26. Strubell, E., Ganesh, A. and McCallum, A. Energy and Policy Considerations for Deep Learning in NLP. arXiv:1906.02243 (2019), ACL 2019. Warto czytać dokładnie właśnie przez to, co stało się z jej najczęściej cytowaną liczbą: artykuł jest staranny, podaje swoją ekstrapolację, a mimo to pomylił się o dwa rzędy wielkości w jednej linijce, którą wszyscy powtarzali.

  27. Smith, S. J., Hubbard, A., Newkirk, A., Ganeshalingam, M., Holecek, B., Sartor, D., Mills, M. and Shehabi, A. United States Data Center Energy Usage Report: 2025 Update. LBNL-2001758 (18 czerwca 2026). To rewiduje szeroko cytowany raport z 2024 w dół dla serii historycznej; jeśli cytujesz liczbę 176 TWh dla 2023, cytujesz wydanie zastąpione.

  28. NVIDIA. NVIDIA H100 Tensor Core GPU product page, nvidia.com/en-us/data-center/h100/ (dostęp 2026-09-06). Każdy wiersz tensor-core na tej stronie poza FP64 ma przypis „with sparsity”; użyta tutaj wartość dense BF16 to połowa opublikowanych 1 979 TFLOPS.

  29. Lambda. GPU Cloud pricing, lambda.ai/pricing (dostęp 2026-09-06). On-demand, za GPU za godzinę, przed podatkiem. Ceny w tej sekcji zestarzeją się szybciej niż cokolwiek innego w tym kursie; arytmetyka wokół nich nie.

  30. Karpathy, A. karpathy/llm.c, discussion #481, Reproducing GPT-2 (124M) in llm.c in 90 minutes for $20 (28 maja 2024), oraz discussion #677, Let's reproduce GPT-2 (1.6B): one 8XH100 node, 24 hours, $672, in llm.c (11 lipca 2024).

  31. Karpathy, A. karpathy/nanochat, README i leaderboard „time to GPT-2” (dostęp 2026-09-06). Liczba $48 i definicja „GPT-2 capability” przez CORE-score są w README; własny speedrun.sh repozytorium mówi „approximately 1.5 hours”, więc dwugodzinną liczbę traktuj jako zaokrągloną.

  32. Meta. Llama 3.1 model card, models/llama3_1/MODEL_CARD.md w meta-llama/llama-models (dostęp 2026-09-06). Źródło 30,84 M H100-godzin dla modelu 405 B, 39,3 M łącznie, lokalizacyjnej liczby 11 390 tCO2eq oraz data cutoff z grudnia 2023.

Gotowy, żeby to LIA wybierała za Ciebie?

Twórz ze wszystkimi modelami AI w jednym miejscu — zacznij dziś za darmo.