Pretraining LLM: Data, Komputasi, Scaling Laws, dan Biaya
Dua puluh model dilatih di satu GPU laptop untuk mengukur scaling law dan menguji estimasi komputasi 6ND dengan penghitung FLOP nyata.
Di halaman ini
Bab 9 berakhir dengan sebuah blok transformer yang bisa dilatih. Tumpuk beberapa blok seperti itu, arahkan loss next-token dari Bab 8 ke output-nya, dan tidak ada lagi yang perlu ditemukan. Semua yang tersisa adalah pembelian.
Perubahan itu lebih besar daripada kedengarannya. Setiap bab sejauh ini bertanya apakah ini belajar? — pertanyaan ya-atau-tidak yang bisa dijawab laptop dalam sepuluh menit. Bab ini mengajukan pertanyaan yang mengandung uang: dengan jumlah aritmetika tetap, model terbaik apa yang bisa saya beli? Jawabannya adalah sebuah rumus, dan pada 2018 itu tidak jelas bagi siapa pun.
Berikut pertanyaan itu dijawab lewat pengukuran, di satu GPU laptop. Dua puluh model, dari 98.624 hingga 15 juta parameter, dilatih dari nol pada 174 juta token Wikipedia — vocabulary BPE 2.048-token yang dilatih seperti Bab 7 melatihnya, transformer dari Bab 9. Setiap run mendapat tepat satu dari tiga anggaran komputasi dan tidak satu operasi pun lebih, sehingga model yang lebih besar niscaya membaca teks lebih sedikit. Loss held-out terbaik yang dicapai pada setiap anggaran:
budget C (FLOPs) best loss reached by a model of
1.00e13 5.3531 98,624 params
3.16e13 4.8638 98,624 params
1.00e14 4.3383 295,808 params
fitted: L = (Cc / C)^0.0913 over one decade of computeAritmetika sepuluh kali lebih besar memangkas loss sebesar 19 %, dan tiga titik itu berada pada garis lurus dalam log-log. Tidak ada apa pun dalam sembilan bab pertama yang memprediksi itu. Tidak ada teorema di baliknya — ini adalah keteraturan empiris, berlaku dengan eksponen berbeda di rentang sepuluh orde magnitudo antara laptop ini dan datacentre, dan inilah satu pengamatan yang meyakinkan sebuah industri untuk menghabiskan PDB negara kecil untuk GPU.
Apa itu pretraining, dan apa yang baru darinya
Tautan ke bagian: Apa itu pretraining, dan apa yang baru darinyaTidak ada yang berubah pada objective. Model masih memprediksi token berikutnya, loss masih cross-entropy dari Bab 4 yang diterapkan pada faktorisasi Bab 8, optimiser masih AdamW dari Bab 6. Pretraining bukan algoritma baru; ia adalah algoritma yang sama, dijalankan pada corpus yang cukup besar sehingga run-nya harus dianggarkan. Dua hal membuatnya mungkin: labelnya gratis, karena target untuk posisi adalah token di dan sudah ada di dalam teks; dan bagian terakhir Bab 6 menghapus keberatan, karena model dengan parameter jauh lebih banyak daripada yang diizinkan aturan klasik tidak hancur, melainkan membaik. Hasilnya adalah base model — sesuatu yang melanjutkan teks, bukan menjawab.
Menghitung komputasi sebelum membelanjakannya: 6ND
Tautan ke bagian: Menghitung komputasi sebelum membelanjakannya: 6NDSebelum semua ini bisa dianggarkan, ia harus dihitung, dan bidang ini menghitungnya dengan satu rumus:
di mana adalah jumlah parameter, adalah token pelatihan, dan adalah total operasi floating-point. Kaplan et al. menurunkannya dalam dua langkah.1 Forward: 2 FLOP per parameter per token, karena setiap parameter dalam perkalian matriks digunakan sekali per token, dalam satu perkalian dan satu penjumlahan. Backward: dua kali forward, karena backward pass dari Bab 5 menghitung dua gradient di setiap layer — terhadap input layer, agar sinyal terus berjalan, dan terhadap weight-nya — masing-masing perkalian matriks sebesar forward, sehingga .
Itulah seluruh penurunannya, dan ini layak dicek alih-alih dipercaya begitu saja. PyTorch menyertakan penghitung FLOP nyata, torch.utils.flop_counter.FlopCounterMode, yang mencegat setiap operasi yang dikirim model dan menjumlahkan kerja aktualnya. Jalankan melintasi empat orde magnitudo, yang terbesar pada perangkat meta, yang mengalokasikan shape tanpa memori:
from torch.utils.flop_counter import FlopCounterMode
counter = FlopCounterMode(display=False)
with counter:
loss = model(x, targets)[1]
loss.backward()
measured = counter.get_total_flops()
print(measured / (6 * n_params * n_tokens))| konfigurasi | tanpa embeddings | total | terukur, fwd+bwd | ÷ (total ) | ÷ (tanpa emb.) | fwd+bwd ÷ fwd |
|---|---|---|---|---|---|---|
| 128, 4 layer, 256 | 788.736 | 7.254.400 | 4.60e10 | 1.031 | 9.485 | 3.000 |
| 512, 8 layer, 256 | 25.183.232 | 51.045.888 | 3.26e11 | 1.038 | 2.104 | 3.000 |
| 768, 12 layer, 1024 | 84.973.056 | 124.356.864 | 1.75e12 | 1.145 | 1.676 | 3.000 |
| 1600, 48 layer, 1024 | 1.474.870.400 | 1.556.920.000 | 2.10e13 | 1.100 | 1.161 | 3.000 |
| 4096, 32 layer, 2048 | 6.442.983.424 | 6.582.444.032 | 8.74e13 | 1.080 | 1.104 | 3.000 |
| 8192, 80 layer, 8192 | 64.427.147.264 | 65.544.929.280 | 3.75e15 | 1.163 | 1.183 | 3.000 |
Rasio forward+backward terhadap forward adalah 3.000, persis, di setiap skala: bukan aproksimasi yang kebetulan bagus, melainkan identitas aritmetika di atas yang dikembalikan sebagai angka bulat oleh penghitung yang tidak tahu apa pun tentang penurunannya.
Total terukur kemudian berada antara 3 % dan 17 % di atas , setelah menghitung matriks embedding — dan klausa itu penting, karena dua paper pendiri menghitung secara berbeda. Kaplan mengecualikan “semua vocabulary dan positional embeddings” karena tindakan itu “menghasilkan scaling laws yang jauh lebih bersih” (§1.3); Appendix F Chinchilla mengatakan “kami juga menghitung matriks embeddings dalam total jumlah parameter”.2 Untuk vocabulary lebar dan dimensi hidden sempit, keduanya berbeda dengan faktor sembilan, seperti ditunjukkan baris pertama.
Sisa celahnya adalah apa yang sengaja dihilangkan : skor attention. Eq. (2.2) Kaplan menulis biaya forward sebagai dan membuang suku kedua karena — aman pada 2020, kurang aman sekarang, dan menjadi alasan rasio merangkak naik saat tumbuh — itulah sebabnya dua baris di sini berbagi sebesar 1.024 dan rasionya turun, dari 1.145 ke 1.100, ketika naik dari 768 ke 1.600. Itulah biaya yang diperkenalkan Bab 9 dan diubah menjadi harga oleh Bab 16.
Memori: apa yang sebenarnya harus muat
Tautan ke bagian: Memori: apa yang sebenarnya harus muatKomputasi menentukan berapa lama sebuah run berlangsung; memori menentukan apakah ia bisa dimulai. Latih dengan AdamW fp32 polos dan setiap parameter membawa empat angka: weight, gradient-nya, serta running mean dan variance milik Adam — dua rata-rata yang dibangun dengan tangan di Bab 6. Empat angka masing-masing empat byte berarti 16 byte per parameter, sebelum satu activation pun. Diukur pada GPU laptop 8 GB, mengambil alokasi resident pada titik di dalam step ketika tidak ada graph yang hidup:
| model | vocabulary | batch | prediksi | resident terukur | puncak dalam step | selisihnya | |
|---|---|---|---|---|---|---|---|
| 512, 8 layer | 50.257 | 8 | 51.045.888 | 779 MB | 801 MB | 2.500 MB | 1.699 MB |
| 512, 8 layer | 4.096 | 8 | 27.411.456 | 418 MB | 426 MB | 1.043 MB | 617 MB |
| 256, 6 layer | 4.096 | 8 | 5.839.360 | 89 MB | 89 MB | 382 MB | 293 MB |
| 256, 6 layer | 4.096 | 32 | 5.839.360 | 89 MB | 89 MB | 1.259 MB | 1.170 MB |
| 256, 6 layer | 4.096 | 128 | 5.839.360 | 89 MB | 89 MB | 4.771 MB | 4.681 MB |
Prediksi dan pengukuran cocok dalam 3 %. Kejutannya ada di kolom terakhir: activations membuat model terlihat kecil. Model 5,8 juta parameter yang sama, yang membutuhkan 89 MB state persisten, membutuhkan 4.681 MB activations pada batch 128 — lima puluh dua kali ukuran model — dan sebagian besar bahkan bukan transformer. Itu adalah logits, satu vektor berukuran vocabulary per token dengan empat byte per entri: 512 MB pada baris terakhir, 393 MB pada baris pertama. Ukuran vocabulary dipilih di Bab 7, dan ia masih menentukan apa yang muat di kartu.
Suku mana yang dominan bergantung pada bentuk run, itulah sebabnya Micikevicius et al. mengatakan memori “didominasi oleh activations”3 sementara ZeRO mengatakan model 1,5 miliar parameter membutuhkan “setidaknya 24 GB” hanya untuk state model.4 ZeRO mencapai 16 byte yang sama lewat rute lain — untuk weight fp16, untuk gradient fp16, masing-masing untuk master weights fp32 dan dua moment Adam — yang untuk 70 miliar parameter berarti 1,12 terabyte, setara empat belas GPU 80 GB sebelum satu activation pun.
Parallelism, dalam satu paragraf dan satu delegasi
Tautan ke bagian: Parallelism, dalam satu paragraf dan satu delegasiTidak ada satu pun dari itu yang muat di satu perangkat pada skala frontier, jadi run dipecah empat cara sekaligus. Data parallelism menaruh salinan model di setiap GPU dan merata-ratakan gradient — default-nya, dan yang ditingkatkan ZeRO dengan menolak menyimpan salinan state optimiser yang redundan. Tensor parallelism memecah matriks individual lintas perangkat. Pipeline parallelism memberi setiap perangkat sekelompok layer yang berurutan. Context parallelism memecah sekuens itu sendiri, diperlukan hanya ketika cukup panjang hingga suku attention mendominasi. Tabel 4 Llama 3 mencantumkan keempatnya sekaligus: tensor 8, context hingga 16, pipeline 16, data hingga 128, di 16.384 GPU H100.5 Hanya itu yang akan dikatakan kursus ini tentangnya; rekayasa distributed training adalah satu semester tersendiri, dan CS336 Stanford adalah semester itu, kuliah 5 sampai 8, beserta kodenya.6 Yang tersisa dari delegasi ini adalah satu angka, model FLOPs utilisation — fraksi aritmetika puncak GPU yang dicapai run nyata — yang mengubah yang rapi menjadi waktu wall-clock dan karena itu menjadi uang.
Kaplan, dan taruhan yang dibuat industri
Tautan ke bagian: Kaplan, dan taruhan yang dibuat industriPada Januari 2020, Kaplan et al. melatih grid transformer dan menemukan bahwa test loss mengikuti power law pada masing-masing dari tiga resource selama lebih dari enam orde magnitudo.1 §1.2 mereka memberi tiga hukum hasil fit:
dengan pendamping untuk data dan untuk komputasi yang dialokasikan optimal. Konstanta-konstantanya tidak universal, dan paper itu mengatakannya: “nilai numerik tepat dari , , dan bergantung pada ukuran vocabulary dan tokenization sehingga tidak memiliki makna fundamental.”
Eksponennya sangat kecil: parameter sepuluh kali lebih banyak membeli faktor dari sisa loss. Itu terdengar seperti tidak ada apa-apanya, dan justru itulah fakta terpenting di sini — return-nya buruk dan tidak pernah berhenti. Power law dengan eksponen kecil menjanjikan bahwa orde magnitudo berikutnya akan membantu, lebih sedikit daripada yang sebelumnya, selamanya. Membeli komputasi berhenti menjadi perjudian dan menjadi pembelian dengan kurs tukar yang dipublikasikan, persis argumen yang membuka modal.
Lalu datang resepnya, dan di sinilah paper itu salah dengan cara yang membuat industri menghabiskan banyak uang. Tabel 6 Kaplan memberi dan : komputasi sepuluh kali berarti model 5,4 kali lebih besar yang diberi teks hanya 1,9 kali lebih banyak. Abstraknya eksplisit — “pelatihan yang optimal secara efisiensi komputasi melibatkan pelatihan model sangat besar pada jumlah data yang relatif sederhana dan berhenti jauh sebelum konvergensi.” Bidang ini melakukan persis itu: GPT-3 175 miliar parameter pada 300 miliar token,7 Gopher 280 miliar pada 300 miliar, Megatron-Turing NLG 530 miliar pada 270 miliar.2 Setengah token hingga dua token per parameter, di seluruh papan.
Chinchilla, dan apa yang diukur sweep di atas
Tautan ke bagian: Chinchilla, dan apa yang diukur sweep di atasPada Maret 2022, Hoffmann et al. melatih lebih dari 400 model dari 70 juta hingga 16 miliar parameter dan mencapai kesimpulan berlawanan lewat tiga rute independen.2 Tabel 2 mereka melaporkan eksponen dalam sebagai 0,50, 0,49, dan 0,46, melawan 0,73 dari Kaplan. Dalam bahasa sederhana: ukuran model dan data pelatihan harus tumbuh dalam proporsi yang sama.
Pendekatan kedua mereka adalah yang direproduksi oleh sweep di awal bab ini, pada skala sepersejuta: tetapkan anggaran, latih banyak ukuran tepat pada anggaran itu, plot loss akhir terhadap ukuran model.
| parameter | |||
|---|---|---|---|
| 98.624 | 5.3531 (171) | 4.8638 (542) | — |
| 150.320 | 5.4636 (74) | — | — |
| 194.208 | 5.5041 (44) | 4.8730 (140) | 4.4040 (442) |
| 295.808 | 5.5550 (19) | 4.9029 (60) | 4.3383 (190) |
| 665.280 | 5.7849 (3.8) | 5.1254 (12) | 4.4192 (38) |
| 1.280.768 | 5.8174 (1.0) | 5.1751 (3.2) | 4.5003 (10) |
| 3.101.568 | — | 5.4686 (0.5) | 4.7768 (1.7) |
| 5.315.072 | — | 5.5894 (0.2) | 4.8514 (0.6) |
| 15.053.568 | — | — | 5.3534 (0.1) |
Held-out loss dalam nats per token, token per parameter dalam tanda kurung, tebal untuk model terbaik pada setiap anggaran; tanda pisah adalah titik yang tidak dijalankan, karena anggaran menuntut lebih banyak teks daripada yang tersedia di corpus atau ukuran itu berada di luar yang disapu di sana.
Baca turun satu kolom: loss turun, mencapai dasar, lalu naik lagi. Model bisa terlalu besar untuk anggarannya semudah terlalu kecil — pada penalti memilih 665.280 parameter daripada 295.808 adalah 0,08 nats, yang pada envelope yang di-fit di atas adalah loss yang dicapai model berukuran tepat dengan komputasi 18 % lebih sedikit. Memilih shape yang salah membuang seperlima anggaran. Itu adalah Gambar 3 Chinchilla dalam satu sore di satu GPU, bukan dengan empat ratus model.
Sekarang baca melintang. Pada model terbaik adalah model terkecil yang disapu; pada ia 295.808 parameter, diapit di kedua sisi. Optimum bergerak ke kanan saat anggaran tumbuh, dan itulah seluruh isi koreksi. Fit pendekatan ketiga paper itu — surface atas setiap run — lalu minimalkan dengan kendala :
L(N, D) = 24.7 / N^0.195 + 46.8 / D^0.169 (E fits to ~0; see below)
implied N_opt ∝ C^0.464
compare Chinchilla 0.46-0.50 · Besiroglu 0.513 · Kaplan 0.730,46, dari laptop, melawan 0,73 Kaplan. Kecocokan tiga digit dari fit tiga anggaran adalah keberuntungan; kecocokan digit pertama bukan. Eksponen ikut berjalan — konstanta tidak, karena rasio token-terhadap-parameter pada optimum ini 170 hingga 540, bukan 20. Ada tiga alasan, semuanya instruktif. di-fit ke nol karena pada loss di atas 4 nats run masih jauh dari lantai entropi yang mendominasi fit Chinchilla. Batch size dan learning rate dibuat tetap alih-alih di-tune per titik, yang merugikan run mana pun yang mendapat step paling sedikit — dan itu adalah model besar: pada FLOP, model 1,28 juta parameter mendapat total 159 step optimiser, jauh di bawah beberapa ribu yang menurut suku Kaplan dibutuhkan model mana pun. Sebuah scaling law di-fit di dalam sebuah rezim, dan yang ini berada enam orde magnitudo di bawah Chinchilla.
Karena itu abstrak paper tersebut: “large language models saat ini sangat undertrained”. Chinchilla adalah demontrasinya — 70 miliar parameter pada 1,4 triliun token, komputasi total yang sama dengan Gopher 280 miliar pada 300 miliar, mengalahkannya pada 51 dari 57 tugas MMLU, 67,5 % melawan 60 %.2 Empat kali lebih kecil, empat setengah kali lebih banyak teks, uang yang sama, model lebih baik.
Dua catatan untuk rasio terkenal itu. “Dua puluh token per parameter” bukan kalimat dalam paper, yang hanya mengatakan bahwa “untuk setiap pelipatan dua ukuran model, jumlah token pelatihan juga harus dilipatgandakan”; angka 20 adalah inferensi dari Tabel 3 dan dari Chinchilla sendiri: 70 B pada 1,4 T. Dan presisinya lebih buruk daripada yang dipublikasikan: Besiroglu et al. melakukan refit dari digitasi Gambar 4, menemukan parameter asli “kurang cocok dengan data rekonstruksi” dengan interval yang “tidak masuk akal ketat mengingat jumlah titik data”, dan menaruh rentang jujurnya pada “antara 4 dan 40” token per parameter.8
Satu detail metode Chinchilla menepati janji yang dibuat Bab 1 tentang learning-rate schedules. Cosine schedule harus dicocokkan dengan anggaran token. Model yang akan melihat 10 juta token harus menurunkan learning rate-nya ke nol pada 10 juta token; beri ia schedule untuk 100 juta, hentikan lebih awal, dan kamu membaca loss di tengah penurunan dengan rate yang jauh terlalu tinggi. Chinchilla melatih setiap model pada empat panjang siklus untuk mengendalikan hal ini persis; sweep di atas menetapkan schedule dari anggaran karena alasan yang sama.
Apa yang tidak dijanjikan scaling laws
Tautan ke bagian: Apa yang tidak dijanjikan scaling lawsMereka adalah hasil empiris paling berguna di bidang ini dan secara rutin dijual berlebihan. Empat batas.
Mereka memprediksi loss, bukan capability. Sisi kiri adalah cross-entropy pada teks held-out. Tidak ada dalam paper-paper ini yang mengizinkan klaim tentang apakah sebuah model akan menulis SQL yang benar, menolak permintaan berbahaya, atau menggunakan tool. Ini lagi-lagi pelajaran Bab 5: prediksi loss bukan prediksi perilaku yang kamu bayar.
Mereka di-fit, bukan diturunkan. Tidak ada teori yang menghasilkan . Konstanta bergerak bersama tokenizer — itulah sebabnya perbandingan perplexity lintas dua tokenizer tidak bermakna, seperti dijelaskan Bab 8 — dan bersama campuran data, arsitektur, serta optimiser. Setiap hukum yang dipublikasikan adalah hukum dari setup yang menghasilkannya, itulah sebabnya Meta melakukan refit sendiri sebelum Llama 3.5
Mereka mengasumsikan token baru untuk setiap step, yang diam-diam mengasumsikan corpus tak terbatas. Muennighoff et al. mengukur apa yang terjadi ketika corpus habis: hingga empat epoch data berulang hampir tidak ada biayanya — model 8,7 miliar parameter pada 44 miliar token unik yang dilihat empat kali selesai dengan “validation loss hanya 0,5 % lebih tinggi” daripada model yang sama pada 178 miliar token unik — sementara setelah sekitar enam belas epoch, komputasi tambahan tidak membeli apa pun.9
Dan tidak ada yang melatih compute-optimal lagi. Chinchilla meminimalkan biaya pelatihan; model yang dideploy kemudian membayar kira-kira FLOP per token yang dihasilkan, selamanya. LLaMA 1 mengatakannya gamblang: “dengan target tingkat performa tertentu, model yang lebih disukai bukan yang paling cepat dilatih, melainkan yang paling cepat saat inference”.10 Sardana et al. memformalkannya dengan meminimalkan sebagai gantinya, dan menemukan siapa pun yang mengharapkan satu miliar request harus melatih “lebih kecil dan lebih lama daripada Chinchilla-optimal”.11 §9.1 Llama 3 sepakat: model kecilnya dilatih “jauh melampaui titik pelatihan optimal-komputasi, secara efektif menukar komputasi pelatihan dengan efisiensi inference”.5 Rasionya tidak usang; ia menjawab pertanyaan yang kini bukan lagi pertanyaan yang diajukan.
Emergent abilities, dan perdebatan tentang apakah mereka nyata
Tautan ke bagian: Emergent abilities, dan perdebatan tentang apakah mereka nyataLoss turun mulus. Skor benchmark kadang tidak. Wei et al. mengumpulkan kasus ketika sebuah tugas berada di level tebak-tebakan sepanjang orde magnitudo komputasi pelatihan lalu melompat — aritmetika tiga digit muncul pada GPT-3 sekitar FLOP, MMLU naik di atas tebakan antara dan — dan memberi nama polanya: “sebuah ability bersifat emergent jika tidak hadir pada model yang lebih kecil tetapi hadir pada model yang lebih besar”.12 Jika itu sifat nyata, ekstrapolasi dari eksperimen murah tidak aman, karena capability yang kamu beli mungkin tidak ada pada skala mana pun yang sanggup kamu uji.
Schaeffer, Miranda, dan Koyejo berargumen bahwa sebagian besar adalah artefak pengukuran, dan mekanismenya adalah aritmetika.13 Per-token loss turun mulus, sehingga probabilitas satu token benar, , membaik bertahap. Skor model dengan exact string match atas jawaban -token dan kamu menaikkan probabilitas itu ke pangkat — kurva mulus yang dipangkatkan besar terlihat seperti tebing. Ganti dengan metrik yang menghitung token alih-alih menuntut semuanya benar, pada output yang sama, dan “performa keluarga itu meningkat mulus, kontinu, dan dapat diprediksi seiring bertambahnya skala”.
Audit mereka adalah angka yang perlu diingat — “dari 39 metrik pilihan di BIG-Bench, paling banyak 5 menampilkan emergence”, dengan dua metrik diskontinu menyumbang lebih dari 92 % kasus yang diklaim — begitu pula peringatannya: “tidak ada dalam paper ini yang boleh ditafsirkan sebagai klaim bahwa large language models tidak dapat menampilkan emergent abilities”. Lompatan dalam chart adalah bukti tentang metrik sampai terbukti sebaliknya. Bab 29 adalah tempat hal itu menjadi masalahmu, karena memilih metrik hard-cutoff adalah keputusan yang akan kamu buat tanpa sadar.
Dari mana data berasal
Tautan ke bagian: Dari mana data berasalCorpus adalah bagian dari run pretraining yang tidak memiliki persamaan terlampir, dan tempat sebagian besar keputusan penting berada. Bahan mentahnya adalah web crawl: arsip Agustus 2026 Common Crawl berisi “2,14 miliar halaman web atau 360 TiB konten tak terkompresi”, satu bulan, gratis untuk diunduh.14 Hampir tidak ada yang bisa langsung dipakai. Paper T5 mengatakan crawl “sebagian besar terdiri dari teks omong kosong atau boiler-plate seperti menu, pesan error, atau teks duplikat”, dan pipeline C4 yang diperkenalkannya adalah daftar heuristik tumpul — simpan hanya baris yang berakhir dengan tanda baca terminal, buang halaman dengan kurang dari tiga kalimat, buang halaman apa pun yang mengandung kurung kurawal atau kata dari daftar publik kata-kata kasar — mengubah dua puluh terabyte teks bulanan menjadi sekitar 750 GB.15
Tumpul adalah kata yang tepat. Dodge et al. mengaudit apa yang dihapus filter itu dan menemukan blocklist kata kasar menghapus 42 % dokumen dalam African-American English dan 32 % dalam English yang selaras Hispanik, dibanding 6,2 % dalam English yang selaras White, menyisakan corpus yang 97,8 % berasal dari kategori terakhir.16 Aturan yang tidak punya opini tentang dialek ternyata punya.
Lalu deduplication, yang bukan sekadar housekeeping: Lee et al. menemukan kalimat 61 kata yang diulang 61.036 kali di C4, dan menunjukkan bahwa deduplication memangkas sepuluh kali lipat laju model “memancarkan teks yang dihafal”, dari 1,9 % token yang dihasilkan menjadi 0,19 %.17 Namun lebih banyak tidak selalu lebih baik — tim FineWeb melakukan deduplication global di 96 crawl, mendapatkan 4 triliun token dan tidak ada gain terukur, lalu melakukan deduplication tiap crawl secara terpisah, mendapatkan 20 triliun, dan menyamai corpus terbaik yang ada.18
Lalu contamination. Llama 3 mengukur miliknya sendiri dan mempublikasikannya: 98 % AGIEval, 95 % BIG-Bench Hard, dan 85 % HellaSwag overlap dengan training set menurut 8-gram, dan untuk MMLU overlap begitu tinggi sehingga “mustahil mendapatkan estimasi gain performa yang baik”.5 §4 GPT-3 melaporkan bug filtering yang meninggalkan benchmark di dalam data tanpa jalan kembali: “karena pertimbangan biaya, tidak layak untuk melatih ulang model”.7
Provenance adalah bagian yang belum terselesaikan. The Pile mengirim komponen 100,96 GiB bernama Books3 — 12 % corpus dan, menurut tabel persetujuan paper itu sendiri, buku dari private torrent tracker;19 komponen itu dibuat offline pada Agustus 2023 setelah keluhan hak cipta. Posisi hukum per September 2026 belum mapan, dan tiga putusan AS yang dikutip sebagai tren saling tidak sepakat. Alsup menyatakan pelatihan pada buku yang diperoleh secara sah “sangat transformatif” sambil memutuskan bahwa library yang dibangun dari salinan bajakan tidak demikian, dan Anthropic menyelesaikan separuh itu dengan $1,5 miliar untuk 482.460 karya, kira-kira $3.000 masing-masing, disetujui 20 Juli 2026.20 Chhabria mengabulkan summary judgment Meta sambil menulis bahwa putusannya “tidak berarti bahwa penggunaan materi berhak cipta oleh Meta untuk melatih language models-nya adalah sah”, hanya bahwa “para penggugat ini mengajukan argumen yang salah”.21 Bibas, memutuskan melawan Ross Intelligence, mencatat bahwa “hanya AI non-generatif yang ada di hadapan saya hari ini”.22 Belum ada pengadilan banding AS yang memutuskan pertanyaan ini.
Manusia mengerjakan bagian yang tidak bisa dikerjakan loss. TIME melaporkan pada Januari 2023 bahwa pekerja yang melabeli teks toksik untuk OpenAI melalui firma Sama membawa pulang “antara sekitar $1,32 dan $2 per jam” membaca bagian yang menggambarkan pelecehan seksual anak, penyiksaan, dan self-harm, sementara OpenAI membayar Sama $12,50 per jam untuk pekerjaan itu; Sama membantah baik rentang upah maupun kuotanya.23 Itu adalah filtering di sekitar pretraining, bukan pretraining itu sendiri — tetapi ada di invoice yang sama, dan di situlah seorang manusia duduk.
Listriknya nyata dan biasanya salah dikutip. Angka terbitan paling teliti adalah BLOOM: 1.082.990 GPU-hour, 433 MWh, dan 24,7 ton ekuivalen CO₂ untuk run, 50,5 jika menghitung manufaktur dan node idle;24 Patterson et al. menaruh GPT-3 pada 1.287 MWh dan 552 ton.25 Dua peringatan. Keunggulan BLOOM adalah jaringan nuklir Prancis pada 57 g CO₂ per kWh, bukan efisiensi — ia memakai energi lebih banyak daripada OPT-175B. Dan angka emisi yang paling sering dikutip di bidang ini, 626.155 lb dari Strubell et al. untuk neural architecture search, belakangan terbukti 88 kali terlalu tinggi, karena mengasumsikan search berjalan pada ukuran model penuh padahal berjalan pada proxy.26 Framing LBNL adalah yang dapat dipertahankan: data center AS memakai 192 TWh pada 2024, 4,7 % listrik nasional — angka yang melekat pada sebuah industri, bukan pada satu run tertentu.27
Benang merahnya adalah apa yang Bender et al. sebut documentation debt: “menempatkan diri kita dalam situasi ketika dataset sekaligus tidak terdokumentasi dan terlalu besar untuk didokumentasikan post hoc”.28 Setiap fakta di atas ada karena seseorang melihat. Untuk corpora di balik model yang dipakai kebanyakan orang, tidak ada yang bisa.
Berapa biaya sebenarnya
Tautan ke bagian: Berapa biaya sebenarnyaSekarang aritmetika yang diinginkan semua orang, dari empat input yang dikutip, sehingga saat nanti basi jelas mana yang perlu diganti.
Throughput puncak
Tautan ke bagian: Throughput puncakHalaman H100 NVIDIA mencantumkan 1.979 teraFLOPS throughput tensor-core BF16 di bawah catatan kaki “with sparsity”.29 Tidak ada run pretraining yang memakai structured sparsity, jadi angka dense adalah setengahnya: 989,5 TFLOP/s.
Utilisation
Tautan ke bagian: UtilisationTabel 4 Llama 3 melaporkan 38–43 % BF16 model FLOPs utilisation. Ambil 40 %: 395,8 TFLOP/s aritmetika berguna per GPU.5
Harga on-demand Lambda untuk node 8×H100 SXM, diakses 2026-09-06: $3,99 per GPU-hour, jadi $31,92 per jam untuk node.30
Rasio Chinchilla, , memberi dan karena itu .
| anggaran | H100-hour | FLOP | parameter compute-optimal | token | pada satu node 8×H100 | GPU untuk selesai dalam 90 hari |
|---|---|---|---|---|---|---|
| $100 | 25 | 3.6e19 | 546 M | 10.9 B | 3.1 jam | 1 |
| $1,000 | 251 | 3.6e20 | 1.73 B | 34.5 B | 31.3 jam | 1 |
| $10,000 | 2,506 | 3.6e21 | 5.46 B | 109 B | 13 hari | 2 |
| $100,000 | 25,063 | 3.6e22 | 17.3 B | 345 B | 131 hari | 12 |
| $1,000,000 | 250,627 | 3.6e23 | 54.6 B | 1.09 T | 4 tahun | 116 |
| $10,000,000 | 2,506,266 | 3.6e24 | 173 B | 3.45 T | 36 tahun | 1,160 |
| $100,000,000 | 25,062,657 | 3.6e25 | 546 B | 10.9 T | 358 tahun | 11,603 |
Baca dua kolom terakhir bersama-sama. Dengan $10.000 kamu mendapat model 5 miliar parameter di satu node sewaan dalam dua pekan. Pada $100.000.000, aritmetikanya mengatakan 546 miliar parameter — dan dua belas ribu H100 yang dirangkai bersama selama tiga bulan, yang bukan sesuatu yang kamu sewa dengan kartu kredit. Lewat sekitar $100.000, constraint yang mengikat berhenti menjadi uang dan menjadi cluster.
Sebelum mempercayai tabel seperti itu, uji terhadap run yang biaya nyatanya dipublikasikan — llm.c mereproduksi GPT-2 124M dalam “~90 menit” di node 8×A100 “dengan sekitar $20”, dan GPT-2 1.6B dalam 24 jam di node 8×H100 seharga $672.31
$672, against what $672 actually bought (llm.c GPT-2 1.6B, one 8xH100 node, 24 h)
this table predicts: 168 H100-hours N = 1.41 B params D = 28.3 B tokens
what was actually run: 192 H100-hours N = 1.558 B params D = 33.6 B tokens
Llama 3 405B, against Meta's own published GPU-hours
from the paper's 3.8e25 FLOPs at 40 % MFU: 26.67 M H100-hours
published in Meta's Llama 3.1 model card: 30.84 M H100-hours ratio 0.86Keduanya dalam sekitar 15 %, kira-kira tingkat akurasi yang pantas untuk estimasi semacam ini dan jauh lebih baik daripada akurasi yang biasanya dipakai saat mengutipnya.
Perbandingan headline, dengan kedua definisi di atas meja
Tautan ke bagian: Perbandingan headline, dengan kedua definisi di atas mejaAngka yang paling sering diulang dalam topik ini adalah bahwa model sekelas GPT-2 yang menelan biaya sekitar $43.000 pada 2019 kini bisa direproduksi dengan beberapa puluh dolar. Separuh modernnya terdokumentasi baik; separuh historisnya tidak.
Hari ini. README nanochat Karpathy: “kamu bisa melatih LLM berkemampuan GPT-2 milikmu sendiri ... hanya dengan $48 (~2 jam node GPU 8XH100) ... Pada spot instance, total biaya bisa lebih dekat ke ~$15.”32 “Kemampuan GPT-2” di sini presisi dan dipublikasikan — mengalahkan skor CORE GPT-2 sebesar 0,256525 — pada leaderboard yang entri terbaiknya per 14 Maret 2026 adalah 1,65 jam. Angka $48 mengasumsikan $3 per GPU-hour, di bawah daftar Lambda $3,99; pada harga daftar, lebih dekat ke $64.
Pada 2019. Tidak ada sumber primer: OpenAI tidak pernah mempublikasikan durasi atau biaya. Rantainya berjalan dari The Register, Februari 2019, melaporkan “256 Google TPU3 cores” tanpa harga dan tanpa durasi; lalu Synced, Juni 2019, mencatat bahwa biaya hardware $256 per jam di Google Cloud dan menyatakan eksplisit bahwa “OpenAI tidak menyebutkan durasi pelatihan”. $43.008 adalah $256 per jam dikali asumsi 168 jam yang tidak pernah punya sumber.
Jadi headline yang jujur adalah: model yang menyamai skor benchmark GPT-2 yang dipublikasikan dapat dilatih hari ini dengan jauh di bawah $100 pada hardware sewaan, dibanding biaya 2019 yang tidak pernah dipublikasikan dan estimasi terkenalnya bertumpu pada tebakan durasi tanpa sumber. Keruntuhannya nyata dan separuh modernnya bisa direproduksi oleh siapa pun dengan kartu kredit; rasio-nya adalah aritmetika atas angka yang tidak ada. Begitulah keadaan biaya pelatihan yang dipublikasikan secara umum. Paper GPT-3 tidak berisi jumlah dolar sama sekali, hanya FLOP di Tabel D.1;7 paper Llama 3 juga tidak berisi angka dolar.5 Setiap biaya pelatihan yang pernah kamu baca adalah estimasi dari jumlah FLOP, asumsi hardware, dan asumsi harga — selalu layak ditanya asumsi siapa.
Apa yang diketahui base model, dan kapan ia berhenti mengetahuinya
Tautan ke bagian: Apa yang diketahui base model, dan kapan ia berhenti mengetahuinyaHasilnya telah melihat corpus tetap yang disusun pada momen tetap, dan dua sifat mengikutinya.
Yang pertama adalah knowledge cutoff. Setelah tanggal pengumpulan, model tidak tahu apa-apa — bukan “tidak yakin”, melainkan tidak tahu apa pun — dan ia akan mengarang dengan lancar alih-alih mengatakannya, karena mengatakan itu bukan perilaku yang pernah dilatihkan. Model card Llama 3.1 memberi Desember 2023;33 setiap model memilikinya, dan itu adalah sifat data pelatihan, bukan deployment. Mengakalinya adalah masalah retrieval, yaitu Bab 19.
Yang kedua adalah bahwa base model melengkapi, bukan menjawab. Beri ia “Apa ibu kota Prancis?” dan kelanjutan yang masuk akal adalah pertanyaan lain, karena dalam corpus string itu paling sering muncul dalam daftar latihan.
Ke mana selanjutnya
Tautan ke bagian: Ke mana selanjutnyaPelengkap teks bukan assistant. Ia tidak mengikuti instruksi, karena tidak ada dalam corpus yang memberi tahu bahwa request harus dipatuhi alih-alih dilanjutkan. Ia tidak punya gagasan tentang percakapan dengan dua peserta. Ia akan dengan senang hati menghasilkan kelanjutan paling mungkin dari prompt berbahaya, karena kemungkinan adalah satu-satunya hal yang pernah dioptimalkan untuknya.
Mengubahnya menjadi sesuatu yang menjawab memerlukan tahap kedua yang biayanya hanya sebagian kecil dari satu persen tahap pertama, dan hampir seluruhnya terdiri dari menunjukkan contoh perilaku yang kamu inginkan lalu membandingkan pasangan output-nya sendiri. Tahap itulah asal instruction following, chat templates, refusals, dan — ini mengejutkan orang — kemampuan memanggil tool. Bab 11 adalah tahap itu: supervised fine-tuning, RLHF, DPO, dan GRPO, serta pertanyaan tentang apa arti “aligned” dan siapa yang memutuskan.
Sumber dan metode
Tautan ke bagian: Sumber dan metodeJuga layak dibaca bersama bab ini: build-nanogpt Karpathy dan video pendampingnya, yang menelusuri reproduksi penuh GPT-2 dari ujung ke ujung dengan tempo yang tidak bisa dilakukan bab ini; dan Stanford CS324, Large Language Models, yang kuliah tentang data dan dampak lingkungan membahas lebih dalam materi yang kursus ini perlakukan sekali lalu delegasikan.
Referensi
Tautan ke bagian: Referensi-
Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J. and Amodei, D. Scaling Laws for Neural Language Models. arXiv:2001.08361 (2020). Tiga power law adalah Eq. (1.1)–(1.3) di §1.2 dan konstanta lengkapnya ada di Appendix A, Tabel 5; penurunan adalah §2.1; eksponen alokasi komputasi ada di Tabel 6. Perhatikan ada dua hukum komputasi, pada batch size tetap dan pada batch size optimal; paper mengatakan yang terakhir “sebaiknya digunakan untuk membuat prediksi”. ↩ ↩2
-
Hoffmann, J., Borgeaud, S., Mensch, A., Buchatskaya, E., Cai, T., Rutherford, E. et al. Training Compute-Optimal Large Language Models. arXiv:2203.15556 (2022). Eksponen di Tabel 2, anggaran proyeksi di Tabel 3, perbandingan Gopher di §4, konvensi penghitungan parameter di Appendix F. Prosa di bawah Tabel 3 tidak sepakat dengan Tabel 3 sendiri untuk baris 175 B dan 280 B; tabel adalah versi yang harus dikutip. ↩ ↩2 ↩3 ↩4
-
Micikevicius, P., Narang, S., Alben, J., Diamos, G., Elsen, E., Garcia, D. et al. Mixed Precision Training. arXiv:1710.03740 (2017), ICLR 2018. Master weights FP32 di §3.1, loss scaling di §3.2. ↩ ↩2
-
Rajbhandari, S., Rajbhandari, S., Ruwase, O. and He, Y. ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054 (2019), SC20. Pembukuan ada di §3.1; angka residual-state untuk activations ada di §3.2. ↩
-
Grattafiori, A. et al. (Llama Team, AI @ Meta). The Llama 3 Herd of Models. arXiv:2407.21783 (2024). Anggaran komputasi dan jumlah token di §1, scaling law hasil refit di §3.2.1, konfigurasi parallelism dan MFU di Tabel 4, analisis contamination di §5.1.4, pernyataan over-training di §9.1. Paper ini tidak berisi angka dolar dan tidak ada tabel emisi. ↩ ↩2 ↩3 ↩4 ↩5 ↩6
-
Stanford CS336, Language Modeling from Scratch. Kuliah 2 membahas pembukuan resource, kuliah 5–8 GPU, kernel, dan parallelism, kuliah 9 dan 11 scaling, kuliah 13–14 data. Ini adalah kursus yang menjadi tujuan delegasi rekayasa bab ini, dan kursusnya publik. ↩
-
Brown, T. B. et al. Language Models are Few-Shot Learners. arXiv:2005.14165 (2020). Komputasi di Appendix D, Tabel D.1 — yang memiliki kolom secara harfiah berjudul “flops per param per token”, dengan nilai 6 untuk setiap baris GPT-3. Analisis contamination di §4. ↩ ↩2 ↩3
-
Besiroglu, T., Erdil, E., Barnett, M. and You, J. Chinchilla Scaling: A replication attempt. arXiv:2404.10102 (2024). Merekonstruksi data Chinchilla dengan mendigitasi Gambar 4, melakukan refit, dan melaporkan eksponen terkoreksi serta interval yang jauh lebih lebar. ↩
-
Muennighoff, N., Rush, A. M., Barak, B., Le Scao, T., Piktus, A., Tazi, N., Pyysalo, S., Wolf, T. and Raffel, C. Scaling Data-Constrained Language Models. arXiv:2305.16264 (2023), NeurIPS 2023. Hasil empat epoch ada di §6; half-life enam belas epoch adalah hasil fit. ↩
-
Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T. et al. LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 (2023). §1 menyatakan argumen biaya inference melawan pelatihan Chinchilla-optimal. ↩
-
Sardana, N., Portes, J., Doubov, S. and Frankle, J. Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws. arXiv:2401.00448 (2023), ICML 2024. §5 mereka juga memuat penyeimbang: model yang dilatih pada rasio token ekstrem terus membaik, tetapi “lebih lambat daripada prediksi scaling laws”. ↩
-
Wei, J., Tay, Y., Bommasani, R., Raffel, C., Zoph, B., Borgeaud, S. et al. Emergent Abilities of Large Language Models. arXiv:2206.07682 (2022), TMLR. Definisi di §2, contoh dan ambang komputasi di §3–4 dan Tabel 1. ↩
-
Schaeffer, R., Miranda, B. and Koyejo, S. Are Emergent Abilities of Large Language Models a Mirage? arXiv:2304.15004 (2023), paper outstanding NeurIPS 2023. Argumen metrik ada di §2, meta-analisis BIG-Bench di §4, contoh vision yang dikonstruksi di §5. ↩
-
Common Crawl, August 2026 Crawl Archive Now Available (CC-MAIN-2026-34), diterbitkan 24 Agustus 2026, diakses 2026-09-06. Front page-nya sendiri mengklaim “lebih dari 300 miliar halaman selama 15 tahun”, “total lebih dari 10 petabyte” — angka untuk seluruh arsip, bukan untuk crawl bulanan yang dihargai di sini. ↩
-
Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W. and Liu, P. J. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683 (2019), JMLR 21(140). Filter C4 ada di §2.2. Paper memberi ukuran dalam byte, bukan token; angka 156 miliar token yang sering dikaitkan dengannya berasal dari Dodge et al. di bawah. ↩
-
Dodge, J., Sap, M., Marasović, A., Agnew, W., Ilharco, G., Groeneveld, D., Mitchell, M. and Gardner, M. Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758 (2021), EMNLP 2021. Tingkat penghapusan dialek ada di §5.3; benchmark contamination di C4 ada di §4.2. ↩
-
Lee, K., Ippolito, D., Nystrom, A., Zhang, C., Eck, D., Callison-Burch, C. and Carlini, N. Deduplicating Training Data Makes Language Models Better. arXiv:2107.06499 (2021), ACL 2022. Pengulangan 61.036 kali ada di footnote 1; angka memorisation ada di §6.2, Tabel 4, dan merupakan persentase token yang dihasilkan di bawah kriteria exact-match 50-token. ↩
-
Penedo, G., Kydlíček, H., Ben Allal, L., Lozhkov, A., Mitchell, M., Raffel, C., Von Werra, L. and Wolf, T. The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale. arXiv:2406.17557 (2024), NeurIPS 2024 Datasets and Benchmarks. Hasil deduplication ada di §3.4. Dataset yang dirilis sejak itu telah tumbuh melewati 15 triliun token dalam paper. ↩
-
Gao, L., Biderman, S., Black, S. et al. The Pile: An 800GB Dataset of Diverse Text for Language Modeling. arXiv:2101.00027 (2020). Books3 ada di §2.3 dan Tabel 1; tabel consent adalah Tabel 5. Corpus-nya 825,18 GiB, jadi bahkan judulnya adalah pembulatan ke bawah. ↩
-
Bartz v. Anthropic, No. 4:24-cv-05417 (N.D. Cal.). Perintah fair-use 23 Juni 2025 (Dkt. 231); class certification 17 Juli 2025; persetujuan akhir dan putusan 20 Juli 2026 (Dkt. 680). Settlement hanya melepaskan input masa lalu, bukan output dan bukan tindakan masa depan. ↩
-
Kadrey v. Meta, No. 3:23-cv-03417-VC (N.D. Cal.), summary judgment 25 Juni 2025 (Dkt. 598). Perhatikan bahwa klaim distribusi atas torrenting tidak diputus dan tetap berjalan. ↩
-
Thomson Reuters v. ROSS Intelligence, No. 1:20-cv-00613-SB (D. Del.), revised opinion 11 Februari 2025 (Dkt. 770), Bibas J. Dalam interlocutory appeal ke Third Circuit (No. 25-2153), disidangkan 11 Juni 2026, belum diputus pada saat penulisan. ↩
-
Perrigo, B. Exclusive: OpenAI Used Kenyan Workers on Less Than $2 Per Hour to Make ChatGPT Less Toxic. TIME, 18 Januari 2023. $2 adalah batas atas untuk senior reviewers yang memenuhi setiap target; junior labellers, mayoritasnya, membawa pulang $1,32. Sanggahan Sama, dikutip dalam artikel yang sama, memberi $1,46–$3,74 dan kuota lebih rendah. ↩
-
Luccioni, A. S., Viguier, S. and Ligozat, A.-L. Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language Model. arXiv:2211.02001 (2022), JMLR 24(253). Tabel 1 dan 3. ↩
-
Patterson, D., Gonzalez, J., Le, Q., Liang, C., Munguia, L.-M., Rothchild, D., So, D., Texier, M. and Dean, J. Carbon Emissions and Large Neural Network Training. arXiv:2104.10350 (2021). Angka GPT-3 ada di Tabel 4; koreksi estimasi NAS ada di §4.1. ↩
-
Strubell, E., Ganesh, A. and McCallum, A. Energy and Policy Considerations for Deep Learning in NLP. arXiv:1906.02243 (2019), ACL 2019. Layak dibaca tepat karena apa yang terjadi pada angka yang paling sering dikutip darinya: paper itu teliti, menyatakan ekstrapolasinya, dan tetap salah dua orde magnitudo pada satu baris yang diulang semua orang. ↩
-
Smith, S. J., Hubbard, A., Newkirk, A., Ganeshalingam, M., Holecek, B., Sartor, D., Mills, M. and Shehabi, A. United States Data Center Energy Usage Report: 2025 Update. LBNL-2001758 (18 Juni 2026). Ini merevisi seri historis dari laporan 2024 yang banyak dikutip ke bawah; jika kamu mengutip angka 176 TWh untuk 2023, kamu mengutip edisi yang sudah digantikan. ↩
-
Bender, E. M., Gebru, T., McMillan-Major, A. and Shmitchell, S. On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? FAccT '21, pp. 610–623. DOI 10.1145/3442188.3445922. “Documentation debt” ada di §4.4. Perhatikan bahwa angka karbon paper itu sendiri dikutip dari Strubell et al. dan mewarisi koreksi di atas — yang merupakan ilustrasi argumennya, bukan bantahan terhadapnya. ↩
-
NVIDIA. NVIDIA H100 Tensor Core GPU product page,
nvidia.com/en-us/data-center/h100/(diakses 2026-09-06). Setiap baris tensor-core di halaman itu kecuali FP64 membawa catatan kaki “with sparsity”; angka BF16 dense yang digunakan di sini adalah setengah dari 1.979 TFLOPS yang dipublikasikan. ↩ -
Lambda. GPU Cloud pricing,
lambda.ai/pricing(diakses 2026-09-06). On-demand, per GPU per jam, sebelum pajak. Harga di bagian ini akan basi lebih cepat daripada apa pun dalam kursus ini; aritmetika di sekitarnya tidak. ↩ -
Karpathy, A.
karpathy/llm.c, diskusi #481, Reproducing GPT-2 (124M) in llm.c in 90 minutes for $20 (28 Mei 2024), dan diskusi #677, Let's reproduce GPT-2 (1.6B): one 8XH100 node, 24 hours, $672, in llm.c (11 Juli 2024). ↩ -
Karpathy, A.
karpathy/nanochat, README dan leaderboard “time to GPT-2” (diakses 2026-09-06). Angka $48 dan definisi skor CORE untuk “kemampuan GPT-2” keduanya ada di README;speedrun.shmilik repositori itu sendiri mengatakan “sekitar 1,5 jam”, jadi perlakukan angka dua jam sebagai pembulatan. ↩ -
Meta. Llama 3.1 model card,
models/llama3_1/MODEL_CARD.mdinmeta-llama/llama-models(diakses 2026-09-06). Sumber 30,84 M H100-hour untuk model 405 B, total 39,3 M, angka berbasis lokasi 11.390 tCO2eq, dan data cutoff Desember 2023. ↩