Huấn luyện trước một LLM: dữ liệu, compute, scaling laws và chi phí
20 mô hình huấn luyện trên một GPU laptop để đo scaling law, và ước tính compute 6ND được đối chiếu bằng bộ đếm FLOP thật.
Trên trang này
Chương 9 kết thúc với một khối transformer có thể huấn luyện. Xếp chồng vài khối như vậy, trỏ loss dự đoán token tiếp theo của Chương 8 vào đầu ra, và không còn gì phải phát minh nữa. Mọi thứ còn lại là một khoản mua.
Đó là một bước chuyển lớn hơn vẻ bề ngoài. Mọi chương trước đây đều hỏi nó có học được không? — một câu hỏi có-không mà laptop giải quyết trong mười phút. Chương này hỏi một câu có tiền trong đó: với một lượng số học cố định, mô hình tốt nhất tôi có thể mua là gì? Câu trả lời là một công thức, và năm 2018 nó không hề hiển nhiên với bất kỳ ai.
Đây là câu hỏi đó được trả lời bằng đo đạc, trên một GPU laptop. Hai mươi mô hình, từ 98.624 đến 15 triệu tham số, được huấn luyện từ đầu trên 174 triệu token Wikipedia — một vocabulary BPE 2.048-token được huấn luyện theo cách Chương 7 huấn luyện, cùng transformer của Chương 9. Mỗi lượt chạy nhận chính xác một trong ba ngân sách compute và không hơn một phép toán nào, nên mô hình lớn hơn tất yếu đọc ít văn bản hơn. Loss held-out tốt nhất đạt được ở mỗi ngân sách:
budget C (FLOPs) best loss reached by a model of
1.00e13 5.3531 98,624 params
3.16e13 4.8638 98,624 params
1.00e14 4.3383 295,808 params
fitted: L = (Cc / C)^0.0913 over one decade of computeGấp mười lần số học làm loss giảm 19 %, và ba điểm nằm trên một đường thẳng trong log-log. Không có gì trong chín chương đầu dự đoán điều đó. Không có định lý nào phía sau — đó là một quy luật thực nghiệm, giữ được với một số mũ khác trên mười bậc độ lớn giữa chiếc laptop này và một datacentre, và là quan sát duy nhất đã thuyết phục cả một ngành chi GDP của một quốc gia nhỏ cho GPU.
Pretraining là gì, và có gì mới ở nó
Liên kết đến mục: Pretraining là gì, và có gì mới ở nóKhông có gì trong mục tiêu thay đổi. Mô hình vẫn dự đoán token tiếp theo, loss vẫn là cross-entropy của Chương 4 áp vào phép phân rã của Chương 8, bộ tối ưu vẫn là AdamW của Chương 6. Pretraining không phải một thuật toán mới; đó là cùng thuật toán được chạy trên một corpus đủ lớn để lượt chạy phải được lập ngân sách. Hai điều khiến việc đó khả thi: nhãn là miễn phí, vì mục tiêu cho vị trí là token tại và đã có sẵn trong văn bản; và phần cuối Chương 6 đã gỡ bỏ phản đối, vì một mô hình có nhiều tham số hơn rất xa các quy tắc cổ điển cho phép không sụp đổ, mà cải thiện. Thứ thu được là một base model — thứ tiếp tục văn bản hơn là trả lời.
Đếm compute trước khi chi: 6ND
Liên kết đến mục: Đếm compute trước khi chi: 6NDTrước khi lập ngân sách cho bất kỳ điều gì trong số này, nó phải được đếm, và lĩnh vực này đếm bằng một công thức:
trong đó là số tham số, là số token huấn luyện và là tổng số phép toán dấu phẩy động. Kaplan và cộng sự suy ra nó trong hai bước.1 Forward: 2 FLOP cho mỗi tham số mỗi token, vì mọi tham số trong một phép nhân ma trận được dùng một lần cho mỗi token, trong một phép nhân và một phép cộng. Backward: gấp đôi forward, vì backward pass của Chương 5 tính hai gradient ở mỗi lớp — theo đầu vào của lớp, để tín hiệu tiếp tục đi, và theo trọng số của nó — mỗi cái là một phép nhân ma trận cùng kích thước với forward, nên .
Đó là toàn bộ suy luận, và đáng kiểm tra thay vì tin. PyTorch có sẵn một bộ đếm FLOP thật, torch.utils.flop_counter.FlopCounterMode, chặn mọi phép toán mà một mô hình dispatch và cộng tổng công việc thực tế. Chạy nó qua bốn bậc độ lớn, mô hình lớn nhất trên thiết bị meta, thiết bị chỉ cấp phát shape chứ không cấp phát bộ nhớ:
from torch.utils.flop_counter import FlopCounterMode
counter = FlopCounterMode(display=False)
with counter:
loss = model(x, targets)[1]
loss.backward()
measured = counter.get_total_flops()
print(measured / (6 * n_params * n_tokens))| cấu hình | không tính embeddings | tổng | đo được, fwd+bwd | ÷ (tổng ) | ÷ (không emb.) | fwd+bwd ÷ fwd |
|---|---|---|---|---|---|---|
| 128, 4 layers, 256 | 788,736 | 7,254,400 | 4.60e10 | 1.031 | 9.485 | 3.000 |
| 512, 8 layers, 256 | 25,183,232 | 51,045,888 | 3.26e11 | 1.038 | 2.104 | 3.000 |
| 768, 12 layers, 1024 | 84,973,056 | 124,356,864 | 1.75e12 | 1.145 | 1.676 | 3.000 |
| 1600, 48 layers, 1024 | 1,474,870,400 | 1,556,920,000 | 2.10e13 | 1.100 | 1.161 | 3.000 |
| 4096, 32 layers, 2048 | 6,442,983,424 | 6,582,444,032 | 8.74e13 | 1.080 | 1.104 | 3.000 |
| 8192, 80 layers, 8192 | 64,427,147,264 | 65,544,929,280 | 3.75e15 | 1.163 | 1.183 | 3.000 |
Tỷ lệ forward+backward trên forward là 3.000, chính xác, ở mọi quy mô: không phải một xấp xỉ tình cờ tốt, mà là đồng nhất thức số học ở trên được trả lại thành một số tròn bởi một bộ đếm không biết gì về phép suy luận.
Tổng đo được sau đó nằm cao hơn từ 3 % đến 17 % so với , khi tính cả các ma trận embedding — và mệnh đề đó quan trọng, vì hai bài báo nền tảng đếm khác nhau. Kaplan loại trừ "all vocabulary and positional embeddings" vì làm vậy "produces significantly cleaner scaling laws" (§1.3); Phụ lục F của Chinchilla nói "we also count embeddings matrices in the total parameter count".2 Với vocabulary rộng và hidden dimension hẹp, hai cách khác nhau gấp chín lần, như hàng đầu tiên cho thấy.
Khoảng chênh còn lại là thứ cố ý bỏ qua: các điểm attention. Phương trình (2.2) của Kaplan viết chi phí forward là và bỏ hạng thứ hai vì — an toàn năm 2020, kém an toàn hơn bây giờ, và là lý do tỷ lệ trôi lên khi tăng — đó là lý do hai hàng ở đây có cùng là 1.024 và tỷ lệ giảm, từ 1.145 xuống 1.100, khi đi từ 768 lên 1.600. Đó là chi phí mà Chương 9 đã giới thiệu và Chương 16 biến thành một mức giá.
Bộ nhớ: thứ thực sự phải vừa
Liên kết đến mục: Bộ nhớ: thứ thực sự phải vừaCompute quyết định một lượt chạy mất bao lâu; bộ nhớ quyết định nó có khởi động được không. Huấn luyện bằng fp32 AdamW thường và mỗi tham số mang bốn con số: trọng số, gradient của nó, mean chạy và variance của Adam — hai trung bình đã tự xây trong Chương 6. Bốn số, mỗi số bốn byte, là 16 byte cho mỗi tham số, trước cả một activation. Đo trên GPU laptop 8 GB, lấy lượng cấp phát resident tại điểm trong step khi không còn graph nào sống:
| mô hình | vocabulary | batch | dự đoán | resident đo được | đỉnh trong một step | phần chênh | |
|---|---|---|---|---|---|---|---|
| 512, 8 layers | 50,257 | 8 | 51,045,888 | 779 MB | 801 MB | 2,500 MB | 1,699 MB |
| 512, 8 layers | 4,096 | 8 | 27,411,456 | 418 MB | 426 MB | 1,043 MB | 617 MB |
| 256, 6 layers | 4,096 | 8 | 5,839,360 | 89 MB | 89 MB | 382 MB | 293 MB |
| 256, 6 layers | 4,096 | 32 | 5,839,360 | 89 MB | 89 MB | 1,259 MB | 1,170 MB |
| 256, 6 layers | 4,096 | 128 | 5,839,360 | 89 MB | 89 MB | 4,771 MB | 4,681 MB |
Dự đoán và đo đạc khớp trong phạm vi 3 %. Điều bất ngờ là cột cuối: activation lấn át mô hình. Cùng mô hình 5,8 triệu tham số cần 89 MB trạng thái bền vững nhưng cần 4.681 MB activation ở batch 128 — gấp năm mươi hai lần mô hình — và phần lớn không phải transformer. Đó là logits, một vector kích thước vocabulary cho mỗi token, mỗi mục bốn byte: 512 MB ở hàng cuối, 393 MB ở hàng đầu. Kích thước vocabulary đã được chọn ở Chương 7, và nó vẫn quyết định thứ gì vừa trên card.
Hạng nào chiếm ưu thế phụ thuộc vào hình dạng lượt chạy, vì vậy Micikevicius và cộng sự nói bộ nhớ "is dominated by activations"3 trong khi ZeRO nói một mô hình 1,5 tỷ tham số cần "at least 24 GB" chỉ cho các trạng thái mô hình.4 ZeRO đi đến cùng 16 byte bằng một đường khác — cho trọng số fp16, cho gradient fp16, mỗi cho trọng số master fp32 và hai moment của Adam — với 70 tỷ tham số là 1,12 terabyte, tương đương mười bốn GPU 80 GB trước cả một activation.
Parallelism, trong một đoạn và một lần ủy thác
Liên kết đến mục: Parallelism, trong một đoạn và một lần ủy thácỞ quy mô frontier, không thứ nào ở trên vừa trên một thiết bị, nên lượt chạy được tách theo bốn cách cùng lúc. Data parallelism đặt một bản sao mô hình trên mọi GPU và lấy trung bình gradient — mặc định, và là thứ ZeRO cải thiện bằng cách từ chối giữ các bản sao dư thừa của trạng thái bộ tối ưu. Tensor parallelism tách từng ma trận qua các thiết bị. Pipeline parallelism giao cho mỗi thiết bị một nhóm lớp liền nhau. Context parallelism tách chính chuỗi, chỉ cần khi đủ dài để hạng attention chiếm ưu thế. Bảng 4 của Llama 3 liệt kê cả bốn cùng lúc: tensor 8, context tới 16, pipeline 16, data tới 128, trên 16.384 GPU H100.5 Khóa học này chỉ nói đến vậy; kỹ thuật huấn luyện phân tán là cả một học kỳ riêng, và CS336 của Stanford chính là học kỳ đó, bài giảng 5 đến 8, kèm code.6 Thứ còn lại sau lần ủy thác là một con số duy nhất, model FLOPs utilisation — phần tỷ lệ số học đỉnh của GPU mà một lượt chạy thật đạt được — chính là thứ biến gọn gàng thành thời gian thực và vì vậy thành tiền.
Kaplan, và ván cược của ngành
Liên kết đến mục: Kaplan, và ván cược của ngànhTháng 1 năm 2020, Kaplan và cộng sự huấn luyện một lưới transformer và thấy test loss tuân theo power law theo từng một trong ba tài nguyên qua hơn sáu bậc độ lớn.1 §1.2 của họ đưa ra ba luật đã fit:
kèm theo cho dữ liệu và cho compute được phân bổ tối ưu. Các hằng số không phổ quát, và bài báo nói rõ: "the precise numerical values of , and depend on the vocabulary size and tokenization and hence do not have a fundamental meaning."
Các số mũ rất nhỏ: gấp mười lần tham số mua được một hệ số giảm khỏi phần loss còn lại. Nghe như chẳng là gì, và đó là sự thật quan trọng nhất ở đây — lợi suất rất tệ và không bao giờ dừng. Một power law với số mũ nhỏ hứa rằng bậc độ lớn tiếp theo sẽ giúp, ít hơn bậc trước, mãi mãi. Mua compute không còn là canh bạc mà trở thành một khoản mua với tỷ giá công bố, chính là lập luận đã mở khóa vốn.
Rồi đến chỉ định, và đây là nơi bài báo sai theo cách khiến ngành tốn rất nhiều tiền. Bảng 6 của Kaplan cho và : gấp mười lần compute nghĩa là mô hình lớn hơn 5,4 lần nhưng chỉ ăn nhiều văn bản hơn 1,9 lần. Tóm tắt nói rõ — "optimally compute-efficient training involves training very large models on a relatively modest amount of data and stopping significantly before convergence." Lĩnh vực đã làm đúng như vậy: GPT-3 là 175 tỷ tham số trên 300 tỷ token,7 Gopher 280 tỷ trên 300 tỷ, Megatron-Turing NLG 530 tỷ trên 270 tỷ.2 Nửa token đến hai token cho mỗi tham số, trên toàn bộ.
Chinchilla, và sweep ở trên đang đo gì
Liên kết đến mục: Chinchilla, và sweep ở trên đang đo gìTháng 3 năm 2022, Hoffmann và cộng sự huấn luyện hơn 400 mô hình từ 70 triệu đến 16 tỷ tham số và đi đến kết luận ngược lại bằng ba con đường độc lập.2 Bảng 2 của họ báo cáo số mũ trong là 0.50, 0.49 và 0.46, so với 0.73 của Kaplan. Nói đơn giản: kích thước mô hình và dữ liệu huấn luyện nên tăng theo tỷ lệ bằng nhau.
Cách tiếp cận thứ hai của họ là thứ sweep ở đầu chương này tái hiện, ở quy mô bằng một phần triệu: cố định ngân sách, huấn luyện nhiều kích thước đúng ngân sách đó, vẽ final loss theo kích thước mô hình.
| tham số | |||
|---|---|---|---|
| 98,624 | 5.3531 (171) | 4.8638 (542) | — |
| 150,320 | 5.4636 (74) | — | — |
| 194,208 | 5.5041 (44) | 4.8730 (140) | 4.4040 (442) |
| 295,808 | 5.5550 (19) | 4.9029 (60) | 4.3383 (190) |
| 665,280 | 5.7849 (3.8) | 5.1254 (12) | 4.4192 (38) |
| 1,280,768 | 5.8174 (1.0) | 5.1751 (3.2) | 4.5003 (10) |
| 3,101,568 | — | 5.4686 (0.5) | 4.7768 (1.7) |
| 5,315,072 | — | 5.5894 (0.2) | 4.8514 (0.6) |
| 15,053,568 | — | — | 5.3534 (0.1) |
Held-out loss tính bằng nat trên mỗi token, token trên mỗi tham số trong ngoặc, in đậm cho mô hình tốt nhất ở mỗi ngân sách; dấu gạch là điểm không chạy, vì ngân sách đòi nhiều văn bản hơn corpus có hoặc kích thước nằm ngoài các giá trị được sweep ở đó.
Đọc xuống một cột: loss giảm, chạm đáy rồi tăng lại. Một mô hình có thể quá lớn so với ngân sách dễ như quá nhỏ — tại , hình phạt khi chọn 665.280 tham số thay vì 295.808 là 0,08 nat, trên đường bao đã fit ở trên tương đương loss mà một mô hình đúng cỡ đạt với ít compute hơn 18 %. Chọn sai shape ném đi một phần năm ngân sách. Đó là Hình 3 của Chinchilla trong một buổi chiều trên một GPU thay vì bốn trăm mô hình.
Bây giờ đọc ngang. Ở , mô hình tốt nhất là mô hình nhỏ nhất được sweep; ở , đó là 295.808 tham số, được kẹp hai bên. Điểm tối ưu dịch sang phải khi ngân sách tăng, và đó là toàn bộ nội dung của hiệu chỉnh. Fit cách tiếp cận thứ ba của bài báo — bề mặt trên mọi lượt chạy — rồi tối thiểu hóa với ràng buộc :
L(N, D) = 24.7 / N^0.195 + 46.8 / D^0.169 (E fits to ~0; see below)
implied N_opt ∝ C^0.464
compare Chinchilla 0.46-0.50 · Besiroglu 0.513 · Kaplan 0.730,46, từ một laptop, so với 0,73 của Kaplan. Khớp đến ba chữ số từ một fit ba ngân sách là may mắn; khớp chữ số đầu thì không. Số mũ di chuyển — hằng số thì không, vì tỷ lệ token-trên-tham-số tại các điểm tối ưu này là 170 đến 540, không phải 20. Ba lý do, đều đáng học. fit về không vì ở loss trên 4 nat, lượt chạy còn rất xa sàn entropy chi phối fit của Chinchilla. Batch size và learning rate được giữ cố định thay vì tinh chỉnh theo từng điểm, gây bất lợi cho các lượt chạy có ít step nhất — và đó là các mô hình lớn: tại FLOP, mô hình 1,28 triệu tham số chỉ có tổng cộng 159 step bộ tối ưu, thấp hơn rất xa vài nghìn step mà hạng của Kaplan nói mọi mô hình đều cần. Một scaling law được fit bên trong một chế độ, và chế độ này nằm thấp hơn Chinchilla sáu bậc độ lớn.
Vì thế tóm tắt của bài báo: "current large language models are significantly undertrained". Chinchilla là minh chứng — 70 tỷ tham số trên 1,4 nghìn tỷ token, cùng tổng compute như Gopher 280 tỷ trên 300 tỷ, vượt nó ở 51 trong 57 tác vụ MMLU, 67,5 % so với 60 %.2 Nhỏ hơn bốn lần, nhiều văn bản hơn bốn lần rưỡi, cùng tiền, mô hình tốt hơn.
Hai lưu ý về tỷ lệ nổi tiếng đó. "Hai mươi token cho mỗi tham số" không phải một câu trong bài báo; bài chỉ nói rằng "for every doubling of model size the number of training tokens should also be doubled"; con số 20 là suy luận từ Bảng 3 và từ chính Chinchilla 70 B trên 1,4 T. Và độ chính xác của nó kém hơn công bố: Besiroglu và cộng sự fit lại từ bản số hóa Hình 4, thấy các tham số gốc "fit the reconstructed data poorly" với khoảng "implausibly tight given the number of data points", và đặt khoảng trung thực là "between 4 and 40" token cho mỗi tham số.8
Một chi tiết trong phương pháp của Chinchilla thực hiện lời hứa mà Chương 1 đã nói về lịch learning-rate. Cosine schedule phải khớp với ngân sách token. Một mô hình sẽ thấy 10 triệu token phải giảm learning rate về không tại 10 triệu token; đưa cho nó schedule cỡ 100 triệu, dừng sớm, và bạn đang đọc loss giữa lúc giảm với rate quá cao. Chinchilla huấn luyện mỗi mô hình ở bốn độ dài chu kỳ để kiểm soát đúng điều này; sweep ở trên đặt schedule từ ngân sách vì cùng lý do.
Scaling laws không hứa điều gì
Liên kết đến mục: Scaling laws không hứa điều gìChúng là kết quả thực nghiệm hữu ích nhất trong lĩnh vực và thường xuyên bị bán quá lời. Bốn giới hạn.
Chúng dự đoán loss, không dự đoán năng lực. Vế trái là cross-entropy trên văn bản held-out. Không có gì trong các bài báo này cho phép tuyên bố liệu một mô hình sẽ viết SQL đúng, từ chối yêu cầu có hại hay dùng tool. Đây lại là bài học của Chương 5: một dự đoán về loss không phải dự đoán về hành vi bạn đang trả tiền để có.
Chúng được fit, không được suy ra. Không có lý thuyết nào tạo ra . Các hằng số dịch chuyển theo tokenizer — đó là lý do so sánh perplexity giữa hai tokenizer là vô nghĩa, như Chương 8 đã giải thích — và theo hỗn hợp dữ liệu, kiến trúc và bộ tối ưu. Mọi luật đã công bố là luật của thiết lập đã tạo ra nó, đó là lý do Meta tự fit lại trước Llama 3.5
Chúng giả định mỗi step có một token mới, tức ngầm giả định corpus vô hạn. Muennighoff và cộng sự đo điều gì xảy ra khi nó cạn: tới bốn epoch dữ liệu lặp lại gần như không tốn gì — một mô hình 8,7 tỷ tham số trên 44 tỷ token duy nhất, thấy bốn lần, kết thúc với "only 0.5 % higher validation loss" so với cùng mô hình trên 178 tỷ token duy nhất — trong khi sau khoảng mười sáu epoch, compute bổ sung không mua được gì.9
Và không ai còn huấn luyện compute-optimal nữa. Chinchilla tối thiểu hóa chi phí huấn luyện; một mô hình triển khai sau đó trả xấp xỉ FLOP cho mỗi token sinh ra, mãi mãi. LLaMA 1 nói thẳng: "given a target level of performance, the preferred model is not the fastest to train but the fastest at inference".10 Sardana và cộng sự hình thức hóa bằng cách tối thiểu hóa thay vào đó, và thấy bất kỳ ai kỳ vọng một tỷ request nên huấn luyện "smaller and longer than Chinchilla-optimal".11 §9.1 của Llama 3 đồng ý: các mô hình nhỏ của họ huấn luyện "far beyond the point of compute optimal training, effectively trading training compute for inference efficiency".5 Tỷ lệ không lỗi thời; nó trả lời một câu hỏi không còn là câu đang được hỏi.
Emergent abilities, và tranh luận liệu chúng có thật không
Liên kết đến mục: Emergent abilities, và tranh luận liệu chúng có thật khôngLoss giảm mượt. Điểm benchmark đôi khi không. Wei và cộng sự gom các trường hợp một tác vụ nằm ở mức đoán mò qua nhiều bậc độ lớn compute huấn luyện rồi nhảy vọt — số học ba chữ số xuất hiện trong GPT-3 ở khoảng FLOP, MMLU tăng vượt đoán mò giữa và — và đặt tên cho mẫu này: "an ability is emergent if it is not present in smaller models but is present in larger models".12 Nếu đó là một thuộc tính thật, ngoại suy từ thí nghiệm rẻ là không an toàn, vì năng lực bạn đang mua có thể không tồn tại ở bất kỳ quy mô nào bạn đủ tiền kiểm thử.
Schaeffer, Miranda và Koyejo lập luận rằng phần lớn điều đó là hiện vật của đo lường, và cơ chế là số học.13 Per-token loss giảm mượt, nên xác suất một token đúng, , cải thiện dần. Chấm mô hình bằng exact string match trên một câu trả lời -token và bạn nâng xác suất đó lên lũy thừa — một đường cong mượt nâng lên lũy thừa lớn trông như vách đá. Đổi sang metric đếm token thay vì đòi tất cả chúng đúng, trên cùng output, và "the family's performance smoothly, continuously and predictably improves with increasing scale".
Con số cần nhớ trong kiểm toán của họ là — "of the 39 preferred metrics in BIG-Bench, at most 5 display emergence", với hai metric gián đoạn chiếm hơn 92 % các trường hợp được tuyên bố — và cả cảnh báo của họ: "nothing in this paper should be interpreted as claiming that large language models cannot display emergent abilities". Một cú nhảy trên biểu đồ là bằng chứng về metric cho đến khi chứng minh khác đi. Chương 29 là nơi điều đó trở thành vấn đề của bạn, vì chọn một metric ngưỡng cứng là quyết định bạn sẽ đưa ra mà không nhận ra.
Dữ liệu đến từ đâu
Liên kết đến mục: Dữ liệu đến từ đâuCorpus là phần của một lượt pretraining không có phương trình đi kèm, và là nơi có phần lớn các quyết định hệ trọng. Nguyên liệu thô là một web crawl: kho lưu trữ tháng 8 năm 2026 của Common Crawl có "2.14 billion web pages or 360 TiB of uncompressed content", một tháng dữ liệu, tải miễn phí.14 Hầu như không thứ gì dùng được nguyên trạng. Bài báo T5 nói crawl "largely comprises gibberish or boiler-plate text like menus, error messages, or duplicate text", và pipeline C4 mà nó giới thiệu là một danh sách heuristic thô — chỉ giữ các dòng kết thúc bằng dấu câu cuối câu, bỏ trang có ít hơn ba câu, bỏ bất kỳ trang nào chứa ngoặc nhọn hoặc một từ trong danh sách công khai các từ tục — biến hai mươi terabyte văn bản hằng tháng thành khoảng 750 GB.15
Thô là đúng từ. Dodge và cộng sự kiểm toán thứ các bộ lọc đó loại bỏ và thấy blocklist từ tục xóa 42 % tài liệu bằng African-American English và 32 % bằng Hispanic-aligned English, so với 6,2 % của White-aligned English, để lại corpus 97,8 % thuộc loại cuối.16 Một quy tắc tưởng không có quan điểm về phương ngữ lại có một quan điểm.
Rồi đến deduplication, không phải dọn dẹp: Lee và cộng sự tìm thấy một câu 61 từ lặp lại 61.036 lần trong C4, và cho thấy deduplication cắt tỷ lệ mô hình "emit memorized text" mười lần, từ 1,9 % token được sinh xuống 0,19 %.17 Tuy vậy, nhiều hơn không phải tốt hơn — nhóm FineWeb deduplicate toàn cục trên 96 crawl, được 4 nghìn tỷ token và không có cải thiện đo được, rồi deduplicate từng crawl riêng, được 20 nghìn tỷ, và khớp corpus tốt nhất hiện có.18
Rồi đến contamination. Llama 3 tự đo và công bố: 98 % AGIEval, 95 % BIG-Bench Hard và 85 % HellaSwag chồng lấp với tập huấn luyện theo 8-gram, và với MMLU, độ chồng lấp cao đến mức "it is impossible to get a good performance gain estimate".5 §4 của GPT-3 báo cáo một lỗi lọc khiến benchmark còn trong dữ liệu mà không có đường quay lại: "because of cost considerations it was infeasible to retrain the model".7
Provenance là phần chưa được giải quyết. The Pile phát hành một thành phần 100,96 GiB tên Books3 — 12 % corpus và, theo bảng đồng ý của chính bài báo, là sách từ một private torrent tracker;19 nó bị đưa offline tháng 8 năm 2023 sau một khiếu nại bản quyền. Tình thế pháp lý tính đến tháng 9 năm 2026 vẫn chưa ngã ngũ, và ba phán quyết của Mỹ được viện dẫn như một xu hướng lại bất đồng với nhau. Alsup thấy việc huấn luyện trên sách được thu nhận hợp pháp là "exceedingly transformative" trong khi cho rằng một thư viện xây từ bản sao lậu thì không, và Anthropic dàn xếp nửa đó với $1.5 billion bao phủ 482.460 tác phẩm, khoảng $3.000 mỗi tác phẩm, được phê chuẩn ngày 20 tháng 7 năm 2026.20 Chhabria cho Meta thắng summary judgment nhưng viết rằng phán quyết của ông "does not stand for the proposition that Meta's use of copyrighted materials to train its language models is lawful", chỉ là "these plaintiffs made the wrong arguments".21 Bibas, khi xử bất lợi cho Ross Intelligence, lưu ý rằng "only non-generative AI is before me today".22 Chưa tòa phúc thẩm Mỹ nào phán quyết về câu hỏi này.
Con người làm những phần mà loss không làm được. TIME đưa tin tháng 1 năm 2023 rằng công nhân gán nhãn văn bản độc hại cho OpenAI qua công ty Sama mang về "between around $1.32 and $2 per hour" khi đọc các đoạn mô tả lạm dụng tình dục trẻ em, tra tấn và tự hại, trong khi OpenAI trả Sama $12.50 mỗi giờ cho công việc; Sama phản bác cả khoảng lương và quota.23 Đó là lọc quanh pretraining chứ không phải bản thân pretraining — nhưng nằm trên cùng hóa đơn, và là nơi có một con người ngồi.
Điện là thật và thường bị trích sai. Con số công bố cẩn thận nhất là của BLOOM: 1.082.990 GPU-giờ, 433 MWh và 24,7 tấn CO₂ tương đương cho lượt chạy, 50,5 nếu tính sản xuất và node nhàn rỗi;24 Patterson và cộng sự đặt GPT-3 ở 1.287 MWh và 552 tấn.25 Hai cảnh báo. Lợi thế của BLOOM là lưới điện hạt nhân Pháp ở 57 g CO₂ mỗi kWh chứ không phải hiệu suất — nó dùng nhiều năng lượng hơn OPT-175B. Và con số phát thải được trích nhiều nhất trong lĩnh vực, 626.155 lb của Strubell và cộng sự cho neural architecture search, sau đó được chứng minh là cao hơn 88 lần, vì đã giả định search chạy ở kích thước mô hình đầy đủ trong khi nó chạy trên proxy.26 Cách đóng khung của LBNL là cách có thể bảo vệ: datacentre Mỹ dùng 192 TWh năm 2024, 4,7 % điện quốc gia — một con số gắn với một ngành, không gắn với một lượt chạy riêng.27
Sợi chỉ xuyên suốt là thứ Bender và cộng sự gọi là documentation debt: "putting ourselves in a situation where the datasets are both undocumented and too large to document post hoc".28 Mọi sự thật ở trên tồn tại vì có ai đó đã nhìn. Với corpus phía sau các mô hình hầu hết mọi người dùng, không ai có thể.
Thực sự tốn bao nhiêu
Liên kết đến mục: Thực sự tốn bao nhiêuBây giờ là phép số học mà ai cũng muốn, từ bốn đầu vào được trích dẫn, để khi chúng lỗi thời thì rõ phải thay cái nào.
Peak throughput
Liên kết đến mục: Peak throughputTrang H100 của NVIDIA liệt kê 1.979 teraFLOPS throughput tensor-core BF16 dưới một chú thích "with sparsity".29 Không lượt pretraining nào dùng structured sparsity, nên con số dense bằng một nửa: 989,5 TFLOP/s.
Utilisation
Liên kết đến mục: UtilisationBảng 4 của Llama 3 báo cáo 38–43 % BF16 model FLOPs utilisation. Lấy 40 %: 395,8 TFLOP/s số học hữu ích mỗi GPU.5
Giá on-demand của Lambda cho một node 8×H100 SXM, truy cập 2026-09-06: $3.99 mỗi GPU-giờ, tức $31.92 một giờ cho node.30
Tỷ lệ của Chinchilla, , cho và do đó .
| ngân sách | H100-giờ | FLOP | tham số compute-optimal | token | trên một node 8×H100 | GPU để xong trong 90 ngày |
|---|---|---|---|---|---|---|
| $100 | 25 | 3.6e19 | 546 M | 10.9 B | 3.1 h | 1 |
| $1,000 | 251 | 3.6e20 | 1.73 B | 34.5 B | 31.3 h | 1 |
| $10,000 | 2,506 | 3.6e21 | 5.46 B | 109 B | 13 days | 2 |
| $100,000 | 25,063 | 3.6e22 | 17.3 B | 345 B | 131 days | 12 |
| $1,000,000 | 250,627 | 3.6e23 | 54.6 B | 1.09 T | 4 years | 116 |
| $10,000,000 | 2,506,266 | 3.6e24 | 173 B | 3.45 T | 36 years | 1,160 |
| $100,000,000 | 25,062,657 | 3.6e25 | 546 B | 10.9 T | 358 years | 11,603 |
Đọc hai cột cuối cùng cùng nhau. Với $10.000, bạn có một mô hình 5 tỷ tham số trên một node thuê trong hai tuần. Với $100.000.000, số học nói 546 tỷ tham số — và mười hai nghìn H100 nối dây với nhau trong ba tháng, thứ không thể thuê bằng thẻ tín dụng. Sau khoảng $100.000, ràng buộc chặt không còn là tiền mà là cluster.
Trước khi tin một bảng như vậy, kiểm nó với các lượt chạy có chi phí thật được công bố — llm.c tái lập GPT-2 124M trong "~90 minutes" trên một node 8×A100 "for about $20", và GPT-2 1.6B trong 24 giờ trên một node 8×H100 với $672.31
$672, against what $672 actually bought (llm.c GPT-2 1.6B, one 8xH100 node, 24 h)
this table predicts: 168 H100-hours N = 1.41 B params D = 28.3 B tokens
what was actually run: 192 H100-hours N = 1.558 B params D = 33.6 B tokens
Llama 3 405B, against Meta's own published GPU-hours
from the paper's 3.8e25 FLOPs at 40 % MFU: 26.67 M H100-hours
published in Meta's Llama 3.1 model card: 30.84 M H100-hours ratio 0.86Cả hai đều trong khoảng 15 %, gần mức chính xác mà loại ước tính này xứng đáng có và tốt hơn đáng kể so với độ chính xác mà nó thường được trích dẫn.
So sánh headline, với cả hai định nghĩa trên bàn
Liên kết đến mục: So sánh headline, với cả hai định nghĩa trên bànCon số được lặp lại nhiều nhất trong chủ đề này là một mô hình cỡ GPT-2 tốn khoảng $43.000 năm 2019 có thể được tái lập hôm nay với vài chục đô. Nửa hiện đại được ghi chép tốt; nửa lịch sử thì không.
Hôm nay. README nanochat của Karpathy: "you can train your own GPT-2 capability LLM ... for only $48 (~2 hours of 8XH100 GPU node) ... On a spot instance, the total cost can be closer to ~$15."32 "GPT-2 capability" ở đây chính xác và được công bố — vượt CORE score 0.256525 của GPT-2 — trên leaderboard có mục tốt nhất tính đến 14 tháng 3 năm 2026 là 1,65 giờ. Con số $48 giả định $3 mỗi GPU-giờ, thấp hơn giá niêm yết $3,99 của Lambda; theo giá niêm yết, nó gần $64 hơn.
Năm 2019. Không có nguồn sơ cấp: OpenAI chưa bao giờ công bố thời lượng hay chi phí. Chuỗi dẫn chạy qua The Register, tháng 2 năm 2019, báo cáo "256 Google TPU3 cores" mà không có giá hay thời lượng; rồi Synced, tháng 6 năm 2019, ghi rằng phần cứng tốn $256 một giờ trên Google Cloud và nói rõ rằng "OpenAI didn't specify the training duration". $43.008 là $256 một giờ nhân với 168 giờ giả định mà chưa ai từng truy nguồn.
Vì vậy headline trung thực là: một mô hình khớp điểm benchmark đã công bố của GPT-2 có thể được huấn luyện hôm nay với thấp hơn nhiều $100 trên phần cứng thuê, so với chi phí năm 2019 chưa từng được công bố và ước tính nổi tiếng của nó dựa trên một phỏng đoán không có nguồn về thời lượng. Sự sụp đổ chi phí là thật và nửa hiện đại có thể được bất kỳ ai có thẻ tín dụng tái lập; tỷ lệ là số học trên một con số không tồn tại. Đó là trạng thái của chi phí huấn luyện được công bố nói chung. Bài GPT-3 không chứa số tiền đô nào, chỉ có FLOP trong Bảng D.1;7 bài Llama 3 cũng không có.5 Mọi chi phí huấn luyện bạn đã đọc là một ước tính từ số FLOP, một giả định phần cứng và một giả định giá — luôn đáng hỏi là của ai.
Base model biết gì, và nó ngừng biết khi nào
Liên kết đến mục: Base model biết gì, và nó ngừng biết khi nàoThứ thu được đã thấy một corpus cố định được lắp ráp tại một thời điểm cố định, và hai thuộc tính theo sau.
Thứ nhất là knowledge cutoff. Sau ngày thu thập, mô hình không biết gì — không phải "không chắc", mà là không gì cả — và nó sẽ bịa trơn tru thay vì nói vậy, vì nói vậy chưa bao giờ là một hành vi nó được huấn luyện. Model card của Llama 3.1 ghi tháng 12 năm 2023;33 mọi mô hình đều có một mốc, và đó là thuộc tính của dữ liệu huấn luyện, không phải deployment. Lách quanh nó là một bài toán retrieval, thuộc Chương 19.
Thứ hai là base model hoàn tất thay vì trả lời. Đưa cho nó "Thủ đô của Pháp là gì?" và một tiếp diễn hợp lý là một câu hỏi khác, vì trong corpus chuỗi đó thường xuất hiện trong danh sách bài tập.
Đi tiếp đến đâu
Liên kết đến mục: Đi tiếp đến đâuMột trình hoàn tất văn bản không phải assistant. Nó không làm theo chỉ dẫn, vì không có gì trong corpus nói rằng một yêu cầu nên được tuân theo thay vì được tiếp tục. Nó không có khái niệm về một cuộc trò chuyện với hai bên tham gia. Nó sẽ vui vẻ tạo tiếp diễn xác suất cao nhất của một prompt có hại, vì xác suất là thứ duy nhất nó từng được tối ưu hóa cho.
Biến nó thành thứ trả lời cần một giai đoạn thứ hai tốn một phần rất nhỏ của một phần trăm giai đoạn đầu, và gần như hoàn toàn gồm việc cho nó xem ví dụ về hành vi bạn muốn rồi so sánh từng cặp output của chính nó. Giai đoạn đó là nơi instruction following, chat templates, refusal và — điều này làm nhiều người ngạc nhiên — khả năng gọi một tool xuất hiện. Chương 11 là giai đoạn đó: supervised fine-tuning, RLHF, DPO và GRPO, và câu hỏi "aligned" nghĩa là gì và ai quyết định.
Nguồn và phương pháp
Liên kết đến mục: Nguồn và phương phápCũng đáng đọc song song với chương này: build-nanogpt của Karpathy và video đi kèm, đi qua một bản tái lập GPT-2 đầy đủ từ đầu đến cuối ở nhịp độ chương này không thể; và Stanford CS324, Large Language Models, có các bài giảng về dữ liệu và tác động môi trường đi sâu hơn phần trên vào chất liệu mà khóa học này chỉ xử lý một lần rồi ủy thác.
Tài liệu tham khảo
Liên kết đến mục: Tài liệu tham khảo-
Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J. and Amodei, D. Scaling Laws for Neural Language Models. arXiv:2001.08361 (2020). Ba power law là Eqs. (1.1)–(1.3) trong §1.2 và đầy đủ hằng số ở Phụ lục A, Bảng 5; suy luận là §2.1; số mũ phân bổ compute ở Bảng 6. Lưu ý có hai luật compute, ở batch size cố định và ở batch size tối ưu; bài báo nói cái sau "should be used to make predictions". ↩ ↩2
-
Hoffmann, J., Borgeaud, S., Mensch, A., Buchatskaya, E., Cai, T., Rutherford, E. et al. Training Compute-Optimal Large Language Models. arXiv:2203.15556 (2022). Số mũ ở Bảng 2, ngân sách dự phóng ở Bảng 3, so sánh Gopher trong §4, quy ước đếm tham số ở Phụ lục F. Phần văn xuôi dưới Bảng 3 không khớp với chính Bảng 3 ở các hàng 175 B và 280 B; bảng là phiên bản nên trích. ↩ ↩2 ↩3 ↩4
-
Micikevicius, P., Narang, S., Alben, J., Diamos, G., Elsen, E., Garcia, D. et al. Mixed Precision Training. arXiv:1710.03740 (2017), ICLR 2018. Trọng số master FP32 ở §3.1, loss scaling ở §3.2. ↩ ↩2
-
Rajbhandari, S., Rajbhandari, S., Ruwase, O. and He, Y. ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054 (2019), SC20. Kế toán là §3.1; các con số trạng thái còn lại cho activations là §3.2. ↩
-
Grattafiori, A. et al. (Llama Team, AI @ Meta). The Llama 3 Herd of Models. arXiv:2407.21783 (2024). Ngân sách compute và số token trong §1, scaling law fit lại trong §3.2.1, cấu hình parallelism và MFU ở Bảng 4, phân tích contamination trong §5.1.4, phát biểu over-training trong §9.1. Bài báo không có số đô la và không có bảng phát thải. ↩ ↩2 ↩3 ↩4 ↩5 ↩6
-
Stanford CS336, Language Modeling from Scratch. Bài giảng 2 bao phủ kế toán tài nguyên, bài giảng 5–8 GPU, kernel và parallelism, bài giảng 9 và 11 scaling, bài giảng 13–14 dữ liệu. Đây là khóa học mà chương này ủy thác phần kỹ thuật cho, và nó công khai. ↩
-
Brown, T. B. et al. Language Models are Few-Shot Learners. arXiv:2005.14165 (2020). Compute trong Phụ lục D, Bảng D.1 — có một cột đúng nghĩa tên "flops per param per token", giá trị cho mọi hàng GPT-3 là 6. Phân tích contamination trong §4. ↩ ↩2 ↩3
-
Besiroglu, T., Erdil, E., Barnett, M. and You, J. Chinchilla Scaling: A replication attempt. arXiv:2404.10102 (2024). Tái dựng dữ liệu của Chinchilla bằng cách số hóa Hình 4, fit lại, và báo cáo các số mũ đã hiệu chỉnh cùng khoảng rộng hơn nhiều. ↩
-
Muennighoff, N., Rush, A. M., Barak, B., Le Scao, T., Piktus, A., Tazi, N., Pyysalo, S., Wolf, T. and Raffel, C. Scaling Data-Constrained Language Models. arXiv:2305.16264 (2023), NeurIPS 2023. Kết quả bốn epoch ở §6; half-life mười sáu epoch là đã fit. ↩
-
Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T. et al. LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 (2023). §1 nêu lập luận chi phí inference chống lại huấn luyện Chinchilla-optimal. ↩
-
Sardana, N., Portes, J., Doubov, S. and Frankle, J. Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws. arXiv:2401.00448 (2023), ICML 2024. §5 của họ cũng chứa đối trọng: mô hình huấn luyện ở tỷ lệ token cực đoan vẫn cải thiện, nhưng "more slowly than scaling laws predict". ↩
-
Wei, J., Tay, Y., Bommasani, R., Raffel, C., Zoph, B., Borgeaud, S. et al. Emergent Abilities of Large Language Models. arXiv:2206.07682 (2022), TMLR. Định nghĩa trong §2, ví dụ và ngưỡng compute trong §3–4 và Bảng 1. ↩
-
Schaeffer, R., Miranda, B. and Koyejo, S. Are Emergent Abilities of Large Language Models a Mirage? arXiv:2304.15004 (2023), bài xuất sắc NeurIPS 2023. Lập luận về metric ở §2, meta-analysis BIG-Bench ở §4, ví dụ thị giác được dựng ở §5. ↩
-
Common Crawl, August 2026 Crawl Archive Now Available (CC-MAIN-2026-34), xuất bản 24 August 2026, truy cập 2026-09-06. Trang chủ của chính nó tuyên bố "over 300 billion pages spanning 15 years", "totalling more than 10 petabytes" — một con số cho toàn bộ kho lưu trữ, không phải cho crawl hằng tháng được định giá ở đây. ↩
-
Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W. and Liu, P. J. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683 (2019), JMLR 21(140). Các bộ lọc C4 ở §2.2. Bài báo cho kích thước theo byte, không phải token; con số 156 tỷ token thường gán cho nó đến từ Dodge và cộng sự bên dưới. ↩
-
Dodge, J., Sap, M., Marasović, A., Agnew, W., Ilharco, G., Groeneveld, D., Mitchell, M. and Gardner, M. Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758 (2021), EMNLP 2021. Tỷ lệ loại bỏ phương ngữ ở §5.3; benchmark contamination trong C4 ở §4.2. ↩
-
Lee, K., Ippolito, D., Nystrom, A., Zhang, C., Eck, D., Callison-Burch, C. and Carlini, N. Deduplicating Training Data Makes Language Models Better. arXiv:2107.06499 (2021), ACL 2022. 61.036 lần lặp ở chú thích 1; các con số memorisation ở §6.2, Bảng 4, và là phần trăm token được sinh theo tiêu chí exact-match 50-token. ↩
-
Penedo, G., Kydlíček, H., Ben Allal, L., Lozhkov, A., Mitchell, M., Raffel, C., Von Werra, L. and Wolf, T. The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale. arXiv:2406.17557 (2024), NeurIPS 2024 Datasets and Benchmarks. Kết quả deduplication ở §3.4. Dataset phát hành từ đó đã tăng vượt 15 nghìn tỷ token trong bài. ↩
-
Gao, L., Biderman, S., Black, S. et al. The Pile: An 800GB Dataset of Diverse Text for Language Modeling. arXiv:2101.00027 (2020). Books3 ở §2.3 và Bảng 1; bảng đồng ý là Bảng 5. Corpus là 825,18 GiB, nên ngay cả tiêu đề cũng là làm tròn xuống. ↩
-
Bartz v. Anthropic, No. 4:24-cv-05417 (N.D. Cal.). Lệnh fair-use ngày 23 June 2025 (Dkt. 231); chứng nhận class ngày 17 July 2025; phê chuẩn cuối và phán quyết ngày 20 July 2026 (Dkt. 680). Dàn xếp chỉ giải phóng input quá khứ, không phải output và không phải hành vi tương lai. ↩
-
Kadrey v. Meta, No. 3:23-cv-03417-VC (N.D. Cal.), summary judgment 25 June 2025 (Dkt. 598). Lưu ý claim phân phối qua torrenting chưa được quyết định và vẫn còn hiệu lực. ↩
-
Thomson Reuters v. ROSS Intelligence, No. 1:20-cv-00613-SB (D. Del.), ý kiến sửa đổi 11 February 2025 (Dkt. 770), Bibas J. Đang kháng cáo interlocutory lên Third Circuit (No. 25-2153), tranh luận 11 June 2026, chưa có quyết định tại thời điểm viết. ↩
-
Perrigo, B. Exclusive: OpenAI Used Kenyan Workers on Less Than $2 Per Hour to Make ChatGPT Less Toxic. TIME, 18 January 2023. $2 là trần cho reviewer cấp cao đạt mọi mục tiêu; labeller cấp junior, chiếm đa số, mang về $1,32. Phản hồi của Sama, được trích trong cùng bài, cho $1,46–$3,74 và quota thấp hơn. ↩
-
Luccioni, A. S., Viguier, S. and Ligozat, A.-L. Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language Model. arXiv:2211.02001 (2022), JMLR 24(253). Bảng 1 và 3. ↩
-
Patterson, D., Gonzalez, J., Le, Q., Liang, C., Munguia, L.-M., Rothchild, D., So, D., Texier, M. and Dean, J. Carbon Emissions and Large Neural Network Training. arXiv:2104.10350 (2021). Con số của GPT-3 ở Bảng 4; hiệu chỉnh ước tính NAS ở §4.1. ↩
-
Strubell, E., Ganesh, A. and McCallum, A. Energy and Policy Considerations for Deep Learning in NLP. arXiv:1906.02243 (2019), ACL 2019. Đáng đọc chính xác vì điều đã xảy ra với con số được trích nhiều nhất của nó: bài báo cẩn thận, nêu rõ phép ngoại suy, và vẫn sai hai bậc độ lớn ở dòng duy nhất mọi người lặp lại. ↩
-
Smith, S. J., Hubbard, A., Newkirk, A., Ganeshalingam, M., Holecek, B., Sartor, D., Mills, M. and Shehabi, A. United States Data Center Energy Usage Report: 2025 Update. LBNL-2001758 (18 June 2026). Bản này chỉnh giảm chuỗi lịch sử so với báo cáo 2024 được trích rộng rãi; nếu bạn đang trích con số 176 TWh cho 2023, bạn đang trích phiên bản đã bị thay thế. ↩
-
Bender, E. M., Gebru, T., McMillan-Major, A. and Shmitchell, S. On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? FAccT '21, pp. 610–623. DOI 10.1145/3442188.3445922. "Documentation debt" ở §4.4. Lưu ý rằng các con số carbon của chính bài báo được trích từ Strubell và cộng sự và thừa hưởng hiệu chỉnh ở trên — đó là minh họa cho lập luận của nó hơn là phản bác. ↩
-
NVIDIA. NVIDIA H100 Tensor Core GPU product page,
nvidia.com/en-us/data-center/h100/(truy cập 2026-09-06). Mọi hàng tensor-core trên trang đó trừ FP64 đều có chú thích "with sparsity"; con số BF16 dense dùng ở đây bằng một nửa 1.979 TFLOPS đã công bố. ↩ -
Lambda. GPU Cloud pricing,
lambda.ai/pricing(truy cập 2026-09-06). On-demand, theo GPU mỗi giờ, trước thuế. Giá trong phần này sẽ lỗi thời nhanh hơn bất kỳ thứ gì khác trong khóa học; số học quanh chúng thì không. ↩ -
Karpathy, A.
karpathy/llm.c, thảo luận #481, Reproducing GPT-2 (124M) in llm.c in 90 minutes for $20 (28 May 2024), và thảo luận #677, Let's reproduce GPT-2 (1.6B): one 8XH100 node, 24 hours, $672, in llm.c (11 July 2024). ↩ -
Karpathy, A.
karpathy/nanochat, README và leaderboard "time to GPT-2" (truy cập 2026-09-06). Con số $48 và định nghĩa CORE-score của "GPT-2 capability" đều nằm trong README;speedrun.shcủa chính repository nói "approximately 1.5 hours", nên hãy xem con số hai giờ là làm tròn. ↩ -
Meta. Llama 3.1 model card,
models/llama3_1/MODEL_CARD.mdtrongmeta-llama/llama-models(truy cập 2026-09-06). Nguồn của 30,84 M H100-giờ cho mô hình 405 B, tổng 39,3 M, con số 11.390 tCO2eq theo địa điểm, và data cutoff tháng 12 năm 2023. ↩