Chuyển đến nội dung
10/30Chương 10 trên 30

Huấn luyện trước một LLM: dữ liệu, compute, scaling laws và chi phí

20 mô hình huấn luyện trên một GPU laptop để đo scaling law, và ước tính compute 6ND được đối chiếu bằng bộ đếm FLOP thật.

Trên trang này

Chương 9 kết thúc với một khối transformer có thể huấn luyện. Xếp chồng vài khối như vậy, trỏ loss dự đoán token tiếp theo của Chương 8 vào đầu ra, và không còn gì phải phát minh nữa. Mọi thứ còn lại là một khoản mua.

Đó là một bước chuyển lớn hơn vẻ bề ngoài. Mọi chương trước đây đều hỏi nó có học được không? — một câu hỏi có-không mà laptop giải quyết trong mười phút. Chương này hỏi một câu có tiền trong đó: với một lượng số học cố định, mô hình tốt nhất tôi có thể mua là gì? Câu trả lời là một công thức, và năm 2018 nó không hề hiển nhiên với bất kỳ ai.

Đây là câu hỏi đó được trả lời bằng đo đạc, trên một GPU laptop. Hai mươi mô hình, từ 98.624 đến 15 triệu tham số, được huấn luyện từ đầu trên 174 triệu token Wikipedia — một vocabulary BPE 2.048-token được huấn luyện theo cách Chương 7 huấn luyện, cùng transformer của Chương 9. Mỗi lượt chạy nhận chính xác một trong ba ngân sách compute và không hơn một phép toán nào, nên mô hình lớn hơn tất yếu đọc ít văn bản hơn. Loss held-out tốt nhất đạt được ở mỗi ngân sách:

TEXT
budget C (FLOPs)   best loss   reached by a model of
       1.00e13       5.3531           98,624 params
       3.16e13       4.8638           98,624 params
       1.00e14       4.3383          295,808 params

fitted:  L = (Cc / C)^0.0913     over one decade of compute

Gấp mười lần số học làm loss giảm 19 %, và ba điểm nằm trên một đường thẳng trong log-log. Không có gì trong chín chương đầu dự đoán điều đó. Không có định lý nào phía sau — đó là một quy luật thực nghiệm, giữ được với một số mũ khác trên mười bậc độ lớn giữa chiếc laptop này và một datacentre, và là quan sát duy nhất đã thuyết phục cả một ngành chi GDP của một quốc gia nhỏ cho GPU.

Không có gì trong mục tiêu thay đổi. Mô hình vẫn dự đoán token tiếp theo, loss vẫn là cross-entropy của Chương 4 áp vào phép phân rã của Chương 8, bộ tối ưu vẫn là AdamW của Chương 6. Pretraining không phải một thuật toán mới; đó là cùng thuật toán được chạy trên một corpus đủ lớn để lượt chạy phải được lập ngân sách. Hai điều khiến việc đó khả thi: nhãn là miễn phí, vì mục tiêu cho vị trí tt là token tại t+1t+1 và đã có sẵn trong văn bản; và phần cuối Chương 6 đã gỡ bỏ phản đối, vì một mô hình có nhiều tham số hơn rất xa các quy tắc cổ điển cho phép không sụp đổ, mà cải thiện. Thứ thu được là một base model — thứ tiếp tục văn bản hơn là trả lời.

Trước khi lập ngân sách cho bất kỳ điều gì trong số này, nó phải được đếm, và lĩnh vực này đếm bằng một công thức:

C6NDC \approx 6ND

trong đó NN là số tham số, DD là số token huấn luyện và CC là tổng số phép toán dấu phẩy động. Kaplan và cộng sự suy ra nó trong hai bước.1 Forward: 2 FLOP cho mỗi tham số mỗi token, vì mọi tham số trong một phép nhân ma trận được dùng một lần cho mỗi token, trong một phép nhân và một phép cộng. Backward: gấp đôi forward, vì backward pass của Chương 5 tính hai gradient ở mỗi lớp — theo đầu vào của lớp, để tín hiệu tiếp tục đi, và theo trọng số của nó — mỗi cái là một phép nhân ma trận cùng kích thước với forward, nên 4N4N.

Đó là toàn bộ suy luận, và đáng kiểm tra thay vì tin. PyTorch có sẵn một bộ đếm FLOP thật, torch.utils.flop_counter.FlopCounterMode, chặn mọi phép toán mà một mô hình dispatch và cộng tổng công việc thực tế. Chạy nó qua bốn bậc độ lớn, mô hình lớn nhất trên thiết bị meta, thiết bị chỉ cấp phát shape chứ không cấp phát bộ nhớ:

flops.pyPYTHON
from torch.utils.flop_counter import FlopCounterMode

counter = FlopCounterMode(display=False)
with counter:                       
    loss = model(x, targets)[1]     
    loss.backward()                 
measured = counter.get_total_flops()
print(measured / (6 * n_params * n_tokens))
cấu hìnhNN không tính embeddingstổng NNđo được, fwd+bwd÷ 6ND6ND (tổng NN)÷ 6ND6ND (không emb.)fwd+bwd ÷ fwd
dd 128, 4 layers, TT 256788,7367,254,4004.60e101.0319.4853.000
dd 512, 8 layers, TT 25625,183,23251,045,8883.26e111.0382.1043.000
dd 768, 12 layers, TT 102484,973,056124,356,8641.75e121.1451.6763.000
dd 1600, 48 layers, TT 10241,474,870,4001,556,920,0002.10e131.1001.1613.000
dd 4096, 32 layers, TT 20486,442,983,4246,582,444,0328.74e131.0801.1043.000
dd 8192, 80 layers, TT 819264,427,147,26465,544,929,2803.75e151.1631.1833.000

Tỷ lệ forward+backward trên forward là 3.000, chính xác, ở mọi quy mô: không phải một xấp xỉ tình cờ tốt, mà là đồng nhất thức số học ở trên được trả lại thành một số tròn bởi một bộ đếm không biết gì về phép suy luận.

Tổng đo được sau đó nằm cao hơn từ 3 % đến 17 % so với 6ND6ND, khi NN tính cả các ma trận embedding — và mệnh đề đó quan trọng, vì hai bài báo nền tảng đếm NN khác nhau. Kaplan loại trừ "all vocabulary and positional embeddings" vì làm vậy "produces significantly cleaner scaling laws" (§1.3); Phụ lục F của Chinchilla nói "we also count embeddings matrices in the total parameter count".2 Với vocabulary rộng và hidden dimension hẹp, hai cách khác nhau gấp chín lần, như hàng đầu tiên cho thấy.

Khoảng chênh còn lại là thứ 6ND6ND cố ý bỏ qua: các điểm attention. Phương trình (2.2) của Kaplan viết chi phí forward là 2N+2nlayernctxdmodel2N + 2\,n_{\text{layer}} n_{\text{ctx}} d_{\text{model}} và bỏ hạng thứ hai vì dmodelnctx/12d_{\text{model}} \gg n_{\text{ctx}}/12 — an toàn năm 2020, kém an toàn hơn bây giờ, và là lý do tỷ lệ trôi lên khi T/dT/d tăng — đó là lý do hai hàng ở đây có cùng TT là 1.024 và tỷ lệ giảm, từ 1.145 xuống 1.100, khi dd đi từ 768 lên 1.600. Đó là chi phí O(T2)O(T^2) mà Chương 9 đã giới thiệu và Chương 16 biến thành một mức giá.

Compute quyết định một lượt chạy mất bao lâu; bộ nhớ quyết định nó có khởi động được không. Huấn luyện bằng fp32 AdamW thường và mỗi tham số mang bốn con số: trọng số, gradient của nó, mean chạy mm và variance vv của Adam — hai trung bình đã tự xây trong Chương 6. Bốn số, mỗi số bốn byte, là 16 byte cho mỗi tham số, trước cả một activation. Đo trên GPU laptop 8 GB, lấy lượng cấp phát resident tại điểm trong step khi không còn graph nào sống:

mô hìnhvocabularybatchNN16N16N dự đoánresident đo đượcđỉnh trong một stepphần chênh
dd 512, 8 layers50,257851,045,888779 MB801 MB2,500 MB1,699 MB
dd 512, 8 layers4,096827,411,456418 MB426 MB1,043 MB617 MB
dd 256, 6 layers4,09685,839,36089 MB89 MB382 MB293 MB
dd 256, 6 layers4,096325,839,36089 MB89 MB1,259 MB1,170 MB
dd 256, 6 layers4,0961285,839,36089 MB89 MB4,771 MB4,681 MB

Dự đoán và đo đạc khớp trong phạm vi 3 %. Điều bất ngờ là cột cuối: activation lấn át mô hình. Cùng mô hình 5,8 triệu tham số cần 89 MB trạng thái bền vững nhưng cần 4.681 MB activation ở batch 128 — gấp năm mươi hai lần mô hình — và phần lớn không phải transformer. Đó là logits, một vector kích thước vocabulary cho mỗi token, mỗi mục bốn byte: 512 MB ở hàng cuối, 393 MB ở hàng đầu. Kích thước vocabulary đã được chọn ở Chương 7, và nó vẫn quyết định thứ gì vừa trên card.

Hạng nào chiếm ưu thế phụ thuộc vào hình dạng lượt chạy, vì vậy Micikevicius và cộng sự nói bộ nhớ "is dominated by activations"3 trong khi ZeRO nói một mô hình 1,5 tỷ tham số cần "at least 24 GB" chỉ cho các trạng thái mô hình.4 ZeRO đi đến cùng 16 byte bằng một đường khác — 2Ψ2\Psi cho trọng số fp16, 2Ψ2\Psi cho gradient fp16, mỗi 4Ψ4\Psi cho trọng số master fp32 và hai moment của Adam — với 70 tỷ tham số là 1,12 terabyte, tương đương mười bốn GPU 80 GB trước cả một activation.

Parallelism, trong một đoạn và một lần ủy thác

Liên kết đến mục: Parallelism, trong một đoạn và một lần ủy thác

Ở quy mô frontier, không thứ nào ở trên vừa trên một thiết bị, nên lượt chạy được tách theo bốn cách cùng lúc. Data parallelism đặt một bản sao mô hình trên mọi GPU và lấy trung bình gradient — mặc định, và là thứ ZeRO cải thiện bằng cách từ chối giữ các bản sao dư thừa của trạng thái bộ tối ưu. Tensor parallelism tách từng ma trận qua các thiết bị. Pipeline parallelism giao cho mỗi thiết bị một nhóm lớp liền nhau. Context parallelism tách chính chuỗi, chỉ cần khi TT đủ dài để hạng attention chiếm ưu thế. Bảng 4 của Llama 3 liệt kê cả bốn cùng lúc: tensor 8, context tới 16, pipeline 16, data tới 128, trên 16.384 GPU H100.5 Khóa học này chỉ nói đến vậy; kỹ thuật huấn luyện phân tán là cả một học kỳ riêng, và CS336 của Stanford chính là học kỳ đó, bài giảng 5 đến 8, kèm code.6 Thứ còn lại sau lần ủy thác là một con số duy nhất, model FLOPs utilisation — phần tỷ lệ số học đỉnh của GPU mà một lượt chạy thật đạt được — chính là thứ biến 6ND6ND gọn gàng thành thời gian thực và vì vậy thành tiền.

Tháng 1 năm 2020, Kaplan và cộng sự huấn luyện một lưới transformer và thấy test loss tuân theo power law theo từng một trong ba tài nguyên qua hơn sáu bậc độ lớn.1 §1.2 của họ đưa ra ba luật đã fit:

L(N)=(NcN)αN,αN0.076,Nc8.8×1013L(N) = \left(\frac{N_c}{N}\right)^{\alpha_N}, \qquad \alpha_N \approx 0.076, \qquad N_c \approx 8.8 \times 10^{13}

kèm theo αD0.095\alpha_D \approx 0.095 cho dữ liệu và αCmin0.050\alpha_C^{\min} \approx 0.050 cho compute được phân bổ tối ưu. Các hằng số không phổ quát, và bài báo nói rõ: "the precise numerical values of NcN_c, CcminC_c^{\min} and DcD_c depend on the vocabulary size and tokenization and hence do not have a fundamental meaning."

Các số mũ rất nhỏ: gấp mười lần tham số mua được một hệ số 100.0761.1910^{0.076} \approx 1.19 giảm khỏi phần loss còn lại. Nghe như chẳng là gì, và đó là sự thật quan trọng nhất ở đây — lợi suất rất tệ và không bao giờ dừng. Một power law với số mũ nhỏ hứa rằng bậc độ lớn tiếp theo sẽ giúp, ít hơn bậc trước, mãi mãi. Mua compute không còn là canh bạc mà trở thành một khoản mua với tỷ giá công bố, chính là lập luận đã mở khóa vốn.

Rồi đến chỉ định, và đây là nơi bài báo sai theo cách khiến ngành tốn rất nhiều tiền. Bảng 6 của Kaplan cho NoptC0.73N_{\text{opt}} \propto C^{0.73}DoptC0.27D_{\text{opt}} \propto C^{0.27}: gấp mười lần compute nghĩa là mô hình lớn hơn 5,4 lần nhưng chỉ ăn nhiều văn bản hơn 1,9 lần. Tóm tắt nói rõ — "optimally compute-efficient training involves training very large models on a relatively modest amount of data and stopping significantly before convergence." Lĩnh vực đã làm đúng như vậy: GPT-3 là 175 tỷ tham số trên 300 tỷ token,7 Gopher 280 tỷ trên 300 tỷ, Megatron-Turing NLG 530 tỷ trên 270 tỷ.2 Nửa token đến hai token cho mỗi tham số, trên toàn bộ.

Tháng 3 năm 2022, Hoffmann và cộng sự huấn luyện hơn 400 mô hình từ 70 triệu đến 16 tỷ tham số và đi đến kết luận ngược lại bằng ba con đường độc lập.2 Bảng 2 của họ báo cáo số mũ aa trong NoptCaN_{\text{opt}} \propto C^{a} là 0.50, 0.49 và 0.46, so với 0.73 của Kaplan. Nói đơn giản: kích thước mô hình và dữ liệu huấn luyện nên tăng theo tỷ lệ bằng nhau.

Cách tiếp cận thứ hai của họ là thứ sweep ở đầu chương này tái hiện, ở quy mô bằng một phần triệu: cố định ngân sách, huấn luyện nhiều kích thước đúng ngân sách đó, vẽ final loss theo kích thước mô hình.

tham sốC=1013C = 10^{13}C=3.16×1013C = 3.16 \times 10^{13}C=1014C = 10^{14}
98,6245.3531 (171)4.8638 (542)
150,3205.4636 (74)
194,2085.5041 (44)4.8730 (140)4.4040 (442)
295,8085.5550 (19)4.9029 (60)4.3383 (190)
665,2805.7849 (3.8)5.1254 (12)4.4192 (38)
1,280,7685.8174 (1.0)5.1751 (3.2)4.5003 (10)
3,101,5685.4686 (0.5)4.7768 (1.7)
5,315,0725.5894 (0.2)4.8514 (0.6)
15,053,5685.3534 (0.1)

Held-out loss tính bằng nat trên mỗi token, token trên mỗi tham số trong ngoặc, in đậm cho mô hình tốt nhất ở mỗi ngân sách; dấu gạch là điểm không chạy, vì ngân sách đòi nhiều văn bản hơn corpus có hoặc kích thước nằm ngoài các giá trị được sweep ở đó.

Đọc xuống một cột: loss giảm, chạm đáy rồi tăng lại. Một mô hình có thể quá lớn so với ngân sách dễ như quá nhỏ — tại 101410^{14}, hình phạt khi chọn 665.280 tham số thay vì 295.808 là 0,08 nat, trên đường bao đã fit ở trên tương đương loss mà một mô hình đúng cỡ đạt với ít compute hơn 18 %. Chọn sai shape ném đi một phần năm ngân sách. Đó là Hình 3 của Chinchilla trong một buổi chiều trên một GPU thay vì bốn trăm mô hình.

Bây giờ đọc ngang. Ở 101310^{13}, mô hình tốt nhất là mô hình nhỏ nhất được sweep; ở 101410^{14}, đó là 295.808 tham số, được kẹp hai bên. Điểm tối ưu dịch sang phải khi ngân sách tăng, và đó là toàn bộ nội dung của hiệu chỉnh. Fit cách tiếp cận thứ ba của bài báo — bề mặt L(N,D)=E+A/Nα+B/DβL(N,D) = E + A/N^{\alpha} + B/D^{\beta} trên mọi lượt chạy — rồi tối thiểu hóa với ràng buộc C=6NDC = 6ND:

TEXT
L(N, D) = 24.7 / N^0.195 + 46.8 / D^0.169       (E fits to ~0; see below)
implied   N_opt ∝ C^0.464
  compare   Chinchilla 0.46-0.50 · Besiroglu 0.513 · Kaplan 0.73

0,46, từ một laptop, so với 0,73 của Kaplan. Khớp đến ba chữ số từ một fit ba ngân sách là may mắn; khớp chữ số đầu thì không. Số mũ di chuyển — hằng số thì không, vì tỷ lệ token-trên-tham-số tại các điểm tối ưu này là 170 đến 540, không phải 20. Ba lý do, đều đáng học. EE fit về không vì ở loss trên 4 nat, lượt chạy còn rất xa sàn entropy chi phối fit của Chinchilla. Batch size và learning rate được giữ cố định thay vì tinh chỉnh theo từng điểm, gây bất lợi cho các lượt chạy có ít step nhất — và đó là các mô hình lớn: tại 101310^{13} FLOP, mô hình 1,28 triệu tham số chỉ có tổng cộng 159 step bộ tối ưu, thấp hơn rất xa vài nghìn step mà hạng SminS_{\min} của Kaplan nói mọi mô hình đều cần. Một scaling law được fit bên trong một chế độ, và chế độ này nằm thấp hơn Chinchilla sáu bậc độ lớn.

Vì thế tóm tắt của bài báo: "current large language models are significantly undertrained". Chinchilla là minh chứng — 70 tỷ tham số trên 1,4 nghìn tỷ token, cùng tổng compute như Gopher 280 tỷ trên 300 tỷ, vượt nó ở 51 trong 57 tác vụ MMLU, 67,5 % so với 60 %.2 Nhỏ hơn bốn lần, nhiều văn bản hơn bốn lần rưỡi, cùng tiền, mô hình tốt hơn.

Hai lưu ý về tỷ lệ nổi tiếng đó. "Hai mươi token cho mỗi tham số" không phải một câu trong bài báo; bài chỉ nói rằng "for every doubling of model size the number of training tokens should also be doubled"; con số 20 là suy luận từ Bảng 3 và từ chính Chinchilla 70 B trên 1,4 T. Và độ chính xác của nó kém hơn công bố: Besiroglu và cộng sự fit lại từ bản số hóa Hình 4, thấy các tham số gốc "fit the reconstructed data poorly" với khoảng "implausibly tight given the number of data points", và đặt khoảng trung thực là "between 4 and 40" token cho mỗi tham số.8

Một chi tiết trong phương pháp của Chinchilla thực hiện lời hứa mà Chương 1 đã nói về lịch learning-rate. Cosine schedule phải khớp với ngân sách token. Một mô hình sẽ thấy 10 triệu token phải giảm learning rate về không tại 10 triệu token; đưa cho nó schedule cỡ 100 triệu, dừng sớm, và bạn đang đọc loss giữa lúc giảm với rate quá cao. Chinchilla huấn luyện mỗi mô hình ở bốn độ dài chu kỳ để kiểm soát đúng điều này; sweep ở trên đặt schedule từ ngân sách vì cùng lý do.

Chúng là kết quả thực nghiệm hữu ích nhất trong lĩnh vực và thường xuyên bị bán quá lời. Bốn giới hạn.

Chúng dự đoán loss, không dự đoán năng lực. Vế trái là cross-entropy trên văn bản held-out. Không có gì trong các bài báo này cho phép tuyên bố liệu một mô hình sẽ viết SQL đúng, từ chối yêu cầu có hại hay dùng tool. Đây lại là bài học của Chương 5: một dự đoán về loss không phải dự đoán về hành vi bạn đang trả tiền để có.

Chúng được fit, không được suy ra. Không có lý thuyết nào tạo ra αN=0.076\alpha_N = 0.076. Các hằng số dịch chuyển theo tokenizer — đó là lý do so sánh perplexity giữa hai tokenizer là vô nghĩa, như Chương 8 đã giải thích — và theo hỗn hợp dữ liệu, kiến trúc và bộ tối ưu. Mọi luật đã công bố là luật của thiết lập đã tạo ra nó, đó là lý do Meta tự fit lại trước Llama 3.5

Chúng giả định mỗi step có một token mới, tức ngầm giả định corpus vô hạn. Muennighoff và cộng sự đo điều gì xảy ra khi nó cạn: tới bốn epoch dữ liệu lặp lại gần như không tốn gì — một mô hình 8,7 tỷ tham số trên 44 tỷ token duy nhất, thấy bốn lần, kết thúc với "only 0.5 % higher validation loss" so với cùng mô hình trên 178 tỷ token duy nhất — trong khi sau khoảng mười sáu epoch, compute bổ sung không mua được gì.9

Và không ai còn huấn luyện compute-optimal nữa. Chinchilla tối thiểu hóa chi phí huấn luyện; một mô hình triển khai sau đó trả xấp xỉ 2N2N FLOP cho mỗi token sinh ra, mãi mãi. LLaMA 1 nói thẳng: "given a target level of performance, the preferred model is not the fastest to train but the fastest at inference".10 Sardana và cộng sự hình thức hóa bằng cách tối thiểu hóa 6NDtrain+2NDinference6ND_{\text{train}} + 2ND_{\text{inference}} thay vào đó, và thấy bất kỳ ai kỳ vọng một tỷ request nên huấn luyện "smaller and longer than Chinchilla-optimal".11 §9.1 của Llama 3 đồng ý: các mô hình nhỏ của họ huấn luyện "far beyond the point of compute optimal training, effectively trading training compute for inference efficiency".5 Tỷ lệ không lỗi thời; nó trả lời một câu hỏi không còn là câu đang được hỏi.

Emergent abilities, và tranh luận liệu chúng có thật không

Liên kết đến mục: Emergent abilities, và tranh luận liệu chúng có thật không

Loss giảm mượt. Điểm benchmark đôi khi không. Wei và cộng sự gom các trường hợp một tác vụ nằm ở mức đoán mò qua nhiều bậc độ lớn compute huấn luyện rồi nhảy vọt — số học ba chữ số xuất hiện trong GPT-3 ở khoảng 2×10222 \times 10^{22} FLOP, MMLU tăng vượt đoán mò giữa 335×10235 \times 10^{23} — và đặt tên cho mẫu này: "an ability is emergent if it is not present in smaller models but is present in larger models".12 Nếu đó là một thuộc tính thật, ngoại suy từ thí nghiệm rẻ là không an toàn, vì năng lực bạn đang mua có thể không tồn tại ở bất kỳ quy mô nào bạn đủ tiền kiểm thử.

Schaeffer, Miranda và Koyejo lập luận rằng phần lớn điều đó là hiện vật của đo lường, và cơ chế là số học.13 Per-token loss giảm mượt, nên xác suất một token đúng, exp(L)\exp(-\mathcal{L}), cải thiện dần. Chấm mô hình bằng exact string match trên một câu trả lời LL-token và bạn nâng xác suất đó lên lũy thừa LL — một đường cong mượt nâng lên lũy thừa lớn trông như vách đá. Đổi sang metric đếm token thay vì đòi tất cả chúng đúng, trên cùng output, và "the family's performance smoothly, continuously and predictably improves with increasing scale".

Con số cần nhớ trong kiểm toán của họ là — "of the 39 preferred metrics in BIG-Bench, at most 5 display emergence", với hai metric gián đoạn chiếm hơn 92 % các trường hợp được tuyên bố — và cả cảnh báo của họ: "nothing in this paper should be interpreted as claiming that large language models cannot display emergent abilities". Một cú nhảy trên biểu đồ là bằng chứng về metric cho đến khi chứng minh khác đi. Chương 29 là nơi điều đó trở thành vấn đề của bạn, vì chọn một metric ngưỡng cứng là quyết định bạn sẽ đưa ra mà không nhận ra.

Corpus là phần của một lượt pretraining không có phương trình đi kèm, và là nơi có phần lớn các quyết định hệ trọng. Nguyên liệu thô là một web crawl: kho lưu trữ tháng 8 năm 2026 của Common Crawl có "2.14 billion web pages or 360 TiB of uncompressed content", một tháng dữ liệu, tải miễn phí.14 Hầu như không thứ gì dùng được nguyên trạng. Bài báo T5 nói crawl "largely comprises gibberish or boiler-plate text like menus, error messages, or duplicate text", và pipeline C4 mà nó giới thiệu là một danh sách heuristic thô — chỉ giữ các dòng kết thúc bằng dấu câu cuối câu, bỏ trang có ít hơn ba câu, bỏ bất kỳ trang nào chứa ngoặc nhọn hoặc một từ trong danh sách công khai các từ tục — biến hai mươi terabyte văn bản hằng tháng thành khoảng 750 GB.15

Thô là đúng từ. Dodge và cộng sự kiểm toán thứ các bộ lọc đó loại bỏ và thấy blocklist từ tục xóa 42 % tài liệu bằng African-American English và 32 % bằng Hispanic-aligned English, so với 6,2 % của White-aligned English, để lại corpus 97,8 % thuộc loại cuối.16 Một quy tắc tưởng không có quan điểm về phương ngữ lại có một quan điểm.

Rồi đến deduplication, không phải dọn dẹp: Lee và cộng sự tìm thấy một câu 61 từ lặp lại 61.036 lần trong C4, và cho thấy deduplication cắt tỷ lệ mô hình "emit memorized text" mười lần, từ 1,9 % token được sinh xuống 0,19 %.17 Tuy vậy, nhiều hơn không phải tốt hơn — nhóm FineWeb deduplicate toàn cục trên 96 crawl, được 4 nghìn tỷ token và không có cải thiện đo được, rồi deduplicate từng crawl riêng, được 20 nghìn tỷ, và khớp corpus tốt nhất hiện có.18

Rồi đến contamination. Llama 3 tự đo và công bố: 98 % AGIEval, 95 % BIG-Bench Hard và 85 % HellaSwag chồng lấp với tập huấn luyện theo 8-gram, và với MMLU, độ chồng lấp cao đến mức "it is impossible to get a good performance gain estimate".5 §4 của GPT-3 báo cáo một lỗi lọc khiến benchmark còn trong dữ liệu mà không có đường quay lại: "because of cost considerations it was infeasible to retrain the model".7

Provenance là phần chưa được giải quyết. The Pile phát hành một thành phần 100,96 GiB tên Books3 — 12 % corpus và, theo bảng đồng ý của chính bài báo, là sách từ một private torrent tracker;19 nó bị đưa offline tháng 8 năm 2023 sau một khiếu nại bản quyền. Tình thế pháp lý tính đến tháng 9 năm 2026 vẫn chưa ngã ngũ, và ba phán quyết của Mỹ được viện dẫn như một xu hướng lại bất đồng với nhau. Alsup thấy việc huấn luyện trên sách được thu nhận hợp pháp là "exceedingly transformative" trong khi cho rằng một thư viện xây từ bản sao lậu thì không, và Anthropic dàn xếp nửa đó với $1.5 billion bao phủ 482.460 tác phẩm, khoảng $3.000 mỗi tác phẩm, được phê chuẩn ngày 20 tháng 7 năm 2026.20 Chhabria cho Meta thắng summary judgment nhưng viết rằng phán quyết của ông "does not stand for the proposition that Meta's use of copyrighted materials to train its language models is lawful", chỉ là "these plaintiffs made the wrong arguments".21 Bibas, khi xử bất lợi cho Ross Intelligence, lưu ý rằng "only non-generative AI is before me today".22 Chưa tòa phúc thẩm Mỹ nào phán quyết về câu hỏi này.

Con người làm những phần mà loss không làm được. TIME đưa tin tháng 1 năm 2023 rằng công nhân gán nhãn văn bản độc hại cho OpenAI qua công ty Sama mang về "between around $1.32 and $2 per hour" khi đọc các đoạn mô tả lạm dụng tình dục trẻ em, tra tấn và tự hại, trong khi OpenAI trả Sama $12.50 mỗi giờ cho công việc; Sama phản bác cả khoảng lương và quota.23 Đó là lọc quanh pretraining chứ không phải bản thân pretraining — nhưng nằm trên cùng hóa đơn, và là nơi có một con người ngồi.

Điện là thật và thường bị trích sai. Con số công bố cẩn thận nhất là của BLOOM: 1.082.990 GPU-giờ, 433 MWh và 24,7 tấn CO₂ tương đương cho lượt chạy, 50,5 nếu tính sản xuất và node nhàn rỗi;24 Patterson và cộng sự đặt GPT-3 ở 1.287 MWh và 552 tấn.25 Hai cảnh báo. Lợi thế của BLOOM là lưới điện hạt nhân Pháp ở 57 g CO₂ mỗi kWh chứ không phải hiệu suất — nó dùng nhiều năng lượng hơn OPT-175B. Và con số phát thải được trích nhiều nhất trong lĩnh vực, 626.155 lb của Strubell và cộng sự cho neural architecture search, sau đó được chứng minh là cao hơn 88 lần, vì đã giả định search chạy ở kích thước mô hình đầy đủ trong khi nó chạy trên proxy.26 Cách đóng khung của LBNL là cách có thể bảo vệ: datacentre Mỹ dùng 192 TWh năm 2024, 4,7 % điện quốc gia — một con số gắn với một ngành, không gắn với một lượt chạy riêng.27

Sợi chỉ xuyên suốt là thứ Bender và cộng sự gọi là documentation debt: "putting ourselves in a situation where the datasets are both undocumented and too large to document post hoc".28 Mọi sự thật ở trên tồn tại vì có ai đó đã nhìn. Với corpus phía sau các mô hình hầu hết mọi người dùng, không ai có thể.

Bây giờ là phép số học mà ai cũng muốn, từ bốn đầu vào được trích dẫn, để khi chúng lỗi thời thì rõ phải thay cái nào.

Trang H100 của NVIDIA liệt kê 1.979 teraFLOPS throughput tensor-core BF16 dưới một chú thích "with sparsity".29 Không lượt pretraining nào dùng structured sparsity, nên con số dense bằng một nửa: 989,5 TFLOP/s.

Bảng 4 của Llama 3 báo cáo 38–43 % BF16 model FLOPs utilisation. Lấy 40 %: 395,8 TFLOP/s số học hữu ích mỗi GPU.5

Giá on-demand của Lambda cho một node 8×H100 SXM, truy cập 2026-09-06: $3.99 mỗi GPU-giờ, tức $31.92 một giờ cho node.30

Tỷ lệ của Chinchilla, D=20ND = 20N, cho C=6ND=120N2C = 6ND = 120N^2 và do đó N=C/120N = \sqrt{C/120}.

ngân sáchH100-giờFLOPtham số compute-optimaltokentrên một node 8×H100GPU để xong trong 90 ngày
$100253.6e19546 M10.9 B3.1 h1
$1,0002513.6e201.73 B34.5 B31.3 h1
$10,0002,5063.6e215.46 B109 B13 days2
$100,00025,0633.6e2217.3 B345 B131 days12
$1,000,000250,6273.6e2354.6 B1.09 T4 years116
$10,000,0002,506,2663.6e24173 B3.45 T36 years1,160
$100,000,00025,062,6573.6e25546 B10.9 T358 years11,603

Đọc hai cột cuối cùng cùng nhau. Với $10.000, bạn có một mô hình 5 tỷ tham số trên một node thuê trong hai tuần. Với $100.000.000, số học nói 546 tỷ tham số — và mười hai nghìn H100 nối dây với nhau trong ba tháng, thứ không thể thuê bằng thẻ tín dụng. Sau khoảng $100.000, ràng buộc chặt không còn là tiền mà là cluster.

Trước khi tin một bảng như vậy, kiểm nó với các lượt chạy có chi phí thật được công bố — llm.c tái lập GPT-2 124M trong "~90 minutes" trên một node 8×A100 "for about $20", và GPT-2 1.6B trong 24 giờ trên một node 8×H100 với $672.31

TEXT
$672, against what $672 actually bought (llm.c GPT-2 1.6B, one 8xH100 node, 24 h)
  this table predicts:      168 H100-hours   N = 1.41 B params   D = 28.3 B tokens
  what was actually run:    192 H100-hours   N = 1.558 B params  D = 33.6 B tokens

Llama 3 405B, against Meta's own published GPU-hours
  from the paper's 3.8e25 FLOPs at 40 % MFU:   26.67 M H100-hours
  published in Meta's Llama 3.1 model card:    30.84 M H100-hours    ratio 0.86

Cả hai đều trong khoảng 15 %, gần mức chính xác mà loại ước tính này xứng đáng có và tốt hơn đáng kể so với độ chính xác mà nó thường được trích dẫn.

So sánh headline, với cả hai định nghĩa trên bàn

Liên kết đến mục: So sánh headline, với cả hai định nghĩa trên bàn

Con số được lặp lại nhiều nhất trong chủ đề này là một mô hình cỡ GPT-2 tốn khoảng $43.000 năm 2019 có thể được tái lập hôm nay với vài chục đô. Nửa hiện đại được ghi chép tốt; nửa lịch sử thì không.

Hôm nay. README nanochat của Karpathy: "you can train your own GPT-2 capability LLM ... for only $48 (~2 hours of 8XH100 GPU node) ... On a spot instance, the total cost can be closer to ~$15."32 "GPT-2 capability" ở đây chính xác và được công bố — vượt CORE score 0.256525 của GPT-2 — trên leaderboard có mục tốt nhất tính đến 14 tháng 3 năm 2026 là 1,65 giờ. Con số $48 giả định $3 mỗi GPU-giờ, thấp hơn giá niêm yết $3,99 của Lambda; theo giá niêm yết, nó gần $64 hơn.

Năm 2019. Không có nguồn sơ cấp: OpenAI chưa bao giờ công bố thời lượng hay chi phí. Chuỗi dẫn chạy qua The Register, tháng 2 năm 2019, báo cáo "256 Google TPU3 cores" mà không có giá hay thời lượng; rồi Synced, tháng 6 năm 2019, ghi rằng phần cứng tốn $256 một giờ trên Google Cloud và nói rõ rằng "OpenAI didn't specify the training duration". $43.008 là $256 một giờ nhân với 168 giờ giả định mà chưa ai từng truy nguồn.

Vì vậy headline trung thực là: một mô hình khớp điểm benchmark đã công bố của GPT-2 có thể được huấn luyện hôm nay với thấp hơn nhiều $100 trên phần cứng thuê, so với chi phí năm 2019 chưa từng được công bố và ước tính nổi tiếng của nó dựa trên một phỏng đoán không có nguồn về thời lượng. Sự sụp đổ chi phí là thật và nửa hiện đại có thể được bất kỳ ai có thẻ tín dụng tái lập; tỷ lệ là số học trên một con số không tồn tại. Đó là trạng thái của chi phí huấn luyện được công bố nói chung. Bài GPT-3 không chứa số tiền đô nào, chỉ có 3.14×10233.14 \times 10^{23} FLOP trong Bảng D.1;7 bài Llama 3 cũng không có.5 Mọi chi phí huấn luyện bạn đã đọc là một ước tính từ số FLOP, một giả định phần cứng và một giả định giá — luôn đáng hỏi là của ai.

Base model biết gì, và nó ngừng biết khi nào

Liên kết đến mục: Base model biết gì, và nó ngừng biết khi nào

Thứ thu được đã thấy một corpus cố định được lắp ráp tại một thời điểm cố định, và hai thuộc tính theo sau.

Thứ nhất là knowledge cutoff. Sau ngày thu thập, mô hình không biết gì — không phải "không chắc", mà là không gì cả — và nó sẽ bịa trơn tru thay vì nói vậy, vì nói vậy chưa bao giờ là một hành vi nó được huấn luyện. Model card của Llama 3.1 ghi tháng 12 năm 2023;33 mọi mô hình đều có một mốc, và đó là thuộc tính của dữ liệu huấn luyện, không phải deployment. Lách quanh nó là một bài toán retrieval, thuộc Chương 19.

Thứ hai là base model hoàn tất thay vì trả lời. Đưa cho nó "Thủ đô của Pháp là gì?" và một tiếp diễn hợp lý là một câu hỏi khác, vì trong corpus chuỗi đó thường xuất hiện trong danh sách bài tập.

Một trình hoàn tất văn bản không phải assistant. Nó không làm theo chỉ dẫn, vì không có gì trong corpus nói rằng một yêu cầu nên được tuân theo thay vì được tiếp tục. Nó không có khái niệm về một cuộc trò chuyện với hai bên tham gia. Nó sẽ vui vẻ tạo tiếp diễn xác suất cao nhất của một prompt có hại, vì xác suất là thứ duy nhất nó từng được tối ưu hóa cho.

Biến nó thành thứ trả lời cần một giai đoạn thứ hai tốn một phần rất nhỏ của một phần trăm giai đoạn đầu, và gần như hoàn toàn gồm việc cho nó xem ví dụ về hành vi bạn muốn rồi so sánh từng cặp output của chính nó. Giai đoạn đó là nơi instruction following, chat templates, refusal và — điều này làm nhiều người ngạc nhiên — khả năng gọi một tool xuất hiện. Chương 11 là giai đoạn đó: supervised fine-tuning, RLHF, DPO và GRPO, và câu hỏi "aligned" nghĩa là gì và ai quyết định.


Cũng đáng đọc song song với chương này: build-nanogpt của Karpathy và video đi kèm, đi qua một bản tái lập GPT-2 đầy đủ từ đầu đến cuối ở nhịp độ chương này không thể; và Stanford CS324, Large Language Models, có các bài giảng về dữ liệu và tác động môi trường đi sâu hơn phần trên vào chất liệu mà khóa học này chỉ xử lý một lần rồi ủy thác.

  1. Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J. and Amodei, D. Scaling Laws for Neural Language Models. arXiv:2001.08361 (2020). Ba power law là Eqs. (1.1)–(1.3) trong §1.2 và đầy đủ hằng số ở Phụ lục A, Bảng 5; suy luận 6N6N là §2.1; số mũ phân bổ compute ở Bảng 6. Lưu ý có hai luật compute, αC=0.057\alpha_C = 0.057 ở batch size cố định và αCmin=0.050\alpha_C^{\min} = 0.050 ở batch size tối ưu; bài báo nói cái sau "should be used to make predictions". 2

  2. Hoffmann, J., Borgeaud, S., Mensch, A., Buchatskaya, E., Cai, T., Rutherford, E. et al. Training Compute-Optimal Large Language Models. arXiv:2203.15556 (2022). Số mũ ở Bảng 2, ngân sách dự phóng ở Bảng 3, so sánh Gopher trong §4, quy ước đếm tham số ở Phụ lục F. Phần văn xuôi dưới Bảng 3 không khớp với chính Bảng 3 ở các hàng 175 B và 280 B; bảng là phiên bản nên trích. 2 3 4

  3. Micikevicius, P., Narang, S., Alben, J., Diamos, G., Elsen, E., Garcia, D. et al. Mixed Precision Training. arXiv:1710.03740 (2017), ICLR 2018. Trọng số master FP32 ở §3.1, loss scaling ở §3.2. 2

  4. Rajbhandari, S., Rajbhandari, S., Ruwase, O. and He, Y. ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054 (2019), SC20. Kế toán 16Ψ16\Psi là §3.1; các con số trạng thái còn lại cho activations là §3.2.

  5. Grattafiori, A. et al. (Llama Team, AI @ Meta). The Llama 3 Herd of Models. arXiv:2407.21783 (2024). Ngân sách compute và số token trong §1, scaling law fit lại trong §3.2.1, cấu hình parallelism và MFU ở Bảng 4, phân tích contamination trong §5.1.4, phát biểu over-training trong §9.1. Bài báo không có số đô la và không có bảng phát thải. 2 3 4 5 6

  6. Stanford CS336, Language Modeling from Scratch. Bài giảng 2 bao phủ kế toán tài nguyên, bài giảng 5–8 GPU, kernel và parallelism, bài giảng 9 và 11 scaling, bài giảng 13–14 dữ liệu. Đây là khóa học mà chương này ủy thác phần kỹ thuật cho, và nó công khai.

  7. Brown, T. B. et al. Language Models are Few-Shot Learners. arXiv:2005.14165 (2020). Compute trong Phụ lục D, Bảng D.1 — có một cột đúng nghĩa tên "flops per param per token", giá trị cho mọi hàng GPT-3 là 6. Phân tích contamination trong §4. 2 3

  8. Besiroglu, T., Erdil, E., Barnett, M. and You, J. Chinchilla Scaling: A replication attempt. arXiv:2404.10102 (2024). Tái dựng dữ liệu của Chinchilla bằng cách số hóa Hình 4, fit lại, và báo cáo các số mũ đã hiệu chỉnh cùng khoảng rộng hơn nhiều.

  9. Muennighoff, N., Rush, A. M., Barak, B., Le Scao, T., Piktus, A., Tazi, N., Pyysalo, S., Wolf, T. and Raffel, C. Scaling Data-Constrained Language Models. arXiv:2305.16264 (2023), NeurIPS 2023. Kết quả bốn epoch ở §6; half-life mười sáu epoch là RD15R_D^* \approx 15 đã fit.

  10. Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T. et al. LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 (2023). §1 nêu lập luận chi phí inference chống lại huấn luyện Chinchilla-optimal.

  11. Sardana, N., Portes, J., Doubov, S. and Frankle, J. Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws. arXiv:2401.00448 (2023), ICML 2024. §5 của họ cũng chứa đối trọng: mô hình huấn luyện ở tỷ lệ token cực đoan vẫn cải thiện, nhưng "more slowly than scaling laws predict".

  12. Wei, J., Tay, Y., Bommasani, R., Raffel, C., Zoph, B., Borgeaud, S. et al. Emergent Abilities of Large Language Models. arXiv:2206.07682 (2022), TMLR. Định nghĩa trong §2, ví dụ và ngưỡng compute trong §3–4 và Bảng 1.

  13. Schaeffer, R., Miranda, B. and Koyejo, S. Are Emergent Abilities of Large Language Models a Mirage? arXiv:2304.15004 (2023), bài xuất sắc NeurIPS 2023. Lập luận về metric ở §2, meta-analysis BIG-Bench ở §4, ví dụ thị giác được dựng ở §5.

  14. Common Crawl, August 2026 Crawl Archive Now Available (CC-MAIN-2026-34), xuất bản 24 August 2026, truy cập 2026-09-06. Trang chủ của chính nó tuyên bố "over 300 billion pages spanning 15 years", "totalling more than 10 petabytes" — một con số cho toàn bộ kho lưu trữ, không phải cho crawl hằng tháng được định giá ở đây.

  15. Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W. and Liu, P. J. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683 (2019), JMLR 21(140). Các bộ lọc C4 ở §2.2. Bài báo cho kích thước theo byte, không phải token; con số 156 tỷ token thường gán cho nó đến từ Dodge và cộng sự bên dưới.

  16. Dodge, J., Sap, M., Marasović, A., Agnew, W., Ilharco, G., Groeneveld, D., Mitchell, M. and Gardner, M. Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758 (2021), EMNLP 2021. Tỷ lệ loại bỏ phương ngữ ở §5.3; benchmark contamination trong C4 ở §4.2.

  17. Lee, K., Ippolito, D., Nystrom, A., Zhang, C., Eck, D., Callison-Burch, C. and Carlini, N. Deduplicating Training Data Makes Language Models Better. arXiv:2107.06499 (2021), ACL 2022. 61.036 lần lặp ở chú thích 1; các con số memorisation ở §6.2, Bảng 4, và là phần trăm token được sinh theo tiêu chí exact-match 50-token.

  18. Penedo, G., Kydlíček, H., Ben Allal, L., Lozhkov, A., Mitchell, M., Raffel, C., Von Werra, L. and Wolf, T. The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale. arXiv:2406.17557 (2024), NeurIPS 2024 Datasets and Benchmarks. Kết quả deduplication ở §3.4. Dataset phát hành từ đó đã tăng vượt 15 nghìn tỷ token trong bài.

  19. Gao, L., Biderman, S., Black, S. et al. The Pile: An 800GB Dataset of Diverse Text for Language Modeling. arXiv:2101.00027 (2020). Books3 ở §2.3 và Bảng 1; bảng đồng ý là Bảng 5. Corpus là 825,18 GiB, nên ngay cả tiêu đề cũng là làm tròn xuống.

  20. Bartz v. Anthropic, No. 4:24-cv-05417 (N.D. Cal.). Lệnh fair-use ngày 23 June 2025 (Dkt. 231); chứng nhận class ngày 17 July 2025; phê chuẩn cuối và phán quyết ngày 20 July 2026 (Dkt. 680). Dàn xếp chỉ giải phóng input quá khứ, không phải output và không phải hành vi tương lai.

  21. Kadrey v. Meta, No. 3:23-cv-03417-VC (N.D. Cal.), summary judgment 25 June 2025 (Dkt. 598). Lưu ý claim phân phối qua torrenting chưa được quyết định và vẫn còn hiệu lực.

  22. Thomson Reuters v. ROSS Intelligence, No. 1:20-cv-00613-SB (D. Del.), ý kiến sửa đổi 11 February 2025 (Dkt. 770), Bibas J. Đang kháng cáo interlocutory lên Third Circuit (No. 25-2153), tranh luận 11 June 2026, chưa có quyết định tại thời điểm viết.

  23. Perrigo, B. Exclusive: OpenAI Used Kenyan Workers on Less Than $2 Per Hour to Make ChatGPT Less Toxic. TIME, 18 January 2023. $2 là trần cho reviewer cấp cao đạt mọi mục tiêu; labeller cấp junior, chiếm đa số, mang về $1,32. Phản hồi của Sama, được trích trong cùng bài, cho $1,46–$3,74 và quota thấp hơn.

  24. Luccioni, A. S., Viguier, S. and Ligozat, A.-L. Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language Model. arXiv:2211.02001 (2022), JMLR 24(253). Bảng 1 và 3.

  25. Patterson, D., Gonzalez, J., Le, Q., Liang, C., Munguia, L.-M., Rothchild, D., So, D., Texier, M. and Dean, J. Carbon Emissions and Large Neural Network Training. arXiv:2104.10350 (2021). Con số của GPT-3 ở Bảng 4; hiệu chỉnh ước tính NAS ở §4.1.

  26. Strubell, E., Ganesh, A. and McCallum, A. Energy and Policy Considerations for Deep Learning in NLP. arXiv:1906.02243 (2019), ACL 2019. Đáng đọc chính xác vì điều đã xảy ra với con số được trích nhiều nhất của nó: bài báo cẩn thận, nêu rõ phép ngoại suy, và vẫn sai hai bậc độ lớn ở dòng duy nhất mọi người lặp lại.

  27. Smith, S. J., Hubbard, A., Newkirk, A., Ganeshalingam, M., Holecek, B., Sartor, D., Mills, M. and Shehabi, A. United States Data Center Energy Usage Report: 2025 Update. LBNL-2001758 (18 June 2026). Bản này chỉnh giảm chuỗi lịch sử so với báo cáo 2024 được trích rộng rãi; nếu bạn đang trích con số 176 TWh cho 2023, bạn đang trích phiên bản đã bị thay thế.

  28. Bender, E. M., Gebru, T., McMillan-Major, A. and Shmitchell, S. On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? FAccT '21, pp. 610–623. DOI 10.1145/3442188.3445922. "Documentation debt" ở §4.4. Lưu ý rằng các con số carbon của chính bài báo được trích từ Strubell và cộng sự và thừa hưởng hiệu chỉnh ở trên — đó là minh họa cho lập luận của nó hơn là phản bác.

  29. NVIDIA. NVIDIA H100 Tensor Core GPU product page, nvidia.com/en-us/data-center/h100/ (truy cập 2026-09-06). Mọi hàng tensor-core trên trang đó trừ FP64 đều có chú thích "with sparsity"; con số BF16 dense dùng ở đây bằng một nửa 1.979 TFLOPS đã công bố.

  30. Lambda. GPU Cloud pricing, lambda.ai/pricing (truy cập 2026-09-06). On-demand, theo GPU mỗi giờ, trước thuế. Giá trong phần này sẽ lỗi thời nhanh hơn bất kỳ thứ gì khác trong khóa học; số học quanh chúng thì không.

  31. Karpathy, A. karpathy/llm.c, thảo luận #481, Reproducing GPT-2 (124M) in llm.c in 90 minutes for $20 (28 May 2024), và thảo luận #677, Let's reproduce GPT-2 (1.6B): one 8XH100 node, 24 hours, $672, in llm.c (11 July 2024).

  32. Karpathy, A. karpathy/nanochat, README và leaderboard "time to GPT-2" (truy cập 2026-09-06). Con số $48 và định nghĩa CORE-score của "GPT-2 capability" đều nằm trong README; speedrun.sh của chính repository nói "approximately 1.5 hours", nên hãy xem con số hai giờ là làm tròn.

  33. Meta. Llama 3.1 model card, models/llama3_1/MODEL_CARD.md trong meta-llama/llama-models (truy cập 2026-09-06). Nguồn của 30,84 M H100-giờ cho mô hình 405 B, tổng 39,3 M, con số 11.390 tCO2eq theo địa điểm, và data cutoff tháng 12 năm 2023.


Tạo bởi

David Vicente Campos

Nhà sáng lập NeuraLIA Labs & Đồng sáng lập MyRealFood

Tôi là kỹ sư máy tính tốt nghiệp Đại học León. Tôi đồng sáng lập MyRealFood, nơi tôi, với vai trò CTO, đã xây dựng ứng dụng mà hàng triệu người đã dùng để ăn uống lành mạnh hơn, và tôi sáng lập NeuraLIA Labs, nơi tôi xây dựng các sản phẩm AI. Ở đây, tôi viết về những gì tôi đã phải hiểu trong quá trình đó, theo cách mà tôi ước đã có ai đó giải thích cho mình.

Tìm hiểu thêm về tác giả

Xuất bản bởi NeuraLIA Labs.

Nhận bài viết mới trong hộp thư

Tin AI, hướng dẫn và cập nhật sản phẩm — một email ngắn khi chúng tôi có nội dung đáng để bạn đọc.

Thích nhắn tin hơn? Vẫn nội dung đó, ở đây:Cộng đồng WhatsApp (mở trong tab mới)Kênh Telegram (mở trong tab mới)

Mục lục khóa học

Abstract agent runtime sorting documents, memory blocks and pointer nodes inside a bounded context frame.
context-engineeringĐọc 16 phút

Kỹ thuật ngữ cảnh cho tác nhân AI dài hạn

Tác nhân chạy lâu không thất bại chỉ vì cửa sổ nhỏ. Chúng thất bại khi tệp, đầu ra công cụ và lịch sử cũ lấn át nhiệm vụ mà tác nhân phải hoàn thành.

Sẵn sàng để LIA chọn giúp bạn chưa?

Xây dựng cùng mọi mô hình AI ở một nơi — bắt đầu miễn phí ngay hôm nay.