İçeriğe geç
10/3030 bölümden 10. bölüm

Bir LLM’i pretraining etmek: Veri, compute, scaling laws ve maliyet

Bir laptop GPU’sunda eğitilen 20 modelle scaling law ölçümü ve 6ND compute tahmininin gerçek FLOP sayacıyla kontrolü.

Bu sayfada

Bölüm 9, eğitilebilen bir transformer bloğuyla bitmişti. Bunlardan birkaçını üst üste koy, Bölüm 8’deki next-token loss’u çıktıya yönelt, geriye icat edilecek hiçbir şey kalmaz. Kalan her şey bir satın almadır.

Bu, kulağa geldiğinden daha büyük bir kırılma. Buraya kadarki her bölüm öğreniyor mu? diye sordu — bir laptop’ın on dakikada çözdüğü evet-hayır sorusu. Bu bölüm, içinde para olan bir soru soruyor: sabit miktarda aritmetik verildiğinde, satın alabileceğim en iyi model hangisi? Cevap bir formül ve 2018’de kimse için bariz değildi.

İşte bu sorunun tek bir laptop GPU’sunda ölçümle verilmiş cevabı. 98.624’ten 15 milyon parametreye kadar yirmi model, 174 milyon Wikipedia token üzerinde sıfırdan eğitildi — Bölüm 7’nin eğittiği şekilde eğitilmiş 2.048-token BPE vocabulary, Bölüm 9’un transformer’ı. Her çalıştırma tam olarak üç compute bütçesinden birini aldı ve tek bir işlem fazlasını almadı; bu yüzden daha büyük bir model zorunlu olarak daha az metin okur. Her bütçede ulaşılan en iyi held-out loss:

TEXT
budget C (FLOPs)   best loss   reached by a model of
       1.00e13       5.3531           98,624 params
       3.16e13       4.8638           98,624 params
       1.00e14       4.3383          295,808 params

fitted:  L = (Cc / C)^0.0913     over one decade of compute

Aritmetiğin on katı, loss’u %19 düşürüyor ve üç nokta log-log grafikte düz bir çizgi üzerinde duruyor. İlk dokuz bölümde hiçbir şey bunu öngörmez. Arkasında bir teorem yok — bu ampirik bir düzenlilik; bu laptop ile bir datacentre arasındaki on büyüklük mertebesi boyunca farklı bir üsle geçerli oluyor ve bir sektörü küçük bir ülkenin GSYH’si kadar parayı GPU’lara harcamaya ikna eden tek gözlem de bu.

Objective değişmez. Model hâlâ bir sonraki token’ı tahmin eder, loss hâlâ Bölüm 8’in çarpanlara ayrılmasına uygulanan Bölüm 4’ün cross-entropy’sidir, optimiser hâlâ Bölüm 6’daki AdamW’dir. Pretraining yeni bir algoritma değildir; bütçelenmesi gerekecek kadar büyük bir corpus üzerinde çalıştırılan aynı algoritmadır. Bunu iki şey mümkün kılar: label’lar bedavadır, çünkü tt konumunun hedefi t+1t+1 konumundaki token’dır ve metnin içinde zaten vardır; ayrıca Bölüm 6’nın son kısmı itirazı kaldırmıştır, çünkü klasik kuralların izin verdiğinden çok daha fazla parametreye sahip bir model dağılmaz, iyileşir. Ortaya çıkan şey bir base model’dir — cevap vermekten çok metni sürdüren bir şey.

Bunlardan herhangi biri bütçelenmeden önce sayılması gerekir ve alan bunu tek bir formülle sayar:

C6NDC \approx 6ND

burada NN parametre sayısı, DD training token’ları ve CC toplam floating-point operations’tır. Kaplan ve arkadaşları bunu iki adımda türetir.1 Forward: parametre başına token başına 2 FLOP, çünkü bir matrix multiply’daki her parametre token başına bir kez, bir çarpma ve bir toplamada kullanılır. Backward: forward’ın iki katı, çünkü Bölüm 5’in backward pass’i her layer’da iki gradient hesaplar — sinyalin yolculuğu sürsün diye layer’ın input’larına göre ve layer’ın weight’lerine göre — her biri forward ile aynı boyutta bir matrix multiply olduğundan 4N4N.

Bütün türetme bu; inanmak yerine kontrol etmeye değer. PyTorch gerçek bir FLOP sayacıyla gelir: torch.utils.flop_counter.FlopCounterMode. Bu sayaç, modelin dispatch ettiği her operation’ı yakalar ve gerçek işi toplar. Dört büyüklük mertebesi boyunca çalıştır; en büyüğü, şekilleri ayırıp memory ayırmayan meta device üzerinde olsun:

flops.pyPYTHON
from torch.utils.flop_counter import FlopCounterMode

counter = FlopCounterMode(display=False)
with counter:                       
    loss = model(x, targets)[1]     
    loss.backward()                 
measured = counter.get_total_flops()
print(measured / (6 * n_params * n_tokens))
yapılandırmaembedding olmadan NNtoplam NNölçülen, fwd+bwd÷ 6ND6ND (toplam NN)÷ 6ND6ND (emb. yok)fwd+bwd ÷ fwd
dd 128, 4 layer, TT 256788.7367.254.4004.60e101.0319.4853.000
dd 512, 8 layer, TT 25625.183.23251.045.8883.26e111.0382.1043.000
dd 768, 12 layer, TT 102484.973.056124.356.8641.75e121.1451.6763.000
dd 1600, 48 layer, TT 10241.474.870.4001.556.920.0002.10e131.1001.1613.000
dd 4096, 32 layer, TT 20486.442.983.4246.582.444.0328.74e131.0801.1043.000
dd 8192, 80 layer, TT 819264.427.147.26465.544.929.2803.75e151.1631.1833.000

Forward+backward’ın forward’a oranı 3.000, her ölçekte tam olarak böyle: tesadüfen iyi çıkan bir yaklaşım değil, türetmeden haberi olmayan bir sayacın yukarıdaki aritmetik özdeşliği yuvarlak bir sayı olarak geri vermesi.

Ölçülen toplam daha sonra, NN embedding matrislerini saydığında 6ND6ND değerinin %3 ila %17 üstünde durur — ve bu cümle önemlidir, çünkü iki kurucu makale NN değerini farklı sayar. Kaplan, “çok daha temiz scaling laws ürettiği” için “tüm vocabulary ve positional embeddings”i hariç tutar (§1.3); Chinchilla’nın Ek F’si “toplam parametre sayısına embedding matrislerini de sayıyoruz” der.2 İlk satırın gösterdiği gibi, geniş bir vocabulary ve dar bir hidden dimension için ikisi dokuz kat farklıdır.

Kalan fark, 6ND6ND’in bilinçli olarak dışarıda bıraktığı şeydir: attention skorları. Kaplan’ın Denklem (2.2)’si forward maliyetini 2N+2nlayernctxdmodel2N + 2\,n_{\text{layer}} n_{\text{ctx}} d_{\text{model}} olarak yazar ve ikinci terimi dmodelnctx/12d_{\text{model}} \gg n_{\text{ctx}}/12 olduğu için atar — 2020’de güvenli, şimdi daha az güvenli; T/dT/d büyüdükçe oranın yukarı kaymasının nedeni de bu — bu yüzden burada iki satır TT değerini 1.024 olarak paylaşır ve dd 768’den 1.600’e çıktığında oran düşer, 1.145’ten 1.100’e. Bu, Bölüm 9’un tanıttığı ve Bölüm 16’nın fiyata çevirdiği O(T2)O(T^2) maliyetidir.

Compute, bir çalıştırmanın ne kadar süreceğine karar verir; memory, başlayıp başlayamayacağına. Düz fp32 AdamW ile eğit ve her parametre dört sayı taşır: weight, gradient, Adam’ın running mean’i mm ve variance’ı vv — Bölüm 6’da elle kurulan iki ortalama. Dört byte’lık dört sayı, tek bir activation’dan önce parametre başına 16 byte eder. 8 GB’lık bir laptop GPU’sunda, step içinde graph’ın canlı olmadığı noktadaki resident allocation alınarak ölçüldü:

modelvocabularybatchNNtahmin edilen 16N16Nölçülen residentstep içi peakfark
dd 512, 8 layer50.257851.045.888779 MB801 MB2.500 MB1.699 MB
dd 512, 8 layer4.096827.411.456418 MB426 MB1.043 MB617 MB
dd 256, 6 layer4.09685.839.36089 MB89 MB382 MB293 MB
dd 256, 6 layer4.096325.839.36089 MB89 MB1.259 MB1.170 MB
dd 256, 6 layer4.0961285.839.36089 MB89 MB4.771 MB4.681 MB

Tahmin ve ölçüm %3 içinde uyuşuyor. Sürpriz son sütunda: activation’lar modeli gölgede bırakıyor. 89 MB kalıcı durum isteyen aynı 5,8 milyon parametreli model, 128 batch’te 4.681 MB activation istiyor — modelin elli iki katı — ve bunun çoğu transformer bile değil. Bu, logits: token başına vocabulary boyutunda bir vektör, giriş başına dört byte. Son satırda 512 MB, ilk satırda 393 MB. Vocabulary boyutu Bölüm 7’de seçilmişti ve hâlâ kartta neyin sığacağını belirliyor.

Hangi terimin baskın olduğu çalıştırmanın şekline bağlıdır; bu yüzden Micikevicius ve arkadaşları memory’nin “activation’ların baskınlığı altında” olduğunu söylerken3 ZeRO, 1,5 milyar parametreli bir modelin yalnızca model durumları için “en az 24 GB” istediğini söyler.4 ZeRO aynı 16 byte’a başka bir yoldan ulaşır — fp16 weights için 2Ψ2\Psi, fp16 gradients için 2Ψ2\Psi, fp32 master weights ve Adam’ın iki moment’inin her biri için 4Ψ4\Psi — ki 70 milyar parametre için bu, tek bir activation’dan önce 1,12 terabayt, yani on dört adet 80 GB GPU eder.

Parallelism, bir paragraf ve bir delege etme

Bölüme bağlantı: Parallelism, bir paragraf ve bir delege etme

Bunların hiçbiri frontier ölçekte tek bir device’a sığmaz; bu yüzden çalıştırma aynı anda dört şekilde bölünür. Data parallelism, modelin bir kopyasını her GPU’ya koyar ve gradient’ları ortalar — varsayılan budur; ZeRO’nun iyileştirdiği şey, optimiser state’in redundant kopyalarını tutmayı reddetmesidir. Tensor parallelism, tekil matrisleri device’lar arasında böler. Pipeline parallelism, her device’a bitişik bir layer grubu verir. Context parallelism, sequence’in kendisini böler; yalnızca TT attention terimi baskın olacak kadar uzadığında gerekir. Llama 3’ün Tablo 4’ü dördünü birden listeler: 16.384 H100 GPU üzerinde tensor 8, context 16’ya kadar, pipeline 16, data 128’e kadar.5 Bu kursun bu konuda söyleyeceği her şey bu; distributed training engineering başlı başına bir dönemlik derstir ve Stanford’ın CS336’sı, 5’ten 8’e lecture’ları ve koduyla, o dönemdir.6 Delegasyondan geriye tek bir sayı kalır: model FLOPs utilisation — gerçek bir çalıştırmanın bir GPU’nun peak aritmetiğinin hangi fraksiyonunu başardığı — ve düzenli 6ND6ND değerini wall-clock time’a, dolayısıyla paraya çeviren şey budur.

Ocak 2020’de Kaplan ve arkadaşları bir transformer grid’i eğitti ve test loss’un, altıdan fazla büyüklük mertebesi boyunca üç kaynağın her birinde power law izlediğini buldu.1 §1.2 üç fitted law verir:

L(N)=(NcN)αN,αN0.076,Nc8.8×1013L(N) = \left(\frac{N_c}{N}\right)^{\alpha_N}, \qquad \alpha_N \approx 0.076, \qquad N_c \approx 8.8 \times 10^{13}

yanında data için αD0.095\alpha_D \approx 0.095 ve optimal ayrılmış compute için αCmin0.050\alpha_C^{\min} \approx 0.050 bulunur. Sabitler evrensel değildir ve makale bunu söyler: “NcN_c, CcminC_c^{\min} ve DcD_c değerlerinin kesin sayısal değerleri vocabulary size ve tokenization’a bağlıdır; dolayısıyla temel bir anlamları yoktur.”

Üsler küçücüktür: parametreleri on katına çıkarmak kalan loss’tan 100.0761.1910^{0.076} \approx 1.19 çarpanı kadar alır. Bu hiçbir şey gibi gelir ve buradaki en önemli gerçek de budur — getiriler berbat ve asla durmuyor. Küçük üsse sahip bir power law, bir sonraki büyüklük mertebesinin de yardımcı olacağını, önceki kadar olmasa da sonsuza dek yardımcı olacağını vaat eder. Compute satın almak kumar olmaktan çıkar, yayımlanmış döviz kuru olan bir satın almaya dönüşür; sermayenin kilidini açan argüman tam olarak buydu.

Sonra reçete geldi ve makalenin sektöre çok paraya mal olacak şekilde yanıldığı yer burasıydı. Kaplan’ın Tablo 6’sı NoptC0.73N_{\text{opt}} \propto C^{0.73} ve DoptC0.27D_{\text{opt}} \propto C^{0.27} değerlerini verir: compute’un on katı, yalnızca 1,9 kat daha fazla metinle beslenen 5,4 kat daha büyük bir model demektir. Abstract açıktır — “optimal compute-efficient training, çok büyük modelleri nispeten mütevazı miktarda data üzerinde eğitmeyi ve convergence’dan ciddi şekilde önce durmayı içerir.” Alan da aynen bunu yaptı: GPT-3, 300 milyar token üzerinde 175 milyar parametre,7 Gopher 300 milyar üzerinde 280 milyar, Megatron-Turing NLG 270 milyar üzerinde 530 milyar.2 Tahtanın tamamında parametre başına yarım token ile iki token arası.

Chinchilla ve yukarıdaki sweep’in ölçtüğü şey

Bölüme bağlantı: Chinchilla ve yukarıdaki sweep’in ölçtüğü şey

Mart 2022’de Hoffmann ve arkadaşları 70 milyondan 16 milyar parametreye kadar 400’den fazla model eğitti ve üç bağımsız yoldan zıt sonuca ulaştı.2 Tablo 2, NoptCaN_{\text{opt}} \propto C^{a} içindeki aa üssünü 0,50, 0,49 ve 0,46 olarak bildirir; Kaplan’ınki 0,73’tür. Düz dille: model boyutu ve training data eşit oranda büyümelidir.

İkinci yaklaşımları, bu bölümün başındaki sweep’in milyon kat küçük ölçekte yeniden ürettiği yaklaşımdır: bir bütçe sabitle, birçok boyutu tam o bütçede eğit, final loss’u model boyutuna karşı çiz.

parametrelerC=1013C = 10^{13}C=3.16×1013C = 3.16 \times 10^{13}C=1014C = 10^{14}
98.6245.3531 (171)4.8638 (542)
150.3205.4636 (74)
194.2085.5041 (44)4.8730 (140)4.4040 (442)
295.8085.5550 (19)4.9029 (60)4.3383 (190)
665.2805.7849 (3.8)5.1254 (12)4.4192 (38)
1.280.7685.8174 (1.0)5.1751 (3.2)4.5003 (10)
3.101.5685.4686 (0.5)4.7768 (1.7)
5.315.0725.5894 (0.2)4.8514 (0.6)
15.053.5685.3534 (0.1)

Held-out loss, token başına nat cinsinden; parantez içinde parametre başına token; her bütçedeki en iyi model kalın; tire, bütçenin corpus’ta bulunandan fazla metin istemesi ya da boyutun o sweep’te taranan aralığın dışında kalması nedeniyle çalıştırılmayan bir noktadır.

Bir sütunda aşağı oku: loss düşer, dip yapar ve tekrar yükselir. Bir model, bütçesi için fazla küçük olabildiği kadar kolay fazla büyük de olabilir101410^{14} değerinde 295.808 yerine 665.280 parametre seçmenin cezası 0,08 nat’tır; yukarıda fitted envelope üzerinde bu, doğru boyutlandırılmış bir modelin %18 daha az compute ile ulaştığı loss’tur. Yanlış şekli seçmek bütçenin beşte birini çöpe atar. Bu, dört yüz model yerine tek GPU üzerinde bir öğleden sonra üretilmiş Chinchilla Şekil 3’tür.

Şimdi yatay oku. 101310^{13} değerinde en iyi model sweep’teki en küçük modeldir; 101410^{14} değerinde 295.808 parametre, iki yanında bracket edilmiş durumdadır. Bütçe büyüdükçe optimum sağa kayar; düzeltmenin tüm içeriği budur. Makalenin üçüncü yaklaşımını — her çalıştırma üzerinde L(N,D)=E+A/Nα+B/DβL(N,D) = E + A/N^{\alpha} + B/D^{\beta} yüzeyini — fit et ve C=6NDC = 6ND koşuluyla minimize et:

TEXT
L(N, D) = 24.7 / N^0.195 + 46.8 / D^0.169       (E fits to ~0; see below)
implied   N_opt ∝ C^0.464
  compare   Chinchilla 0.46-0.50 · Besiroglu 0.513 · Kaplan 0.73

0.46, bir laptop’tan, Kaplan’ın 0.73’üne karşı. Üç bütçeli bir fit’ten üç basamak uyum şanstır; ilk basamağa kadar uyum şans değildir. Üs seyahat eder — sabit etmez, çünkü bu optimumlardaki token-parametre oranı 20 değil, 170 ile 540 arasındadır. Üç neden, hepsi öğretici. EE sıfıra fit eder, çünkü 4 nat üzerindeki bir loss’ta çalıştırma Chinchilla’nın fit’ine hâkim olan entropy floor’a hiç yakın değildir. Batch size ve learning rate her nokta için ayrı tuned edilmek yerine sabit tutuldu; bu da en az step alan çalıştırmaları sakatlar — onlar da büyük modellerdir: 101310^{13} FLOPs değerinde 1,28 milyon parametreli bir model toplam 159 optimiser step alır; Kaplan’ın SminS_{\min} teriminin herhangi bir modelin ihtiyaç duyduğunu söylediği birkaç binin çok altında. Bir scaling law bir rejimin içinde fit edilir ve bu rejim Chinchilla’nın altı büyüklük mertebesi altındadır.

Bu yüzden makalenin abstract’ı: “mevcut large language models ciddi şekilde undertrained.” Chinchilla bunun gösterimidir — Gopher’ın 300 milyar token üzerinde 280 milyarıyla aynı toplam compute ile, 1,4 trilyon token üzerinde 70 milyar parametre; 57 MMLU task’ının 51’inde onu geçer, %60’a karşı %67,5.2 Dört kat daha küçük, dört buçuk kat daha fazla metin, aynı para, daha iyi model.

O meşhur oran hakkında iki uyarı. “Parametre başına yirmi token” makalede geçen bir cümle değildir; makale yalnızca “model boyutunun her iki katına çıkışında training token sayısı da iki katına çıkmalıdır” der. 20, Tablo 3’ten ve Chinchilla’nın kendi 1,4 T üzerinde 70 B’sinden çıkarımdır. Ve hassasiyeti yayımlandığından kötüdür: Besiroglu ve arkadaşları Şekil 4’ün digitisation’ından yeniden fit etti, orijinal parametrelerin “yeniden oluşturulan data’ya kötü fit ettiğini” ve aralıkların “data point sayısı göz önüne alındığında akıl almaz derecede dar” olduğunu buldu; dürüst aralığı parametre başına “4 ile 40 arasında” token olarak koydu.8

Chinchilla’nın yöntemindeki bir ayrıntı, Bölüm 1’in learning-rate schedules hakkında verdiği sözü yerine getirir. Cosine schedule, token bütçesiyle eşleştirilmelidir. 10 milyon token görecek bir model learning rate’ini 10 milyon token’da sıfıra indirmelidir; ona 100 milyon için boyutlandırılmış bir schedule verip erken durdurursan, çok yüksek bir rate’te inişin ortasındaki loss’u okuyorsun demektir. Chinchilla, tam bunu kontrol etmek için her modeli dört cycle length’te eğitir; yukarıdaki sweep de aynı nedenle schedule’ını bütçeden ayarlar.

Alandaki en yararlı ampirik sonuçlardır ve rutin olarak fazla satılırlar. Dört sınır.

Loss’u tahmin ederler, capability’yi değil. Sol taraf held-out text üzerindeki cross-entropy’dir. Bu makalelerde hiçbir şey, bir modelin doğru SQL yazıp yazmayacağı, zararlı bir isteği reddedip reddetmeyeceği ya da bir tool kullanıp kullanmayacağı hakkında iddiaya izin vermez. Bu yine Bölüm 5’in dersidir: loss tahmini, parasını ödediğin davranışın tahmini değildir.

Türetilmezler, fit edilirler. Hiçbir teori αN=0.076\alpha_N = 0.076 üretmez. Sabitler tokenizer ile hareket eder — bu yüzden Bölüm 8’in açıkladığı gibi iki tokenizer arasında perplexity karşılaştırması anlamsızdır — ve data mixture, architecture ve optimiser ile de hareket eder. Yayımlanmış her yasa, onu üreten setup’ın yasasıdır; Meta’nın Llama 3’ten önce kendi yasasını yeniden fit etmesinin nedeni de bu.5

Her step için taze bir token varsayarlar, bu da sessizce sonsuz bir corpus varsayar. Muennighoff ve arkadaşları corpus bitince ne olduğunu ölçtü: tekrarlanan data’nın dört epoch’una kadar maliyet neredeyse yoktur — dört kez görülen 44 milyar unique token üzerinde 8,7 milyar parametreli bir model, 178 milyar unique token üzerindeki aynı modele göre “yalnızca %0,5 daha yüksek validation loss” ile bitirdi — yaklaşık on altı epoch’tan sonra ise ek compute hiçbir şey satın almaz.9

Ve artık kimse compute-optimal eğitmiyor. Chinchilla training maliyetini minimize eder; deployed model ise bundan sonra üretilen token başına kabaca 2N2N FLOPs öder, sonsuza dek. LLaMA 1 bunu açıkça söyledi: “hedef bir performance düzeyi verildiğinde, tercih edilen model eğitmesi en hızlı olan değil, inference’ta en hızlı olandır.”10 Sardana ve arkadaşları bunun yerine 6NDtrain+2NDinference6ND_{\text{train}} + 2ND_{\text{inference}} değerini minimize ederek formelleştirdi ve bir milyar request bekleyen herkesin “Chinchilla-optimal’den daha küçük ve daha uzun” eğitmesi gerektiğini buldu.11 Llama 3’ün §9.1’i katılır: küçük modelleri “compute optimal training noktasının çok ötesinde” eğitilir; effectively training compute’u inference efficiency ile takas eder.5 Oran eskimiş değildir; sadece artık sorulan soru olmayan bir soruya cevap verir.

Emergent abilities ve gerçek olup olmadıkları tartışması

Bölüme bağlantı: Emergent abilities ve gerçek olup olmadıkları tartışması

Loss pürüzsüz biçimde düşer. Benchmark skorları bazen düşmez. Wei ve arkadaşları, bir task’ın training compute’un büyüklük mertebeleri boyunca şans seviyesinde kaldığı ve sonra sıçradığı örnekler topladı — GPT-3’te yaklaşık 2×10222 \times 10^{22} FLOPs civarında görünen üç basamaklı aritmetik, 33 ile 5×10235 \times 10^{23} arasında tahminin üstüne çıkan MMLU — ve desene ad verdi: “bir ability, küçük modellerde yok ama büyük modellerde varsa emergent’tır.”12 Bu gerçek bir özellikse ucuz deneylerden extrapolate etmek güvenli değildir, çünkü satın aldığın capability test etmeye paran yeten hiçbir ölçekte var olmayabilir.

Schaeffer, Miranda ve Koyejo bunun çoğunun ölçüm artefact’i olduğunu savundu; mekanizma da aritmetiktir.13 Token başına loss pürüzsüz düşer, bu yüzden tek bir token’ın doğru olma olasılığı, exp(L)\exp(-\mathcal{L}), kademeli olarak iyileşir. Modeli LL-token bir cevap üzerinde exact string match ile puanlarsan bu olasılığı LL kuvvetine çıkarırsın — büyük bir kuvvete yükseltilmiş pürüzsüz bir eğri uçurum gibi görünür. Aynı çıktılar üzerinde hepsini istemek yerine token sayan bir metriğe geç ve “ailenin performance’ı scale arttıkça pürüzsüz, sürekli ve öngörülebilir biçimde iyileşir.”

Hatırlanacak sayı onların audit’idir — “BIG-Bench’teki 39 preferred metric’in en fazla 5’i emergence gösteriyor”; iki discontinuous metric iddia edilen vakaların %92’sinden fazlasını açıklıyor — ve uyarıları da öyledir: “bu makaledeki hiçbir şey large language models’ın emergent abilities gösteremeyeceğini iddia ediyor şeklinde yorumlanmamalıdır.” Bir grafikteki sıçrama, aksi gösterilene kadar metric hakkında kanıttır. Bölüm 29’da bu senin problemin olacak, çünkü hard-cutoff metric seçmek, fark etmeden vereceğin bir karardır.

Corpus, pretraining çalıştırmasının denklem eklenmemiş kısmıdır ve en sonuç doğuran kararların çoğu burada yaşar. Ham madde bir web crawl’dır: Common Crawl’ın Ağustos 2026 arşivi “2,14 milyar web sayfası veya 360 TiB sıkıştırılmamış içerik” barındırır; bunun bir ayı ücretsiz indirilebilir.14 Neredeyse hiçbiri olduğu gibi kullanılabilir değildir. T5 makalesi crawl’ın “büyük ölçüde menüler, hata mesajları veya duplicate text gibi anlamsız ya da boiler-plate text” içerdiğini söyler ve tanıttığı C4 pipeline’ı kaba heuristics listesidir — yalnızca terminal punctuation ile biten satırları tut, üçten az cümle içeren sayfaları at, curly brace veya halka açık bir küfür listesinden bir kelime içeren her sayfayı at — aylık yirmi terabayt metni yaklaşık 750 GB’a çevirir.15

“Kaba” doğru kelime. Dodge ve arkadaşları bu filtrelerin neyi kaldırdığını audit etti ve obscenity blocklist’in African-American English dokümanlarının %42’sini ve Hispanic-aligned English dokümanlarının %32’sini, White-aligned English’in %6,2’sine karşılık sildiğini, geriye %97,8’i son kategoriden oluşan bir corpus bıraktığını buldu.16 Dialect hakkında fikri olmayan bir kuralın fikri vardı.

Sonra deduplication gelir; bu housekeeping değildir: Lee ve arkadaşları C4’te 61 kelimelik bir cümlenin 61.036 kez tekrarlandığını buldu ve deduplication’ın modellerin “ezberlenmiş metin yayma” oranını generated token’ların %1,9’undan %0,19’una, on kat düşürdüğünü gösterdi.17 Yine de daha fazlası daha iyi değildir — FineWeb ekibi 96 crawl üzerinde global deduplication yaptı, 4 trilyon token elde etti ve ölçülebilir gain alamadı; sonra her crawl’ı ayrı deduplicate etti, 20 trilyon elde etti ve mevcut en iyi corpus ile eşleşti.18

Sonra contamination. Llama 3 kendininkini ölçtü ve yayımladı: AGIEval’in %98’i, BIG-Bench Hard’ın %95’i ve HellaSwag’in %85’i training set ile 8-gram overlap gösteriyordu; MMLU için overlap o kadar yüksekti ki “iyi bir performance gain estimate almak imkânsız.”5 GPT-3’ün §4’ü, benchmark’ları data içinde bırakan ve geri dönüş yolu olmayan bir filtering bug bildirir: “cost considerations nedeniyle modeli yeniden eğitmek infeasible’dı.”7

Provenance çözülmemiş kısımdır. The Pile, Books3 adlı 100,96 GiB’lik bir bileşenle geldi — corpus’un %12’si ve makalenin kendi consent table’ına göre private torrent tracker’dan gelen kitaplar;19 Ağustos 2023’te bir copyright complaint sonrası offline’a alındı. Eylül 2026 itibarıyla hukuki pozisyon belirsizdir ve trend diye alıntılanan üç ABD kararı birbiriyle uyuşmaz. Alsup, hukuken edinilmiş kitaplarla training’i “son derece transformative” bulurken pirated kopyalardan kurulan bir library’nin öyle olmadığını belirtti; Anthropic bu yarıyı $1,5 milyar karşılığında, 482.460 eseri kapsayacak şekilde, eser başına yaklaşık $3.000 ile, 20 Temmuz 2026’da onaylanan şekilde settle etti.20 Chhabria, Meta lehine summary judgment verdi ama kararının “Meta’nın copyrighted materials’ı language models eğitmek için kullanmasının lawful olduğu önerisini desteklemediğini”, yalnızca “bu plaintiffs’ın yanlış argümanları sunduğunu” yazdı.21 Ross Intelligence aleyhine karar veren Bibas, “bugün önümde yalnızca non-generative AI var” diye not etti.22 Hiçbir ABD appellate court bu soru hakkında karar vermedi.

İnsanlar loss’un yapamadığı parçaları yapar. TIME, Ocak 2023’te OpenAI için Sama firması üzerinden toxic text label’layan çalışanların, çocuk cinsel istismarı, işkence ve kendine zarar vermeyi anlatan pasajları okurken “saatte yaklaşık $1,32 ile $2 arasında” net aldığını, OpenAI’ın bu iş için Sama’ya saatte $12,50 ödediğini bildirdi; Sama hem ücret aralığına hem kotaya itiraz ediyor.23 Bu pretraining’in kendisi değil, pretraining etrafındaki filtering’dir — ama aynı faturadadır ve bir insanın oturduğu yer orasıdır.

Elektrik gerçektir ve genellikle yanlış alıntılanır. Yayımlanmış en dikkatli rakam BLOOM’undur: çalıştırma için 1.082.990 GPU-saat, 433 MWh ve 24,7 ton CO₂ eşdeğeri; manufacturing ve idle nodes sayıldığında 50,5;24 Patterson ve arkadaşları GPT-3’ü 1.287 MWh ve 552 ton olarak verir.25 İki uyarı. BLOOM’un avantajı efficiency değil, 57 g CO₂/kWh’lik Fransız nükleer şebekesidir — OPT-175B’den daha fazla enerji kullandı. Ve alanın en çok alıntılanan emissions rakamı, Strubell ve arkadaşlarının neural architecture search için verdiği 626.155 lb, daha sonra 88 kat fazla gösterildi; çünkü search’ün proxy üzerinde değil, full model size’da çalıştığı varsayılmıştı.26 LBNL’nin framing’i savunulabilir olandır: ABD data centre’ları 2024’te 192 TWh kullandı, ulusal elektriğin %4,7’si — tek bir çalıştırmaya değil, bir sektöre bağlı bir sayı.27

Ana çizgi, Bender ve arkadaşlarının documentation debt dediği şeydir: “datasets hem belgelenmemiş hem de post hoc belgelenemeyecek kadar büyükken kendimizi bir durumun içine koymak.”28 Yukarıdaki her gerçek, birisi baktığı için var. Çoğu insanın kullandığı modellerin arkasındaki corpora için kimse bakamaz.

Şimdi herkesin istediği aritmetik: dört cited input’tan, bayatladıklarında hangisinin değiştirileceği belli olsun diye.

NVIDIA’nın H100 sayfası, “with sparsity” dipnotu altında 1.979 teraFLOPS BF16 tensor-core throughput listeler.29 Hiçbir pretraining run structured sparsity kullanmaz; bu yüzden dense rakam bunun yarısıdır: 989,5 TFLOP/s.

Llama 3’ün Tablo 4’ü %38–43 BF16 model FLOPs utilisation bildirir. %40 al: GPU başına 395,8 TFLOP/s faydalı aritmetik.5

Lambda’nın 8×H100 SXM node için on-demand fiyatı, 2026-09-06’da erişildi: GPU-saat başına $3,99, yani node için saatte $31,92.30

Chinchilla’nın oranı, D=20ND = 20N, C=6ND=120N2C = 6ND = 120N^2 değerini ve dolayısıyla N=C/120N = \sqrt{C/120} değerini verir.

bütçeH100-saatFLOPscompute-optimal parametretokentek bir 8×H100 node üzerinde90 günde bitirmek için GPU
$100253.6e19546 M10.9 B3,1 sa1
$1.0002513.6e201,73 B34,5 B31,3 sa1
$10.0002.5063.6e215,46 B109 B13 gün2
$100.00025.0633.6e2217,3 B345 B131 gün12
$1.000.000250.6273.6e2354,6 B1,09 T4 yıl116
$10.000.0002.506.2663.6e24173 B3,45 T36 yıl1.160
$100.000.00025.062.6573.6e25546 B10,9 T358 yıl11.603

Son iki sütunu birlikte oku. $10.000’de, kiralık tek node üzerinde iki haftada 5 milyar parametreli bir model alırsın. $100.000.000’de aritmetik 546 milyar parametre der — ve üç ay boyunca birbirine bağlanmış on iki bin H100 ister; bu kredi kartıyla kiralayacağın bir şey değildir. Yaklaşık $100.000’den sonra bağlayıcı kısıt para olmaktan çıkar, cluster olur.

Böyle bir tabloya güvenmeden önce, gerçek maliyeti yayımlanmış çalıştırmalara karşı test et — llm.c, GPT-2 124M’yi 8×A100 node üzerinde “~90 dakikada” “yaklaşık $20” karşılığında, GPT-2 1.6B’yi ise 8×H100 node üzerinde 24 saatte $672’ye yeniden üretir.31

TEXT
$672, against what $672 actually bought (llm.c GPT-2 1.6B, one 8xH100 node, 24 h)
  this table predicts:      168 H100-hours   N = 1.41 B params   D = 28.3 B tokens
  what was actually run:    192 H100-hours   N = 1.558 B params  D = 33.6 B tokens

Llama 3 405B, against Meta's own published GPU-hours
  from the paper's 3.8e25 FLOPs at 40 % MFU:   26.67 M H100-hours
  published in Meta's Llama 3.1 model card:    30.84 M H100-hours    ratio 0.86

İkisi de yaklaşık %15 içinde; bu, bu tür bir estimate’in hak ettiği doğruluk civarıdır ve genellikle alıntılandığı doğruluktan çok daha iyidir.

Manşet karşılaştırma, iki tanım da masada

Bölüme bağlantı: Manşet karşılaştırma, iki tanım da masada

Bu konuda en çok tekrarlanan rakam, 2019’da yaklaşık $43.000’a mal olan GPT-2 sınıfı bir modelin bugün birkaç on dolara yeniden üretilebildiğidir. Modern yarı iyi belgelenmiştir; tarihsel yarı değildir.

Bugün. Karpathy’nin nanochat README’si: “kendi GPT-2 capability LLM’inizi ... yalnızca $48’e (~2 saat 8XH100 GPU node) ... eğitebilirsiniz. Spot instance üzerinde toplam maliyet ~$15’e daha yakın olabilir.”32 Burada “GPT-2 capability” kesin ve yayımlanmıştır — 14 Mart 2026 itibarıyla en iyi entry’si 1,65 saat olan leaderboard’da GPT-2’nin CORE score’u 0.256525’i geçmek. $48, Lambda’nın list price’ı $3,99’un altında, GPU-saat başına $3 varsayar; list price ile $64’e daha yakındır.

2019’da. Birincil kaynak yoktur: OpenAI hiçbir süre veya maliyet yayımlamadı. Zincir The Register, Şubat 2019, fiyat ve süre vermeden “256 Google TPU3 core” bildirimiyle başlar; sonra Synced, Haziran 2019, hardware maliyetinin Google Cloud’da saatte $256 olduğunu not eder ve açıkça “OpenAI training duration’ı belirtmedi” der. $43.008, saatte $256 ile kimsenin kaynak göstermediği varsayılan 168 saatin çarpımıdır.

Dürüst manşet şu olur: GPT-2’nin yayımlanmış benchmark skorunu eşleyen bir model bugün kiralık hardware üzerinde $100’ın çok altında eğitilebilir; 2019 maliyeti ise hiç yayımlanmamıştır ve meşhur estimate’i süre hakkında kaynaksız bir tahmine dayanır. Çöküş gerçektir ve modern yarı kredi kartı olan herkes tarafından yeniden üretilebilir; oran ise var olmayan bir sayı üzerinde aritmetiktir. Yayımlanmış training cost’ların genel durumu budur. GPT-3 makalesi hiç dolar tutarı içermez, yalnızca Tablo D.1’de 3.14×10233.14 \times 10^{23} FLOPs vardır;7 Llama 3 makalesi de içermez.5 Okuduğun her training cost, bir FLOP count, bir hardware varsayımı ve bir fiyat varsayımından yapılmış estimate’tir — her zaman kimin varsayımı olduğunu sormaya değer.

Base model ne bilir ve ne zaman bilmeyi bıraktı

Bölüme bağlantı: Base model ne bilir ve ne zaman bilmeyi bıraktı

Ortaya çıkan şey sabit bir anda derlenmiş sabit bir corpus görmüştür ve bundan iki özellik çıkar.

İlki knowledge cutoff’tur. Toplama tarihinden sonra model hiçbir şey bilmez — “emin değildir” değil, hiçbir şey — ve bunu söylemek yerine akıcı biçimde uydurur, çünkü bunu söylemek eğitim aldığı bir davranış değildir. Llama 3.1’in model card’ı Aralık 2023 der;33 her modelin bir tarihi vardır ve bu deployment’ın değil, training data’nın özelliğidir. Etrafından dolaşmak bir retrieval problemidir; bu da Bölüm 19’dur.

İkincisi, base model’in cevaplamak yerine tamamlamasıdır. Ona “Fransa’nın başkenti neresidir?” ver; makul bir continuation başka bir sorudur, çünkü corpus’ta bu string en sık alıştırma listelerinde görünür.

Bir metin tamamlayıcı assistant değildir. Talimatları izlemez, çünkü corpus’ta bir request’in sürdürülmek yerine yerine getirilmesi gerektiğini söyleyen hiçbir şey yoktu. İki katılımcılı bir conversation kavramı yoktur. Zararlı bir prompt’un en olası continuation’ını memnuniyetle üretir, çünkü optimize edildiği tek şey probable olmaktır.

Onu cevap veren bir şeye dönüştürmek, ilkinin yüzde birinin küçük bir kesri kadar maliyetli ikinci bir aşama ister; bu aşama neredeyse tamamen ona istediğin davranışın örneklerini göstermekten ve sonra kendi output’larının çiftlerini karşılaştırmaktan oluşur. Instruction following, chat templates, refusals ve — insanlar buna şaşırır — tool call etme yeteneği hep bu aşamadan gelir. Bölüm 11 bu aşamadır: supervised fine-tuning, RLHF, DPO ve GRPO; ayrıca “aligned”ın ne anlama geldiği ve buna kimin karar verdiği sorusu.


Bu bölümle birlikte okumaya değer başka kaynaklar: Karpathy’nin build-nanogpt’i ve ona eşlik eden video; tam GPT-2 reproduction’ı bu bölümün yapamayacağı bir tempoda baştan sona yürütür. Ayrıca Stanford CS324, Large Language Models; data ve environmental impact üzerine lecture’ları, bu kursun bir kez ele alıp delege ettiği malzemede yukarıdaki bölümden daha derine iner.

  1. Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J. and Amodei, D. Scaling Laws for Neural Language Models. arXiv:2001.08361 (2020). Üç power law, §1.2’deki Denk. (1.1)–(1.3)’tür ve tam sabitler Ek A, Tablo 5’tedir; 6N6N türetmesi §2.1’dedir; compute-allocation üsleri Tablo 6’dadır. İki compute law olduğuna dikkat et: fixed batch size’da αC=0.057\alpha_C = 0.057 ve optimal batch size’da αCmin=0.050\alpha_C^{\min} = 0.050; makale ikincisinin “predictions yapmak için kullanılmalı” olduğunu söyler. 2

  2. Hoffmann, J., Borgeaud, S., Mensch, A., Buchatskaya, E., Cai, T., Rutherford, E. et al. Training Compute-Optimal Large Language Models. arXiv:2203.15556 (2022). Üsler Tablo 2’de, projected budgets Tablo 3’te, Gopher karşılaştırması §4’te, parameter-counting convention Ek F’dedir. Tablo 3’ün altındaki prose, 175 B ve 280 B satırları için Tablo 3’ün kendisiyle çelişir; alıntılanacak sürüm tablodur. 2 3 4

  3. Micikevicius, P., Narang, S., Alben, J., Diamos, G., Elsen, E., Garcia, D. et al. Mixed Precision Training. arXiv:1710.03740 (2017), ICLR 2018. FP32 master weights §3.1’de, loss scaling §3.2’dedir. 2

  4. Rajbhandari, S., Rajbhandari, S., Ruwase, O. and He, Y. ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054 (2019), SC20. 16Ψ16\Psi accounting §3.1’dedir; activations için residual-state rakamları §3.2’dedir.

  5. Grattafiori, A. et al. (Llama Team, AI @ Meta). The Llama 3 Herd of Models. arXiv:2407.21783 (2024). Compute budget ve token count §1’de, yeniden fit edilmiş scaling law §3.2.1’de, parallelism configuration ve MFU Tablo 4’te, contamination analysis §5.1.4’te, over-training statement §9.1’dedir. Makale dolar rakamı ve emissions table içermez. 2 3 4 5 6

  6. Stanford CS336, Language Modeling from Scratch. Lecture 2 resource accounting’i, lectures 5–8 GPUs, kernels ve parallelism’i, lectures 9 ve 11 scaling’i, lectures 13–14 data’yı kapsar. Bu bölümün engineering’i delege ettiği ders budur ve herkese açıktır.

  7. Brown, T. B. et al. Language Models are Few-Shot Learners. arXiv:2005.14165 (2020). Compute Ek D, Tablo D.1’dedir — orada başlığı kelimesi kelimesine “flops per param per token” olan bir sütun vardır ve her GPT-3 satırındaki değeri 6’dır. Contamination analysis §4’tedir. 2 3

  8. Besiroglu, T., Erdil, E., Barnett, M. and You, J. Chinchilla Scaling: A replication attempt. arXiv:2404.10102 (2024). Chinchilla’nın data’sını Şekil 4’ünü digitising ederek yeniden oluşturur, yeniden fit eder ve düzeltilmiş üsleri ve çok daha geniş aralıkları bildirir.

  9. Muennighoff, N., Rush, A. M., Barak, B., Le Scao, T., Piktus, A., Tazi, N., Pyysalo, S., Wolf, T. and Raffel, C. Scaling Data-Constrained Language Models. arXiv:2305.16264 (2023), NeurIPS 2023. Dört-epoch sonucu §6’dadır; on altı-epoch half-life fitted RD15R_D^* \approx 15’dir.

  10. Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T. et al. LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 (2023). §1, Chinchilla-optimal training’e karşı inference-cost argümanını belirtir.

  11. Sardana, N., Portes, J., Doubov, S. and Frankle, J. Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws. arXiv:2401.00448 (2023), ICML 2024. §5 ayrıca karşı ağırlığı içerir: extreme token ratios ile eğitilen modeller iyileşmeyi sürdürür, ama “scaling laws’ın öngördüğünden daha yavaş.”

  12. Wei, J., Tay, Y., Bommasani, R., Raffel, C., Zoph, B., Borgeaud, S. et al. Emergent Abilities of Large Language Models. arXiv:2206.07682 (2022), TMLR. Tanım §2’de, örnekler ve compute thresholds §3–4 ve Tablo 1’dedir.

  13. Schaeffer, R., Miranda, B. and Koyejo, S. Are Emergent Abilities of Large Language Models a Mirage? arXiv:2304.15004 (2023), NeurIPS 2023 outstanding paper. Metric argümanı §2’de, BIG-Bench meta-analysis §4’te, constructed vision example §5’tedir.

  14. Common Crawl, August 2026 Crawl Archive Now Available (CC-MAIN-2026-34), yayımlanma 24 Ağustos 2026, erişim 2026-09-06. Kendi ön sayfası “15 yılı kapsayan 300 milyardan fazla sayfa”, “toplamda 10 petabyte’tan fazla” iddiasında bulunur — burada fiyatlandırılan aylık crawl için değil, tüm arşiv için bir rakam.

  15. Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W. and Liu, P. J. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683 (2019), JMLR 21(140). C4 filtreleri §2.2’dedir. Makale boyutları token olarak değil byte olarak verir; ona yaygın biçimde atfedilen 156 milyar-token rakamı aşağıdaki Dodge ve arkadaşlarından gelir.

  16. Dodge, J., Sap, M., Marasović, A., Agnew, W., Ilharco, G., Groeneveld, D., Mitchell, M. and Gardner, M. Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758 (2021), EMNLP 2021. Dialect removal rates §5.3’tedir; C4’te benchmark contamination §4.2’dedir.

  17. Lee, K., Ippolito, D., Nystrom, A., Zhang, C., Eck, D., Callison-Burch, C. and Carlini, N. Deduplicating Training Data Makes Language Models Better. arXiv:2107.06499 (2021), ACL 2022. 61.036 tekrar dipnot 1’dedir; memorisation rakamları §6.2, Tablo 4’tedir ve 50-token exact-match criterion altında generated tokens yüzdeleridir.

  18. Penedo, G., Kydlíček, H., Ben Allal, L., Lozhkov, A., Mitchell, M., Raffel, C., Von Werra, L. and Wolf, T. The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale. arXiv:2406.17557 (2024), NeurIPS 2024 Datasets and Benchmarks. Deduplication sonucu §3.4’tedir. Released dataset o zamandan beri makaledeki 15 trilyon token’ın ötesine büyüdü.

  19. Gao, L., Biderman, S., Black, S. et al. The Pile: An 800GB Dataset of Diverse Text for Language Modeling. arXiv:2101.00027 (2020). Books3 §2.3 ve Tablo 1’dedir; consent table Tablo 5’tedir. Corpus 825,18 GiB’dir, dolayısıyla başlığın kendisi bile aşağı yuvarlamadır.

  20. Bartz v. Anthropic, No. 4:24-cv-05417 (N.D. Cal.). Fair-use order 23 Haziran 2025 (Dkt. 231); class certification 17 Temmuz 2025; final approval and judgment 20 Temmuz 2026 (Dkt. 680). Settlement yalnızca geçmiş inputs’u release eder, outputs’u ve future conduct’u değil.

  21. Kadrey v. Meta, No. 3:23-cv-03417-VC (N.D. Cal.), summary judgment 25 Haziran 2025 (Dkt. 598). Torrenting üzerinden distribution claim’in karara bağlanmadığına ve canlı kaldığına dikkat et.

  22. Thomson Reuters v. ROSS Intelligence, No. 1:20-cv-00613-SB (D. Del.), revised opinion 11 Şubat 2025 (Dkt. 770), Bibas J. Third Circuit’e interlocutory appeal üzerinde (No. 25-2153), 11 Haziran 2026’da tartışıldı, yazım anında kararsız.

  23. Perrigo, B. Exclusive: OpenAI Used Kenyan Workers on Less Than $2 Per Hour to Make ChatGPT Less Toxic. TIME, 18 Ocak 2023. $2, her hedefi tutturan senior reviewers için tavandır; çoğunluğu oluşturan junior labellers $1,32 net aldı. Aynı makalede alıntılanan Sama rebuttal’ı $1,46–$3,74 ve daha düşük kota verir.

  24. Luccioni, A. S., Viguier, S. and Ligozat, A.-L. Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language Model. arXiv:2211.02001 (2022), JMLR 24(253). Tablo 1 ve 3.

  25. Patterson, D., Gonzalez, J., Le, Q., Liang, C., Munguia, L.-M., Rothchild, D., So, D., Texier, M. and Dean, J. Carbon Emissions and Large Neural Network Training. arXiv:2104.10350 (2021). GPT-3 rakamları Tablo 4’tedir; NAS estimate’in düzeltilmesi §4.1’dedir.

  26. Strubell, E., Ganesh, A. and McCallum, A. Energy and Policy Considerations for Deep Learning in NLP. arXiv:1906.02243 (2019), ACL 2019. En çok alıntılanan sayısına ne olduğu yüzünden özellikle okumaya değer: makale dikkatli, extrapolation’ını belirtiyor ve yine de herkesin tekrarladığı tek satırda iki büyüklük mertebesi yanılıyor.

  27. Smith, S. J., Hubbard, A., Newkirk, A., Ganeshalingam, M., Holecek, B., Sartor, D., Mills, M. and Shehabi, A. United States Data Center Energy Usage Report: 2025 Update. LBNL-2001758 (18 Haziran 2026). Bu, historical series için çok alıntılanan 2024 raporunu aşağı revize eder; 2023 için 176 TWh rakamını alıntılıyorsan, superseded edition’ı alıntılıyorsun.

  28. Bender, E. M., Gebru, T., McMillan-Major, A. and Shmitchell, S. On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? FAccT '21, pp. 610–623. DOI 10.1145/3442188.3445922. “Documentation debt” §4.4’tedir. Makalenin kendi carbon rakamlarının Strubell ve arkadaşlarından cite edildiğine ve yukarıdaki düzeltmeyi miras aldığına dikkat et — bu, argümanın çürütülmesi değil, bir örneğidir.

  29. NVIDIA. NVIDIA H100 Tensor Core GPU ürün sayfası, nvidia.com/en-us/data-center/h100/ (erişim 2026-09-06). O sayfadaki FP64 dışındaki her tensor-core satırı “with sparsity” dipnotunu taşır; burada kullanılan dense BF16 rakamı yayımlanan 1.979 TFLOPS’un yarısıdır.

  30. Lambda. GPU Cloud pricing, lambda.ai/pricing (erişim 2026-09-06). On-demand, GPU başına saatlik, vergi öncesi. Bu bölümdeki fiyatlar bu kurstaki her şeyden hızlı bayatlayacak; etraflarındaki aritmetik bayatlamayacak.

  31. Karpathy, A. karpathy/llm.c, discussion #481, Reproducing GPT-2 (124M) in llm.c in 90 minutes for $20 (28 Mayıs 2024), ve discussion #677, Let's reproduce GPT-2 (1.6B): one 8XH100 node, 24 hours, $672, in llm.c (11 Temmuz 2024).

  32. Karpathy, A. karpathy/nanochat, README ve “time to GPT-2” leaderboard (erişim 2026-09-06). $48 rakamı ve “GPT-2 capability”nin CORE-score tanımı README’dedir; repository’nin kendi speedrun.sh dosyası “approximately 1.5 hours” der, bu yüzden iki saat rakamını yuvarlanmış kabul et.

  33. Meta. Llama 3.1 model card, models/llama3_1/MODEL_CARD.md içinde meta-llama/llama-models (erişim 2026-09-06). 405 B model için 30,84 M H100-saatin, toplam 39,3 M’nin, 11.390 tCO2eq location-based rakamının ve Aralık 2023 data cutoff’un kaynağı.


Hazırlayan

David Vicente Campos

NeuraLIA Labs kurucusu ve MyRealFood kurucu ortağı

León Üniversitesinden mezun bir bilgisayar mühendisiyim. MyRealFood’un kurucu ortaklarındanım; orada CTO olarak milyonlarca insanın daha iyi beslenmek için kullandığı uygulamayı geliştirdim. Ayrıca NeuraLIA Labs’i kurdum ve burada AI ürünleri geliştiriyorum. Bu sitede yol boyunca anlamak zorunda kaldığım şeyleri, keşke biri bana böyle anlatsaydı dediğim şekilde yazıyorum.

Yazar hakkında daha fazla

Yayımlayan: NeuraLIA Labs.

Yeni yazılar gelen kutuna gelsin

AI haberleri, rehberler ve ürün güncellemeleri — zamanına değecek bir şey yayımladığımızda kısa bir e-posta.

Mesajlaşmayı mı tercih ediyorsun? Aynı yazılar, burada:WhatsApp topluluğu (yeni sekmede açılır)Telegram kanalı (yeni sekmede açılır)

Kurs dizini

Abstract software decision engine with branching paths, probability nodes, and glowing gates.
jev10 dk okuma

Jev AI modeli düzyazı için değil, kararlar için tasarlandı

TypeSafe AI’ın Jev’i dikkat çekiyor çünkü yazılım zekâsını bir olasılık problemi olarak ele alıyor: doğru dalı seç, güven düzeyini ekle ve kodun bir karara ihtiyacı varken bir LLM’ye metin yazdırmak için ödeme yapma.

Abstract agent runtime sorting documents, memory blocks and pointer nodes inside a bounded context frame.
context-engineering10 dk okuma

Uzun süreli AI ajanları için bağlam mühendisliği

Uzun süre çalışan ajanlar yalnızca pencere küçük olduğu için başarısız olmaz. Dosyalar, araç çıktıları ve bayatlamış geçmiş, ajanın tamamlaması gereken görevi arka plana ittiğinde başarısız olurlar.

Seçimi LIA'ya bırakmaya hazır mısın?

Tüm yapay zeka modelleriyle tek yerde üret — bugün ücretsiz başla.