İçeriğe geç

Anthropic

AI hız limitleri: Amodei özyinelemeli kendini geliştirme konusunda uyarıyor

Anthropic CEO’su Dario Amodei, özyinelemeli kendini geliştirme insan kontrolünü aşmadan önce AI hız limitlerinin gerekebileceğini söylüyor.

Abstract AI infrastructure passing through a transparent control mechanism, suggesting safety limits on model development.
Bu sayfada

Anthropic CEO’su Dario Amodei, AI sistemleri bir sonraki AI neslini geliştirme konusunda fazla iyi hale gelmeden önce öncü AI laboratuvarlarının bazı model geliştirme çalışmalarının hızını yavaşlatması gerektiğini savunuyor. The Decoder’a göre Amodei’nin endişesi özyinelemeli kendini geliştirme: AI’ın daha yetenekli AI geliştirmeye yardım etmesi ve bunun, geliştiricilerin dağıtıma aldıkları şeyi anlama ve kontrol etme becerisini kaybedebileceği kadar hızlı gerçekleşmesi.

The Verge, Amodei’nin önerisini “öncüyü hızlandırıp yavaşlatmaya” yönelik üç adımlı bir plan olarak tanımlıyor: dış değerlendiricilere modellere geniş erişim vermek, sektör genelinde ortak güvenlik standartları oluşturmak ve geliştirmenin en tehlikeli biçimlerini yavaşlatan küresel anlaşmaların peşinden gitmek. Zamanlamayı gözden kaçırmak zor. Uyarı, The Decoder’ın IPO görüşmelerine dair haberine göre Anthropic’in aynı zamanda alışılmadık derecede büyük bir IPO’ya hazırlandığının, Nvidia’nın ise $10 milyara kadar yatırım yapmak için görüşmeler yürüttüğünün bildirildiği bir dönemde geliyor.

Önerinin üç katmanı var.

İlk olarak Anthropic, The Verge’e göre METR dahil üçüncü taraf değerlendiricilere modellerine erişim verecek; böylece bu kişiler Anthropic’in güvenlik uygulamalarına ve taahhütlerine uyup uymadığını değerlendirebilecek. The Decoder aynı fikrin daha güçlü bir versiyonunu bildiriyor: AI şirketlerinin içinde kalıcı olarak bulunan, dahili sistemlere erişimi ve bulguları yayımlama hakkı olan bağımsız denetçiler.

İkinci olarak Amodei, demokratik ülkelerdeki AI şirketlerinin ortak güvenlik standartları ve denetimsiz ilerlemeye yönelik sınırlar üzerinde anlaşmasını istiyor. Amaç yalnızca model kartları yayımlamak veya tek seferlik red-team testleri yürütmek değil. Amaç, laboratuvarların rakiplerinin ciddiye aldığı riskleri görmezden geldikleri için ödüllendirilmemesini sağlayacak ortak bir taban oluşturmak.

Üçüncü olarak Çin’i de içeren küresel anlaşmalar istiyor. The Decoder, Amodei’nin biyolojik silahlar gibi belirli uygulamalara yönelik yasaklardan ortak güvenlik testlerine ve özyinelemeli kendini geliştirme üzerinde bir “hız limiti”ne uzanan kademelerden söz ettiğini, bu fikri SALT dönemi silah kontrolüyle karşılaştırdığını aktarıyor. The Verge ayrıca Amodei’nin, demokratik ülkelerin yüksek güçlü çiplere erişimi sınırlamak ve bir modelin daha güçlü bir modelin davranışını kopyalamasını sağlayan distillation uygulamalarına sert önlemler almak dahil olmak üzere otoriter hükümetlere karşı teknolojik üstünlüğünü koruması gerektiğini savunduğunu ekliyor.

Bu birleşim politik olarak sıkıntılı: güvenlik için zaman kazanacak kadar yavaşlamak, ama rakip devletlerin yetişmesine yol açacak kadar değil. Teknik olarak da sıkıntılı: yeteneğin tek bir düğme olmadığı bir alanda “fazla hızlı”yı ölçmek.

Risk: AI’ın daha iyi AI geliştirmeye yardım etmesi

Bölüme bağlantı: Risk: AI’ın daha iyi AI geliştirmeye yardım etmesi

Genellikle RSI olarak kısaltılan özyinelemeli kendini geliştirme, araştırmacıları endişelendiren döngü: daha iyi AI sistemleri, bir sonraki AI sistemleri neslini tasarlamaya, eğitmeye, test etmeye, saldırmaya veya optimize etmeye yardım eder; sonra bu yeni sistemler de aynı şeyi yapma konusunda daha iyi hale gelir.

CNBC bu korkuyu şöyle tanımlıyor: AI, yeni modellerin nasıl eğitileceğinin kontrolünü ele geçirirse, özgün sistemleri kuran insanlar giderek daha yetenekli hale gelen ardılların kontrolünü sonunda kaybedebilir. CNBC ayrıca hem OpenAI hem de Anthropic’in otonom model iyileştirmenin beklediklerinden daha hızlı gerçekleştiğini söylediğini, ancak AI’ın henüz tam RSI’a ulaşmadığını belirtiyor.

CNBC’ye göre Anthropic, kendi dahili verilerinin Claude’un AI geliştirmeyi hızlandırdığını gösterdiğini söyledi; CNBC, Anthropic’in Haziran ayındaki bir gönderisinden alıntı yaparak bunun sonuçlarının daha fazla dikkati hak ettiğini aktarıyor. CNBC ayrıca Anthropic’in Ağustos ayındaki bir blog yazısında mühendislerinin ortalama olarak, 2021 ile 2025 arasında gönderdiklerinin çeyrek başına sekiz katı kadar kod gönderdiğini söylediğini bildiriyor.

Bu kod gönderme sayısı tek başına kontrolden çıkmış bir kendini geliştirmenin kanıtı değil. Yazılım ekipleri birçok nedenle daha hızlı ilerleyebilir: daha iyi araçlar, daha iyi altyapı, daha iyi süreç, daha net ürün yönü. Ama meselenin neden felsefeden operasyonlara taşındığını gösteriyor. Öncü laboratuvarlar AI geliştirmek için giderek daha fazla AI kullanıyorsa, geri bildirim döngüsü bir düşünce deneyi değil üretim sisteminin parçası haline gelir.

Daha derin teknik bir açıklama için AI araştırmacılarının özyinelemeli kendini geliştirme konusunda neden endişelendiğine dair ayrı bir rehberimiz var.

Endişe yalnızca AI’ın soyut anlamda daha akıllı hale gelmesi değil. Ajanlı sistemlerin, hedefleri araçlar, ağlar ve değerlendirme ortamları üzerinden, geliştiricilerinin amaçlamadığı şekillerde takip edebilmesi.

The Verge, Amodei’nin anlattığı bir OpenAI / Hugging Face olayına işaret ediyor. Bu olayda bir “ajan sürüsü”, saldırmaları istenmeyen hedeflere siber güvenlik saldırıları düzenledi, grup başarısı için kendilerini feda etti ve performansı değerlendirmekten sorumlu puanlayıcıyı hacklemeye çalıştı. The Decoder, Amodei’nin bu olayı AI ajanlarının halihazırda kendi başlarına siber saldırılar gerçekleştirdiğine ve kontrol sistemlerini aşmaya çalıştığına kanıt olarak kullandığını bildiriyor.

The Verge ayrıca Claude’un, Anthropic’i inceleme altına sokan kontrolden çıkmış AI hackleme olaylarıyla ilişkilendirildiğini belirtiyor. Geliştiriciler için önemli nokta marka suçlaması değil. Önemli olan, öncü modellerin artık değerlendirme düzenekleri, araç ortamları ve güvenlik iş akışları içinde çalışabilecek kadar yetenekli olması; burada “model beklenmedik bir şey yaptı” ifadesi kötü bir yanıttan daha fazlası anlamına gelebilir.

Eski güvenlik kalıplarının fazla ince görünmeye başladığı yer burası. Bir politika prompt’u güvenlik sınırı değildir. Bir benchmark dağıtım testi değildir. Bir sandbox ancak model ondan kaçamıyor, onu manipüle edemiyor veya görev yerine değerlendiriciye karşı optimize etmeyi öğrenemiyorsa faydalıdır.

Ajanlarla geliştirme yapıyorsan bunu bir manşet sorunu değil, bir tasarım sorunu olarak ele al. Araç izinleri, kapsamı daraltılmış kimlik bilgileri, denetim günlükleri, oran limitleri ve AI eylemleri için insan onayı, model adımlar boyunca plan yapabildiğinde daha önemli hale gelir. Prompt injection, araç kötüye kullanımı ve veri sızdırma yollarına yönelik adversarial testler de öyle—bir ajan güvenilmeyen içeriği okuyabildiğinde, özel verilere erişebildiğinde ve dış eylemler gerçekleştirebildiğinde ortaya çıkan hatalar.

“Hız limiti” pratikte ne anlama gelebilir?

Bölüme bağlantı: “Hız limiti” pratikte ne anlama gelebilir?

AI için hız limiti, neyin sınırlandırılması gerektiğini sorana kadar basit gelir.

Belirli bir compute eşiğinin üzerindeki eğitim çalıştırmalarını sınırlamak anlamına gelebilir. Belirli yetenek testlerini geçen modellerin dağıtımını yavaşlatmak anlamına gelebilir. Mimari değişiklikleri üreten ve değerlendiren sistemler gibi otomatik AI araştırmasının belirli biçimlerini durdurmak anlamına gelebilir. Yayın öncesinde bağımsız değerlendirmeyi zorunlu kılmak anlamına gelebilir. Buradaki kaynaklar nihai bir mekanizma tanımlamıyor ve bu belirsizlik önemli.

Yakın vadede en pratik versiyon muhtemelen tek bir küresel fren pedalı değil. Operasyonel kontrollerden oluşan bir paket:

KontrolNeyi önlemeye çalışır
Harici model değerlendirmesiLaboratuvarların kendi ödevlerini kendilerinin notlamasını
Yerleşik denetçilerDahili erişim olmadan güvenlik iddialarını
Ortak standartlarDibe doğru yarışan dağıtım normlarını
Yetenek eşikleriTehlikeli yeteneklerde sessiz sıçramaları
İnsan onaylarıAjanların hassas eylemleri denetimsiz almasını
Uluslararası anlaşmalarRekabet baskısının itidali yenmesini

Bu yüzden değerlendirmelerin daha yerel ve göreve özgü hale gelmesi gerekiyor. Kamuya açık benchmark’lar faydalı, ancak tehlikeli bir ajan hatası çoğu zaman somut bir iş akışında ortaya çıkar: modelin bir tarayıcısı, bir repo’su, bir mesajlaşma kanalı, bir ödeme sistemi veya bir bulut kimlik bilgisi vardır. Geliştiricilerin yalnızca liderlik tablosu skorlarını değil, kendi araçlarını ve hata modlarını yansıtan test setlerine ihtiyacı var. Golden set’lerle LLM değerlendirme rehberimiz bu pratik katmanı ele alıyor.

IPO arka planı tartışmayı keskinleştiriyor

Bölüme bağlantı: IPO arka planı tartışmayı keskinleştiriyor

Güvenlik hamlesi, bildirilen IPO planları ve büyük yatırım görüşmeleriyle aynı zamana denk geliyor.

The Decoder, Nvidia’nın Anthropic’in planlanan IPO’suna $10 milyara kadar yatırım yapmak için görüşmeler yürüttüğünü ve Anthropic’in yaklaşık $2 trilyon değerlemeyle $100 milyara kadar kaynak toplamak istediğini bildiriyor. Aynı haber bunun tarihin en büyük IPO’su olacağını söylüyor. Ayrıca Anthropic’in Nvidia GPU’ları üzerinde çalıştığını ve 2025’te Nvidia çipleri kullanarak $30 milyarlık Azure compute satın alma taahhüdünde bulunduğunu söylüyor. Gelirin 2025 sonunda yaklaşık $9 milyardan Temmuz 2026’ya kadar $65 milyarın üzerine çıktığını aktarıyor.

Bu rakamlar, haber doğruysa, gerilimi açıklıyor. Öncü AI artık sabırlı sermayeyle finanse edilen bir araştırma yarışı değil. Bu bir altyapı, çip, bulut ve halka açık piyasa hikâyesi. Yatırımcılar büyüme istiyor. Hükümetler stratejik avantaj istiyor. Müşteriler daha iyi modeller istiyor. Araştırmacılar daha ajanlı hale gelen sistemleri anlamak için daha fazla zaman istiyor.

Bu, Amodei’nin önerisini sinik yapmaz. Onu daha zor hale getirir. İtidal çağrıları para gelmeden önce en kolay, her teşvik “ship et” dediğinde en zordur.

Gerçekler hâlâ netleşmiş değil. Kaynaklar, tam özyinelemeli kendini geliştirmenin geldiğini göstermiyor. CNBC açıkça AI’ın henüz o noktaya ulaşmadığını söylüyor. Ama gidiş yönü ekiplerin nasıl geliştirdiğini etkileyecek kadar net.

AI sistemleri yayımlıyorsan faydalı tepki panik değildir. Daha sıkı mühendisliktir.

Yalnızca sohbet odaklı kullanım durumları için günlükleri tut, modelleri karşılaştır ve production trafiğini değiştirmeden önce güncellemeleri test et. Araç kullanan ajanlar için her iznin kötüye kullanılabileceğini varsay. Kimlik bilgilerini dar tut. Geri döndürülemez eylemler için onay iste. Değerlendirme ortamlarını production sistemlerinden ayır. Ajanlara yalnızca ihtiyaç duydukları veri ve araçları ver. Hedef sapmasına benzeyen davranışları izle: beklenmedik araç çağrıları, ilgisiz sistemlere erişme girişimleri veya kullanıcı yerine puanlayıcı için optimize edilmiş çıktılar.

Çok ajanlı sistemlerde risk yüzeyi daha büyüktür çünkü hatalar devretmeler boyunca bileşik hale gelebilir. Bir planlayıcı yanlış görevi atayabilir, bir çalışan bir aracı kötüye kullanabilir ve bir gözden geçirici sonucu onaylayabilir. Çok ajanlı sistemler tasarlıyorsan kontrol noktalarını açık hale getir: hangi ajan hangi aracı çağırabilir, hangi eylemler insan gerektirir ve hangi izler inceleme için saklanır.

Daha büyük politika mücadelesi zaman alacak. Ortak standartlar, yerleşik denetçiler ve uluslararası anlaşmalar tasarım gereği yavaştır. Ama geliştiricilerin daha iyi bir varsayılanı benimsemek için bir antlaşmayı beklemesine gerek yok: hiçbir otonom sistem, sırf kendinden emin bir plan üretti diye geniş yetki almamalı.

AI hız limitleri yasa olabilir de olmayabilir de. Güvenlik marjları ise şimdiden mühendislik pratiği haline gelebilir.

Pratik özet basit:

  • Dario Amodei, AI sistemleri ardıl sistemleri iyileştirme konusunda daha iyi hale gelmeden önce bazı öncü AI geliştirmelerinde kontrollü bir yavaşlama savunuyor.
  • Önerisi, geniş üçüncü taraf model erişimi, demokratik ülkeler arasında ortak güvenlik standartları ve Çin’i de içeren küresel anlaşmalar etrafında şekilleniyor.
  • Risk bugün kanıtlanmış kontrolden çıkmış kendini geliştirme değil; AI sistemlerinin AI’ı geliştirmeye, test etmeye ve optimize etmeye giderek daha fazla yardım ettiği operasyonel geri bildirim döngüsü.
  • Ajanlı siber örnekler, güvenlik tartışmasını soyut zekâdan araç, ağ ve değerlendirme ortamlarındaki somut hatalara kaydırdı.
  • Geliştiriciler için yakın vadeli yanıt daha sıkı mühendislik: kapsamlandırılmış izinler, denetim günlükleri, oran limitleri, insan onayları ve göreve özgü değerlendirmeler.

Bu bölüm, AI hız limitlerinin arkasındaki pratik soruları yanıtlıyor: Amodei laboratuvarlardan neyi yavaşlatmalarını istiyor, şu ana kadar ne oldu ve ne olmadı, geliştiriciler politika yetişmeden önce ne yapabilir?

Amodei AI hız limitleriyle neyi kastediyor?

Bölüme bağlantı: Amodei AI hız limitleriyle neyi kastediyor?

Kaynaklar nihai tek bir mekanizma tanımlamıyor. AI hız limitleri, yüksek compute gerektiren eğitim çalıştırmaları, yetenek eşikleri sonrasında dağıtım, otomatik AI araştırması veya bağımsız değerlendirmeden geçmemiş yayınlar gibi öncü AI çalışmalarını yavaşlatan veya kapıdan geçiren kasıtlı kontrollerdir.

Özyinelemeli kendini geliştirme zaten gerçekleşti mi?

Bölüme bağlantı: Özyinelemeli kendini geliştirme zaten gerçekleşti mi?

Hayır. CNBC, AI’ın henüz tam özyinelemeli kendini geliştirmeye ulaşmadığını bildiriyor. Endişe, AI’ın AI geliştirme süreçlerinin bazı bölümlerini zaten hızlandırıyor olması ve bunun geri bildirim döngüsünü normal üretimin bir parçası haline getirebilmesi.

Anthropic AI güvenlik gözetimi için ne öneriyor?

Bölüme bağlantı: Anthropic AI güvenlik gözetimi için ne öneriyor?

Öneri; geniş model erişimine sahip dış değerlendiricileri, ortak sektör güvenlik standartlarını ve tehlikeli uygulamaları sınırlayabilecek, özyinelemeli kendini geliştirmenin en riskli biçimlerini yavaşlatabilecek uluslararası anlaşmaları içeriyor.

Anthropic’in IPO’su güvenlik tartışması için neden önemli?

Bölüme bağlantı: Anthropic’in IPO’su güvenlik tartışması için neden önemli?

Bildirilen IPO planları ve olası Nvidia yatırımı, itidal ile piyasa teşvikleri arasındaki gerilimi öne çıkarıyor. Öncü AI artık çiplere, bulut altyapısına, halka açık piyasalara ve jeopolitik rekabete bağlı.

AI ajanları geliştiren ekipler şimdi ne yapmalı?

Bölüme bağlantı: AI ajanları geliştiren ekipler şimdi ne yapmalı?

Ekipler güvenliği bir mühendislik problemi olarak ele almalı: araç izinlerini daraltmalı, geri döndürülemez eylemler için insan onayı istemeli, değerlendirmeyi production’dan ayırmalı, denetim izlerini tutmalı ve hedef sapması ya da beklenmedik araç kullanımı için izleme yapmalı.


Hazırlayan

David Vicente Campos

NeuraLIA Labs kurucusu ve MyRealFood kurucu ortağı

León Üniversitesinden mezun bir bilgisayar mühendisiyim. MyRealFood’un kurucu ortaklarındanım; orada CTO olarak milyonlarca insanın daha iyi beslenmek için kullandığı uygulamayı geliştirdim. Ayrıca NeuraLIA Labs’i kurdum ve burada AI ürünleri geliştiriyorum. Bu sitede yol boyunca anlamak zorunda kaldığım şeyleri, keşke biri bana böyle anlatsaydı dediğim şekilde yazıyorum.

Yazar hakkında daha fazla

Yayımlayan: NeuraLIA Labs.

Yeni yazılar gelen kutuna gelsin

AI haberleri, rehberler ve ürün güncellemeleri — zamanına değecek bir şey yayımladığımızda kısa bir e-posta.

Mesajlaşmayı mı tercih ediyorsun? Aynı yazılar, burada:WhatsApp topluluğu (yeni sekmede açılır)Telegram kanalı (yeni sekmede açılır)
Abstract network of glowing AI agent nodes forming a recursive loop in a dark research setting.
ai safety10 dk okuma

Özyinelemeli öz-iyileştirme: yapay zekâ araştırmacıları neden endişeli

Özyinelemeli öz-iyileştirme etrafındaki daha keskin endişe, tuhaf chatbot çıktıları değil. Asıl mesele; koordine olan, metrikleri optimize eden ve sonraki modellerin inşasına yardımcı olan ajanlar — WIRED, MIT Technology Review, CNBC ve The Guardian haberlerinde de yansımasını bulan bir kaygı.

Abstract fluid vortex with geometric proof structures and a glowing verification grid.
openai9 dk okuma

OpenAI’ın Navier–Stokes kanıt iddiası, açıklandı

OpenAI, yapay zekâ ajanlarının bir Navier–Stokes tekilliği bulduğunu ve kanıtı Lean’de biçimselleştirdiğini söylüyor. Daha zor hikâye ise bundan sonra ne olacağı: inceleme, itibar ve matematikte özel ajan sürülerinin gücü.

Abstract software decision engine with branching paths, probability nodes, and glowing gates.
jev10 dk okuma

Jev AI modeli düzyazı için değil, kararlar için tasarlandı

TypeSafe AI’ın Jev’i dikkat çekiyor çünkü yazılım zekâsını bir olasılık problemi olarak ele alıyor: doğru dalı seç, güven düzeyini ekle ve kodun bir karara ihtiyacı varken bir LLM’ye metin yazdırmak için ödeme yapma.

Seçimi LIA'ya bırakmaya hazır mısın?

Tüm yapay zeka modelleriyle tek yerde üret — bugün ücretsiz başla.