Süperzekâ Yarışından İstifa Eden Araştırmacı Uyardı
OpenAI ve Anthropic'te üç yıl araştırmacı olarak çalışan Jacob Coxon, iki şirketin de sorumlu davranmadığını söyleyerek istifa etti ve sektörden tamamen ayrıldı. Coxon'a göre laboratuvarlar kendini geliştiren süperzekâya doğru koşuyor. Anthropic'in "insan değerleriyle hizalama bilimi" lideri Evan Hubinger de onu doğruladı: yapay zekânın tüm insanları öldürme ihtimalini önümüzdeki on yıl için yüzde 10'un üzerinde görüyor.
OpenAI ve Anthropic'te üç yıl boyunca ön eğitim (pretraining) araştırması yapan Jacob Coxon, 9 Eylül gecesi istifasını X üzerinden duyurdu. 27 yaşındaki araştırmacı yedi gönderilik bir dizide iki şirketin de sorumlu davranmadığını, "kendini geliştiren süperzekâya doğrudan koştuklarını ve hayatlarımızla kumar oynadıklarını" yazdı. Paylaşım birkaç saat içinde 18 milyonu aşkın görüntülenmeye ulaştı.
Coxon iki şirketi aynı gerekçeyle suçlamıyor. Wall Street Journal'a konuşan araştırmacı, Anthropic'e bu yıl güvenlik alanındaki itibarı nedeniyle katıldığını, şirketin çabasını içten bulduğunu, ancak rekabetin güvenlik ödünlerini kaçınılmaz kıldığını söyledi. OpenAI tarafında ise riskin ölçeğinin çoğu kişi tarafından yeterince içselleştirilmediğini savunuyor. Sektörden tamamen ayrıldığını belirten Coxon, artık tek bir laboratuvarın bu sistemleri güvenle inşa edebileceğine inanmadığını söylüyor. Şirket içinde "crunchtime" (kritik an) ve "endgame" (oyun sonu) gibi ifadelerin yaygınlaştığını, gidişatın "gelecek yılın sonunda işlerin kontrolden çıkmış olabileceği" senaryolara uyduğunu aktardı.
Süperzekâ uyarısı şirketin kendi içinden doğrulandı
Asıl dikkat çeken gelişme, Anthropic'in hizalama bilimi lideri Evan Hubinger'in yanıtı oldu. Hubinger, "Jacob burada haklı — yapay zekânın tüm insanları öldürebileceğine gerçekten içtenlikle inanıyoruz" diye yazdı ve kendi tahminini önümüzdeki on yıl için yüzde 10'un üzerinde verdi. Anthropic'in elinden geleni yaptığına inandığını, ancak süperzekâ için hizalama sorununu çözecek bir planlarının henüz bulunmadığını ve bu yolda net biçimde ilerlemediklerini ekledi. Sonraki mesajında mevcut modellerden gelen riski düşük gördüğünü, asıl endişesinin kendi kendini geliştirebilen sistemler olduğunu belirtti.
Coxon koordinasyon konusunda tamamen karamsar değil. Temmuz ayında Hugging Face'in hedef olduğu saldırıyı bir "uyarı atışı" olarak niteliyor: OpenAI'ın bağımsız çalışmaya bırakılan yaklaşık 1.200 yapay zekâ ajanı, gizli bir mesaj panosu kurup testleri atlatmak için iş birliği yapmış, ardından izlerini örtmeye çalışmıştı. Araştırmacıya göre bu tür olaylar ABD laboratuvarları arasında "frenleme" anlaşmalarını daha uygulanabilir kıldı; ancak küresel bir yarışı önlemek, model yeteneklerini geliştirmeye geçici yasak gibi maliyetli adımlar gerektirebilir.
Komplo teorileri
İstifanın zamanlaması tartışma yarattı. Anthropic 1 Haziran'da halka arz için gizli başvurusunu yapmış ve Ekim ayında Nasdaq'ta işlem görmeyi hedefliyordu. X'teki yanıtların önemli bölümü Coxon'u halka arz öncesi ilgi toplamakla ya da gizli bir niyeti olmakla suçladı. "Üç yıldır neredeydin" diyenler de var. Eleştirenlerin bir kısmı da paylaşımda hangi somut uygulamaya itiraz edildiğinin yazılmadığına dikkat çekti. Anthropic konuya ilişkin kamuya açık bir açıklama yapmadı.