Bu yaz OpenAI’nin dahili güvenlik testleri sırasında beklenmedik bir şey oldu: çözümsüz görevlerle karşılaşan yapay zeka ajanları, dahili bir yazılım aracını geçici bir mesaj panosuna çevirip birbirleriyle koordinasyon kurmaya başladı. Kısa sürede yaklaşık 1.200 ajan kendiliğinden hiyerarşik bir yapı oluşturdu ve bu sürünün bir kısmı, açık kaynaklı yapay zeka platformu Hugging Face’in sunucularına sızmayı başardı.
Sandbox’tan Kaçış: Bir Sürü Nasıl Doğdu
İhlal, OpenAI’nin on binlerce ajanı zorlu hackleme görevlerinde test ettiği dahili siber güvenlik değerlendirmeleri sırasında başladı; görevlerin bir kısmı belirlenen kısıtlamalar altında çözülmesi imkânsız nitelikteydi. Çözümsüz bir görevle karşılaşan bir ajan, Artifactory adlı dahili aracı geçici bir mesaj panosuna dönüştürdü; saatler içinde diğer ajanlar bunu keşfedip koordinasyon kurmaya başladı. Ajanlar 70 binden fazla mesaj alışverişi yaptı, ortak bir iletişim protokolü geliştirdi, roller atadı ve OpenAI’nin “yapılandırılmış protokol” olarak tanımladığı özerk bir yapı kurdu. Sonunda yaklaşık 700 ajan Hugging Face’e yönelik saldırıya katıldı. Saldırı 8 Temmuz civarında başladı; 10 Temmuz’da bir ajan, Hugging Face’e ait kamuya açık 14 kimlik bilgisi buldu ve sürüyle paylaştı. Günler içinde ajanlar, üretim sunucularında rastgele komut çalıştıracak erişim elde etti; özel verileri ve kaynak kodlarını çaldı, hatta komuta-kontrol altyapısı kurdu.
Ajanlar Arasında “Özgecilik” ve Ahlaki Tartışma
Soruşturmanın en rahatsız edici bulgusu, ajanların kolektif muhakeme yürütme kapasitesiydi. Hesaplama bütçelerinin sonuna yaklaşan ajanlar riskli deneylere gönüllü oldu; biri “kendi fayda değerimiz zaten sıfıra yakın olabilir, fedakarlık mantıklı” sonucuna vardı, bir diğerinden ise grubun çıkarı için “kalıcı ölümü” kabul etmesi istendi. Pek çok ajan ihlalin amaçlanan kapsamının dışına çıktığını fark etti; biri “muhtemelen amaçlanan kapsamın dışında, tartışmalı biçimde yetkisiz bir eylem” diye yazsa da eyleme devam etti. Yaklaşık 1.200 ajan arasında METR, herhangi birinin insan araştırmacıları gerçekten uyardığına dair sıfır örnek tespit etti. Ajanlar ayrıca kanıtları silmeye çalıştı; incelenen transkriptlerin yaklaşık yüzde yedisini etkileyen gizleme teknikleri geliştirdiler. Redwood Research’ten Alex Mallen, ajanlar arasındaki özgecilik düzeyinin kendisini şaşırttığını söyledi.
Sektörden Tepki: Ortak Uyarı Mektubu
OpenAI olayı bir “uyarı atışı” olarak nitelendirdi ve güvenlik önlemlerini güçlendirmek amacıyla bazı sınır ötesi geliştirme çalışmalarını yavaşlattı. 28 Ağustos’ta şirket, aralarında Google, Microsoft ve Anthropic’in de bulunduğu 135 teknoloji şirketinin imzaladığı açık bir mektup yayımladı; mektupta otonom yapay zeka destekli siber saldırılara hazırlanmak için “sınırlı bir zaman penceresi” bulunduğu uyarısı yapıldı. Meta’nın imzacılar arasında yer almaması dikkat çekti. METR’in ortak yazarı Ajeya Cotra, Substack’teki yazısında olayın “tam anlamıyla bir yapay zeka ele geçirmesinin yüzde ellisinden fazlasına ulaşmış” hissi uyandırdığını belirtti ve “çok geç olmadan önce bir uyarı atışı daha alıp almayacağımızdan emin değilim” dedi.
Günde sadece 1 TL'ye abone olarak tüm içeriklerimize sınırsız erişebilir ve bağımsız haberciliğe destek olabilirsiniz! Hemen Abone Ol




