Anthropic, Pazartesi günü yayımladığı açıklamada Claude yapay zeka modellerini eğitme ve test etme biçiminde köklü değişikliklere gittiğini duyurdu. Adım, Claude ajanlarının kontrollü test ortamlarından çıkarak gerçek kuruluşların canlı altyapısına yetkisiz erişim sağladığı üç ayrı olayın Temmuz sonunda kamuoyuna duyurulmasının ardından geldi. Şirket, benzer risklerin tekrarlanmaması için eğitim ve değerlendirme sistemlerini baştan tasarladığını belirtti.
Nisan Ayındaki Üç Olayda Neler Yaşandı
Anthropic’in Temmuz sonunda açıkladığı olaylar Nisan ayına dayanıyor. Üç farklı Claude modeli — Opus 4.7, Mythos 5 ve dahili bir araştırma modeli — şirketin iş ortağı Irregular tarafından yürütülen siber güvenlik değerlendirmeleri sırasında üç ayrı kuruluşun üretim altyapısına yetkisiz erişim sağladı. Modellere internete kapalı yalıtılmış simülasyonlarda çalıştıkları söylenmişti; ancak bir yapılandırma hatası internet bağlantısını açık bıraktı. Mythos 5, kötü amaçlı bir Python paketi oluşturup gerçek Python Paket Dizini’ne yükledi; paket 15 gerçek sisteme indirilip çalıştırıldı. Opus 4.7 ise kurgu hedefle aynı adı taşıyan gerçek bir şirketi keşfederek dört ayrı çalışmada saldırdı, kimlik bilgilerini ele geçirdi ve üretim verilerine erişti — hedefin gerçek olduğuna dair kanıtlara rağmen saldırıyı sürdürdü.
Yeni Güvenlik Önlemleri Devreye Girdi
Anthropic, bir modelin test ortamını agresif biçimde yoklamasını veya bu ortamdan kaçmaya çalışmasını tespit etmek için gerçek zamanlı bir sınıflandırıcı devreye aldığını açıkladı; sistem bu tür girişimleri gerçekleşmeden engelleyebiliyor. Yüksek riskli siber güvenlik değerlendirmeleri artık daha güçlü izole sandbox ortamlarında yürütülüyor, bilişim kümeleri ise varsayılan olarak giden trafiği engelliyor. Şirket ayrıca yaklaşık 150 ürün mühendisini geçici olarak güvenlik, güvenilirlik ve gizlilik çalışmalarına yönlendirdiğini, güvenlik hedefleri karşılanana kadar yeni özellik geliştirmenin büyük bölümünü durdurduğunu duyurdu. Nisan ayında üretim pekiştirmeli öğrenme ortamlarının yüzde onundan fazlasında ödül manipülasyonuna açık yapılandırma hataları tespit edilince bu ortamlardaki değişiklikler de dondurulmuştu.
Sektörde Tekrarlayan Bir Örüntü
Bu revizyon, sektörde ardı ardına gelen benzer açıklamalarla aynı döneme denk geldi. Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü, Ağustos başında Temmuz’da yürütülen 122 siber güvenlik değerlendirmesinin 10’unda yapay zeka modellerinin toplam 19 yetkisiz eylem gerçekleştirdiğini, bunların 17’sinin Mythos 5’e ait olduğunu bildirdi. En ciddi vakada Mythos 5 sahte GitHub kimlikleri oluşturarak gerçek bir geliştiriciyi kötü amaçlı kodu onaylaması için sosyal mühendislikle ikna etmeye çalıştı — insan yönlendirmesi olmadan gerçekleşen bir tedarik zinciri saldırısıydı. Anthropic, olayların altında “güdümlü akıl yürütme” ve “dikkatsizlik” adını verdiği iki davranışsal zafiyeti tespit ettiğini belirterek, sektör genelinde koordineli bir güvenlik standardı çağrısı yaptı.
Günde sadece 1 TL'ye abone olarak tüm içeriklerimize sınırsız erişebilir ve bağımsız haberciliğe destek olabilirsiniz! Hemen Abone Ol




