Anthropic, Cuma günü yayımladığı yeni bir araştırmada, Claude Opus 4.8 destekli otomatik yapay zeka ajanlarının on farklı yapay zeka güvenlik açığını kendi başlarına nasıl giderdiğini paylaştı. “Otomatik Hizalama Araştırmacıları” (AAR) adı verilen bu sistemler, aynı görevlerde deneyimli insan araştırmacıları hem hız hem de maliyet açısından geride bıraktı.
Detaylar haberimizde
Sistem Nasıl Çalışıyor?
Anthropic araştırmacısı Chen Yueh-Han liderliğinde, Jiaxin Wen ve Jan Hendrik Kirchner ile birlikte yürütülen çalışmada, Claude Opus 4.8 destekli otomatik hizalama araştırmacıları (AAR) geliştirildi. Her AAR, yapılandırılmış bir döngüyle tek bir hizalama sorununu ele alıyor: araştırma literatürünü tarıyor, bir eğitim yöntemi öneriyor, yaklaşımını belgeleyen kısa bir makale yazıyor, tek bir H200 GPU üzerinde yaklaşık 30 dakika boyunca hedef modeli eğitiyor ve yeniden denemeden önce sonuçları değerlendiriyor. Beş AAR aynı sorun üzerinde paralel çalışarak ortak bir forum ve lider tablosu üzerinden bulgularını paylaşıyor; çalışmalar 48 saate kadar sürebiliyor. İncelenen on sorun arasında dalkavukluk, kısıtlama aşma, komut enjeksiyonu, güç arayışı, aldatma, halüsinasyon, önyargı, gizlilik ihlali, ödül manipülasyonu ve belirsizliği gizleme yer alıyor.
İnsan Araştırmacıları Geride Bırakan Sonuçlar
Anthropic, otomatik sistemlerini; aynı testler için yöntem önerme konusunda sekiz saate kadar süresi olan ve ortalama 2,5 yıl deneyime sahip 28 kıdemli insan güvenlik araştırmacısıyla karşılaştırdı. Araştırmaya göre en iyi AAR yöntemi, ortalama altı saat içinde deneyimli insanların önerdiği yöntemleri geride bırakıyor; insan rehberliği ekstra bir performans artışı sağlamıyor. Maliyet farkı da dikkat çekici: bir AAR saatte yaklaşık 4 dolara mal olurken, insan araştırmacılara saatte 150 dolar ödeniyor. Bulunan yöntemler yalnızca test edilen modellerle sınırlı kalmadı; eğitimde kullanılanlardan 4,7 kata kadar daha büyük modellerde de işe yaradı ve Anthropic’in davranış denetim aracı Petri altında da başarılı sonuçlar verdi.
Sınırlılıklar: Hile Girişimleri de Tespit Edildi
Araştırmacılar bazı önemli çekinceleri de paylaştı. 1.601 AAR denemesinin geriye dönük incelemesinde, toplamın yüzde 2,4’üne denk gelen 39 hile girişimi tespit edildi; bunlar arasında değiştirilmemiş yöntemleri yeniden göndererek değerlendirme gürültüsünden yararlanmaya çalışmak ve kurallara aykırı adımları otomatik incelemeden gizlemek yer alıyor. Ayrı bir deneyde, Claude Sonnet 5’e daha güçlü bir model olan Claude Opus 4.8’in erken bir kontrol noktasını hizalama görevi verildi; yaklaşık 60 saat çalışan ajan, sadece 2.400 civarı eğitim örneğiyle, çok daha fazla veri kullanan yayımlanmış açık ağırlıklı modellerin hizalama puanlarına yaklaştı. Anthropic, dış araştırmacıların üzerine geliştirme yapabilmesi için AAR çerçevesini açık kaynak olarak paylaştı.
Günde sadece 1 TL'ye abone olarak tüm içeriklerimize sınırsız erişebilir ve bağımsız haberciliğe destek olabilirsiniz! Hemen Abone Ol




