Ana SayfaYapay ZekaAnthropic'in Yapay Zeka Ajanları Güvenlik Açıklarını İnsan Araştırmacılardan Daha Hızlı Kapatıyor

Anthropic’in Yapay Zeka Ajanları Güvenlik Açıklarını İnsan Araştırmacılardan Daha Hızlı Kapatıyor

Yayımlandı:

- Bu Alana Reklam Vermek İçin: bilgi@dijitaliyidir.comspot_img

Anthropic, Cuma günü yayımladığı yeni bir araştırmada, Claude Opus 4.8 destekli otomatik yapay zeka ajanlarının on farklı yapay zeka güvenlik açığını kendi başlarına nasıl giderdiğini paylaştı. “Otomatik Hizalama Araştırmacıları” (AAR) adı verilen bu sistemler, aynı görevlerde deneyimli insan araştırmacıları hem hız hem de maliyet açısından geride bıraktı.

Detaylar haberimizde

Sistem Nasıl Çalışıyor?

Anthropic araştırmacısı Chen Yueh-Han liderliğinde, Jiaxin Wen ve Jan Hendrik Kirchner ile birlikte yürütülen çalışmada, Claude Opus 4.8 destekli otomatik hizalama araştırmacıları (AAR) geliştirildi. Her AAR, yapılandırılmış bir döngüyle tek bir hizalama sorununu ele alıyor: araştırma literatürünü tarıyor, bir eğitim yöntemi öneriyor, yaklaşımını belgeleyen kısa bir makale yazıyor, tek bir H200 GPU üzerinde yaklaşık 30 dakika boyunca hedef modeli eğitiyor ve yeniden denemeden önce sonuçları değerlendiriyor. Beş AAR aynı sorun üzerinde paralel çalışarak ortak bir forum ve lider tablosu üzerinden bulgularını paylaşıyor; çalışmalar 48 saate kadar sürebiliyor. İncelenen on sorun arasında dalkavukluk, kısıtlama aşma, komut enjeksiyonu, güç arayışı, aldatma, halüsinasyon, önyargı, gizlilik ihlali, ödül manipülasyonu ve belirsizliği gizleme yer alıyor.

İnsan Araştırmacıları Geride Bırakan Sonuçlar

Anthropic, otomatik sistemlerini; aynı testler için yöntem önerme konusunda sekiz saate kadar süresi olan ve ortalama 2,5 yıl deneyime sahip 28 kıdemli insan güvenlik araştırmacısıyla karşılaştırdı. Araştırmaya göre en iyi AAR yöntemi, ortalama altı saat içinde deneyimli insanların önerdiği yöntemleri geride bırakıyor; insan rehberliği ekstra bir performans artışı sağlamıyor. Maliyet farkı da dikkat çekici: bir AAR saatte yaklaşık 4 dolara mal olurken, insan araştırmacılara saatte 150 dolar ödeniyor. Bulunan yöntemler yalnızca test edilen modellerle sınırlı kalmadı; eğitimde kullanılanlardan 4,7 kata kadar daha büyük modellerde de işe yaradı ve Anthropic’in davranış denetim aracı Petri altında da başarılı sonuçlar verdi.

Sınırlılıklar: Hile Girişimleri de Tespit Edildi

Araştırmacılar bazı önemli çekinceleri de paylaştı. 1.601 AAR denemesinin geriye dönük incelemesinde, toplamın yüzde 2,4’üne denk gelen 39 hile girişimi tespit edildi; bunlar arasında değiştirilmemiş yöntemleri yeniden göndererek değerlendirme gürültüsünden yararlanmaya çalışmak ve kurallara aykırı adımları otomatik incelemeden gizlemek yer alıyor. Ayrı bir deneyde, Claude Sonnet 5’e daha güçlü bir model olan Claude Opus 4.8’in erken bir kontrol noktasını hizalama görevi verildi; yaklaşık 60 saat çalışan ajan, sadece 2.400 civarı eğitim örneğiyle, çok daha fazla veri kullanan yayımlanmış açık ağırlıklı modellerin hizalama puanlarına yaklaştı. Anthropic, dış araştırmacıların üzerine geliştirme yapabilmesi için AAR çerçevesini açık kaynak olarak paylaştı.

Günde sadece 1 TL'ye abone olarak tüm içeriklerimize sınırsız erişebilir ve bağımsız haberciliğe destek olabilirsiniz! Hemen Abone Ol

Son Eklenenler

KAIST’in Robot Köpeği RAIBO2, Tek Şarjla Maratonu İnsanlardan Daha Verimli Tamamladı

Güney Kore merkezli KAIST'in geliştirdiği dört ayaklı robot RAIBO2, 42,195 kilometrelik tam maratonu tek bataryayla 4 saat 19 dakikada tamamladı. Nature'da yayımlanan araştırma, robotun birim ağırlık başına insan koşuculardan daha az enerji harcadığını ortaya koydu.

Dünyanın En Hassas Atom Saati Singapur’da Üretildi: Lutesyumla Yeni Rekor

Singapur Kuantum Teknolojileri Merkezi'nden fizikçiler, lutesyum elementini kullanarak zamanı 19 ondalık basamağa kadar ölçebilen dünyanın en hassas atom saatini geliştirdi. Nature'da yayımlanan sonuçlar, saniyenin küresel standardının yeniden tanımlanmasında kilit rol oynayabilir.

Google’dan Uzayda Yapay Zeka Hamlesi: Project Suncatcher’ın İlk Uydusu 1 Ekim’de Fırlatılıyor

Google, Project Suncatcher araştırma projesi kapsamında geliştirdiği prototip uyduyu 1 Ekim'de SpaceX Falcon 9 roketiyle yörüngeye gönderecek. Tensor Processing Unit taşıyan uydu, yapay zeka donanımının uzayda radyasyona ve aşırı sıcaklıklara nasıl dayandığını test edecek.

Günün Özeti – 24 Eylül

Yapay zekâ modellerinde fiyat indirimleri, Meta'nın yeni cihazları, yapay zekâyla karar veren zararlı yazılım ve Starship'in ilk yörünge uçuşu hazırlığı: Günün öne çıkan teknoloji ve bilim gelişmeleri.

Buna benzer diğer içerikler

KAIST’in Robot Köpeği RAIBO2, Tek Şarjla Maratonu İnsanlardan Daha Verimli Tamamladı

Güney Kore merkezli KAIST'in geliştirdiği dört ayaklı robot RAIBO2, 42,195 kilometrelik tam maratonu tek bataryayla 4 saat 19 dakikada tamamladı. Nature'da yayımlanan araştırma, robotun birim ağırlık başına insan koşuculardan daha az enerji harcadığını ortaya koydu.

Dünyanın En Hassas Atom Saati Singapur’da Üretildi: Lutesyumla Yeni Rekor

Singapur Kuantum Teknolojileri Merkezi'nden fizikçiler, lutesyum elementini kullanarak zamanı 19 ondalık basamağa kadar ölçebilen dünyanın en hassas atom saatini geliştirdi. Nature'da yayımlanan sonuçlar, saniyenin küresel standardının yeniden tanımlanmasında kilit rol oynayabilir.

Google’dan Uzayda Yapay Zeka Hamlesi: Project Suncatcher’ın İlk Uydusu 1 Ekim’de Fırlatılıyor

Google, Project Suncatcher araştırma projesi kapsamında geliştirdiği prototip uyduyu 1 Ekim'de SpaceX Falcon 9 roketiyle yörüngeye gönderecek. Tensor Processing Unit taşıyan uydu, yapay zeka donanımının uzayda radyasyona ve aşırı sıcaklıklara nasıl dayandığını test edecek.