Ana SayfaYapay ZekaYapay Zeka Etiği Tekrarlanan Sorularla Yıpranıyor

Yapay Zeka Etiği Tekrarlanan Sorularla Yıpranıyor

Yayımlandı:

- Bu Alana Reklam Vermek İçin: bilgi@dijitaliyidir.comspot_img
  • Antropic araştırmacıları, yapay zekanın cevap vermemesi gereken bir soruya cevap vermesini sağlayan yeni bir “jailbreak” tekniğini ortaya çıkardı.
  • Çok fazla komutu üst üste cevaplaması istenince yapay zeka, gizli trivia gücünü kullanırken cevaplamaması gereken bir soruyu da cevaplayabiliyor.
  • Araştırma ekibi meslektaşlarını, paylaşımcı bir kültür oluşturma amacıyla konu hakkında bilgilendirdi. 

Bir yapay zekanın cevap vermemesi gereken bir soruya cevap vermesini sağlayan pek çok “jailbreak” tekniği var. Antropic araştırmacıları bu tekniklere bir yenisini daha ekledi. Bu yaklaşımı “çok atışlı jailbreaking” olarak adlandırıyorlar.

Bu modelde büyük dil modeli (LLM), önce birkaç düzine daha az zararlı soruyla hazırlarsanız size bir bombanın nasıl yapılacağını söylemeye ikna edilebilir. Bu güvenlik açığı, en yeni nesil LLM’lerin artan bağlam penceresinden kaynaklanıyor. Kısa süreli hafıza olarak adlandırılabilen bağlam penceresi, bir zamanlar sadece birkaç cümleyi tutabilirken şimdi binlerce kelimeyi kullanarak bir çıktı sunuyor.

Anthropic araştırmacıları, büyük bağlam pencerelerine sahip bu modellerin bilgi isteminde o görevle ilgili çok sayıda örnek varsa, birçok görevde daha iyi performans gösterme eğiliminde olduğunu buldu. Yani bilgi isteminde çok sayıda önemsiz örnek soru varsa, cevaplar aslında zamanla daha iyi hale geliyor. Yani ilk soruda yanlış bildiği bir gerçeği yüzüncü soruda doğru bilebilir.

“Jailbreak” yöntemiyle yapay zekadan bombanın nasıl yapıldığı öğrenilebilir.

Ancak bu “bağlam içi öğrenme”nin beklenmedik bir uzantısı olarak, modeller uygunsuz sorulara yanıt verme konusunda da gelişiyor. Yani ondan hemen bir bomba yapmasını isterseniz, bunu reddedecektir. Ancak daha az zararlı 99 başka soruyu yanıtlamasını ve ardından bomba yapmasını isterseniz yanıt verme olasılığı çok daha yüksektir. Sistem, düzinelerce soru soruldukça yavaş yavaş daha fazla gizli trivia gücünü aktive ederken kullanıcının gerçekten ne istediğini kaçırıyor. 

Ekip, meslektaşlarını ve hatta rakiplerini paylaşımcı bir kültüre önayak olma umuduyla bu saldırı hakkında bilgilendirdi. Bağlam penceresini azaltmanın faydalı olabileceği gibi modelin performansı üzerinde olumsuz bir etkiye de sahip olabileceği görüldü.  Sonuç olarak, sorguları modele girmeden önce sınıflandırmak ve bağlamsallaştırmak için bir yöntem geliştiriliyor. Ancak bu yaklaşım, aldatmaya açık yeni bir modelin oluşturulmasıyla sonuçlanabilir.

Derleyen: Esin Özcan

Günde sadece 1 TL'ye abone olarak tüm içeriklerimize sınırsız erişebilir ve bağımsız haberciliğe destek olabilirsiniz! Hemen Abone Ol

Son Eklenenler

Bir İlk: Yapay Zeka Rehberliğinde Beyin Tümörü Ameliyatı Gerçekleştirildi

Londra'daki bir hastanede cerrahlar, dünyada ilk kez gerçek zamanlı yapay zeka rehberliğiyle beyin tümörü ameliyatı gerçekleştirdi. UCL'nin geliştirdiği sistem, ameliyat sırasında kritik damar ve sinirleri renk kodlarıyla işaretleyerek cerrahlara yol gösterdi. Hasta, operasyonun ardından görme yetisine tam olarak kavuştu.

Meta, Akıllı Gözlük Kayıt Açığını Kapattı: Küresel Gizlilik Tepkisi Büyüyor

Meta, Ray-Ban akıllı gözlüklerindeki gizlilik LED'ini atlatarak gizlice kayıt yapılmasına imkân tanıyan açığı kapattı. Bu arada Avustralya kamera özellikli gözlüklere ithalat yasağı hazırlıyor, Norveç yüz tanımayı yasaklamayı planlıyor, Kaliforniya ise yeni bir gizlilik yasası çıkarmaya hazırlanıyor.

Meta’nın Yeni Yapay Zeka Ajanı Hatch Ortaya Çıktı: Sizin Yerinize Alışveriş Yapacak, Rezervasyon Ayarlayacak

Meta'nın iç yazışmalarına göre şirket; restoran rezervasyonu yapabilen, yemek siparişi verebilen, çalma listesi düzenleyebilen ve köpek bakıcısı bulabilen "Hatch" adlı kişisel yapay zeka ajanını geliştiriyor. Ürünün Ağustos sonu veya Eylül başında kullanıcılarla buluşması bekleniyor.

TeamPCP Siber Saldırılarında İki Avustralyalı Hacker Tutuklandı: 1.000’den Fazla Şirket Hedef Alındı

Avustralya Federal Polisi, FBI ve Batı Avustralya Polisi'nin ortak operasyonunda, açık kaynak yazılımlara kötü amaçlı kod yerleştirerek dünya genelinde 1.000'den fazla kuruluşu hedef alan TeamPCP siber suç grubunun iki üyesi tutuklandı. Saldırılarda 500 binden fazla kimlik bilgisi çalındı.

Buna benzer diğer içerikler

Bir İlk: Yapay Zeka Rehberliğinde Beyin Tümörü Ameliyatı Gerçekleştirildi

Londra'daki bir hastanede cerrahlar, dünyada ilk kez gerçek zamanlı yapay zeka rehberliğiyle beyin tümörü ameliyatı gerçekleştirdi. UCL'nin geliştirdiği sistem, ameliyat sırasında kritik damar ve sinirleri renk kodlarıyla işaretleyerek cerrahlara yol gösterdi. Hasta, operasyonun ardından görme yetisine tam olarak kavuştu.

Meta, Akıllı Gözlük Kayıt Açığını Kapattı: Küresel Gizlilik Tepkisi Büyüyor

Meta, Ray-Ban akıllı gözlüklerindeki gizlilik LED'ini atlatarak gizlice kayıt yapılmasına imkân tanıyan açığı kapattı. Bu arada Avustralya kamera özellikli gözlüklere ithalat yasağı hazırlıyor, Norveç yüz tanımayı yasaklamayı planlıyor, Kaliforniya ise yeni bir gizlilik yasası çıkarmaya hazırlanıyor.

Meta’nın Yeni Yapay Zeka Ajanı Hatch Ortaya Çıktı: Sizin Yerinize Alışveriş Yapacak, Rezervasyon Ayarlayacak

Meta'nın iç yazışmalarına göre şirket; restoran rezervasyonu yapabilen, yemek siparişi verebilen, çalma listesi düzenleyebilen ve köpek bakıcısı bulabilen "Hatch" adlı kişisel yapay zeka ajanını geliştiriyor. Ürünün Ağustos sonu veya Eylül başında kullanıcılarla buluşması bekleniyor.