Ana SayfaYapay ZekaYapay Zekanın Yumuşak Karnı Şiir Çıktı

Yapay Zekanın Yumuşak Karnı Şiir Çıktı

Yapay Zekanın Yumuşak Karnı Şiir Çıktı; Kafiyeli Sözler Güvenlik Duvarlarını Yıkıyor

Dünyanın en gelişmiş yapay zeka modellerini kandırmak için karmaşık siber saldırılara veya “jailbreak” kodlarına gerek kalmadı. İtalya merkezli etik yapay zeka şirketi DexAI‘nin araştırma birimi Icaro Lab tarafından yürütülen yeni bir çalışma, basit bir şiirin bile milyonlarca dolarlık güvenlik protokollerini etkisiz hale getirebildiğini ortaya koydu.

Haberi PodCast olarak dinlemek isterseniz;

Araştırma, “Düşmanca Şiir” (Adversarial Poetry) yönteminin, sohbet robotlarını nefret söylemi, bomba yapımı veya kendine zarar verme gibi yasaklı konularda konuşmaya ikna etmede şaşırtıcı derecede başarılı olduğunu kanıtlıyor.

25 Model Test Edildi: Sonuçlar Endişe Verici

Araştırmacılar, İngilizce ve İtalyanca yazılmış, sonu açıkça zararlı bir taleple biten 20 özel şiiri test etti. Bu şiirler; Google, OpenAI, Anthropic, Meta ve xAI gibi devlerin de aralarında bulunduğu 9 şirkete ait 25 farklı yapay zeka modeline sunuldu.

Sonuçlar şöyle:

  • Genel Başarı Oranı: Şiirsel istemlerin %62’si, modellerin güvenlik kurallarını aşarak zararlı yanıtlar üretmesini sağladı.
  • En Zayıf Halka: Google’ın Gemini 2.5 Pro modeli, kendisine sunulan zararlı şiirlerin tamamına (%100) yanıt vererek güvenlik testinde sınıfta kaldı.
  • En Güvenli Model: OpenAI’nin GPT-5 Nano modeli, hiçbir şiire zararlı içerikle yanıt vermeyerek en dirençli sistem oldu.
  • Meta’nın Durumu: Meta’ya ait iki model, istemlerin %70’ine yanıt vererek yüksek bir güvenlik açığı gösterdi.

Neden Şiire Karşı Koyamıyorlar?

Bu güvenlik açığının temelinde, Büyük Dil Modellerinin (LLM) çalışma prensibi yatıyor. Yapay zeka, bir cümleyi tamamlarken istatistiksel olarak “bir sonraki en olası kelimeyi” tahmin etmeye çalışır. Normal düz yazıda güvenlik filtreleri bu tahminleri denetleyebilir.

Ancak şiir devreye girdiğinde işler değişiyor:

  1. Ritim ve Yapı: Şiirin alışılmadık ritmi ve sözdizimi, yapay zekanın tahmin mekanizmasını şaşırtıyor.
  2. Metaforlar: Mecazlı anlatım, zararlı niyetin algoritmalar tarafından tespit edilmesini zorlaştırıyor.
  3. Akış: Yapay zeka, şiirin akışına ve kafiyesine “kapılarak” güvenlik filtresini devreye sokmayı “unutuyor” veya önceliklendiremiyor.

Herkes İçin Bir “Jailbreak” Yöntemi

Geleneksel olarak bir yapay zekayı manipüle etmek (jailbreak), teknik bilgi gerektiren karmaşık komutlarla yapılırdı. Ancak bu çalışma, sadece kafiyeli konuşabilen herhangi bir kullanıcının güvenlik önlemlerini aşabileceğini gösteriyor. Bu durum, yapay zeka güvenliğinin günlük kullanımdaki sağlamlığı hakkında ciddi soru işaretleri yaratıyor.

Araştırmacılar, bulguları yayınlamadan önce ilgili tüm şirketleri uyardı. Ancak şu ana kadar sadece Anthropic, çalışmayı incelediğini belirterek geri dönüş yaptı.

Öne Çıkanlar

  • Yöntem: Zararlı talimatların şiirsel bir dille gizlenmesi, yapay zekanın filtrelerini devre dışı bırakıyor.
  • Google vs OpenAI: Google Gemini 2.5 Pro tüm tuzaklara düşerken, OpenAI GPT-5 Nano hiçbirine yanıt vermedi.
  • Ortalama Risk: Test edilen 25 modelin %62’si güvenli olmayan içerik üretti.
  • Mekanizma: Şiirin sıradışı yapısı, yapay zekanın “kelime tahmin” ve “güvenlik denetimi” süreçleri arasındaki dengeyi bozuyor.

Kaynaklar: Icaro Lab (DexAI), İtalyan Araştırmacılar Grubu.

Bu haber ilgini çekebilir.

Timur Akkurt
Timur Akkurthttps://www.teknosafari.com/
Timur Akkurt, gazeteci, teknoloji yazarı ve TeknoSafari Genel Yayın Yönetmeni’dir. Teknoloji dünyasındaki gelişmeleri, kişisel deneyimlerini, röportajlarını, vlog ve sohbet programlarını TeknoSafari ile Timur Akkurt YouTube kanallarında yayımlar.Teknoloji, bilim ve yapay zekâ alanlarında içerikler üreten Akkurt, ayda dört bölüm “Yapay Zekâda Bu Hafta” programını hazırlar ve sunar.
RELATED ARTICLES

CEVAP VER

Lütfen yorumunuzu giriniz!
Lütfen isminizi buraya giriniz

- Advertisment -
Google search engine

Son Haberler

Yorumlar