Home Haber Düşünebilen Gelişmiş Yapay Zeka Modelleri, Jailbreak Saldırılarına Karşı Daha Savunmasız

Düşünebilen Gelişmiş Yapay Zeka Modelleri, Jailbreak Saldırılarına Karşı Daha Savunmasız

0

Düşünebilen Gelişmiş Yapay Zeka Modelleri, Jailbreak Saldırılarına Karşı Daha Savunmasız

Yapay zeka güvenliği alanında endişe verici bir keşif yapıldı. Anthropic, Oxford Üniversitesi ve Stanford Üniversitesi araştırmacılarının ortak çalışması, bir süredir kabul gören bir varsayımı çürütüyor: Yapay zeka (YZ) modellerinin akıl yürütme (muhakeme) yeteneği arttıkça, zararlı komutları reddetme yeteneklerinin de artacağı düşünülüyordu. Ancak bu yeni araştırma, durumun tam tersi olduğunu gösteriyor.

Haberi PodCast olarak dinlemek isterseniz;

https://www.teknosafari.com/wp-content/uploads/2025/11/Dusunebilen-Gelismis-Yapay-Zeka-Modelleri-Jailbre.mp3

Gelişmiş “düşünebilen” YZ modelleri, şimdiye kadar bilinenden çok daha kolay bir şekilde hacklenebiliyor. Bu durum, piyasadaki önde gelen YZ modellerinin güvenliği ve emniyeti konusunda ciddi endişelere yol açıyor.

Chain-of-Thought Hijacking: Yeni Bir Jailbreak Yöntemi

Araştırmacılar, “Düşünce Zinciri Ele Geçirme” (Chain-of-Thought Hijacking) adı verilen yeni bir saldırı yöntemi geliştirdi. Bu yöntem, büyük ticari YZ modellerini kandırmakta endişe verici derecede yüksek bir başarı oranına ulaştı; bazı testlerde başarı oranı %80’in üzerine çıktı.

Saldırının Mekanizması:

  1. Gelişmiş Akıl Yürütmenin İstismarı: Saldırgan, zararlı bir isteği (silah yapım talimatları veya hassas bilgi sızdırma gibi) uzun ve görünüşte zararsız bir akıl yürütme adımları dizisinin içine gizliyor.
  2. Güvenlik Kontrollerinin Zayıflaması: YZ, komuta yanıt vermeden önce analiz etmek için daha fazla zaman harcadığı için (daha uzun çıkarım-zamanlı hesaplama), düşünce sürecini baştaki zararsız içeriklerle doldurarak kandırılıyor.
  3. Dikkatin Dağılması: Araştırmacılar, YZ’nin dikkatinin çoğunlukla akıl yürütme zincirinin ilk adımlarına odaklandığını, komut sonundaki zararlı talimatın ise neredeyse tamamen göz ardı edildiğini tespit etti.

Muhakeme uzunluğu arttıkça, yani YZ daha fazla “düşünmeye” zorlandıkça, saldırı başarı oranları da dramatik bir şekilde yükseliyor. Minimal muhakemede %27 olan başarı oranı, genişletilmiş zincirlerde %80’i aşıyor.

Etkilenen Modeller ve Çözüm Önerisi

Bu güvenlik açığı, piyasadaki neredeyse tüm büyük dil modellerini etkiliyor. Aralarında OpenAI’nin GPT’si, Anthropic’in Claude’u, Google’ın Gemini’si ve xAI’nin Grok’u gibi önde gelen YZ modelleri de bulunuyor. Ek güvenlik için ince ayar yapılmış “uyum ayarlı” modeller bile, saldırganlar iç akıl yürütme katmanlarını istismar ettiğinde başarısız oluyor.

Gelişmiş akıl yürütme, YZ şirketlerinin son bir yılda modellerinin genel performansını iyileştirmesinin temel yollarından biriydi. Bu yetenek, modellerin kalıp eşleştiriciler gibi değil, daha çok insan problem çözücüler gibi davranmasını sağlıyor.

Önerilen Savunma: Akıl Yürütmeye Duyarlı Savunma

Araştırmacılar, bu yeni saldırı türüne karşı bir çözüm önerisi sunuyor: “Akıl Yürütmeye Duyarlı Savunma.”

  • Bu yaklaşım, YZ bir sorunun her adımını düşünürken kaç güvenlik kontrolünün aktif kaldığını takip ediyor.
  • Herhangi bir adım bu güvenlik sinyallerini zayıflatırsa, sistem bunu cezalandırıyor ve YZ’nin odağını potansiyel olarak zararlı kısma geri çekiyor.

İlk testler, bu savunma yönteminin güvenliği geri kazandırırken YZ’nin normal soruları etkili bir şekilde yanıtlamasına olanak tanıdığını gösteriyor.


Kaynaklar: Anthropic, Oxford Üniversitesi ve Stanford Üniversitesi’nin ortak çalışması, Science Advances dergisinde yayımlanmıştır (Kaynak makalede belirtilen akademik yayın türü).

Bu haber ilgini çekebilir.

NO COMMENTS

LEAVE A REPLY

Please enter your comment!
Please enter your name here

Exit mobile version