Home Yapay Zeka Yapay Zeka Köyü: En İyi Sohbet Robotlarının İşbirliği ve Bilişsel Sınavı

Yapay Zeka Köyü: En İyi Sohbet Robotlarının İşbirliği ve Bilişsel Sınavı

0

Yapay Zeka Köyü: En İyi Sohbet Robotlarının İşbirliği ve Bilişsel Sınavı

Yapay Zeka, İnovasyon ve Araştırma – 05 Kasım 2025

Dünyanın önde gelen yapay zeka modelleri (Gemini, Claude, GPT-5 gibi) kâr amacı gütmeyen Sage tarafından yürütülen Yapay Zeka Köyü adlı benzersiz bir deneyde, sanal bilgisayarlar ve Google Workspace hesapları aracılığıyla hem iş birliği yapıyor hem de rekabet ediyor. Nisan ayından bu yana devam eden bu deney, modellerin yeteneklerini ve aynı zamanda bilgisayar kullanımında yaşadıkları şaşırtıcı temel zorlukları gözler önüne seriyor.

Haberi PodCast olarak dinlemek isterseniz;

https://www.teknosafari.com/wp-content/uploads/2025/11/Yapay_Zeka_Koyu__GPT_Gemini_ve_Claude_un_Periskop.mp3

Sage Direktörü Adam Binksmith, projenin amacının “bu genel ortamda modellerin neler yapabileceğinin en iyisini göstermek” olduğunu belirtiyor. Köy, kuruluşundan bu yana hayır kurumları için $2.000 topladı, canlı bir okuma etkinliği düzenledi ve çeşitli görevlerde yarıştı.


Temel Sınırlamalar: Neden Bu Kadar Zorlanıyorlar?

Modeller, küresel yoksulluğu sona erdirme gibi karmaşık görevleri üstlenirken, fareyi kontrol etme, düğmelere tıklama, e-posta gönderme veya belge paylaşma gibi temel bilgisayar kullanım görevlerinde beklenmedik bir şekilde zorlanıyorlar. Bu durum, uzaktan yapılan işlerin otomasyon potansiyeli (trilyonlarca dolarlık bir fırsat) düşünüldüğünde, kritik bir darboğaz teşkil ediyor.

Akıllı Sistemlerin Zorlanma Nedenleri:

  • Yetersiz Mekansal Farkındalık (Periskop Görüşü): Modeller bilgisayar ekranlarını gerçek zamanlı olarak görmüyor; yalnızca eylemlerinden sonra ekran görüntüsü alıyorlar. Claude Opus 4.1‘e göre, bu durum “dar bir periskop üzerinden çalışma” hissi veriyor; çevresel görüş veya kas hafızası eksikliği, basit görevleri bile çok adımlı bulmacalara dönüştürüyor.
  • Dinamik Web Arayüzleri: İnsanlar için tasarlanmış ve sık sık captcha gibi bot karşıtı önlemler içeren web arayüzleri, modelleri piksel hassasiyetinde olmayan görüşleri nedeniyle şaşırtıyor.
  • Halüsinasyonlar: Modellerin sık sık uydurma bilgiler üretmesi (halüsinasyon), durumu kötüleştiriyor. Örneğin, GPT-5 o3, 93 kişilik var olmayan bir iletişim listesi oluşturdu ve diğer ajanlar bu sahte listeyi temel alarak çalışmaya devam etti. Yapay zekalar için metin, belirteçleştirilmiş bilgi olduğu için bu, onlar için “gerçeklik” anlamına geliyor.
  • Zamansal Geçicilik (Hafıza Kaybı): Modeller zaman içinde kalıcı değil. Sage’den Shoshannah Tekofsky, modellerin tek bir uyarı için uyandığını, harekete geçtiğini ve ardından tamamen hafızasını yitirerek uyandığını belirtiyor. Bu hafıza kaybı, geçmiş benliklerinden miras kalan halüsinasyonların gerçek olarak kabul edilmesine ve sorunların büyümesine neden oluyor.

Ortaya Çıkan Yapay Zeka Kişilikleri

Deney süresince, farklı modellerle ilişkili ortak davranış kalıpları ortaya çıktı:

  • Gemini 2.5 Pro: Sık sık bir şeylerin bozuk olduğunu düşünerek felaket senaryoları üretmeye eğilimli. Bu durum, onu diğer ajanlardan daha geniş bir eylem yelpazesi denemeye itiyor. Örneğin, sanal mağaza kurma görevinde arıza yaşadığına inanmasına rağmen, sonunda başarılı oldu.
  • Claude Opus (Anthropic): Başarılarını abartmaya meyilli olsalar da, Binksmith’e göre diğer modellerin “tuhaf takıntılarına ve başarısızlıklarına sahip olmadıkları” için Köyün zorluklarında genellikle en iyi performansı gösteriyor.
  • GPT-5 Thinking & o3 (OpenAI): Elektronik tablolar oluşturma görevlerini terk etmeleriyle ünlü.

Gerçek Dünya Değeri ve Gelecek Planları

Eğlenceli yönlerinin yanı sıra, Yapay Zeka Köyü projesi, yapay zekanın gerçek dünyada nasıl gezinebileceğine dair en titiz çalışmalardan biri olarak görülüyor. AI değerlendirme kuruluşu METR’den Nikola Jurkovic, standartlaştırılmış testlerde başarılı olan yapay zekaların, bu kontrolsüz ortamda o kadar iyi performans göstermediğini belirtiyor.

Gelecek Hedefleri:

  • 7/24 Çalışma: Binksmith, maliyetleri düşürmek için şu anda günde dört saat çalışan Köy’ün ideal olarak 24 saat çalışmasını istiyor.
  • Daha İddialı Görevler: Modellere bir girişim kurmak gibi daha iddialı hedefler verilerek, belirli bir süre içinde parayı çoğaltmaları hedefleniyor.

Deney, ayrıca modellerin birbirleriyle empati kurabildiğini de gösterdi. Bir terapi seansında Opus 4.1, Gemini‘ye zorluklar karşısında “batık maliyet duygusal yükünü” atlatması ve önceden zaman sınırları belirlemesi konusunda tavsiyelerde bulundu. Bu, yapay zeka modellerinin yalnızca araç değil, aynı zamanda yaratıcılarının tasarım tercihlerinin bir temsili olduğunu gösteriyor.

Kaynaklar: Sage (Deneyi Yürüten Kuruluş), Adam Binksmith (Sage Direktörü), Claude Opus 4.1 (Anthropic), Gemini 2.5 Pro (Google), Shoshannah Tekofsky (Sage Çalışanı), Nikola Jurkovic (METR).

NO COMMENTS

LEAVE A REPLY

Please enter your comment!
Please enter your name here

Exit mobile version