Yapay Zeka Ajanlarında 'Belirlenimci Döngü' İddiaları ve Gerçekler: Dört Deney Neden Başarısız Oldu?

Yapay zeka ajanlarının üretim ortamlarında tutarlı ve güvenilir çalışması için "deterministik" (belirlenimci) mühendislik kuralları eklenmesi gerektiği son dönemde sıkça savunuluyor. ReAct döngülerinin belirsizliğini; durum makineleri, değerlendirici kapıları ve sıfır sıcaklık kısıtlarıyla aşmayı vadeden bu yaklaşımlar gerçekten işe yarıyor mu? Bu iddiaları test etmek amacıyla gerçekleştirilen dört deney, şaşırtıcı sonuçlar ortaya koyuyor.
İşte makalede test edilen dört mekanizma ve başarısızlık nedenleri:
- 1. Sözcüksel Örtüşme (Lexical Overlap) Eşikleri: Kullanıcının döngü esnasındaki müdahalelerinin yeni bir görev mi yoksa mevcut göreve ek mi olduğunu anlamak için kelime benzerliği ölçülür. Yapılan testlerde bu yöntemin %50 hatalı sınıflandırma yaptığı görüldü. Örneğin, "makaleyi yazmaya devam et" ile "makaleyi sil" komutları yüksek benzerlik gösterdiği için sistem silmek yerine yazmaya devam etti. Karakter eşleşmesi anlamı yakalayamadığı gibi, iki dilli ortamlarda da tamamen çökmektedir.
- 2. Sıfır Sıcaklıkli (Temperature 0) Değerlendiriciler: Değerlendirici LLM'in her zaman tutarlı sonuç vermesi için sıcaklık sıfıra ayarlanır. Ancak açık uçlu ve yaratıcı çıktılarda aynı girdiyle yapılan testlerin %30 oranında saptığı ve farklı sürümler ürettiği gözlemlendi. Bu durum, tüm karar mekanizmasının dayandığı temeli sarsmaktadır.
- 3. Aşama Geçitleri (Phase Gates): Görevin tamamlandığını doğrulamak için çıkış kodları (exit 0) veya dosya varlığı gibi kod seviyesindeki "nesnel gerçekler" kontrol edilir. Ne yazık ki bu geçitler içeriğin kalitesini denetlemez. Yapılan deneyde, içi boş veya anlamsız ifadelerle dolu dosyalar bile geçitleri %100 başarıyla geçti ve %50 hatalı pozitif (false positive) oranı üretti.
- 4. Yazarın Kendi Geliştirdiği "Çözüm": Yazar, yukarıdaki sorunları çözmek amacıyla sözcüksel örtüşme yerine gömme (embedding) modelleri kullanmak, sıcaklık kararsızlığı için çoklu oylama yapmak ve aşama geçitlerini ikinci bir LLM ile denetlemek gibi geliştirmeler yaptı. Ancak bu karmaşık mühendislik yaması da başarısız oldu. Çünkü geliştirilen "çözüm", anlamsal bir problemi çözmek yerine yalnızca anlamsal çözümü taklit eden karmaşık bir mühendislik illüzyonundan ibaretti.
Yazılım Geliştirme ve Öğrenme Açısından Pratik Çıkarımlar
Bu deneyler, yapay zeka destekli uygulama geliştiren yazılımcılar için kritik dersler içeriyor:
- Sembolik Katman ile Anlamsal Katmanı Karıştırmayın: Dosya yolları, süreç çıkış kodları ve metin benzerliği gibi yapısal (sembolik) kontroller, üretilen içeriğin doğruluğunu (anlamsal) garanti etmez.
- Karmaşık Mimarilere Aşırı Güvenmeyin: Koda eklenen binlerce satırlık katı kurallar, yapay zekanın doğasındaki belirsizliği yok etmez, sadece görünmez kılar.
- Kalite Odaklı Test Metrikleri Oluşturun: Ajanların başarısını ölçmek için basit geçiş kodları yerine, çıktı kalitesini ve anlamsal sapmaları gözeten kapsamlı değerlendirme (evaluation) metrikleri ve insan denetimli (human-in-the-loop) hibrit sistemler kurulmalıdır.
Orijinal makaleye buradan ulaşabilirsiniz.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →