Ajanınız Bilgiyi Hatırladı Ama Bir Yabancı Gibi Yanıt Verdi

İçindekiler
Bir bellek sistemi, sorguda açıkça adı geçtiğinde ihtiyaç duyulan bilgiyi kusursuzca getirebilir; fakat aynı bilgiye dayanan dolaylı bir talep geldiğinde, o bilgiye hiç sahip olmayan bir yabancı gibi yanıt verebilir. InMind çalışmasındaki (arXiv 2607.24368v1, Li ve ark.) 125 görevlik kıyaslama verileri bu yapısal sorunu açıkça ortaya koymaktadır:
Kıyaslama Sonuçları (125 Görev)
- Bilginin doğrudan sorulduğu durum (6 bellek sistemi): %76,0 ile %100,0 arası
- Dolaylı istek, bilgi bağlamda mevcutken (6 bellek sistemi): %0,8 ile %12,0 arası
- Uçtan uca puanlanan dolaylı istek (6 bellek sistemi): En fazla %14,4
- Uçtan uca puanlanan dolaylı istek (En iyi 3 Naive RAG kontrolü): %16,0
- Dolaylı istek, bilginin bağlama elle yerleştirildiği durum: %84,0
- Dolaylı istek, bilginin sürekli durumda tutulduğu sonda (diagnostic probe): %68,8
Tek Kelime Altında İki Farklı Yetenek
Yapay zekâ ajanlarında "bellek" kavramı iki farklı yeteneği maskeler:
- Doğrudan Hatırlama (Kolay Kısım): Aranacak şeyin açıkça belirtildiği durumdur. Örneğin roket şirketi olan bir kurucunun, üç hafta önce bahsettiği kodlama şirketinin adını sorması ve ajanın bunu söylemesi.
- Örtük Bilgiyi Kullanma (Zor Kısım): Aynı kısıtı tekrar tekrar açıklamak zorunda kalmamaktır. "O kodlama şirketi için roket bütçesinden kalana göre teklif hazırla" dendiğinde, ajanın önceki notlardaki bütçe bilgisini kendiliğinden bağlama dahil etmesidir.
Geliştiriciler için pratik test: Ajanınıza bildiği bir bilgiye dayanan ancak o bilgiyi açıkça adlandırmayan bir görev verin. Yanıtı hiçbir bellek geçmişi olmayan bir ajanın cevabıyla kıyaslayın. İkisi uyuşuyorsa veritabanınız dolu olsa bile bellek mimariniz çalışmıyor demektir.
Uçurum Yetenekte Değil, Erişilebilirlikte
Elde edilen sonuçlar iki varsayımı çürütmektedir:
- Model yetersizliği değildir: Bilgi bağlama elle eklendiğinde aynı model %84,0 başarı göstermektedir. %84 ile %16 arasındaki fark modelin yeteneği değil, bilgiye erişim problemidir.
- Bilgi kaybolmuş değildir: Doğrudan sorulduğunda, araya giren 38 oturumdan sonra dahi bilgi %100'e varan oranla geri çağrılmaktadır.
- Vektör boyutu çözmez: Embedding boyutunu 8 katına çıkarmak varlığı artırsa da uçtan uca başarı %16'yı geçememektedir.
Çözülememiş asıl problem yönlendirme (routing) problemidir: Kimse sormadan önce hangi bilginin görünür kalacağını belirlemek. Prompt içine 200 satırlık bir durum dosyasını sabit koymak (%68,8) yalnızca bir teşhistir; veri tabanı büyüdükçe bilgiler birbirini dışarı itecektir.
Test Bataryası İçin Dördüncü Koşul
Sergei Parfenov'un önerdiği test bataryası bağımsız durum kopyalarıyla bu zaafı ölçmeyi amaçlar:
- Doğrudan soruyu alan durum,
- Yalnızca görevi alan durum,
- Kısıtın açıkça içine yazıldığı görevi alan durum,
- Bilginin adının geçmediği ancak yanıtta zorunlu olduğu dolaylı durumlar.
Production ortamında güvenilir ajanlar inşa etmek için yalnızca semantik RAG aramalarına güvenilmemeli; proaktif kısıt yönlendirme mekanizmaları tasarlanmalıdır.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Production'da Agent Güvenilirliği modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →