LLM·3 dk okuma·

Saymak mı, Hesaplamak mı? Bir Araç Satır Döndürdüğünde Doğru Sayan Modeller Token Harcıyor

Paylaş
Saymak mı, Hesaplamak mı? Bir Araç Satır Döndürdüğünde Doğru Sayan Modeller Token Harcıyor

Yapay zekâ ajanları (AI agents) geliştirirken arama motoru, veritabanı veya API araçları genellikle bir kayıt listesi döndürür. Kullanıcı "kaç adet var?" diye sorduğunda sayma işlemini doğrudan model üstlenir. Birkaç satırlık hızlı testlerde sorunsuz çalışan bu adım, satır sayısı arttığında sessizce başarısız olur; model doğru sorguyu üretse dahi kendinden emin bir şekilde yanlış sayı söyler. Bu Kaggle benchmark çalışması, ajanların sıklıkla yürüttüğü fakat nadiren test edilen sayma adımını 10 farklı model ve 68 soru ile sınıyor.

Karşılaştırma Sonuçları: Token Maliyeti ve Doğruluk

İki farklı araç tipi (count_ids ve list_ids) karşılaştırıldığında modeller belirgin biçimde iki gruba ayrıldı:

  • count_ids (Kesin sayım aracı): Araç doğrudan kesin adedi döndürdüğünde, biri hariç tüm modeller 330 ID içeren listelerdeki soruları eksiksiz doğru yanıtladı.
  • list_ids (ID listesi aracı): Soru başına 2.700 ile 8.200 çıkış (output) token'ı harcayan modeller, 21 listenin 15 ila 21'ini doğru saydı. 600 token'ın altında yanıt veren modeller ise yalnızca 0 ila 10 listeyi doğru sayabildi.
  • Şaşırtıcı modeller: Grubun en pahalı modeli olan Claude Opus 5, yalnızca 579 token harcayarak 21 listeden 9'unu doğru sayabildi. Buna karşılık 26 milyar parametreli açık ağırlıklı Gemma 4 26B, 8.153 token harcayarak 20 listeyi doğru saymayı başardı.

Neyi Test Ettim? (What I Benchmarked)

Benchmark kurgusu 11 ID örneğinden yola çıkar: 0, 2, 3, 20, 21, 22, 23, 10, 11, 12, 13. "Hangileri 10 veya üzeridir?" sorusunun yanıtı 8'dir ve tüm modeller bunu bilir. Ancak 11 satırlık testler 300 satır hakkında hiçbir fikir vermez. Aritmetik işlemin kim tarafından yapıldığını ölçen 3 görev kurgulanmıştır:

  • count-engine: Model count_ids(where) çağrısı yapar (kesin sayı, minimum ve maksimum döner). Sayımı araç yapar.
  • count-rows-tool: Model list_ids(where) çağrısı yapar (eşleşen ID'leri döner). Sayımı listeden model yapar.
  • count-python-tool: Tüm ID'ler prompt içinde sunulur ve run_python ortamı sağlanır. Sayımı modelin yazdığı Python kodu yapar.

İlk iki görevde ID'ler prompt içinde yer almaz. Model filtreleri denetlenir (örneğin 9 ID'si "10 veya üzeri" için doğru kabul edilir), tüm hatalar sorgu veya sayım kaynaklı olarak ayrıştırılır. Testte 11, 110 ve 330 ID'lik listeler, 7 farklı eşik ifadesi ve 3 farklı seed ile 68 soru yöneltilmiştir.

Test Edilen Modeller

Kadro; küçük, orta ve büyük ticari modeller ile açık ağırlıklı modelleri kapsar:

  • Google: Gemini 2.5 Flash, Gemini 3.7 Flash, Gemini 3.8 Flash, Gemma 4 26B A4B
  • Anthropic: Claude Haiku 4.5, Claude Sonnet 5, Claude Opus 5
  • OpenAI: GPT-5.4 nano, GPT-5.4 mini, gpt-oss-20b

Geliştiriciler İçin Pratik Çıkarımlar

  • Agregasyonu araca bırakın: LLM'e ham kayıt listesi dönüp saydırmak yerine COUNT(*) gibi hesaplamaları doğrudan veritabanı veya API aracına yaptırın.
  • Token bütçesi doğruluğu belirler: Modeller akıl yürütme (reasoning) için yeterli çıkış token'ı harcamadığında yüksek güvenle yanlış bilgi (halüsinasyon) üretir.
  • Büyük ölçekli testler uygulayın: 11 satırda çalışan bir ajan mimarisi yüzlerce satırda çökebilir; tool calling sistemlerinizi gerçek veri boyutlarıyla test edin.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Tool Calling ve Multi-Step Agent'lar modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →