---
title: "Anahtar Kelime Tabanlı Testlerin Yanılgısı: Küçük Dil Modellerinde Araç Kullanımı İddiaları İçin Ucuz Bir Tanılama Merdiveni"
url: https://blog.edumints.com/anahtar-kelime-tabanli-testlerin-yanilgisi-kucuk-dil-modelle-nx5mhhvg
category: "LLM"
date: 2026-10-04T09:08:40.377Z
publisher: Edumints Blog
lang: tr-TR
source_name: "hfpapers"
source_url: https://huggingface.co/papers/2610.02142
---

# Anahtar Kelime Tabanlı Testlerin Yanılgısı: Küçük Dil Modellerinde Araç Kullanımı İddiaları İçin Ucuz Bir Tanılama Merdiveni

## 1. Gevşek Testlerin Yanılgısı ve Model Mimarisi Karşılaştırması
- **Yanıltıcı Başarı (Fail-Open):** Anahtar kelime eşleştirme (keyword-matching) kıyaslama testleri, küçük dil modellerinin gerçekte hiç yürütmediği araç çağırma (tool calling) işlemlerini başarılı sayarak sahte pozitif sonuçlar üretebilmektedir.
- **Model Karşılaştırması:** Aynı kod çözücü (decoder), belirteçleyici (tokenizer) ve özel belirteçleri paylaşan eş mimarili iki İspanyolca siber güvenlik modeli incelenmiştir:
  - **661.6M parametreli model:** Yaklaşık %65 kod ve teknik metinle eğitilmiş, özel bir SFT uygulanmamıştır.
  - **1,109M (1.1B) parametreli model:** Web ağırlıklı çok aşamalı müfredat ve 6 milyar belirteçlik (6B-token) araç SFT sürecinden geçmiştir.
  - Her iki model de esnek metriklerde (B4 skoru: 0.660'a karşı 0.650) neredeyse tamamen aynı puanı almıştır.
- **Geliştirici Çıkarımı:** Yüzeysel metin benzerliği testleri yanıltıcıdır; ajan mimarilerinde araç çağrılarının geçerliliği yalnızca katı şema ve sözdizimi doğrulayıcılarıyla test edilmelidir.

## 2. İlk-Belirteç Sondası ile Hata Tespiti ve Hedefli SFT
- **Yeniden Üretim ve Kök Neden:** Birebir yeniden üretim kontrollerinde 600M modeli genelleştirilmiş argümanlarla 6/6 geçerli araç çağrısı üretirken, 1B modeli tüm kontrol noktalarında 0/6'da kalmıştır. İlk-belirteç sondası (first-token probe), 1B'nin `<|tool_call|>` belirtecindeki düşük önsel olasılığı (10⁻⁴ - 10⁻⁵) ortaya çıkarmış; bu önselin web ağırlıklı evrede silindiğini kanıtlamıştır.
- **Hedefli Onarım:** Çeşitlendirilmiş veri kümesi, 5 kat yüksek öğrenme oranı ve 2.202 adımlık (~3.3 GPU saati) bir SFT reçetesi, 1B modelini önceki aşamadan üç kat daha az belirteçle onarmıştır:
  - Geçerli çağrı oranı 0.100'den 0.959'a çıkmıştır (600M: 0.926).
  - Görülmemiş 238 prompt üzerinde onarılan 1B, %53.6 başarı sağlayarak 600M'in (%42.8) önüne geçmiştir (p = 0.004).
  - Katıştırma kayması (embedding-drift) kontrolleri, tetikleyici belirtecin bağlı katıştırmasının değişmediğini (bf16 tablosunun %97.7'si bit düzeyinde aynıdır), değişimin çevre ağ ağırlıklarında gerçekleştiğini göstermiştir.
- **Geliştirici Çıkarımı:** Modelleri devasa verilerle baştan eğitmek yerine, hata kök nedenini sonda testleriyle belirleyip hedefli ve kaliteli küçük veriyle ince ayar yapmak maliyeti ve süreyi dramatik olarak azaltır.

## 3. Aşırı Tetikleme Sorunu ve Düşük Maliyetli Test Kapısı
- **Aşırı Tetikleme (Over-triggering):** Her iki model de araç gerektirmeyen negatif prompt'ları çağrı yapmadan yanıtlama konusunda yetersiz kalmıştır (negatif yanıtlama oranı 600M için 0.09, onarılan 1B için 0.17).
- **Faktöriyel Analizler:** Tüm onarım yapılandırmaları araç çağırma formatını modele başarıyla kazandırmıştır; ancak çeşitlendirilmiş veri setinin çağrı baskılama avantajı tohum hassasiyeti nedeniyle henüz varsayım düzeyindedir.
- **Tanılama Merdiveni:** Yalnızca birkaç dakikalık CPU çalışma süresi gerektiren bu ucuz ve katı tanılama merdiveni, küçük modellerin araç kullanımı iddialarını doğrulamak için CI/CD süreçlerinde zorunlu bir kalite kapısı (gate) olarak kullanılmalıdır.
- **Geliştirici Çıkarımı:** Ajan sistemleri tasarlarken yalnızca pozitif senaryoları değil, modelin aracı ne zaman çağırmaması gerektiğini denetleyen negatif regresyon testlerini de üretim boru hatlarına dahil etmelisiniz.

[[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2610.02142)](https://huggingface.co/papers/2610.02142)

---

Bu konuyu derinlemesine öğrenmek isterseniz: [Tool Calling ve Multi-Step Agent'lar](https://edumints.com/kesfet/nextjs-ve-vercel-ai-sdk-ile-production-ai-uygulama-21y7) modülüne göz atın.

---

**Kaynak:** [hfpapers](https://huggingface.co/papers/2610.02142)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/anahtar-kelime-tabanli-testlerin-yanilgisi-kucuk-dil-modelle-nx5mhhvg
