LLM·3 dk okuma·

Anahtar Kelime Tabanlı Testlerin Yanılgısı: Küçük Dil Modellerinde Araç Kullanımı İddiaları İçin Ucuz Bir Tanılama Merdiveni

Paylaş
LLMEdumints Blog

1. Gevşek Testlerin Yanılgısı ve Model Mimarisi Karşılaştırması

  • Yanıltıcı Başarı (Fail-Open): Anahtar kelime eşleştirme (keyword-matching) kıyaslama testleri, küçük dil modellerinin gerçekte hiç yürütmediği araç çağırma (tool calling) işlemlerini başarılı sayarak sahte pozitif sonuçlar üretebilmektedir.
  • Model Karşılaştırması: Aynı kod çözücü (decoder), belirteçleyici (tokenizer) ve özel belirteçleri paylaşan eş mimarili iki İspanyolca siber güvenlik modeli incelenmiştir:
    • 661.6M parametreli model: Yaklaşık %65 kod ve teknik metinle eğitilmiş, özel bir SFT uygulanmamıştır.
    • 1,109M (1.1B) parametreli model: Web ağırlıklı çok aşamalı müfredat ve 6 milyar belirteçlik (6B-token) araç SFT sürecinden geçmiştir.
    • Her iki model de esnek metriklerde (B4 skoru: 0.660'a karşı 0.650) neredeyse tamamen aynı puanı almıştır.
  • Geliştirici Çıkarımı: Yüzeysel metin benzerliği testleri yanıltıcıdır; ajan mimarilerinde araç çağrılarının geçerliliği yalnızca katı şema ve sözdizimi doğrulayıcılarıyla test edilmelidir.

2. İlk-Belirteç Sondası ile Hata Tespiti ve Hedefli SFT

  • Yeniden Üretim ve Kök Neden: Birebir yeniden üretim kontrollerinde 600M modeli genelleştirilmiş argümanlarla 6/6 geçerli araç çağrısı üretirken, 1B modeli tüm kontrol noktalarında 0/6'da kalmıştır. İlk-belirteç sondası (first-token probe), 1B'nin <|tool_call|> belirtecindeki düşük önsel olasılığı (10⁻⁴ - 10⁻⁵) ortaya çıkarmış; bu önselin web ağırlıklı evrede silindiğini kanıtlamıştır.
  • Hedefli Onarım: Çeşitlendirilmiş veri kümesi, 5 kat yüksek öğrenme oranı ve 2.202 adımlık (~3.3 GPU saati) bir SFT reçetesi, 1B modelini önceki aşamadan üç kat daha az belirteçle onarmıştır:
    • Geçerli çağrı oranı 0.100'den 0.959'a çıkmıştır (600M: 0.926).
    • Görülmemiş 238 prompt üzerinde onarılan 1B, %53.6 başarı sağlayarak 600M'in (%42.8) önüne geçmiştir (p = 0.004).
    • Katıştırma kayması (embedding-drift) kontrolleri, tetikleyici belirtecin bağlı katıştırmasının değişmediğini (bf16 tablosunun %97.7'si bit düzeyinde aynıdır), değişimin çevre ağ ağırlıklarında gerçekleştiğini göstermiştir.
  • Geliştirici Çıkarımı: Modelleri devasa verilerle baştan eğitmek yerine, hata kök nedenini sonda testleriyle belirleyip hedefli ve kaliteli küçük veriyle ince ayar yapmak maliyeti ve süreyi dramatik olarak azaltır.

3. Aşırı Tetikleme Sorunu ve Düşük Maliyetli Test Kapısı

  • Aşırı Tetikleme (Over-triggering): Her iki model de araç gerektirmeyen negatif prompt'ları çağrı yapmadan yanıtlama konusunda yetersiz kalmıştır (negatif yanıtlama oranı 600M için 0.09, onarılan 1B için 0.17).
  • Faktöriyel Analizler: Tüm onarım yapılandırmaları araç çağırma formatını modele başarıyla kazandırmıştır; ancak çeşitlendirilmiş veri setinin çağrı baskılama avantajı tohum hassasiyeti nedeniyle henüz varsayım düzeyindedir.
  • Tanılama Merdiveni: Yalnızca birkaç dakikalık CPU çalışma süresi gerektiren bu ucuz ve katı tanılama merdiveni, küçük modellerin araç kullanımı iddialarını doğrulamak için CI/CD süreçlerinde zorunlu bir kalite kapısı (gate) olarak kullanılmalıdır.
  • Geliştirici Çıkarımı: Ajan sistemleri tasarlarken yalnızca pozitif senaryoları değil, modelin aracı ne zaman çağırmaması gerektiğini denetleyen negatif regresyon testlerini de üretim boru hatlarına dahil etmelisiniz.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2610.02142)


Bu konuyu derinlemesine öğrenmek isterseniz: Tool Calling ve Multi-Step Agent'lar modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →