LLM·3 dk okuma·

Düzeltme Ne Zaman Onarıma Dönüşür? Araç Kullanan LLM'lerde İçsel Müdahalelerin Mekanistik Denetimi

Paylaş
LLMEdumints Blog

Araç Kullanan Ajanlarda Karar Mekanizması ve Eylem Uzayı

Otonom ve ajan tabanlı büyük dil modelleri (LLM'ler), harici araçları (tools) yürütmeden önce $K$ boyutlu bir eylem uzayı arasından kritik bir seçim yapmak zorundadır. Modelin önündeki bu yürütme öncesi eylem uzayı dört temel seçenekten oluşur:

  • Bir çağrıyı yürütme (executing a call): İlgili aracı doğru parametrelerle tetiklemek.
  • Açıklama veya netleştirme isteme (seeking clarification): Eksik parametre veya belirsizlik durumunda kullanıcıya danışmak.
  • Doğrudan yanıtlama (answering directly): Harici bir araca gerek duymadan yanıt üretmek.
  • İsteği reddetme (declining): Yetki dışı, zararlı veya anlamsız istekleri geri çevirmek.

Modelin yürütme öncesi bu kararları, iç aktivasyon yönlendirmeleri (activation steering) ile değiştirilebilmektedir. Ancak geleneksel toplu metrikler (aggregate metrics), değiştirilen içsel durumların latent uzayda tam olarak nereye ulaştığını ve sistemde nasıl bir ikincil hasar (collateral damage) yarattığını gizlemektedir.

SAKIKO Çerçevesi: Temsil Onarımının Mekanistik Denetimi

Araştırmacılar, içsel müdahaleleri denetlemek ve temsil onarımını biçimselleştirmek amacıyla SAKIKO adlı yenilikçi bir denetim çerçevesi sunmaktadır. SAKIKO süreci şu dört temel bileşen üzerine kuruludur:

  • Yönsel Hata Keşfi (Directional error discovery): Modelin hatalı kararlara sapmasına neden olan vektörel yönlerin tespit edilmesi.
  • Yönlendirici Koşullu Müdahale (Router-conditioned intervention): Karar yönlendiricisinin durumuna bağlı olarak uygulanan kontrollü içsel müdahaleler.
  • Hedef Çözümlemeli Doğrulama (Destination-resolved verification): Müdahale edilen iç durumların hangi nihai eyleme vardığının tekil olarak incelenmesi.
  • İleriye Dönük Dondurulmuş İstatistiksel Yetkilendirme (Prospectively frozen statistical licensing): Değerlendirme öncesinde protokolü dondurulan katı istatistiksel testlerle rastlantısallığın elenmesi.

When2Call ve MetaTool kıyaslamalarında yedi farklı LLM üzerinde yapılan kapsamlı deneylerde, kanal anahtarlı müdahaleler beş modelde yöne özgü net kazanımlar sağlamıştır. Ayrıca mühürlü üç değerlendirmede bütçe eşlemeli 59 rastgele yönün hiçbiri hedeflenen kalibre kazanıma ulaşamamıştır.

Davranışsal Hareket Onarım Anlamına Gelmez

SAKIKO'nun hedef çözümlemeli denetimi, model içi durum hareketinin her zaman gerçek bir onarım anlamına gelmediğini göstermektedir:

  • Yüksek İkincil Hasar: Bir müdahale net olarak +55 puanlık bir kazanım sağlasa bile, başlangıçta doğru çalışan kararların yarısından fazlasını bozabilmektedir.
  • İstatistiksel Belirsizlik ve Red: Qwen3-4B ve Gemma-2-9B modellerinde umut verici nokta tahminleri elde edilmesine rağmen, sonlu örneklem belirsizliği nedeniyle bu müdahaleler resmi olarak yetkilendirilmemiştir.

Yazılım Geliştiriciler İçin Pratik Çıkarımlar

  • Regresyon Riskini Ciddiye Alın: Ajan sistemlerinde toplu başarım metrikleri yanıltıcıdır; bir prompt veya yönlendirme müdahalesi yaparken mevcut doğru kararların bozulmadığı regresyon testleriyle doğrulanmalıdır.
  • Sonuç Odaklı Karar Mekanizması Kurun: Temsil düzeyinde müdahale iddia edilmeden önce sonuç odaklı nihai denetim (outcome-resolved adjudication) uygulanmalıdır.
  • Açık Kaynak Kod: Araştırmanın deneysel araçlarına ve kodlarına https://github.com/ruizheliUOA/mechanistic-tool-use-llm adresinden erişilebilir.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Tool Calling ve Multi-Step Agent'lar modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →