Hissiyatın Ötesinde: Yerel SLM'ler, Deterministik Değerlendirmeler ve İnsan Öğrenme Döngüleriyle Kapalı Devre Ajan Mimarisi

İçindekiler
Llama 3.2 3B gibi 3 milyar parametreli bir modeli standart yerel donanımda çalıştırmak ilk bakışta büyüleyici hissettirir: Oldukça hızlıdır, veri gizliliğini korur ve sıfır API maliyetiyle tamamen çevrimdışı çalışır. Ancak bu modeli fatura kesme veya muhasebe mutabakatı gibi operasyonel iş verileriyle karşılaştırdığınızda gerçekler hızla yüzünüze çarpar. Bir Küçük Dil Modeli (SLM), son derece nazik ve profesyonel bir e-posta taslağı kaleme alırken, aynı metin içerisinde 1.975 dolarlık fatura için sessizce 1.990 dolarlık bakiye uydurabilir veya "TX-9999" gibi hayali işlem kimlikleri üretebilir.
Olasılıksal dil modelleri kritik iş akışlarıyla buluştuğunda dört temel hata modu ortaya çıkar:
- Matematik ve Muhasebe Halüsinasyonları: Güçlü akıl yürütme yeteneği sergileyen modeller dahi aritmetik işlemlerde rastgele hata yapabilir, küsuratları tutarsız yuvarlayabilir ya da hayali işlem kalemleri uydurabilir.
- "Hissiyat" Değerlendirme Tuzağı: Ekipler sistemleri genellikle istatistiksel değerlendirici uyumunu ölçmeden ya da yanıt uzunluğu yanlılığını denetlemeden, yalnızca birkaç örneği göz ucuyla inceleyerek veya bir başka LLM'e "1 ile 5 arasında puan ver" diyerek yetersiz biçimde test eder.
- Eksik Çıkış Rampaları: Model belirsizlik veya eksik veriyle karşılaştığında, varsayılan yönlendirmeler yüzünden güvenli bir ret (Abstain) vermek veya konuyu uzmana eskalasyon (Escalate) etmek yerine tahmin yürütmeye zorlanır.
- Statik ve Kopuk Bilgi: İnsan operatörlerin taslakları incelerken düzelttiği hatalar, sistemi eğiten bir geribildirim mekanizmasına aktarılmak yerine e-posta istemcilerinde kaybolup gider.
Temel Felsefe: "Sayılar Koda, Kelimeler Modellere Aittir"
Bu engelleri aşmak için açık kaynaklı closed-loop-slm-agent mimarisi geliştirilmiştir. Temel yaklaşım son derece açıktır: Kritik iş alanlarında bir dil modelinin sayıları hesaplamasına veya doğruluk kontrolü yapmasına asla izin vermeyin. Dil modelleri cebirsel çözücüler değil, olasılıksal belirteç tahmincileridir.
Bu mimaride yerel SLM yalnızca metin akışı, ton ve okunabilirlikten sorumludur. Fatura kalemleri, tamsayı-kuruş aritmetiği ve tarih doğrulamaları tamamen deterministik Python kodu tarafından yönetilir. Taslak oluştuktan sonra hibrit doğrulayıcı devreye girer; kod tabanlı kontroller geçilirse ton değerlendirmesi yapılır. Sistem, değerlendirmeleri Karesel Ağırlıklı Kappa (QWK) ile kalibre eder ve insan geri bildirimlerinden bağlam içinde (in-context) sürekli beslenir.
Yazılım Geliştirme Açısından Pratik Çıkarımlar
- Katmanlı Doğrulama Kurun: Dil modelini iş mantığının hesaplayıcısı değil, yalnızca sunum katmanı olarak değerlendirin; tüm kritik verileri deterministik kod katmanıyla denetleyin.
- Üç Durumlu Yönlendirme Tasarlayın: Modelinize sadece metin üretme seçeneği vermeyin; veri yoksa güvenli ret (Abstain), şüphe durumunda ise uzman eskalasyonu (Escalate) mekanizmaları tanımlayın.
- Kapalı Devre Geri Bildirim Döngüsü: İnsan incelemelerini kaybetmeyin; yapılan düzeltmeleri modelin bağlam içi öğrenmesine aktararak yaşayan bir sistem inşa edin.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Production'da Agent Güvenilirliği modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →