LLM·3 dk okuma·

BenchMIRT: LLM Kıyaslama Testleri Gerçekte Neyi Ölçüyor?

Paylaş
LLMEdumints Blog

Büyük dil modellerini (LLM) değerlendirirken kullanılan kıyaslama testleri (benchmarks), modellerin yeteneklerini ölçmede standart kabul edilir. Ancak Allen Institute for AI (Ai2) tarafından geliştirilen BenchMIRT, bu testleri tekil istem (prompt) düzeyinde denetleyen yeni bir yöntem sunarak testlerin gerçekte neyi ölçtüğünü derinlemesine sorguluyor.

Bir kıyaslama testi genellikle güvenlik, genel akıl yürütme veya talimat takibi gibi belirli bir yeteneği ölçmek amacıyla kurgulanır. Ancak testin içerisindeki bireysel görevler ve sorular, çoğu zaman bu hedefin ötesinde farklı dinamiklere dayanır:

  • BBQ Kıyaslaması: Modellerin sosyal önyargılara dayanıp dayanmadığını ölçmek için tasarlanmıştır. Örneğin, bir büyükbaba ve torunun Uber çağırmaya çalıştığı senaryoda yaş ayrımcılığı irdelenir. Ancak sorunun doğru yanıtlanabilmesi, modelin metin içinde kimin kim olduğunu doğru takip etmesini ve önyargılar yerine verilen kanıtlara dayanarak mantık yürütmesini gerektirir.
  • WildJailbreak Kıyaslaması: Zararlı "jailbreak" istemlerinin yanı sıra modelin masum talepleri gereksiz yere reddedip reddetmediğini (aşırı reddetme) test eden güvenli istemleri de barındırır. Zararlı istemler doğrudan güvenlikle ilişkiliyken, masum istemler genel akıl yürütmeyle bağlantılıdır. Bu iki farklı istem grubunu tek bir ortalama skorda birleştirmek, modelin asıl kabiliyetini gizler.

BenchMIRT, modellerin her bir soru ve görevdeki başarımını analiz ederek doğru yanıta hangi temel yeteneklerin katkıda bulunduğunu matematiksel olarak ayrıştırır.

Kıyaslama Testlerindeki Gizli Sinyalleri Bulmak

BenchMIRT, kökeni psikometriye dayanan Madde Tepki Kuramı'ndan (Item Response Theory - IRT) ilham alır. IRT, her sorunun sınava giren model hakkında aynı miktarda bilgi vermediği ilkesine dayanır; kimi sorular daha zordur, kimi sorular ise güçlü modelleri zayıf olanlardan çok daha etkili biçimde ayırt eder.

Daha önce Fluid Benchmarking çalışmalarında tek boyutlu IRT uygulanmışken, BenchMIRT bu yaklaşımı Çok Boyutlu IRT (MIRT) ile genişletmektedir:

  • Model ve Soru Düzeyinde Ayrıştırma: Model düzeyinde belirli yeteneklerin gücünü tahmin ederken; soru düzeyinde ise sorunun zorluğunu ve o yeteneklere sahip modelleri ayırt etme kapasitesini hesaplar.
  • Büyük Ölçekli Doğrulama: 100 LLM, 16 farklı benchmark ve 34 binden fazla soru üzerinde eğitilmiştir. Bu testlerin 6'sı genel akıl yürütmeyi (MMLU-Pro, GPQA, MATH, BBH), 10'u ise Olmo 3 güvenlik paketini (HarmBench, StrongReject, WildJailbreak, BBQ, WMDP, XSTest) kapsar.
  • Bağımsız Boyut Keşfi: BenchMIRT'e hangi testin hangi yeteneği ölçtüğü önceden bildirilmemiştir. Model, tamamen denetimsiz olarak iki baskın boyutu açığa çıkarmıştır: Güvenlik ve Genel Akıl Yürütme.

Yazılım Geliştiriciler İçin Pratik Çıkarımlar

  • Tekil Skor Yanılsamasından Kaçının: Bir LLM seçerken veya ince ayar (fine-tuning) yaparken sadece kümülatif benchmark puanına güvenmek yanıltıcıdır; güvenlik ve mantık yürütme metrikleri bağımsız olarak izlenmelidir.
  • Değerlendirme (Eval) Kümelerinizi Optimize Edin: Üretim öncesi regresyon testlerinizde (golden dataset), modeller arasında gerçek bir ayırt edicilik sağlamayan veya hedef yetenek dışındaki dinamikleri ölçen gürültülü istemleri tespit edip temizleyin.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/blog/allenai/benchmirt)


Bu konuyu derinlemesine öğrenmek isterseniz: AI Test Stratejileri modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →