LLM·2 dk okuma·

UK AISI ve EvalEval Kriter Değerlendirme Sonuçlarını Nasıl Yeniden Üretilebilir Kılıyor?

Paylaş
LLMEdumints Blog

EvalEval Koalisyonu, Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü'nün (UK AISI), model değerlendirme sonuçlarını açıkça paylaşmak ve doğrulanabilir bir değerlendirme bilimi geliştirmek üzere EvalEval altyapısını kullanmaya başladığını duyurdu. NeurIPS 2025 kapsamındaki ortak çalıştayla temelleri atılan bu iş birliği, Every Eval Ever (EEE) şemasının geliştirilmesine katkı sağladı ve paylaşılan ortak altyapıyı somut bir biçimde hayata geçirdi.

Yeniden Üretilebilir Değerlendirme Raporlaması Neden Önemli?

Yapay zeka modellerinin dağıtımı ve yazılım sistemlerine entegrasyonu hızlandıkça, model yeteneklerini ölçen benchmark değerlendirmeleri en kritik karar kaynakları haline geliyor. Ancak günümüzde sonuçlar çok sayıda farklı format ve platformda, çoğu zaman yeniden üretmeye yetmeyecek eksik yapılandırma verileriyle paylaşılıyor. Üstelik bu değerlendirmeleri sıfırdan çalıştırmak geliştiriciler ve kurumlar için maliyet açısından imkânsız hale gelebiliyor.

EvalEval, bu karmaşık ekosistemi düzenlemek amacıyla Every Eval Ever raporlama şeması ve sonuçların yorumlanmasını standartlaştıran açık Evaluation Cards platformunu sunuyor. Bu ortak yapı, AISI'nin değerlendirme verimliliğini artıran OptStop, istatistiksel geçerliliği güçlendiren HiBayES ve transkript analizi ile yetenek ortaya çıkarma (capability elicitation) standartları üzerine inşa ediliyor. Yazılım mühendisliği açısından bu süreç, üretim ortamlarına LLM entegre edilirken rastgele testler yerine standardize edilmiş ve sürümlenebilir değerlendirme boru hatlarının kurulması gerektiğini vurguluyor.

AISI Neler Paylaşıyor?

Transkript düzeyinde şeffaflık; yalnızca sonuçların yeniden üretilmesi için değil, aynı zamanda model hatalarının analizi ve teşhisi için de hayati önem taşır. Bu iş birliği kapsamında AISI, kamuya açık yöntem ve bulgularını Evaluation Cards üzerinden topluluğa sunuyor. Paylaşılan veri seti, ana makale deneyinde yer alan beş temel kriter değerlendirmesi için doğrulanmış sonuçları, bağlamı ve kurulum yapılandırmalarını içeriyor:

  • HealthBench
  • FrontierMath
  • Humanity's Last Exam
  • SWE-Bench Pro
  • Terminal-Bench 2.0

Bu paylaşılan sonuçlar Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 ve GPT-5.4 olmak üzere altı öncü modeli kapsıyor. Ayrıca siber güvenlik odaklı Cyber CTFs ve The Last Ones değerlendirmeleri de bu veriler arasında yer alıyor. AISI'nin çalışması, kıyaslama başarısının çıkarım zamanı hesaplama gücüne (inference compute) ve değerlendirme protokolüne doğrudan bağımlı olduğunu kanıtlıyor. Örneğin Humanity's Last Exam testinde, modeller her denemeden sonra bir orakıldan (oracle) doğruluk geri bildirimi aldığında, artan token kullanımıyla birlikte çözülen görev sayısının istikrarlı biçimde arttığı gözlemleniyor.

Geliştiriciler için pratik çıkarım: Güvenilir yapay zeka sistemleri inşa ederken tekil metrikler yerine; transkript kayıtları, inference bütçeleri ve doğrulama protokollerini kapsayan şeffaf test mimarileri benimsenmelidir.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: AI Test Stratejileri modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →