LLM·2 dk okuma·

Real-SWE: Özel ve Gerçek Dünya Kurumsal Kod Tabanlarında Yapay Zeka Kıyaslaması

Paylaş
LLMEdumints Blog

Specific Labs tarafından Eylül 2026'da yayımlanan Real-SWE (Snagnik Das, Siddhant Paliwal ve Janak Sunil imzalı), en gelişmiş yapay zeka modellerini kamuya açık sentetik testler yerine, lisanslanmış gerçek şirketlerin özel üretim kod tabanlarında değerlendiren yeni bir kıyaslama çalışmasıdır. Geliştiricilerin üzerinde çalıştığı gerçek ürünlerin tüm bağlamını ve karmaşıklığını taşıyan bu çalışma, şu kritik soruyu ele alır: Bir kodlama ajanı gerçek dünyada bir yazılım mühendisinin işini gerçekten yapabilir mi?

Real-SWE'yi Tanımlayan Üç Temel Unsur

Gerçek kurumsal kod ortamlarındaki görevler, modelleri şu 3 ana maddeyle sınamaktadır:

  • Özel Kod Tabanları (Private Codebases): Ajanlar, çözümleri ve kaynak kodları genel internette yer almayan, eğitim verilerine sızmamış tescilli sistemlerde çalışmak zorundadır.
  • Doğrudan İş Sonuçları Doğuran Görevler (Work with Business Consequences): Faturalandırmayı düzeltme, vergi hesaplamaları veya müşteri taşıma (migration) gibi bir işletmenin işleyişini ve çoklu servislerini doğrudan etkileyen kritik operasyonel değişikliklerdir.
  • Şirkete Özgü Karmaşıklık (Company-Specific Complexity): Her organizasyonun kendine has kuralları ve kod yazım gelenekleri vardır. Ajanların mevcut konvansiyonları anlaması ve var olan kod yapısıyla uyumlu çalışması gerekir.

Benchmark Sonuçları: Model ve Ajan Çatısı Başarısı

Real-SWE, modelleri tek başına değil; mühendislerin pratikte kullandığı yerel araç ve arayüzlerle (harness) birlikte test etmiştir. Görev başına 8 bağımsız çalıştırmanın ortalamasıyla elde edilen pass@1 çözülme oranları (%95 güven aralığıyla) şöyledir:

    1. Fable 5.1 (Claude Code) — %38.8
    1. GPT-6 Astra (Codex CLI) — %33.8
    1. Gemini 3.8 Flash (Gemini CLI) — %31.2
    1. GLM 5.3 (Claude Code) — %28.8
  • =5. Grok 4.6 (Grok Build) — %23.8
  • =5. Muse Spark 1.3 (Muse Code) — %23.8
    1. Kimi K3 (Kimi Code) — %18.8
    1. GPT-5.6 Sol (Codex CLI) — %16.2

Metodoloji ve Yazılım Geliştiriciler İçin Pratik Çıkarımlar

Uzmanlarca tasarlanan sentetik senaryolar ne kadar iyi kurgulanırsa kurgulansın, gerçek şirket mühendislerinin çözdüğü görevlerin yerini tutamaz. Real-SWE, altta yatan kod çıktısı (artifact) ve talimat özgüllüğü olmak üzere iki ana eksende modelleri zorlamaktadır.

  • Kurumsal Bağlamın Önemi: En gelişmiş model dahi %38.8 başarıda kalmaktadır; internette hazır cevabı olmayan özel kod tabanlarında başarı için şirket içi bağlam belirleyicidir.
  • Model ve Harness Uyumu: Çözüm oranları, sadece modelin kabiliyetine değil, kullanılan CLI/ajan çatısının bağlamı yönetme ve araca hükmetme yeteneğine doğrudan bağlıdır.
  • Kritik İş Mantığı Riskleri: Vergilendirme, fatura ve istisnalar gibi doğrudan iş sonucu doğuran konularda ajan çıktılarının güvenilirliği için insan denetimi (human-in-the-loop) ve güçlü test stratejileri vazgeçilmezdir.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://withspecific.com/benchmarks/real-swe)


Bu konuyu derinlemesine öğrenmek isterseniz: Production'da Agent Güvenilirliği modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →