Cognition SWE-2 Modelini Duyurdu: Fable 5.1 ve GPT-Astra Seviyesinde Yeni Nesil Kodlama Ajanı
İçindekiler
Cognition, bugüne kadarki en gelişmiş otonom kodlama modeli olan SWE-2'yi duyurdu. Yetenek ve maliyet dengesini temsil eden Pareto sınırını yeniden tanımlayan SWE-2, FrontierCode 1.1 Main testinde %50.0 başarı oranı elde etti. Bu sonuçla Fable 5.1'in (%50.9) sadece bir puan gerisinde kalırken, rakibine kıyasla %64 daha düşük maliyet sunmayı başardı.
SWE-2 ile pekiştirmeli öğrenme (RL), SWE-1.7 altyapısı üzerine inşa edilerek ilk kez çok trilyon parametreli ölçeğe taşındı. Ajan tabanlı kodlama için önceden eğitilmiş 2.8 trilyon parametreli Kimi K3 temel modelini kullanan Cognition, uyguladığı RL teknikleriyle K3 üzerinde 5-6 puanlık ek performans artışı sağladı. Model, FrontierCode 1.1 Main ve DeepSWE 1.1 (%73.0) kıyaslamalarında Kimi K3, Grok 4.6 ve SWE-1.7'yi hem başarı hem de maliyet tarafında geride bırakırken, GPT-6 Astra'ya dörtte bir fiyatla oldukça yakın sonuçlar verdi.
SWE-2'nin Arkasındaki Eğitim Sonrası Gelişmeler
SWE-2 modelinin sergilediği yetenek sıçraması, eğitim sonrası (post-training) süreçte uygulanan dört kritik yeniliğe dayanmaktadır:
- Maliyet Cezaları (Cost Penalties): Tek bir RL sürecinde her akıl yürütme çabası düzeyi için temel modelin Pareto eğrisine uyarlanmış doğrusal maliyet cezaları uygulandı. Bu yaklaşım, Pareto sınırının formunu koruyarak sınır çizgisini bütünüyle ileri taşırken gerçek kullanıcı maliyetlerini eğitim optimizasyonuna doğrudan yansıttı.
- Ödül Taban Çizgileri (Reward Baselines): SWE-1.6 sürümünden bu yana geliştirilen uzunluk ağırlıklı ödül taban çizgisi formüle edilerek eğitim süreçlerinin belirgin biçimde kararlı hale gelmesi sağlandı.
- RL Dağıtım Sunumu (RL Rollout Serving): Çıkarım hızını artırmak için gelişmiş zamanlama algoritmaları ve çevrim içi taslak model eğitildi. NVFP4/FP8 çekirdekleri ve kuantizasyon duyarlı eğitim (QAT) sayesinde, parametre sayısı yaklaşık üç katına çıkmasına rağmen bellek kullanımı azaltıldı ve eğitim-çıkarım uyumsuzluğu minimuma indirildi.
- Eğitim Verisi (Training Data): RL ortamlarının sayısı üç katına çıkarıldı, talimat takip katmanları eklendi ve önceki SWE-2 kontrol noktalarından yararlanılarak doğrulayıcıları (verifiers) yinelemeli biçimde güçlendiren bir geri besleme döngüsü (flywheel) kuruldu.
Model Davranışı ve Geliştiriciler İçin Çıkarımlar
SWE-2'de akıl yürütme zekası doğrudan işlem verimliliğine yansıyor. Gelişmiş mühendislik muhakemesi, ajanın gereksiz dosya okumalarından ve aramalardan (grep, read) kaçınarak doğrudan ve eksiksiz çözümler üretmesini sağlıyor. FrontierCode 1.1 Main testinde SWE-2 medium konfigürasyonu, SWE-1.7'ye kıyasla %58 daha az adım atarken ortalama %81 daha düşük maliyet oluşturuyor (SWE-1.7'nin 127 adımına karşılık medium 53, high 80, max 98 adım).
Yazılım Geliştiriciler İçin Pratik Çıkarım: Otonom kodlama ajanlarında kritik başarı metriği yalnızca kodun doğruluğu değil, tüketilen token ve tur (turn) sayısıdır. Çok adımlı geliştirme süreçlerinde (multi-step agent workflows), görevin zorluğuna uygun akıl yürütme seviyesini (medium, high, max) seçmek, geliştirici bekleme sürelerini ve API maliyetlerini optimize ederken bağlam penceresi şişkinliğini önlemenin en etkili yoludur.
SWE-2 bugünden itibaren Devin Desktop ve CLI üzerinden kullanıma sunuldu; ayrıca Devin Web ve Fusion sürümlerine de dağıtılmaktadır.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Modeller: Hangisi, Ne Zaman? modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →