Qwen 3.8, GPT-5.5 Pro Akıl Yürütme Ön Eklerini (Reasoning Prefills) Takip Ediyor
İçindekiler
Giriş ve Metodoloji
Bu araştırma, açık kaynaklı yapay zeka modellerinin düşünce zincirlerine öğretmen model olarak GPT-5.5 Pro'nun ilk adımları ön ek (reasoning prefill) olarak eklendiğinde ortaya çıkan davranışsal değişimleri analiz eder. Deneyde her problem için hedef modellerden iki yanıt üretilmiştir: standart ön eksiz yanıt ve modelin akıl yürütme kanalına GPT-5.5 Pro'nun düşünce sürecinin yalnızca ilk %1'lik bölümünün eklendiği yanıt. Nihai görünür cevabın ilk 100 token'ında öğretmenin cevabıyla ne kadar örtüşme olduğu; 1-gram, 2-gram ve 3-gram geri çağırma (recall) ortalamalarıyla ölçülmüştür.
Genel Problem Değerlendirmesi
Değerlendirme; 15 STEM, 15 STEM dışı ve 15 sentetik bulmaca olmak üzere toplam 45 problemden oluşmaktadır:
- DeepSeek V4 Flash: Ön eksiz %27.30, GPT-5.5 Pro ön ekiyle %26.13 (-1.17 pp değişim).
- Inkling: Ön eksiz %19.99, GPT-5.5 Pro ön ekiyle %20.45 (+0.46 pp değişim).
- Kimi K3: Ön eksiz %31.11, GPT-5.5 Pro ön ekiyle %35.65 (+4.54 pp artış).
- Qwen3.8 A95B: Ön eksiz %16.79, GPT-5.5 Pro ön ekiyle %34.97 (+18.18 pp dramatik artış).
Kategori Bazında Qwen3.8 Performansı
Qwen3.8 A95B modelinin GPT-5.5 Pro'nun akıl yürütme ön eklerine verdiği tepki kategorilere göre şu şekildedir:
- STEM (15 Soru): Ön eksiz %19.26 iken ön ekle %46.24'e fırlamıştır (+26.99 pp).
- STEM Dışı (15 Soru): Ön eksiz %20.62 iken ön ekle %33.42'ye çıkmıştır (+12.80 pp).
- Sentetik Bulmaca (15 Soru): Ön eksiz %10.49 iken ön ekle %25.23'e yükselmiştir (+14.75 pp).
- Tüm Sorular (45 Soru): Ortalama %16.79'dan %34.97'ye ulaşmıştır (+18.18 pp).
Tartışma ve Bulgular
- Model Soykütüğü: Qwen, önceki deneylerde Opus 4.8 ön eklerine karşı neredeyse hiç tepki vermemişken, GPT-5.5 Pro ön ekleriyle +18.18 puanlık devasa bir kayma sergilemiştir. Özellikle sentetik bulmacalardaki güçlü etki, Qwen'in Opus yerine GPT-5.5 Pro veya yakından ilişkili bir GPT modelinden damıtılmış (distilled) verilerle eğitilmiş olabileceğini göstermektedir.
- Kimi K3 Örtüşmesi: Kimi K3, hem ön eksiz (%31.11) hem de ön ekli (%35.65) durumda GPT-5.5 Pro ile en yüksek taban örtüşmeye sahiptir; ancak ön ek yalnızca +4.54 puanlık sınırlı bir katkı sağlamıştır.
Yazılım Geliştirme ve Mühendislik Çıkarımları
- Akıl Yürütme ile Yönlendirme (Steering): Akıl yürütme kanalına enjekte edilen %1 gibi minimal bir başlangıç girdisi, açık modelin nihai çözüm rotasını kökten değiştirebilmektedir.
- Veri Sızıntısı ve Damıtma Tespiti: Ön ek geri çağırma (prefill recall) analizi, açık ağırlıklı modellerin arka planda hangi tescilli modellerle eğitildiğini saptamak için etkili bir test yaklaşımı sunar.
- Hibrit Çıkarım Mimarileri: STEM problemlerindeki %26.99'luk sıçrama, karmaşık görevlerde pahalı modellerin yalnızca düşünce tohumunu üretip işi açık modellere devrettiği uygun maliyetli boru hatlarının kurulabileceğini gösterir.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: İleri Akıl Yürütme Teknikleri modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →