LLM·3 dk okuma·

Qwen 3.8, GPT-5.5 Pro Akıl Yürütme Ön Eklerini (Reasoning Prefills) Takip Ediyor

Paylaş
LLMEdumints Blog

Giriş ve Metodoloji

Bu araştırma, açık kaynaklı yapay zeka modellerinin düşünce zincirlerine öğretmen model olarak GPT-5.5 Pro'nun ilk adımları ön ek (reasoning prefill) olarak eklendiğinde ortaya çıkan davranışsal değişimleri analiz eder. Deneyde her problem için hedef modellerden iki yanıt üretilmiştir: standart ön eksiz yanıt ve modelin akıl yürütme kanalına GPT-5.5 Pro'nun düşünce sürecinin yalnızca ilk %1'lik bölümünün eklendiği yanıt. Nihai görünür cevabın ilk 100 token'ında öğretmenin cevabıyla ne kadar örtüşme olduğu; 1-gram, 2-gram ve 3-gram geri çağırma (recall) ortalamalarıyla ölçülmüştür.

Genel Problem Değerlendirmesi

Değerlendirme; 15 STEM, 15 STEM dışı ve 15 sentetik bulmaca olmak üzere toplam 45 problemden oluşmaktadır:

  • DeepSeek V4 Flash: Ön eksiz %27.30, GPT-5.5 Pro ön ekiyle %26.13 (-1.17 pp değişim).
  • Inkling: Ön eksiz %19.99, GPT-5.5 Pro ön ekiyle %20.45 (+0.46 pp değişim).
  • Kimi K3: Ön eksiz %31.11, GPT-5.5 Pro ön ekiyle %35.65 (+4.54 pp artış).
  • Qwen3.8 A95B: Ön eksiz %16.79, GPT-5.5 Pro ön ekiyle %34.97 (+18.18 pp dramatik artış).

Kategori Bazında Qwen3.8 Performansı

Qwen3.8 A95B modelinin GPT-5.5 Pro'nun akıl yürütme ön eklerine verdiği tepki kategorilere göre şu şekildedir:

  • STEM (15 Soru): Ön eksiz %19.26 iken ön ekle %46.24'e fırlamıştır (+26.99 pp).
  • STEM Dışı (15 Soru): Ön eksiz %20.62 iken ön ekle %33.42'ye çıkmıştır (+12.80 pp).
  • Sentetik Bulmaca (15 Soru): Ön eksiz %10.49 iken ön ekle %25.23'e yükselmiştir (+14.75 pp).
  • Tüm Sorular (45 Soru): Ortalama %16.79'dan %34.97'ye ulaşmıştır (+18.18 pp).

Tartışma ve Bulgular

  • Model Soykütüğü: Qwen, önceki deneylerde Opus 4.8 ön eklerine karşı neredeyse hiç tepki vermemişken, GPT-5.5 Pro ön ekleriyle +18.18 puanlık devasa bir kayma sergilemiştir. Özellikle sentetik bulmacalardaki güçlü etki, Qwen'in Opus yerine GPT-5.5 Pro veya yakından ilişkili bir GPT modelinden damıtılmış (distilled) verilerle eğitilmiş olabileceğini göstermektedir.
  • Kimi K3 Örtüşmesi: Kimi K3, hem ön eksiz (%31.11) hem de ön ekli (%35.65) durumda GPT-5.5 Pro ile en yüksek taban örtüşmeye sahiptir; ancak ön ek yalnızca +4.54 puanlık sınırlı bir katkı sağlamıştır.

Yazılım Geliştirme ve Mühendislik Çıkarımları

  • Akıl Yürütme ile Yönlendirme (Steering): Akıl yürütme kanalına enjekte edilen %1 gibi minimal bir başlangıç girdisi, açık modelin nihai çözüm rotasını kökten değiştirebilmektedir.
  • Veri Sızıntısı ve Damıtma Tespiti: Ön ek geri çağırma (prefill recall) analizi, açık ağırlıklı modellerin arka planda hangi tescilli modellerle eğitildiğini saptamak için etkili bir test yaklaşımı sunar.
  • Hibrit Çıkarım Mimarileri: STEM problemlerindeki %26.99'luk sıçrama, karmaşık görevlerde pahalı modellerin yalnızca düşünce tohumunu üretip işi açık modellere devrettiği uygun maliyetli boru hatlarının kurulabileceğini gösterir.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: İleri Akıl Yürütme Teknikleri modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →