LLM Akıl Yürütmesinde İlke-İçi Öz-Damıtmanın Ölçeklenme Sınırlarını Aşmak
İçindekiler
Giriş ve Problem Tanımı
Büyük dil modellerinde (LLM) akıl yürütme (reasoning) yeteneklerini geliştirmede ilke-içi öz-damıtma (On-Policy Self-Distillation - OPSD) kritik bir rol oynamaktadır. OPSD, öğrenci modelin kendi örneklediği çözüm yörüngesi boyunca ayrıcalıklı bir öğretmen dağılımını taklit etmesi prensibine dayanır. Ancak standart OPSD uygulamaları, bu denetimi doğrulanmamış öğrenci çıktılarına (unverified rollouts) uygulamakta ve öğretmen modeli insan referans çözümü gibi ayrıcalıklı bir bağlama koşullandırmaktadır.
Faktöriyel Analiz ve Taklit Açığı
Yapılan faktöriyel analiz, damıtma sürecinde model performansını belirleyen temel dinamikleri ortaya koymuştur:
- İskele ve Bağlam Doğruluğu: Çözüm adımlarındaki iskele doğruluğunun (scaffold correctness), bağlam doğruluğuna (context correctness) kıyasla nihai doğruluk üzerinde çok daha baskın bir etkiye sahip olduğu saptanmıştır.
- Taklit Açığı (Imitation Gap): Doğrulanmamış iskeleler, öğretmenin öğrenciye kapalı olan bilgileri kullanabilmesi nedeniyle bir taklit açığı yaratır. Model ölçeği büyüdükçe bu açık daralsa da standart OPSD çoğunlukla denetlenmemiş yörüngeleri denetlemeye devam eder.
- Doğrulanmış İskelelerin Kararlılığı: Öğretmen modeli öğrencinin kendi başarısız denemesine koşullandırılsa dahi doğrulanmış iskeleler etkinliğini ve gücünü korur.
Yeni Yaklaşım: OASIS
Elde edilen bulgular doğrultusunda geliştirilen OASIS yöntemi, OPSD'nin temel optimizasyon hedefini korurken denetim yapısını yeniden tanımlar:
- Etiketle Doğrulanmış Yörüngeler: Rastgele öğrenci adımları yerine, çoğunlukla nihai etiketle doğrulanmış ilke-içi yörüngeleri denetler.
- Model Tarafından Üretilen Bağlam: İnsanlarca yazılmış referans çözümler yerine, modelin kendi ürettiği doğrulanmamış denemeleri öğretmen bağlamı olarak kullanır.
- Minimum Etiket İhtiyacı: Yöntem, adım adım detaylı insan açıklamaları yerine yalnızca nihai cevap etiketlerine ihtiyaç duyar.
Deneysel Sonuçlar ve Ölçeklenme Dinamikleri
Qwen3-1.7B, 4B ve 8B modelleri üzerinde AIME 2024, AIME 2025 ve HMMT 2025 kıyaslamalarında yapılan testler yöntemin üstünlüğünü kanıtlamıştır:
- OASIS Başarısı: Temel modele kıyasla ortalama 3.2 ila 3.8 puan arasında tutarlı bir iyileşme sağlamıştır.
- OPSD Ölçeklenme Çöküşü: Standart OPSD'nin kazanımı 1.7B modelinde 3.05 puan iken, 8B modelinde 0.14 puana gerileyerek ölçeklenme doygunluğuna takılmıştır.
- Büyük Ölçek Üstünlüğü: 8B modelinde OASIS, OPSD'ye kıyasla 3.05 puanlık üstünlük kurmuştur. Bu bulgu, doğrulanmış ilke-içi iskelelerin modeller ölçeklendikçe öz-damıtmanın verimliliğini koruduğunu gösterir.
Yazılım Geliştiriciler İçin Pratik Çıkarımlar
- Doğrulama Odaklı Pipeline: Akıl yürütme zincirlerinde (Chain-of-Thought) harici çözümler sunmaktan ziyade, adımların ve nihai sonucun doğrulanabilirliği optimize edilmelidir.
- Maliyet ve Veri Verimliliği: Pahalı uzman çözümleri toplamak yerine, yalnızca nihai cevap kontrolü ve model denemeleriyle yüksek kaliteli sentetik veri döngüleri kurulabilir.
- Ölçekleme Optimizasyonu: Büyük parametreli modellerde öz-damıtma yapılırken doğrulanmamış yörüngelerle modeli aşırı uyarlamaktan kaçınılmalıdır.
[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.37915)
Bu konuyu derinlemesine öğrenmek isterseniz: İleri Akıl Yürütme Teknikleri modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →