---
title: "LLM Akıl Yürütmesinde İlke-İçi Öz-Damıtmanın Ölçeklenme Sınırlarını Aşmak"
url: https://blog.edumints.com/llm-akil-yurutmesinde-ilke-ici-oz-damitmanin-olceklenme-sini-db72zhw8
category: "LLM"
date: 2026-10-01T09:09:32.670Z
publisher: Edumints Blog
lang: tr-TR
source_name: "hfpapers"
source_url: https://huggingface.co/papers/2609.37915
---

# LLM Akıl Yürütmesinde İlke-İçi Öz-Damıtmanın Ölçeklenme Sınırlarını Aşmak

## Giriş ve Problem Tanımı
Büyük dil modellerinde (LLM) akıl yürütme (reasoning) yeteneklerini geliştirmede **ilke-içi öz-damıtma** (On-Policy Self-Distillation - OPSD) kritik bir rol oynamaktadır. OPSD, öğrenci modelin kendi örneklediği çözüm yörüngesi boyunca ayrıcalıklı bir öğretmen dağılımını taklit etmesi prensibine dayanır. Ancak standart OPSD uygulamaları, bu denetimi **doğrulanmamış öğrenci çıktılarına** (unverified rollouts) uygulamakta ve öğretmen modeli insan referans çözümü gibi ayrıcalıklı bir bağlama koşullandırmaktadır.

## Faktöriyel Analiz ve Taklit Açığı
Yapılan faktöriyel analiz, damıtma sürecinde model performansını belirleyen temel dinamikleri ortaya koymuştur:
- **İskele ve Bağlam Doğruluğu:** Çözüm adımlarındaki iskele doğruluğunun (scaffold correctness), bağlam doğruluğuna (context correctness) kıyasla nihai doğruluk üzerinde çok daha baskın bir etkiye sahip olduğu saptanmıştır.
- **Taklit Açığı (Imitation Gap):** Doğrulanmamış iskeleler, öğretmenin öğrenciye kapalı olan bilgileri kullanabilmesi nedeniyle bir taklit açığı yaratır. Model ölçeği büyüdükçe bu açık daralsa da standart OPSD çoğunlukla denetlenmemiş yörüngeleri denetlemeye devam eder.
- **Doğrulanmış İskelelerin Kararlılığı:** Öğretmen modeli öğrencinin kendi başarısız denemesine koşullandırılsa dahi doğrulanmış iskeleler etkinliğini ve gücünü korur.

## Yeni Yaklaşım: OASIS
Elde edilen bulgular doğrultusunda geliştirilen **OASIS** yöntemi, OPSD'nin temel optimizasyon hedefini korurken denetim yapısını yeniden tanımlar:
- **Etiketle Doğrulanmış Yörüngeler:** Rastgele öğrenci adımları yerine, çoğunlukla nihai etiketle doğrulanmış ilke-içi yörüngeleri denetler.
- **Model Tarafından Üretilen Bağlam:** İnsanlarca yazılmış referans çözümler yerine, modelin kendi ürettiği doğrulanmamış denemeleri öğretmen bağlamı olarak kullanır.
- **Minimum Etiket İhtiyacı:** Yöntem, adım adım detaylı insan açıklamaları yerine yalnızca nihai cevap etiketlerine ihtiyaç duyar.

## Deneysel Sonuçlar ve Ölçeklenme Dinamikleri
Qwen3-1.7B, 4B ve 8B modelleri üzerinde AIME 2024, AIME 2025 ve HMMT 2025 kıyaslamalarında yapılan testler yöntemin üstünlüğünü kanıtlamıştır:
- **OASIS Başarısı:** Temel modele kıyasla ortalama **3.2 ila 3.8 puan** arasında tutarlı bir iyileşme sağlamıştır.
- **OPSD Ölçeklenme Çöküşü:** Standart OPSD'nin kazanımı 1.7B modelinde **3.05 puan** iken, 8B modelinde **0.14 puana** gerileyerek ölçeklenme doygunluğuna takılmıştır.
- **Büyük Ölçek Üstünlüğü:** 8B modelinde OASIS, OPSD'ye kıyasla **3.05 puanlık** üstünlük kurmuştur. Bu bulgu, doğrulanmış ilke-içi iskelelerin modeller ölçeklendikçe öz-damıtmanın verimliliğini koruduğunu gösterir.

## Yazılım Geliştiriciler İçin Pratik Çıkarımlar
- **Doğrulama Odaklı Pipeline:** Akıl yürütme zincirlerinde (Chain-of-Thought) harici çözümler sunmaktan ziyade, adımların ve nihai sonucun doğrulanabilirliği optimize edilmelidir.
- **Maliyet ve Veri Verimliliği:** Pahalı uzman çözümleri toplamak yerine, yalnızca nihai cevap kontrolü ve model denemeleriyle yüksek kaliteli sentetik veri döngüleri kurulabilir.
- **Ölçekleme Optimizasyonu:** Büyük parametreli modellerde öz-damıtma yapılırken doğrulanmamış yörüngelerle modeli aşırı uyarlamaktan kaçınılmalıdır.

[[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.37915)](https://huggingface.co/papers/2609.37915)

---

Bu konuyu derinlemesine öğrenmek isterseniz: [İleri Akıl Yürütme Teknikleri](https://edumints.com/kesfet/sistematik-prompt-muhendisligi-ve-dspy-ile-program-xpig) modülüne göz atın.

---

**Kaynak:** [hfpapers](https://huggingface.co/papers/2609.37915)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/llm-akil-yurutmesinde-ilke-ici-oz-damitmanin-olceklenme-sini-db72zhw8
