EOS Belirteçleri Uyuşmadığında: On-Policy Distilasyonda Uzunluk Enflasyonunu Anlamak
İçindekiler
Giriş ve Problem Tanımı
Büyük dil modellerinde bilgi aktarımı için sıklıkla başvurulan on-policy distilasyon (OPD - On-Policy Distillation), öğrenci (student) modelin kendi ürettiği yanıtlar üzerinden öğretmen (teacher) modeli taklit etmesini sağlayan etkili bir yöntemdir. Ancak bu süreçte karşılaşılan en kritik problemlerden biri "uzunluk enflasyonu" (length inflation) olarak adlandırılan durumdur. Bu problemde öğrenci model, yanıtlarını kontrolsüz biçimde uzatmakta ve ayrılan maksimum üretim bütçesini (token sınırını) tamamen tüketerek sonsuz veya gereksiz döngülere girmektedir. Çıkarım (inference) maliyetini ve gecikme sürelerini ciddi şekilde artıran bu davranışın kök nedenleri yeni bir araştırmayla aydınlatılmaktadır.
Temel Neden: EOS Belirteç Uyuşmazlığı
Araştırma, aşırı uzun yanıt üretiminin arkasındaki temel kaynağın temel (base) öğrenci modeller ile eğitim sonrası uyarlanmış (post-trained) öğretmen modeller arasındaki sonlandırma belirteci (termination-token / EOS) uyumsuzluğu olduğunu kanıtlamaktadır. Çalışmanın öne çıkan bulguları şunlardır:
- Olasılık Dağılımındaki Ayrışma: Qwen3, Llama ve Gemma model ailelerinde yapılan deneylerde, modellerin tanımlı durdurma kümeleri (stopping sets) tamamen özdeş olsa dahi, iki modelin durma olasılık kütlesini farklı EOS belirteçlerine atadığı görülmüştür.
- Sonlandırma Eyleminin Baskılanması: Bu uyumsuzluk, öğrenci modelin kendi temel eğitiminden gelen doğal sonlandırma eylemini cezalandırıp baskılarken, öğretmen modelin tercih ettiği alternatif belirteci öğrenciye güvenilir ve kararlı bir şekilde aktaramamaktadır.
- Anlamsal Durdurma Eylemi Hizalaması: Yalnızca çıkarım aşamasında kod çözme durdurma kümesini (decoding stopping set) hizalamak bu sorunu çözmede yetersiz kalmaktadır. Buna karşılık, işlevsel açıdan eşdeğer kabul edilen tüm EOS belirteçlerinin paylaşılan tek bir anlamsal durdurma eylemi (shared semantic stopping action) olarak ele alınması, her üç model ailesinde de uyumsuzluk kaynaklı uzunluk enflasyonunu büyük ölçüde ortadan kaldırmaktadır.
- K2-Horizon Eğitim Aşamaları ve Geç Evre Dinamikleri: Farklı K2-Horizon eğitim aşamaları üzerinden yürütülen aşamalı analizler, sonlandırma tercihlerinin eğitim boyunca belirgin biçimde kaydığını göstermektedir. Ayrıca çalışma, sonlandırma hizalaması yapılsa bile OPD sürecinin ileri aşamalarında ortaya çıkan ve varlığını sürdüren farklı bir uzunluk enflasyonunu daha açığa çıkarmıştır.
Bu sonuçlar, sonlandırma uyuşmazlığının uzunluk patlamasındaki en önemli faktörlerden biri olduğunu ancak tüm OPD uzunluk dinamiklerini tek başına açıklayamadığını ortaya koymaktadır.
Yazılım Geliştiricileri İçin Pratik Çıkarımlar
- Distilasyon Kayıp Fonksiyonunu Güncelleyin: Model distilasyonu yaparken farklı EOS belirteçlerini bağımsız kategorik hedefler olarak eğitmek yerine, aynı işlevi gören belirteçleri tek bir durma olasılığında birleştirin.
- Çıkarım Kurallarına Güvenmeyin: Üretim ortamında
stopparametrelerini ayarlamak semptomu hafifletse de modelin öğrenilen olasılık dağılımındaki dengesizliği düzeltmez; asıl müdahale eğitim kaybı (loss) hesaplamasında yapılmalıdır. - Eğitim Sürecini Aşama Aşama İzleyin: Eğitim boyunca ortalama çıktı uzunluklarını kaydedin. Geç aşamalarda baş gösteren uzunluk artışlarına karşı erken durdurma (early stopping) veya düzenlileştirme stratejileri uygulayın.
Araştırmacılar, bu düzeltmeleri içeren sonlandırma yönetim uygulamasını açık kaynak olarak geliştiricilerin erişimine sunmuştur.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →