Yazılım·3 dk okuma·

Drift Kısıtlı Optimizasyon: Talimat Modellerinin İnce Ayarında Sadece Yön Önemlidir

Paylaş
YazılımEdumints Blog

Giriş: İnce Ayarda Davranışsal Sapma Problemi

Büyük dil modellerinde talimat modellerini (instruct models) belirli bir hedef görev için ince ayardan (fine-tuning) geçirmek hedef performansı artırırken, referans modelden kaynaklanan istenmeyen davranışsal sapmalara (behavioral drift) yol açar. Bu kontrolsüz sapma, modelin daha önceden kazanmış olduğu genel akıl yürütme, problem çözme ve dil kabiliyetlerini ciddi ölçüde bozabilmektedir. Geleneksel yaklaşımlar bu sapmayı optimizasyon sürecinin kaçınılmaz bir yan etkisi olarak kabul ederken, Drift Kısıtlı Optimizasyon (Drift-Constrained Optimization - DCO) yaklaşımı sorunu tersine çevirir: Optimizasyondan önce kesin bir davranışsal sapma bütçesi tanımlanır ve hedef görevin başarısı doğrudan bu bütçe sınırları dahilinde aranır.

Geometrik Çerçeve: İnce Ayarın Yön Seçimi Olarak Yeniden Formülasyonu

Yerel ölçekte davranışsal sapma, referans modeli merkez alan ortak bir parametre ve temsil geometrisi oluşturur:

  • Mesafe Olarak Sapma: Sapma bütçesi, referans modelin etrafında aşılmaması gereken bir sınır çizer; burada drift doğrudan referanstan uzaklığı (mesafeyi) belirler.
  • Kalan Serbestlik Derecesi: Bütçe sabitlendiğinde geriye kalan tek serbestlik derecesi model ağırlıklarının güncellenme yönüdür (update direction).
  • Yön Verimliliği: Güncellemeler büyüklükleri yerine yönsel verimlilikleri üzerinden karşılaştırılır; bu durum ince ayar sürecini temelde bir yön seçimi problemine dönüştürür. Bu formülasyon, erişilebilir yönlerin değiştirilmesinin optimizasyon çıktısını niteliksel olarak kökten değiştireceğini öngörür.

Zorlu Senaryo: Sadece Cevap Odaklı (QA-Only) İnce Ayar

Bu yaklaşım, güçlü talimat modellerinin yalnızca nihai cevaplar üzerinden eğitildiği, ancak çıkarım (inference) anında çok adımlı akıl yürütme üretmesinin beklendiği zorlu bir yalnızca QA senaryosunda test edilmiştir:

  • Standart ince ayarın başarısızlıkla sonuçlandığı bu uyumsuzlukta, katman seçici (layer-selective) kaba bir prob bu başarısızlığı tersine çevirmiştir.
  • Araştırma, çok adımlı düşünme yeteneğini ve genel kabiliyetleri korurken hedef görevi iyileştiren birden fazla etkili güncelleme yönünün var olduğunu kanıtlamıştır.
  • Qwen3-8B ve Qwen3-14B modellerinde yapılan kapsamlı deneylerde, bu yönler bilimsel akıl yürütmeyi ve çok dilli çeviri başarımını belirgin şekilde artırmıştır.
  • 100'den fazla dilde elde edilen modeller, özel çeviri sistemlerini yakalamış veya geride bırakmış; aynı zamanda sonraki pekiştirmeli öğrenme (RL) süreçleri için çok daha güçlü bir başlangıç noktası sağlamıştır.

Yazılım Geliştiriciler İçin Pratik Çıkarımlar

  • Değişim Bütçesini Doğru Harcamak: İnce ayar başarısı modelin ne kadar değiştiğiyle değil, ayrılan bütçenin parametre uzayında hangi doğrultuda harcandığıyla belirlenir.
  • Katman Seçici İnce Ayar: Tüm katmanları güncellemek yerine yalnızca kritik katmanları optimize ederek, genel akıl yürütme yeteneklerini unutma (catastrophic forgetting) riski olmadan koruyabilirsiniz.
  • RL İçin Sağlam Başlangıç: Modelleri doğrudan pekiştirmeli öğrenmeye sokmak yerine yön kısıtlı ince ayarla optimize etmek, eğitim kararlılığını ve yakınsama hızını artırır.
  • Açık Kaynak Kodlar: Bu yöntemi üretim ortamlarında test etmek için araştırmacıların paylaştığı açık kaynak depolardan (GitHub Deposu ve HuggingFace Koleksiyonu) faydalanabilirsiniz.

Orijinal makaleye buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Axolotl ve torchtune ile Pratik Çok-GPU Fine-Tuning modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →