Yazılım·3 dk okuma·

Rufus-Air: Açık ve Yeniden Üretilebilir LLM Post-Training Reçetesi

Paylaş
YazılımEdumints Blog

Yapay zeka modellerinin ön eğitim (pre-training) sonrası yeteneklerini geliştirmek için uygulanan post-training süreçleri, çoğunlukla kapalı kapılar ardında ve tescilli yöntemlerle yürütülmektedir. Rufus-Air, GLM-4.5-Air-Base (106B-A12B) modeli üzerinde geliştirilen, tamamen açık ve yeniden üretilebilir bir post-training reçetesi sunarak bu yaklaşımı değiştirmektedir. Yeni bir insan etiketlemesine veya şirket içi özel bir damıtma (distillation) öğretmenine ihtiyaç duymadan, kamuya açık veri setleri ve açık kaynaklı bileşenlerle inşa edilen Rufus-Air; hem resmi GLM-4.5-Air sürümünden daha yüksek başarı sergilemekte hem de benzer ölçekteki açık ağırlıklı modellerle güçlü bir rekabet ortaya koymaktadır.

Sekiz Aşamalı Seri Post-Training Pipeline

Reçete, temel yeteneklerden ileri düzey otonom ajan yeteneklerine, sert ve doğrulanabilir ödüllerden yumuşak yargıç sinyallerine uzanan sekiz aşamalı seri bir iş akışı şeklinde organize edilmiştir:

  1. SFT (Supervised Fine-Tuning): Modelin genel kavrayışını ve temel davranış kalıplarını belirleyen yüksek kaliteli denetimli ince ayar.
  2. Reasoning RL (Akıl Yürütme RL): Adım adım mantıksal düşünme ve matematiksel problem çözme becerilerinin pekiştirilmesi.
  3. Coding RL (Kodlama RL): Birim testler ve derleyici geri bildirimleriyle doğrulanabilir kodlama optimizasyonu.
  4. Instruction-Following RL (Talimat Takibi RL): Karmaşık ve çok kısıtlı geliştirici yönergelerine kusursuz uyum sağlama.
  5. General Agent (Genel Ajan): Çok adımlı iş akışlarını ve genel amaçlı fonksiyon çağrılarını otonom yürütme.
  6. Coding Agent (Kodlama Ajanı): Kod tabanlarında hata ayıklama, refactoring ve yazılım geliştirme görevlerini üstlenme.
  7. Search Agent (Arama Ajanı): Web ve harici dokümantasyon araçlarını kullanarak bilgi arama ve sentezleme.
  8. RLHF (İnsan Geri Bildirimiyle RL): İnsan tercihleri ve model tabanlı değerlendiricilerle son aşama davranışsal hizalama.

Dört Temel Bulgu ve Yazılım Geliştiriciler İçin Çıkarımlar

Rufus-Air çalışmasında elde edilen dört kritik prensip, modern yapay zeka mühendisliği için yol gösterici pratik çıktılar sunmaktadır:

  • (i) Çeşitli ve Yüksek Kaliteli SFT Sağlam Bir Yetenek Tabanı Kurar: Yazılım mimarisinde sağlam bir temel kütüphane inşa etmek gibi, pekiştirmeli öğrenmenin başarısı da modelin SFT ile kazandığı güçlü başlangıç zeminine dayanır.
  • (ii) Zorluk Filtreleme RL İstemlerini Verimli Öğrenme Aralığında Tutar: Modelin aşırı kolay veya imkansız prompt'larla vakit kaybetmesini önleyerek, eğitim verisini üretken bir zorluk eşiğinde tutmak optimizasyon verimini maksimize eder.
  • (iii) Ödül Güvenilirliği Aşamaları Sıralamak İçin Pratik Bir İlke Sağlar: Pipeline kurgulanırken, kod testleri gibi kesin doğrulanabilir sert ödüllerden başlanmalı; LLM tabanlı yumuşak değerlendirme sinyallerine kademeli olarak geçilmelidir.
  • (iv) Altyapı ve Mühendislik Tercihleri Reçetenin Bir Parçasıdır: Dağıtık antrenman, bellek optimizasyonu ve ödül altyapısı basit teknik detaylar değil; modelin nihai performansını doğrudan belirleyen temel unsurlardır.

Pratik açıdan Rufus-Air, tescilli modellerin kapalı süreçlerine bağımlı kalmadan, kamuya açık veriler ve disiplinli bir mühendislik yaklaşımıyla üretim kalitesinde yapay zeka sistemleri geliştirilebileceğini kanıtlamaktadır.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.29421)

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →