Makine Öğrenmesi·3 dk okuma·

Xiaomi Yapay Zekâ Eğitimi Canlı Yayında: MiMo 2.6 RL Paneli Neler Gösteriyor?

Paylaş
Xiaomi Yapay Zekâ Eğitimi Canlı Yayında: MiMo 2.6 RL Paneli Neler Gösteriyor?

Xiaomi yapay zekâ laboratuvarı, yeni modelini kamuya açık bir şekilde eğitiyor. mimo.xiaomi.com/rl adresindeki canlı kontrol paneli, doğrudan eğitim günlüklerinden alınan iki takviyeli öğrenme (RL) sürecini sunuyor: Başarı oranları, veri karması, operatörlerin müdahale gerekçeleriyle yeniden başlatmalar ve perşembe günü 1 milyon doları aşan anlık maliyet sayacı. Lansman bloglarının göstermediği perde arkasını bu panel şeffafça sergiliyor.

Kısa Özet (TL;DR)

  • Xiaomi, iki RL post-training sürecini canlı yayınlıyor: MiMo 2.6 Pro (~1 trilyon parametre, 42 milyar aktif) ve MiMo 2.6 Flash (309 milyar parametre, 15 milyar aktif). İki model de henüz yayınlanmadı.
  • Pro modelin maliyet sayacı perşembe öğleden sonra UTC itibarıyla saniyede 5,71 dolar artışla 1.048.236 dolara ulaştı; bu da saatte yaklaşık 20.500 dolar, günde ise yaklaşık yarım milyon dolar harcandığını gösteriyor.
  • Pro eğitimi 51 saatte 7 kez yeniden başlatıldı. Operatörler, rollout kayıtlarında kötü örüntüler görüldüğü için siber veri setini kaldırmak gibi teknik gerekçeleri paylaştı.
  • Başarı oranı 14 adımda %56,5'ten %61,5'e, Xiaomi'nin DeepSWE skoru ise 58,4'ten 65,8'e yükseldi (Hacker News topluluğu bunu veri kirlenmesi / contamination şüphesiyle sorguladı).
  • Bölümde ayrıca Neovim'in unutulan Bitcoin'i, incelenen bir Flock kamerası ve Servo bağışlarının bir yıllık bilançosu yer aldı.
  • Paneldeki tüm veriler, 17 Eylül'de 13:20–13:45 UTC arasında JSON uç noktalarından okundu; veriler anlık olarak değişmektedir.

Xiaomi MiMo 2.6 Canlı Eğitim Paneli Nedir?

  • "Hakkında" kısmı oldukça kısa: "RL büyük modellerimizi canlı yayınlıyoruz. mimo-v2.6 serisi yakında geliyor." Altbilgide ise "Açıklık değer verdiğimiz şeydir" ifadesi yer alıyor.
  • Pro eğitimi 15 Eylül 10:32 UTC'de başladı; canlı yayın ise ertesi gün 04:00'te açıldı ve Hacker News'te 480 puana ulaştı.
  • Süreç resmi bir duyuruyla değil, Hugging Face'ten Elie Bakouch gibi topluluk üyelerince keşfedildi (@XiaomiMiMo hesabının son paylaşımı 8 Eylül tarihli kapalı masaüstü uygulaması betasıydı).
  • Mimari, Mixture-of-Experts (MoE) modelini izliyor: 1 trilyon parametre depolanırken token başına 42 milyar aktif parametre çalıştırılıyor.
  • Önceki sürüm MiMo-V2.5-Pro, MIT lisansıyla Hugging Face'te yer alıyor ve mayıs ayında API fiyatı %99'a varan oranda indirilmişti. Dolayısıyla 2.6 sürümünün de açık ve ekonomik olması bekleniyor; bu panel adeta bir fragman niteliğinde.

Takviyeli Öğrenme (RL) Post-Training Nasıl Çalışır?

Ön eğitim (pre-training) modele bir sonraki kelimeyi tahmin etmeyi öğretirken, takviyeli öğrenme (RL post-training) görevleri başarıyla tamamlamayı öğretir: Probleme çözüm dener, yanıt test edilir ve ağırlıklar başarılı denemelere doğru yönlendirilir.

  • Pro modeli her adımda 1.568 istem örnekliyor ve her biri için 16 deneme ("rollout") üreterek toplam 25.088 sekans oluşturuyor.
  • Denemeler sandbox ortamlarında çalıştırılıp puanlanıyor. Perşembeye kadar 2 milyona yakın sandbox kullanıldı ve 30,2 milyar token eğitildi.
    1. adımda 5 kategorideki 24 veri kaynağından beslenildi; 1.568 istemin 1.061'i (%68) kodlama üzerinedir. Bu, doğrudan bir kodlama ajanı (coding agent) inşa edildiğini kanıtlıyor.
# Bir RL adımı (örnek mantık akışı)
prompts = sample(datasets, n=1568) # 15. adımda ~%68 kod
rollouts = [model.generate(p) for p in prompts for _ in range(16)]
rewards = [sandbox_grade(r) for r in rollouts] # deneme başına geçti/kaldı
pass_rate = mean(rewards)

Yazılım Geliştiriciler İçin Pratik Çıkarımlar

  • Otonom Kodlama Ajanları: İstemlerin %68'inin koda ayrılması ve izole sandbox ortamlarında test edilmesi, yeni nesil LLM'lerin salt metin üretimi yerine yazılım görevlerini uçtan uca çözen ajanlar olarak optimize edildiğini gösterir.
  • Canlı Metrik Takibi ve Veri Hijyeni: 51 saatte 7 yeniden başlatma yapılması, büyük model eğitiminde kötü çıktı kalıplarının anlık log denetimiyle tespit edilip zararlı veri setlerinin dinamik olarak ayıklanmasının önemini ortaya koyar.

Orijinal kaynağa buradan ulaşabilirsiniz.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →