---
title: "Xiaomi Yapay Zekâ Eğitimi Canlı Yayında: MiMo 2.6 RL Paneli Neler Gösteriyor?"
url: https://blog.edumints.com/xiaomi-yapay-zek-egitimi-canli-yayinda-mimo-26-rl-paneli-nel-j6jbbo1l
category: "Makine Öğrenmesi"
date: 2026-10-01T09:09:32.670Z
publisher: Edumints Blog
lang: tr-TR
source_name: "dev.to"
source_url: https://dev.to/axrisi/xiaomi-ai-training-live-what-the-mimo-26-rl-dashboard-shows-3ioh
---

# Xiaomi Yapay Zekâ Eğitimi Canlı Yayında: MiMo 2.6 RL Paneli Neler Gösteriyor?

Xiaomi yapay zekâ laboratuvarı, yeni modelini kamuya açık bir şekilde eğitiyor. `mimo.xiaomi.com/rl` adresindeki canlı kontrol paneli, doğrudan eğitim günlüklerinden alınan iki takviyeli öğrenme (RL) sürecini sunuyor: Başarı oranları, veri karması, operatörlerin müdahale gerekçeleriyle yeniden başlatmalar ve perşembe günü 1 milyon doları aşan anlık maliyet sayacı. Lansman bloglarının göstermediği perde arkasını bu panel şeffafça sergiliyor.

## Kısa Özet (TL;DR)
- Xiaomi, iki RL post-training sürecini canlı yayınlıyor: **MiMo 2.6 Pro** (~1 trilyon parametre, 42 milyar aktif) ve **MiMo 2.6 Flash** (309 milyar parametre, 15 milyar aktif). İki model de henüz yayınlanmadı.
- Pro modelin maliyet sayacı perşembe öğleden sonra UTC itibarıyla saniyede 5,71 dolar artışla **1.048.236 dolara** ulaştı; bu da saatte yaklaşık 20.500 dolar, günde ise yaklaşık yarım milyon dolar harcandığını gösteriyor.
- Pro eğitimi 51 saatte 7 kez yeniden başlatıldı. Operatörler, rollout kayıtlarında kötü örüntüler görüldüğü için siber veri setini kaldırmak gibi teknik gerekçeleri paylaştı.
- Başarı oranı 14 adımda %56,5'ten %61,5'e, Xiaomi'nin DeepSWE skoru ise 58,4'ten 65,8'e yükseldi (Hacker News topluluğu bunu veri kirlenmesi / contamination şüphesiyle sorguladı).
- Bölümde ayrıca Neovim'in unutulan Bitcoin'i, incelenen bir Flock kamerası ve Servo bağışlarının bir yıllık bilançosu yer aldı.
- Paneldeki tüm veriler, 17 Eylül'de 13:20–13:45 UTC arasında JSON uç noktalarından okundu; veriler anlık olarak değişmektedir.

## Xiaomi MiMo 2.6 Canlı Eğitim Paneli Nedir?
- "Hakkında" kısmı oldukça kısa: *"RL büyük modellerimizi canlı yayınlıyoruz. mimo-v2.6 serisi yakında geliyor."* Altbilgide ise *"Açıklık değer verdiğimiz şeydir"* ifadesi yer alıyor.
- Pro eğitimi 15 Eylül 10:32 UTC'de başladı; canlı yayın ise ertesi gün 04:00'te açıldı ve Hacker News'te 480 puana ulaştı.
- Süreç resmi bir duyuruyla değil, Hugging Face'ten Elie Bakouch gibi topluluk üyelerince keşfedildi (@XiaomiMiMo hesabının son paylaşımı 8 Eylül tarihli kapalı masaüstü uygulaması betasıydı).
- Mimari, **Mixture-of-Experts (MoE)** modelini izliyor: 1 trilyon parametre depolanırken token başına 42 milyar aktif parametre çalıştırılıyor.
- Önceki sürüm MiMo-V2.5-Pro, MIT lisansıyla Hugging Face'te yer alıyor ve mayıs ayında API fiyatı %99'a varan oranda indirilmişti. Dolayısıyla 2.6 sürümünün de açık ve ekonomik olması bekleniyor; bu panel adeta bir fragman niteliğinde.

## Takviyeli Öğrenme (RL) Post-Training Nasıl Çalışır?
Ön eğitim (pre-training) modele bir sonraki kelimeyi tahmin etmeyi öğretirken, takviyeli öğrenme (RL post-training) görevleri başarıyla tamamlamayı öğretir: Probleme çözüm dener, yanıt test edilir ve ağırlıklar başarılı denemelere doğru yönlendirilir.
- Pro modeli her adımda 1.568 istem örnekliyor ve her biri için 16 deneme ("rollout") üreterek toplam 25.088 sekans oluşturuyor.
- Denemeler sandbox ortamlarında çalıştırılıp puanlanıyor. Perşembeye kadar 2 milyona yakın sandbox kullanıldı ve 30,2 milyar token eğitildi.
- 15. adımda 5 kategorideki 24 veri kaynağından beslenildi; 1.568 istemin 1.061'i (%68) kodlama üzerinedir. Bu, doğrudan bir **kodlama ajanı (coding agent)** inşa edildiğini kanıtlıyor.

```python
# Bir RL adımı (örnek mantık akışı)
prompts = sample(datasets, n=1568) # 15. adımda ~%68 kod
rollouts = [model.generate(p) for p in prompts for _ in range(16)]
rewards = [sandbox_grade(r) for r in rollouts] # deneme başına geçti/kaldı
pass_rate = mean(rewards)
```

## Yazılım Geliştiriciler İçin Pratik Çıkarımlar
- **Otonom Kodlama Ajanları**: İstemlerin %68'inin koda ayrılması ve izole sandbox ortamlarında test edilmesi, yeni nesil LLM'lerin salt metin üretimi yerine yazılım görevlerini uçtan uca çözen ajanlar olarak optimize edildiğini gösterir.
- **Canlı Metrik Takibi ve Veri Hijyeni**: 51 saatte 7 yeniden başlatma yapılması, büyük model eğitiminde kötü çıktı kalıplarının anlık log denetimiyle tespit edilip zararlı veri setlerinin dinamik olarak ayıklanmasının önemini ortaya koyar.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://dev.to/axrisi/xiaomi-ai-training-live-what-the-mimo-26-rl-dashboard-shows-3ioh)

---

**Kaynak:** [dev.to](https://dev.to/axrisi/xiaomi-ai-training-live-what-the-mimo-26-rl-dashboard-shows-3ioh)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/xiaomi-yapay-zek-egitimi-canli-yayinda-mimo-26-rl-paneli-nel-j6jbbo1l
