Yapay Zeka·2 dk okuma·

Olmo-core 3: Büyük MoE Modelleri İçin Açık ve Ölçeklenebilir Eğitim Altyapısı

Paylaş
Yapay ZekaEdumints Blog

Allen Institute for AI (Ai2), trilyon parametre ölçeğindeki Uzman Karışımı (Mixture-of-Experts - MoE) modellerinin eğitimini hesaplama verimliliğini koruyarak ölçeklendirmek üzere tasarlanan açık kaynaklı Olmo-core 3 altyapısını duyurdu.

Büyük yapay zeka modellerini eğitmek, yüksek hesaplama gücü ve enerji maliyetleri gerektirdiğinden akademik araştırmacılar ve küçük ölçekli ekipler için ciddi bir engel oluşturur. MoE mimarileri, her girdi için tüm bileşenleri (parametreleri) çalıştırmayarak hesaplama açısından verimli bir alternatif sunar. Ancak modelin tamamının GPU belleğinde saklanması ve girdilerin doğru uzmanlara (experts) yönlendirilmesi, küme genelinde iletişim ve koordinasyon darboğazları yaratabilir. Olmo-core 3 bu verimsizliği gidermeyi hedefler: Yapılan testlerde uzman havuzu 8'den 128'e çıkarılıp token başına 4 uzman seçildiğinde (~3.2B aktif parametre sabit tutularak), modelin toplam kapasitesi 4.6B'den 47B'ye yükselmiş; eğitim işlem hacmi (throughput) ise %5'ten daha az düşmüştür. Altyapı, 1 trilyon parametre ölçeğinde de kıyaslanmıştır.

MoE'lerin Gerçek Çalışma Mantığına Dayalı Bir Eğitim Yığını Oluşturmak

Olmo-core altyapısı her Olmo nesliyle birlikte gelişmiştir. Seyrek mimari çalışmaları 64 yönlendirmeli uzman içeren OlmoE'ye dayanırken, yoğun (dense) mimariye sahip Olmo 3'ün ardından Olmo-core 3 çok daha büyük MoE'ler için yeniden tasarlandı:

  • FSDP'den DDP Tabanlı Mimariye Geçiş: Önceki FSDP (Fully Sharded Data Parallelism) yaklaşımı her küçük veri grubunda model ağırlıklarını toplayıp yeniden parçalarken (resharding); Olmo-core 3, DDP (Distributed Data Parallelism) tabanlı bir sisteme geçerek uzmanları GPU üzerinde yerleşik tutar ve veriyi ilgili uzmanlara yönlendirir. Bu sayede tekrarlanan ağırlık toplama yükü ortadan kalkar.
  • İşlem Hacminde 2.7 Kat Artış: NVIDIA Megatron-Core gibi yerleşik çözümlere açık bir alternatif sunan bu mimari, 8 adet NVIDIA B300 GPU üzerinde 47 milyar parametrelik MoE testinde GPU başına saniyede 52.000 token işleme hızına ulaştı (eski FSDP sürümünün 19.400 token/sn değerine kıyasla yaklaşık 2.7 kat artış).

MoE Eğitimini Ölçeklendirme ve Optimize Etme

Olmo-core 3; büyük MoE modellerini GPU kümelerine dağıtma tekniklerini, yönlendirme ve hesaplamayı hızlandıran optimizasyonlarla bir araya getirir.

Yazılım Geliştirme ve Öğrenme Açısından Pratik Çıkarımlar:

  • Bellek ve İletişim Dengesi: Dağıtık sistemlerde ağırlıkları GPU'lar arasında sürekli taşımak yerine veriyi yerleşik uzmanlara yönlendirmek (data routing), I/O darboğazlarını minimize etmenin anahtarıdır.
  • Sabit Aktif Parametre Stratejisi: Toplam parametre sayısını 10 katına çıkarırken token başına aktif parametre sayısını sabit tutmak, eğitim bütçesini patlatmadan model kapasitesini artırmayı sağlar.
  • Açık Ekosistem Erişimi: Büyük ölçekli yapay zeka mühendisliğinde FSDP ve DDP optimizasyonlarını kavramak, donanım kaynaklarını en üst düzeyde verimli kullanmayı öğretir.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Ölçeklendirme ve Optimizasyon modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →