LLM·3 dk okuma·

SlideDP: Çoklu GPU Sistemlerinde Host Tabanlı LLM İnce Ayarını Ölçeklendirme

Paylaş
LLMEdumints Blog

Giriş ve Problem: Host Belleğinde Katman Akışı

Host-resident (ana bellek yerleşik) katman akışı (layer streaming), GPU VRAM sınırlarının ötesine geçerek büyük dil modellerinin (LLM) tam parametreli ince ayarını (full-parameter fine-tuning) mümkün kılmaktadır. Ancak tek bir paylaşımlı host makine üzerinde çalışan veri paraleli (data-parallel) worker'lar, sınırlı ana bellek ve PCIe veri yolu gibi ortak kaynaklar için yoğun bir rekabete girer. Replikasyonlu veri transferleri toplam trafiği katlarken, güçlü ölçekleme (strong scaling) senaryolarında hesaplama pencereleri daraldığı için CPU ve ana bellek üzerindeki iş yükleri sistem genelinde belirgin bir darboğaza dönüşür.

SlideDP'nin Çözüm Mimarisi

SlideDP, paylaşımlı host mimarisine sahip çoklu GPU sistemleri için geliştirilmiş senkron bir veri paraleli çalışma zamanı (runtime) çözümüdür. Sistem, bu darboğazları aşmak için şu temel teknikleri uygular:

  • Tek Yetkili Host Durumu: Durum yerleşimini (state layout) iletişim rotalarından tamamen soyutlayarak tek ve otoriter bir host durumunu muhafaza eder.
  • Uçtan Uca Pipelining: Parametre dağıtımını, gradyan toplamayı (aggregation) ve CPU güncellemelerini worker'lar ve parçalar (chunks) arasında eşzamanlı bir boru hattında yürütür.
  • Analitik Adım-Zaman Modeli: Donanımsal kaynak kısıtlarını ve boru hattı açıklarını önceden modelleyip karakterize eden analitik bir adım-zaman modeli sunar.
  • Dinamik Politika Yönetimi: Gerçek zamanlı çalışma ölçümlerine dayanarak GPU bellek bütçesi sınırları dahilinde iletişim, parçalama ve aktivasyon saklama politikalarını dinamik olarak yönetir.

Performans ve Karşılaştırmalı Ölçümler

Yapılan kapsamlı testler, SlideDP'nin mevcut yaklaşımlara karşı üstünlüğünü kanıtlamaktadır:

  • Mevcut Çözümlere Karşı Üstünlük: Eşleştirilmiş batch taramalarında SlideDP; SlideFormer, MegaTrain ve ZeRO-Offload'a kıyasla 1.46x ile 2.64x arasında geometrik ortalama verimlilik (throughput) artışı sağlar.
  • FSDP2 ile Başabaş Performans: Dört adet NVIDIA H100 üzerinde Qwen3-14B modeliyle küçük batch boyutlarında tamamen GPU belleğinde çalışan FSDP2 verimliliğine yaklaşır.
  • Tepe Verimlilik Artışı: Büyük batch senaryosunda adım başına 1 milyondan fazla token işler ve FSDP2'nin ölçülen tepe verimini %11.2 oranında aşar.
  • Uzun Bağlam ve Tüketici Donanımı Desteği: Aynı modelde 256K token uzunluğundaki dizileri desteklerken; sadece dört adet tüketici sınıfı NVIDIA RTX 4090 GPU üzerinde Qwen2.5-72B modelinin ince ayarını başarıyla tamamlar.

Geliştiriciler İçin Pratik Çıkarımlar

  • Erişilebilir Büyük Model Eğitimi: SlideDP, pahalı veri merkezi GPU'larına (H100 gibi) erişimi olmayan ekiplerin tüketici sınıfı donanımlarla (örneğin 4x RTX 4090) 72B boyutundaki devasa modelleri tam parametreli eğitebilmesini sağlar.
  • Bant Genişliği ve Boru Hattı Optimizasyonu: Dağıtık mimarilerde salt ham hesaplama gücünden ziyade, CPU-GPU arasındaki veri aktarımını hesaplamayla örtüştürmenin (pipeline/overlap) performansı nasıl katladığını gösterir.
  • Ölçeklenebilir Bağlam Yönetimi: 256K token gibi aşırı uzun bağlamlarda GPU bellek sınırlarını aşmadan akıllı parçalama ve aktivasyon yönetimi kurgulamanın önemini vurgular.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.34162)


Bu konuyu derinlemesine öğrenmek isterseniz: PyTorch FSDP2: Modern Sharding API modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →