998 Dolar ile 3.8B Parametreli LLM Eğitimi: Altyapı ve Verimlilik Dersleri
İçindekiler
Büyük dil modelleri dünyasında, hobi amaçlı "nanoGPT" denemeleri ile milyon dolarlık kurumsal laboratuvarlar arasında genellikle az tanımlanmış bir orta alan yer alır. Hugo Vergnes, bireysel bir geliştiricinin yaklaşık 1.000 dolarlık bir bütçeyle sıfırdan anlamlı bir dil modeli eğitebileceğini gösteriyor. Andrej Karpathy’nin nanochat projesinden ilham alan bu çalışma; akşamları yazıldı, RTX 5090 üzerinde test edildi ve kiralanan B200 GPU'larda tamamlandı. Sonuçta 43 saatte, 65 milyar token ile 998 dolara eğitilen ve CORE testinde 0.384 skoruna ulaşan 3.8B parametreli bir model ortaya çıktı.
Model Karşılaştırmaları ve Sonuçlar
Çalışmada elde edilen metrikler, donanım nesillerinin maliyet verimliliğini net biçimde ortaya koymaktadır:
- GPT-2 (OpenAI): 1.5B parametre — 0.2565 CORE
- nanochat d26: ~561M parametre, 11.2B token, 8× H100 (~3 saat) — ~0.258 CORE
- nanochat d32: ~1B parametre, 8× H100 (~33 saat, ~$1.000) — 0.310 CORE
- little-lm 3.8B (1024 ctx): 3.848B parametre, 57.3B token, 8× B200 (35.9 saat, $820) — 0.338 CORE
- little-lm 3.8B (2048 ctx): 3.848B parametre, 65.3B token, 8× B200 (43 saat, $998) — 0.384 CORE
B200 GPU'lar iş birimi başına H100'lerden çok daha yüksek verimlilik sundu. nanochat'in 1.000 dolarlık konfigürasyonuyla benzer sürede çalışan model, anlamlı bir performans üstünlüğü elde etti.
Kurulum ve Altyapı Mühendisliği
Geliştirici, küçük decoder-only modelleri eğitmek için konfigürasyon odaklı little-lm çatısını kurdu. Süreç tamamen YAML dosyalarıyla yönetilmekte; model, veri seti, optimizer, öğrenme oranı çizelgesi ve geri çağırmalar merkezi kayıt sisteminde çözümlenmektedir. Yapay zeka çalışmalarında endişelerin ayrımı (separation of concerns) ve modüler arayüzler gibi klasik yazılım mühendisliği disiplinleri kritik öneme sahiptir. İyi bir altyapı, kod değiştirmek yerine yalnızca 3 satırlık YAML farkıyla deney yapmayı mümkün kılar.
Model Mimarisi ve Parametre Dağılımı
Nihai model Llama mimarisine dayanır (RMSNorm, RoPE, 24 sorgu ve 8 KV başlıklı GQA, relu² MLP'ler, QK-norm, logit softcap, öğrenilebilir artık skalerler ve ResFormer tarzı değer gömmeleri):
- Token embeddings: 154.5M
- LM head (untied): 154.5M
- 28 decoder layers: 2,818.7M
- Value embeddings (14 tablo): 721.2M (Toplam parametrelerin %19'u, her iki katmanda bir)
- Toplam: 3.848B
Erken Deneyler ve Başarısızlıklar
Başarılı çalıştırmalardan önce tek bir A100 GPU üzerinde 5.8 gün süren 858M parametreli Llama denemesi yapıldı (FineWeb-Edu, 16.4B token, AdamW 2.5e-4, sıfıra inen kosinüs sönümleme). Sonuçta PIQA skoru %60.45'te kaldı; bu da 2019 çıkışlı ve yedi kat daha küçük olan GPT-2 124M'in (%63) gerisindeydi. Sıfıra inen kosinüs sönümlemesi kayıp eğrisini tamamen düzleştirmiş, model tekrarlayan ve anlamsız çıktılar üretmiştir.
Pratik Çıkarımlar
- Altyapı Yatırımı: İlk yakınsama sorununda kod karmaşası yerine konfigürasyon tabanlı deney yönetimi zaman kazandırır.
- Donanım Seçimi: Yeni nesil GPU'lar (B200), birim zamanda daha yüksek hesaplama sağlayarak toplam bütçeyi dramatik şekilde düşürür.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Ölçeklendirme ve Optimizasyon modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →