LLM·3 dk okuma·

Granite 4.2 LLM'leri: Nasıl İnşa Edildiler?

Paylaş
LLMEdumints Blog

IBM Granite ekibi tarafından geliştirilen Granite 4.2, açık kaynak ekosistemine güçlü akıl yürütme (reasoning) ve otonom ajan yetenekleri kazandıran yoğun (dense), yalnızca kod çözücü (decoder-only) yeni nesil dil modeli ailesidir. Apache 2.0 lisansıyla sunulan bu modeller, yazılım geliştiricilere çıkarım maliyeti ile mantıksal doğruluk arasında hassas bir denge kurma imkânı sunar.

Özet (TL;DR)

  • Üç Ölçekte Yoğun Model: Sıfırdan eğitilmiş 3B, 8B ve 30B boyutlarında, akıl yürütme odaklı yoğun mimari seçenekleri.
  • 5 Aşamalı Ön Eğitim ve 512K Bağlam: Yaklaşık 15 trilyon token üzerinde 5 aşamalı stratejiyle eğitilerek bağlam penceresi 512K token seviyesine genişletildi.
  • Gelişmiş Denetimli İnce Ayar (SFT): Düşünce zinciri (chain-of-thought), yapılandırılmış akıl yürütme ve ajan yörüngesi (agentic trajectory) verileriyle zenginleştirilmiş ince ayar.
  • Çok Aşamalı ve Ajan RL Pipeline'ı: Özellikle 8B ve 30B modellerine gerçek korumalı alanlarda (sandbox) araç kullanmayı öğreten pekiştirmeli öğrenme döngüsü.
  • Dinamik Düşünme ve Doğal Araç Çağırma: Düşünme/düşünmeme (thinking/non-thinking) anahtarı, basit sorular için düşük efor modu ve yerel araç çağırma desteği.
  • Açık Kaynak Lisans: Kurumsal ve ticari projelere tam uyum sağlayan Apache 2.0 lisansı.

Genel Bakış ve Geliştirici Çıkarımları

Önceki Granite serisi talimat takibinde yetkinken, Granite 4.2 açık akıl yürütme kabiliyetini doğrudan sisteme ekler. Modelin yanıt öncesinde düşünce zinciri üretebilmesi ve geliştiricinin "düşünme modunu" açıp kapatabilmesi, üretimde gecikme (latency) ve maliyet optimizasyonu açısından kritik bir esneklik sağlar.

Ajan yetenekleri açısından belirgin ayrım 8B ve 30B modellerinde ortaya çıkar. Bu modeller ajan pekiştirmeli öğrenme (Agentic RL) ile terminal komutları çalıştırma, kod düzenleme ve web araması yapma gibi araç odaklı adımları güvenli ortamlarda gerçekleştirebilir. Ayrıca OpenAI işlev çağırma standardını yerel olarak desteklemesi, vLLM ve SGLang servisleri aracılığıyla mevcut mimarilere sıfır adaptasyon maliyetiyle entegrasyonu mümkün kılar.

Model Mimarisi

Granite 4.2 modelleri modern ve optimize edilmiş bir yoğun transformer mimarisine dayanır:

  • Attention: 40 dikkat başı ve 8 KV başı içeren Grouped Query Attention (GQA).
  • Position Embedding: Uzun bağlam kararlılığı sunan Rotary Position Embedding (RoPE, θ = 10.000.000).
  • Feed-Forward: SwiGLU aktivasyon fonksiyonuna sahip çok katmanlı algılayıcı (MLP).
  • Normalizasyon: Yüksek kararlılık sağlayan RMSNorm (ε = 1e-5).
  • Embeddings: Ayrı giriş ve çıkış gömme (tied olmayan) katmanları.
  • Hassasiyet: Standart bfloat16 sayısal hesaplama biçimi.

3B modeli 40 katman ve 2560 gömme boyutuyla uç birimlerde hafif iş yükleri için ideal bir seçenekken; 8B ve 30B modelleri 4096 gömme boyutu ile 12800 ve 32768 MLP genişlikleriyle karmaşık otonom ajan pipeline'larında yüksek performans sunar.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Modeller: Hangisi, Ne Zaman? modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →