Amazon SageMaker'da Gemma 4: NVIDIA T4, Birebir Aynı Yanıtlarla L4'ün 0.8x Hızında Decode Ediyor

İçindekiler
Genel Bakış ve Sistem Mimarisi
Bu çalışma, Google'ın Gemma 4 model ailesini Amazon SageMaker'ın en ekonomik GPU seçeneği olan NVIDIA T4 üzerinde çalıştırmayı ve önceki testlerde incelenen L4 performansı ile kıyaslamayı ele alır. vLLM tabanlı dağıtım ve yaşam döngüsü yönetimini kolaylaştırmak için özel Python MCP (Model Context Protocol) araçları geliştirilmiştir.
- Modeller: Gemma 4 E2B, E4B, 12B ve 26B A4B (4-bit ağırlıklar ve 4-bit embedding katmanları).
- Donanım: SageMaker
ml.g4dn.xlarge(1x NVIDIA T4, 16 GB VRAM); referans olarakml.g6.xlarge(1x L4). - Bölge ve Altyapı: us-east-2; AWS vLLM SageMaker container 0.30.0 (Turing attention mimari yamasıyla).
- Sonuç: T4 donanımı, L4'ün %77-%82'si (0.77x - 0.82x) decode hızına ulaşarak birebir aynı kalitede yanıtlar üretmiştir. 16 GB belleğe sığabilen en büyük model 12B sürümüdür.
Nereden Başlamalıyım?
Bu çalışma, pratik model optimizasyonunu inceleyen dört bölümlük serinin son ayağıdır:
- Bölüm 1: AWS CLI ve bir MCP sunucusu aracılığıyla Gemma 4'ü SageMaker endpoint'ine dağıtma.
- Bölüm 2: Google'ın QAT (Quantization-Aware Training) ağırlıklarının tam boyutlu bf16 sürüme kıyasla tek bir L4'te 2.05x daha hızlı decode ettiğini doğrulama.
- Bölüm 3: QAT ağırlıklarını 4-bit embedding'ler ile yeniden paketleyip L4 üzerinde 1.39x ek hız artışı elde etme.
- Bölüm 4 (Bu İnceleme): Optimize edilen bu sürümleri bir önceki GPU jenerasyonuna (T4) indirerek maliyet-performans dengesini test etme.
Bu Çalışma Nereye Oturuyor?
SageMaker JumpStart kütüphanesi, Gemma 4 E2B için en az ml.g6e.xlarge (L40S) ve 12B için ml.g6e.16xlarge gereksinimi sunar; T4 seçenekleri resmi katalogda yer almaz. Ayrıca Turing mimarili GPU'larda (SM 7.5) paylaşılan bellek limitleri sebebiyle vLLM attention hatası (#38918) yaşanmaktadır. Burada sunulan 4-bit embedding paketleri, Google'ın QAT ağırlıklarını 4-bit ızgarada kayıpsız korur. Örneğin 26B A4B sürümünde katman 0 query projeksiyonundaki 11.5 milyon ağırlığın hiçbiri düzey kaybetmezken, klasik AWQ dönüşümleri ağırlıkların %30.3'ünü kaydırır; bu fark grid_check.py aracıyla doğrulanmıştır.
Başlamadan Önce Gerekenler
- GitHub deposunun klonlanmış ve
make testkomutunun hatasız çalışıyor olması, ml.g4dn.xlargeiçin yeterli SageMaker endpoint kotasına sahip yetkili bir AWS hesabı,- Kıyaslama yapılacak Bölüm 3 L4 performans ölçüm verileri.
SageMaker'daki En Küçük GPU Hangisi?
MCP sunucusunun check_quotas aracı US bölgelerindeki kotaları denetler (ml.g4dn.xlarge her bölgede mevcuttur). SageMaker bünyesinde kiralanabilen en küçük GPU ml.g4dn.xlarge (16 GB T4) seçeneğidir. Graviton T4G (g5g) yalnızca EC2'de bulunur; Inferentia2 ise Neuron SDK ve model derleme süreci gerektirir.
1. Adım — Container'ı Turing Mimarisi İçin Yamalamak
Gemma 4'ün full-attention katmanları 512 boyutundadır. vLLM'in Triton attention çekirdeği blok başına 98.304 bayt paylaşımlı bellek ister. T4 (Turing) donanımı ise en fazla 65.536 bayt sunduğundan sunucu başlatılırken çöker. Dağıtımı sorunsuz ayağa kaldırmak için Triton çekirdeğine bellek sınırını aşmayan özel Turing yamasının uygulanması zorunludur.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Ölçeklendirme ve Optimizasyon modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →