---
title: "Tek Bir T4G Üzerinde 3 Doların Altında Üç Gemma 4 Dağıtımı: Çalışma Zamanının Değiştirdikleri ve Değiştirmedikleri"
url: https://blog.edumints.com/tek-bir-t4g-uzerinde-3-dolarin-altinda-uc-gemma-4-dagitimi-c-3as1tl8c
category: "DevOps"
date: 2026-09-04T15:09:53.492Z
publisher: Edumints Blog
lang: tr-TR
source_name: "dev.to"
source_url: https://dev.to/gde/three-gemma-4-deployments-on-one-t4g-for-under-3-what-the-runtime-changes-and-what-it-doesnt-jo3
---

# Tek Bir T4G Üzerinde 3 Doların Altında Üç Gemma 4 Dağıtımı: Çalışma Zamanının Değiştirdikleri ve Değiştirmedikleri

Bu makale, tek bir AWS GPU donanımı üzerinde üç farklı Gemma 4 dağıtımının adım adım karşılaştırmasını sunmaktadır. Dağıtım yönetimini otomatikleştirmek için Python tabanlı bir MCP araç seti kurgulanmış; çalışma zamanının (runtime) tek bağımsız değişken olmasını sağlamak amacıyla üç dağıtım için de ortak bir test düzeneği (benchmark harness) kullanılmıştır. Tüm sürecin 3 doların altında bir maliyetle tamamlanabilmesi, model testlerinde geliştiricilere büyük bir bütçe avantajı sağlar. Yaklaşık 4,5 saatlik çalışma süresi ve 19 bulut örneği; 3 dağıtım taraması, 9 ölçümlü önyükleme ve çeşitli A/B testlerini mümkün kılmıştır. En önemlisi, soyut akıl yürütme yerine ampirik ölçüm yapılması sayesinde teoride doğru kabul edilen 5 hatalı varsayım erkenden yakalanmıştır.

## Bu Proje Ne Yapmaya Çalışıyor?
Monorepo içindeki üç yapı, AWS G5g örneği üzerinde `google/gemma-4-E2B-it` modelini sunar:
- **vLLM** motoru,
- **Saf JAX** uyarlaması,
- **PyTorch ve transformers** kütüphanesi.

Donanım birebir aynı tutularak yalnızca çalışma zamanı katmanı değiştirilmiştir. Yazılım mühendisliğinde adil bir A/B kıyaslaması yapabilmek için her sistemin kendi iç istatistiğini üretmesi yerine tüm mimarilerin tek bir standart kıyaslama altyapısıyla ölçülmesi şarttır.

## Ön Koşullar
Üretim güvenliğini ve otomasyonu sağlamak için altyapı şu 4 temel bileşene dayanır:
- **AWS us-east-1 G Ailesi Kotası:** 8 vCPU gerektiren `g5g.2xlarge` sistemlerinden ikisini aynı anda çalıştırabilmek için 16 vCPU spot kotası.
- **Ağ ve Güvenlik Yapılandırması:** TCP 8000 portunu açan güvenlik grubu ve `AmazonSSMManagedInstanceCore` ile token okuma yetkisi içeren IAM rolü.
- **Secrets Manager Entegrasyonu:** Hugging Face erişim anahtarı doğrudan AWS Secrets Manager'dan `EnvironmentFile` içerisine çekilir; kullanıcı verilerinde asla açık bırakılmaz.
- **Güvenli Kimlik Denetimi:** Harici SSH anahtarları veya CLI kabuk komutları yerine doğrudan boto3 standart kimlik doğrulama zinciri kullanılır.

## AWS EC2 G5g Örneği
- **g5g.2xlarge:** 8 vCPU, 16 GiB ana bellek.
- **Sunucu CPU:** AWS Graviton2 mimarisi (aarch64).
- **GPU:** 1x NVIDIA T4G, Turing mimarisi (SM 7.5).
- **GPU Belleği:** `nvidia-smi` çıktısına göre 15.360 MiB kullanılabilir VRAM (AWS nominal: 16.384 MiB).

G5g ailesi, Graviton işlemci ile NVIDIA GPU bileşenini birleştiren ve aarch64 ile compute capability 7.5 desteğini aynı anda sunan yegane AWS çözümüdür.

## Gemma 4 E2B
Referans komut ayarlı `google/gemma-4-E2B-it` modeli, toplam 5B parametreden 2B etkin parametre kullanır. Ağırlıkların önemli kısmı matmul yerine gather operasyonu ile okunan katman gömme (embedding) tablolarında tutulur. 9,5 GiB boyutundaki float16 ağırlıklar, 15.360 MiB GPU belleğine rahatlıkla yerleşir. Token başına yaklaşık 18 KiB yer kaplayan KV önbelleği yalnızca onlarca megabayt tüketir ve darboğaz yaratmaz.

## Üç Çalışma Zamanı
- **vLLM (v0.27.2rc0):** Kaynaktan sm_75 için derlenmiş; sürekli toplu işleme (continuous batching), sayfalı KV (paged KV) ve önek önbellekleme (prefix caching).
- **JAX:** Projeye özel uyarlama; basamaklı bucket mimarisine sahip elle yazılmış döngüsel KV halka tamponu.
- **PyTorch:** `AutoModelForCausalLM` ve transformers; `past_key_values` ile istekleri tek tek işleme.

Turing mimarisi donanımsal bfloat16 ve FP8 desteğine sahip olmadığından her üç çalışma zamanı da float16 ile çalıştırılmıştır.

## Kotaları Kontrol Edin
| Kota Tanımı | vCPU Limiti |
| :--- | :--- |
| Çalışan İsteğe Bağlı (On-Demand) G ve VT Örnekleri | 16 |
| Tüm G ve VT Spot Örnek İstekleri | 16 |

`g5g.2xlarge` örneği 8 vCPU tükettiğinden dolayı donanımsal sınır gereği aynı anda en fazla iki sistem paralel olarak test edilebilmektedir.

[[Orijinal kaynağa buradan ulaşabilirsiniz.](https://dev.to/gde/three-gemma-4-deployments-on-one-t4g-for-under-3-what-the-runtime-changes-and-what-it-doesnt-jo3)](https://dev.to/gde/three-gemma-4-deployments-on-one-t4g-for-under-3-what-the-runtime-changes-and-what-it-doesnt-jo3)

---

Bu konuyu derinlemesine öğrenmek isterseniz: [Ölçeklendirme ve Optimizasyon](https://edumints.com/kesfet/embedding-ve-reranking-modelleri-productionda-depl-blu6) modülüne göz atın.

---

**Kaynak:** [dev.to](https://dev.to/gde/three-gemma-4-deployments-on-one-t4g-for-under-3-what-the-runtime-changes-and-what-it-doesnt-jo3)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/tek-bir-t4g-uzerinde-3-dolarin-altinda-uc-gemma-4-dagitimi-c-3as1tl8c
