---
title: "Tek TPU v5e Üzerinde Yeniden Paketlenmiş QAT Gemma 4: 12B ile Saniyede 675 Token Dağıtımı"
url: https://blog.edumints.com/tek-tpu-v5e-uzerinde-yeniden-paketlenmis-qat-gemma-4-12b-ile-usohjl4j
category: "Yazılım"
date: 2026-10-03T07:11:58.880Z
publisher: Edumints Blog
lang: tr-TR
source_name: "dev.to"
source_url: https://dev.to/gde/repacked-qat-gemma-4-on-one-tpu-v5e-12b-serves-at-675-tokens-per-second-15dd
---

# Tek TPU v5e Üzerinde Yeniden Paketlenmiş QAT Gemma 4: 12B ile Saniyede 675 Token Dağıtımı

Bu rehber, Google'ın kuantizasyon farkındalıklı eğitilmiş (QAT) Gemma 4 ağırlıklarının vLLM için yeniden paketlenmesini ve tek bir Google Cloud TPU v5e çipinde yüksek verimle servis edilmesini adım adım ele almaktadır. Süreç boyunca oluşturulan her derleme; sınıflandırma, matematik, araç çağırma (tool calling), verim (throughput) ve uzun istem testleriyle kapsamlı şekilde doğrulanmıştır.

Tek bir v5e çipi üzerinde yeniden paketlenen QAT modelleri, E2B'den 26B'ye kadar tüm Gemma 4 varyantlarını başarıyla çalıştırabilmektedir. 12B modeli; 3.880 kayıtlık test paketinde bf16 hassasiyetiyle eşdeğer başarım gösterirken, GSM8K'da 0.964 ve BFCL araç çağırmada 0.955 doğruluk skorlarına ulaşmaktadır. 11.31 GiB ağırlık boyutuyla çipin belleğine sığabilen en büyük model olan 12B, 16 eşzamanlı istek altında saniyede 675 çıktı tokenı üreterek dikkat çekici bir çıkarım performansı sergilemektedir.

## Neden Yeniden Paketleme (Repack)?

Tek bir TPU v5e çipi (`v5litepod-1`) yalnızca 15.75 GiB HBM belleğe sahiptir. Gemma 4 E4B modeli bf16 formatında 14.9 GiB, 12B ise 22.4 GiB bellek tükettiğinden, E2B dışındaki tüm modellerin bu donanımda çalışabilmesi için 4-bit veya 8-bit kuantizasyon zorunludur. Google, her boyut için 4-bit modelleri eğitmiş ve ağırlıkları "unquantized" bf16 olarak yayımlamıştır. Yeniden paketleme işlemi, 32'lik gruplar halindeki bu 16 seviyeli ızgara değerlerini tekrar yuvarlamadan vLLM formatına dönüştürür:

- **q4w4a16**: QAT ızgarasını tam olarak koruyan int4 ağırlıklar ve 16-bit aktivasyonlar.
- **q4w4a16emb4**: Aynı mimariye ek olarak kelime tablolarının (`embed_tokens`, `lm_head`, katman gömmeleri) int4 olarak saklanması.
- **w8a8**: QAT değerlerinden kanal başına elde edilen int8 ağırlıklar ve token başına int8 aktivasyonlar.
- **w8a8emb4**: int8 ağırlık ve aktivasyonlara ek olarak int4 kelime tabloları.

TPU v5e donanımı yerel (native) olarak int8 x int8 matris çarpımını desteklediğinden, bu çip üzerinde en yüksek hız int8 derlemeleriyle sağlanır.

## Başlamadan Önce Gereksinimler

Uygulamaya geçmeden önce geliştirme ortamınızda şu bileşenlerin hazır bulunması gerekir:
- `us-west4-a` bölgesinde TPU v5e flex-start kotasına sahip bir Google Cloud projesi ve kimliği doğrulanmış `gcloud` CLI,
- Ağırlıklar ve test çıktıları için bir Google Cloud Storage (GCS) depolama alanı,
- Secret Manager üzerinde `hf-token` adıyla tanımlanmış Hugging Face erişim anahtarı,
- Proje deposunun klonu (`git clone https://github.com/xbill9/gemma4-dev`).

## Adım 1 — QAT Ağırlıklarını Yeniden Paketleme

4-bit yeniden paketleme adımı, her grubun eğitilmiş adım aralığını koruyarak int4 olarak saklar; böylece her değer ızgaradaki konumunu muhafaza eder:
- İlgili model Hugging Face üzerinden indirilir (`huggingface-cli download google/gemma-4-12B-it-qat-q4_0-unquantized`).
- `repack_q4_0.py` betiği çalıştırılarak ağırlıklar paketlenir.
- int8 sürümleri ise `w8a8_from_qat.py` betiğiyle kanal başına int8 formatına dönüştürülür.

Modelleri TPU arka ucunda sunabilmek için vLLM'in `tpu_inference` katmanına üç yama uygulanır: JAX yolunda int8 W8A8 metodu, çipte paketli kalıp yalnızca ihtiyaç duyulan satırları açan int4 embedding tabloları ve int4 `lm_head`.

## Adım 2 — Tek bir v5e Çipinde Dağıtım (Serving)

Her dağıtım; vLLM imajını başlatan, yamaları uygulayan, modelleri sırayla servis edip sonuçları yükleyen bir flex-start kuyruklu kaynağıdır (queued resource). Dağıtım `gcloud alpha compute tpus queued-resources create` komutuyla yürütülür.

**Öğrenme ve Yazılım Çıkarımı:** Bellek kısıtlı bulut hızlandırıcılarında model ağırlıklarını donanımın yerel int8 yeteneklerine göre optimize etmek ve kelime tablolarını dinamik açılacak şekilde saklamak, doğruluk kaybı yaşamadan üretim maliyetlerini düşürmenin en pratik yoludur.

[[Orijinal kaynağa buradan ulaşabilirsiniz.](https://dev.to/gde/repacked-qat-gemma-4-on-one-tpu-v5e-12b-serves-at-675-tokens-per-second-15dd)](https://dev.to/gde/repacked-qat-gemma-4-on-one-tpu-v5e-12b-serves-at-675-tokens-per-second-15dd)

---

Bu konuyu derinlemesine öğrenmek isterseniz: [Ölçeklendirme ve Optimizasyon](https://edumints.com/kesfet/embedding-ve-reranking-modelleri-productionda-depl-blu6) modülüne göz atın.

---

**Kaynak:** [dev.to](https://dev.to/gde/repacked-qat-gemma-4-on-one-tpu-v5e-12b-serves-at-675-tokens-per-second-15dd)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/tek-tpu-v5e-uzerinde-yeniden-paketlenmis-qat-gemma-4-12b-ile-usohjl4j
