AMD MI300X Üzerinde Gemma 4 Sunumu: Saatte 1.99 Dolar Ne Kazandırır?

İçindekiler
Bu makale, Gemma 4 E2B modelinin AMD Instinct MI300X GPU barındıran bir sisteme adım adım dağıtım sürecini incelemektedir. vLLM tabanlı bu dağıtımın yönetimini kolaylaştırmak amacıyla Python ile geliştirilmiş bir MCP (Model Context Protocol) araç seti kullanılmıştır. Donanıma arka planda DigitalOcean altyapısını çalıştıran AMD Developer Cloud üzerinden erişilmekte olup, sistemi yöneten yerel iş istasyonunda herhangi bir AMD GPU bulunmamaktadır.
Sistem ve Dağıtım Özellikleri
- Model:
google/gemma-4-E2B-it(bf16 referans sürümü) - Donanım: 1x AMD Instinct MI300X (gfx942, CDNA 3, 191.7 GiB HBM3)
- Host:
gpu-mi300x1-192gb-devcloud— 20 vCPU, 240 GB RAM, 720 GB disk, atl1 bölgesi - Kontrol Düzlemi: AMD Developer Cloud / DigitalOcean v2 API (gcloud veya EC2 kullanılmaz)
- Yazılım:
vllm/vllm-openai-rocm:nightly-rocm100, vLLM 0.3.1.dev3+g0bfc7a15d - Maliyet: Saatte 1.99 dolar (on-demand / isteğe bağlı)
- Performans: Tek akışta 305 tok/s, 64 paralel akışta 10.284 tok/s (dolar-saat başına 2.713 tok/s)
Nereden Başlamalıyım?
Bulut ortamındaki kart, AMD Developer Cloud üzerinden erişilen bir DigitalOcean GPU droplet'idir. Makinenin oluşturulması ve silinmesi bilinçli olarak konsol üzerinden manuel yapılır; çünkü her iki işlem de doğrudan saatlik bütçeyi etkiler ve otonom bir ajanın inisiyatifine bırakılmamalıdır. Dağıtım sonrasındaki tüm adımlar ise script ile yürütülür. Droplet belirli bir etiket taşır ve hazırlanan tüm araçlar yalnızca bu etiket kapsamındaki kaynakları yönetebilir.
Bu Aşamada Sahip Olmanız Gerekenler…
- Çalışır durumda, etiketlenmiş ve SSH anahtarı ile erişilebilen bir GPU droplet'i
- Sunucunun dizininde
0600dosya izin moduna sahip.enviçindeDIGITALOCEAN_ACCESS_TOKEN - Droplet üzerinde
/dev/kfdve/dev/driaygıt izinleri yapılandırılmış Docker - Korumalı (gated) Gemma 4 model ağırlıklarına erişim için droplet üzerinde bir Hugging Face token'ı
- Yerel iş istasyonunuzda Python 3 (makinede yerel bir GPU bulunması beklenmez)
Çalıştırdığınız Yerel Makinede GPU Yok
Yazılım mimarisi açısından kritik bir kural şudur: Yerel makinede rocm-smi, amd-smi, rocminfo veya hipcc bulunmaz. Yerel kabukta ROCm komutu çalıştırmak bir kontrol değil, mimari bir hatadır. Tüm metrikler SSH veya DigitalOcean API üzerinden alınır. Bu yaklaşım, yerel makinede hiçbir donanım bağımlılığı olmadan uzaktaki güçlü GPU'ları yönetmeyi sağlar.
MCP Sunucusu stdio Üzerinden Konuşur
Geliştirilen tek bir server.py dosyası, stdio üzerinden 21 farklı aracı (@mcp.tool) dışa aktarır: droplet yaşam döngüsü, imaj kontrolleri, dağıtım, log takibi ve SRE sondaları. Güvenliği korumak amacıyla kabuk (shell) çalıştırılmaz; tüm alt süreçler asyncio.create_subprocess_exec kullanan run_command fonksiyonu üzerinden güvenle yürütülür.
Droplet Nedir?
Sistem gpu-mi300x1-192gb-devcloud profiliyle 20 vCPU, 240 GB RAM ve 720 GB disk sunar. Fiyatlandırma statik belgeler yerine doğrudan DigitalOcean API'sinin droplet.size.price_hourly alanından anlık olarak doğrulanır ve kapalıyken de ücretlendirildiği göz önünde bulundurulmalıdır.
Her Şey Çalışmadan Önce Kartın Durumu
GPU ilk kontrolde SR-IOV sanal fonksiyonu olarak listelenir. Bu bir sanal bölüntü gibi görünse de donanımın tamamını sunar; tüm 304 hesaplama birimi (CU) ve 191.7 GiB bellek eksiksiz aktiftir. ROCm sürücü araçları her zaman anlamlı çıkış kodları üretmediğinden, MCP aracı komut çıktılarını metin olarak ayrıştırarak donanım sağlığını teyit eder.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Production MCP Entegrasyonu modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →