DevOps·3 dk okuma·

AMD MI300X Üzerinde Gemma 4 Sunumu: Saatte 1.99 Dolar Ne Kazandırır?

Paylaş
AMD MI300X Üzerinde Gemma 4 Sunumu: Saatte 1.99 Dolar Ne Kazandırır?

Bu makale, Gemma 4 E2B modelinin AMD Instinct MI300X GPU barındıran bir sisteme adım adım dağıtım sürecini incelemektedir. vLLM tabanlı bu dağıtımın yönetimini kolaylaştırmak amacıyla Python ile geliştirilmiş bir MCP (Model Context Protocol) araç seti kullanılmıştır. Donanıma arka planda DigitalOcean altyapısını çalıştıran AMD Developer Cloud üzerinden erişilmekte olup, sistemi yöneten yerel iş istasyonunda herhangi bir AMD GPU bulunmamaktadır.

Sistem ve Dağıtım Özellikleri

  • Model: google/gemma-4-E2B-it (bf16 referans sürümü)
  • Donanım: 1x AMD Instinct MI300X (gfx942, CDNA 3, 191.7 GiB HBM3)
  • Host: gpu-mi300x1-192gb-devcloud — 20 vCPU, 240 GB RAM, 720 GB disk, atl1 bölgesi
  • Kontrol Düzlemi: AMD Developer Cloud / DigitalOcean v2 API (gcloud veya EC2 kullanılmaz)
  • Yazılım: vllm/vllm-openai-rocm:nightly-rocm100, vLLM 0.3.1.dev3+g0bfc7a15d
  • Maliyet: Saatte 1.99 dolar (on-demand / isteğe bağlı)
  • Performans: Tek akışta 305 tok/s, 64 paralel akışta 10.284 tok/s (dolar-saat başına 2.713 tok/s)

Nereden Başlamalıyım?

Bulut ortamındaki kart, AMD Developer Cloud üzerinden erişilen bir DigitalOcean GPU droplet'idir. Makinenin oluşturulması ve silinmesi bilinçli olarak konsol üzerinden manuel yapılır; çünkü her iki işlem de doğrudan saatlik bütçeyi etkiler ve otonom bir ajanın inisiyatifine bırakılmamalıdır. Dağıtım sonrasındaki tüm adımlar ise script ile yürütülür. Droplet belirli bir etiket taşır ve hazırlanan tüm araçlar yalnızca bu etiket kapsamındaki kaynakları yönetebilir.

Bu Aşamada Sahip Olmanız Gerekenler…

  • Çalışır durumda, etiketlenmiş ve SSH anahtarı ile erişilebilen bir GPU droplet'i
  • Sunucunun dizininde 0600 dosya izin moduna sahip .env içinde DIGITALOCEAN_ACCESS_TOKEN
  • Droplet üzerinde /dev/kfd ve /dev/dri aygıt izinleri yapılandırılmış Docker
  • Korumalı (gated) Gemma 4 model ağırlıklarına erişim için droplet üzerinde bir Hugging Face token'ı
  • Yerel iş istasyonunuzda Python 3 (makinede yerel bir GPU bulunması beklenmez)

Çalıştırdığınız Yerel Makinede GPU Yok

Yazılım mimarisi açısından kritik bir kural şudur: Yerel makinede rocm-smi, amd-smi, rocminfo veya hipcc bulunmaz. Yerel kabukta ROCm komutu çalıştırmak bir kontrol değil, mimari bir hatadır. Tüm metrikler SSH veya DigitalOcean API üzerinden alınır. Bu yaklaşım, yerel makinede hiçbir donanım bağımlılığı olmadan uzaktaki güçlü GPU'ları yönetmeyi sağlar.

MCP Sunucusu stdio Üzerinden Konuşur

Geliştirilen tek bir server.py dosyası, stdio üzerinden 21 farklı aracı (@mcp.tool) dışa aktarır: droplet yaşam döngüsü, imaj kontrolleri, dağıtım, log takibi ve SRE sondaları. Güvenliği korumak amacıyla kabuk (shell) çalıştırılmaz; tüm alt süreçler asyncio.create_subprocess_exec kullanan run_command fonksiyonu üzerinden güvenle yürütülür.

Droplet Nedir?

Sistem gpu-mi300x1-192gb-devcloud profiliyle 20 vCPU, 240 GB RAM ve 720 GB disk sunar. Fiyatlandırma statik belgeler yerine doğrudan DigitalOcean API'sinin droplet.size.price_hourly alanından anlık olarak doğrulanır ve kapalıyken de ücretlendirildiği göz önünde bulundurulmalıdır.

Her Şey Çalışmadan Önce Kartın Durumu

GPU ilk kontrolde SR-IOV sanal fonksiyonu olarak listelenir. Bu bir sanal bölüntü gibi görünse de donanımın tamamını sunar; tüm 304 hesaplama birimi (CU) ve 191.7 GiB bellek eksiksiz aktiftir. ROCm sürücü araçları her zaman anlamlı çıkış kodları üretmediğinden, MCP aracı komut çıktılarını metin olarak ayrıştırarak donanım sağlığını teyit eder.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Production MCP Entegrasyonu modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →