DevOps·2 dk okuma·

SOTA Yapay Zeka Modellerini Yerel Olarak Çalıştırma Rehberi

Paylaş
DevOpsEdumints Blog

Yerel olarak son teknoloji (SOTA) büyük dil modellerini (LLM) çalıştırmak; veri güvenliği sağlamak, gecikme sürelerini düşürmek ve uzun vadeli bulut API maliyetlerini sıfırlamak isteyen yazılım geliştiriciler için son derece kritik bir konudur. Jamesob’un hazırladığı bu kılavuz, uygun maliyetli donanım kurulumundan ince ayarlı sistem optimizasyonlarına kadar yerel yapay zeka ekosisteminin tüm detaylarını sunuyor. Yazılım geliştirme, mimari ve sürekli öğrenme perspektifinden bu rehberdeki 3 temel maddeyi ve bunlardan çıkarılabilecek pratik dersleri şu şekilde inceleyebiliriz:

Yerel LLM Kurulumunun 3 Temel Adımı

  • Yerel SOTA Donanımı ve Akıllı Bütçe Yönetimi: Büyük dil modellerini çalıştırmanın önündeki en büyük engel VRAM (ekran kartı belleği) ihtiyacıdır. Rehberde, en son nesil aşırı pahalı anakart ve DDR5 sistemler yerine, ikinci el AMD EPYC işlemciler ve DDR4 RAM tercih edilerek bütçe optimizasyonu yapılmıştır. Ayrıca, PCIe 4.0 switch’ler (c-payne.com) kullanılarak GPU’ların CPU üzerinden geçmeden, doğrudan (peer-to-peer) haberleşmesi sağlanmıştır. Bu sayede 27.5 GB/s tek yönlü ve 50.4 GB/s çift yönlü bant genişliğine ulaşılmıştır. Donanımı 110V standart prizde çalıştırmak için ekran kartları nvidia-smi ile 350W güce limitlenmiştir. BIOS ayarlarında Re-Size BAR’ı aktif etmek, IOMMU ve ASPM’i devre dışı bırakmak ise veri transferi darboğazlarını çözer. Pratik Çıkarım: Yapay zeka uygulamaları geliştirirken donanım bütçesini dengeli dağıtmak şarttır. İşlem gücü veya genel sistem belleği yerine doğrudan VRAM kapasitesine ve veriyolu bant genişliğine yatırım yapmak, geliştiricilere çok daha yüksek token üretim hızları (t/s) olarak geri döner.

  • Yerel Ses-Metin Dönüşümü (STT) ve Veri Gizliliği: Rehber, OpenAI’ın "whisper-large-v3" modelini yaklaşık 11GB VRAM kullanan Nvidia ekran kartları üzerinde yerel olarak koşturmaya yarayan özel bir "stt" aracı içeriyor. Bu yerel kurulum, ses verilerinin internete sızmasını tamamen engelleyerek veri gizliliğini maksimum düzeyde korur ve sıfır gecikmeli uygulamalar yapmayı sağlar. Pratik Çıkarım: Hassas ses verileriyle çalışan kurumsal projelerde, harici API servisleri yerine açık kaynaklı Whisper gibi modellerin yerel sunucularda barındırılması (self-hosting), veri egemenliği ve yasal regülasyonlara uyum açısından en güvenli mimari tercihtir.

  • Docker ve Tmux ile Konteynerize Model Yönetimi: İndirilen model ağırlıkları ZFS dosya sistemiyle yedeklenirken, her model kendi Docker konteyneri içinde izole edilir. Tmux oturumları aracılığıyla arka planda yönetilen bu modeller, yerel ağda bir HTTP API (vLLM) servisi olarak sunulur. Geliştiriciler böylece "opencode" gibi istemcilerle modellere güvenli bir şekilde erişebilirler. Bu sayede GLM-5.2-594B gibi devasa modeller bile yüksek bağlam penceresinde (~460k context) 80 t/s hıza ulaşır. Pratik Çıkarım: Yapay zeka modellerinin bağımlılıkları sıklıkla çakışabilir. Konteynerizasyon (Docker) ve süreç yönetimi (Tmux) prensiplerini yapay zeka altyapısına uygulamak, modellerin birbirini etkilemeden izole çalışmasını ve test süreçlerinin kolaylaşmasını sağlar.

Orijinal makaleye buradan ulaşabilirsiniz.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →