---
title: "2.000 Dolarlık Çıkarım Sunucusu: 10 Yıllık Donanımla Yerel Yapay Zeka Kurulumu"
url: https://blog.edumints.com/2000-dolarlik-cikarim-sunucusu-10-yillik-donanimla-yerel-yap-qhltlo7b
category: "Yapay Zeka"
date: 2026-09-09T15:10:38.181Z
publisher: Edumints Blog
lang: tr-TR
source_name: "dev.to"
source_url: https://dev.to/devbrewery/the-2000-inference-server-standing-up-local-ai-on-ten-year-old-hardware-3l1k
---

# 2.000 Dolarlık Çıkarım Sunucusu: 10 Yıllık Donanımla Yerel Yapay Zeka Kurulumu

Günde binlerce ajan isteğini işleyen yerel bir çıkarım (inference) sunucusu kurmak için servet harcamanıza gerek yok. İkinci el kurumsal parçalarla yaklaşık 2.000 dolara toplanan ve en yeni çipi 2016 üretimi olan bu sistem, teorik varsayımların pratikte nasıl çürütüldüğünü gösteren harika bir geliştirici deneyimi sunuyor. Üstelik bu yatırım, sınır modellerin (frontier models) API faturalarına kıyasla yaklaşık iki ayda kendini amorti ediyor.

## Malzeme Listesi (Donanım Bileşenleri)

Sistem; eBay üzerinden toplanan ikinci el kurumsal sunucu bileşenleri ile yeni kasa, güç kaynağı ve soğutucu kombinasyonundan oluşuyor:

- **AMD EPYC 7302P + Supermicro H11SSL-i (16 çekirdek / 32 izlek)**: 555 $
- **128 GB DDR4-2666 ECC RAM (8x 16 GB)**: 551 $
- **2x NVIDIA Tesla P40 (24 GB VRAM her biri)**: 403 $
- **1 TB Intel DC P4510 U.2 NVMe SSD**: 100 $
- **U.2 adaptörü ve güç kablolaması**: 63 $
- **Kasa, Güç Kaynağı (PSU) ve İşlemci Soğutucusu**: ~330 $
- **Toplam**: ~2.000 $

Sistemin kalbinde 2016 mimarili Pascal GPU'lar (Tesla P40) yer alıyor. Kağıt üzerinde 2x24 GB ile 48 GB VRAM sağlansa da geliştiricilerin çıkarması gereken ilk zorlu ders: **47 GB'lık bir model 48 GB'a sığmaz**. Sürücü yaklaşık %6 VRAM ayırdığından kullanılabilir alan 45 GiB ile sınırlıdır; veri tablosu rakamlarıyla bütçe yapmak bellek aşımına (OOM) yol açar.

## Bu Donanımın Yapamadıkları

Mimarinin kısıtlarını önceden bilmek geliştirme sürecinde haftalar kazandırır:

- **vLLM Desteği Yok**: Hesaplama kabiliyeti (compute capability) 6.1 seviyesinde kaldığı için vLLM bu mimariyi desteklemez.
- **Tensor Çekirdeği Yok (FP16 Tuzağı)**: Pascal mimarisinde FP16 işlemleri FP32 hızının 1/64'ü hızında çalışır. Kartın asıl gücü `dp4a` komutuyla çalışan INT8 hesaplamalarındadır (~47 TOPS). Bu yüzden modern kart tavsiyeleri yerine kuantize modeller ve tamsayı matris çarpım çekirdekleri kullanılmalıdır.
- **Eşzamanlı GPU Modelleri Yok**: Bellekte aynı anda yalnızca tek bir büyük model barındırılabilir. Portainer API üzerinden model değişimi yaklaşık 30 saniye sürer.
- **Hızlı Soğuk Başlatma (Cold Start) Yok**: Modelin belleğe yüklenmesi boyutuna bağlı olarak 20 ila 40 saniye sürer.
- **Modern Optimizasyon Rehberleri Geçersiz**: Ampere ve sonrası modern mimariler için yazılmış rehberler Pascal'da çalışmaz; hatta önerilen bazı hızlandırma modları belleğe geçersiz erişim (illegal memory access) hatasıyla çöker.

## Sistemin Başarabildikleri ve Pratik Çıkarımlar

Bu kısıtlamalara rağmen optimize edilmiş bir yığınla üretim loglarından alınan gerçek performans verileri şunlardır:

- **26B MoE Modeli (Gemma 4 26B-A4B, Q8)**: Hızlı rotada saniyede 41 token (tokens/sec) kod çözme hızına ulaşır.
- **27B Yoğun Model (Q6_K)**: Spekülatif kod çözmeyle tekli akışta 13-17 token/sn, dört paralel yuvada toplam 15 token/sn üretir.
- **Quantized KV Cache ile 262k Bağlam**: Kuantize KV önbelleği sayesinde 262 bin token bağlam penceresi yalnızca 23 GB VRAM tüketir.
- **CPU Tabanlı Yardımcı Modeller**: 4B modeller, GPU'larla yarışmadan CPU çekirdeklerinde 15-25 token/sn ile sınıflandırma ve yönlendirme görevlerini kesintisiz yürütür.

Geliştiriciler için pratik çıkarım: Donanım sınırlarını doğru analiz etmek, ticari API bağımlılığı yerine akıllı kuantizasyon ve iş yükü ayrıştırmasıyla son derece düşük maliyetli ve sürdürülebilir yerel mimariler inşa etmeyi mümkün kılar.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://dev.to/devbrewery/the-2000-inference-server-standing-up-local-ai-on-ten-year-old-hardware-3l1k)

---

Bu konuyu derinlemesine öğrenmek isterseniz: [Ölçeklendirme ve Optimizasyon](https://edumints.com/kesfet/embedding-ve-reranking-modelleri-productionda-depl-blu6) modülüne göz atın.

---

**Kaynak:** [dev.to](https://dev.to/devbrewery/the-2000-inference-server-standing-up-local-ai-on-ten-year-old-hardware-3l1k)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/2000-dolarlik-cikarim-sunucusu-10-yillik-donanimla-yerel-yap-qhltlo7b
