Intel Arc iGPU Üzerinde Yerel LLM Çalıştırma: Mini PC ve Ubuntu Rehberi

İçindekiler
Intel işlemcili mini PC'lerde yerel LLM çalıştırmak, NVIDIA sistemlerine göre daha az bilinen ama oldukça verimli bir yoldur. Bu rehberde, Intel Arc iGPU üzerinde GPU hızlandırmalı yerel çıkarım adımlarını inceleyeceğiz.
Neden NVIDIA'dan Daha Zor?
NVIDIA'nın CUDA ekosisteminin aksine Intel'in GPU hesaplama yapısı (SYCL, oneAPI, Level Zero) daha parçalıdır. llama.cpp'nin SYCL arka ucu, Intel oneAPI ile birlikte gelen MKL kütüphanesini zorunlu kılar; bu da kurulumu daha karmaşık hale getirir.
Donanım Bağlamı
Intel Arc 140T iGPU, sistem belleğini (DDR5) VRAM olarak paylaşır. 64GB RAM'li bir sistemde iGPU, BIOS ayarına bağlı olarak 16-32GB'a kadar bellek adresleyebilir.
Adım 1: BIOS Yapılandırması
iGPU performansı için BIOS'ta şu ayarları yapmalısınız:
- Above 4G Decoding ve Resizable BAR (ReBAR): Aktif edilmeli.
- DVMT Pre-Allocated: Maksimum veya 512MB olarak ayarlanmalı.
- Bellek Hızı (XMP/EXPO): Bant genişliğini artırmak için en yüksek hıza ayarlanmalı.
Adım 2: Intel oneAPI Kurulumu
Açık kaynaklı dpclang yerine Intel'in tescilli oneAPI derleyici yığınını kullanmalısınız. oneAPI Base Toolkit indirilmeli ve intel-ocloc, libsycl-dev gibi bağımlılıklarla kurulmalıdır.
Adım 3: llama.cpp Derleme
Derleme sırasında icx/icpx derleyicilerini belirtmeli ve GGML_SYCL=ON gibi bayrakları kullanmalısınız. RMS_NORM çökmelerini önlemek için ONEAPI_DEVICE_SELECTOR=level_zero:gpu çevresel değişkeni tanımlanmalıdır.
Adım 4: Linux İyileştirmeleri
Bellek ve CPU performansını optimize etmek için:
- İşlemci yöneticisini (CPU Governor) performance moduna alın.
- Disk swap kullanımını azaltmak için
swappiness=10yapın. - Büyük model ayırmalarında TLB kayıplarını önlemek için Hugepages aktifleştirin.
Adım 5: iGPU'da Model Çalıştırma
Tüm katmanları iGPU'ya aktarmak için -ngl 99 parametresini kullanın. 9B modeller için 131K bağlam uzunluğunda KV önbelleği ciddi RAM tüketir; pratik kullanımda 32K-65K arası en uygun değerdir.
Sorun Giderme
Eğer CMake MKL'yi bulamazsa setvars.sh dosyasının doğru kaynaklandığından emin olun. Çökmeler durumunda bağlam (context) boyutunu küçültün.
Performans Notları
Bellek bant genişliği (DDR5) en büyük darboğazdır. Qwen3-Coder-30B gibi modellerde Arc 140T iGPU, mobil RTX 3050 seviyesinde performans verir ve düşük güç tüketimiyle ekonomik bir yerel yapay zeka istasyonu sağlar.
IPEX-LLM ve Ollama Seçenekleri
IPEX-LLM PyTorch tabanlı modeller için bir alternatiftir. Ollama ise Intel GPU desteğini artırmaktadır; daha az kontrol gerektiren basit kurulumlar için Ollama tercih edilebilir.
Devam Eden Çalışmalar
Yeni GGUF modellerinin test edilmesi ve multi-agent kararlılık analizleri devam etmektedir. Amaç, buluta bağımlı olmadan cebinizde taşıyabileceğiniz maliyetsiz bir yerel yapay zeka yardımcısı elde etmektir.
Yazılım Geliştirme ve Öğrenme Çıkarımları
Donanım kaynaklarının verimli kullanımı, yerel LLM projelerinde geliştiricilere sıfır API maliyeti ve veri gizliliği avantajı sunar. Derleyici optimizasyonlarını öğrenmek, gömülü sistemlerde ve uç cihazlarda yapay zeka uygulamaları geliştirmek için kritik bir beceridir.
[Orijinal kaynağa buradan ulaşabilirsiniz.](https://dev.to/starrzan/running-local-llms-on-intel-arc-igpu-a-complete-guide-for-ubuntu-on-mini-pc-hardware-40bc)
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →