RTX 5080 ve RTX 3090 Kurulumu: Qwen 3.6 27B Q8 ile Saniyede 80+ Token
İçindekiler
Oyun oynamak ve yapay zeka denemeleri yapmak amacıyla RTX 5080 aldım. Ancak 2026 yılına geldiğimizde Qwen 3.5, Gemma ve Qwen 3.6 gibi modelleri çalıştırmak için 16 GB VRAM yetersiz kalmaya başladı. Ben de 24 GB VRAM'e sahip yenilenmiş bir RTX 3090 edindim. İki farklı GPU'yu bir arada kullanabilmek için PCIe hatlarını 2x8 olarak bölebilen Asus Prime X570-Pro anakart ve RTX 5080'in büyüklüğünden ötürü kaliteli bir PCIe 4 riser kablo tercih ettim. Yazılım geliştirme ve öğrenme açısından bu kurulum, yüksek bulut maliyetlerinden kaçınarak yerel sistemlerde büyük dil modellerini (LLM) deneyimlemek, prototipler üretmek ve gizlilik odaklı projeler geliştirmek için mükemmel bir pratik çıkarım sunuyor.
BIOS Ayarları
BIOS yapılandırması beklediğimden karmaşıktı. En önemli kural: İşletim sistemini kesinlikle BIOS/MBR modunda başlatmamalısınız; bu durum çift kart kullanımını engeller. UEFI modunu kullanmalısınız.
Yapılması gereken BIOS ayarları:
- Boot sekmesine gidin ve CSM (Compatibility Support Module) seçeneğini Disabled yapın.
- Advanced sekmesinden PCI Subsystem Settings bölümüne girin.
- Above 4G Decoding ayarını Enabled yapın.
- ReSize BAR Support seçeneğini Auto veya Enabled olarak ayarlayın.
- Yine Advanced sekmesindeyken -> PCIEX16_1 Link Mode seçeneğini Gen 4 yapın.
- PCIEX16_2 Link Mode seçeneğini Gen 4 yapın.
İşletim Sistemi Çekirdeği (Kernel)
Kartlar farklı mimarilere (Ampere ve Blackwell) sahip olduğu için açık kaynaklı GPU çekirdek modüllerini kullanamadım. Farklı nesil GPU'lara sahipseniz en kararlı yol nvidia-open sürücüsünü kullanmaktır.
Aynı tipte iki kartı olan şanslı okuyucular için özel sürücü kurulduktan sonra yapılması gerekenler:
nvidia-dkms-openpaketini kaldırın.- Yeni
novasürücüsünü kara listeye (blacklist) ekleyin.
Sürücü yüklendikten sonra nvidia-smi komutuyla her iki kartın da sistem tarafından tanındığını doğrulayabilirsiniz.
llama.cpp Yapılandırması
Hem Ampere hem de Blackwell mimarilerini desteklemek için derleme aşamasında CMAKE_CUDA_ARCHITECTURES="86;120" bayrağını kullandım. Ayrıca NCCL kütüphanesinin bu senaryoda performansı olumsuz etkilediğini fark ederek -DGGML_CUDA_NCCL=OFF ile devre dışı bıraktım.
Kullandığım başlatma parametreleri ve açıklamaları:
Huihui-Qwen3.6-27B-abliterated-ggml-model-Q8_0.gguf: Bu modelinq8kuantizasyonu,230kbağlam penceresi veq8KV-cache kuantı ile toplam 39 GB VRAM'e sığar.--spec-type ngram-mod,draft-mtp --spec-draft-n-max 3:ngramipucu içeren MTP spekülatif hızlandırma ile performansı artırır.-sm tensor: Çoklu GPU desteği için tensor modunu etkinleştirir.-ts 2,3: VRAM'in tamamını verimli kullanmak için kartlar arası yük dağılım oranını belirler.
Sonuç
Bu optimizasyonlarla, Q8 kuantizasyonundaki 27 milyar parametreli Qwen 3.6 modelinde saniyede 80 ila 90+ token üretebildim. Yazılım geliştiriciler için bu hız, yerel LLM destekli uygulamaları gecikmesiz test etmeyi ve yapay zeka entegrasyonu öğrenme sürecini oldukça akıcı ve keyifli hale getiriyor.
Orijinal makaleye buradan ulaşabilirsiniz.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →