---
title: "RTX 5080 ve RTX 3090 Kurulumu: Qwen 3.6 27B Q8 ile Saniyede 80+ Token"
url: https://blog.edumints.com/rtx-5080-ve-rtx-3090-kurulumu-qwen-36-27b-q8-ile-saniyede-80-8gs6946u
category: "LLM"
date: 2026-06-14T09:05:43.460Z
publisher: Edumints Blog
lang: tr-TR
source_name: "Hacker News"
source_url: https://imil.net/blog/posts/2026/rtx-5080-+-rtx-3090-setup-80+-tok-s-on-qwen-3.6-27b-q8/
---

# RTX 5080 ve RTX 3090 Kurulumu: Qwen 3.6 27B Q8 ile Saniyede 80+ Token

Oyun oynamak ve yapay zeka denemeleri yapmak amacıyla RTX 5080 aldım. Ancak 2026 yılına geldiğimizde Qwen 3.5, Gemma ve Qwen 3.6 gibi modelleri çalıştırmak için 16 GB VRAM yetersiz kalmaya başladı. Ben de 24 GB VRAM'e sahip yenilenmiş bir RTX 3090 edindim. İki farklı GPU'yu bir arada kullanabilmek için PCIe hatlarını 2x8 olarak bölebilen Asus Prime X570-Pro anakart ve RTX 5080'in büyüklüğünden ötürü kaliteli bir PCIe 4 riser kablo tercih ettim. Yazılım geliştirme ve öğrenme açısından bu kurulum, yüksek bulut maliyetlerinden kaçınarak yerel sistemlerde büyük dil modellerini (LLM) deneyimlemek, prototipler üretmek ve gizlilik odaklı projeler geliştirmek için mükemmel bir pratik çıkarım sunuyor.

## BIOS Ayarları
BIOS yapılandırması beklediğimden karmaşıktı. En önemli kural: İşletim sistemini kesinlikle BIOS/MBR modunda başlatmamalısınız; bu durum çift kart kullanımını engeller. UEFI modunu kullanmalısınız.

Yapılması gereken BIOS ayarları:
- Boot sekmesine gidin ve CSM (Compatibility Support Module) seçeneğini Disabled yapın.
- Advanced sekmesinden PCI Subsystem Settings bölümüne girin.
- Above 4G Decoding ayarını Enabled yapın.
- ReSize BAR Support seçeneğini Auto veya Enabled olarak ayarlayın.
- Yine Advanced sekmesindeyken -> PCIEX16_1 Link Mode seçeneğini Gen 4 yapın.
- PCIEX16_2 Link Mode seçeneğini Gen 4 yapın.

## İşletim Sistemi Çekirdeği (Kernel)
Kartlar farklı mimarilere (Ampere ve Blackwell) sahip olduğu için açık kaynaklı GPU çekirdek modüllerini kullanamadım. Farklı nesil GPU'lara sahipseniz en kararlı yol `nvidia-open` sürücüsünü kullanmaktır.

Aynı tipte iki kartı olan şanslı okuyucular için özel sürücü kurulduktan sonra yapılması gerekenler:
- `nvidia-dkms-open` paketini kaldırın.
- Yeni `nova` sürücüsünü **kara listeye (blacklist)** ekleyin.

Sürücü yüklendikten sonra `nvidia-smi` komutuyla her iki kartın da sistem tarafından tanındığını doğrulayabilirsiniz.

## llama.cpp Yapılandırması
Hem Ampere hem de Blackwell mimarilerini desteklemek için derleme aşamasında `CMAKE_CUDA_ARCHITECTURES="86;120"` bayrağını kullandım. Ayrıca NCCL kütüphanesinin bu senaryoda performansı olumsuz etkilediğini fark ederek `-DGGML_CUDA_NCCL=OFF` ile devre dışı bıraktım.

Kullandığım başlatma parametreleri ve açıklamaları:
- `Huihui-Qwen3.6-27B-abliterated-ggml-model-Q8_0.gguf`: Bu modelin `q8` kuantizasyonu, `230k` bağlam penceresi ve `q8` KV-cache kuantı ile toplam 39 GB VRAM'e sığar.
- `--spec-type ngram-mod,draft-mtp --spec-draft-n-max 3`: `ngram` ipucu içeren MTP spekülatif hızlandırma ile performansı artırır.
- `-sm tensor`: Çoklu GPU desteği için tensor modunu etkinleştirir.
- `-ts 2,3`: VRAM'in tamamını verimli kullanmak için kartlar arası yük dağılım oranını belirler.

## Sonuç
Bu optimizasyonlarla, Q8 kuantizasyonundaki 27 milyar parametreli Qwen 3.6 modelinde saniyede 80 ila 90+ token üretebildim. Yazılım geliştiriciler için bu hız, yerel LLM destekli uygulamaları gecikmesiz test etmeyi ve yapay zeka entegrasyonu öğrenme sürecini oldukça akıcı ve keyifli hale getiriyor.

Orijinal makaleye [buradan](https://imil.net/blog/posts/2026/rtx-5080-+-rtx-3090-setup-80+-tok-s-on-qwen-3.6-27b-q8/) ulaşabilirsiniz.

---

**Kaynak:** [Hacker News](https://imil.net/blog/posts/2026/rtx-5080-+-rtx-3090-setup-80+-tok-s-on-qwen-3.6-27b-q8/)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/rtx-5080-ve-rtx-3090-kurulumu-qwen-36-27b-q8-ile-saniyede-80-8gs6946u
