---
title: "GPU'nuz Geri Getirme (Retrieval) Sisteminize Muhtemelen Yardımcı Olmuyor"
url: https://blog.edumints.com/gpunuz-geri-getirme-retrieval-sisteminize-muhtemelen-yardimc-u7bclejl
category: "Makine Öğrenmesi"
date: 2026-06-03T09:07:57.585Z
publisher: Edumints Blog
lang: tr-TR
source_name: "dev.to"
source_url: https://dev.to/newtorob/your-gpu-probably-isnt-helping-your-retrieval-system-2c0n
---

# GPU'nuz Geri Getirme (Retrieval) Sisteminize Muhtemelen Yardımcı Olmuyor

Küçük yapay zeka modellerini çalıştırırken verilen "hemen bir GPU kullan" tavsiyesi genellikle yanlıştır. 33 milyon parametreli bir gömme (embedding) modelini beş farklı donanım altyapısında test ettim ve sonuçlar beklediğim gibi çıkmadı.

## Kurulum ve Test Ortamı
- **Model**: BAAI/bge-small-en-v1.5 (33M parametre, 384 boyutlu çıktı). Arama sistemlerinin vazgeçilmezi olan popüler bir küçük gömme modeli.
- **İş Yükü**: LongMemEval veri seti üzerinde 500 örnek, batch=1, çağrı başına tekil sorgu. Gerçekçi bir sorgu dağılımına sahip akademik kıyaslama.
- **Makineler**: Metal (Mac M2 Pro), CUDA 13 (RTX 2080 Ti), CPU (Intel 13700K), CPU (AMD 5800X) ve DirectML (RX 6600 XT).
- **Metrik**: 500 sorgu üzerinden ölçülen p50 ve p95 gecikme süreleri (milisaniye cinsinden).

## Rakamlarla Sonuçlar
| Altyapı | Donanım | p50 (ms) | p95 (ms) |
|---|---|---|---|
| Metal | M2 Pro (Birleşik Bellek) | 10.6 | 35.0 |
| CUDA 13 | RTX 2080 Ti | 17.8 | 20.8 |
| CPU | Intel 13700K | 22.2 | 34.6 |
| CPU | AMD 5800X | 18.9 | 21.7 |
| DirectML | RX 6600 XT | 17.9 | 22.0 |

## Göze Çarpanlar
RX 6600 XT üzerindeki DirectML, aynı makinedeki AMD CPU ile neredeyse aynı performansı gösterdi; yani GPU hızlandırması işe yaramadı. CUDA, RTX 2080 Ti ile kazandı ancak kazanç p50'de sadece %20, p95'te ise %40 oldu. Kazanan ise host-to-device kopyalamayı ortadan kaldıran birleşik bellekli Metal oldu.

## Neden?
Batch=1 ile küçük bir model çalıştırırken hesaplama gücüne değil, işlem dağıtım gecikmesine (dispatch-bound) takılırsınız. Eşik şu üç faktöre göre değişir:
- **Model Boyutu**: Parametre sayısı arttıkça işlem yükü amorti edilir ve GPU kullanımı mantıklı hale gelir.
- **Batch Boyutu**: Eş zamanlı iş arttıkça sabit gecikme ek yükü daha fazla veriye dağılır.
- **Dizi Uzunluğu**: Uzun girdiler matris çarpım yükünü artırarak GPU'nun hesaplama gücünden yararlanır.
Pratik çıkarım: Küçük modellerde tekil sorgularla çalışıyorsanız GPU maliyetine girmeyin, CPU fazlasıyla yeterlidir.

## Hata Ayıklama Hikayesi
PyTorch'un CUDA'yı algılamama sorunu çoğunlukla sürücü sürümü ile PyTorch build tag'i arasındaki ABI uyumsuzluğundan kaynaklanır. Kontrol sırası şöyledir:
- **Torch CUDA Sürümü**: `torch.__version__` ile PyTorch'un hangi CUDA sürümüne göre derlendiğini kontrol edin (örneğin cu130).
- **Sürücü Kapasitesi**: `nvidia-smi` ile sürücünün desteklediği maksimum sürümü görün.
- **ABI Uyumsuzluğu**: Sürücü ve runtime eşleşmiyorsa CUDA kullanılamaz hatası alırsınız, sürücüyü güncellemeniz gerekir.

## Kıyaslama Metodolojisi Tuzağı
Modeli her sorguda yeniden başlatmak (cold-start), CUDA'da toplam süreyi iki katına çıkardı. Canlı sistemlerde model belleğe bir kez yüklenir. Test yapınızı canlı sistem mimarinize göre tasarlamazsanız yanlış metrikleri optimize edersiniz.

## Çıkarım
Küçük modellerde tekil sorgular için birleşik bellekli Metal en hızlısıdır. CUDA hafif avantajlıdır, DirectML ise CPU ile eşittir. Yazılım geliştiriciler olarak ML projelerinde ezbere GPU'ya yönelmek yerine önce iş yükünü ölçmeli ve gereksiz maliyetlerden kaçınmalıyız. Erken optimizasyon yerine ölçüm odaklı ilerleyin.

[[Orijinal kaynağa buradan ulaşabilirsiniz.](https://dev.to/newtorob/your-gpu-probably-isnt-helping-your-retrieval-system-2c0n)](https://dev.to/newtorob/your-gpu-probably-isnt-helping-your-retrieval-system-2c0n)

---

**Kaynak:** [dev.to](https://dev.to/newtorob/your-gpu-probably-isnt-helping-your-retrieval-system-2c0n)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/gpunuz-geri-getirme-retrieval-sisteminize-muhtemelen-yardimc-u7bclejl
