---
title: "KV-Cache Tahliye Politikalarında LRU'yu Alt Etmek Neden Sanılandan Daha Zor?"
url: https://blog.edumints.com/kv-cache-tahliye-politikalarinda-lruyu-alt-etmek-neden-sanil-bceqhb6z
category: "LLM"
date: 2026-09-12T15:10:48.285Z
publisher: Edumints Blog
lang: tr-TR
source_name: "Hacker News"
source_url: https://github.com/gauravapiscean/agentic-kv-cache
---

# KV-Cache Tahliye Politikalarında LRU'yu Alt Etmek Neden Sanılandan Daha Zor?

Büyük dil modellerinde (LLM) otonom ajan iş yüklerini sunarken istekler arası KV ön ek önbellekleme (**cross-request KV prefix caching**), çıkarım maliyetini ve yanıt süresini düşüren en kritik optimizasyon mekanizmasıdır. Günümüz üretim sistemlerindeki **vLLM**, **SGLang (RadixAttention)** ve **Mooncake** gibi modern çıkarım altyapıları, önbellekten tahliye (**eviction**) stratejisi olarak varsayılan biçimde **LRU (Least Recently Used)** politikasını tercih eder. Son akademik yayınlar, ajanların sıkça boşta kalması nedeniyle LRU'nun duraklatılmış ve terk edilmiş oturumları ayırt edemediğini savunarak LRU'nun yetersiz olduğunu öne sürse de, gerçek üretim verileri çok daha farklı bir tablo ortaya koymaktadır.

393 gerçek Claude Code oturumundan elde edilen 68.266 istek ve Mooncake verileriyle blok düzeyinde bir simülatör üzerinde yapılan kapsamlı testler, üretimdeki LRU taban çizgisini aşmanın neden beklenenden çok daha zor olduğunu beş temel bulguyla özetlemektedir:

## Temel Bulgular

1. **Ajan oturumları literatürde belirtilenden çok daha fazla boşta (idle) kalır:** Gerçek kullanım izlerinde (traces) oturumlar arası bekleme süreleri, yayımlanan akademik makalelerde varsayılan sürelerden belirgin şekilde daha uzundur.
2. **Kapasite baskısı altında asıl israf beklenmeyen yerdedir:** Yeniden hesaplama (**recomputation**) maliyetinin büyük kısmı, uzun süre bekleyen ölü oturumlardan değil; saniyeler arayla gerçekleşen ardışık araç çağırma (**tool-calling**) döngülerinden kaynaklanmaktadır.
3. **5 dakikalık TTL süresi kapasite baskısında hiç devreye girmemiştir:** Bellek doluluğunun yüksek olduğu anlarda bloklar, 5 dakikalık zaman aşımına (TTL) ulaşamadan çok önce kapasite kısıtı nedeniyle tahliye edilmektedir.
4. **LRU'yu geride bırakmak için denenen üç yöntem de başarısız olmuştur:** Gelişmiş sezgisel stratejiler ve alternatif önbellek tahliye mantıkları, üretimdeki LRU başarımını geçmeyi başaramamıştır.
5. **Belady algoritmasının LRU'ya kaybetmesine yol açan test düzeneği hatası:** Yürütme esnasındaki aktif blok zincirinin belleğe sabitlenmemesi (**pinning** eksikliği), teorik olarak en kusursuz kabul edilen Belady algoritmasının bile LRU'nun gerisine düşmesine sebep olmuştur.

## Yazılım Geliştirme ve Sistem Mimarisi Açısından Çıkarımlar

- **Gerçek Üretim Verisi ile Modelleme:** Sentetik veriler yerine gerçek araç çağırma trafik izlerini analiz etmek gerekir. Ajan sistemlerinde darboğaz oturum bekleme sürelerinden ziyade ani ve sık araç çağrısı patlamalarıdır.
- **Radix Ağacı ve Kesintisiz Ön Ek Gereksinimi:** KV-cache isabeti rasgele bir küme kesişimi değil, kesintisiz bir ön ek zinciridir. Radix ağacında alt düğümü olan bloklar doğrudan atılamayacağı için tahliyenin yaprak düğümler (**leaves**) üzerinden LRU ile yapılması mimari bir standarttır.
- **Bellek Sabitleme (Pinning) Disiplini:** Aktif isteklerin kullandığı blok zincirleri bellek tahliyesine karşı mutlaka kilitlenmeli, test ve kıyaslama düzeneklerinde simülasyon doğruluğu titizlikle doğrulanmalıdır.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://github.com/gauravapiscean/agentic-kv-cache)

---

Bu konuyu derinlemesine öğrenmek isterseniz: [Ölçeklendirme ve Optimizasyon](https://edumints.com/kesfet/embedding-ve-reranking-modelleri-productionda-depl-blu6) modülüne göz atın.

---

**Kaynak:** [Hacker News](https://github.com/gauravapiscean/agentic-kv-cache)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/kv-cache-tahliye-politikalarinda-lruyu-alt-etmek-neden-sanil-bceqhb6z
