LLM·3 dk okuma·

RAG Bağlamını Daraltmak: LLM Yanıtları İçin Optimum Bilgi Optimizasyonu

Paylaş
LLMEdumints Blog

RAG (Retrieval-Augmented Generation) sistemlerinde en büyük maliyet ve performans darboğazlarından biri, LLM'e gönderilen gereksiz bağlam (context) miktarıdır. Kapa.ai ekibi, bilgi geri çağırma (retriever) ile yanıt üretme (generator) adımları arasına küçük ve düşük maliyetli bir LLM katmanı ekleyerek bağlamın %68'ini elemeyi ve maliyetleri net %34 oranında düşürmeyi başardı. İşte bu yenilikçi yaklaşımdan yazılım geliştirme ve öğrenme süreçlerine yönelik pratik çıkarımlar:

1. Yoksayılan Parçalar Hâlâ Maliyetlidir

Reranker aşamasından çıkan parçaların çoğu nihai yanıtta kullanılmaz ancak jeneratör model her bir token için ücret almaya devam eder.

  • Yazılım ve Öğrenme Çıkarımı: Veri yapılarında olduğu gibi RAG mimarilerinde de gereksiz veri taşımak performansı düşürür ve maliyeti artırır. Geliştiriciler olarak sadece "çalışan" sistemler değil, aynı zamanda kaynakları verimli kullanan sistemler tasarlamalıyız.

2. Kolay Çözüm (Skor Bazlı Filtreleme) İşe Yaramaz

Sıralama (rerank) skoruna göre sabit bir sınır (örneğin 0.7 üzeri) koyup altını silmek başarısız olur. Çünkü bu skorlar mutlak değerler değil, sadece göreceli bir sıralama sunar. Ayrıca bir bilginin doğruluğu ve alakası tek bir parçada değil, parçaların birleşimindedir.

  • Yazılım ve Öğrenme Çıkarımı: Sistem tasarımlarında tekil metriklere (pointwise) körü körüne güvenmek hata yaptırır. Verinin kendi bağlamı içindeki ilişkisel değerini (listwise) anlamak daha kritik bir mühendislik becerisidir.

3. Akıllıca Görünen Ama Başarısız Olan Diğer Yöntem

Araya yapay "referans belgeler" yerleştirerek skorları kalibre etme denemesi de yetersiz kalmıştır. Sıralayıcı yine de parçaları bir bütün olarak göremediği için dolaylı ilişkili bilgileri elemenin önüne geçememiştir.

  • Yazılım ve Öğrenme Çıkarımı: Karmaşık algoritmik yama çözümler üretmek yerine, problemin asıl kaynağına inmek gerekir. Bazen çözüm algoritmayı iyileştirmek değil, mimariyi değiştirmektir.

4. Çözüm: LLM ile Parçaları Derecelendirmek

Kapa.ai, reranker sonrasına küçük bir LLM yerleştirerek parçaları 5 seviyeli bir ölçekle (Temel, Katkı Sağlayan, Destekleyici, Teğetsel, Alakasız) değerlendirdi.

  • Yazılım ve Öğrenme Çıkarımı: Pahalı modeller yerine, spesifik görevler için optimize edilmiş küçük, hızlı ve ucuz LLM'leri (örneğin GPT-4o-mini gibi modelleri) ara katman ajanları olarak konumlandırmak son derece verimli bir tasarım kalıbıdır.

5. Elde Edilen Sonuçlar

Bu yöntemle bilgi kaybı (recall) %96 oranında korunurken, bağlamın %68'i elendi ve sorgu maliyeti üçte bir oranında azaldı.

  • Yazılım ve Öğrenme Çıkarımı: Mühendislikte mükemmeliyetçilik yerine optimum ticaret (trade-off) noktalarını belirlemek önemlidir. Çok küçük bir başarı kaybı karşılığında devasa kaynak tasarrufu sağlamak başarılı bir sistem tasarımıdır.

6. Gecikme Süresi (Latency) Maliyeti

Sürece eklenen bu küçük LLM katmanı sorgu başına yaklaşık 0.7 saniye ek gecikme getiriyor.

  • Yazılım ve Öğrenme Çıkarımı: Tek aşamalı kullanıcı arayüzlerinde bu gecikme hissedilebilir ancak çoklu araç kullanan otonom ajanlarda (AI Agents) bu ek süre marjinal kalır. Mimaride her optimizasyonun bir bedeli olduğunu bilerek karar vermeliyiz.

7. Bu Yöntem Nerede Kullanılmalı?

Özellikle çoklu araç çağrısı yapan ve bağlamı hızla şişen yapay zekâ ajanlarında bu mimari can kurtarıcıdır.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://www.kapa.ai/blog/how-we-prune-rag-context)

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →