Heterojen Çok-Ajanlı LLM Sistemlerinde Prefill Gerektirmeyen Aileler Arası KV Cache Aktarımı
İçindekiler
Giriş ve Karşılaşılan Temel Zorluklar
Modern çok-ajanlı (multi-agent) büyük dil modeli (LLM) sistemleri, karmaşık problem çözme süreçlerinde görev dağılımı yapmak amacıyla farklı uzmanlıklara sahip heterojen modelleri giderek daha yoğun biçimde bir araya getirmektedir. Ancak bu sistemlerde ajanlar arası iletişim geleneksel metin formatında yürütüldüğünde, gönderici ajanın daha önce işlediği ortak bağlamın alıcı ajan tarafından baştan itibaren yeniden işlenmesi (prefill aşaması) zorunlu hale gelir. Bu durum hem ciddi bir hesaplama ve enerji israfına yol açmakta hem de ilk belirteç gecikmesini (Time-to-First-Token - TTFT) kritik ölçüde artırmaktadır.
Gönderici ajanın hesapladığı anahtar-değer (KV) önbelleğini alıcı ajanda doğrudan yeniden kullanmak bu gereksiz tekrarı önler. Bununla birlikte, farklı model aileleri arasında ön yüklemesiz (prefill-free) bir aktarım gerçekleştirebilmek için şu üç temel mimari farklılığın aşılması gerekir:
- Belirteçleme (Tokenization) Farklılıkları: Farklı model ailelerinin kendilerine özgü kelime dağarcıkları ve belirteç parçalama algoritmaları kullanması.
- Model Derinliği Farklılıkları: Gönderici ve alıcı modellerin katman sayıları, blok mimarileri ve ara katman derinlikleri arasındaki uyuşmazlıklar.
- KV Temsil Farklılıkları: Farklı mimarilerde üretilen anahtar ve değer vektörlerinin uzamsal dağılım ve geometrik temsil uyumsuzlukları.
Çözüm: HeteroFold Mimarisi
Söz konusu mimari engelleri aşmak amacıyla, hem gönderici hem de alıcı modellerin ağırlıklarını tamamen donduran (frozen) ve alıcı tarafında prefill gereksinimini ortadan kaldıran HeteroFold yöntemi önerilmiştir. HeteroFold, süreci şu üç aşamalı yaklaşımla çözer:
- Model Yapılarını Hizalama: Gönderici ve alıcı modellerin farklı katman derinliklerini ve yapısal parametrelerini birbirine uyumlu hale getirir.
- Önbellek Uzayı Eşleme: Gönderici modelin KV önbellek verilerini alıcı modelin gizli temsil uzayına doğrudan dönüştürerek yansıtır.
- Davranışsal Kalibrasyon: Eşlenen önbelleği kalibre ederek alıcı modelin orijinal çıkarım doğruluğunu ve beklenen davranış biçimini eksiksiz biçimde korur.
Başarım ve Performans Kazanımları
HeteroFold, altı farklı model ailesi aktarım yönünde kapsamlı biçimde test edilmiştir. Yöntem, dört uzun bağlam kıyaslamasının tamamında ve kısa bağlam senaryolarının büyük bölümünde en yüksek önbellek aktarım performansına ulaşmıştır. Çok-ajanlı değerlendirme testlerinde ise standart metin tabanlı iletişimin doğruluk başarımını eksiksiz yakalamıştır:
- Yerel Prefill Kıyaslaması: 32K bağlam uzunluğundaki Llama-3.1-8B modelinden Ministral-3-14B modeline aktarımda, yerel ön yükleme (Native Prefill) yaklaşımına göre 10.7 kat daha hızlı sonuç vermiştir.
- SOTA Yöntem Kıyaslaması: En gelişmiş prefill-free alternatifler olan Dense Latent ve KV Ridge yöntemlerine kıyasla 1.18 ile 1.47 kat arasında hızlanma sağlamaktadır.
Yazılım Geliştiriciler İçin Pratik Çıkarımlar
- Üretim Seviyesinde Optimizasyon: Çok-ajanlı kurumsal hatlarda tekrarlanan prefill yükü ortadan kaldırılarak yüksek GPU bellek verimliliği ve düşük yanıt gecikmesi sağlanabilir.
- Dondurulmuş Model Entegrasyonu: Modelleri yeniden eğitmeden veya ince ayar (fine-tuning) maliyetine girmeden, farklı açık kaynaklı modeller hibrit boru hatlarında yüksek verimle birlikte çalıştırılabilir.
[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.32259)
Bu konuyu derinlemesine öğrenmek isterseniz: Ölçeklendirme ve Optimizasyon modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →