Görsel Modeller Dahil LLM'ler İçin Tek Fonksiyonlu Jev Benzeri Sarmalayıcı
İçindekiler
Giriş: Token Olasılıkları ve Jev Yaklaşımı
Açık kaynak ekosisteminde Jev, OpenJev ve SemIf gibi projeler, büyük dil modellerinden (LLM) hızlı, hafif ve yapılandırılmış kararlar almanın yenilikçi yollarını sergiliyor. Bu mimarilerin merkezinde, OpenAI'ın "logprobs cookbook" rehberinde de yer alan temel bir teknik bulunuyor: modelin token olasılıklarını (logprobs) doğrudan okumak.
Yöntemin Çalışma Mantığı ve Parametreler
Bu yaklaşımda, model uzun paragraflar üretmeye yönlendirilmez. Bunun yerine çoktan seçmeli bir prompt yapısı ve özel üretim parametreleri kullanılır:
- Durum (State): İncelenecek bağlam modele aktarılır (örneğin: "Siparişim hasarlı ulaştı ve iade istiyorum").
- Soru (Question):
[A] faturalama,[B] kargo,[C] iadelergibi seçenekler sunularak modelden yalnızca doğru seçeneğin harfini üretmesi istenir. - Üretim Parametreleri: API çağrısına
{ max_completion_tokens: 1, logprobs: true, top_logprobs: 20 }parametreleri eklenir.
Model tek bir token üretmeye zorlandığı için çıkarım süresi milisaniyelere iner. Yanıt olarak seçilen harfin yanında alternatif token'ların log olasılıkları da elde edilir. Girdi işleme (prefill) süresi bir maliyet oluştursa da, aynı durum için sorulan birden fazla soruda paylaşılan durum öneki KV-cache mekanizması ile önbelleğe alınarak yüksek verim sağlanır.
Görsel Modellere Genişletme
Jev'in standart formatı metin veya JSON durumlarını tanımlarken, bu yapıya bir attachments alanı eklenerek çok modlu (vision) modellere kolayca uyarlanabilir. OpenCV yalnızca web kamerasından görüntü almak amacıyla kullanılır; kareler base64 JPEG formatında modele iletilir. Örnek senaryoda her kare için şu üç soru puanlanır:
- Kişi varlığı: Görünürde bir insan var mı?
- Ortam tespiti: Kamera iç mekanda mı yoksa dış mekanda mı?
- Işık seviyesi: Sahne karanlık mı, loş mu yoksa aydınlık mı?
Performans Karşılaştırması ve Pratik Çıkarımlar
Yapılan testlerde iki farklı çalışma ortamı karşılaştırılmıştır:
- Yerel Model (RTX 3090 üzerinde Gemma 4 12B): Kare başına üç soru ile yaklaşık 1 FPS (saniyede 1 kare) hızına ulaşılmıştır.
- Bulut Modeli (OpenAI gpt-6-luna): Soru ve kare başına ayrı bağlantı kurulması ve ağ gecikmesi optimizasyonlarının yapılmaması sebebiyle yaklaşık 0.2 FPS seviyesinde kalmıştır.
Yazılım Geliştirme Açısından Değerlendirme: Özel bilgisayarlı görü (CV) modelleri şüphesiz kaynak tüketimi ve hız açısından çok daha verimlidir. Ancak bu sarmalayıcının yazılımcılara sağladığı asıl avantaj yüksek esnekliktir. Yeni bir nesne tanıma modeli eğitmek veya karmaşık pipeline'lar yapılandırmak yerine, denetlemek istediğiniz herhangi bir kuralı sadece doğal dille tanımlayarak anında çalışır hale getirebilirsiniz.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Üretim Parametreleri modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →