LLM·3 dk okuma·

Apple Silicon İçin Paralel Kısıtlı Kod Çözme: Qwen-2.5-1B-RLCD ile Hızlı ve Yapılandırılmış JSON Üretimi

Paylaş
LLMEdumints Blog

MLX ekosistemi üzerinde geliştirilen harshatheg/Qwen-2.5-1B-RLCD, Apple Silicon donanımlarında yapılandırılmış bilgi çıkarımı, karar yönlendirme ve kategorik sınıflandırma işlemleri için tasarlanmış yüksek verimli bir çıkarım (inference) motorudur. Geleneksel dil modellerinin aksine, çok alanlı JSON şemalarını sıralı token üretimiyle oluşturmak yerine eşzamanlı olarak değerlendiren Paralel Kısıtlı Kod Çözme (Parallel Constrained Decoding) mimarisini kullanır. Apple Silicon M4 Max çipinde yapılan testlerde, %100 şema geçerliliği ve kalibre edilmiş alan düzeyinde güven skorları sunarken gecikme sürelerinde 5.6x ile 7.0x arasında azalma sağlamıştır.

Performans Kıyaslamaları (Apple Silicon M4 Max & macOS Sequoia)

mlx-community/Qwen2.5-1.5B-Instruct-4bit modeliyle gerçekleştirilen kıyaslama senaryoları şu sonuçları vermiştir:

  • Fintech Sahtekarlık Yönlendirmesi (4 alan): Standart otoregresif taban çizgisi 420 ms (120 tok/s) iken paralel kısıtlı çözüm 75 ms sürerek 5.6x hızlanma ve %100 garantili sözdizimi doğruluğu sağlamıştır.
  • Kod Güvenliği Denetimi (4 alan): 380 ms'lik (125 tok/s) işlem süresi 68 ms'ye düşerek 5.6x hızlanma elde edilmiştir.
  • Yüksek Kardinaliteli Tarife (1 alan, 255 seçenek): 500 ms (118 tok/s) süren karmaşık seçim, 89 ms'ye inerek 5.6x hızlanma sunmuştur.
  • Kurumsal Destek Triyajı (28 alan): 1.900 ms'den (130 tok/s) 270 ms'ye gerileyerek 7.0x hızlanma ile en yüksek verimlilik artışını kaydetmiştir.

Neden Paralel Kısıtlı Kod Çözme?

Otoregresif Yapılandırılmış Üretim Problemi

Standart JSON modu veya gramer güdümlü örnekleme, sıralı token üretim döngüsüne dayanır. Bu yöntem her alan ve karakter için 150 ila 500 ardışık ileri geçiş (forward pass) gerektirir. Her bir token, ayrı bir GPU/NPU döngüsü ve sıralı bellek bant genişliği maliyeti doğurur. Toplam gecikme, çıktı uzunluğuyla doğrusal olarak ölçeklenir ($T_{\text{autoregressive}} = \sum_{k=1}^{K} t_{\text{step}}(k)$). Ayrıca süreç; sözdizimi bozulması, alan atlama ve hayali (hallucinated) anahtarlar üretme risklerine açıktır.

Çözüm: KV-Önbellek Yayını ile Paralel Değerlendirme

Kategorik sınıflandırma ve yapılandırılmış veri çıkarımında değerler genellikle boole veya enum gibi sınırlı aday kümelerine aittir. Sistem bu durumu 6 temel mekanizmayla çözer:

  • Tek Seferlik Yayın Ön Doldurma (Single Broadcast Prefill): Bağlam belgesi ve anlamsal şema tanımları MLX Anahtar-Değer (KV) önbelleğine tek seferde işlenir.
  • KV-Önbellek Yayını (KV-Cache Broadcasting): Tekil KV-önbellek durumu, paralel biçimde tüm şema alanlarına dağıtılır.
  • Alt Kelime Dağarcığı Logit Dilimleme (Sub-Vocabulary Logit Slicing): Her alan için yalnızca geçerli şema seçeneklerine ait token kimlikleri değerlendirilir, sözlüğün geri kalanı maskelenir.
  • Kalibre Edilmiş Softmax Olasılıkları (Calibrated Softmax Probabilities): Geçerli aday dilimi üzerinde doğrudan normalize olasılıklar hesaplanır ($P(c_i) = \frac{\exp(z_i / T)}{\sum_{j=1}^{C} \exp(z_j / T)}$).
  • Token Ağacı Anlam Belirleme (Token Tree Disambiguation): Çoklu token öneklerini paylaşan seçeneklerde, motor sıfır bellek yeniden tahsisi ile dilimlenmiş önbellek durumlarını çalıştırır.
  • Programatik Birleştirme (Programmatic Assembly): Çıktı JSON doğrudan programatik olarak inşa edilir.

Geliştiriciler İçin Pratik Çıkarımlar

Uç cihazlarda (edge) ve Apple Silicon mimarisinde çalışan yerel yapay zekâ sistemleri için bu yaklaşım; API maliyetlerini düşürürken deterministik ve hatasız JSON çıktısı almayı sağlar. Karar ağaçları ve triyaj süreçlerinde gecikmeyi milisaniyeler seviyesine indirerek mikroservis mimarilerine doğrudan entegre edilebilir.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Structured Output ve JSON Modu modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →