Yapay Zeka·2 dk okuma·

Prism-ML Ternary-Bonsai-2-27B-GGUF: Uç Cihazlarda 2-Bit Çıkarım ve Akıl Yürütme Mimarisi

Paylaş
Yapay ZekaEdumints Blog

Model Genel Bakışı ve Temel Metrikler

Hugging Face platformunda öne çıkan prism-ml/Ternary-Bonsai-2-27B-gguf, büyük dil modellerini uç donanımlarda verimli çalıştırmayı amaçlayan üçlü (ternary) kuantizasyon teknolojisine dayalı bir modeldir. Model kartında yer alan resmi metrikler ve ekosistem etiketleri şu şekildedir:

  • Model Adı: prism-ml/Ternary-Bonsai-2-27B-gguf
  • İndirme ve Beğeni İstatistikleri: Model 0 indirme sayısına sahip olmasına karşın, kısa sürede topluluktan 487 beğeni alarak dikkat çeken bir popülariteye ulaşmıştır.
  • Etiketler ve Donanım Desteği: llama.cpp, gguf, ternary, 2-bit, llama-cpp, cuda, metal, on-device.

Çekirdek Yapı ve Sohbet Şablonu Kuralları

Modelin Jinja tabanlı sohbet şablonu incelendiğinde, çıkarım sürecini denetleyen ve katı doğrulama kuralları içeren üç ana bileşen öne çıkmaktadır:

  • Çok Modlu Veri Doğrulama ve İstisnalar: Şablon; metin, görsel ve video ögelerini ayrı ayrı işler. Sistem mesajları içine video eklenmesini kesin bir kural hatası (raise_exception) ile engeller. Görseller ve videolar için |vision_start|>, |image_pad|>, |video_pad|> ve |vision_end|> etiketlerini kullanarak deterministik bir belirteç akışı oluşturur.
  • Yapılandırılabilir Akıl Yürütme Düzeyi (Reasoning Effort): Modelin düşünme modu aktif olduğunda xhigh, medium ve low olmak üzere üç farklı akıl yürütme derinliği tanımlanabilmektedir. xhigh seviyesinde modelden varsayımları doğrulaması, alternatifleri değerlendirmesi ve doğruluğa öncelik vermesi istenirken; low seviyesinde düşünme sürecinin kısa tutulması ve gereksiz detaylara girmeden doğrudan sonuca gidilmesi talimatı verilir.
  • Katı Biçimli Araç ve Fonksiyon Çağrısı (Tool Calling): Sistem iletisinde JSON formatında sağlanan araçlar, model tarafından özel XML benzeri etiketlerle (<tool_call>, <function>, <parameter>) çağrılır. Şablon metninde tanımlanan dört temel kural şunlardır:
    • Fonksiyon çağrıları belirlenen XML hiyerarşisine harfiyen uymalıdır,
    • Gerekli tüm parametreler eksiksiz belirtilmelidir,
    • İsteğe bağlı akıl yürütme yalnızca fonksiyon çağrısından önce yapılmalı, çağrı sonrasına metin bırakılmamalıdır,
    • Çağrılabilecek uygun bir araç bulunmadığında model mevcut bilgisiyle normal yanıta dönmelidir.

Yazılım Geliştirme ve Pratik Çıkarımlar

Yazılım geliştiriciler ve yapay zeka mühendisleri açısından bu model mimarisinin sağladığı pratik çıkarımlar şunlardır:

  • Uç Cihazlarda Yüksek Verimlilik: 27 milyar parametrelik büyük bir modelin 2-bit ternary formatında GGUF olarak paketlenmesi; CUDA ve Apple Silicon Metal hızlandırmasıyla harici sunucu maliyeti olmadan cihaz üzerinde (on-device) çalışmasını sağlar.
  • Güvenilir Ajan Entegrasyonu: Katı şablon kuralları ve şema zorunluluğu, otonom ajan sistemlerinde yapılandırılmış çıktıların (structured outputs) bozulmasını ve fonksiyon parametresi hatalarını engeller.
  • Mühendislik Esnekliği: Akıl yürütme eforunun programatik olarak ayarlanabilmesi, gerçek zamanlı yanıt gerektiren uygulamalar ile derin analiz gerektiren görevler arasında kaynak optimizasyonu yapılmasına imkan tanır.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Edge Runtime ve Production Optimizasyonu modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →