Edge0-35B-A3B-preview: Uç Cihazlar İçin Optimize Edilmiş MoE Mimarisi ve Yerel Araç Çağırma
İçindekiler
Hugging Face platformunda öne çıkan Edge0/Edge0-35B-A3B-preview, toplamda 35 milyar parametre barındıran ancak her çıkarım adımında yalnızca yaklaşık 3 milyar parametreyi aktif kılan (A3B) yenilikçi bir Uzmanlar Karışımı (MoE) mimarisidir. Topluluk tarafından 1.596 indirme ve 324 beğeniye ulaşan bu ön izleme modeli, özellikle kısıtlı kaynaklara sahip uç cihazlarda yüksek kapasiteli akıl yürütme sağlamak üzere tasarlanmıştır.
Temel Özellikler ve Dağıtım Optimizasyonları
Modelin etiketlerinde yer alan bileşenler, yerel çıkarım ve donanım optimizasyonuna yönelik kapsamlı bir mimari yaklaşımı temsil etmektedir:
- mlx: Apple Silicon donanımlarının birleşik bellek mimarisinden tam verim alarak yerel ortamda yüksek hızlı tensör işlemleri ve donanım hızlandırmalı çıkarım sunar.
- safetensors: Model ağırlıklarının bellek kopyalamaya gerek kalmadan doğrudan bellek haritalama (mmap) yöntemiyle güvenli ve hızlı yüklenmesini sağlar.
- qwen3_5_moe: Modelin dil kavrama, mantıksal çıkarım ve çok dilli yeteneklerini borçlu olduğu güncel Qwen 3.5 MoE omurgasını temsil eder.
- moe: Büyük parametre havuzunun yalnızca sorguyla ilgili uzman katmanlarını tetikleyerek işlem gücü maliyetini ve yanıt gecikmesini minimize eder.
- edge-inference: Bulut altyapısına bağımlılığı ortadan kaldırarak kullanıcı cihazlarında tamamen çevrimdışı ve düşük gecikmeli çalışma imkânı tanır.
- prerouter: Sorgu akışında hangi uzmanların etkinleşeceğini önceden tahmin edip yönlendirerek yönlendirme gecikmelerini düşürür.
- lora: Düşük bellek tüketimiyle alana özgü görevler için parametre verimli ince ayar (PEFT) süreçlerini kolaylaştırır.
- ssd-offload: Bellek yetersizliği durumunda uzman ağırlıklarını yüksek hızlı NVMe/SSD sürücülerinden dinamik olarak okuyarak kısıtlı RAM kapasitesinde büyük modelleri çalıştırır.
Token Mimarisi ve Gelişmiş Şablon Yetenekleri
Model yapılandırmasında sonlandırma belirteci olarak pad_token: |endoftext|> kullanılırken, bilinmeyen belirteç tanımı unk_token: null olarak belirlenmiştir. Jinja tabanlı sohbet şablonu (chat_template_jinja) geliştiricilere iki temel işlevsellik sunar:
- Çok Modlu (Multimodal) Veri Formatlama: Görseller ve videolar sistem mesajları dışında tutularak özel ped belirteçleriyle (
|vision_start|>,|image_pad|>,|video_pad|>,|vision_end|>) indekslenir ve ardışık kimliklerle (Picture X:,Video X:) şablona eklenir. - Yapılandırılmış Araç Çağırma (Tool Calling): Sistem istemine JSON olarak iletilen araçlar, model tarafından katı XML etiketleri (
<tool_call>,<function>,<parameter>) kullanılarak çağrılır. Fonksiyon çağrısı öncesinde doğal dilde akıl yürütme serbest bırakılarak doğruluğu artırılırken,multi_step_toolbayrağı ile uç birimlerde çok adımlı ajan iş akışları güvenle yürütülür.
Özellikle bulut maliyetlerini düşürmek ve hassas verileri dış sunuculara aktarmadan kullanıcı cihazında yerel olarak işlemek isteyen yazılım ekipleri için Edge0 mimarisi, hem donanım verimliliği hem de otonom ajan kabiliyetleri açısından güçlü ve pratik bir referans noktası oluşturmaktadır.
Orijinal makaleye buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Edge Runtime ve Production Optimizasyonu modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →