LLM·2 dk okuma·

PrismML'in Minik LLM Devrimi: Uç Cihazlarda Güçlü Akıl Yürütme Modelleri

Paylaş
LLMEdumints Blog

Yapay zeka araştırma laboratuvarı PrismML, yüksek performanslı ve akıl yürütebilen büyük dil modellerinin (LLM) devasa veri merkezlerine ve sunuculara bağımlı kalmak zorunda olmadığını kanıtlamayı hedefliyor. Caltech kökenli girişim, topladığı 22.25 milyon dolarlık tohum yatırımı ve güçlü teknik kadrosuyla sektörün dinamiklerini değiştirmeye aday. Girişimin temel tezi net: Yetenekli akıl yürütme modelleri kişisel bilgisayarlara ve akıllı telefonlara sığabilecek kadar küçültülebilir. Hatta şirketin Apple ile temas halinde olduğu söylentileri teknoloji dünyasında şimdiden geniş yankı buluyor.

Bonsai 2 27B: Bellekte 10 Kat Küçülme ve Sıfıra Yakın Kayıp

PrismML, Alibaba'nın açık kaynaklı popüler modeli Qwen3.8 27B'yi sıkıştırarak geliştirdiği yeni nesil Bonsai 2 27B modelini duyurdu. Orijinal modele kıyasla bellekte 9 ila 10 kat azalma sağlayan bu teknoloji, model boyutunu yalnızca 5.9 GB seviyesine çekiyor. Bu kompakt boyut, modelin bağımsız bir PC'de veya üst segment bir akıllı telefonda yerel olarak çalıştırılabilmesini mümkün kılıyor.

Girişimin sunduğu teknolojik atılımlar ve ekosistemdeki konumu şu temel noktalara dayanıyor:

  • Seçkin Mühendislik Kadrosu ve Güçlü Ekosistem: Caltech profesörü ve model sıkıştırma uzmanı Babak Hassibi liderliğinde kurulan girişim; Databricks kurucularından ve Berkeley Sky Computing Lab yöneticisi Ion Stoica'nın danışmanlığında ilerliyor. Girişim, Khosla Ventures, Cerberus Capital ve Caltech tarafından fonlanıyor.
  • Yüksek Benchmark Paritesi: Sektörde Multiverse Computing gibi rakipler bulunsa da PrismML, sıkıştırmada neredeyse hiç performans kaybetmediğini belirtiyor. Bonsai 2, Qwen'in kümülatif benchmark skorlarının %98'ini karşılıyor. Mart ayında yayımlanan ilk Bonsai (%95 parite) 11 milyondan fazla, daha küçük varyantlar ise 2.6 milyon kez indirilerek başarısını kanıtladı.
  • Ternary (Üçlü) Ağırlık Mimarisi: Geleneksel modellerde ağırlık başına 16-bit veri kullanılırken, PrismML bu ağırlıkları basitleştiren "ternary" ağırlık yaklaşımıyla bellek ayak izini radikal biçimde küçültüyor.

Yazılım Geliştiriciler İçin Pratik Çıkarımlar ve Öğrenme Notları

Bu teknolojik gelişme, modern yapay zeka yazılım geliştirme pratikleri açısından önemli kazanımlar sunuyor:

  • Edge Runtime ve Gizlilik Odaklı Dağıtım: Akıl yürütme modellerinin 5.9 GB seviyesine inmesi, bulut bağımlılığını, API maliyetlerini ve ağ gecikmelerini ortadan kaldırıyor. Uç cihazlarda doğrudan çalışan yerel yapay zeka sistemleri geliştirmek artık erişilebilir hale geliyor.
  • Akademik Skorlar ve Gerçek Dünya Dengesi: Hassibi'nin ifade ettiği gibi, sıkıştırma kaynaklı %2'lik başarım kaybı pratik senaryolarda göz ardı edilebilir düzeydedir. Temel modellerin ham hali de kusursuz olmadığından, sentetik testler yerine sahadaki işlevselliğe odaklanmak gerekir.
  • Çalışma İskeletinin (Harness) Kritik Rolü: Bir modelin uç ortamdaki doğruluğu yalnızca parametrelerine değil, içinde koştuğu yazılım iskeletine, prompt orkestrasyonuna ve bağlam yönetimine doğrudan bağlıdır.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Edge Runtime ve Production Optimizasyonu modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →