---
title: "Ternary LLM'lerde 1.58-Bit Sınırını Aşmak: Dağılıma Uyarlanabilir BITCOS Mimarisi"
url: https://blog.edumints.com/ternary-llmlerde-158-bit-sinirini-asmak-dagilima-uyarlanabil-okle4tnd
category: "LLM"
date: 2026-09-17T07:12:21.334Z
publisher: Edumints Blog
lang: tr-TR
source_name: "Hacker News"
source_url: https://arxiv.org/abs/2609.16338
---

# Ternary LLM'lerde 1.58-Bit Sınırını Aşmak: Dağılıma Uyarlanabilir BITCOS Mimarisi

Büyük Dil Modellerinde (LLM) bellek bant genişliği ve depolama darboğazlarını aşmak amacıyla geliştirilen ternary (üçlü) modeller, ağırlıkları $\{-1, 0, +1\}$ kümesinde tutarak hesaplama verimliliğini üst seviyeye taşır. Klasik yaklaşımlar bilgi teorisindeki teorik alt sınırı referans alırken, yeni araştırmalar model ağırlıklarının gerçek dağılım karakteristiğinden yararlanarak bu sınırın da altına inilebileceğini kanıtlamaktadır.

## Makalenin Temel Bulguları ve Mimarisi

- **Ternary Temsil ve Mevcut Paketleme Sınırları:** Üç sembollü $\{-1, 0, +1\}$ ağırlık yapısı, bilgi teorisine göre ağırlık başına teorik olarak $\log_2 3 \approx 1.585$ bit depolama maliyeti gerektirir. Endüstride yaygın olan 5-trit paketleme (beş ternary ağırlığın bir bayta sığdırılması) yöntemi ise ikinin kuvveti olan grup boyutları nedeniyle pratikte $1.625$ bite yuvarlanır ve her üç sembolün eşit olasılıkla dağıldığını varsayar.
- **Ağırlık Dağılımı ve Sıfır Yoğunluğu Keşfi:** İncelenen 29 farklı ternary LLM modelinde sembollerin eşit dağılmadığı, sıfır değerinin toplam ağırlıkların %51.5'ine kadarını oluşturduğu tespit edilmiştir.
- **Dağılıma Uyarlanabilir BITCOS Düzeni:** Bu dağılım asimetrisini avantaja dönüştüren BITCOS mimarisi; yoğun bir varlık bit eşlemi (dense presence bitmap) ve sıkıştırılmış bir işaret vektöründen (compacted sign vector) oluşur. Modeldeki sıfır yoğunluğu $z$ olduğunda, ağırlık başına bellek maliyeti $2 - z$ bit formülüyle hesaplanır.
- **1.58-Bit Barajının Aşılması:** BITCOS, test edilen 29 modelin 26'sında geleneksel 5-trit paketlemeden daha kompakt depolama sağlamış; en seyrek modelde ağırlık başına $1.485$ bite kadar gerileyerek 1.585 bitlik teorik eşiğin altına inmiştir.
- **Donanım Düzeyinde Hızlı Çözme (Unpacking):** Format, modern işlemci mimarilerinde yüksek verimle açılacak biçimde geliştirilmiştir. AVX-512, AVX2 ve Intel Xe2 GPU'ları için optimize edilen vektörel açma dizilimleri, üretim seviyesindeki mevcut ternary matris-vektör çarpım (GEMV) çekirdeklerine kıyasla $1.28\times$'a varan hızlanma sunmuştur.
- **Uçtan Uca Çıkarım (Inference) Kazanımları:** İstemci ve sunucu işlemcileri ile entegre ve harici Intel Xe2 GPU'larını kapsayan 5 farklı donanım platformunda yapılan uçtan uca testlerde; token üretim (decode) verimliliği CPU'larda $1.18\times$, GPU'larda ise $1.27\times$ seviyesine kadar yükselmiştir.

## Yazılım Geliştiriciler İçin Pratik Çıkarımlar

- **Veri Dağılımına Duyarlı Veri Yapıları Tasarlamak:** Statik paketleme yerine verinin içsel seyreklik (sparsity) oranını kullanan çift bileşenli mimariler (bitmap + kompakt veri), bellek transfer maliyetini doğrudan düşürür.
- **Bellek Bant Genişliği ve Decode Optimizasyonu:** LLM çıkarım süreçlerinde token üretimi (decode aşaması) bellek bant genişliğine bağımlıdır (memory-bound). Ağırlık boyutunun küçültülmesi doğrudan gecikmeyi azaltır ve işlem hacmini artırır.
- **SIMD Vektörizasyonu ve Çözme Maliyeti Dengesi:** Sıkıştırma algoritmaları geliştirilirken AVX veya GPU donanım komut setleriyle uyum gözetilmeli; sıkıştırmadan elde edilen bellek kazancı, açma (unpacking) döngülerinin getireceği işlemci yüküyle dengelenmelidir.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://arxiv.org/abs/2609.16338)

---

Bu konuyu derinlemesine öğrenmek isterseniz: [Ölçeklendirme ve Optimizasyon](https://edumints.com/kesfet/embedding-ve-reranking-modelleri-productionda-depl-blu6) modülüne göz atın.

---

**Kaynak:** [Hacker News](https://arxiv.org/abs/2609.16338)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/ternary-llmlerde-158-bit-sinirini-asmak-dagilima-uyarlanabil-okle4tnd
