Yazılım·3 dk okuma·

Transformers Artık llama.cpp Kuantizasyonlarını (GGUF) Destekliyor

Paylaş
YazılımEdumints Blog

Hugging Face, transformers kütüphanesine GGUF modellerini doğrudan ve yüksek verimle çalıştırma desteği eklediğini duyurdu. Bu yenilik sayesinde geliştiriciler, dizüstü bilgisayarlarının bellek kapasitesine göre optimize edilmiş kontrol noktalarını (checkpoints), alışık oldukları transformers API'leri ve from_pretrained metodu aracılığıyla kolayca yerel ortamlarında çalıştırabiliyor.

Yerel Yapay Zeka ve llama.cpp Ekosistemi

Yapay zeka modellerini kişisel bilgisayarlarda koşturmak, llama.cpp projesinin sağladığı optimize çıkarım motoru sayesinde pratik bir standarda dönüştü. Ollama, LM Studio ve Jan gibi popüler yerel araçlara altyapı sağlayan bu teknoloji, MLX gibi kütüphanelerle birlikte yerel çıkarımı günlük yazılım geliştirme süreçlerinin bir parçası haline getirdi. Nitekim MacBook Pro üzerinde llama.cpp ile çalışan 27B parametreli açık kaynaklı modeller, kodlama asistanı olarak kapalı kaynaklı büyük bulut modellerine yakın bir başarım sergileyebiliyor.

llama.cpp ekibince geliştirilen GGUF formatı; Unsloth, LM Studio Community ve bartowski gibi yayıncıların sunduğu hazır modellerle milyonlarca indirmeye ulaştı. Hugging Face, bu uyumluluğu sağlarken performansı llama.cpp seviyesinde tutmak adına kernels kütüphanesi üzerinden doğrudan ggml çekirdeklerini kullanıyor ve generate çağrılarındaki ek yükü (overhead) azaltıyor. İlk aşamada Apple Silicon donanımları ve Qwen3.5 mimarisine odaklanılıyor.

GGUF Dosya Formatı Nedir?

GGUF; model ağırlıklarını, tokenizer yapılandırmasını ve isteğe bağlı sohbet şablonunu tek bir dosyada birleştiren bir formattır. Hassasiyetten kontrollü şekilde ödün vererek bellek ayak izini küçültür. Örneğin Q4_K_M varyantı, kritik tensörleri yüksek hassasiyette tutarken ağırlıkların büyük bölümünü 4-bite indirir.

Unsloth'un Qwen3.5-4B modeli üzerindeki kuantizasyon boyutları ve ödünleşimler:

GGUF VaryantıDosya BoyutuÖdünleşim (Tradeoff)
BF168.42 GBKuantize edilmemiş referans model
Q6_K3.53 GBKüçük varyantlara kıyasla daha yüksek hassasiyet
Q5_K_M3.14 GBBoyut ve hassasiyet arasında dengeli bir orta yol
Q4_K_M2.74 GBYerel çıkarım için pratik bir başlangıç noktası

Yerel geliştirmede başlangıç için Q4_K_M önerilmektedir; donanım belleği elveriyorsa Q5_K_M veya Q6_K tercih edilebilir. Daha agresif kuantizasyonlar büyük modelleri kısıtlı belleğe sığdırmayı sağlasa da kalite kaybı modele ve göreve göre değiştiğinden, çıkarım başarımı projenin gerçek senaryolarında test edilmelidir.

transformers ile GGUF Yükleme

Geliştiricilerin bu entegrasyonu kullanmaya başlaması için gerekenler:

  • Bir Apple Silicon Mac.
  • Yayınlanan ggml-quantization kernel derlemeleriyle uyumlu bir PyTorch sürümü (genellikle en son iki sürüm).
  • transformers'ın en güncel sürümü ile uyumlu kernels paketi (pip install -U "git+https://github.com/huggingface/transformers.git" kernels).

Modeli yüklemek için Hugging Face Hub'daki model kimliği (model_id) ve dosya adı gguf_file parametresi olarak aktarılır. Bu entegrasyon, harici API maliyetlerini ortadan kaldırarak Python ekosisteminde güvenli, çevrimdışı ve hızlı prototipleme imkânı sunar.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Ölçeklendirme ve Optimizasyon modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →