---
title: "Transformers Artık llama.cpp Kuantizasyonlarını (GGUF) Destekliyor"
url: https://blog.edumints.com/transformers-artik-llamacpp-kuantizasyonlarini-gguf-destekli-2m2hhljv
category: "Yazılım"
date: 2026-09-22T15:09:59.952Z
publisher: Edumints Blog
lang: tr-TR
source_name: "hfblog"
source_url: https://huggingface.co/blog/transformers-llama-cpp-quants
---

# Transformers Artık llama.cpp Kuantizasyonlarını (GGUF) Destekliyor

Hugging Face, `transformers` kütüphanesine GGUF modellerini doğrudan ve yüksek verimle çalıştırma desteği eklediğini duyurdu. Bu yenilik sayesinde geliştiriciler, dizüstü bilgisayarlarının bellek kapasitesine göre optimize edilmiş kontrol noktalarını (checkpoints), alışık oldukları `transformers` API'leri ve `from_pretrained` metodu aracılığıyla kolayca yerel ortamlarında çalıştırabiliyor.

## Yerel Yapay Zeka ve llama.cpp Ekosistemi

Yapay zeka modellerini kişisel bilgisayarlarda koşturmak, `llama.cpp` projesinin sağladığı optimize çıkarım motoru sayesinde pratik bir standarda dönüştü. Ollama, LM Studio ve Jan gibi popüler yerel araçlara altyapı sağlayan bu teknoloji, MLX gibi kütüphanelerle birlikte yerel çıkarımı günlük yazılım geliştirme süreçlerinin bir parçası haline getirdi. Nitekim MacBook Pro üzerinde `llama.cpp` ile çalışan 27B parametreli açık kaynaklı modeller, kodlama asistanı olarak kapalı kaynaklı büyük bulut modellerine yakın bir başarım sergileyebiliyor.

`llama.cpp` ekibince geliştirilen GGUF formatı; Unsloth, LM Studio Community ve bartowski gibi yayıncıların sunduğu hazır modellerle milyonlarca indirmeye ulaştı. Hugging Face, bu uyumluluğu sağlarken performansı `llama.cpp` seviyesinde tutmak adına `kernels` kütüphanesi üzerinden doğrudan `ggml` çekirdeklerini kullanıyor ve `generate` çağrılarındaki ek yükü (overhead) azaltıyor. İlk aşamada Apple Silicon donanımları ve Qwen3.5 mimarisine odaklanılıyor.

## GGUF Dosya Formatı Nedir?

GGUF; model ağırlıklarını, tokenizer yapılandırmasını ve isteğe bağlı sohbet şablonunu tek bir dosyada birleştiren bir formattır. Hassasiyetten kontrollü şekilde ödün vererek bellek ayak izini küçültür. Örneğin `Q4_K_M` varyantı, kritik tensörleri yüksek hassasiyette tutarken ağırlıkların büyük bölümünü 4-bite indirir.

Unsloth'un Qwen3.5-4B modeli üzerindeki kuantizasyon boyutları ve ödünleşimler:

| GGUF Varyantı | Dosya Boyutu | Ödünleşim (Tradeoff) |
| :--- | :--- | :--- |
| **BF16** | 8.42 GB | Kuantize edilmemiş referans model |
| **Q6_K** | 3.53 GB | Küçük varyantlara kıyasla daha yüksek hassasiyet |
| **Q5_K_M** | 3.14 GB | Boyut ve hassasiyet arasında dengeli bir orta yol |
| **Q4_K_M** | 2.74 GB | Yerel çıkarım için pratik bir başlangıç noktası |

Yerel geliştirmede başlangıç için `Q4_K_M` önerilmektedir; donanım belleği elveriyorsa `Q5_K_M` veya `Q6_K` tercih edilebilir. Daha agresif kuantizasyonlar büyük modelleri kısıtlı belleğe sığdırmayı sağlasa da kalite kaybı modele ve göreve göre değiştiğinden, çıkarım başarımı projenin gerçek senaryolarında test edilmelidir.

## transformers ile GGUF Yükleme

Geliştiricilerin bu entegrasyonu kullanmaya başlaması için gerekenler:
- Bir **Apple Silicon Mac**.
- Yayınlanan `ggml-quantization` kernel derlemeleriyle uyumlu bir **PyTorch sürümü** (genellikle en son iki sürüm).
- `transformers`'ın en güncel sürümü ile uyumlu **kernels** paketi (`pip install -U "git+https://github.com/huggingface/transformers.git" kernels`).

Modeli yüklemek için Hugging Face Hub'daki model kimliği (`model_id`) ve dosya adı `gguf_file` parametresi olarak aktarılır. Bu entegrasyon, harici API maliyetlerini ortadan kaldırarak Python ekosisteminde güvenli, çevrimdışı ve hızlı prototipleme imkânı sunar.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/blog/transformers-llama-cpp-quants)

---

Bu konuyu derinlemesine öğrenmek isterseniz: [Ölçeklendirme ve Optimizasyon](https://edumints.com/kesfet/embedding-ve-reranking-modelleri-productionda-depl-blu6) modülüne göz atın.

---

**Kaynak:** [hfblog](https://huggingface.co/blog/transformers-llama-cpp-quants)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/transformers-artik-llamacpp-kuantizasyonlarini-gguf-destekli-2m2hhljv
