Yazılım·3 dk okuma·

GLM-5.2 Modelini Yerel Bilgisayarda Çalıştırma Rehberi

Paylaş
YazılımEdumints Blog

GLM-5.2, Z.ai tarafından geliştirilen ve özellikle uzun bağlamlı kodlama, karmaşık mantık yürütme ile otonom ajan görevlerinde üstün SOTA performansı sunan yeni bir açık kaynaklı yapay zeka modelidir. 744 milyar parametreye, 40 milyar aktif parametreye ve 1 milyonluk devasa bağlam penceresine sahip olan bu modeli, Unsloth’un dinamik GGUF kuantizasyon teknolojisi sayesinde yerel donanımlarınızda çalıştırmanız artık mümkündür.

## Donanım Gereksinimleri ve Kuantizasyon Analizi

Modelin çalışması için gereken bellek miktarı, seçtiğiniz sıkıştırma (kuantizasyon) seviyesine göre büyük ölçüde değişir:

  • 1-bit (UD-IQ1_S): 223 GB bellek gerektirir. Boyut %86 oranında küçülürken, doğruluk kaybı sadece %24'tür (%76.2 doğruluk).
  • 2-bit (UD-IQ2_M): 245 GB RAM/VRAM gerektirir. Bu model 256 GB birleşik belleğe sahip bir Mac'te veya 24 GB GPU ve 256 GB RAM barındıran bir sistemde MoE offloading ile rahatlıkla çalıştırılabilir.
  • 4-bit ve Üzeri: Neredeyse kayıpsız bir doğruluk için 372 GB ila 810 GB arasında donanım belleği gerekmektedir. Kuantizasyon işlemi modelin zekasını tamamen yok etmez; sadece alternatif kelimelerin dağılım oranlarını değiştirir.

## Önerilen Ayarlar ve Düşünme (Reasoning) Modları

GLM-5.2, varsayılan olarak akıl yürütme (reasoning) yeteneğiyle gelir ve 3 farklı düşünme moduna (Düşünmesiz, High ve Max) sahiptir. Karmaşık kodlama projelerinde "Max Thinking" modu tercih edilmelidir. Genel görevler için temperature: 1.0 ve top_p: 0.95 ayarları önerilirken, düşünme modunu kapatmak veya özelleştirmek için --chat-template-kwargs parametreleri kullanılır.

## Unsloth Studio ile Yerel Kurulum

Unsloth Studio, yerel yapay zeka modellerini çalıştırmak için geliştirilmiş açık kaynaklı ve kullanımı son derece kolay bir web arayüzüdür.

  • 1. Adım (Kurulum): MacOS, Linux veya WSL üzerinde terminalde curl -fsSL https://unsloth.ai/install.sh | sh komutuyla hızlıca kurulum yapın.
  • 2. Adım (Başlatma): unsloth studio -H 0.0.0.0 -p 8888 komutuyla stüdyoyu ayağa kaldırıp tarayıcınızdan ilgili adrese gidin.
  • 3. Adım (Çalıştırma): Studio Chat sekmesinde GLM-5.2 araması yapıp donanımınıza uygun kuantizasyonu seçerek sohbeti başlatın.

## llama.cpp ile Manuel Kurulum

Daha teknik entegrasyonlar ve hızlı çıkarım için llama.cpp kullanılabilir:

  • 1. Adım: Güncel llama.cpp reposunu GitHub'dan klonlayarak sisteminize uygun şekilde derleyin.
  • 2. Adım: llama-cli aracı yardımıyla unsloth/GLM-5.2-GGUF altındaki modeli hedefleyin.
  • 3. Adım: Daha kararlı ve hızlı bir indirme süreci için Hugging Face CLI komutlarından faydalanın.
  • 4. Adım: Terminal üzerinden indirilen .gguf dosyalarını conversation modunda çalışacak şekilde başlatın.
  • 5. Adım: Modelin lokal kod yazma yeteneğini (örneğin basit bir HTML Flappy Bird oyunu yazdırarak) test edin.

## Yazılım Geliştiriciler İçin Pratik Çıkarımlar

Bu yerel kurulum rehberi, geliştiricilere hassas proje kodlarını veya ticari verileri üçüncü taraf API servislerine göndermeden, tamamen kendi güvenli ortamlarında işleme gücü verir. Dinamik kuantizasyon analizi, donanım tasarrufu yaparken modelin mantıksal kapasitesinin korunduğunu kanıtlamaktadır. Geliştiriciler, kaynak tüketimini optimize etmek için basit görevlerde düşünme modunu kapatıp, derin algoritmik işlerde ise "Max Thinking" seviyesini açarak dinamik maliyet ve performans dengesi sağlayabilirler.

Orijinal makaleye buradan ulaşabilirsiniz.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →