LLM·2 dk okuma·

NeuralHats: Yerel LLM'ler ve Gemma 4 ile Altı Düşünceli Şapka Metodu

Paylaş
NeuralHats: Yerel LLM'ler ve Gemma 4 ile Altı Düşünceli Şapka Metodu

Ne İnşa Ettim

Karar verme süreçlerinde tıkanıp kalan geliştiriciler için Edward de Bono’nun ünlü Altı Düşünmeli Şapka yöntemini tamamen yerel çalışan yapay zeka ajanlarıyla hayata geçiren NeuralHats uygulamasını tasarladım.

  • Yedi Ajanlı Sistem: Altı farklı düşünce yapısını temsil eden şapka ajanları ve bir sentez raporu yazan kolaylaştırıcı ajan, yerel bilgisayarınızda bir araya gelerek tartışır.
  • Geliştiriciler bu yapay zeka paneline canlı katılarak kendi perspektiflerini de ekleyebilirler.

Demo

Projenin gerçek zamanlı çalışma prensibini ve tarayıcı üzerindeki zengin tartışma arayüzünü incelemek için orijinal makalede yer alan video rehberi izleyebilirsiniz.

Kod ve Mimari

Sistem; FastAPI, React, Vite ve SQLite ile çalışan tamamen yerel ve sunucusuz bir yapıya sahiptir. Yazılım geliştirme ve öğrenme açısından çıkarımlarımız şunlardır:

  • Tek Model, Çoklu Rol (Modelfile): Bellekte yedi farklı model çalıştırmak yerine, Ollama'nın Modelfile yapısıyla tek bir Gemma 4 modeli üzerinde farklı sıcaklık (temperature) ve sistem prompt'ları tanımlanarak kaynak tasarrufu yapılmıştır. Öğrenme çıkarımı: Ajan tabanlı sistemlerde bellek optimizasyonu için Modelfile şablonları kritik bir araçtır.
  • YZ Çıktısı ile Kontrol Akışı: Mavi Şapka'nın çıktı sonuna eklediği CONTINUE veya STOP token'ı, FastAPI tarafında tartışma döngüsünü durdurmak veya devam ettirmek için doğrudan kontrol akış kodu (Control Flow) olarak ayrıştırılır. Pratik çıkarım: LLM çıktılarını yapılandırılmış token'larla sınırlandırarak deterministik iş akışları oluşturabilirsiniz.
  • SSE ile Gerçek Zamanlı Akış: Kullanıcı deneyimini canlı tutmak amacıyla Server-Sent Events (SSE) kullanılarak her şapkanın yanıtı üretildiği anda ekrana yansıtılır.
  • Yapılandırılmış Konuşma Geçmişi: Modellerin birbirini tekrarlamaması için konuşma geçmişi düz bir metin bloğu yerine, her şapkaya özel kurallar ve hedefler içeren yapılandırılmış bir veri şemasıyla beslenmiştir.

Gemma 4'ü Nasıl Kullandım

Bir tartışma döngüsünde 31 adede kadar hızlı çıkarım yapılması gerektiği için yerel model seçimi hayati önem taşıyordu.

  • E4B Tercihi: 2B modeli karakteri korumakta başarısız olurken, 26B modeli donanımı çok fazla zorlamaktaydı. E4B (4B) modeli, 16 GB VRAM'e sahip sistemlerde 3-8 saniye yanıt süresiyle karakter rollerini mükemmel şekilde sürdürmüştür. Pratik çıkarım: Projelerinizde en büyük modeli seçmek yerine hız ve doğruluk dengesini sunan en verimli modeli belirlemelisiniz.

Özet

NeuralHats, doğru bir yazılım mimarisi ve esnek yönlendirme teknikleriyle yerel donanımlarda çalışan küçük dil modellerinin bile ne kadar yetenekli olabileceğini göstermektedir. Geliştiriciler için asıl ders; pahalı ve gizlilik riski barındıran bulut API'lerine bağımlı kalmadan, kendi sistemlerimizde güçlü karar destek mekanizmaları kurabileceğimizdir.

Orijinal kaynağa buradan ulaşabilirsiniz.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →