LLM·3 dk okuma·

MicroLLM Lab – Tarayıcıda WebGPU ile Minik LLM Testi ve Performans Analizi

Paylaş
LLMEdumints Blog

MicroLLM Lab, modern WebGPU teknolojisinden yararlanarak 4-bit (Q4) kuantize edilmiş minik dil modellerini (135M parametre ölçeği dahil) doğrudan istemci tarayıcısında çalıştırmayı ve kıyaslamayı sağlayan yenilikçi bir deney laboratuvarıdır. Sunucu maliyetini sıfıra indiren ve veri gizliliğini tamamen yerel ortamda koruyan bu yaklaşım, uç bilişim (edge computing) mimarilerinin geleceğini temsil eder.

Tarayıcı İçi Çalışma ve Model Yönetimi

Sistem başlatıldığında WebGPU motoru ve model kataloğu devreye alınır. Modeller tarayıcının IndexedDB önbelleğinde saklanarak sonraki ziyaretlerde anında erişilebilir hale gelir:

  • Load all models: Listelenen tüm modelleri tek hamlede istemci belleğine yükler.
  • Unload all: Donanım kaynaklarını serbest bırakmak için yüklü modelleri bellekten kaldırır.

Test Metodolojisi ve Koşum Seçenekleri

Yazılım geliştirme açısından edebi yaratıcılık yerine regex ve tam token eşleşmesi gibi nesnel kriterler test edilir. 135M gibi kompakt modellerin başarısız olması beklenen bir ölçüm sonucudur:

  • Run suite on active model: Yalnızca seçili olan aktif model üzerinde kıyaslama süitini çalıştırır.
  • Run suite on every loaded model: Bellekteki tüm modeller üzerinde testleri sırayla yürüterek toplu karşılaştırma sağlar.
  • Run sustained speed test (256 tokens): Sürekli 256 token üretiminde donanımın sürdürülebilir hızını ölçer.

Temel Performans Metrikleri

Kıyaslama sürecinde donanım ve model performansı dört ana metrikle raporlanır:

  • 🏎️ Highest Peak Speed: Tekil testlerde ulaşılan en yüksek anlık üretim hızı.
  • ⚡ Highest Sustained Speed: Sürekli 256 token deşifresi boyunca ölçülen en yüksek hız.
  • 📊 Avg Sustained Speed: Yüklenen ve test edilen tüm modellerin ortalama sürekli hızı.
  • ⏱️ Total Benchmark Score: Test süitinin toplam tamamlanma süresi (wall time).

Sonuç Analizi ve Yerel Gizlilik

Test başına çalışma süresi (ms) ve doğruluk oranları tamamen kullanıcının cihazında hesaplanır; hiçbir telemetri verisi sunucuya iletilmez. Geçmiş verileri sıfırlamak için Clear saved comparison seçeneği bulunur.

Doğrulanabilir Sertifika ve Paylaşım

Test tamamlandığında cihaz donanımı ve hız değerlerini içeren doğrulanabilir bir performans sertifikası oluşturulur:

  • 🎨 Generate Certificate: Kullanıcı adı ve donanım bilgisiyle sertifika üretir.
  • ⬇️ Download Certificate Image (.png): Sertifikayı görsel dosyası olarak indirir.
  • 📋 Copy Image: Sertifika görselini doğrudan panoya kopyalar.
  • 𝕏 Share on X: Sonuçları X platformunda paylaşır.
  • 💼 Share on LinkedIn: Başarı skorunu LinkedIn ağında paylaşır.
  • 🔗 Copy Text Summary: Skor özetini metin olarak kopyalar.

JavaScript ile Özel Benchmark Geliştirme

Geliştiriciler, eval() mantığıyla çalışan editör sayesinde modellerin ürettiği metinler üzerinde kendi test mantıklarını koşturabilir:

  • Example: object: Nesne tabanlı test şablonu sunar.
  • Example: function: Fonksiyon tabanlı test yapısı sağlar.
  • Eval and run: Yazılan JavaScript kodunu derleyip model çıktısında anında çalıştırır.
  • Prompt for a larger LLM: Daha kapsamlı testler üretmek için büyük bir modele yönelik istem hazırlar.
  • Copy prompt: Oluşturulan istemi panoya kopyalar.
  • Function form: Testi fonksiyonel yapıda biçimlendirir.

WebGPU destekli istemci taraflı çıkarım; sıfır sunucu maliyeti, çevrimdışı çalışabilirlik ve tam veri gizliliği sunarak edge runtime geliştiricileri için kritik fırsatlar yaratmaktadır.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Edge Runtime ve Production Optimizasyonu modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →