Ekran Görüntüleri İçin 7B Vision Modelini 2B'ye Damıttım — Ve 7B Öğretmen Daha Düşük Puan Aldı

İçindekiler
Büyük yapay zeka modelleri piyasaya sürüldüğünde şu soru akla gelir: Daha küçük bir model kullansaydık ne kaybederdik? Bu makalede, bir Qwen2-VL-7B vision-language modelini (VLM) "öğretmen" olarak kullanarak, Qwen2-VL-2B "öğrenci" modeline ekran görüntülerini açıklama yeteneği kazandırma deneyi ele alınmaktadır. M4 Pro işlemcili MacBook üzerinde gerçekleştirilen bu damıtma (distillation) işlemi şaşırtıcı sonuçlar verdi.
Özet (TL;DR): Damıtılmış 2B model; 2.4 kat daha hızlı çalıştı, 2.4 kat daha az bellek tüketti ve ROUGE-L metriklerinde öğretmeninden daha yüksek skor elde etti. Ayrıca dar bir görev için özelleştirilmiş küçük öğrenci modelin, temel (eğitilmemiş) küçük modele kıyasla belirgin şekilde daha başarılı olduğu doğrulandı.
Neden Dar Bir Alan İçin VLM Damıtılmalı?
Genel amaçlı küçük modeller iyi olsa da, belirli bir görevde güvenilir olmaları zordur. Bilgi damıtma (knowledge distillation), büyük modelin uzmanlığını daha küçük ve hafif bir modele aktararak ekran görüntüsü anlama gibi dar bir alanda yüksek verim almayı sağlar.
Kurulum: Görev, Veri ve Metrikler
Deneyde, 22.417 Android ekran görüntüsü içeren Screen2Words veri seti kullanıldı. Başarı kriteri olarak insan referanslarına karşı ROUGE-L ve BLEU metrikleri ölçüldü.
Yöntem: Üç Sinyal, Tek MVP
Çalışmada dizilim düzeyinde damıtma (sequence-level distillation) yöntemi uygulandı. Öğretmen modelin ürettiği metinler hedef alınarak öğrenci model LoRA ile ince ayar (fine-tuning) işlemine tabi tutuldu.
Öğretmen Modeli Etiketlemesi
Öğretmen model (Qwen2-VL-7B), Apple Silicon üzerinde MLX kütüphanesi yardımıyla 4-bit olarak çalıştırıldı. Öğretmen model, insan referanslarına kıyasla çok daha detaylı ve zengin (ortalama 33 kelime) açıklamalar üretti.
Öğrenci Modelin Eğitilmesi (Ve MLX'in Hayır Dediği Kısım)
MLX'in özel Metal çekirdeklerindeki geri yayılım (backpropagation) hatası sebebiyle PyTorch (transformers + PEFT LoRA) altyapısına geçildi. Uzun ekran görüntülerinin bağlam penceresini aşmaması için görsel token bütçesi (max_pixels) sınırlandırıldı. Ayrıca, torchvision kütüphanesinin yüklü olmamasından kaynaklanan küçük bir bağımlılık hatası da hızlıca giderildi.
Sonuçlar: Dürüst Versiyon
Metrik sonuçlarına göre 2B öğrenci model 0.178 ROUGE-L skoru alırken, 7B öğretmen model 0.164 skorunda kaldı. Bunun sebebi metriklerin yapısıdır; BLEU ve ROUGE-L tam eşleşme ve kısalığı ödüllendirdiğinden öğretmen modelin uzun ve detaylı yanıtlarını cezalandırmıştır.
Ödünleşim (Asıl Mesele)
2B öğrenci model, öğretmenine kıyasla ~2.4 kat hızlı ve ~2.4 kat daha az bellek (2.4 GB) kullanımıyla çalışmaktadır.
Yazılım Geliştirme ve Öğrenme Açısından Çıkarımlar:
- Amaca Yönelik Optimizasyon: Prodüksiyon ortamlarında devasa genel modeller yerine, LoRA ile dar alanda özelleştirilmiş küçük modeller kullanmak maliyet ve hız açısından büyük kazanç sağlar.
- Değerlendirme Metriklerinin Sınırları: Klasik metrikler (BLEU/ROUGE-L) üretken modellerin zengin çıktılarını ölçmede yetersiz kalabilir. Yazılımcılar bunun yerine LLM-as-judge veya amaca yönelik özel değerlendirme protokolleri tasarlamalıdır.
Orijinal makaleye buradan ulaşabilirsiniz.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →