LLM·2 dk okuma·

Ultralytics YOLO26: Birleşik Gerçek Zamanlı Uçtan Uca Yapay Görme Modelleri

Paylaş
LLMEdumints Blog

1. Giriş

Yapay görme (computer vision) sistemlerinde doğruluk, hız ve donanım uyumluluğu en kritik parametrelerdir. Ancak geleneksel YOLO modelleri, çıkarım (inference) aşamasında performansı ve işlemciyi olumsuz etkileyen NMS (Maksimum Olmayan Bastırma) gibi post-processing adımlarına bağımlı kalmıştır. Ultralytics ekibinin geliştirdiği YOLO26, bu darboğazları aşarak tamamen uçtan uca (end-to-end) çalışan bir model ailesidir. Yazılım geliştiriciler için bu model, ek yazılımsal filtreleme süreçlerinin ortadan kalkması ve genel kod tabanının sadeleşmesi anlamına gelmektedir.

2. İlgili Çalışmalar

YOLO26, kendisinden önceki YOLO sürümlerinin (YOLOv8, YOLO11 vb.) ve RT-DETR gibi modern transformatör tabanlı mimarilerin güçlü yönlerini sentezlemektedir. Bir yapay zeka ve yazılım mühendisi olarak modellerin evrimini yakından izlemek değerlidir; zira her yeni nesil, önceki sürümlerin donanım uyumsuzluklarını ve derleme (compilation) aşamasındaki kısıtlamalarını çözmeyi hedefler. YOLO26 da özellikle hafif omurga (backbone) yapılarını optimize eden literatür çalışmalarından beslenmektedir.

3. Metot ve Yenilikler

Modelin yüksek performansının arkasında üç temel yenilikçi yöntem yatmaktadır:

  • Doğal NMS-Free Çıkarım: Çift başlıklı (dual-head) mimari sayesinde, eğitimde denetim zenginliği korunurken çıkarımda yalnızca tek bir tahmin başlığı aktif kullanılır. Böylece NMS işlemine olan ihtiyaç tamamen ortadan kalkar ve gecikme azalır.
  • DFL (Distribution Focal Loss) Kaldırılması: Bu karmaşık kayıp fonksiyonunun kaldırılmasıyla algılama başlığı hafifletilmiş ve kısıtlanmamış bir regresyon aralığı elde edilmiştir. Bu durum, modelin dışa aktarım süreçlerini pratikleştirir.
  • Eğitim İnovasyonları: LLM dünyasından transfer edilen hibrit MuSGD optimizasyonu, eğitim odağını çıkarım başlığına kaydıran Progressive Loss ve küçük nesnelerin kaçırılmasını engelleyen STAL etiket atama stratejisi entegre edilmiştir.

4. Deneyler ve Performans

COCO veri kümesinde test edilen YOLO26, 40.9–57.5 mAP doğruluğuna 1.7–11.8 ms gecikme (latency) süreleriyle ulaşarak hız-doğruluk dengesinde yeni bir standart belirlemiştir. CPU çıkarımında YOLO11n'e kıyasla %43'e varan hız artışı sergilemektedir. Ayrıca YOLOE-26 uzantısı, metinsel veya görsel yönlendirmelerle (prompting) çalışan sıfır örnekli (zero-shot) açık kelime dağarcığı çıkarımını başarıyla desteklemektedir.

5. Sonuç ve Pratik Çıkarımlar

YOLO26, üretim ortamında (production) yapay görme modellerinin dağıtımını (deployment) ve entegrasyonunu önemli ölçüde kolaylaştırmaktadır. Geliştiriciler için pratik çıkarımlar şunlardır:

  • Azaltılmış Kod Karmaşıklığı: NMS'in elenmesi, C++ veya ONNX Runtime entegrasyonlarında yüzlerce satırlık ek post-processing kodunu ve buna bağlı kütüphane bağımlılıklarını ortadan kaldırır.
  • Çok Görevli Tek Altyapı: Nesne tespiti, segmentasyon ve iskelet (pose) tahmini gibi farklı görevler tek bir birleşik kütüphane ile çözülebilmektedir.
  • Kararlı Transfer Öğrenme: MuSGD optimizasyonu sayesinde, özel veri kümeleri üzerinde yapılan ince ayarlama (fine-tuning) işlemleri çok daha hızlı ve kararlı şekilde yakınsamaktadır.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://arxiv.org/abs/2606.03748)

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →