Mercury 2.5: Saniyede 780 Token Üretim Hızı ve Performans Analizi
İçindekiler
Eylül 2026'da yayımlanan tescilli akıl yürütme modeli Mercury 2.5, Artificial Analysis benchmark testlerinde yüksek işlem hızı ve dengeli fiyatlandırmasıyla dikkat çekiyor. Modelin temel performans ve maliyet göstergeleri aşağıda özetlenmiştir.
Model Özeti
- Zekâ (#89 / 173): Zekâ Endeksi skoru 12'dir (4 üzerinden 2 birim). Sınıfındaki modeller arasında ortalamanın altında yer alır.
- Hız (#2 / 173): Saniyede 780,8 çıktı tokenı üretir (4 üzerinden 4 birim). 173 model arasında en hızlı ikinci seçenektir.
- Maliyet (#21 / 173): 1M girdi tokenı için $0,25, çıktı için $0,75 ve %90 önbellek indirimi sunar. Görev başına ortalama maliyeti $0,06 seviyesindedir (4 üzerinden 2 birim).
- Ayrıntı Düzeyi (#14 / 173): Testlerde 35M çıktı tokenı üreterek medyan değer olan 85M'e kıyasla oldukça özlü yanıtlar vermiştir (4 üzerinden 2 birim).
Karşılaştırma Özeti ve Geliştirici Çıkarımları
Mercury 2.5, genel muhakeme testlerinde medyan seviyede (12 puan) kalarak ortalamanın altında performans sergilese de fiyat-performans açısından oldukça dengelidir. 781 token/saniye hızı, onu gerçek zamanlı üretim sistemleri için ideal kılar. Model ayrıca 260k tokenlık geniş bir bağlam penceresine sahiptir.
Yazılım geliştirme ve mimari tasarım açısından çıkarımlar:
- Gerçek Zamanlı Akış (Streaming): Yüksek token üretim hızı, kullanıcı arayüzlerinde ilk yanıt ve akış gecikmesini neredeyse tamamen ortadan kaldırır.
- Maliyet Odaklı Çoklu Ajan Döngüleri: Modelin gereksiz uzatmalardan kaçınan özlü yapısı ve %90 önbellek avantajı, tekrarlayan ajan çağrılarında bütçeyi korur.
- Doğru Görev Dağılımı: Zekâ puanı sınırlı olduğundan, karmaşık akıl yürütme yerine veri yönlendirme, hızlı sınıflandırma ve özetleme katmanlarında tercih edilmelidir.
Teknik Özellikler
- Akıl Yürütme (Reasoning): Var (İncelenen sürüm akıl yürütme yeteneğine sahiptir; akıl yürütme yapmayan varyantı da bulunabilir).
- Girdi Modalitesi: Metin destekler.
- Çıktı Modalitesi: Metin üretir.
- Bağlam Penceresi: 260k token (12 punto Arial yazı tipiyle yaklaşık 390 A4 sayfasına denktir).
Sınıf Karşılaştırma Metodolojisi
- Akıl Yürütmeyen Modeller: Yalnızca diğer akıl yürütmeyen modellerle karşılaştırılır.
- Akıl Yürüten Modeller: Hem akıl yürüten hem de yürütmeyen tüm modellerle karşılaştırılır.
- Açık Ağırlıklı Modeller: Kendi parametre boyut sınıflarında kıyaslanır (Tiny: ≤4B, Small: 4B–40B, Medium: 40B–150B, Large: 150B+).
- Tescilli Modeller: 3:1 girdi/çıktı harmanlanmış fiyat oranına göre benzer fiyat aralıklarındaki modellerle kıyaslanır (<$0.15, $0.15–$1, >$1).
Öne Çıkan Değerlendirme Kriterleri
- Zekâ: Artificial Analysis Zekâ Endeksi (Daha yüksek değer daha iyidir).
- Hız: Saniye başına üretilen çıktı tokenı (Daha yüksek değer daha iyidir).
- Görev Başına Maliyet: Zekâ Endeksi görevi başına ağırlıklı ortalama maliyet (Daha düşük değer daha iyidir).
Zekâ Endeksi Test Kapsamı (v4.3.2)
Modelin değerlendirilmesinde kullanılan 10 temel kıyaslama testi:
- AA-Briefcase v1.1
- GDPval-AA v2.1
- AutomationBench-AA
- Terminal-Bench 4.0
- SciCode
- Humanity's Last Exam
- GDP.pdf
- CritPt
- AA-Omniscience
- AA-LCR v1.1
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Modeller: Hangisi, Ne Zaman? modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →