LLM·3 dk okuma·

Mercury 2.5: Üretim Odaklı Hızlı ve Yetenekli Difüzyon Dil Modeli

Paylaş
LLMEdumints Blog

Inception, bugüne kadarki en yetenekli üretim modeli olan Mercury 2.5'i duyurdu. Mercury 2'nin düşük gecikme ve düşük maliyet profilini koruyan yeni sürüm, model kalitesinde önemli bir sıçrama gerçekleştiriyor. Mercury 2'nin lansmanından bu yana binlerce geliştirici ve onlarca kurumsal şirket modeli üretime alarak kullanım hacmini katbekat artırdı. Arama, ses ve kodlama ürünlerindeki bu gecikmeye duyarlı iş yükleri, sentetik kıyaslamalardan çok daha net üretim geri bildirimleri sağlayarak Mercury 2.5'in odaklı eğitim döngüsünü şekillendirdi.

Neler Değişti?

Piyasadaki en yetenekli ve bugüne kadar eğitilmiş en büyük difüzyon tabanlı dil modeli olan Mercury 2.5, teknik özellikleriyle şu geliştirmeleri sunuyor:

  • Kalite: Mercury 2'ye kıyasla zekada %40 artış sağlandı. GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite ve Claude Haiku 4.5 gibi maliyet optimizasyonlu öncü modellerle doğrudan yarışabilir kaliteye ulaştı.
  • Hız: Yaygın olarak erişilebilen NVIDIA GPU'ları üzerinde saniyede tam 1.107 token üretim hızına ulaşıyor.
  • Bağlam Genişliği: 260K token büyüklüğünde geniş bir bağlam penceresi sunuyor.
  • Fiyatlandırma: 1 milyon girdi token'ı için 0,20 $, çıktı için 0,75 $ olarak belirlendi. Model lansmana özel %80 indirimle 0,04 $ girdi ve 0,15 $ çıktı seviyesinden sunuluyor.
  • Gelişmiş Yetenekler: Ayarlanabilir akıl yürütme (tunable reasoning), paralel araç çağırma (parallel tool calls) ve şemaya tam uyumlu JSON çıktı üretimi destekleniyor.

NVIDIA Hızlandırılmış Bilişim Grubu Kıdemli Ürün Müdürü Shruti Koparkar, difüzyon tabanlı modellerin NVIDIA altyapısında bu hız ve zeka dengesiyle üretime hazır sistemlere dönüşmesinin önemini vurguluyor.

Üretimde Mercury

Üretim ortamlarındaki bileşik gecikme (compound latency) sorununu çözen Mercury 2.5, üç kritik kullanım senaryosunda öne çıkıyor:

  • Arama Ajanları ve RAG Boru Hatları: Tek bir arama işlemi; planlama, sorgu yeniden yazma, yeniden sıralama (rerank), olguları yapılandırma ve kaynak özetleme gibi onlarca model çağrısını tetikler. Mercury, tüm bu ara adımları tek bir etkileşim anı içine sığdıracak kadar hızlı tutarak gecikmeyi görünmez kılıyor.
  • Sesli Ajanlar ve Etkileşimli Uygulamalar: Ses teknolojilerinde gecikme, kullanıcının hatta duyduğu rahatsız edici sessizliktir. Canlı çağrıları yöneten OpenCall, Mercury ile medyan yanıt süresini 170 ms seviyesine çekti. Kurucu ortak Oliver Silverstein, akıl yürütme dahil P99 yanıt sürelerinin dakikalardan 1 saniyeye, P50 sürelerinin ise 0,2 saniyenin altına indiğini belirtiyor.
  • Kodlama Alt Ajanları ve Asistanlar: Modern kodlama ajanları iş yükünü planlama, araç çalıştırma ve bağlam sıkıştırma gibi alt görevlere böler. Bu ara çağrılar maliyet ve süreyi hızla katlar. Augment Code; bağlam sıkıştırma ve MCP araç aramasında Mercury'ye geçerek sıkıştırma gecikmesini 150 saniyeden 27 saniyeye (%82 düşüş), maliyeti ise %90 oranında azalttı; araç arama özetlerini ise bir saniyenin altına indirdi.

Yazılım geliştiriciler için bu gelişmeler, yüksek hacimli ajan mimarilerinde pahalı modeller yerine Mercury 2.5 gibi ultra hızlı modellerle zincirleme görevleri optimize etmenin somut yolunu gösteriyor.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Modeller: Hangisi, Ne Zaman? modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →