Desert Ant Labs: Cihaz Üzerinde Çalışan Hızlı ve Yerel Modeller
Avrupa merkezli yeni nesil yapay zekâ laboratuvarı Desert Ant Labs, ürün etkileşimlerine doğrudan cihaz üzerinde (on-device) çalışan zekâ kazandırmak amacıyla kuruldu. Günümüz modern yazılım mimarisinde bulut API'lerine olan bağımlılık; yüksek token maliyetleri, ağ gecikmesi ve veri gizliliği gibi ciddi kısıtlar yaratıyor. Desert Ant Labs, ses, görüntü ve metin alanında geliştirdiği küçük ve amaca yönelik modellerle bu darboğazı ortadan kaldırmayı hedefliyor.
Beş yıllık eski telefonlarda bile milisaniyeler içinde yanıt veren ve sıfır çıkarım maliyetine sahip olan bu mimari, tek bir SDK ile Swift, Kotlin ve JavaScript platformlarına sunuluyor. İlk etapta 12'si kararlı, 6'sı beta olmak üzere 18 model erişime açıldı. Her görev için en hızlı cihaz içi çözümü sunmak üzere optimize edilen öne çıkan dört model şunlar:
- Voz: iPhone üzerinde 10 dakikalık bir ses kaydını yalnızca iki saniyede metne döküyor. Whisper'dan 4,7 kat daha hızlı çalışırken her kelime için başlangıç ve bitiş zaman damgaları üretiyor.
- Clear: Beş dakikalık bir dizüstü bilgisayar kaydını bir saniyede stüdyo kalitesine dönüştüren 9 MB boyutunda bir ses iyileştirme modeli.
- Redact: İsim, adres ve kart numarası gibi hassas kişisel verileri 27 dilde gerçek zamanlı maskeleyerek sunucuya gitmesini engelliyor. 12 MB'lık bu model, metindeki kişisel verilerin %88,8'ini yakalayarak 2,3 GB'lık GLiNER-PII modeline (%91,1) yakın bir başarı sunarken OpenAI filtresini (%60,2) geride bırakıyor.
- Tongue: Yalnızca üç kelimeden 84 dili tanımlayabilen 2 MB'lık bir dil tespit modeli. 293 MB'lık standart dedektörün 0,887'lik skoruna karşı 0,933 doğruluk oranına ulaşıyor.
Modeller aylık 100 bin aktif cihaza kadar tamamen ücretsiz sunuluyor; herhangi bir oturum veya token gerektirmiyor. Verinin kullanıcının cihazından hiç ayrılmaması, bulut bağımlılığını ortadan kaldırarak veri egemenliği ve gizlilik standartlarına doğrudan uyum sağlıyor.
Buraya Nasıl Gelindi ve Yazılım Geliştiriciler İçin Çıkarımlar
Desert Ant Labs ekibi, beş yıl boyunca geliştirdikleri video uygulaması Detail sürecinde, kısa klip oluşturma veya podcast ses iyileştirme gibi özellikler için bulut API'lerine başvurmak zorunda kaldı. Uygulamanın popülaritesi arttıkça altyapı maliyetleri de hızla yükseldi. Donanım, çipler ve Core ML gibi temel teknolojiler mevcut olsa da, birkaç satır kodla doğrudan entegre edilebilecek hazır yerel modeller sektörde eksikti.
Model eğitimini bir ürün tasarımı problemi olarak ele alan ekip, kendi modellerini geliştirdi. Ses iyileştirmede Dolby yerine Clear'ı kullanarak daha hızlı ve kaliteli sonuç aldılar. Transkripsiyon tarafında Voz ile 5 kat hız artışı sağlarken, 10 dakikalık bir videoyu 5 saniyede kliplere ayıran 284 MB'lık Clips modeliyle Claude Sonnet'in yerini aldılar; bu sayede 10 kat hız ve 470 kat enerji tasarrufu elde ettiler.
Yazılım geliştirme açısından temel çıkarım şudur: Her görev için büyük bulut modellerine API çağrısı yapmak yerine; amaca özel, küçük ve istemci üzerinde koşan modeller kullanmak; sıfır marjinal maliyet, düşük gecikme ve üstün veri güvenliği sağlar.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Modeller: Hangisi, Ne Zaman? modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →