ZGCM-1: Matematik ve Ajan Tabanlı Arama İçin Tamamen Açık ve Yüksek Verimli Temel Model
İçindekiler
Kompakt Modellerde Yeni Paradigma: Düşünce ve Araç Entegrasyonu
Yapay zekâ modellerinin açık web'deki devasa bilgiyi salt parametrik ağırlıklarında ezberlemesi, özellikle 7B ölçeğindeki kompakt mimariler için ciddi bir kapasite darboğazı oluşturmaktadır. Sıfırdan aşırı veri, sistem ve algoritmik verimlilikle eğitilen, tamamen açık kaynaklı 7B yoğun (dense) temel model ZGCM-1, bu kısıtı aşmak adına yenilikçi bir önermeye dayanıyor: Kompakt modeller pasif ezberleme sınırlarını, planlı içsel akıl yürütmeyi aktif dış araç kullanımıyla birleştirerek aşabilir.
Modelin 256K gibi son derece geniş bir bağlam penceresinde bu paradigmayı desteklemesi amacıyla uçtan uca, açık ve yüksek verimli bir eğitim reçetesi geliştirilmiştir:
- Mimari ve Sistem Ortak Tasarımı (Architecture & System Co-design): Araya eklenmiş kapılı kayan pencere (gated sliding-window) ve tam dikkat (full attention) mekanizmalarının dengeli hibrit kullanımı ile kararlı bir FP8 Muon optimize edicisinin entegrasyonu.
- Aşamalı Müfredat ve MDP Ara Eğitimi (Progressive Curriculum & MDP Mid-Training): Bağlam penceresinin 16K, 64K ve 256K uzunluklarına aşamalı olarak ölçeklendirilmesi ve dış ortam etkileşim izlerinin Markov Karar Süreçleri'ne (MDP) dönüştürülmesi.
Geliştirme sürecinde donanım kümesi operasyonları, veri kürasyonu ve hızlı tanısal değerlendirmeler, otonom çalışan ajan sürüleri (agent swarms) tarafından yönetilen yapay zekâ yerel (AI-native) bir Ar-Ge iş akışıyla yürütülmüştür. Bu mimari ve sistem optimizasyonları, 16K ön eğitim safhasında kayıp değerine ulaşma süresinde (time-to-loss) yaklaşık 4.2 kat verimlilik artışı sağlamaktadır.
Performans, Değerlendirmeler ve Yazılım Geliştirme Çıkarımları
ZGCM-1-7B, genel kıyaslamalarda 7B model ailesi içinde üstün bir rekabet sergilemektedir. Özellikle karmaşık matematiksel akıl yürütme ve ajan tabanlı arama testlerinde, parametre hacmi açısından kendisinden katbekat büyük olan Qwen3-235B-A22B ve GLM-5.1 gibi sınır modellerle doğrudan rekabet edebilecek bir performans ortaya koymaktadır.
Geliştirme yaşam döngüsü boyunca damıtılan mimari ölçekleme, SFT kalite budaması, uzun bağlam genellemesi ve ajan ortak eğitim dinamiklerine dair sekiz somut ampirik bulgu, yapay zekâ mühendisleri için kritik pratik çıkarımlar sunmaktadır. Yazılım geliştiriciler açısından bu çalışma; salt parametre boyutunu büyütmek yerine akıl yürütme adımlarını araç çağırma (tool calling) ve Markov Karar Süreçleri ile pekiştirmenin, düşük kaynaklı ve gecikmeye duyarlı üretim ortamlarında güçlü ve maliyet etkin bir alternatif sunduğunu kanıtlamaktadır. Ayrıca 256K bağlamda kararlı FP8 optimizasyonu ve aşamalı müfredat yaklaşımı, kurumsal ortamlarda uzun bağlamlı özel modeller eğitmek isteyen ekipler için doğrudan uygulanabilir bir mühendislik rehberidir.
Topluluk araştırmalarını desteklemek amacıyla ön eğitim, ara eğitim ve son eğitim ağırlıkları, ara kontrol noktaları (checkpoints), eğitim kodları, veri tarifleri ve W&B logları tamamen açık kaynak olarak paylaşılmıştır.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Tool Calling ve Multi-Step Agent'lar modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →