NVIDIA Kumo Tabular: Tablo Tahmininde Doğruluk ve Verimlilikte Yeni Bir Eşik
İçindekiler
Öne Çıkanlar (TL;DR)
- Açık Temel Model: NVIDIA Kumo Structured koleksiyonunun bir parçası olan Kumo Tabular, Hugging Face üzerinde kullanıma sunulan açık bir tablosal temel modeldir (foundation model).
- Sıfır Eğitim ile Çıkarım: Etiketli satırlardan oluşan bir tablo verildiğinde; sınıflandırma ve regresyon için eğitim, ince ayar (fine-tuning) veya özellik mühendisliği gerekmeden tek bir ileri geçişte (forward pass) yeni satırların etiketlerini tahmin eder.
- Sentetik Veri ve Lisans: Yalnızca yapay verilerle önceden eğitilmiştir, 28M ile 215M parametre arasında değişen üç boyutta gelir, açık kaynak kütüphane üzerinden çalışır ve ticari kullanıma uygun OpenMDW-1.1 lisansıyla yayınlanmıştır.
- Kıyaslama Liderliği: TabArena, BeyondArena, TALENT ve ScoringBench olmak üzere dört farklı kıyaslama testinde (benchmark) birinci sırada yer almaktadır.
- Açık Erişim: Model kodları GitHub (
https://github.com/NVIDIA/structured-data-models), model ağırlıkları ise Hugging Face (https://huggingface.co/nvidia/Kumo-Tabular) üzerinden paylaşılmıştır.
Tablosal Temel Modellere Geçiş (The Shift to Tabular Foundation Models)
Tablo verileri kurumsal makine öğreniminin bel kemiğidir. Müşteri kayıtları, finansal işlemler, sensör logları ve siparişler tablolarda yer alır; müşteri kaybı (churn), kredi temerrüdü veya talep tahmini gibi görevler endüstrideki en yaygın makine öğrenimi problemleridir. Son yirmi yıldır bu alanda gradyan artırımlı karar ağaçları (GBDT) başarıyla kullanıldı. Ancak bu modellerin yaşam döngüsü neredeyse hiç değişmedi: Her yeni görev için veri etiketleme, özellik mühendisliği (feature engineering), hiperparametre arama ve modeli sıfırdan eğitip devreye alma zorunluluğu bulunuyordu.
Büyük Dil Modelleri (LLM'ler), görevlere yaklaşımda yeni bir paradigma sundu. Önceden eğitilmiş bir model, istem (prompt) içindeki birkaç örnekle ağırlıklarını güncellemeden problemi çözebilir. Bağlam içi öğrenme (in-context learning) olarak adlandırılan bu yaklaşım tablolara da uygulanabilir: Milyonlarca tablo üzerinde önceden eğitilmiş bir temel model, etiketli bir tabloyu bağlam olarak okur ve yeni satırların etiketlerini doğrudan tahmin eder. NVIDIA Kumo Tabular, tek bir ileri geçişte (forward pass) sınıf olasılıklarını veya sayısal tahminleri döndürerek bu paradigmayı hayata geçirir.
Kumo Tabular Nasıl Çalışır? (How Kumo Tabular Works)
Kumo Tabular, TabICL ve TabPFN çalışmalarında tanıtılan sütun, satır ve bağlam içi dikkat (in-context attention) mekanizmalarını kullanan, tablo yapısı etrafında inşa edilmiş bir Transformer mimarisidir. Bir etiketi tahmin etmek için modelin üç aşamayı gerçekleştirmesi gerekir:
- Sütun İçi Anlamlandırma: Her değerin kendi sütunu içinde ne anlama geldiğini anlamak,
- Satır İçi Etkileşim: Bir satırın sütunlarının birbiriyle nasıl etkileşime girdiğini anlamak,
- Bağlam ve Sorgu İlişkisi: Mevcut etiketlere sahip bağlam satırlarını, etiketi bilinmeyen sorgu satırlarıyla ilişkilendirmek.
Kumo Tabular bunu şu mimari bileşenle başarır:
- Hücre Gömme (Cell Embedding): Bir hücre grubu bir belirtece (token) dönüşür. Sayısal ve kategorik değerler Fourier özellikleri ve sinüs dönüşümleriyle temsil edilir.
Geliştiriciler İçin Pratik Çıkarımlar
Yazılım geliştiriciler için Kumo Tabular, tablo verileriyle çalışırken geleneksel makine öğrenimi boru hatlarındaki eğitim, hiperparametre tarama ve dağıtım süreçlerini ortadan kaldırır. Özellikle veri etiketleme maliyetinin yüksek olduğu veya hızlı prototipleme gereken durumlarda, sıfır eğitimle (zero-shot/in-context inference) anında çıkarım yapma kolaylığı sunar.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →