LLM·2 dk okuma·

PhysBrain 1.5: Görme-Dil Modellerinden Fiziksel Temel Modellere

Paylaş
LLMEdumints Blog

Giriş ve Fiziksel Çevre Döngüsü

PhysBrain 1.5, fiziksel ortamları anlama, eylemler üretme ve gelecekteki durumları tahmin etme yeteneklerini tek bir çatıda birleştiren açık kaynaklı bir fiziksel temel modeldir. Sistem; gözlem, etkileşim ve çevresel değişim adımlarından meydana gelen fiziksel döngüyü ortak bir öğrenme çerçevesi içinde ele alır.

Mimari ve Birleşik Temsil

Genel bir Görme-Dil Modelinden (VLM) yola çıkan mimari, tüm fiziksel süreçleri ayrık diziler halinde kodlayarak otoregresif sonraki belirteç tahmini (next-token prediction) ile ortaklaşa optimize eder:

  • Dil Yanıtları: Doğal dil çıktıları ve anlamsal yanıtlar ayrık diziler olarak işlenir.
  • Uç Efektör Hareketi: Robotik uç efektör hareketleri (end-effector motion) ayrık belirteç dizilerine dönüştürülür.
  • Yoğun Görsel Hedefler: Sahnelerdeki görsel hedefler belirteçleştirilerek modelin eylem ve algıyı eş zamanlı öğrenmesi sağlanır.

İki Aşamalı Veri ve Eğitim Süreci

Modelin eğitimi, fiziksel etkileşim denetimini iki temel aşamada yapılandırır:

  • Ön Eğitim (Pre-training): Somutlaştırılmış denetim tamamen insan etkileşim videolarından toplanır. Görev odaklı bölümler aracılığıyla anlamsal ve mekansal bağlam; yeniden oluşturulan hareketler ve sonraki gözlemlerle eşleştirilir.
  • Denetimli İnce Ayar (SFT): Model; insan gösterimleri (demonstrations), robot yörüngeleri ve simülasyon deneyimlerinden oluşan hibrit bir veri karışımıyla eğitilerek fiziksel dünyaya uyarlanır.

Kıyaslama Başarımları ve SOTA Performansı

PhysBrain 1.5'in 8B parametreli sürümü, somutlaştırılmış yapay zeka alanında yeni standartlar ortaya koymaktadır:

  • 28 Kıyaslama Testi: Somutlaştırılmış anlama alanındaki 28 testte ortalama 72.5 skor elde ederek açık kaynak dünyasında yeni bir son teknoloji (SOTA) seviyesi belirlemiştir.
  • Tescilli Modellerle Rekabet: GPT-6-Astra ve Gemini 3.6 Flash gibi önde gelen kapalı kaynaklı ticari modellerle başa baş performans sergilemiştir.
  • 14 Testte Zirve: 14 farklı kıyaslamada en yüksek açık kaynak sonucunu alırken genel çok modlu (multimodal) yeteneklerini eksiksiz korumuştur.

Niteliksel Çıktılar ve Gelecek Tahmini

Model, yalnızca anlama seviyesinde kalmayıp eylem üretimi ve sahne öngörüsü gerçekleştirir:

  • Yörünge Üretimi: Robotik manipülasyon için uç efektör hareket yörüngelerini başarıyla üretir.
  • Çok Katmanlı Sahne Tahmini: Mekansal olarak hizalanmış RGB görüntüleri, derinlik (depth) haritaları ve robot maskesi çıktıları sunarak gelecekteki sahneleri tahmin eder.

Yazılım Geliştiriciler İçin Pratik Çıkarımlar

Yazılım geliştiriciler ve yapay zeka mühendisleri için PhysBrain 1.5, robotik eylemlerin ve sensör verilerinin standart otoregresif dil modelleriyle doğrudan yönetilebileceğini kanıtlar. Karmaşık kontrol boru hatları geliştirmek yerine; görüntü, derinlik ve eylem verilerini ayrık belirteçler olarak işleyen çok modlu mimariler kurulabilir. Ayrıca insan videolarından hareket çıkarma yaklaşımı, veri toplama maliyetlerini azaltmak isteyen geliştiriciler için kritik bir veri mühendisliği stratejisi sunmaktadır.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.14973)

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →