Makine Öğrenmesi·2 dk okuma·

DRG-MAPPO: İş Birlikçi Hava Muharebesi İçin Hiyerarşik Dinamik Rol-Çizge Çok Ajanlı Pekiştirmeli Öğrenme

Paylaş
Makine ÖğrenmesiEdumints Blog

Giriş ve Temel Problem

Çok Ajanlı Pekiştirmeli Öğrenme (MARL - Multi-Agent Reinforcement Learning), otonom sistemlerde ve hava muharebesinde karmaşık karar alma süreçleri için kritik bir paradigma haline gelmiştir. MARL hava muharebesinde yüksek bir potansiyel gösterse de gelişmiş taktiksel koordinasyonu sağlamak çözülmesi zor bir problem olmayı sürdürmektedir. Bu zorluk temelde iki ana kısıtlamadan kaynaklanmaktadır:

  1. Yapılandırılmış İlişkisel Modelleme Eksikliği: Mevcut yaklaşımlar, ajanların muharebe alanındaki varlıklar arasında zamanla değişen karmaşık etkileşimleri yakalamasını engellemektedir.
  2. Geleneksel Düz Mimarilerin Yetersizliği: Konvansiyonel düz (flat) yapılar taktiksel rolleri açıkça modelleme kabiliyetinden yoksundur; bu durum son derece dinamik ortamlarda görev dağılımının belirsizleşmesine yol açmaktadır.

Çözüm: DRG-MAPPO Mimarisi

Bu zorlukların üstesinden gelmek amacıyla çizge tabanlı ilişkisel modelleme ile dinamik rol atamasını entegre eden DRG-MAPPO (Hierarchical Dynamic Role-Graph Multi-Agent Proximal Policy Optimization) çerçevesi önerilmektedir.

Çerçevenin çalışma mekanizması şu temel bileşenlerden oluşur:

  • Çizge Tabanlı İlişkisel Gösterim: Muharebe alanı etkileşimleri bir çizge olarak modellenir ve çizge dikkat mekanizmaları (GAT) kullanılarak dost unsurlar, düşmanlar ve tehditler arasındaki kritik ilişkisel öznitelikler çıkarılır.
  • Dinamik Rol Ataması: Üst düzey bir politika (high-level policy), taktiksel sorumlulukları (örneğin "lider" ve "destekçi") belirlemek için dinamik bir rol atama mekanizması işletir.
  • Hiyerarşik Eylem İcrası: Alt düzey politika (low-level policy), atanan rollere ve kodlanmış çizge özniteliklerine koşullanarak ayrık manevra eylemlerini yürütür; böylece taktiksel strateji ile iş birlikçi icra eş zamanlı optimize edilir.
  • Hedef Önceliği Yardımcı Görevi: Tasarlanan hedef önceliklendirme yardımcı görevi (target-priority auxiliary task), hedefe odaklanmış ateş (focus-fire) gibi kolektif taktik davranışların ortaya çıkmasını destekler.

Deneysel sonuçlar, DRG-MAPPO'nun %87 kazanma oranına ulaşarak son teknoloji (SOTA) bir performans sergilediğini; ilişkisel modelleme, açıklanabilirlik ve optimizasyon kararlılığı arasında dengeli bir köprü kurduğunu kanıtlamaktadır.

Yazılım ve Sistem Tasarımı Açısından Çıkarımlar

Karmaşık çok ajanlı yazılım sistemleri geliştiren mühendisler için bu mimari şu pratik ilkeleri sunar:

  • Hiyerarşik Sorumluluk Ayrımı: Ajanlara tüm kararları düz bir yapıda aldırmak yerine strateji belirleme ile aksiyon yürütümünü hiyerarşik katmanlara ayırmak, hesaplama yükünü ve model belirsizliğini azaltır.
  • Çizge Tabanlı Durum Yönetimi: Ajanlar arası veri akışını ve bağımlılıkları düz durum vektörleri yerine dinamik ilişkisel çizgelerle yönetmek, karmaşık ortamlarda bağlam kaybını önler.
  • Gözlemlenebilirlik ve Rol İzleme: Ajanların dinamik roller üstlenmesi, üretim ortamında hangi bileşenin neden belirli bir eylemde bulunduğunu denetlemeyi ve hata ayıklamayı kolaylaştırır.
  • Yardımcı Görevlerle Davranış Rehberliği: Ana ödül fonksiyonunu aşırı karmaşıklaştırmadan yardımcı görevlerle iş birlikçi hedefleri desteklemek, optimizasyon stabilitesini korur.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.11155)

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →