EDGEGEN: Sentetik Uç Durum Üretimi ile Araç Çağıran Ajanların Geliştirilmesi
İçindekiler
Araç çağırma (tool-calling) yeteneğine sahip Büyük Dil Modeli (LLM) ajanları, günümüzde kurumsal iş uygulamalarında giderek daha yaygın bir şekilde konumlandırılmaktadır. Ancak bu ajanların etkin biçimde değerlendirilmesi ve optimize edilmesi; veri gizliliği ve yasal kısıtlamalar nedeniyle elde edilmesi güç olan yüksek kaliteli, çeşitli görev veri setlerini gerektirir. Mevcut sentetik görev üretim yaklaşımları ise genellikle ajanın arkasındaki veritabanı durumunu göz ardı eden genel senaryolar üretmekte ve yalnızca sorunsuz akış ("happy path") durumlarına odaklanarak gerçek dünya kullanım çeşitliliğini yansıtmakta yetersiz kalmaktadır.
EdgeGen: Kurallardan Uç Durumlara
EdgeGen, bu kısıtlamaları aşmak için geliştirilmiş yenilikçi bir sentetik görev üretim çerçevesidir. Sistem, doğrudan ajanın teknik şartnamesinden (spesifikasyon) iş ve uyumluluk kurallarını çıkarır. Ardından, bu kuralları özellikle ihlal etmek üzere tasarlanmış ve veritabanı durumuna dayalı (database-grounded) uç durum (edge-case) görevleri üretir.
EdgeGen çerçevesi mevcut sentetik veri üretim teknikleriyle birleştirildiğinde aşağıdaki temel bileşenleri sağlar:
- Otomatik Kural Çıkarımı: Ajan spesifikasyonundaki sınırları analiz ederek kural ihlali oluşturan sınır senaryoları tasarlar.
- Veritabanı Tabanlı Görev Üretimi: Üretilen senaryolar soyut kalmaz; doğrudan sistemin gerçek veritabanı durumuna ve kısıtlamalarına bağlanır.
- İnsansız Kapalı Döngü: İnsan müdahalesi veya manuel etiketleme gerektirmeyen, tamamen otonom ve kapalı döngü (closed-loop) bir geliştirme boru hattı sunar.
Model İnce Ayarı ve Harness Optimizasyonu
EdgeGen tarafından üretilen veriler, ajanların yeteneklerini hem model ince ayarı (finetuning) hem de yönlendirici çerçeve optimizasyonu (harness optimization) aracılığıyla ileriye taşır:
- Finetuning Performansı: tau2bench havayolu alanında gerçekleştirilen testlerde, EdgeGen verileriyle ince ayar yapılan modeller ortalama ilerlemede %2 ile %42 arasında tutarlı bir başarı artışı göstermiştir. Klasik temel yöntemlerin bazı modellerde performans kaybına yol açtığı senaryolarda EdgeGen istikrarlı kazanım sağlamıştır.
- Harness İyileştirmesi: Gemma-4-e4b modeli üzerinde yapılan testlerde, temel harness yapısına göre %30, insan eliyle hazırlanmış (human-curated) harness yapısına göre ise %10'luk bir ortalama ilerleme artışı elde edilmiştir.
Geliştiriciler ve Öğrenenler İçin Pratik Çıkarımlar
Ajan tabanlı yazılım mimarileri geliştiren mühendisler için bu çalışma şu kritik pratik çıkarımları sunar:
- Uç Durum Testleri Hayatidir: Ajanlar varsayılan akışlarda başarılı olsa da kurumsal üretim ortamlarında sistemleri bozan durumlar kural ihlalleri ve uç vakalardır.
- Spesifikasyonu Test Üretecine Dönüştürün: Ajanınızın araç ve API dokümantasyonundaki kuralları, modeli zorlayacak sentetik test senaryoları üretmek için girdi olarak kullanın.
- Durum Bilgisi (State) ile Doğrulama: Testleri veritabanı durumundan bağımsız promptlarla değil, gerçek veri durumuna bağlı kurgulayarak ajanın halüsinasyonlarını engelleyin.
- Otonom Optimizasyon Döngüleri Kurun: İnsan etiketleme maliyetini ortadan kaldıran kapalı döngü boru hatları, modeller geliştikçe test ve optimizasyon süreçlerini de otomatikleştirir.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Tool Calling ve Multi-Step Agent'lar modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →