LLM·3 dk okuma·

Kurumsal Gereksinimler Strands, LangGraph ve CrewAI ile Karşılaştığında: 45 Koşumun Ölçümü

Paylaş
Kurumsal Gereksinimler Strands, LangGraph ve CrewAI ile Karşılaştığında: 45 Koşumun Ölçümü

İnsan onayı kapıları, denetim izleri ve yapılandırılmış çıktılar gibi kurumsal gereksinimler ajan çerçeveleriyle buluştuğunda ne olur? Aynı kayıt vekil sunucusu (recorder proxy), aynı model ve araçlar kullanılarak Strands, LangGraph ve CrewAI üzerinde 45 yeni test koşumu gerçekleştirildi. Öne çıkan en temel bulgu şudur: Çerçeveler farklı biçimlerde başarısız olmaktadır. Model odaklı çalışan Strands, çıkış yaparken üç kez boş çıktı üretirken; LangGraph ve CrewAI bu hatayı hiç yapmadı.

Neden Kurumsal Bakış Açısı?

Ajanlar regüle edilen iş süreçlerine dahil olduğunda geliştiricilerin karşısına iki kritik duvar çıkar:

  • Denetim (Audit): "Ajan bu kararı neden aldı?" sorusu kesin olarak yanıtlanabilmelidir; aksi halde iş akışı regüle edilmiş alana giremez.
  • Onay (Approval): Bir insan, yıkıcı bir eylemden (veri değiştirme, gönderme, yayınlama) önce ajanı durdurabilmelidir.

AB Yapay Zeka Yasası (EU AI Act), yüksek riskli yapay zeka sistemleri için otomatik günlük kaydı tutmayı ve saklamayı yasal zorunluluk haline getirmektedir.

Deney 1: İnsan Onay Kapıları (18 Koşum)

Görev: Bir haber özeti yazmak, insandan onay istemek ve yalnızca onay verilirse yayınlamak. Üç çerçeve onay kapısını farklı kurgulamaktadır:

  • LangGraph: interrupt() tüm grafiği askıya alır; kararın ardından Command(resume=...) ile akışı devam ettirir.
  • CrewAI: Task(human_input=True) kullanır; görev tamamlandıktan sonra konsol geri bildirimi için duraklar.
  • Strands: Yalnızca istem (prompt) tabanlıdır ("yayınlamadan önce inceleyene sor"); model odaklı döngüyü esas alır.

Sonuçlar:

  • LangGraph: 6/6 koşumu askıya aldı ve 0,0 saniyede geri sürdürdü; checkpointer durumu yeniden çalıştırmadan geri yükler. Ret durumu grafiğin kenar koşuluyla yönlendirilir; kapı modelin iyi niyetine değil, grafiğin yapısına emanettir.
  • Strands: Sıralamaya (sor - kontrol et - yayınla) 3/3 uydu ve rette hiç yayınlamadı. Ancak bir koşumda aynı taslakla publish_article fonksiyonunu iki kez tetikledi. Model odaklı tasarımda onay sonrası mükerrer çalıştırma ciddi bir risktir.
  • CrewAI: En yalın yapıya sahipti (onay için 1, ret için görevi yeniden çalıştıran 2 çağrı). Ancak her isteme aynı ret yanıtı verildiğinde sonsuz döngüye girdi; 131 LLM çağrısı yapıldı ve istem 240'tan 6.561 tokene fırladı. Tekrarlama politikası geliştiricinin sorumluluğundadır.

Deney 2: Denetim İzi Rekonstrüksiyonu (36 Koşum)

Regüle edilen alanın temel sorusu şudur: "Ajan buna neden karar verdi?" Yedi kritik denetim unsuru üzerinden çerçeveler puanlandı:

ÇerçeveGerekçeAraç SırasıArgümanlarSessiz Hata
Strands%100%100%1002
LangGraph%100%0%00
CrewAI%100%50%500

Strands model odaklıdır; modelin akıl yürüttüğü her şey izde kalır, ancak 2 sessiz hata üretmiştir. LangGraph'ın araç sırası ve argümanlarda %0 alması bir kusur değildir; araç çağrıları grafik seviyesinde yönetildiği için proxy izine bu şekilde yansımaktadır.

Pratik Geliştirici Çıkarımları

  • Mimari Güvenlik: Yıkıcı operasyonlarda prompt tabanlı iyi niyet yerine LangGraph gibi deterministik durum makineleri kullanılmalıdır.
  • Maliyet ve Döngü Koruması: CrewAI gibi geri bildirim alan döngülerde maliyet patlamalarını önleyecek sınırlayıcı politikalar mimariye eklenmelidir.

Orijinal kaynağa buradan ulaşabilirsiniz.


Bu konuyu derinlemesine öğrenmek isterseniz: Production'da Agent Güvenilirliği modülüne göz atın.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →