DevOps·2 dk okuma·

Ne Zaman Tahmin Etmeyeceğini Bilen Bir Yapay Zeka Ajanı Geliştirmek (Qwen + MCP)

Paylaş
Ne Zaman Tahmin Etmeyeceğini Bilen Bir Yapay Zeka Ajanı Geliştirmek (Qwen + MCP)

Yapay zeka (YZ) ajanlarının en büyük ve en maliyetli problemlerinden biri, bilmedikleri ya da yeterli veriye sahip olmadıkları konularda bile kendinden son derece emin bir şekilde yanlış cevaplar (yani halüsinasyonlar) üretmesidir. Daniel Nwaneri, "Recona" adını verdiği ve ödeme mutabakat süreçlerini otomatikleştiren bir yapay zeka ajanı inşa ederken tam olarak bu güvenilirlik sorunuyla karşılaştı. Qwen bulut modelleri ve Model Context Protocol (MCP) kullanarak açık faturalar ile gelen ödemeleri eşleştirmeyi amaçlayan bu proje, beklenmedik bir senaryoyla karşılaştığında sistemin nasıl davranması gerektiğine dair çok değerli dersler sunuyor.

Recona Neler Yapıyor ve Nasıl Çalışıyor?

Recona, serbest çalışanlar veya küçük işletmeler için gelen ödemeleri açık faturalarla eşleştiren ve gecikmiş alacaklar için otomatik hatırlatıcılar gönderen bir yapay zeka ajanıdır. Cloudflare Workers ve D1 veritabanı altyapıyı sağlarken, Qwen modeli karar mekanizması olarak çalışır. Geliştirici, "model önerir, deterministik kod karar verir" kuralını benimsemiştir. Yani, nihai işlem onayı sadece modele bırakılmaz; kod seviyesinde tutar ve para birimi doğrulaması yapılır.

  • Yazılım Geliştirme Çıkarımı: Kritik finansal iş süreçlerinde yapay zeka modellerine asla körü körüne güvenmeyin. Karar mekanizmalarında deterministik (kesin kurallı) kod kontrollerini son onay aşaması olarak kullanmak, sistem güvenliği için kritik bir zorunluluktur.

Demoda Ne Bekleniyordu ve Ne Gerçekleşti?

Planlanan senaryoda, bir müşterinin faturanın yarısı kadar ödeme yapması durumunda Qwen'in faturayı doğru eşleştirmesi, ancak tutar uyuşmadığı için kod katmanındaki deterministik engelin işlemi durdurması bekleniyordu. Ancak gerçek senaryoda Qwen, doğru faturayı içsel olarak akıl yürütme (reasoning) sürecinde bulmasına rağmen, faturayı kesin olarak onaylamadı ve %30 güven skoru döndürdü. Model, yetersiz veriyle tahminde bulunmaktansa dürüstçe belirsizliğini bildirmeyi seçti.

  • Yazılım Geliştirme Çıkarımı: Yapay zeka projelerinde modelleri hata yapmamaya zorlamak yerine, belirsizlik durumlarını dürüstçe raporlamaya teşvik eden yönlendirmeler (prompting) tasarlamalısınız. Modelin bilmediğini söylemesi, yanlış tahmin yürütmesinden çok daha değerlidir.

Dürüst Versiyon Neden Çok Daha İyi Bir Demodur?

Geliştiriciler genelde modellerin yanlış kararlarını yakalamaya odaklanırlar. Oysa asıl başarı, belirsizliğin kendisini birinci sınıf bir çıktı (first-class output) olarak kabul edip iş akışını buna göre tasarlamaktır. Qwen'in %30 güven skoru döndürmesi, sistemin doğrudan insan onayına (human-in-the-loop) yönlendirilmesi için net bir sinyaldir.

  • Öğrenim: Her şeyi bildiğini iddia edin bir stajyerdense, "Bundan %30 eminim çünkü veriler eksik" diyen bir yardımcıya çok daha fazla güvenebilirsiniz.
  • Pratik Çıkarım: Güvenlik katmanlarınızı modelin belirsizlik seviyesine göre kural tabanlı hale getirin. Güven skoru düşük olduğunda sistemi doğrudan insan onayına aktaran dinamik onay kapıları (approval gates) oluşturun.

Orijinal kaynağa buradan ulaşabilirsiniz.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →