---
title: "Yapay Zeka Güvenlik Duvarınız Yeşil Yanıyor; Ancak Hiçbir Şeyi Yakalamıyor"
url: https://blog.edumints.com/yapay-zeka-guvenlik-duvariniz-yesil-yaniyor-ancak-hicbir-sey-yaep6v7r
category: "AI Araçları"
date: 2026-10-04T09:08:40.377Z
publisher: Edumints Blog
lang: tr-TR
source_name: "dev.to"
source_url: https://dev.to/rudratosh/your-ai-guardrail-is-green-its-also-catching-nothing-5eel
---

# Yapay Zeka Güvenlik Duvarınız Yeşil Yanıyor; Ancak Hiçbir Şeyi Yakalamıyor

Bir güvenlik bariyerinin (guardrail) sizi yarı yolda bırakmasının üç farklı yolu vardır. Bunların ikisi oldukça gürültülüdür; üçüncüsü ise adeta sessiz bir katildir:

- **Çökmüş olması:** Yanlış yapılandırılmış, devreye alınamamış veya tamamen çökmüştür. Bunu çok hızlı fark edersiniz; sistem hataları, uyarı bildirimleri, kıpkırmızı panolar ve gece 03:00'te gelen nöbetçi çağrısı. Acı vericidir ama dürüsttür.
- **Zayıf olması:** Çalışır, bazı saldırıları yakalar, bazılarını ise gözden kaçırır. Ölçülebilir, üzerinde tartışılabilir ve iyileştirilebilir. Bu da dürüst bir başarısızlıktır.
- **Kusursuz çalışıp hiçbir şeyi engellememesi:** Sistem tıkır tıkır işler, tüm sağlık kontrollerinden başarıyla geçer, her istekte geçerli puanlar döner; fakat yapılandırması gereği hiçbir şeyi yakalayamaz. Hata yoktur, uyarı yoktur, kırmızıya dönen hiçbir panel yoktur.

Asıl büyük sorun bu üçüncü senaryodur çünkü hiçbir belirti göstermez. İzleme sisteminiz "guardrail: sağlıklı ✅" der ve gerçeği söyler. Sistem gerçekten sağlıklıdır; sadece bir güvenlik bariyeri gibi davranmamaktadır.

## Yapay Zeka Mimarilerinin Duman Dedektörü

Bugün bir yapay zeka ajanı geliştiren herkes, modele giren metinleri tarayan ve saldırı sezdiğinde alarm veren bir prompt-injection (istek enjeksiyonu) dedektörü entegre eder. Bu, yapay zeka dünyasının duman dedektörüdür: Kurarsınız, yeşil ışığı görürsünüz ve yolunuza devam edersiniz.

Bu varsayımı test etmek amacıyla, AgentDojo veri kümesinden alınan 629 gerçek saldırı senaryosu; faturalar, e-postalar ve web sayfaları gibi gerçekçi araç çıktılarına gömüldü. Ardından 10 açık kaynak dedektör, bu 629 gömülü saldırı ve her şeye alarm verenleri ayırt etmek için eklenen 97 zararsız çıktı üzerinde test edildi.

## Meta Prompt Guard 2 ve %1 Yakalama Oranı

Sektörde sıkça adı geçen Meta Prompt Guard 2, araç çıktılarına gizlenmiş 629 saldırının yalnızca 6'sını (%1) yakalayabildi. İlk bakışta modelin yetersiz olduğu düşünülebilir; oysa model istek bazında şu sonuçları üretiyordu:

| Metin Türü | Prompt Guard 2 Skoru | Karar Eşiği (Threshold) | Sonuç |
| :--- | :--- | :--- | :--- |
| **Saldırı (Attack)** | ~0.009 | 0.5 | ✅ İZİN VER (ALLOW) |
| **Zararsız (Benign)** | ~0.0008 | 0.5 | ✅ İZİN VER (ALLOW) |

Saldırı skoru, zararsız metne kıyasla yaklaşık 10 kat daha yüksektir. Yani modelin ayrıştırma yeteneği kusursuzdur. Ancak ikili sınıflandırıcıların varsayılan **0.5** karar eşiği uygulandığında, hem saldırı (0.009) hem de normal içerik (0.0008) eşiğin çok altında kalır. Sonuç olarak sistem tüm isteklere onay verir. Eşik değeri, gömülü saldırılar için yaklaşık 50 kat sapmıştır. Sensör kusursuzdur; fakat alarm yalnızca bir süpernova patladığında çalacak şekilde ayarlanmıştır.

## Yazılım Geliştiriciler İçin Pratik Çıkarımlar

- **Varsayılan Eşik Değerlerine Güvenmeyin:** Güvenlik sınıflandırıcılarını doğrudan 0.5 eşiğiyle canlıya almayın. Kendi veri dağılımınıza göre ROC/AUC eğrilerini çıkarıp eşikleri kalibre edin.
- **Gerçekçi Bağlamlarla Test Edin:** Saldırı tespitini laboratuvar ortamındaki yalın metinlerle değil; araç çıktılarına, tablolara ve e-postalara gömülü kirli yüklerle doğrulayın.
- **Skor Dağılımını Gözlemleyin:** Yalnızca HTTP 200 ve çalışma sürelerini değil, dedektörün ürettiği ham güven skorlarının dağılımını da observabilite pipeline'ınıza dahil edin.

[[Orijinal kaynağa buradan ulaşabilirsiniz.](https://dev.to/rudratosh/your-ai-guardrail-is-green-its-also-catching-nothing-5eel)](https://dev.to/rudratosh/your-ai-guardrail-is-green-its-also-catching-nothing-5eel)

---

Bu konuyu derinlemesine öğrenmek isterseniz: [Inference Saldırıları](https://edumints.com/kesfet/ai-altyapi-guvenligi-model-supply-chain-ve-artifac-ja5f) modülüne göz atın.

---

**Kaynak:** [dev.to](https://dev.to/rudratosh/your-ai-guardrail-is-green-its-also-catching-nothing-5eel)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/yapay-zeka-guvenlik-duvariniz-yesil-yaniyor-ancak-hicbir-sey-yaep6v7r
