---
title: "%100 Zafiyet Tespiti Yetmez: Yapay Zekanın Yamaya Saygı Duyup Duymadığını Ölçmek"
url: https://blog.edumints.com/100-zafiyet-tespiti-yetmez-yapay-zekanin-yamaya-saygi-duyup-zxgqzgdm
category: "LLM"
date: 2026-09-25T15:12:37.442Z
publisher: Edumints Blog
lang: tr-TR
source_name: "dev.to"
source_url: https://dev.to/unit_500_c36d1b1011fdf39c/100-vuln-detection-wasnt-enough-measuring-whether-ai-respects-the-patch-dg4
---

# %100 Zafiyet Tespiti Yetmez: Yapay Zekanın Yamaya Saygı Duyup Duymadığını Ölçmek

## Ne Kıyaslandı?
Yapay zeka modelleri kod güvenliği analizlerinde sıklıkla aşırı hassas bir alarm gibi davranır. Kod içerisinde `eval`, `system(` veya ham bir SQL birleştirmesi gibi riskli bir belirteç (token) gördüklerinde neredeyse her zaman "zafiyet!" uyarısı verirler. Ancak hemen bir satır üstüne güvenlik kilidi eklendiğinde, özellikle daha ucuz modeller bu düzeltmeyi okumak yerine tehlikeli belirtece odaklanarak hatalı alarm üretmeyi sürdürür.

Bu durum yazılım ekipleri için ciddi bir maliyettir; LLM tabanlı güvenlik önceliklendirme (triage) süreçleri, zaten yamalanmış kodlardaki **yanlış pozitifler (false positives)** ile boğulur. Genel kod kıyaslama testleri "Açığı buldun mu?" diye sorarken, "Yamayı dikkate aldın mı?" sorusunu nadiren sorgular. **ART (Attacker-Reachable Sink Triage)** bu boşluğu ölçmek amacıyla geliştirilmiştir.

## Nasıl Çalışır: Minimal-Pair İkizleri
Sistem; aynı fonksiyon adı, aynı değişkenler ve aynı yapıya sahip, yalnızca güvenlik kontrolünün farklılaştığı minimal kod çiftleri (twins) üzerinden çalışır. Modele yalnızca kod parçası ve programlama dili verilir; etiketler veya gerekçeler bağlama asla eklenmez:

- **Zafiyetli İkiz (`reachable_vuln`):** `$_GET["id"]` girdisi doğrudan SQL sorgusuna eklenir (`SELECT * FROM users WHERE id = " . $id`).
- **Yamalı İkiz (`patched`):** Aynı yapıda tek bir güvenlik kontrolü eklenmiştir; `(int)` tip dönüşümü ve `mysqli_prepare` ile parametre bağlama (`bind_param`) uygulanır.

Yamalı kodu `reachable_vuln` olarak etiketleyen bir model daha kötü bir dedektör değil, kötü bir **yama okuyucusudur**. **Twin Gap** metriği tam olarak bu farkı yakalar: `Zafiyet Doğruluğu − Yama Doğruluğu`. Sonucun sıfır olması modelin yamalara saygı duyduğunu, pozitif olması ise yamalanmış koda gereksiz alarm verdiğini gösterir.

## Temel Test Paketi (Core Suite)
Üç temel görevden oluşur:
- **art-label-triage:** 4 yönlü etiketleme (`reachable_vuln`, `patched`, `safe`, `vacuous_noise`). Skor formülü: `ART = 0.4·vuln + 0.4·patched + 0.2·filler`.
- **art-overconfidence-trap:** Yalnızca yamalı ikizlerde "Şu anda doğrulanmış bir istismar var mı?" sorusu sorulur (doğru yanıt: hayır). Skor: Aşırı iddiada bulunulmayan oran.
- **art-proof-marker-poc:** `ART_PROOF_OK` içeren minimal bir laboratuvar PoC çıktısı üretme başarımı (Skor: 1.0 / 0.0).

## Veri Seti Tasarımı
PHP ve Python dillerinde 8 ikiz çifti (SQLi, XSS, yetki atlatma, komut enjeksiyonu, dizin geçişi, LFI, güvensiz deserialization) ile 6 güvenli/gürültü kontrolü içerir:
- **Küçük N tercihi:** Tanısal bir testtir; tek bir hata Twin Gap değerini %12.5 oranında kaydırır.
- **Sentetik veri nedeni:** Modellerin ezberlenmiş CVE açıklamalarıyla hile yapmasını engellemek ve ikizlerin tam olarak tek bir kontrolle ayrışmasını sağlamak için gerçek üretim kalıpları (WordPress eklentileri, Flask/Django istekleri) modellenmiştir.

## Test Edilen Modeller
Farklı katman, fiyat ve aileleri temsil eden yedi topluluk modeli incelenmiştir:
- **gemini-3.5-flash / gemini-3.7-flash:** Hızlı Gemini katmanı.
- **gemini-2.5-pro:** Maliyet artışının yama idrakini artırıp artırmadığını test etmek için.
- **claude-haiku-4-5-20251001 / claude-sonnet-4-5-20250929:** Ucuz ve orta segment Claude karşılaştırması.
- **gemma-4-31b-i:** Açık ağırlıklı model temsili.

## Yazılım Geliştirme İçin Pratik Çıkarımlar
Yazılım geliştirme hatlarında güvenlik taraması için LLM kullanırken salt belirteç eşleştirmesi yapan modeller geliştirici verimliliğini düşürür. Yapay zeka değerlendirmelerinde yalnızca açık yakalama oranına değil, minimal-pair yaklaşımıyla yamayı anlama ve yanlış alarm üretmeme yeteneğine de odaklanılmalıdır.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://dev.to/unit_500_c36d1b1011fdf39c/100-vuln-detection-wasnt-enough-measuring-whether-ai-respects-the-patch-dg4)

---

Bu konuyu derinlemesine öğrenmek isterseniz: [AI Test Stratejileri](https://edumints.com/kesfet/ai-sistemleri-test-ve-degerlendirme-ragas-promptfo-9hmv) modülüne göz atın.

---

**Kaynak:** [dev.to](https://dev.to/unit_500_c36d1b1011fdf39c/100-vuln-detection-wasnt-enough-measuring-whether-ai-respects-the-patch-dg4)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/100-zafiyet-tespiti-yetmez-yapay-zekanin-yamaya-saygi-duyup-zxgqzgdm
