---
title: "SantanderAI/autoguardrails: LLM Güvenlik Protokolleri ve Hizalama Araştırmaları İçin Minimalist Bir Çatı"
url: https://blog.edumints.com/santanderaiautoguardrails-llm-guvenlik-protokolleri-ve-hizal-2zrnkkjb
category: "Yazılım"
date: 2026-06-19T09:06:34.300Z
publisher: Edumints Blog
lang: tr-TR
source_name: "GitHub"
source_url: https://github.com/SantanderAI/autoguardrails
---

# SantanderAI/autoguardrails: LLM Güvenlik Protokolleri ve Hizalama Araştırmaları İçin Minimalist Bir Çatı

## SantanderAI/autoguardrails Nedir ve Neden Önemlidir?
**SantanderAI/autoguardrails**, büyük dil modellerinin (LLM) güvenliğini ve hizalamasını (alignment) optimize etmek amacıyla geliştirilmiş açık kaynaklı bir araştırma çatısıdır. Andrej Karpathy'nin "autoresearch" yaklaşımından esinlenen bu kütüphane, karmaşık kod tabanlarında veya eğitim betiklerinde değişiklik yapmak yerine güvenlik politikalarını tek bir dosya üzerinden yönetmeyi hedefler. Geliştiriciler ve yapay zeka güvenliği araştırmacıları için bu aracın değeri, hizalama deneylerini son derece hızlı, ölçülebilir ve tekrarlanabilir hale getirmesinde yatmaktadır. Modelin jailbreak gibi kötü niyetli saldırılara karşı direncini artırırken günlük işlevlerini yerine getirme yeteneğini (benign-pass rate) korumasına yardımcı olur. Böylece yapay zeka uygulamalarının beklenmedik ve zararlı çıktılar üretmesi engellenir.

## Temel Çalışma Prensibi ve Pratik Kullanım
Projenin merkezinde, deneyler sırasında güncellenen tek dosya olan `policy.md` yer alır. Sabit bir değerlendirme seti (`eval_suite.jsonl`) ve yargıç şablonu kullanılarak, yapılan her politika değişikliğinin etkililiği ölçülür. Bir aday politikanın kabul edilmesi için saldırı başarı oranının (**Attack Success Rate - ASR**) düşmesi ve normal sorguları yanıtlama oranının en fazla %2 azalması gerekir.

Pratik kullanım adımları şu şekildedir:

- **Başlangıç Noktası Belirleme (Baseline):** İlk olarak mevcut politikanın performansını ölçmek için bir referans noktası kaydedilir:
  ```bash
  python -m autoguardrails baseline --reset --repeat 2 --notes "ilk baseline"
  ```
- **Politika Değişikliği:** Sadece `policy.md` dosyası düzenlenerek yeni kurallar eklenir.
- **Adayı Test Etme ve Skorlama:** Yeni politika test edilerek baseline ile karşılaştırılır:
  ```bash
  python -m autoguardrails candidate --repeat 2 --notes "jailbreak koruması eklendi"
  ```
Tüm kararlar otomatik olarak `results.tsv` dosyasına kaydedilerek deneylerin geçmişi şeffaf bir şekilde izlenebilir.

## Benzer Araçlarla Karşılaştırma
Piyasada LLM güvenliği için kullanılan **Llama Guard**, **Guardrails AI** veya **NeMo Guardrails** gibi araçlar genellikle çalışma zamanı filtreleme ve karmaşık yazılım mimarilerine odaklanır. Bu sistemler genellikle karmaşık entegrasyonlar gerektirir. `autoguardrails` ise doğrudan bir "araştırma iskelesi" (scaffold) olarak konumlanır. Karmaşık konfigürasyon dosyaları veya kod değişiklikleri gerektirmek yerine, arama uzayını yalnızca `policy.md` metin dosyası ile sınırlandırarak hızlı iterasyon sağlar. Bu yönüyle bir üretim ortamı filtresinden ziyade, güvenlik politikalarının sistematik olarak optimize edildiği bir deney laboratuvarı işlevi görür.

Geliştiriciler, kod yazma yükünü tamamen ortadan kaldıran bu yapı sayesinde doğrudan modelin davranış kurallarına ve güvenlik direktiflerine odaklanabilirler. Bu basitlik ve odaklanmışlık, projeyi diğer karmaşık hizalama çözümlerinden ayırır.

Orijinal repoya [buradan](https://github.com/SantanderAI/autoguardrails) ulaşabilirsiniz.

---

**Kaynak:** [GitHub](https://github.com/SantanderAI/autoguardrails)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/santanderaiautoguardrails-llm-guvenlik-protokolleri-ve-hizal-2zrnkkjb
