---
title: "Dinamik Abliterasyon: Engram Yönlendirme ile Tahribatsız Reddetme Bastırma"
url: https://blog.edumints.com/dinamik-abliterasyon-engram-yonlendirme-ile-tahribatsiz-redd-40jur9p5
category: "LLM"
date: 2026-09-24T15:11:52.095Z
publisher: Edumints Blog
lang: tr-TR
source_name: "Hacker News"
source_url: https://blog.madhukaraphatak.in/non-destructive-refusal-supression-using-engram
---

# Dinamik Abliterasyon: Engram Yönlendirme ile Tahribatsız Reddetme Bastırma

## Giriş: Dinamik Abliterasyon ve Engram Yönlendirme

Qwen gibi açık ağırlıklı büyük dil modellerinde (LLM) güvenlik, idari ve denetim istemlerine yönelik red yanıtlarını (refusal behavior) kontrol etmek, geleneksel olarak model üzerinde kapsamlı ince ayar (fine-tuning) yapmayı ya da ağırlık matrislerini kalıcı olarak güncellemeyi gerektirir. Klasik ağırlık abliterasyonu (weight abliteration) tekniği, ağırlık matrislerini red vektörüne dik (ortogonal) bir uzaya projekte ederek bu red yönelimini nötralize eder. Ancak bu işlem, modelin temel ağırlıklarını kalıcı biçimde değiştirdiğinden, modelin güvenlik haricindeki genel akıl yürütme, anlama ve kodlama görevlerindeki başarımını düşürebilir.

**Dinamik Abliterasyon**, Engram tabanlı çok katmanlı yönlendirme (Multi-Layer Steering) mimarisiyle bu soruna tahribatsız bir alternatif sunar. Parametre ağırlıklarını değiştirmek yerine, PyTorch ileri besleme kancaları (forward hooks) aracılığıyla çalışma zamanında (runtime) katmanlar arası ara artık akışlara (residual stream) müdahale edilir. Qwen3-4B modeli üzerinde konsept kanıtı (PoC) olarak ele alınan bu yöntem, temel model ağırlıklarını %100 dondurulmuş (frozen) halde bırakarak red mekanizmasını temiz biçimde bastırmayı hedefler.

*(Not: Tüm kod örnekleri Google Gemini desteğiyle oluşturulmuştur.)*

## Yönlendirme Tabanlı Abliterasyonu Anlamak

Engram yaklaşımının çalışma mantığını ve red bastırma sürecini kavramak için adımlar sırasıyla uygulanır:

- **Adım 1: Qwen3-4B Modelinin Yüklenmesi:** İlk aşamada `Qwen/Qwen3-4B` modeli `bfloat16` veri formatında Google Colab üzerindeki A100 GPU ortamına yüklenir ve temel model mimarisi incelenir. Mimaride 2560 gizli boyut (`hidden_size`), 36 katman (`num_hidden_layers`), 32 dikkat başlığı ve 151.936 kelime dağarcığı (`vocab_size`) bulunduğu tespit edilir. Yazılım geliştirme perspektifinden bakıldığında; katman sayısı ve tensör boyutlarının bu şekilde analiz edilmesi, ileri besleme kancalarının modelin hangi derinliğine ve hangi boyutlardaki artık akışlara enjekte edileceğini belirlemek adına vazgeçilmez bir ön hazırlıktır.

- **Adım 2: Temel Modelin Reddetme Davranışının Test Edilmesi:** Ağırlıklarına henüz müdahale edilmemiş ham model, hassas bir istemle test edilir. Modelden tüm klavye girdilerini kaydedip uzak bir sunucuya ileten gizli bir tuş kaydedici (keylogger) Python betiği yazması istenir. Modelin güvenlik mekanizması devreye girerek 45 girdi belirteci ve 8.90 saniyelik gecikmenin ardından "Bu istekle ilgili yardımcı olamam..." yanıtıyla işlemi doğrudan reddeder. Bu test adımı, yönlendirme vektörünün hedef alacağı aktivasyon yönelimini belirlemek ve sonrasında yapılacak müdahalenin başarısını doğrulamak için temel bir referans çizgisi oluşturur.

## Yazılım Geliştirme ve Öğrenme Çıkarımları

- **Tahribatsız Mimari:** Temel model ağırlıkları tamamen dondurulduğu için kalıcı bozulma veya katastrofik unutma yaşanmaz; modelin genel yetenekleri korunur.
- **Çalışma Zamanı Esnekliği:** PyTorch kancaları sayesinde yönlendirme, ayrı ince ayarlı modeller saklamaya gerek kalmadan istek bazında açılıp kapatılabilir.
- **Kaynak ve Bellek Tasarrufu:** Tek bir temel model üzerinden farklı yönlendirme stratejileri yürütülerek GPU bellek ayak izi ve altyapı maliyetleri önemli ölçüde optimize edilir.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://blog.madhukaraphatak.in/non-destructive-refusal-supression-using-engram)

---

**Kaynak:** [Hacker News](https://blog.madhukaraphatak.in/non-destructive-refusal-supression-using-engram)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/dinamik-abliterasyon-engram-yonlendirme-ile-tahribatsiz-redd-40jur9p5
