---
title: "PLC-DPO: Gürültülü ve Belirsiz Tercih Optimizasyonunda Sonsal Etiket Düzeltme"
url: https://blog.edumints.com/plc-dpo-gurultulu-ve-belirsiz-tercih-optimizasyonunda-sonsal-g59u7814
category: "Makine Öğrenmesi"
date: 2026-09-14T09:08:01.694Z
publisher: Edumints Blog
lang: tr-TR
source_name: "hfpapers"
source_url: https://huggingface.co/papers/2608.30597
---

# PLC-DPO: Gürültülü ve Belirsiz Tercih Optimizasyonunda Sonsal Etiket Düzeltme

## Giriş ve Problem Tanımı

Büyük dil modellerinin insan tercihleriyle hizalanması (alignment) sürecinde **Doğrudan Tercih Optimizasyonu (Direct Preference Optimization - DPO)**, ikili karşılaştırmalar yoluyla model eğitimini basitleştiren güçlü bir yöntemdir. Ancak standart DPO yaklaşımı, veri kümesindeki tüm gözlemlenen tercihlerin tamamen doğru ve güvenilir olduğu kritik varsayımına dayanır. Gerçek dünya veri kümelerinde ise bu varsayım sıklıkla geçersiz kalır. İnsan değerlendiricilerin anlaşmazlıkları, öznel yargılar veya veri etiketleme hataları sebebiyle **ters çevrilmiş (reversed)**, **zayıf (weak)** ya da **belirsiz (ambiguous)** etiketler ortaya çıkar. Bu hatalı etiketler, eğitim sırasında model politikasında zararlı güncellemelere (harmful policy updates) yol açarak model performansını ve güvenilirliğini olumsuz etkiler.

## PLC-DPO: Çevrim İçi Kanıta Dayalı Yönlendirme

Bu temel sorunu çözmek için araştırmacılar **Posterior Label Correction DPO (PLC-DPO)** yöntemini önermektedir. PLC-DPO, tercih optimizasyonunu gürültüye karşı dayanıklı kılmak adına her bir veri çiftinin eğitim sinyalini dinamik olarak analiz eder ve üç ana gruba yönlendirir:

- **Temiz Durumlar (Clean):** Tercih yönü net ve güvenilir olan çiftler, standart denetimli sinyalle eğitilmeye devam eder.
- **Ters Çevrilmiş Durumlar (Flip):** Etiketinin ters olduğu saptanan çiftlerin denetim yönü aktif olarak düzeltilerek modele doğru yön aktarılır.
- **Beraberlik Durumları (Tie):** Belirsiz, çelişkili veya zayıf yönlü çiftler nötrleştirilerek modelin hatalı sinyallerle bozulması engellenir.

PLC-DPO'nun merkezindeki ana fikir, kalibre edilmiş politika-referans marjını (calibrated policy-reference margin) anlık bir çevrim içi kanıt (online evidence) olarak değerlendirmektir. Bu mekanizma, gürültülü tercih öğrenimini şüpheli örnekleri basitçe eleyen veya silen (filtering) pasif yaklaşımların ötesine geçirir; denetim sinyalinin yönünü ve şiddetini aktif biçimde düzelten yenilikçi bir paradigma oluşturur.

## Kapsamlı Kıyaslama ve Dayanıklılık Sonuçları

Geniş ölçekli deneyler PLC-DPO'nun etkinliğini somut metriklerle doğrulamaktadır:

- **Yüksek Kazanma Oranı:** 57 farklı veri kümesi, model ve kıyaslama (benchmark) hücresi genelinde PLC-DPO, klasik DPO'ya karşı ortalama **%60.5** kazanma oranı elde etmiştir. Bu skor, en iyi alternatif yöntemin ulaştığı **%55.5** değerini belirgin biçimde geride bırakmaktadır.
- **Stres Testleri ve Kararlılık:** Yapay olarak enjekte edilen gürültü ve beraberlik stres testleri, insan uyuşmazlığı analizleri ve öz-doğrulama tanıları; yönlendirme mekanizmasının yüksek kararlılık sergilediğini ve ters etiketlenmiş çiftleri zayıf yönlü olanlardan başarıyla ayrıştırdığını kanıtlamaktadır.

## Yazılım Geliştirme ve Öğrenme İçin Pratik Çıkarımlar

Bu çalışma, yapay zekâ ve MLOps mühendisleri için kritik pratik ilkeler sunar:

- **Veri İsrafını Önleme:** Gürültülü verileri doğrudan eğitim dışı bırakmak değerli bağlamsal bilgilerin kaybına neden olur; denetim sinyalini akıllıca yönlendirmek veri verimliliğini artırır.
- **Eğitim Esnasında Kalite Kontrolü:** Modelin kendi referans marjlarını dinamik bir doğrulama kanıtı olarak kullanmak, veri temizleme maliyetlerini düşürür ve hizalama boru hatlarını daha güvenilir kılar.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2608.30597)

---

**Kaynak:** [hfpapers](https://huggingface.co/papers/2608.30597)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/plc-dpo-gurultulu-ve-belirsiz-tercih-optimizasyonunda-sonsal-g59u7814
