---
title: "CorrGRPO: Çoklu Ödüllü Öğrenme İçin Korelasyon Normalize Edilmiş GRPO"
url: https://blog.edumints.com/corrgrpo-coklu-odullu-ogrenme-icin-korelasyon-normalize-edil-ggkgn0l3
category: "Yazılım"
date: 2026-10-02T09:08:35.781Z
publisher: Edumints Blog
lang: tr-TR
source_name: "hfpapers"
source_url: https://huggingface.co/papers/2609.36820
---

# CorrGRPO: Çoklu Ödüllü Öğrenme İçin Korelasyon Normalize Edilmiş GRPO

Grup Bağıl Politika Optimizasyonu (**GRPO**), akıl yürütme yeteneklerine sahip modern büyük dil modellerinin pekiştirmeli öğrenme süreçlerinde yaygın olarak tercih edilen bir algoritmadır. Standart GRPO, aynı komut istemine (**prompt**) karşılık üretilen farklı model yanıtları (**rollouts**) genelinde ödülleri merkezileştirip normalize ederek avantaj (**advantage**) değerlerini hesaplar. Ancak gerçek dünya uygulamalarında ve karmaşık otonom sistemlerde tek bir ödül sinyali yeterli olmamakta; modellerin birden fazla hedefi aynı anda optimize etmesi gerekmektedir.

## Çoklu Ödül Sistemlerinde GRPO ve Ölçek Dominansı

Birden fazla ödül bileşeni bulunduğunda GRPO, bu bileşenleri doğrudan toplar ve toplam ödülü grup içi standart sapmaya bölerek normalize eder. Matematiksel olarak bu normalizasyona karşılık gelen varyans, tüm ödül çiftleri arasındaki ikili kovaryansların toplamına eşittir:
- Sabit ve merkezileştirilmiş bir ödül için, toplam kovaryans büyüdükçe daha küçük avantaj değerleri ortaya çıkar; kovaryans küçüldükçe avantaj değerleri büyür.
- Bu yapı, model parametre güncelleme büyüklüklerinin ödüller arasındaki karşılıklı bağımlılığa otomatik olarak uyarlanmasına imkan tanır.
- Ancak yüksek sayısal ölçeğe sahip ve birbiriyle ilişkili ödüller, paydadaki normalizasyon hesabını tamamen domine eder. Sonuç olarak, ölçeği daha küçük olan fakat kritik önem taşıyan diğer ödül sinyalleri bastırılır.

## CorrGRPO: Pearson Korelasyonu ile Dengeleme

Bu darboğazı aşmak amacıyla araştırmacılar, ikili kovaryansları **Pearson korelasyon katsayılarına** normalize eden **CorrGRPO** (Korelasyon Normalize Edilmiş GRPO) yöntemini önermektedir:
- **Merkezi Toplam Ödülü Koruma:** Yöntem, pay kısmında yer alan merkezileştirilmiş toplam ödülü değiştirmeden sabit tutar.
- **Ölçek Bağımsız Normalizasyon:** Farklı büyüklük skalalarına sahip ödül bileşenlerinin normalizasyon paydası üzerindeki etkisini hassas bir şekilde dengeler.
- **Dengeli Gradyan Akışı:** Avantaj büyüklüklerinin ödül korelasyonlarına uyum sağlamasını sürdürürken, büyük ölçekli ödüllerin öğrenme sürecini tekeline almasını engeller.

## Deneysel Sonuçlar ve Pratik Çıkarımlar

CorrGRPO; 0.5B ile 8B parametre aralığındaki modeller üzerinde kod üretimi, araç çağırma (**tool calling**) ve ajan güvenliği alanlarında GRPO ve diğer varyantlarla karşılaştırılmıştır. Bu görevler, ödüllerin hem birlikte geliştiği hem de ödünleşim (**trade-off**) içerdiği çoklu ödül dinamiklerini temsil eder:
- **Üç Alanda Kanıtlanmış Artış:** CorrGRPO; kod üretimi, harici araç çağırma ve ajan güvenliği alanlarının tamamında standart GRPO'ya kıyasla belirgin performans artışı sağlamıştır. Model kodları HKUST-KnowComp/CorrGRPO reposunda açık kaynak olarak sunulmuştur.
- **Yazılım ve Ajan Geliştiricileri İçin Çıkarımlar:** Üretim ortamında otonom ajan geliştiren mühendisler için en büyük zorluklardan biri; araç çağırma sözdizimi, kodun doğruluğu ve güvenlik filtreleri gibi farklı hedefleri tek bir modelde birleştirmektir. CorrGRPO, ödül katsayılarını manuel olarak saatlerce ayarlama ihtiyacını ortadan kaldırır. Küçük ölçekli kritik güvenlik ve format metriklerinin büyük ölçekli ödüller altında ezilmesini önleyerek üretim seviyesinde kararlı bir fine-tuning süreci sunar.

[[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.36820)](https://huggingface.co/papers/2609.36820)

---

Bu konuyu derinlemesine öğrenmek isterseniz: [İleri Akıl Yürütme Teknikleri](https://edumints.com/kesfet/sistematik-prompt-muhendisligi-ve-dspy-ile-program-xpig) modülüne göz atın.

---

**Kaynak:** [hfpapers](https://huggingface.co/papers/2609.36820)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/corrgrpo-coklu-odullu-ogrenme-icin-korelasyon-normalize-edil-ggkgn0l3
