---
title: "ActReview: Eyleme Dönüştürülebilir Hakem Değerlendirmeleri İçin Yanıt Odaklı Eğitim ve Rubrik Ödülleri"
url: https://blog.edumints.com/actreview-eyleme-donusturulebilir-hakem-degerlendirmeleri-ic-idvrafu6
category: "Yazılım"
date: 2026-09-13T09:07:54.357Z
publisher: Edumints Blog
lang: tr-TR
source_name: "hfpapers"
source_url: https://huggingface.co/papers/2609.09076
---

# ActReview: Eyleme Dönüştürülebilir Hakem Değerlendirmeleri İçin Yanıt Odaklı Eğitim ve Rubrik Ödülleri

## Eyleme Dönüştürülebilir Geri Bildirim İhtiyacı

Büyük dil modelleri (LLM'ler), akademik çalışmaların ve teknik dökümanların sunum öncesi öz değerlendirme (pre-submission self-review) süreçlerinde giderek daha yaygın şekilde kullanılmaktadır. Ancak mevcut değerlendirmelerin yalnızca eksiklikleri listelemesi yeterli olmamakta; yazarları ve geliştiricileri somut düzeltmelere yönlendiren yapıcı geri bildirimlere duyulan ihtiyaç hızla artmaktadır. **ActReview** çalışması, bu süreci "Eyleme Dönüştürülebilir Hakem Değerlendirmesi Üretimi" (Actionable Peer-review Generation) olarak ele almakta ve problemi birbirini tamamlayan iki temel alt göreve ayırmaktadır:

- **Teşhis İddiası Üretimi (Diagnostic Claim Generation):** İncelenen çalışmadaki zayıflıkların ve metodolojik açıkların, metin içi yerel kanıtlarla (localized paper evidence) doğrudan eşleştirilerek tespit edilmesi.
- **Revizyon Önerisi Üretimi (Revision Suggestion Generation):** Belirlenen bu zayıflıkları gidermek üzere yazara yol gösteren somut, eyleme dökülebilir ve gerekçelendirilmiş bir revizyon planının sunulması.

## Rebuttal Verisiyle Denetim ve Eğitim Mimarisi

Araştırmanın temel içgörüsü, yazarların hakem eleştirilerine sundukları resmi yanıtlara (rebuttal) dayanmaktadır. Bu yanıtlar, hakem endişelerini gidermek için uygulanabilecek en gerçekçi aksiyonları ortaya koyar; dolayısıyla revizyon odaklı geri bildirim için doğal ve güçlü bir gizil denetim (latent supervision) sağlar. 

Araştırmacılar, OpenReview üzerindeki gerçek hakem-yazar tartışma dizilerini analiz ederek zayıflık bildirimleri ile yazar yanıtlarını hizalamış ve yerel kanıtlarla desteklenen **ActReview-40K** veri setini inşa etmiştir.

Modelin eğitim ve değerlendirme aşamaları şu adımlarla gerçekleştirilmiştir:
- **Qwen3-8B-Base** modeli, yerelleştirilmiş kanıtlarla zenginleştirilmiş çok görevli gözetimli ince ayar (multi-task SFT) sürecinden geçirilmiştir.
- Ardından, adaya duyarlı ve zayıflığa özgü rubrik ödülleri (rubric rewards) kullanan **GRPO** (Group Relative Policy Optimization) pekiştirmeli öğrenme algoritması ile hizalanmıştır.
- Teşhis kalitesini ve revizyonların kullanışlılığını ölçmek amacıyla insan kürasyonundan geçmiş 1.000 örneklik **ActReview-Bench** kıyaslama seti sunulmuştur.

## Deney Sonuçları ve Yazılım Geliştirme Çıkarımları

Deneyler, ActReview'un eyleme dönüştürülebilirlik ve kanıta dayandırma (grounding) boyutlarında önceki uzmanlaşmış modelleri geride bıraktığını, güçlü genel prompt tabanlı LLM'lerle ise başa baş rekabet ettiğini kanıtlamaktadır. İnsan değerlendirmeleri revizyon önerilerinin pratik faydasını doğrularken, teknik doğrulukta kapatılması gereken bir açık kaldığını göstermektedir. Ayrıca model, test edilmemiş yeni makalelere başarıyla genellenmekte ve bağımsız değerlendiricilere karşı yüksek direnç sergilemektedir.

**Yazılım geliştiriciler ve AI ekipleri için pratik çıkarımlar:**
- **Eleştiriden Çözüm Üretimine Geçiş:** Otomatik kod inceleme sistemlerinde yalnızca "kod kokusu" (code smell) veya hata işaretlemek yerine, geliştiriciye doğrudan uygulanabilir refactoring planları sunulmalıdır.
- **Doğal Etkileşimlerden Golden Dataset Üretimi:** GitHub PR tartışmaları ve geliştirici yanıtları, revizyon odaklı kod inceleme asistanlarını eğitmek için mükemmel bir veri kaynağı oluşturur.
- **Rubrik Tabanlı Pekiştirmeli Öğrenme:** Modelleri yalnızca ikili (doğru/yanlış) metriklerle değil, amaca yönelik detaylı rubrik ödülleriyle optimize etmek çıktıların pratik yararlılığını belirgin biçimde artırır.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.09076)

---

Bu konuyu derinlemesine öğrenmek isterseniz: [Golden Dataset Oluşturma](https://edumints.com/kesfet/ai-sistemleri-test-ve-degerlendirme-ragas-promptfo-9hmv) modülüne göz atın.

---

**Kaynak:** [hfpapers](https://huggingface.co/papers/2609.09076)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/actreview-eyleme-donusturulebilir-hakem-degerlendirmeleri-ic-idvrafu6
