---
title: "When2Think: Verimli Hibrit Akıl Yürütme Modelleri İçin Zorluk Duyarlı Uzunluk Kontrolü"
url: https://blog.edumints.com/when2think-verimli-hibrit-akil-yurutme-modelleri-icin-zorluk-2gigc7ef
category: "LLM"
date: 2026-09-18T09:10:08.826Z
publisher: Edumints Blog
lang: tr-TR
source_name: "hfpapers"
source_url: https://huggingface.co/papers/2609.19671
---

# When2Think: Verimli Hibrit Akıl Yürütme Modelleri İçin Zorluk Duyarlı Uzunluk Kontrolü

Büyük Akıl Yürütme Modelleri (**LRM**'ler), karmaşık görevlerde etkileyici bir başarım sergileseler de sistematik bir verimsizlik problemiyle karşı karşıyadır: Basit problemlerde gereğinden fazla düşünürken (**overthinking**), zor ve çok adımlı problemlerde ise yeterince derin akıl yürütemezler (**underthinking**).

## Mevcut Yaklaşımların Sınırları ve Verimlilik Bedeli

Tekdüze uzunluk cezaları veya katı yönlendirme (**routing**) mekanizmalarına dayanan geleneksel yaklaşımlar ciddi bir "verimlilik vergisi" öder. Bu yöntemler, basit örneklerde hesaplama yükünü azaltmayı hedeflerken, zor görevlerde belirgin bir doğruluk kaybına yol açarak sistemin genel performansını olumsuz etkiler.

## When2Think ve Dinamik Hesaplama Dağıtımı

**When2Think**, verimli akıl yürütmeyi örnek bazlı ve uyarlanabilir bir hesaplama kaynağı tahsisi problemi olarak ele alır. Modelin problem zorluğuna göre hesaplama gücünü dinamik şekilde dağıtmasını sağlayan hibrit bir **post-training** (eğitim sonrası) çatısı sunar:

- **IDAC (Örnek Düzeyinde Zorluk Duyarlı Kontrol):** Akıl yürütme derinliğini düzenlemek için önceden hesaplanmış referans istatistiklerinden (doğruluk oranları ve token tüketimi) yararlanan bir ödül şekillendirme mekanizmasıdır.
- **Doğrulayıcı Tabanlı Ödüller ve Stabil Optimizasyon:** IDAC; doğrulayıcı (verifier) ödülleri ve yığın düzeyinde standardize edilmiş avantajlar ile birleştiğinde, öğrenilmiş ödül modellerine veya çevrim içi referans sorgularına gerek duymadan istikrarlı ve **critic-free** (eleştirmensiz) bir optimizasyon sağlar.
- **Sistem 1 ve Sistem 2 Uyumu:** Basit girdilerde doğrudan yanıt vermeyi (**Sistem 1 - NoThink**) teşvik ederken, karmaşık problemlerde uzun zincirleme akıl yürütmeyi (**Sistem 2 - Think**) muhafaza eder ve modelin ne zaman derin düşüneceğini öğrenmesini sağlar.

## Deneysel Başarı ve Benchmark Sonuçları

Matematiksel kıyaslama testleri, When2Think mimarisinin doğruluk-verimlilik dengesini açıkça iyileştirdiğini göstermektedir:
- **AIME24 Başarımı:** Temel modele kıyasla token kullanımını **%27,9** oranında azaltırken, Pass@3 başarımında **%10,0**'luk net bir artış yakalamıştır.
- **AIME25 Başarımı:** **%40,0 Pass@3** değerine ulaşarak model sıkıştırma ve yalnızca yönlendirme odaklı temel çözümleri geride bırakmıştır.

## Yazılım Geliştiriciler İçin Pratik Çıkarımlar

- **Akıllı Token ve Maliyet Yönetimi:** Üretim ortamlarında tüm kullanıcı sorgularına sabit düşünme bütçesi ayırmak hem gecikmeyi (**latency**) hem de API faturalarını artırır. Girdinin zorluk seviyesine duyarlı dinamik token kontrolü maliyetleri optimize eder.
- **Altyapı Yükünü Azaltan RL:** Harici bir critic veya sürekli aktif referans model gerektirmeyen optimizasyon mimarisi, LLM fine-tuning süreçlerinde GPU bellek ve işlem maliyetini düşürür.
- **Hibrit Çıkarım Mimarileri:** Geleceğin yapay zekâ uygulamalarında geliştiriciler, hızlı sezgisel yanıtlar ile derin analitik süreçler arasında dinamik geçiş yapabilen hibrit modelleri tercih etmelidir.

[[Orijinal kaynağa buradan ulaşabilirsiniz.](https://huggingface.co/papers/2609.19671)](https://huggingface.co/papers/2609.19671)

---

Bu konuyu derinlemesine öğrenmek isterseniz: [İleri Akıl Yürütme Teknikleri](https://edumints.com/kesfet/sistematik-prompt-muhendisligi-ve-dspy-ile-program-xpig) modülüne göz atın.

---

**Kaynak:** [hfpapers](https://huggingface.co/papers/2609.19671)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/when2think-verimli-hibrit-akil-yurutme-modelleri-icin-zorluk-2gigc7ef
