---
title: "Aynı Three.js Görevinde 10 Model ve Harness Kombinasyonunun Karşılaştırması"
url: https://blog.edumints.com/ayni-threejs-gorevinde-10-model-ve-harness-kombinasyonunun-k-82vxzmsj
category: "Web"
date: 2026-09-08T07:11:11.604Z
publisher: Edumints Blog
lang: tr-TR
source_name: "Hacker News"
source_url: https://alvins82.github.io/hangar-harness-model-tests/
---

# Aynı Three.js Görevinde 10 Model ve Harness Kombinasyonunun Karşılaştırması

Yapay zekâ destekli otonom kodlama ajanlarının başarısı yalnızca seçilen temel modele değil, modelin çalıştığı araç ve yürütme ortamına (harness) da doğrudan bağlıdır. Bu çalışmada `/goal` modu altında, karmaşık bir Three.js bilimkurgu hangarı (hovering dronlar, uyarı ışıkları, ışıltılı pist şeritleri, hacimsel sis düzlemleri, formasyon geçişi ve sinematik kamera yolu içeren tek bir HTML dosyası) oluşturma istemi 10 farklı model ve harness kombinasyonuyla test edilmiştir.

## Test Edilen 10 Model ve Harness Kombinasyonu

- **GLM 5.3 Flash Max (Codex Open):** 9 dakika sürdü; 475.143 toplam token tüketti, 1 araç hatası aldı ve tarayıcı doğrulama adımı engellendi.
- **Luna 5.6 Max (Codex Open):** 9 dakika 13 saniyede tamamlandı; 32 araç çağrısı yaptı, hem tarayıcıyı açtı hem de ekran görüntülerini başarıyla denetledi.
- **SOL 5.6 Max (Codex Open):** 10 dakika 48 saniye sürdü; 21 araç çağrısında 5 hata aldı, tarayıcı açma ve görsel ekran kontrolü gerçekleştiremedi.
- **Astra 6.0 Max (Codex Open):** 37 dakika 29 saniyelik uzun bir sürede tamamlandı; 5 araç hatası yaşadı, tarayıcıyı açtı ancak ekran görüntüsü denetimi yapmadı.
- **GLM 5.3 Flash Max (OMP Open):** 30 dakika 14 saniye sürdü; 57 araç çağrısını sıfır hatayla yürüttü, tarayıcı ve ekran görüntüsü adımlarını eksiksiz tamamladı.
- **Qwen 3.8 27B x-high (OMP Open):** 41 dakika 25 saniye sürdü; 89 araç çağrısı, 49.131 akıl yürütme token'ı ve sıfır hatayla en kapsamlı görsel doğrulamayı sağladı.
- **GLM 5.3 Flash Max (OpenCode Open):** 20 dakika 28 saniye sürdü; %96,89 önbellekleme oranı ve sıfır hatayla 67 araç çağrısını başarıyla tamamladı.
- **Qwen 3.8 27B x-high (OpenCode Open):** 8 dakika 48 saniye ile testin en hızlısı oldu; sadece 13 araç çağrısıyla hatasız şekilde tüm görsel kontrolleri bitirdi.
- **Qwen 3.8 27B x-high (DSH / PTC Open):** 24 dakika 32 saniye sürdü; 89.894 çıktı token'ı üretti, 5 araç hatasına rağmen tarayıcı ve ekran görüntülerini denetledi.
- **Qwen 3.8 27B x-high (DSH Open):** 18 dakika 15 saniye sürdü; 42 araç çağrısı ve 2 hata bildirdi ancak görsel doğrulama aşamalarını çalıştırmadı.

## Yazılım Geliştirme Açısından Pratik Çıkarımlar

- **Harness Mimarisi Performansı Belirler:** Qwen 3.8 modeli OpenCode üzerinde 8 dakikada sonuca ulaşırken OMP üzerinde 41 dakika harcamıştır. Model yeteneği kadar ajan harness'ının araç orkestrasyonu da etkilidir.
- **Ajanik Geri Bildirim Döngüsü:** Three.js gibi görsel projelerde ajanların tarayıcıyı açıp ekran görüntüsü alarak çıktıyı doğrulaması, olası render hatalarını yakalamada kritik rol oynar.
- **Bağlam Önbellekleme (Caching):** Giriş token'larının %80-96'sının önbellekten sunulması, çok turlu otonom yazılım geliştirme süreçlerinde maliyet ve gecikmeyi ciddi ölçüde düşürür.

[Orijinal kaynağa buradan ulaşabilirsiniz.](https://alvins82.github.io/hangar-harness-model-tests/) <!-- GOAL_COMPLETE -->

---

Bu konuyu derinlemesine öğrenmek isterseniz: [Modeller: Hangisi, Ne Zaman?](https://edumints.com/kesfet/google-ai-studio-kullanm-rehberi-joou) modülüne göz atın.

---

**Kaynak:** [Hacker News](https://alvins82.github.io/hangar-harness-model-tests/)
**Yayıncı:** [Edumints Blog](https://blog.edumints.com) · Alıntılarken bu URL'ye bağlantı verin: https://blog.edumints.com/ayni-threejs-gorevinde-10-model-ve-harness-kombinasyonunun-k-82vxzmsj
