LLM·2 dk okuma·

TRL ve OpenEnv ile Kodlama Modeline Sulu Boya Yapmayı Öğretmek

Paylaş
LLMEdumints Blog

23 Ağustos'ta Surya Narreddi, bir dil modelinin sulu boya tekniğiyle resimler çizdiği büyüleyici bir video paylaştı. Model, p5.js kütüphanesine doğal çizim araçları kazandıran p5.brush kütüphanesi aracılığıyla doğrudan JavaScript kodu yazmaktadır. Kısa sürede 1,5 milyondan fazla izlenmeye ulaşan bu çalışma, tam kompozisyonlar yerine yakın çekim çiçeklere odaklanan projenin erken bir aşamasını anlatan blog yazısıyla duyuruldu. Orijinal fikir sanat ve tasarım odaklı olsa da, buradaki temel çaba süreci mühendislik açısından ele alarak referans veri havuzunu, RL ortamını, eğitim betiklerini ve eğitilen modelleri tamamen açık kaynaklı olarak yeniden üretmektir.

Bu çalışmada Narreddi'nin yaklaşımı TRL ve OpenEnv kullanılarak yeniden hayata geçirilmiş; tüm adımlar Hugging Face ekosistemi üzerinde uçtan uca çalıştırılmıştır:

  • Jobs üzerinde eğitim: Model eğitim işlerinin bulut altyapısında yönetilmesi ve yürütülmesi
  • Spaces üzerinde RL ortamı ve puanlayıcı: Pekiştirmeli öğrenme ortamının ve skorlama modelinin Spaces üzerinde barındırılması
  • Inference Providers ile ikili hakem: Modeller arasındaki karşılaştırmalı değerlendirmenin (pairwise judge) harici çıkarım sağlayıcılarıyla yapılması
  • Hub üzerindeki tek koleksiyon: Tüm veri setlerinin, ortamların, modellerin ve yapıların (artifacts) tek çatı altında toplanması

İki Space ayağa kaldırıldıktan sonra süreç tek bir komutla başlatılabilir. Geliştirici, ortamı ve skorlama modelini kopyalayıp ödül karışımı için ortam değişkenlerini tanımladıktan sonra hf jobs üzerinden train/watercolour_grpo.py betiğini çalıştırır. Qwen/Qwen3.5-35B-A3B modeli üzerinde LoRA, bf16 ve gradyan kontrol noktası optimizasyonlarıyla yürütülen eğitimde, adım adım orijinal blog takip edilmiş ve değişiklikler yalnızca zorunlu hallerde yapılmıştır. Yazarın kendi geliştirdiği fikirler deneye müdahale etmeden bir sonraki adımlar listesine aktarılmış; elle puanlanmış havuz ve paralel eğitilen üç farklı ödül karışımıyla her adımın medyan tablosu karşılaştırılmıştır.

İnsanlar Neden Sevdi?

Günümüz görsel üretim modellerinin sunduğu kusursuz ve istatistiksel olarak ortalama resimlerin aksine; bu sulu boya tabloları serbest, kusurlu ve el yapımı bir his uyandırmaktadır. Projenin viral olmasındaki en büyük etken bu kontrasttır. Bu durum, DeepDream'in (2015) bir hata ayıklama aracından sanata dönüştüğü ve Edmond de Belamy (2018) gibi eserlerin doğduğu, temel amacın doğrudan ortamı keşfetmek olduğu üretici yapay zekânın erken dönemlerini anımsatmaktadır.

Yazılım Geliştirme ve Öğrenme Çıkarımları

Yazılım mühendisleri ve yapay zekâ geliştiricileri için bu çalışma önemli dersler sunmaktadır. Öncelikle, doğrudan piksel üretmek yerine modellerin programatik kütüphanelerle (p5.brush) kod üretmesini sağlamak, çıktılara yüksek denetlenebilirlik ve tekrarlanabilirlik kazandırır. Ayrıca TRL ve OpenEnv entegrasyonu; pekiştirmeli öğrenme (RL/GRPO) ortamını modelden ayırıp bağımsız bir servis olarak kurgulamanın ve sübjektif estetik hedefleri ödül modelleriyle optimize etmenin modern mühendislik standartlarını sergilemektedir.

Orijinal kaynağa buradan ulaşabilirsiniz.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →