OpenArch: Modern LLM Mimarilerinin PyTorch ile Sıfırdan Uygulamaları
İçindekiler
OpenArch, günümüzün önde gelen açık kaynaklı büyük dil modellerinin (LLM) mimari yapılarını PyTorch kullanarak sıfırdan hayata geçiren kapsamlı bir öğrenme deposudur. Sebastian Raschka'nın hazırladığı popüler LLM Architecture Gallery çalışmasını referans alan proje; Llama, DeepSeek, Qwen, Gemma, Mistral, Kimi ve GPT-OSS gibi modelleri orijinal teknik raporlar, akademik makaleler, referans config.json dosyaları ve Machine Learning Mastery incelemeleri doğrultusunda tek tek kodlamaktadır. Projenin temel gayesi, Hugging Face Transformers gibi endüstriyel üretim kütüphaneleriyle hız veya dağıtık sistem performansı açısından yarışmak değildir. Aksine asıl amaç, mimari tasarımı derinlemesine kavramak isteyen mühendisler ve araştırmacılar için üst düzey bir kod okunabilirliği ve eğitim zemini sunmaktır. Her model tek ve bağımsız bir dosya içinde tutularak dikkat mekanizması, normalizasyon katmanları, MoE yönlendirmesi ve konumsal kodlama gibi tüm yapısal kararlar açık ve karşılaştırılabilir biçimde sunulmuştur.
Bu Depo Neden Önemli?
Modern büyük dil modelleri genel hatlarıyla benzer bir dönüştürücü (transformer) iskeletini paylaşsa da performans, bellek ve donanım verimliliğini doğrudan etkileyen onlarca kritik mimari tercihte birbirlerinden ayrışır:
- Dikkat Mekanizmaları (Attention): MHA (Multi-Head Attention), GQA (Grouped Query Attention), MQA (Multi-Query Attention), MLA (Multi-Head Latent Attention), kayan pencereli dikkat (sliding-window) ve lineer/DeltaNet hibrit yaklaşımları.
- Normalizasyon Yöntemleri (Normalization): Pre-norm, post-norm, QK-Norm, sandwich norm ve modern açık kaynak modellerin standardı haline gelen RMSNorm.
- Konumsal Kodlamalar (Positional Encodings): RoPE (Rotary Position Embedding), NoPE, kısmi RoPE (partial RoPE) ve uzun bağlam pencerelerini destekleyen YaRN.
- Dekoder Mimarisi (Decoder Type): Standart yoğun (dense) modellere karşı paylaşımlı uzmanlı ya da uzmansız seyrek MoE (Mixture of Experts) ve Mamba/dikkat hibritleri.
- Eğitim Sırası Yöntemleri (Training-time Tricks): Çoklu token tahmini (Multi-token-prediction), gizil uzmanlar (latent experts) ve geçitli dikkat (gated attention) mekanizmaları.
Yazılım Geliştiriciler İçin Pratik Çıkarımlar ve Uygulanan Modeller
Üretim seviyesindeki açık kaynak kütüphaneler; işlem hızı, GPU sharding (bölümleme) ve geriye dönük uyumluluk gibi optimizasyon katmanları içerdiğinden kaynak kodları oldukça karmaşıktır. OpenArch ise doğrudan "okuma ve anlama" için optimize edilmiştir. Örneğin bir yapay zeka geliştiricisi, Llama 3'ün standart Grouped Query Attention (GQA) yapısı ile DeepSeek R1 ve Kimi K2 modellerindeki Multihead Latent Attention (MLA) ve seyrek MoE yönlendirme mekanizmalarını saf PyTorch kodları üzerinden yan yana koyarak kolayca kıyaslayabilir.
Depo içerisinde GPT-2 XL'den OLMo 2'ye, Gemma 3 ve Mistral 3'ün kayan pencereli dikkat yapılarından GLM 4.5 ve Llama 4 Maverick gibi devasa MoE mimarilerine kadar birçok modelin ileri geçiş (forward pass) süreçleri yer almaktadır. Kendi modellerini tasarlamak veya araştırma makalelerindeki matematiksel kararları kod seviyesinde doğrulamak isteyen mühendisler için vazgeçilmez bir başvuru kaynağıdır.
Orijinal kaynağa buradan ulaşabilirsiniz.
Bu konuyu derinlemesine öğrenmek isterseniz: Modeller: Hangisi, Ne Zaman? modülüne göz atın.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →