LLM·3 dk okuma·

Görsel Anlatımla Transformer Mimarisi: Modern LLM'lerin Çalışma Prensibi

Paylaş
LLMEdumints Blog

Transformer Nedir?

Transformer, modern yapay zekâ ekosistemini kökten dönüştüren çığır açıcı bir derin öğrenme mimarisidir. İlk kez 2017 yılında yayımlanan "Attention is All You Need" makalesiyle tanıtılan bu yapı; günümüzde OpenAI GPT, Meta Llama ve Google Gemini gibi endüstri standardı metin üretici modellerin temelini oluşturur. Etkisi yalnızca metin işleme ile sınırlı kalmamış; ses sentezleme, görüntü tanıma, protein yapısı tahmini ve oyun oynama gibi pek çok farklı alanda da başarısını kanıtlamıştır.

Yazılım geliştiriciler ve yapay zekâ mühendisleri için metin üreten modeller temelde sonraki token tahmini (next-token prediction) prensibiyle çalışır: Kullanıcıdan gelen bir girdi istemi (prompt) doğrultusunda, diziyi takip edecek en olası belirteç (kelime veya kelime parçası) hesaplanır. Transformer mimarisinin asıl gücü, dizileri sıralı işlemek yerine paralel ele alan ve uzun mesafeli anlamsal ilişkileri başarıyla yakalayan self-attention (öz-dikkat) mekanizmasında yatar. 124 milyon parametreli GPT-2 (small) modeli, günümüzün en güçlü devasa modelleri olmasa da en gelişmiş sistemlerle aynı mimari bileşenleri paylaştığından öğrenme sürecinde temelleri kavramak için ideal bir başlangıç noktasıdır.

Transformer Mimarisi

Metin üreten her Transformer modeli üç temel bileşenden meydana gelir:

  • Embedding (Gömme Katmanı): Girdi metni, "token" adı verilen küçük birimlere ayrılır. Bu token'lar, kelimelerin anlamsal içeriğini ve bağlamını yakalayan sayısal vektörlere dönüştürülür.
  • Transformer Block (Transformer Bloğu): Girdi verisini işleyen ve dönüştüren ana yapı taşıdır. Kendi içinde iki kritik katman barındırır:
    • Attention Mechanism (Dikkat Mekanizması): Token'ların birbiriyle iletişim kurmasını sağlayarak bağlamsal bilgiyi ve sözcükler arası ilişkileri çıkarır.
    • MLP (Multilayer Perceptron) Katmanı: Her bir token üzerinde bağımsız çalışan ileri beslemeli bir ağdır. Dikkat katmanı bilgiyi token'lar arasında yönlendirirken, MLP katmanı her token'ın kendi iç temsilini rafine eder.
  • Output Probabilities (Çıktı Olasılıkları): Son doğrusal (linear) ve softmax katmanları, işlenmiş vektörleri olasılık değerlerine dönüştürerek dizideki bir sonraki token tahmininin yapılmasını sağlar.

Embedding Katmanı ve Adımları

Bir modelden metin üretmesini istediğinizde (örneğin: "Data visualization empowers users to"), bu istemin modelin işleyebileceği matematiksel bir forma dönüştürülmesi gerekir. Bu süreç dört temel adımda gerçekleşir:

  • Adım 1: Tokenization (Belirteçleme): Girdi metni daha küçük, anlamlı birimlere ayrılır. Yazılım geliştirme açısından tokenizasyon; API maliyetlerini, gecikme sürelerini ve context window sınırlarını doğrudan yöneten kritik bir adımdır.
  • Adım 2: Token Embedding: Ayrıştırılan her bir token, anlamsal özelliklerini temsil eden çok boyutlu sayısal vektörlerle eşleştirilir.
  • Adım 3: Positional Encoding (Konumsal Kodlama): Transformer modelleri dizileri paralel işlediğinden, kelimelerin sıra ve dizilim bilgisi bu aşamada vektörlere eklenir.
  • Adım 4: Final Embedding (Nihai Gömme): Token temsili ile konum kodlaması toplanarak Transformer bloklarına aktarılacak nihai vektör elde edilir.

Orijinal kaynağa buradan ulaşabilirsiniz.

Paylaş

Bu konuyu daha derinlemesine öğrenmek ister misin?

Edumints'teki ücretsiz kursları incele ve bugün başla.

Kurslara Göz At →