Kendi iMessage Geçmişinizle Sıfırdan Tiny Transformer Modeli Eğitin: texts-to-transformer
İçindekiler
Yapay zeka modellerini önceden eğitilmiş (pretrained) ağırlıklar üzerinden ince ayarlamak (fine-tuning) günümüzde oldukça popüler olsa da, sıfırdan bir Transformer modeli inşa etmek geliştiriciler için en öğretici deneyimlerden biridir. Doriandarko/texts-to-transformer reposu, Apple Silicon işlemcili Mac bilgisayarınızda, tamamen yerel (local-first) bir yapıyla kendi iMessage mesajlaşma geçmişinizi kullanarak sıfırdan minik bir Transformer modeli eğitmenizi sağlayan uçtan uca bir geliştirme hattı (pipeline) sunmaktadır.
Nedir ve Neden Popüler?
Bu proje, Apple'ın yerel makine öğrenimi kütüphanesi olan MLX framework'ünü kullanarak Apple Silicon (M1/M2/M3) donanımından maksimum verim alır. Projenin popülerliğinin arkasındaki en büyük etken, kullanıcının kendi yazım dilini, mizacını, noktalama alışkanlıklarını ve günlük jargonunu taklit eden kişisel bir dil modeli üretmesidir. Varsayılan yapılandırmada model; 4 katmanlı, 1.38 milyon parametreli minik bir decoder-only (yalnızca kod çözücü) Transformer mimarisidir.
Ayrıca bu proje, gelişmiş bir yapay zeka kodlama asistanının tek bir prompt ile tüm bu eğitim sistemini yaklaşık 30 dakikada sıfırdan oluşturabildiğini gösteren bir demo ile viral hale gelmiştir. Geliştiriciler için en büyük değeri; SQLite veri tabanından güvenli veri çekme, HMAC ile veri maskeleme/anonimleştirme, BPE (Byte-Pair Encoding) tokenizer eğitme ve yerel GPU üzerinde model eğitimi adımlarının tamamını şeffaf bir şekilde sunmasıdır.
Nasıl Kullanılır? Pratik Örnekler
Projeyi kendi Mac bilgisayarınızda çalıştırmak için aşağıdaki adımları takip edebilirsiniz:
- Gereksinimler ve Kurulum: macOS 14+ ve Python 3.11 yüklü olmalıdır. Projeyi klonlayıp hızlı paket yöneticisi
uvile bağımlılıkları senkronize edin:git clone https://github.com/Doriandarko/texts-to-transformer.git cd texts-to-transformer brew install uv uv sync - Sistem Kontrolü: Terminalinize iMessage veritabanına (
chat.db) erişebilmesi için "Tam Disk Erişimi" izni verdikten sonra sistemi test edin:uv run imessage-mlx doctor - Veri Hazırlama ve Anonimleştirme: Güvenli ve salt okunur bir veritabanı yedeği alarak kişisel bilgileri maskeleyin:
uv run imessage-mlx snapshot --config configs/data.yaml uv run imessage-mlx prepare --config configs/data.yaml - Tokenizer ve Model Eğitimi: Hazırlanan verilerle 4096 kelime haznesine sahip bir tokenizer eğitin ve ardından MLX eğitim aracını başlatın:
uv run imessage-mlx train-tokenizer --train work/splits/train.jsonl --output outputs/tokenizer --vocab-size 4096
Benzer Araçlarla Karşılaştırma
- Hugging Face / PyTorch LLaMA Fine-tuning: Geleneksel yöntemler milyarlarca parametreli devasa modelleri eğitmek için yüksek VRAM'li bulut GPU'larına ihtiyaç duyar.
texts-to-transformerise tamamen yerelde ve çok daha düşük donanım kaynaklarıyla çalışır. - Ollama / Llama.cpp: Bu araçlar hazır büyük dil modellerini yerel bilgisayarda çalıştırmaya ve çıkarım (inference) yapmaya odaklanır. Ancak, sıfırdan kişisel verilerinizle yepyeni bir tokenizer ve model mimarisi eğitmenize olanak tanımazlar.
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →