Sparkfetch: Web İçeriklerini Yapay Zeka İçin Temiz Markdown'a Dönüştüren Açık Kaynak API
İçindekiler
Geleneksel web kazıma (scraping) yöntemleri, web sayfalarındaki karmaşık HTML kodlarını, reklamları, JavaScript kodlarını ve navigasyon ögelerini temizleme konusunda genellikle yetersiz kalır. Sparkfetch, herhangi bir URL'yi temiz, yapılandırılmış ve Büyük Dil Modelleri (LLM) tarafından kolayca işlenebilir içeriğe dönüştüren açık kaynaklı bir web veri çekme ve içerik ayıklama API'sidir. Node.js ve TypeScript kullanılarak geliştirilen bu proje, geliştiricilerin kendi altyapılarında (self-hosted) yüksek performanslı bir içerik işleme servisi çalıştırmasına olanak tanır.
Sparkfetch Nedir ve Geliştiricilere Ne Sunuyor?
Yapay zeka uygulamaları, RAG (Retrieval-Augmented Generation) mimarileri, içerik özetleme araçları ve araştırma botları geliştirirken web verilerinin gürültüden arındırılması kritik bir gereksinimdir. Sparkfetch, gereksiz HTML etiketlerini ve sayfa düzeni ögelerini otomatik olarak temizleyerek LLM token maliyetlerini ciddi oranda düşürür ve modellerin ürettiği yanıtların kalitesini artırır.
Projenin geliştiricilere sunduğu temel yetenekler şunlardır:
- Scrape (Sayfa Kazıma): Belirtilen URL'den reklam ve menü gürültüsünden arındırılmış temiz Markdown veya düz metin çıktısı ile meta verileri elde etmenizi sağlar.
- Crawl (Derin Tarama): Derinlik ve sayfa sınırı belirleyerek bir web sitesindeki tüm alt sayfaları özyinelemeli (recursive) olarak tarar.
- Map (Site Haritalama): Bir alan adındaki tüm erişilebilir URL bağlantılarını hızlı bir şekilde keşfedip listeler.
- Esnek Etiket Filtreleme: Sadece belirli HTML etiketlerini (
article,main) işleyip, istenmeyen bölümleri (nav,footer,aside) hariç tutma imkanı verir.
Pratik Kullanım Örneği
Sparkfetch'i kendi ortamınızda başlattıktan sonra, basit bir HTTP POST isteği ile herhangi bir web sayfasını temizleyebilirsiniz. Örneğin, tekil bir makaleyi temiz Markdown formatına dönüştürmek için /api/v1/scrape uç noktasına şu şekilde bir istek gönderebilirsiniz:
POST /api/v1/scrape
{
"url": "https://example.com/blog-yazisi",
"formats": ["markdown"],
"includeTags": ["article", "main"],
"excludeTags": ["nav", "footer", "aside"]
}
API, bu isteğe karşılık sayfanın başlık, açıklama ve durum kodu gibi meta verilerinin yanı sıra doğrudan istemlerinizde (prompt) kullanabileceğiniz temizlenmiş Markdown metnini JSON formatında döndürür.
Benzer Araçlarla Karşılaştırma
Piyasada Firecrawl, Jina Reader veya Tavily gibi web içeriklerini yapay zekaya uygun hale getiren popüler ticari çözümler bulunmaktadır. Ancak Sparkfetch'in bu alternatiflere kıyasla öne çıkan avantajları şunlardır:
- Tamamen Açık Kaynak ve Self-Hostable: Verilerinizi üçüncü taraf sunuculara göndermeden kendi altyapınızda çalıştırabilir, gizlilik ve güvenlik standartlarınızı koruyabilirsiniz.
- Maliyet Avantajı: İstek veya sayfa başına ücret alan SaaS servislerinin aksine, kullanım sınırı olmaksızın yüksek hacimli verileri tamamen ücretsiz olarak kazıyabilirsiniz.
- Modern Teknolojik Altyapı: Node.js 24, Express 5, TypeScript ve Zod şemaları ile hazırlanan mimarisi, kurumsal projelere kolay entegrasyon ve yüksek esneklik sunar.
[Orijinal kaynağa buradan ulaşabilirsiniz.](https://github.com/Sparkfetch/sparkfetch)
Bu konuyu daha derinlemesine öğrenmek ister misin?
Edumints'teki ücretsiz kursları incele ve bugün başla.
Kurslara Göz At →