BigSet, tek seferlik bir büyük dil modeli çağrısından ibaret değil. Sistem, veri toplama sürecini farklı görevlerde uzmanlaşan alt ajanlara bölüyor; orkestratör ajan ise genel akışı yönetiyor.
Kaynaklarda açıklanan işleyiş kabaca şöyle :
BigSet’in dikkat çeken özelliklerinden biri de sürecin tekrarlanabilir olması. Kullanıcılar yenileme sıklığını 30 dakikada bir ile haftada bir arasında ayarlayabiliyor. Böylece araştırma ve doğrulama akışı belirlenen takvimde yeniden çalıştırılarak veri setinin güncel tutulması amaçlanıyor .
BigSet, güçlü bir copyleft yaklaşımı kullanan AGPL-3.0 lisansıyla yayımlandı . Bu lisans, yazılımı değiştirip bir ağ hizmeti olarak sunan ekipler için, yapılan değişikliklerin kaynak kodunu kullanıcılarla paylaşma yükümlülüğü doğurabilen şartlar içeriyor. Bu yönüyle AGPL-3.0, daha esnek lisanslardan ve kapalı kaynaklı SaaS modellerinden ayrılıyor.
Sistemin Docker tabanlı self-hosting desteği de önemli bir fark yaratıyor . Web siteleriyle kurulan tarayıcı etkileşimleri, yapay zekâ destekli ajan akıl yürütmesi ve veri çıkarma mantığı şirketin kendi altyapısında çalıştırılabiliyor. Bu modelde erişim izinleri, ağ yapılandırması ve günlükler ekip tarafından yönetiliyor.
Özellikle hassas ticari istihbarat, kurum içi araştırmalar veya sıkı uyumluluk gerektiren iş akışlarında bu yaklaşım, verilerin üçüncü taraf bir platforma gönderilmesiyle ilgili riskleri azaltabilir. Bununla birlikte kendi sunucusunda çalıştırmak, altyapı, işlem gücü ve model API maliyetlerinin ortadan kalktığı anlamına gelmiyor; bu sorumluluklar kullanıcıya geçiyor.
BigSet’in en yakın rakiplerinden biri, Exa.ai tarafından sunulan Exa Websets. Her iki ürün de web’i yapılandırılmış ve sorgulanabilir veri koleksiyonlarına dönüştürmeyi hedefliyor; ancak teknik yaklaşımları farklı .
Web’den otomatik olarak veri derleyen sistemlerde en önemli sorunlardan biri, gerçekte kaynakta bulunmayan bilgilerin veri setine eklenmesi. Trendshift’in BigSet kapsamındaki paylaşımında, BigSet ile finansmanı yüksek bir rakibin aynı sorguyla test edildiği ve rakibin bazı uydurma veriler döndürdüğü iddia ediliyor . Kaynak, söz konusu rakibin adını açıkça belirtmiyor; karşılaştırma genel olarak güçlü fonlanmış bir rakip üzerinden kuruluyor.
Exa ise halüsinasyon kontrolü için belgelenmiş üç aşamalı bir yöntem sunuyor: Metindeki iddiaları çıkarmak, kanıt bulmak için arama yapmak ve iddiaları bulunan kanıtlarla karşılaştırarak doğrulamak . Exa Websets de arama sonuçlarındaki adayları, kullanıcının tam sorgusuna uyup uymadıklarını kontrol eden ajan tabanlı iş akışlarından geçiriyor .
BigSet’in lansmanını ele alan kaynaklar da tablo tamamlanmadan önce bulguların kaynaklara karşı doğrulandığı özel bir aşamadan söz ediyor . Ancak bu doğrulama ajanının tek adımlı bir kontrolden mi yoksa birden fazla kontrol turundan mı oluştuğu mevcut materyallerde ayrıntılı olarak açıklanmıyor. Açık olan nokta, sistemin kaynak desteği olmayan satırların dışa aktarılan veri setine girmesini önlemeyi hedeflemesi.
| Boyut | BigSet | Exa Websets |
|---|---|---|
| Temel yaklaşım | Orkestratörün şemayı planladığı; alt ajanların canlı web’de araştırma, veri çıkarma ve doğrulama yaptığı çoklu ajan sistemi | Arama adaylarını bulmak için gömme tabanlı arama kullanan ve ardından ajanlarla doğrulama yapan sistem |
| Lisans | AGPL-3.0 açık kaynak | Özel mülk yazılım |
| Dağıtım | Docker ile kendi altyapısında çalıştırılabilir | Bulut tabanlı SaaS; kurumsal planlar mevcut |
| Web etkileşimi | Gerçek tarayıcı oturumlarıyla gezinme, tıklama ve veri çıkarma; dinamik sitelerle ve giriş gerektiren akışlarla çalışacak şekilde tasarlanmış | Ağırlıklı olarak arama odaklı; ilgili sayfaları bulmak için nöral gömmeler kullanıyor ve içeriği doğruluyor |
| Fiyatlandırma | Self-hosted kullanımda platform kullanım ücreti yok; işlem gücü ve model API maliyetlerini kullanıcı yönetiyor | Websets aylık 49 dolardan, 8.000 krediyle başlıyor; kurumsal planlar özel fiyatlandırılıyor |
| Veri egemenliği | Veri akışı üzerinde tam kontrol; sistem kullanıcının altyapısında çalışabiliyor | Veri işleme Exa’nın sunucularında gerçekleşiyor |
BigSet’in asıl vaadi, veri mühendisliğinin her adımını ortadan kaldırmaktan çok, başlangıçtaki sürtünmeyi azaltmak. Geleneksel yöntemde bir analistin veya geliştiricinin sitelerin yapısını incelemesi, kazıma betikleri yazması, değişen sayfa düzenlerine göre bu betikleri düzeltmesi, tekrar eden kayıtları temizlemesi ve sonuçları doğrulaması gerekiyor.
BigSet ise bu süreci doğal dilde verilen bir talebe yaklaştırıyor. Kaynaklarda, saatler sürebilen veri hazırlama işinin 2 ila 5 dakikalık bir etkileşime indirilebildiği öne sürülüyor . Küçük ekipler ve hızlı araştırma yapmak isteyen analistler için bu, özellikle ilk prototip veya düzenli pazar takibi aşamasında önemli bir zaman tasarrufu sağlayabilir.
Ancak otomasyon, doğrulama ihtiyacını ortadan kaldırmıyor. Web sayfalarının yapısı değişebilir, kaynaklar güncelliğini yitirebilir ve yapay zekâ ajanları yanlış yorum yapabilir. Bu nedenle BigSet’in ürettiği tabloların, özellikle kritik iş kararlarında kullanılmadan önce kaynak bazında incelenmesi gerekiyor.
TinyFish’in daha geniş web ajanı platformu; canlı web’de arama yapma, içerik çekme, gerçek tarayıcı çalıştırma ve ajan dağıtma yeteneklerini tek bir altyapıda birleştiriyor . BigSet, bu teknolojiyi geliştiricilerin yanı sıra veriyle çalışan daha geniş bir kullanıcı kitlesine göstermek için hazırlanmış, doğrudan kullanılabilir bir örnek sunuyor.
Şirketin 47 milyon dolar yatırım aldığı ve Google, DoorDash ile Amazon gibi müşterilere sahip olduğu bildiriliyor . Bu çerçevede BigSet, bir yandan topluluk için ücretsiz ve faydalı bir araç sunarken diğer yandan TinyFish’in web ajanı altyapısının neler yapabildiğini görünür kılıyor.
Sonuç olarak BigSet, “veri için önce scraper yaz” yaklaşımının yerine “ihtiyacın olan tabloyu tarif et” fikrini koyuyor. Açık kaynak kodu ve self-hosting seçeneği, onu yalnızca kolay kullanım açısından değil; veri kontrolü, özelleştirme ve platform bağımlılığını azaltma açısından da dikkat çekici bir seçenek haline getiriyor.