BigSet není jen jediný prompt odeslaný velkému jazykovému modelu. Je postaven jako multiagentní systém, v němž jednotlivé části úkolu přebírají specializovaní agenti a celý proces řídí orchestrátor.
Podle dostupného popisu probíhá zpracování přibližně takto :
Výhodou má být také opakované spouštění. Uživatel může nastavit interval od každých 30 minut až po jednou týdně; agenti pak celý výzkumný a validační proces znovu provedou podle plánu . Dataset tak nemusí zůstat jednorázovým snímkem webu.
Licence AGPL-3.0 patří mezi takzvané silné copyleftové licence . Pokud tým software upraví a zpřístupní jej jako síťovou službu, licence obecně počítá s tím, že uživatelům poskytne také odpovídající zdrojový kód upravené verze. To BigSet odlišuje jak od proprietárních SaaS platforem, tak od projektů s velmi volnými permisivními licencemi.
Dockerové nasazení umožňuje provozovat celý řetězec na vlastní infrastruktuře . V praxi to může zahrnovat prohlížečové relace, logiku agentů využívajících jazykové modely i samotnou extrakci dat. Organizace tak mohou samy spravovat přístupy, síťová pravidla a logy místo toho, aby všechny citlivé dotazy posílaly přes externí cloudovou platformu.
Neznamená to však automaticky, že je vyřešena veškerá bezpečnost nebo ochrana osobních údajů. Provozovatel stále odpovídá za konfiguraci infrastruktury, použité modelové API, přístupová oprávnění i to, jaké webové zdroje a údaje systém zpracovává. Přínosem je především větší kontrola nad místem, kde pipeline běží a kde se ukládají její výstupy.
Nejbližší srovnání nabízí Exa Websets, produkt společnosti Exa.ai, který také vytváří strukturované kolekce dat z webu. Oba nástroje se snaží proměnit web v databázi, jejich technické přístupy a obchodní modely se ale liší .
U systémů, které samostatně sestavují datasety, je zásadní otázka přesnosti. Materiály o BigSetu popisují srovnání, při němž měl konkurenční produkt při stejném dotazu vrátit smyšlené údaje. Zdroj přitom konkrétního konkurenta nejmenuje; srovnání je pouze zasazeno do kontextu velkého konkurenčního nástroje .
Exa popisuje vlastní postup pro odhalování halucinací ve třech krocích: nejprve z textu vytáhne jednotlivá tvrzení, poté pro ně vyhledá důkazy a nakonec tvrzení s nalezenými důkazy porovná . U produktu Websets Exa uvádí také agentní kontroly, které ověřují, zda kandidátní výsledky skutečně odpovídají přesnému zadání uživatele .
U BigSetu je ověřování rovněž součástí popsaného workflow, ale dostupné materiály nepopisují jeho přesnou technickou architekturu ani počet kontrolních kroků . Jisté je především to, že cílem této fáze je porovnat získané údaje s původními zdroji ještě před exportem tabulky.
| Oblast | BigSet | Exa Websets |
|---|---|---|
| Základní přístup | Multiagentní systém, v němž orchestrátor navrhne schéma a další agenti procházejí, extrahují a ověřují data z webu | Vyhledávání založené na embeddingu, na které navazují agentní kontroly kandidátních výsledků |
| Licence | Open source pod licencí AGPL-3.0 | Proprietární produkt |
| Nasazení | Vlastní provoz přes Docker | Cloudová služba; pro firmy jsou dostupné podnikové tarify |
| Práce s webem | Reálné relace prohlížeče mohou stránky otevírat, procházet, klikat a získávat údaje podobně jako člověk | Přístup je primárně založený na vyhledávání a následném ověřování obsahu |
| Cena | U vlastní instalace se neplatí platformní poplatek; provozovatel ale hradí vlastní výpočetní kapacitu a případné náklady na modelová API | Websets podle dostupných údajů začíná na 49 dolarech měsíčně za 8 000 kreditů; podnikové tarify jsou individuální |
| Suverenita dat | Pipeline může běžet na infrastruktuře uživatele | Zpracování probíhá na serverech Exa |
Srovnání tedy není jen otázkou přesnosti výsledků. BigSet cílí na uživatele, kteří chtějí otevřený a upravitelný základ pro vlastní datovou pipeline. Exa Websets naopak staví na proprietární cloudové službě a vlastním vyhledávacím indexu.
Největší příslib BigSetu spočívá v tom, že přesouvá začátek datového procesu z kódu do přirozeného jazyka. Analytik nemusí nejprve připravit selektory CSS, řešit změny struktury stránky nebo ručně skládat několik kroků extrakce. Začíná popisem toho, jaká data potřebuje.
Podle dostupných materiálů může tento přístup zkrátit dříve několikahodinovou práci na interakci trvající přibližně dvě až pět minut . To neznamená, že tradiční ETL nástroje nebo vlastní scrapery okamžitě ztratí smysl. U kritických datových toků je stále nutná kontrola kvality, sledování změn zdrojů a řešení výpadků či přístupových omezení.
BigSet ale nabízí zajímavou alternativu pro průzkum trhu, monitoring konkurence, tvorbu seznamů firem nebo další úlohy, u nichž je potřeba pravidelně získávat strukturovaná data z webu bez vývoje samostatného scraperu pro každý zdroj.
TinyFish tím současně rozšiřuje svou nabídku infrastruktury pro AI agenty. Firma podle dostupných informací získala 47 milionů dolarů a mezi její zákazníky mají patřit Google, DoorDash a Amazon . BigSet tak může fungovat jako praktická ukázka její technologie pro práci s živým webem — a zároveň jako nástroj, který si mohou vývojáři a týmy provozovat sami.