BigSet nie jest po prostu pojedynczym zapytaniem wysłanym do dużego modelu językowego. To system wieloagentowy, w którym poszczególne zadania są rozdzielone między wyspecjalizowane komponenty, a całością zarządza agent koordynujący.
Udokumentowany przepływ pracy wygląda następująco :
BigSet zaprojektowano także z myślą o zadaniach cyklicznych. Użytkownik może ustawić częstotliwość odświeżania — od co 30 minut do raz w tygodniu — a agenty ponownie uruchomią proces researchu i walidacji, aby zbiór nie dezaktualizował się bez ręcznego poprawiania skryptu .
Licencja AGPL-3.0 to silna licencja typu copyleft . W praktyce, jeśli zespół zmodyfikuje oprogramowanie i udostępni je użytkownikom jako usługę sieciową, licencja co do zasady może wymagać udostępnienia kodu źródłowego tych zmian. To odróżnia BigSet zarówno od projektów korzystających z bardziej liberalnych licencji, jak i od zamkniętych platform SaaS.
System jest przygotowany do samodzielnego wdrożenia w środowisku opartym na Dockerze . Oznacza to, że organizacja może uruchomić cały potok — interakcje z witrynami w przeglądarce, rozumowanie agentów wspierane przez modele językowe oraz logikę ekstrakcji — na własnej infrastrukturze.
Dla firm pracujących z wrażliwymi informacjami taki model może mieć znaczenie z punktu widzenia suwerenności danych. Zamiast przesyłać zapytania o informacje biznesowe do zewnętrznej platformy, zespół sam zarządza dostępem, siecią i logami. Samodzielne wdrożenie nie usuwa oczywiście obowiązków związanych z prawem, bezpieczeństwem ani zasadami korzystania z odwiedzanych serwisów, ale daje większą kontrolę nad miejscem przetwarzania danych.
Najbliższym punktem odniesienia dla BigSet są Exa Websets — produkt Exa.ai służący do budowania strukturalnych kolekcji danych z internetu. Oba rozwiązania próbują przekształcić sieć w bazę danych przeszukiwalną za pomocą języka naturalnego, ale opierają się na nieco innym podejściu .
Halucynacje są jednym z najważniejszych problemów narzędzi, które autonomicznie tworzą zbiory danych. W materiałach Trendshift opisano porównanie, w którym BigSet i konkurencyjny produkt otrzymały to samo zapytanie, a konkurent zwrócił zmyślone dane . Źródło nie wskazuje jednoznacznie nazwy tego produktu, dlatego tej obserwacji nie należy traktować jako niezależnego, rozstrzygającego benchmarku.
Exa opisuje własny trzyetapowy mechanizm wykrywania halucynacji: najpierw wyodrębnia twierdzenia z tekstu, następnie wyszukuje dowody, a na końcu porównuje twierdzenia z odnalezionymi materiałami . W przypadku Websets agentowe procesy weryfikują również, czy znalezione kandydatury rzeczywiście spełniają dokładne kryteria zapytania użytkownika, zanim trafią do końcowego zbioru .
W opisach premiery BigSet pojawia się osobny etap weryfikacji, w którym agenty sprawdzają ustalenia względem źródeł przed sfinalizowaniem tabeli . Dostępne materiały nie wyjaśniają jednak szczegółowo, czy jest to pojedyncza kontrola, czy wieloetapowy mechanizm walidacji. Wiadomo natomiast, jaki jest cel tego etapu: ograniczyć ryzyko, że do eksportowanego zbioru trafią rekordy bez wiarygodnego potwierdzenia.
| Obszar | BigSet | Exa Websets |
|---|---|---|
| Model działania | System wielu agentów: koordynator planuje schemat, a agenty odwiedzają strony, wyodrębniają dane i je weryfikują . | Wyszukiwarka oparta na embeddingach, która uruchamia agentowe procesy weryfikacji kandydatów . |
| Licencja | Open source na licencji AGPL-3.0 . | Produkt zamknięty. |
| Wdrożenie | Możliwość uruchomienia samodzielnie przez Dockera . | Usługa chmurowa SaaS; dostępne są plany dla przedsiębiorstw . |
| Praca z witrynami | Sesje prawdziwej przeglądarki mogą nawigować po dynamicznych stronach, klikać i wyodrębniać dane . | Podejście przede wszystkim wyszukiwarkowe: embeddingi pomagają znaleźć odpowiednie strony, a agenty sprawdzają ich zawartość . |
| Cena | Przy samodzielnym wdrożeniu brak opłaty za korzystanie z platformy; użytkownik ponosi koszty własnej infrastruktury i modeli. | Websets zaczyna się od 49 dolarów miesięcznie za 8000 kredytów, a plany enterprise są wyceniane indywidualnie . |
| Suwerenność danych | Zespół może utrzymywać potok na własnej infrastrukturze . | Przetwarzanie odbywa się na serwerach Exa. |
Największa obietnica BigSet nie polega na samym generowaniu tekstu, lecz na skróceniu drogi od potrzeby informacyjnej do działającego procesu zbierania danych. Według materiałów opisujących projekt zadanie, które tradycyjnie wymagało godzin pisania i poprawiania scraperów, może zostać sprowadzone do interakcji w języku naturalnym trwającej od 2 do 5 minut .
To podejście przypomina alternatywę no-code lub low-code dla klasycznego scrapingu i części procesów ETL. Użytkownik zaczyna od opisu tego, co chce wiedzieć, a nie od projektowania selektorów CSS, konfiguracji parsera czy utrzymywania skryptu po każdej zmianie witryny . Nie oznacza to jednak, że BigSet całkowicie eliminuje potrzebę kontroli jakości: wyniki pozyskiwane autonomicznie z internetu nadal wymagają sprawdzenia, zwłaszcza w zastosowaniach operacyjnych i regulowanych.
Połączenie otwartego kodu, samodzielnego wdrożenia i cyklicznego odświeżania pozycjonuje BigSet jako narzędzie dla zespołów, które chcą ograniczyć zależność od zamkniętych dostawców danych. Jednocześnie projekt może zwiększać zainteresowanie szerszą infrastrukturą TinyFish do pracy agentów AI z żywymi stronami internetowymi.
TinyFish, startup z Palo Alto, zebrał 47 mln dolarów i wymienia wśród klientów swojej szerszej platformy między innymi Google, DoorDash i Amazon . BigSet może więc pełnić podwójną funkcję: być użytecznym, otwartym narzędziem dla społeczności oraz sposobem na pokazanie możliwości technologii web agentów TinyFish.