BigSet is geen enkele prompt naar een taalmodel. De tool werkt als een keten van gespecialiseerde agents, met één centrale agent die het proces aanstuurt. De beschikbare documentatie beschrijft de workflow als volgt:
De precieze technische invulling van de verificatiestap is niet volledig openbaar beschreven. Wel is het doel duidelijk: voorkomen dat gegevens zonder controleerbare bron in het eindbestand terechtkomen. Dat blijft belangrijk, want een fraai opgemaakte dataset kan nog steeds onjuiste informatie bevatten als de onderliggende bronnen niet kloppen.
BigSet is ontworpen voor terugkerende opdrachten. Gebruikers kunnen een vernieuwingsfrequentie instellen van elke 30 minuten tot één keer per week. De onderzoeks- en validatieketen wordt vervolgens volgens dat schema opnieuw uitgevoerd, zodat de dataset actueel blijft zonder dat iemand telkens handmatig een script hoeft te starten.
Dat maakt de tool interessant voor bijvoorbeeld marktmonitoring, onderzoek naar bedrijven of het volgen van veranderlijke webinformatie. De belofte is vooral operationeel: een proces dat normaal gesproken uren aan scripts, foutopsporing en dataopschoning vraagt, begint met een omschrijving in gewone taal. Een door TinyFish aangehaalde analyse stelt dat zo’n workflow kan worden teruggebracht tot ongeveer twee tot vijf minuten.
BigSet wordt uitgebracht onder de AGPL-3.0-licentie, een sterke copyleftlicentie. In algemene zin betekent dit dat organisaties die de software aanpassen en als netwerkdienst aanbieden, onder de licentievoorwaarden doorgaans ook de gewijzigde broncode beschikbaar moeten stellen aan gebruikers. Dat verschilt van permissieve open-sourcelicenties en van gesloten SaaS-platforms.
De software kan via Docker op eigen infrastructuur worden geïnstalleerd. In dat scenario blijven onderdelen van de keten — zoals browserinteracties, agentlogica en extractie — binnen de omgeving die het team zelf beheert. Organisaties houden daarmee meer grip op toegangsrechten, netwerkconfiguratie en logbestanden.
Self-hosting is geen automatische garantie dat alle risico’s rond privacy of naleving verdwijnen. Teams blijven zelf verantwoordelijk voor hun infrastructuur, modelkoppelingen, beveiliging en de vraag of het verzamelen van bepaalde webgegevens is toegestaan. Het model biedt wel een alternatief voor het standaard doorsturen van gevoelige dataopdrachten naar een externe cloudomgeving.
De meest voor de hand liggende vergelijking is met Exa Websets, een product van Exa.ai dat eveneens gestructureerde gegevensverzamelingen uit het web samenstelt. Beide producten proberen het web doorzoekbaar te maken als een soort database, maar hun benadering en positionering verschillen.
BigSet presenteert zich als een open-source multi-agentsysteem dat een orkestrator combineert met agents die live websites bezoeken, informatie extraheren en resultaten controleren.
Exa Websets werkt volgens de beschikbare beschrijvingen eerst met embedding-gebaseerd zoeken om geschikte kandidaten te vinden. Daarna voeren agentische workflows controles uit om te beoordelen of elk resultaat precies aan de zoekopdracht voldoet.
| Onderdeel | BigSet | Exa Websets |
|---|---|---|
| Kernmodel | Multi-agentsysteem voor het plannen, onderzoeken, verifiëren en structureren van live webdata. | Embedding-gebaseerde zoektechnologie met agentische verificatie van gevonden kandidaten. |
| Licentie | Open source onder AGPL-3.0. | Proprietair. |
| Implementatie | Self-hosting via Docker. | Cloudgebaseerde dienst; zakelijke abonnementen zijn beschikbaar. |
| Webinteractie | Echte browsersessies kunnen dynamische websites doorlopen, klikken en gegevens extraheren. | Primair zoekgedreven, met controle van de inhoud van gevonden pagina’s. |
| Kostenmodel | Bij self-hosting geen platformtarief; gebruikers betalen wel hun eigen infrastructuur- en eventuele modelkosten. | Websets begint volgens de beschikbare prijsinformatie bij 49 dollar per maand voor 8.000 credits; zakelijke plannen zijn maatwerk. |
| Databeheer | De organisatie kan de omgeving zelf beheren. | De verwerking vindt plaats binnen de infrastructuur van Exa. |
Hallucinaties — overtuigend klinkende maar onjuiste AI-uitkomsten — vormen een belangrijk risico bij systemen die zelfstandig datasets samenstellen. Trendshift beschrijft een test waarin BigSet en een niet bij naam genoemde, goed gefinancierde concurrent dezelfde opdracht uitvoerden. Volgens die bron bevatte het resultaat van de concurrent verzonnen gegevens. Dat is een bewering uit de launchcommunicatie, geen onafhankelijke benchmark met volledig uitgewerkte testmethode.
Exa documenteert zelf een proces om hallucinaties te controleren: eerst worden claims uit tekst gehaald, daarna wordt gezocht naar bewijs en ten slotte worden de claims met dat bewijs vergeleken. Bij Websets worden gevonden kandidaten eveneens door agentische workflows gecontroleerd voordat ze aan een verzameling worden toegevoegd.
BigSet vermeldt een aparte verificatiefase waarin agents bevindingen naast hun bronnen leggen. De beschikbare informatie maakt echter niet duidelijk of dit een eenvoudige controle is of een meerlagig verificatieproces. Het is daarom te vroeg om op basis van de aangehaalde vergelijking te concluderen dat BigSet in het algemeen nauwkeuriger is dan Exa Websets.
Voor TinyFish is BigSet meer dan een losse datasetbouwer. Het bedrijf, gevestigd in Palo Alto, ontwikkelt bredere infrastructuur voor AI-agents die websites kunnen doorzoeken, openen en bedienen. Die infrastructuur omvat onder meer web search, web fetch, browserautomatisering en een webagent-API.
BigSet laat die mogelijkheden zien in een concreet product: de gebruiker hoeft niet eerst CSS-selectors, API-koppelingen of een ETL-pijplijn — het proces van gegevens ophalen, transformeren en laden — te bouwen. In plaats daarvan beschrijft die gebruiker eerst welke data nodig zijn. Dat maakt BigSet vooral een no-code- of low-code-alternatief voor bepaalde scraping- en datawerkstromen, niet per se een volledige vervanging voor elke productiedatapijplijn.
Volgens beschikbare berichtgeving heeft TinyFish 47 miljoen dollar opgehaald en behoren Google, DoorDash en Amazon tot de klanten van het bredere platform. BigSet kan zo tegelijk een nuttig open-sourceproject voor ontwikkelaars zijn en een manier om de onderliggende webagenttechnologie van TinyFish breder onder de aandacht te brengen.
De belangrijkste vraag voor gebruikers wordt uiteindelijk niet alleen of een AI-agent een tabel kan maken, maar ook of die tabel controleerbaar, juridisch verantwoord en stabiel genoeg is voor dagelijks gebruik. BigSet probeert die drie eisen te combineren met live webonderzoek, bronverificatie en self-hosting. Of dat in de praktijk lukt, zal afhangen van de kwaliteit van de bronnen, de gekozen opdracht en het onderhoud van de workflow.