BigSet bygger inte på ett enda modell-anrop. Systemet delar upp arbetet mellan olika agenter, där en överordnad orkestreringsagent planerar processen och delegerar uppgifter till specialiserade underagenter .
Den dokumenterade arbetsgången ser i huvudsak ut så här:
BigSet är även tänkt för återkommande datainsamling. En uppdateringsfrekvens kan ställas in från var 30:e minut till en gång i veckan, så att research- och valideringsprocessen körs på nytt utan att någon behöver underhålla ett eget skript .
BigSet släpps under AGPL-3.0, en stark copyleft-licens . För organisationer som ändrar programvaran och erbjuder den som en nätverkstjänst innebär licensen normalt krav på att motsvarande källkod görs tillgänglig för användarna. Det skiljer sig från både mer tillåtande open source-licenser och slutna SaaS-tjänster.
Systemet kan köras med Docker på den egna infrastrukturen . Då ligger webbläsarinteraktioner, agenternas modellbaserade resonemang och själva datautvinningen i en miljö som organisationen själv kontrollerar. Det kan vara särskilt relevant för verksamheter med krav på dataskydd, åtkomstkontroll och spårbar loggning.
Självhostning eliminerar inte alla kostnader eller risker: användaren behöver fortfarande hantera beräkningskapacitet, modellkostnader, nätverk och drift. Men upplägget minskar beroendet av en extern plattform och ger bättre kontroll över var känsliga sökningar och resultat behandlas.
Den tydligaste jämförelsen är med Exa Websets, som också bygger strukturerade samlingar av data från webben. Skillnaden ligger framför allt i angreppssättet.
| Område | BigSet | Exa Websets |
|---|---|---|
| Grundmodell | Ett system med flera agenter där en orkestrerare planerar schemat och andra agenter söker, läser ut och verifierar webbinformation . | En embeddingsbaserad söktjänst som använder agentbaserade arbetsflöden för att kontrollera sökresultat mot användarens fråga . |
| Licens | Open source under AGPL-3.0 . | Proprietär tjänst. |
| Drift | Kan självhostas med Docker . | Molnbaserad SaaS-tjänst; företagsplaner finns . |
| Webbinteraktion | Riktiga webbläsarsessioner kan navigera, klicka och hämta information från dynamiska webbplatser . | Mer sökdrivet, med neurala representationer för att hitta relevanta sidor och därefter verifiera innehållet . |
| Prisbild | Ingen plattformsavgift för en självhostad instans, men användaren står för drift och modellkostnader. | Websets uppges börja på 49 dollar i månaden för 8 000 krediter . |
Felaktiga eller helt påhittade dataposter är en central risk när AI självständigt bygger datamängder. Trendshift beskriver ett test där BigSet och en välfinansierad konkurrent fick samma fråga, och hävdar att konkurrenten returnerade hallucinerade uppgifter . Källan namnger dock inte konkurrenten uttryckligen, så påståendet bör läsas som en produktjämförelse från BigSets lanseringsmaterial – inte som ett oberoende benchmark.
Exa har samtidigt beskrivit ett eget arbetsflöde för hallucinationskontroll: först identifieras påståenden, därefter söks belägg fram och slutligen jämförs påståendena med beläggen . Exa Websets använder också agentbaserade kontroller för att avgöra om ett sökresultat verkligen motsvarar den efterfrågade entiteten .
BigSet har enligt lanseringsmaterialet ett särskilt verifieringssteg där agenter kontrollerar uppgifter mot källorna innan tabellen färdigställs . Däremot är det inte offentligt specificerat hur många kontrollpass som används eller exakt hur varje källhänvisning hanteras.
BigSets mest intressanta löfte är inte bara att automatisera skrapning, utan att flytta en del av dataprocessen från kod till avsikt. I stället för att först skriva och felsöka selektorer, API-anrop och ETL-flöden beskriver användaren vilken datamängd som behövs.
TinyFish har redan beskrivit sin bredare plattform som ett sätt att låta AI-agenter navigera på riktiga webbplatser, fylla i formulär och hämta strukturerade resultat med naturliga språkkommandon . BigSet paketerar den idén i ett mer konkret resultat: en tabell som kan laddas ner, granskas och uppdateras enligt ett schema.
För analytiker och mindre team kan det innebära att timmar av manuellt arbete pressas ihop till en kort interaktion. Samtidigt avgörs verktygets praktiska värde av hur väl agenterna hanterar föränderliga webbplatser, åtkomstbegränsningar och felaktiga källor. BigSet gör processen enklare – men en automatiskt skapad tabell behöver fortfarande granskas innan den används som beslutsunderlag.