O BigSet não é uma simples chamada a um grande modelo de linguagem. É um sistema multiagente que delega tarefas a subagentes especializados, com um orquestrador gerenciando todo o fluxo de trabalho.
O pipeline documentado funciona da seguinte forma :
O sistema foi construído para trabalhos recorrentes. Os usuários podem definir uma cadência de atualização — de 30 minutos a semanalmente — e os agentes executarão todo o pipeline de pesquisa e validação novamente no agendamento, garantindo que os datasets permaneçam atualizados sem intervenção manual .
O BigSet é lançado sob a licença AGPL-3.0, uma licença copyleft forte . Para equipes que modificam o software e o disponibilizam como um serviço de rede, a licença geralmente exige que o código-fonte modificado seja disponibilizado aos usuários. Este quadro legal contrasta com licenças permissivas ou modelos SaaS proprietários.
O sistema é empacotado para auto-hospedagem via Docker . Isso significa que todo o pipeline — as interações web baseadas em navegador, o raciocínio do agente com LLM e a lógica de extração — é executado em sua própria infraestrutura. Para setores com requisitos rigorosos de conformidade, este modelo de implantação evita os riscos de soberania de dados de rotear consultas de inteligência de negócios sensíveis através de uma API ou plataforma de nuvem de terceiros. O processo de extração de dados, portanto, permanece dentro de um ambiente controlado onde você gerencia acesso, rede e logs.
A comparação concorrencial mais direta é com o Exa Websets, um produto da Exa.ai que também constrói coleções de dados estruturados da web. Embora ambos os produtos visem transformar a web em um banco de dados consultável, suas abordagens técnicas e posicionamento de mercado diferem .
A alucinação é uma preocupação crítica para qualquer sistema que constrói datasets de forma autônoma. A cobertura do Trendshift sobre o BigSet destaca uma comparação onde tanto o BigSet quanto um concorrente executaram a mesma consulta e o concorrente retornou dados alucinados . A natureza exata desse concorrente não é explicitamente nomeada na fonte, mas a comparação é feita contra um rival bem financiado (que fontes externas identificam como Exa, que levantou US$ 250 milhões).
A Exa aborda a alucinação de frente através de um fluxo de trabalho de detecção de três etapas documentado, que usa seus próprios recursos de busca: extrair alegações do texto, buscar evidências e verificar alegações contra as evidências recuperadas . O produto Websets da Exa também executa fluxos de trabalho de agente em candidatos de busca para verificar se eles correspondem exatamente à consulta do usuário antes de adicioná-los ao conjunto final .
As fontes que cobrem o lançamento do BigSet descrevem um estágio de verificação dedicado, onde subagentes verificam as descobertas contra suas fontes antes que a tabela seja finalizada . A arquitetura específica deste agente de verificação — se é uma verificação de etapa única ou um sistema multi-passo mais complexo — não é totalmente detalhada nos materiais disponíveis. No entanto, seu propósito no pipeline é claro: evitar que linhas sem citações de fonte cheguem ao dataset exportado.
| Dimensão | BigSet | Exa Websets |
|---|---|---|
| Modelo Principal | Sistema multiagente: um orquestrador planeja o esquema e despacha subagentes para navegar, extrair e verificar dados da web ao vivo. | Mecanismo de busca baseado em embeddings que executa fluxos de verificação de agente em candidatos de busca para garantir que correspondam à consulta. |
| Licença | AGPL-3.0 open-source. | Proprietária. |
| Implantação | Auto-hospedado via Docker. | SaaS em nuvem; planos empresariais disponíveis. |
| Interação Web | Sessões reais de navegador que navegam, clicam e extraem como um humano, lidando com sites dinâmicos e logins. | Principalmente baseado em busca; usa embeddings neurais para encontrar páginas relevantes e depois verifica o conteúdo. |
| Preço | Open-source, sem taxa de plataforma para instâncias auto-hospedadas. Usuários gerenciam seus próprios custos de computação e API de modelo. | Websets a partir de $49/mês por 8.000 créditos; planos empresariais personalizados. |
| Soberania de Dados | Controle total — executa em sua própria infraestrutura. | O processamento de dados ocorre nos servidores da Exa. |
O BigSet não é apenas uma nova ferramenta; representa uma mudança em como os pipelines de dados podem ser construídos. Para uma pequena equipe ou um analista ocupado, comprimir o que tradicionalmente era um processo de várias horas de escrever e depurar scripts de raspagem em uma interação de 2 a 5 minutos em linguagem natural é uma economia de tempo significativa .
A licença AGPL-3.0 e a implantação auto-hospedada via Docker também posicionam o BigSet como uma resposta às crescentes preocupações com privacidade de dados e dependência de pipeline. Ao executar o sistema localmente, as empresas evitam rotear dados comerciais proprietários através de um terceiro e ganham a liberdade de modificar o pipeline conforme suas necessidades mudam.
A TinyFish, que já levantou US$ 47 milhões e conta com Google, DoorDash e Amazon entre seus clientes para sua plataforma de infraestrutura mais ampla, parece estar usando o BigSet para impulsionar a adoção de sua tecnologia principal de agente web, ao mesmo tempo que fornece uma ferramenta gratuita e genuinamente útil para a comunidade .