BigSet n’est pas un simple appel à un grand modèle de langage. C’est un système multi-agents qui délègue des tâches à des sous-agents spécialisés, l’orchestrateur gérant le flux global.
Le pipeline documenté fonctionne comme suit :
Le système est conçu pour un usage récurrent. Les utilisateurs peuvent définir une cadence de rafraîchissement – de 30 minutes à une semaine – et les agents réexécuteront l’ensemble du pipeline de recherche et de validation selon le calendrier prévu, garantissant ainsi des jeux de données à jour sans intervention manuelle .
BigSet est publié sous la licence AGPL-3.0, une licence de type copyleft fort . Pour les équipes qui modifient le logiciel et le mettent à disposition sous forme de service réseau, la licence exige généralement que le code source modifié soit mis à la disposition des utilisateurs. Ce cadre juridique contraste avec les licences permissives ou les modèles SaaS propriétaires.
Le système est conditionné pour un auto-hébergement via Docker . Cela signifie que l’ensemble du pipeline – les interactions web via navigateur, le raisonnement des agents basé sur les LLM et la logique d’extraction – s’exécute sur votre propre infrastructure. Pour les secteurs soumis à des exigences de conformité strictes, ce modèle de déploiement évite les risques de souveraineté des données liés à l’acheminement de requêtes sensibles via une API ou une plateforme cloud tierce. Le processus d’extraction des données reste ainsi dans un environnement contrôlé où vous gérez l’accès, le réseau et les journaux.
La comparaison concurrentielle la plus directe est avec Exa Websets, un produit d’Exa.ai qui construit également des collections de données structurées à partir du web. Bien que les deux produits visent à transformer le web en une base de données interrogeable, leurs approches techniques et leur positionnement sur le marché diffèrent .
L’hallucination est une préoccupation majeure pour tout système qui construit des jeux de données de manière autonome. La couverture de Trendshift sur BigSet met en avant une comparaison où BigSet et un concurrent ont exécuté la même requête et où le concurrent a retourné des données hallucinées . La nature exacte de ce concurrent n’est pas explicitement nommée dans la source, mais la comparaison est faite avec un rival bien financé.
Exa aborde l’hallucination de front grâce à un flux de travail de détection en trois étapes documenté, qui utilise ses propres capacités de recherche : extraire les affirmations du texte, rechercher des preuves et vérifier les affirmations par rapport aux preuves récupérées . Le produit Websets d’Exa exécute également des flux de travail agentiques sur des candidats de recherche pour vérifier qu’ils correspondent à la requête exacte de l’utilisateur avant de les ajouter à l’ensemble final .
Les sources couvrant le lancement de BigSet décrivent une étape de vérification dédiée, où des sous-agents vérifient les résultats par rapport à leurs sources avant que le tableau ne soit finalisé . L’architecture spécifique de cet agent de vérification – qu’il s’agisse d’une vérification en une seule étape ou d’un système multipasse plus complexe – n’est pas entièrement détaillée dans les documents disponibles. Cependant, son objectif dans le pipeline est clair : empêcher les lignes sans citation de source d’atteindre le jeu de données exporté.
| Dimension | BigSet | Exa Websets |
|---|---|---|
| Modèle central | Système multi-agents : un orchestrateur planifie le schéma et dispatche des sous-agents pour naviguer, extraire et vérifier les données du web en direct. | Moteur de recherche basé sur les plongements (embeddings) qui exécute des flux de travail agentiques de vérification sur des candidats de recherche pour s’assurer qu’ils correspondent à la requête. |
| Licence | AGPL-3.0 open source. | Propriétaire. |
| Déploiement | Auto-hébergé via Docker. | SaaS dans le cloud ; plans entreprise disponibles. |
| Interaction web | Sessions de navigateur réelles qui naviguent, cliquent et extraient comme un humain, gérant les sites dynamiques et les connexions. | Principalement basé sur la recherche ; utilise des plongements neuronaux pour trouver les pages pertinentes, puis vérifie le contenu. |
| Tarification | Open source, donc pas de frais de plateforme pour les instances auto-hébergées. Les utilisateurs gèrent leurs propres coûts de calcul et de modèle API. | Websets commence à 49 $/mois pour 8 000 crédits ; les plans entreprise sont personnalisés. |
| Souveraineté des données | Contrôle total – s’exécute sur votre propre infrastructure. | Le traitement des données a lieu sur les serveurs d’Exa. |
BigSet n’est pas seulement un nouvel outil ; il représente un changement dans la manière dont les pipelines de données peuvent être construits. Pour une petite équipe ou un analyste débordé, compresser ce qui était traditionnellement un processus de plusieurs heures d’écriture et de débogage de scrapers en une interaction de 2 à 5 minutes en langage naturel est un gain de temps considérable .
La licence AGPL-3.0 et le déploiement Docker auto-hébergé positionnent également BigSet comme une réponse aux préoccupations croissantes concernant la confidentialité des données et le verrouillage des pipelines. En exécutant le système localement, les entreprises évitent d’acheminer des données propriétaires via un tiers et gagnent la liberté de modifier le pipeline à mesure que leurs besoins évoluent.
TinyFish, qui a levé 47 millions de dollars et compte Google, DoorDash et Amazon parmi ses clients pour sa plateforme d’infrastructure plus large, semble utiliser BigSet pour stimuler l’adoption de sa technologie d’agent web centrale tout en fournissant un outil gratuit et réellement utile à la communauté .