BigSet no es una simple llamada a un modelo de lenguaje grande. Es un sistema multiagente que delega tareas en subagentes especializados, con un orquestador que gestiona el flujo de trabajo completo.
El pipeline documentado funciona de la siguiente manera :
El sistema está diseñado para trabajos recurrentes. Los usuarios pueden establecer una frecuencia de actualización —desde cada 30 minutos hasta semanalmente— y los agentes volverán a ejecutar todo el pipeline de investigación y validación según el programa, asegurando que los conjuntos de datos se mantengan actualizados sin intervención manual .
BigSet se publica bajo la licencia AGPL-3.0, una licencia 'copyleft' fuerte . Para los equipos que modifiquen el software y lo pongan a disposición como un servicio de red, la licencia generalmente exige que el código fuente modificado se ponga a disposición de los usuarios. Este marco legal contrasta con las licencias permisivas o los modelos de SaaS propietarios.
El sistema está empaquetado para autogestionarse con Docker . Esto significa que todo el pipeline —las interacciones web basadas en navegador, el razonamiento de los agentes respaldado por modelos de lenguaje y la lógica de extracción— se ejecuta en tu propia infraestructura. Para industrias con estrictos requisitos de cumplimiento, este modelo de despliegue evita los riesgos de soberanía de datos que supone enrutar consultas de inteligencia empresarial sensibles a través de una API o plataforma en la nube de terceros. El proceso de extracción de datos, por lo tanto, permanece dentro de un entorno controlado donde tú gestionas el acceso, la red y los registros.
La comparación competitiva más directa es con Exa Websets, un producto de Exa.ai que también construye colecciones de datos estructurados a partir de la web. Aunque ambos productos pretenden convertir la web en una base de datos consultable, sus enfoques técnicos y posicionamiento en el mercado difieren .
La alucinación es una preocupación crítica para cualquier sistema que construya conjuntos de datos de forma autónoma. La cobertura de Trendshift sobre BigSet destaca una comparación en la que tanto BigSet como un competidor ejecutaron la misma consulta y el competidor devolvió datos inventados . La naturaleza exacta de ese competidor no se nombra explícitamente en la fuente, pero la comparación se enmarca frente a un rival bien financiado.
Exa aborda el problema de las alucinaciones directamente con un flujo de trabajo de detección documentado en tres pasos que utiliza sus propias capacidades de búsqueda: extraer afirmaciones del texto, buscar evidencia y verificar las afirmaciones cotejándolas con la evidencia recuperada . El producto Websets de Exa también ejecuta flujos de trabajo de agentes sobre los candidatos de búsqueda para verificar que coinciden exactamente con la consulta del usuario antes de añadirlos al conjunto final .
Las fuentes que cubren el lanzamiento de BigSet describen una etapa de verificación dedicada, donde los subagentes verifican los hallazgos contrastándolos con sus fuentes antes de finalizar la tabla . La arquitectura específica de este agente de verificación —si es una comprobación de un solo paso o un sistema multipaso más complejo— no se detalla completamente en los materiales disponibles. Sin embargo, su propósito en el pipeline es claro: evitar que las filas sin citas de fuentes lleguen al conjunto de datos exportado.
| Dimensión | BigSet | Exa Websets |
|---|---|---|
| Modelo central | Sistema multiagente: un orquestador planifica el esquema y despliega subagentes para navegar, extraer y verificar datos de la web en vivo. | Motor de búsqueda basado en 'embeddings' que ejecuta flujos de trabajo de verificación con agentes sobre los candidatos de búsqueda para asegurar que coinciden con la consulta. |
| Licencia | AGPL-3.0 (open source). | Propietaria. |
| Despliegue | Autogestionado vía Docker. | SaaS en la nube; planes empresariales disponibles. |
| Interacción web | Sesiones de navegador real que navegan, hacen clic y extraen como un humano, manejando sitios dinámicos e inicios de sesión. | Principalmente basado en búsqueda; utiliza 'embeddings' neuronales para encontrar páginas relevantes y luego verifica el contenido. |
| Precio | Open source, sin tarifa de uso de plataforma para instancias autogestionadas. Los usuarios gestionan sus propios costes de computación y de API de modelos. | Websets desde $49/mes por 8.000 créditos; planes empresariales personalizados. |
| Soberanía de datos | Control total: se ejecuta en tu propia infraestructura. | El procesamiento de datos ocurre en los servidores de Exa. |
BigSet no es solo una nueva herramienta; representa un cambio en la forma en que se pueden construir los pipelines de datos. Para un equipo pequeño o un analista ocupado, comprimir lo que tradicionalmente era un proceso de varias horas de escribir y depurar 'scrapers' en una interacción de 2 a 5 minutos en lenguaje natural supone un ahorro de tiempo significativo .
La licencia AGPL-3.0 y el despliegue autogestionado con Docker también posicionan a BigSet como una respuesta a las crecientes preocupaciones en torno a la privacidad de los datos y la dependencia de un pipeline cerrado. Al ejecutar el sistema localmente, las empresas evitan enrutar datos comerciales confidenciales a través de un tercero y obtienen la libertad de modificar el pipeline según sus necesidades cambien.
TinyFish, que ha recaudado 47 millones de dólares y cuenta con Google, DoorDash y Amazon entre sus clientes para su plataforma de infraestructura más amplia, parece estar utilizando BigSet para impulsar la adopción de su tecnología central de agente web, al tiempo que ofrece una herramienta gratuita y genuinamente útil a la comunidad .