BigSet — это не единый вызов большой языковой модели. Это мультиагентная система, которая распределяет задачи между специализированными субагентами, а оркестратор управляет всем рабочим процессом.
Документированный конвейер работает следующим образом :
Система рассчитана на повторяющуюся работу. Пользователи могут установить периодичность обновления — от каждых 30 минут до еженедельного — и агенты будут повторно запускать полный цикл исследования и проверки по расписанию, гарантируя актуальность данных без ручного вмешательства .
BigSet выпущен под лицензией AGPL-3.0, которая относится к категории строгих авторских левых (copyleft) лицензий . Для команд, которые модифицируют ПО и предоставляют к нему доступ в качестве сетевого сервиса, эта лицензия обычно требует, чтобы исходный код изменений был также доступен пользователям. Эта правовая основа отличается от более разрешительных лицензий или проприетарных SaaS-моделей.
Система упакована для развертывания через Docker . Это означает, что весь конвейер — взаимодействие с веб-страницами через браузер, логика рассуждений на основе LLM и механизм извлечения данных — работает на вашей собственной инфраструктуре. Для отраслей со строгими требованиями соответствия такая модель развертывания позволяет избежать рисков, связанных с суверенитетом данных, когда конфиденциальные бизнес-запросы передаются через стороннее облачное API или платформу. Процесс извлечения данных остается в контролируемой среде, где вы управляете доступом, сетью и журналами.
Наиболее прямым конкурентом является Exa Websets — продукт от Exa.ai, который также создает структурированные наборы данных из интернета. Хотя оба продукта стремятся превратить веб в запрашиваемую базу данных, их технические подходы и позиционирование на рынке различаются .
Галлюцинации — критическая проблема для любой системы, которая автономно создает наборы данных. В освещении Trendshift, посвященном BigSet, приводится сравнение, где и BigSet, и конкурент выполняли один и тот же запрос, и у конкурента были возвращены вымышленные данные . Точная природа конкурента в источнике не названа, но сравнение проводится с хорошо финансируемым соперником.
Exa напрямую решает проблему галлюцинаций с помощью документированного трехэтапного рабочего процесса проверки, используя свои собственные возможности поиска: извлечение утверждений из текста, поиск доказательств и верификация утверждений по найденным доказательствам . Продукт Exa Websets также запускает агентные рабочие процессы на кандидатах из поисковой выдачи, чтобы проверить их соответствие точному запросу пользователя, прежде чем добавить их в финальный набор .
Источники, освещающие запуск BigSet, описывают выделенный этап проверки, на котором субагенты верифицируют находки по их источникам перед финализацией таблицы . Конкретная архитектура этого проверяющего агента — является ли он одношаговой проверкой или более сложной многопроходной системой — не раскрыта в полной мере в доступных материалах. Однако его цель в конвейере ясна: предотвратить попадание строк без указания источников в экспортируемый набор данных.
| Характеристика | BigSet | Exa Websets |
|---|---|---|
| Основная модель | Мультиагентная система: оркестратор планирует схему и отправляет субагентов для просмотра веба, извлечения и проверки данных в реальном времени. | Поисковая система на основе эмбеддингов, которая запускает агентные рабочие процессы верификации на кандидатах из поиска для проверки их соответствия запросу. |
| Лицензия | AGPL-3.0, open-source. | Проприетарная. |
| Развертывание | Само-хостинг через Docker. | Облачный SaaS; доступны корпоративные планы. |
| Взаимодействие с вебом | Реальные сессии браузера: навигация, клики, извлечение данных, как у человека; работа с динамическими сайтами и формами входа. | Преимущественно поисковый подход; использует нейронные эмбеддинги для поиска релевантных страниц с последующей верификацией. |
| Цена | Open-source, плата за платформу отсутствует для self-hosted инстансов. Пользователи оплачивают свои вычислительные ресурсы и API модели. | Websets от $49/мес. за 8 000 кредитов; корпоративные платы — индивидуально. |
| Суверенитет данных | Полный контроль — все работает на вашей инфраструктуре. | Обработка данных происходит на серверах Exa. |
BigSet — это не просто очередной инструмент; он представляет собой сдвиг в том, как могут строиться пайплайны данных. Для небольшой команды или загруженного аналитика сжатие того, что традиционно занимало несколько часов написания и отладки парсеров, в 2–5 минут взаимодействия на естественном языке — это значительная экономия времени .
Лицензия AGPL-3.0 и развертывание через Docker также позиционируют BigSet как ответ на растущие опасения по поводу конфиденциальности данных и зависимости от конкретного поставщика (vendor lock-in). Запуская систему локально, компании избегают передачи конфиденциальных бизнес-данных через третью сторону и получают возможность модифицировать пайплайн по мере изменения их потребностей.
TinyFish, который привлек $47 миллионов инвестиций и насчитывает среди своих клиентов Google, DoorDash и Amazon, использует BigSet, судя по всему, для стимулирования принятия своей основной технологии веб-агентов, одновременно предоставляя сообществу по-настоящему полезный и бесплатный инструмент .