Окрема перевага — можливість регулярного оновлення. Користувач може встановити інтервал від 30 хвилин до одного тижня, після чого агенти повторно запускають пошук і перевірку, підтримуючи датасет в актуальному стані .
BigSet поширюється за ліцензією AGPL-3.0 — це copyleft-ліцензія з вимогами, суворішими за типові дозвільні open-source ліцензії . Для команд це означає необхідність уважно перевірити ліцензійні умови, особливо якщо вони змінюють код і надають модифіковану версію як мережевий сервіс.
Систему можна розгорнути через Docker на власній інфраструктурі . У такій моделі команда контролює середовище виконання, доступи, мережеві налаштування та журнали. Це може бути важливо для компаній, які не хочуть передавати чутливі бізнес-запити через сторонню SaaS-платформу.
Водночас self-hosting не означає автоматично нульових витрат: користувачам усе одно потрібно забезпечити обчислювальні ресурси та, залежно від конфігурації, оплату доступу до моделей. Його головна перевага — контроль над розгортанням і даними, а не повна відсутність операційних витрат.
Найближчим за ідеєю конкурентом BigSet виглядає Exa Websets — сервіс Exa.ai для створення структурованих наборів даних із вебу. Обидва продукти намагаються перетворити інтернет на джерело даних, яке можна запитувати природною мовою, але роблять це різними способами .
Галюцинації — одна з головних проблем автономного створення датасетів. У матеріалі Trendshift описано порівняння, під час якого BigSet і неназваний добре фінансований конкурент виконали однаковий запит, а конкурент повернув частково вигадані дані . Оскільки джерело не називає цей продукт прямо, робити з цього остаточний висновок про перевагу BigSet не варто.
Exa документує окремий процес перевірки тверджень у три кроки: спочатку система виокремлює твердження з тексту, потім шукає докази, а після цього звіряє твердження з отриманими джерелами . У Websets агентні процеси також перевіряють знайдені результати, перш ніж додати їх до фінального набору .
У BigSet передбачено окрему стадію перевірки результатів за джерелами . Її призначення зрозуміле — не допустити до експорту непідтверджені записи, хоча детальна реалізація цього механізму у доступних матеріалах не описана.
| Параметр | BigSet | Exa Websets |
|---|---|---|
| Основний підхід | Оркестратор планує схему, а підлеглі агенти шукають, вилучають і перевіряють дані з живого вебу . | Embeddings-пошук знаходить кандидатів, після чого агентні процеси перевіряють їхню відповідність запиту . |
| Ліцензія | Open-source, AGPL-3.0 . | Пропрієтарний сервіс. |
| Розгортання | Self-hosting через Docker . | Хмарний SaaS із тарифами для бізнесу . |
| Взаємодія з вебом | Реальні браузерні сесії можуть переходити сторінками, натискати кнопки та працювати з динамічними сайтами . | Переважно пошуковий підхід із використанням нейронних embeddings і подальшою перевіркою контенту . |
| Ціна | Для self-hosted-версії немає плати за користування платформою, але залишаються витрати на інфраструктуру та моделі. | Websets стартує від 49 доларів на місяць за 8 000 кредитів; корпоративні плани формуються індивідуально . |
| Контроль над даними | Дані та конвеєр можна тримати у власному середовищі . | Обробка відбувається на інфраструктурі Exa. |
BigSet не скасовує потреби в інженерії для кожного сценарію. Складні джерела, нестабільні сайти, обмеження доступу та вимоги до якості все одно можуть потребувати ручного контролю. Але продукт змінює точку входу: замість написання скрипта користувач спочатку формулює, які саме дані йому потрібні.
За описом запуску, процес, який традиційно міг займати кілька годин роботи зі скреперами та очищенням даних, BigSet намагається скоротити до взаємодії природною мовою тривалістю приблизно 2–5 хвилин . Це робить систему потенційно корисною для аналітиків, невеликих команд і дослідників, яким потрібен робочий датасет без побудови повноцінного ETL-конвеєра.
Для TinyFish BigSet також може стати способом показати можливості її ширшої інфраструктури вебагентів. Компанія описує свої інструменти як такі, що дають агентам змогу шукати в інтернеті, відкривати сторінки, працювати з браузером і повертати структуровані результати . За даними доступних матеріалів, TinyFish залучила 47 мільйонів доларів, а серед клієнтів її платформи називають Google, DoorDash і Amazon .
У підсумку BigSet цікава не лише як ще один генератор таблиць. Це спроба перенести рутинний збір даних із площини ручного програмування у формат «описав — перевірив — експортував». Наскільки надійно такий підхід працюватиме на складних і мінливих сайтах, залежатиме від якості агентів, джерел і контролю результатів — але сам напрямок уже помітно відрізняється від класичного скрепінгу.