BigSet 并非单一的 LLM 调用。它是一个多智能体系统,将任务委派给专门的子智能体,由编排器管理整个工作流。
根据公开文档,其管道工作方式如下 :
该系统还支持重复性工作。用户可以设置刷新频率(从每 30 分钟到每周一次),智能体将按计划重新运行完整的研究和验证流程,确保数据集在不需手动干预的情况下保持最新状态 。
BigSet 采用 AGPL-3.0 许可证 发布,这是一种强版权(copyleft)许可证 。对于修改该软件并将其作为网络服务提供的团队,该许可证通常要求向用户提供修改后的源代码。这一法律框架与宽松的许可证或专有 SaaS 模式形成鲜明对比。
该系统被打包用于 基于 Docker 的自托管 。这意味着整个管道——基于浏览器的网页交互、LLM 支持的智能体推理以及提取逻辑——都运行在你自己的基础设施上。对于有严格合规要求的行业,这种部署模式避免了将敏感的商业智能查询路由至第三方云 API 或平台所带来的数据主权风险。因此,数据提取过程可以在一个受控的环境中进行,你可以自主管理访问、网络和日志。
最直接的竞品是 Exa Websets,这是 Exa.ai 的一款产品,也致力于从网络中构建结构化数据集合。虽然两者都旨在将网络转化为可查询的数据库,但它们的技术路径和市场定位有所不同 。
对于任何自主构建数据集的系统来说,幻觉都是一个关键问题。Trendshift 对 BigSet 的报道中提到了一项对比测试,其中 BigSet 和一个竞品运行了相同的查询,而竞品返回了捏造的数据 。该资料没有明确指出竞品的名称,但将其与一个资金雄厚的竞争对手进行了比较。
Exa 通过一个记录在案的三步检测工作流来正面解决幻觉问题,该工作流利用其自身的搜索能力:从文本中提取声明、搜索证据、并根据检索到的证据验证声明 。Exa 的 Websets 产品还会对搜索候选结果运行智能体工作流,以验证它们是否符合用户的精确查询,然后再将其添加到最终数据集中 。
关于 BigSet 发布的资料描述了一个专门的验证阶段,在该阶段中,子智能体在表格最终确定之前会根据其来源验证发现 。这个验证智能体的具体架构——是单步检查还是更复杂的多通系统——在现有材料中没有详细说明。然而,它在管道中的目的是明确的:防止没有来源引用的行进入导出的数据集。
| 维度 | BigSet | Exa Websets |
|---|---|---|
| 核心模型 | 多智能体系统:编排器规划数据模式并调度子智能体浏览、提取和验证实时网页数据。 | 基于嵌入的搜索引擎,对搜索候选结果运行智能体验证工作流,以确保它们符合查询要求。 |
| 许可证 | AGPL-3.0 开源。 | 专有软件。 |
| 部署方式 | 通过 Docker 自托管。 | 云端 SaaS;提供企业版计划。 |
| 网页交互方式 | 真实的浏览器会话,像人类一样导航、点击和提取,可处理动态网站和登录。 | 主要基于搜索驱动;使用神经嵌入来查找相关页面,然后验证内容。 |
| 定价 | 开源,因此自托管实例无平台使用费。用户需自行承担计算和模型 API 费用。 | Websets 起价 49 美元/月(8000 积分);企业版定制。 |
| 数据主权 | 完全控制——运行在你自己的基础设施上。 | 数据处理发生在 Exa 的服务器上。 |
BigSet 不仅仅是一个新工具;它代表了一种构建数据管道的新思路。对于一个小团队或忙碌的分析师来说,将传统上需要数小时来编写和调试爬虫的过程压缩为 2 到 5 分钟的自然语言交互,是一个显著的效率提升 。
AGPL-3.0 许可证和 Docker 自托管部署也将 BigSet 定位为对日益增长的数据隐私和管道锁定问题的回应。通过在本地运行系统,公司可以避免将专有业务数据路由至第三方,并获得了根据自身需求修改管道的自由。
TinyFish 已融资 4700 万美元,其更广泛的基础设施平台客户包括 Google、DoorDash 和 Amazon。此次发布 BigSet,似乎是希望通过提供一款真正有用且免费的工具来推动其核心网页智能体技术的采用,同时回馈社区 。