BigSet 並非單純呼叫一個大型語言模型。它是一個多智能體系統,將任務委派給專門的子代理人,並由編排代理人管理整體工作流程。
根據文件記載,其管線運作方式如下 :
這個系統也支援重複性工作。使用者可以設定一個刷新頻率(從每 30 分鐘到每週一次),BigSet 就會按照排程自動重新執行完整的研究與驗證管線,確保資料集保持最新狀態 。
BigSet 採用 AGPL-3.0 授權,這是一個具有較強 Copyleft 效力的開源授權 。對於修改軟體並將其作為網路服務提供的團隊,此授權通常要求其向使用者公開修改後的原始碼。此法律框架與寬鬆的授權或專有的 SaaS 模式形成對比。
該系統已封裝好,可透過 Docker 自行託管 。這意味著整個管線——包括基於瀏覽器的網頁互動、大型語言模型支援的代理推理以及提取邏輯——都在你自己的基礎設施上運行。對於有嚴格合規要求的行業,這種部署模式避免了將敏感的商業情報查詢路由到第三方雲端 API 或平台所帶來的資料主權風險。因此,資料提取過程可以完全保留在一個可控的環境中。
最直接的競爭對手是 Exa Websets——Exa.ai 的一個產品,同樣能從網路建立結構化資料集合。儘管兩者都旨在將網路變成可查詢的資料庫,但其技術方法和市場定位有所不同 。
對於任何自動建立資料集的系統來說,幻覺都是一個關鍵問題。根據一份針對 BigSet 的報導,該比較顯示 BigSet 和一個競爭對手在執行相同查詢時,競爭對手回傳了虛構的資料 。報導中並未明確點名該對手,但該比較是針對一個資金雄厚(Series C、$250M)的競爭者。
Exa 透過其記錄在案的三步驟檢測工作流程來正面應對幻覺問題:從文字中提取主張、使用 Exa 搜尋證據、並驗證主張 。Exa 的 Websets 產品也會在將搜尋候選項目加入最終集合前,對其執行代理工作流程,以確認它們符合用戶的查詢 。
關於 BigSet 的報導描述了一個專用的驗證階段,子代理人在表格產出前會比對其發現與原始來源 。雖然其驗證代理人的具體架構細節在現有資料中未完全揭露,但其在管線中的目的很明確:防止無來源引用的資料行進入最終的匯出資料集。
| 項目 | BigSet | Exa Websets |
|---|---|---|
| 核心模型 | 多智能體系統:編排代理人規劃結構派發任務,子代理人自主瀏覽、提取、驗證 Web 資料。 | 基於嵌入向量的搜尋引擎,對搜尋候選項目執行代理驗證。 |
| 授權模式 | AGPL-3.0 開源。 | 專有(Proprietary)。 |
| 部署方式 | Docker 自託管。 | SaaS 雲端服務;另有企業方案。 |
| 網頁互動 | 如同真人般使用真實瀏覽器會話進行導航、點擊、提取。 | 主要以搜尋驅動;使用神經嵌入尋找相關頁面並驗證內容。 |
| 定價 | 開源(無平台使用費)。使用者自行承擔運算和模型 API 成本。 | Websets 起價每月 $49 美元(8,000 點數);企業方案另議。 |
| 資料主權 | 完全掌控——運行於自有基礎設施。 | 資料處理在 Exa 的伺服器上進行。 |
BigSet 不只是一個新工具,它代表了資料管線建構方式的轉變。對於一個小型團隊或忙碌的分析師來說,將過去需要花費數小時編寫和除錯爬蟲的過程,壓縮成一個 2 到 5 分鐘的自然語言互動,這節省了大量的時間 。
AGPL-3.0 授權和 Docker 自託管部署也使 BigSet 成為應對日益增長的資料隱私和管線鎖定疑慮的解答。透過在本機運行,企業可以避免將專有商業數據傳輸給第三方,並能根據需求自由修改管線。
TinyFish 這家公司目前已籌集 4700 萬美元,其更廣泛的基礎設施平台客戶包括 Google、DoorDash 和 Amazon 。透過推出 BigSet,TinyFish 似乎在推動其核心網頁代理技術的採用,同時為社群提供一個實用、免費的工具。