BigSet 唔係簡單叫一次大型語言模型咁簡單。佢係一個多智能體系統,會將任務分配俾專門嘅子智能體,由一個 Orchestrator 統籌管理成個工作流程。
根據資料,佢嘅管道係咁樣行嘅 :
呢個系統係設計嚟做重複性工作嘅。用戶可以設定一個更新頻率,由每 30 分鐘到每個禮拜一次都得,咁樣啲 Agent 就會按照時間表自動重新執行成個研究同驗證管道,確保啲數據集 keep 住最新,唔使手動搞 。
BigSet 係用 AGPL-3.0 許可證 發佈嘅,呢個係一個好嚴格嘅 Copyleft 許可證 。對於嗰啲會修改軟件然後當網絡服務提供俾人用嘅團隊呢,呢個許可證通常要求你將改過嘅源碼都要開放俾用戶睇。呢個法律框架同寬鬆許可證或者封閉式 SaaS 模式好唔同。
呢個系統係包裝成 Docker 形式嚟做自家部署 嘅 。呢個意思係,成個管道——包括基於瀏覽器嘅網絡互動、背後用 LLM 驅動嘅智能體推理、以至提取邏輯——全部喺你自己嘅基建度運行。對於有嚴格合規要求嘅行業嚟講,呢種部署模式就避開咗將敏感嘅商業智能查詢經第三方雲端 API 或平台傳送嘅數據主權風險。成個數據提取過程就可以喺一個你可以完全控制存取、網絡同日誌嘅環境入面進行。
最直接嘅競爭對手就係 Exa Websets,呢個係 Exa.ai 嘅產品,一樣可以從網絡建立結構化數據集。雖然兩個產品都想將網絡變成一個可以查詢嘅數據庫,但係佢哋嘅技術路綫同市場定位就好唔同 。
對於任何自動建立數據集嘅系統嚟講,「作大」(Hallucination)都係一個好關鍵嘅問題。Trendshift 報道 BigSet 時提到一個比較,話 BigSet 同一個競爭對手執行同一條查詢,但對手就俾返啲「作大」嘅數據出嚟 。報道冇指名道姓話係邊個對手,但個比較明顯係針對一個資金好雄厚嘅競爭者。
Exa 應對「作大」問題嘅方法就好透明,佢哋有一個記錄咗嘅三步檢測流程,用到自己嘅搜尋功能:從文字中提取聲明、搜尋證據、然後用搵到嘅證據去核實聲明 。Exa 嘅 Websets 產品亦都會對搜尋返嚟嘅候選結果執行 Agent 化嘅工作流程,確保佢哋符合用戶嘅確切查詢條件,先至加入最終集合同 。
至於講到 BigSet 嘅報道,就提到佢哋有一個專門嘅驗證階段,會用 Sub-Agent 喺表格最終確定之前,核實啲發現係咪有來源根據 。關於呢個驗證 Agent 嘅具體架構——係簡單檢查一次定係複雜嘅多重驗證系統——現有資料就冇講得好詳細。不過佢喺管道入面嘅目的就好清楚:就係要防止冇來源引述嘅行數流出到 Export 嘅數據集度。
| 層面 | BigSet | Exa Websets |
|---|---|---|
| 核心模型 | 多智能體系統:一個 Orchestrator 規劃數據結構,然後派出 Sub-Agent 去瀏覽、提取同驗證即時網絡數據。 | 基於 Embedding 嘅搜尋引擎,對搜尋候選結果執行 Agent 化驗證工作流程,確保符合查詢條件。 |
| 許可證 | AGPL-3.0 開源。 | 封閉源碼。 |
| 部署方式 | 經 Docker 自家部署。 | 雲端 SaaS;另有企業版本。 |
| 網絡互動 | 用真實瀏覽器 Session 好似人類咁瀏覽、點擊、提取資料,處理動態網站同登入。 | 主要靠搜尋驅動;用神經網絡 Embedding 嚟搵相關頁面,然後驗證內容。 |
| 價錢 | 開源,自家部署嘅話冇平台使用費。用戶自己負責管理運算同模型 API 嘅成本。 | Websets 由每月 $49 美金起,有 8,000 Credits;企業版本另議。 |
| 數據主權 | 完全控制——喺你自己嘅基建入面運行。 | 數據處理喺 Exa 嘅伺服器進行。 |
BigSet 唔止係一個新工具;佢代表咗一種數據管道可以點樣建立嘅新思維。對於一個細團隊或者一個好忙嘅分析師嚟講,將以往要花幾個鐘去寫同除錯爬蟲程式嘅工序,壓縮成一個 2 到 5 分鐘嘅自然語言互動,真係可以慳返好多時間 。
AGPL-3.0 許可證同 Docker 自家部署嘅模式,亦都令 BigSet 成為咗一個應對日益增長嘅數據私隱同管道依賴問題嘅答案。透過喺本地運行個系統,公司就可以避免將專有商業數據經第三方傳送,同時亦可以隨住業務需求變化而自由修改個管道。
TinyFish 呢間公司已經融咗 4,700 萬美金,Google、DoorDash 同 Amazon 都係佢哋嘅客戶,用緊佢哋更廣泛嘅基建平台。今次推出 BigSet,似乎係想用呢個實用嘅免費工具嚟推動更多人採用佢哋核心嘅 Web Agent 技術 。