為咗執行呢樣嘢,系統引入咗一個叫「留言板把關系統」(Gated Bulletin Board System,BBS)嘅中央溝通機制,透過三種模式控制智能體幾時可以睇到對方嘅研究成果 :
為咗實證呢種隔離主義係咪真係 Work,Snowflake 團隊喺 BrowseComp 基準嘅 120 條問題子集上做咗個消融實驗(Ablation study)。佢哋測試咗三種配置:用把關 BBS、完全無限制嘅點對點(Peer-to-peer)通訊、同埋單一智能體嘅獨立運作 。
結果一巴掌打醒咗好多人。無限制嘅點對點通訊,極速令到證據嘅多樣性崩潰。 研究團隊觀察到,唔同智能體提取嘅網址(URL),佢哋嘅 Jaccard 重疊度高到得人驚。換句話講,佢哋根本冇分工去覆蓋更多地方,而係一齊湧去睇嗰幾版資料,個個都跟住同一個早期線索走。
更關鍵嘅係,量度系統模擬到幾多個真正獨立調查員嘅「有效樣本數」(Effective Sample Size,ESS),喺有閱讀屏障嘅情況下明顯高好多。隔離狀態強迫智能體進行多元化探索,而呢樣嘢正正係自由傾偈所摧毀咗嘅嘢 。
ArcticSwarm 嘅設計唔係得個講字,反映喺實際戰績上就係大幅嘅效能提升。喺 Snowflake 內部嘅混合深度研究基準測試入面,ArcticSwarm 嘅準確度達到 64.18%,相比起單一智能體配置嘅 47.08%,足足提升咗超過三分一 。
佢喺公開基準測試嘅表現仲犀利。喺完整嘅 BrowseComp 數據集(1,266 條問題)入面,效能同覆檢期間達成共識嘅程度有好強嘅關聯 :
呢個結果證明,後續覆檢階段嘅質素,同起初嘅隔離一樣咁關鍵。
比較返對手,喺原始 BrowseComp 數據集上,標準嘅大型語言模型如 GPT-4o 同 GPT-4.5,準確度接近零(0.6%–0.9%)。OpenAI 專注推理嘅 o1 模型好少少,提升到大約 10%,而專門訓練嚟做持續瀏覽嘅 OpenAI Deep Research 智能體,準確度就大約去到 51.5% 。
再睇更加受控嘅 BrowseComp-Plus 基準,最強嘅競爭配置係 GPT-5 配合 Qwen3-8B 檢索器,達到 70.12% 準確度,而 o3 用同一個檢索器就達到 63.49% 。ArcticSwarm 喺 BrowseComp-Plus 最難、需要雙重驗證嘅子集上達到嘅 86.4%,明顯超越咗呢啲現有嘅基準 。
呢啲打破小圈子思維嘅概念並唔係留喺學術論文度。Snowflake 而家正將 ArcticSwarm 呢套反小圈子思維嘅方法論,整合到佢嘅企業平台,透過 Snowflake CoWork 嘅「深度研究模式」 推出 。
呢個整合等知識型員工可以喺 Snowflake 受監管嘅數據環境入面,直接進行安全、高可信度嘅分析。整個工作流程由三大功能支撐 :
對企業用家嚟講,即係 ArcticSwarm 抵抗確認偏誤(Confirmation bias)嘅能力,可以應用到結構化 SQL 數據庫查詢,同非結構化內部文件瀏覽嘅混合流程度。佢俾到嘅答案,係經過咗嚴格、獨立嘅交叉驗證,先會呈現俾人類決策者睇。