OpenSearch-VL 的答案,是把建立智能體所需的流程公開化:資料、工具編排、監督式微調、強化學習,以及多模態深度搜尋評測,都被納入同一套訓練方案中 。
一般視覺語言模型通常是看圖後描述內容,或根據畫面中可見資訊回答問題。OpenSearch-VL 的設計則更接近一個工具循環:論文描述的智能體可以呼叫網頁搜尋、以圖搜圖、OCR 文字辨識、影像裁切、銳化、超解析度與透視校正等工具 。
這對搜尋任務很關鍵。因為一張圖片常常只提供不完整線索:可能是太小的文字、角度不佳的物件、被裁切的地標,或需要外部資料交叉確認的視覺提示。在 OpenSearch-VL 的設定裡,模型要判斷缺少什麼證據,選擇檢索或影像處理工具,再把取得的結果放回後續推理中 。
OpenSearch-VL 論文包含兩組軌跡資料集:SearchVL-SFT,含 36,000 條監督式微調軌跡;以及 SearchVL-RL,含 8,000 條強化學習軌跡 。其中 SFT 可理解為讓模型先學會示範答案與操作流程;RL 則是強化學習,透過回饋讓模型改善決策。
論文也提出 Multi-round Fault-Aware GRPO,也就是面向多輪工具使用、並考慮中途行動可能失敗或只部分有用的訓練方法 。這點很重要:多模態搜尋智能體不只要知道圖片裡有什麼,還要學會何時搜尋、何時處理圖片、何時用 OCR 讀字,以及何時停止蒐證。OpenSearch-VL 將這些決策整理成可訓練的軌跡,而不是把工具使用過程留在黑盒之中 。
論文中最受注意的說法是:OpenSearch-VL 在七個多模態深度搜尋基準上,平均提升超過 10 個百分點,並且在部分任務上可與領先的閉源商用模型相比 。
不過,這不等於已經證明它在產品層級全面追上 OpenAI 或 Google 的系統。現有公開證據主要來自作者論文與發佈報導,還不是第三方獨立重現,也不是對實際商用系統進行同條件、同規格的公開審計 。因此,目前較穩妥的解讀是:OpenSearch-VL 技術上很有參考價值,也具備開源挑戰者的潛力;但在真實世界的可靠性、延遲、安全行為,以及長流程任務中的錯誤修復能力上,仍需要更多外部測試。
若要把 OpenSearch-VL 與 OpenAI、Google 的專有多模態搜尋或研究型系統相比,目前最清楚、也最有證據支持的差異是:開放程度。OpenSearch-VL 被定位為開源配方與開源訓練方案;相較之下,現有引述資料並沒有揭露那些閉源商用產品的同等訓練堆疊 。
這使它對研究者與開發者特別有吸引力:外界可以檢視多模態搜尋智能體如何被訓練、工具使用軌跡如何建構,以及多步視覺推理在哪些環節容易出錯。它的基準成績讓它成為值得關注的開源競爭者,但公開資料仍不足以斷定它已在正式產品場景中追平閉源系統 。
真正關鍵的下一步,是外部研究者能否重現論文中的基準結果;這套配方是否能套用到論文評測之外的更多領域;以及用這種方式訓練出的智能體,能否在更長、更混亂的真實搜尋任務中穩定處理工具錯誤。
在這些答案出現之前,OpenSearch-VL 最明確的貢獻是透明度。它為 AI 社群提供了一套可檢視、可討論的多模態搜尋智能體開源配方,也讓外界更容易衡量:開源系統距離閉源 AI 搜尋產品,究竟還有多遠 。