一次性 RAG 高度依賴原本嘅問題寫法、索引、文字分段方式同排名。如果第一輪搵到嘅資料似乎合理但其實唔完整,模型可能根本冇機會見到可以糾正答案嘅證據。
Agentic Search 就可以重新組織搜尋、打開另一份文件,或者檢查同一段落附近嘅內容,而唔係見到第一個似樣答案就收工。
財務表格同披露內容,往往要連同標題、頁面位置、註腳同前後文字一齊睇先明白。將文件切成一堆平面文字片段,可能會令呢啲關係消失。Navigation 同針對性閱讀,就畀模型有方法沿住文件行,而唔係將每段文字當成互不相關嘅碎片。
語意搜尋適合搵相近概念,但公司名稱、會計術語、日期、識別碼同重複披露等資料,經常需要逐字核對。Grep 式操作就提供另一條路,檢查某個字詞或模式係咪真係出現喺文件庫。其他 agentic 文件系統亦有類似嘅 search、grep、read 同文件瀏覽工具。
企業常見問題未必只需要一份文件:例如要喺一份申報入面搵數字,再去另一份文件搵定義或背景。模型主導嘅多步流程,可以喺整個文件庫入面交替做「發現資料」同「核實證據」,而唔係只靠一次排名結果。
Mistral 主要提到兩個針對高難度文件問答嘅評估。
FinanceBench 包含 368 份財務申報,總數約 53,900 頁。Mistral 報告指,Mistral Medium 3.5 用單次檢索時正確率係 26.7%,配合 Agentic Search 後升至 86%,即增加 59.3 個百分點,相對於原本結果約升至 3.2 倍。
Mistral 亦表示,曾經用 GLM-5.2 測試呢層檢索系統;官方文件將 GLM-5.2 列為由 Z.ai 提供嘅第三方開源文字模型。相關比較入面,GLM-5.2 嘅正確率由單次檢索嘅 6.3% 升至 Agentic Search 嘅 51.9%。
OfficeQA Pro 集中處理表格密集、需要跨文件查找嘅問題,資料集包含 696 份美國財政部公告掃描文件。Mistral 團隊成員 Ina Koleva 分享嘅公告指,準確率由 6.3% 升至 51.9%,即增加 45.6 個百分點。
呢啲結果相當亮眼,但唔代表任何企業文件、任何模型都一定有同樣表現。文件解析、OCR 質素、分段方式、索引、模型選擇、提示詞、工具使用上限同評估方法,都可能影響結果。OfficeQA Pro 研究亦顯示,文件點樣表示同解析,會實質影響準確度、延遲、工具呼叫次數同成本。
Mistral 表示,Agentic Search 喺相關 benchmark 入面,除咗提高準確度,亦可以減少 turns、token 使用量同延遲。 不過,多步系統始終要逐次等待工具回應同文件處理,唔可以單靠「agentic」呢個標籤就假設一定更快。
一篇針對 FinanceBench 結果嘅二次分析報告指,完整循環平均延遲約 71 秒,p90 則係 154 秒;呢兩個數字唔係 Mistral 主要來源片段直接提供,因此應該當作二次分析數據理解,而唔係官方已獨立驗證嘅通用表現。
企業實際上要比較嘅,唔係簡單嘅「agentic 對非 agentic」,而係:
Agentic 檢索可能透過只讀取模型真正需要嘅內容,減少無謂上下文;但更多推理步驟亦可能帶來額外延遲同成本。邊種設計最啱,取決於任務嘅複雜程度同出錯風險。
Mistral 表示,Agentic Search 可透過 Search Toolkit 同 Libraries 使用。 呢兩項產品屬於 Mistral 更廣泛嘅 agent 同文件搜尋架構:官方文件列出 Document Library,畀模型搜尋上載嘅檔案;Agents API 就支援喺對話期間呼叫工具嘅 agent。
重點係,Agentic Search 被定位成一個檢索元件,而唔只係消費者聊天機械人入面嘅一項功能。企業可以將佢放入自己嘅應用程式、agent,或者更大型嘅企業搜尋流程之中。
Mistral 同時以 Mistral Medium 3.5 同 GLM-5.2 測試,反映佢想將 Agentic Search 做成唔綁死單一模型嘅檢索及工具層。 如果文件搜尋、導覽同核實層可以配合唔同推理模型使用,企業理論上唔需要每次轉模型都由頭重建整套文件流程。
對企業而言,呢種可攜性可能有助平衡能力、價格、授權、部署位置同資料控制。不過,「模型無關」唔等於所有模型都會有一樣表現。工具使用可靠性、上下文處理能力同推理質素,都可能因模型而異,所以每個部署仍然要獨立測試。
Agentic Search 加強咗 Mistral 唔只係賣一個語言模型嘅定位。公司正嘗試提供一層可攜、可以喺敏感組織資料上進行搜尋同推理嘅基礎能力,應用範圍包括財務記錄同內部知識庫。Mistral 嘅金融方案亦強調按權限搜尋,並提供有證據同上下文嘅答案。
對受監管機構嚟講,資料喺邊度處理、模型可以接觸邊啲證據,往往同模型本身一樣重要。相關報道形容 Mistral 支援雲端同受控基礎設施,包括類似 on-premises 嘅環境;但部署彈性唔等於自動符合每個司法管轄區或行業嘅合規要求。
Mistral 嘅基礎設施計劃亦配合呢個敘事。路透社報道,Microsoft 同意斥資數十億美元支持 Mistral 嘅歐洲運算基礎設施,而 Azure 客戶可以使用 Mistral 喺法國嘅數據中心開發軟件。 歐洲託管有助資料留喺指定地區,同時提高營運控制;但 Microsoft 夥伴關係亦提醒市場,「主權 AI」唔代表完全脫離全球雲端同硬件供應鏈。
潛在集資亦反映點解企業檢索同基礎設施具有戰略價值。前沿 AI 產品需要大量昂貴運算資源,而企業客戶就希望系統可以可靠咁處理自己嘅資料。Agentic Search 主要處理應用同檢索層,歐洲數據中心則補足基礎設施一環。
Mistral 同時面對幾類對手:
對長篇、結構複雜嘅企業文件嚟講,Mistral 嘅 benchmark 結果提供咗一個有力起點。但長遠優勢,仍然要睇呢啲提升可唔可以喺獨立評估同真實生產環境重現,以及 Mistral 能否喺可接受嘅延遲、成本、安全性同整合複雜度之下交付。
Mistral Agentic Search 嘅核心概念其實好直接:文件檢索唔應該只係作答前做一次嘅查詢,而應該係一個主動調查過程。透過 search、open、navigate、read 同 grep,模型有更多機會喺複雜企業文件庫入面搵到、理解同核實證據。
Mistral 報告嘅結果——FinanceBench 由 26.7% 升至 86%,以及 OfficeQA Pro 增加 45.6 個百分點——顯示呢種設計有機會大幅改善文件問答。 但另一面同樣重要:呢啲係同 Mistral 有關嘅 benchmark 結果,企業採用前仍然要用自己嘅資料測試延遲、成本、權限、解析質素同可靠性。