Mistral Agentic Search 將一次性檢索改為迭代循環,讓模型依序搜尋、開啟、導覽、閱讀及 grep 文件。 這套方法主要針對長篇財報、掃描 PDF、表格、註腳,以及必須跨多份文件尋找證據的企業問題。 Mistral 報告稱,Mistral Medium 3.5 在 FinanceBench 的正確率由 26.7% 提升至 86%;OfficeQA Pro 則由 6.3% 提升至 51.9%。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Mistral AI’s Agentic Search, how does its five-operation iterative retrieval loop (search, open, navigate, read, and grep) improve o. Article summary: Mistral’s Agentic Search is a retrieval layer that lets an LLM investigate an enterprise corpus over multiple tool calls rather than answer from a single batch of retrieved chunks. Its purpose is to make long, table-heav. Topic tags: general, documentation, general web, news, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Mistral Agentic Search 是一個讓 AI 模型「持續查證」企業文件的檢索層。它不要求模型只根據第一次擷取的一批文字片段作答,而是讓模型透過多次工具呼叫,搜尋候選內容、開啟文件、瀏覽文件結構、閱讀相關段落,再用精確字詞或模式進行核對。
這項差異在長篇財務申報文件、掃描頁面、表格、註腳,以及需要比較多份文件的問題上尤其重要。Mistral 表示,在包含 368 份申報文件、約 53,900 頁資料的 FinanceBench 測試中,Mistral Medium 3.5 的正確率由一次性檢索的 26.7% 提升至 Agentic Search 的 86%,約為原本的三倍。這些結果來自 Mistral 自行進行的評估,應視為產品基準測試,而非已由獨立機構確立的業界標準。
傳統的檢索增強生成(RAG)通常會先搜尋文件,選出固定數量的高排名文字區塊,再把這些內容交給語言模型生成答案。若問題的答案完整存在於某個段落,這種方式相當有效;但當第一次搜尋漏掉關鍵文件、把表格與解釋拆開,或只擷取到缺乏上下文的文字時,可靠度就會下降。Mistral 的文件搜尋流程也將標準 RAG 描述為:從已上傳的文件庫中擷取相關段落,再以這些內容回答問題。
Agentic Search 則讓檢索變成一個可調整的過程。模型不會把第一次得到的結果視為終點,而是可以根據目前看到的內容決定下一步:
模型可以重複這些操作,逐步收窄問題範圍。實際上,這形成一個「搜尋—驗證」循環:先找到可能的答案,再檢查原始文件,尋找相關證據,最後核對精確措辭。這種工具呼叫模式也符合 Mistral 所記錄的代理架構:模型在任務進行期間呼叫外部函式,接收結果後繼續推理。
一次性 RAG 高度依賴初始查詢、索引、分塊方式與排名模型。如果第一次擷取到的內容看似合理卻不完整,模型可能根本沒有機會接觸到能推翻或補足答案的證據。迭代式代理則可以重新組織搜尋、開啟另一份文件,或檢查鄰近章節,而不是停在第一個看似合理的結果上。
財務表格與申報內容往往依賴標題、頁面位置、註腳及前後文才能正確理解。把文件切成平面文字區塊,可能會掩蓋這些關係。透過導覽和定向閱讀,模型可以在文件中移動,不必把每段文字當成互不相關的碎片。
語意搜尋適合尋找概念相近的內容,但公司名稱、會計術語、日期、識別碼與重複披露等資訊,仍常需要精確比對。類似 grep 的操作,讓模型可以確認特定字詞或模式是否真的出現在資料集中。其他代理式文件系統也採用搜尋、grep、閱讀及文件瀏覽等檔案導向工具。
企業資料的問題往往需要比較多份申報文件,或在一份文件找到數字、再到另一份文件確認該數字的定義。由模型主導的循環可以在整個資料集中交替進行「發現」與「驗證」,而非只依靠一次排名程序。
Mistral 特別強調兩項針對困難文件問答任務的評估。
FinanceBench 包含 368 份財務申報文件,總計約 53,900 頁。Mistral 報告稱,Mistral Medium 3.5 使用單次檢索時的正確率為 26.7%,搭配 Agentic Search 後則達到 86%。這代表增加 59.3 個百分點,相對於單次檢索結果約提升 3.2 倍。
Mistral 也表示曾以 GLM-5.2 測試這個檢索層;官方文件將 GLM-5.2 描述為來自 Z.ai 的第三方開源文字模型。在該比較中,GLM-5.2 的正確率由單次檢索的 6.3%,提升至 Agentic Search 的 51.9%。
OfficeQA Pro 著重表格密集、跨文件的問題,資料集包含 696 份掃描版美國《財政公報》文件。Mistral 公告中由 Ina Koleva 分享的結果顯示,與一次性 RAG 比較時,正確率由 6.3% 提升至 51.9%,增加 45.6 個百分點。
這些數字具參考價值,但不代表在所有場景都能得到相同結果。文件解析、OCR 品質、分塊、索引、模型選擇、提示設計、工具使用上限與評估方式,都可能改變結果。OfficeQA Pro 的研究也顯示,文件表示方式與解析品質會實質影響準確度、延遲、工具呼叫次數與成本。
Mistral 表示,與其凸顯的基準配置相比,Agentic Search 同時改善準確度,並減少回合數、Token 使用量與延遲。 不過,多步驟檢索仍必須等待工具呼叫與文件處理。針對 FinanceBench 的一項次級分析指出,完整循環平均延遲為 71 秒,p90 延遲為 154 秒;這些數字並未出現在 Mistral 主要來源的摘錄中,因此應以相應謹慎程度看待。
對實際部署團隊而言,真正需要比較的並不只是「代理式」與「非代理式」,而是:
代理式檢索可能透過只閱讀模型真正需要的內容,減少無效上下文;但額外的推理步驟也可能帶來新的延遲與成本。合適的設計,取決於任務的風險與複雜程度。
Mistral 表示,Agentic Search 可透過 Search Toolkit 與 Libraries 使用。 這兩項產品屬於 Mistral 更廣泛的代理與文件搜尋技術堆疊:官方文件將文件庫列為內建工具,可搜尋使用者上傳的檔案;Agents API 則支援在對話期間呼叫工具的代理。
關鍵在於,Agentic Search 被定位為檢索元件,而不只是消費型聊天機器人的單一功能。企業可以把這套檢索流程嵌入更大的應用程式、AI 代理或企業搜尋管線中。
Mistral 同時以 Mistral Medium 3.5 與 GLM-5.2 進行測試,反映出這套設計具有模型彈性。 如果檢索與文件導覽層可以配合不同的推理模型,企業就不一定要在每次更換模型時重建整套文件工作流程。
這種可攜性對需要在能力、價格、授權、部署地點與資料控管之間取捨的組織尤其重要。市場競爭的焦點也因此不再只有生成最終答案的語言模型,文件表示、權限、可觀測性、檢索品質與證據完整度同樣關鍵。
不過,「原則上支援多種模型」不等於每個部署結果都相同。不同模型在工具使用可靠度、上下文處理與推理能力上存在差異,企業仍須逐一測試。
Agentic Search 強化了 Mistral 不只銷售單一模型的定位。公司正試圖提供一個可攜式層,讓企業在敏感組織資料上進行搜尋與推理,包括財務紀錄及內部知識庫。Mistral 的金融方案強調具權限意識的搜尋,以及附有證據和上下文的回答。
對受監管組織而言,這種定位的重點在於控制資料處理地點,以及管理模型如何存取證據。與 Mistral 相關的報導提到雲端與受控基礎設施,包括類似地端部署的環境;但部署彈性不應被誤解為在所有司法管轄區或產業中自動符合規範。
Mistral 的基礎設施計畫也支撐這套敘事。路透社報導,Microsoft 已同意投入數十億美元支持 Mistral 的歐洲運算基礎設施;Azure 客戶將能使用位於法國的 Mistral 資料中心開發軟體。 在歐洲託管有助於資料駐留與營運控制,但 Microsoft 的合作也說明,「主權 AI」並不代表完全脫離全球雲端服務與硬體供應鏈。
Agentic Search 發布之際,市場也傳出 Mistral 正初步洽談約 30 億歐元的融資,估值約 200 億歐元。彭博報導強調,相關討論仍在早期階段,條件可能改變。
若交易完成,這個估值將大幅高於 Mistral 在 2025 年 9 月融資後報導的 117 億歐元估值。 但必須區分「媒體報導的融資洽談」與「已完成的融資輪」:目前數字代表可能條件,而非已確定的交易。
這項潛在融資也反映企業檢索與基礎設施的戰略價值。打造前沿 AI 產品需要昂貴的運算資源;企業客戶則希望系統能可靠地在自有資料環境中運作。Agentic Search 處理的是應用與檢索層,歐洲資料中心則補上部分基礎設施拼圖。
Mistral 同時在幾條戰線上競爭:
對長篇且結構複雜的文件而言,Mistral 的基準結果提供了一個有力起點。但能否形成持久優勢,仍取決於這些提升是否能在獨立評估與真實生產工作負載中維持,以及 Mistral 能否在可接受的延遲、成本、安全性與整合複雜度下交付。
Mistral Agentic Search 的核心概念其實很直接,卻可能影響深遠:檢索不應只是回答前的一次查詢,而應是一場主動調查。透過搜尋、開啟文件、導覽、定向閱讀與精確字詞比對,模型有更多機會在複雜企業資料集中找到並驗證證據。
Mistral 報告的結果——FinanceBench 從 26.7% 提升至 86%,以及 OfficeQA Pro 增加 45.6 個百分點——顯示這種設計有機會大幅改善文件問答。 但同樣重要的前提是:這些是與供應商相關的基準結果,企業買家仍需要用自己的資料測量延遲、成本、權限、解析品質與長期可靠度。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
Mistral Agentic Search 將一次性檢索改為迭代循環,讓模型依序搜尋、開啟、導覽、閱讀及 grep 文件。
Mistral Agentic Search 將一次性檢索改為迭代循環,讓模型依序搜尋、開啟、導覽、閱讀及 grep 文件。 這套方法主要針對長篇財報、掃描 PDF、表格、註腳,以及必須跨多份文件尋找證據的企業問題。
Mistral 報告稱,Mistral Medium 3.5 在 FinanceBench 的正確率由 26.7% 提升至 86%;OfficeQA Pro 則由 6.3% 提升至 51.9%。