企业常见的问题是:比较多份申报文件,先在一份文件中找到某个数字,再去另一份文件确认其定义或背景。模型主导的循环可以在“发现证据”和“核对证据”之间来回切换,而不是只进行一次排序。
Mistral重点介绍了两个面向复杂文档问答的评测。
FinanceBench 包含 368 份金融申报文件,总量约 53,900 页。Mistral 报告称,Mistral Medium 3.5 使用单次检索时的正确率为 26.7%,使用 Agentic Search 后达到 86%。
这相当于提升 59.3 个百分点,相对于单次检索结果约为 3.2 倍。Mistral还报告称,其检索层与 GLM-5.2 进行了测试;官方文档将该模型描述为来自 Z.ai 的第三方开放源代码文本模型。在相关对比中,GLM-5.2 的正确率从单次检索的 6.3% 提升至 Agentic Search 下的 51.9%。
OfficeQA Pro 聚焦表格密集型、多文档问题,数据集包含 696 份扫描版美国《财政公报》文件。Mistral员工 Ina Koleva 分享的结果显示,与一次性 RAG 相比,正确率从 6.3% 提升至 51.9%,增加 45.6 个百分点。
这些数字具有吸引力,但不能被理解为所有文档和企业场景都能获得同样效果。文档解析、OCR质量、切分方式、索引、模型选择、提示词、工具调用上限和评测方法都会影响结果。OfficeQA Pro 的研究也显示,文档表示方式和解析质量会显著影响准确率、延迟、工具调用次数与成本。
Mistral表示,在其重点展示的基准测试中,Agentic Search不仅提高准确率,也减少了交互轮次、令牌使用量和延迟。不过,多步检索系统仍然需要等待工具调用和文档处理;步骤增加并不意味着响应一定更快。
一份对 FinanceBench 结果的二次分析报告称,完整循环的平均延迟为 71 秒,p90 延迟为 154 秒。这些数字并未出现在 Mistral 主要来源的相关摘要中,因此应作为二次分析结果看待,而不是厂商一手披露。
对生产团队而言,真正需要比较的不是“智能体式”与“非智能体式”这两个标签,而是:
Agentic Search 通过只读取模型实际需要的内容,可能减少无效上下文;但额外的推理步骤也可能带来新的延迟和成本。适合的方案取决于任务的复杂度和出错风险。
Mistral表示,Agentic Search 可通过 Search Toolkit 和 Libraries 使用。这两项产品属于 Mistral 更广泛的智能体与文档搜索体系:官方文档将 Document Library 列为可搜索上传文件的内置工具,Agents API 则支持在对话过程中调用外部工具。
这意味着 Agentic Search 的定位不只是消费级聊天产品中的一个功能,而是一个可以嵌入应用、智能体或企业搜索管线的检索组件。
Mistral分别使用 Mistral Medium 3.5 和 GLM-5.2 进行测试,体现出其希望打造模型更灵活的检索层。如果检索、导航和证据核验层能够与不同推理模型协作,企业在更换模型时就不必完全重建文档工作流。
这种可迁移性可能帮助企业在能力、价格、许可证、部署地点和数据控制之间进行权衡。竞争重点也因此不再只是“谁的语言模型更强”,而会延伸到文档表示、权限、可观测性、证据质量和系统集成。
不过,“原则上支持多个模型”不代表所有模型的实际表现相同。工具调用可靠性、上下文处理能力和推理质量仍会因模型而异,企业需要逐一验证。
Agentic Search 强化了 Mistral 不仅销售单一模型的路线。公司正在把自身定位为一个可移植的检索与推理层,用于处理金融记录、内部知识库等敏感组织数据。Mistral 的金融业务材料强调权限感知搜索,以及带有证据和上下文的回答。
欧洲托管可以帮助企业满足数据驻留和运营控制要求,但微软合作也说明,“主权 AI”并不意味着完全脱离全球云服务和硬件供应链。
潜在融资反映出企业检索和基础设施的战略意义:前沿 AI 产品需要昂贵的计算资源,而企业客户则希望系统能够在自身数据环境中稳定运行。Agentic Search覆盖应用和检索层,欧洲数据中心则对应基础设施层。
Mistral同时面对几类竞争者:
Mistral的基准结果为其在长篇、结构复杂文档领域提供了一个有力起点。但长期优势仍取决于这些提升能否在独立评测和真实生产负载中复现,以及系统能否同时满足延迟、成本、安全性和集成复杂度要求。
Mistral Agentic Search 的核心理念并不复杂,却可能改变企业文档问答的工作方式:检索不应只是回答前的一次查找,而应成为主动调查过程。
通过组合搜索、打开、导航、定向阅读和精确匹配,模型获得了更多寻找并验证证据的机会。Mistral 报告称,该设计在 FinanceBench 上将正确率从 26.7% 提升至 86%,并在 OfficeQA Pro 上带来 45.6 个百分点的提升。
但同样重要的前提是:这些是与 Mistral 相关的基准结果。企业在采购或部署前,仍需使用自己的文档和权限体系测试准确率、延迟、成本、解析质量、可靠性与审计能力。