Mistral OCR 4 於 2026 年 6 月 23–24 日推出,回傳段落層級邊界框、結構化區塊標籤(如標題、表格、方程式、簽名)與逐字信心分數,支援 170 種語言。 在公開基準 OlmOCRBench 上以 85.20 分拿下第一,OmniDocBench 得分 93.07,並在 600 多份真實文件的盲測中以 72% 勝率擊敗同類系統。
研究答案

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What are the key features, benchmark performance, pricing options, and strategic context of Mistr. Article summary: Here is the fact-checked breakdown of Mistral AI's newly released OCR 4 model.. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual e
Mistral AI 於 2026 年 6 月 23–24 日間正式推出 OCR 4,不再只是單純的文字擷取工具,而是升級為「結構化文件理解」引擎。這款模型專為企業搜尋、RAG(檢索增強生成)流程與自主代理工作流所設計,並同步登上 Microsoft Azure AI Foundry,與 Mistral Document AI 及 Mistral Medium 3.5 一同亮相 。
結構感知萃取。 OCR 4 不僅回傳文字,還會提供段落層級的邊界框(bounding boxes)、區塊類型標籤(包括文字、標題、列表、表格、圖片、方程式、標題、程式碼、參考文獻、側邊文字、頁首、頁尾、簽名),以及逐字的信心分數 。這讓輸出結果可以直接用於引用追蹤、內容遮蔽與語意分塊,無需額外後處理
。
include_blocks API 參數。 啟用後,每一頁會回傳一個 blocks 陣列,包含結構化標籤與空間座標,且按閱讀順序排列 。
支援 170 種語言,分為 10 個語言群組。 Mistral 表示,在日語、印度語與希臘語等較罕見或資源較少的語言上,精度提升尤為顯著 。
單容器自託管。 整個模型可以完全部屬於地端伺服器,一個容器搞定。這對金融、醫療與法律等受到嚴格監管的產業來說是一大賣點,因為這些機構無法將文件送往外部 API 處理 。
多模態輸入與結構化輸出。 OCR 4 可接受 PDF 與圖片(Office 文件需先轉換),並輸出結構化的 Markdown 與 JSON,專為 RAG 與自主代理管線所設計 。
| 基準 | OCR 4 分數 | 備註 |
|---|---|---|
| OlmOCRBench(公開排行榜) | 85.20 | 上線時位居榜首 |
| OmniDocBench | 93.07 | 在多元文件類型上表現強勁 |
| 人類偏好盲測(600+ 文件、12+ 語言) | 平均 72% 勝率 | 獨立評審偏好 OCR 4 勝過其他競爭系統 |
Mistral 也在內部 Crawl Multilingual 基準上取得優異成績,不過在所檢視的資料中並未公布具體數字 。
| 方案 | 價格 | 說明 |
|---|---|---|
| 標準版 OCR | 每 1,000 頁 4 美元 | 基礎文字萃取 |
| 註釋版(結構化) | 每 1,000 頁 5 美元 | 包含邊界框、區塊標籤與信心分數 |
計價以頁數為單位,而非以 token 計費,這在 Mistral 其他模型中較為少見,也反映出其文件批次處理的使用情境。
OCR 4 標誌著從「文字萃取」到「文件理解」的明確轉變。它被定位為企業搜尋、RAG 管線與自主代理工作流中的基礎層,因為在這些應用中,保留版面與結構(如表格、方程式、簽名)至關重要 。它直接挑戰 Google 的 Document AI、Azure Document Intelligence 以及開源 OCR 管線,以大宗商品級的定價提供結構化輸出,同時還提供可自託管的容器選項——這在主流 OCR API 中相當罕見
。
單容器設計是金融、醫療與法律等需要資料主權的行業的關鍵差異點 。此外,Mistral 也已將 OCR 4 設為 Le Chat 上數百萬使用者預設的文件理解模型
。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
Mistral OCR 4 於 2026 年 6 月 23–24 日推出,回傳段落層級邊界框、結構化區塊標籤(如標題、表格、方程式、簽名)與逐字信心分數,支援 170 種語言。
Mistral OCR 4 於 2026 年 6 月 23–24 日推出,回傳段落層級邊界框、結構化區塊標籤(如標題、表格、方程式、簽名)與逐字信心分數,支援 170 種語言。 在公開基準 OlmOCRBench 上以 85.20 分拿下第一,OmniDocBench 得分 93.07,並在 600 多份真實文件的盲測中以 72% 勝率擊敗同類系統。
定價為每 1,000 頁 4 美元(標準版)或 5 美元(含註釋結構版),並提供單容器自託管選項,滿足金融、醫療與法律產業的資料落地需求。