Mistral AIが2026年6月23〜24日にリリースしたOCR 4は、テキスト抽出だけでなく、段落単位のバウンディングボックス、ブロックタイプラベル(タイトル、表、数式、署名など14種類)、単語単位の信頼度スコアを構造化出力。従来のOCRを「文書構造理解」へと進化させた。[1][7][10] 公開ベンチマークOlmOCRBenchで85.20、OmniDocBenchで93.07を記録し、リリース時点で両方のリーダーボードでトップ。600以上の実文書・12言語以上を用いたブラインド人間評価では、競合OCRに対して平均72%の勝率を達成。[4][6] 170言語を10言語グループに分割して対応。特に日本語、ヒンディー語、ギ...
研究の答え

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What are the key features, benchmark performance, pricing options, and strategic context of Mistr. Article summary: Here is the fact-checked breakdown of Mistral AI's newly released OCR 4 model.. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual e
Mistral AIは2026年6月23〜24日、文書認識モデル「Mistral OCR 4」をリリースしました。従来のOCRが単なるプレーンテキスト抽出だったのに対し、OCR 4は文書の「構造」を理解し、AIや検索システムが直接扱える形式で出力する点が最大の特徴です。
構造認識抽出(Structure-aware extraction):OCR 4は抽出テキストに加えて、以下の情報を返します。
include_blocks APIパラメータ:このパラメータを有効にすると、各ページのblocks配列に構造ラベルと空間座標が読み順で返されます。
170言語対応:10の言語グループに分類。特に日本語、ヒンディー語、ギリシャ語など、多くのOCRシステムで精度が落ちやすい「特殊言語カテゴリ」や低リソース言語でも改善が見られるとMistral AIは説明しています。
単一コンテナでのセルフホスティング:モデル全体を1つのコンテナに収め、完全にオンプレミスでデプロイ可能。データを外部APIに送信できない金融、医療、法務などの規制業界にとって大きな差別化ポイントです。
マルチモーダル入力・構造化出力:PDFや画像を入力として受け付け、構造化されたMarkdownやJSONを出力。RAG(検索拡張生成)やエージェント型ワークフローとの統合に最適化されています。
| ベンチマーク | OCR 4 スコア | 備考 |
|---|---|---|
| OlmOCRBench(公開リーダーボード) | 85.20 | リリース時点でトップ |
| OmniDocBench | 93.07 | 多様な文書タイプで高スコア |
| 人間評価(ブラインド、600以上の文書、12言語以上) | 平均72%の勝率 | 独立した評価者が競合OCRと比較して選好 |
Mistral AIは内部ベンチマーク「Crawl Multilingual」でも高いスコアを報告していますが、今回のソースでは具体的な数値は公開されていません。
| プラン | 価格 | 詳細 |
|---|---|---|
| 標準OCR | 1,000ページあたり4ドル | 基本テキスト抽出 |
| 構造化アノテーション付き | 1,000ページあたり5ドル | バウンディングボックス、ブロックラベル、信頼度スコア付き |
価格はトークン単位ではなくページ単位で設定されており、これはMistralの他のモデルでは珍しく、文書バッチ処理のユースケースを反映しています。
OCR 4のリリースは、Mistral AIにとって「テキスト抽出」から「文書理解」への明確な戦略転換を示しています。同社はOCR 4を、エンタープライズ検索、RAGパイプライン、エージェント型ワークフローのための基礎レイヤーとして位置づけています。
競合としては、GoogleのDocument AI、Azure Document Intelligence、そしてオープンソースのOCRパイプラインを直接ターゲット。構造化出力をコモディティ価格で提供しつつ、セルフホスティング対応という、主要OCR APIの中では稀有な組み合わせを実現しています。
単一コンテナ設計は、データ主権が求められる規制産業(金融、医療、法務)での導入を後押しします。
また、Mistral AIのチャットサービス「Le Chat」では、OCR 4が数百万ユーザーのデフォルト文書理解モデルとして既に採用されています。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Mistral AIが2026年6月23〜24日にリリースしたOCR 4は、テキスト抽出だけでなく、段落単位のバウンディングボックス、ブロックタイプラベル(タイトル、表、数式、署名など14種類)、単語単位の信頼度スコアを構造化出力。従来のOCRを「文書構造理解」へと進化させた。[1][7][10]
Mistral AIが2026年6月23〜24日にリリースしたOCR 4は、テキスト抽出だけでなく、段落単位のバウンディングボックス、ブロックタイプラベル(タイトル、表、数式、署名など14種類)、単語単位の信頼度スコアを構造化出力。従来のOCRを「文書構造理解」へと進化させた。[1][7][10] 公開ベンチマークOlmOCRBenchで85.20、OmniDocBenchで93.07を記録し、リリース時点で両方のリーダーボードでトップ。600以上の実文書・12言語以上を用いたブラインド人間評価では、競合OCRに対して平均72%の勝率を達成。[4][6]
170言語を10言語グループに分割して対応。特に日本語、ヒンディー語、ギリシャ語など、従来のOCRで精度が低下しやすい言語で顕著な改善を実現。[7][11]