include_blocks API-parameter.blocks170 sprog på tværs af 10 sproggrupper. Mistral rapporterer særlige præcisionsforbedringer på sjældnere og mindre ressourcestærke skriftsprog, herunder japansk, hindi og græsk .
Selvhost i én container. Modellen kan implementeres fuldstændigt on-premises i én enkelt container – en vigtig differentieringsfaktor for regulerede brancher, der ikke kan sende dokumenter til eksterne API'er .
Multimodal input og struktureret output. OCR 4 accepterer PDF'er og billeder (Office-dokumenter via konvertering) og leverer struktureret Markdown og JSON, optimeret til integration med RAG- og agentiske pipelines .
Mistral rapporterer også stærke resultater på deres interne Crawl Multilingual-benchmark, men de rå tal blev ikke offentliggjort i de gennemgåede kilder .
| Niveau | Pris | Detaljer |
|---|---|---|
| Standard OCR | 4 dollars per 1.000 sider | Grundlæggende tekstudtrækning |
| Annoteret (struktureret) | 5 dollars per 1.000 sider | Inkluderer afgrænsningsbokse, bloketiketter og tillidsscorer |
Priserne er sidebaserede, ikke token-baserede, hvilket er usædvanligt blandt Mistrals andre modeller og afspejler dokument-batch-anvendelsestilfældet.
OCR 4 markerer et bevidst skift fra ”tekstudtrækning” til ”dokumentforståelse.” Det positioneres som et grundlæggende lag til virksomhedssøgning, RAG-pipelines og agentiske arbejdsgange, hvor det er afgørende at bevare layout og struktur (tabeller, ligninger, signaturer) . Det retter sig direkte mod Googles Document AI, Azure Document Intelligence og open source-OCR-pipelines ved at kombinere struktureret output til råvarepriser med en selvhostbar containermulighed – en sjælden kombination blandt store OCR-API'er
.