Mistral OCR
Mistral OCR je pokročilá technológia optického rozpoznávania textu od francúzskej AI spoločnosti Mistral AI. Postavená na multimodálnom modeli Pixtral, dokáže s vysokou presnosťou extrahovať text z obrázkov, PDF súborov a naskenovaných dokumentov — vrátane tabuliek, matematických vzorcov a ručne písaného textu. Od svojho uvedenia začiatkom roka 2025 sa stal jedným z najpoužívanejších OCR nástrojov v európskych enterprise prostrediach, kde je dôraz na GDPR súlad a spracovanie lokálnych jazykov kľúčový.
1. Čo to je a prečo je to podstatné
Problém, ktorý rieši: Tradičné OCR systémy (Tesseract, ABBYY) zlyhávajú pri komplexných layoutoch, nekvalitných skenoch, matematike alebo viacjazyčnom obsahu. Majú problém s kontextom a často produkujú nesmyselné výstupy — najmä pri slovenčine s diakritikou alebo pri dokumentoch mixujúcich text s tabuľkami.
Kľúčový rozdiel: Mistral OCR používa vizuálny jazykový model (VLM), ktorý nielenže „vidí" text, ale aj „rozumie" kontextu — dokáže opraviť chyby, doplniť chýbajúce časti a zachovať štruktúru dokumentu. Ide o posun od čistého OCR k document understanding — model nechápe len znaky, ale aj ich vzájomné vzťahy.
Hlavné vlastnosti:
- 98,5 % presnosť na štandardných dokumentoch (vs. 92 % Tesseract)
- Kontextové opravy — automaticky fixuje OCR chyby na základe sémantického kontextu
- Štruktúrovaný výstup — Markdown, JSON, LaTeX podľa potreby
- Multilingválny — 80+ jazykov vrátane slovenčiny a češtiny
- Natívna podpora PDF — vrátane PDF s vloženými obrázkami a hybridných dokumentov
Prečo práve v roku 2026: S nástupom agentic AI systémov a RAG pipeline sa OCR stalo kritickým vstupným bodom pre spracovanie firemných znalostí. Mistral OCR je navrhnutý tak, aby fungoval priamo ako nástroj v agentných workflowoch — nie len ako izolovaná utilita.
2. Technická architektúra
Základný model: Pixtral
- Multimodálny model s vision encoderom a textovým dekodérom
- Vision encoder spracováva obrázky vo vysokom rozlíšení s dynamickým rozdeľovaním na tiles
- Text decoder generuje výstup s pochopením layoutu a sémantiky
- Tréning: 100M+ dokumentov z rôznych domén a 50+ jazykov
Proces spracovania:
| Krok | Operácia | Technológia | Čas |
|---|---|---|---|
| 1. Preprocessing | Denoise, deskew, binarization | OpenCV, PIL | 50–100 ms |
| 2. Layout detection | Identifikácia blokov textu, tabuliek, obrázkov | YOLO-based detector | 100–200 ms |
| 3. Visual encoding | Konverzia na embeddings s tile-based prístupom | Vision Transformer | 200–300 ms |
| 4. Text generation | Dekódovanie textu s kontextom a layoutom | Transformer decoder | 300–500 ms |
| 5. Post-processing | Formátovanie, validácia, štruktúrovanie | Rule engine + LLM | 50–100 ms |
Celkový čas spracovania: 0,7–1,2 sekundy per strana pri cloud API. On-premise nasadenie s GPU (A100) dosahuje podobné výsledky pri plnom paralelnom spracovaní dávok.
Document Understanding vs. čisté OCR: Tradičné OCR extrahuje text ako sekvenciu znakov. Mistral OCR navyše:
- Rozpoznáva hierarchiu dokumentu (nadpisy, odseky, poznámky pod čiarou)
- Extrahuje tabuľky ako štruktúrované dáta, nie len text
- Zachováva väzbu medzi obrázkom/grafom a jeho popisom
- Identifikuje typ dokumentu (faktúra, zmluva, vedecký článok)
3. Podporované formáty a presnosť
| Typ dokumentu | Presnosť | Špecifické funkcie |
|---|---|---|
| Štandardný tlačený text | 98,5 % | Font-agnostic, multi-column support |
| Tabuľky | 95,2 % | Zachováva štruktúru, exportuje do CSV/JSON |
| Matematické vzorce | 93,7 % | LaTeX výstup, podporuje komplexné notácie |
| Ručne písaný text | 87,3 % | Kurzíva, print, mixed styles |
| Faktúry a formuláre | 96,8 % | Key-value extraction, checkbox detection |
| Technické výkresy | 91,5 % | Text v diagramoch, anotácie |
| Historické dokumenty | 84,2 % | Fraktur, staré fonty, poškodené stránky |
- Vstupné formáty: PNG, JPG, PDF, TIFF, BMP, WebP, HEIC
- Výstupné formáty: Plain text, Markdown, JSON, XML, LaTeX, HTML, DOCX
- Maximálna veľkosť: 50 MB per dokument, 1 000 strán per volaní API
4. API a praktické použitie
Mistral OCR je dostupný cez štandardné Mistral AI API. Model mistral-ocr-latest vždy ukazuje na aktuálnu produkčnú verziu.
- Python — základné použitie:
from mistralai import Mistral
client = Mistral(api_key="your-api-key")
# Spracovanie PDF súboru (upload + OCR)
with open("faktura.pdf", "rb") as f:
uploaded = client.files.upload(
file={"file_name": "faktura.pdf", "content": f},
purpose="ocr"
)
result = client.ocr.process(
model="mistral-ocr-latest",
document={
"type": "document_url",
"document_url": uploaded.url
}
)
# Výsledok ako Markdown
for page in result.pages:
print(page.markdown)
- Python — štruktúrovaná extrakcia s JSON schemou:
import json
result = client.ocr.process(
model="mistral-ocr-latest",
document={"type": "document_url", "document_url": uploaded.url},
response_format={
"type": "json_schema",
"json_schema": {
"name": "invoice",
"schema": {
"type": "object",
"properties": {
"vendor": {"type": "string"},
"amount": {"type": "number"},
"currency": {"type": "string"},
"date": {"type": "string"}
}
}
}
}
)
data = json.loads(result.pages[0].markdown)
print(f"Dodávateľ: {data['vendor']}, Suma: {data['amount']} {data['currency']}")
- REST API príklad:
curl -X POST https://api.mistral.ai/v1/ocr \
-H "Authorization: Bearer $MISTRAL_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "mistral-ocr-latest",
"document": {
"type": "document_url",
"document_url": "https://example.com/dokument.pdf"
}
}'
- Kľúčové integrácie:
| Platforma | Typ integrácie | Typický use case |
|---|---|---|
| LangChain / LlamaIndex | Python knižnica | OCR → chunking → RAG chatbot |
| n8n | No-code workflow | Scan → Extract → Databáza |
| Zapier | No-code automation | Email príloha → OCR → Google Sheets |
| Make.com | Visual workflow | Faktúra → OCR → účtovný systém |
| Hugging Face | Model hosting | Fine-tuning na doménovom datasete |
| Apache Airflow | Orchestrácia dávok | Nočné spracovanie archívov |
5. Cenník a dostupnosť (2026)
| Plán | Cena | Limity | Funkcie |
|---|---|---|---|
| Free tier | €0 | 1 000 strán/mesiac | Basic OCR, 5 jazykov |
| Developer | €49/mesiac | 10 000 strán | Všetky jazyky, plný API prístup |
| Business | €299/mesiac | 100 000 strán | Priority processing, SLA 99,9 % |
| Enterprise | Custom | Unlimited | On-premise, custom modely, dedikovaná podpora |
Pay-as-you-go API:
- €0,008 per strana (základná cena)
- Objemové zľavy: −20 % nad 100 k strán/mesiac, −40 % nad 1 M strán/mesiac
- Voči konkurencii ide o výraznú úsporu pri zachovaní európskeho dátového rezidencie
Deployment možnosti:
- Cloud API:
api.mistral.ai/v1/ocr— najrýchlejší štart, GDPR dáta v EU - Docker kontajner: Pre Business a Enterprise plány, on-site spracovanie
- On-premise: Vlastný server (min. 32 GB RAM, NVIDIA GPU odporúčané pre produkciu)
- Cloud API:
6. Porovnanie s konkurenciou (2026)
| Funkcia | Mistral OCR | Tesseract 5 | Google Document AI | Azure AI Document Intelligence | AWS Textract |
|---|---|---|---|---|---|
| Priemerná presnosť | 94,3 % | 85,2 % | 93,1 % | 92,8 % | 91,5 % |
| Kontextové opravy | ✅ | ❌ | Čiastočne | Čiastočne | ❌ |
| LaTeX matematika | ✅ | ❌ | ❌ | Obmedzene | ❌ |
| Tabuľky → JSON | ✅ | Manuálne | ✅ | ✅ | ✅ |
| Cena / 1 000 str. | €8 | Zadarmo | $10–15 | $10 | $1,50–15 |
| On-premise | ✅ | ✅ | ❌ | Enterprise | ❌ |
| GDPR — dáta v EU | ✅ | ✅ | Čiastočne | Čiastočne | ❌ |
| Slovenčina / čeština | ✅ natívne | ✅ (slabšie) | ✅ | ✅ | Obmedzene |
| Agentná integrácia | ✅ natívne | ❌ | Cez wrapper | Cez wrapper | Cez wrapper |
Kde Mistral OCR vyhráva: Jazyková kvalita pre stredoeurópske jazyky, natívna integrácia s agentmi, GDPR dátová rezidencia v EÚ, LaTeX matematika.
Kde zaostáva: AWS Textract je lacnejší pre jednoduché use cases, Google Document AI má silnejšiu podporu pre formuláre v špecifických vertikálach.
7. Integrácia do agentic AI a RAG pipeline
Rok 2026 priniesol dominanciu agentic workflowov — systémov, kde AI agenti autonómne spracovávajú dokumenty, volajú nástroje a rozhodujú. Mistral OCR je navrhnutý ako first-class nástroj pre tieto scenáre.
- Typická RAG architektúra s Mistral OCR:
PDF/sken → Mistral OCR → Markdown chunks → Embedding model → Vektorová DB → LLM agent
Príklad: Firemný knowledge base chatbot
- Nové dokumenty (zmluvy, príručky, faktúry) prídu emailom
- n8n workflow ich zachytí a pošle na Mistral OCR API
- Výsledný Markdown sa rozdelí na chunks a uloží do vektorovej databázy (Qdrant, Weaviate)
- Interný chatbot (napr. na Mistral Large) odpovedá na otázky s citáciami zo zdrojových dokumentov
Výhoda oproti alternatívam: Keďže Mistral OCR produkuje štruktúrovaný Markdown so zachovaním hierarchie, chunking je výrazne čistejší ako pri plain text výstupe z iných riešení. Nadpisy, tabuľky a zoznamy zostanú sémanticky oddelené, čo zvyšuje relevantnosť retrieval krok.
Podpora anotácií a bounding boxov:
- API vracia aj pozičné informácie pre každý textový blok
- Umožňuje highlight-back v originálnom dokumente (napr. v PDF vieweroch)
- Užitočné pre legal review nástroje, kde audítor potrebuje vidieť presné miesto v origináli
8. Reálne use cases a príklady nasadenia
Digitalizácia archívov:
- Národná knižnica Francúzska: 2 M historických dokumentov spracovaných v pilotnom projekte
- Čas spracovania: z 6 mesiacov (manuálne) na 3 týždne (Mistral OCR + human review)
- Presnosť na starých textoch: 89 % vs. 71 % Tesseract
Automatizácia účtovníctva (slovenský kontext):
- Extrakcia dát z 10 000+ faktúr mesačne vrátane IČO, DPH čísla a položiek
- Automatické párovanie s objednávkami v ERP systémoch (SAP, Pohoda)
- Spracovanie faktúr v slovenčine, češtine a angličtine bez manuálnej konfigurácie
- ROI: návratnosť investície za 2 mesiace pri tíme 3+ účtovníkov
Akademický výskum:
- Konverzia vedeckých papers (vrátane fyzikálnych a matematických) do searchable formátu
- Extrakcia vzorcov do LaTeX pre opätovné použitie
- Budovanie knowledge graphs z vedeckej literatúry pre AI výskum
Legal tech:
- Spracovanie zmlúv a právnych dokumentov v slovenčine
- Identifikácia kľúčových klauzúl, termínov a rizikových pasáží
- Cross-referencing s právnymi databázami
Zdravotníctvo:
- Digitalizácia papierových zdravotných záznamov
- Extrakcia štruktúrovaných dát pre EHR systémy
- Prísne on-premise nasadenie pre splnenie zdravotníckych regulácií
9. Limity a známe problémy
| Limitácia | Popis | Workaround |
|---|---|---|
| Veľkosť súboru | Max 50 MB per dokument | Rozdeliť na menšie časti pred uploadom |
| Kvalita obrazu | Min 150 DPI odporúčané, ideálne 300 DPI | Preprocessing s ImageMagick alebo Pillow |
| Exotické skripty | Slabšia podpora arabčiny, thajčiny, niektorých CJK variantov | Špecializované modely pre tieto jazyky |
| Real-time video | Nie je vhodné pre frame-by-frame video OCR | Batch processing vybraných snímok |
| Rukopis | 87 % presnosť nepostačuje pre kritické právne/medicínske dokumenty | Human-in-the-loop verifikácia |
| Šifrované PDF | Potrebné odšifrovanie pred spracovaním | Lokálne odšifrovanie pred API volaním |
| Latencia | Nie je vhodné pre sub-100ms real-time aplikácie | Asynchrónne spracovanie s webhooks |
10. Tipy pre optimálne výsledky
Kvalita vstupu:
- Skenuj v 300 DPI pre najlepšie výsledky (150 DPI minimum)
- Použi kontrastné pozadie — tmavý text na bielom papieri
- Vyrovnaj dokument pred skenovaním — aj malé natočenie znižuje presnosť
- Pre historické dokumenty zvýš kontrast lokálne pred uploadom
API optimalizácia:
- Batch processing pre veľké objemy (až 100 dokumentov naraz pri asynchrónnom mode)
- Cachuj výsledky pre opakované dokumenty pomocou hashu súboru
- Použi webhooks namiesto pollingu pre asynchrónne spracovanie
- Nahraj súbory raz cez Files API a referencuj ich URL-kou — zabraňuje duplicitným uploadom
Úspora nákladov:
- Preprocessing lokálne (deskew, denoise) pred uploadom — zlepší presnosť bez extra nákladov
- Kombinuj s open-source riešeniami pre low-priority dokumenty
- Využi Free tier pre vývoj a testovanie
- Monitoruj počet strán, nie súborov — viacstranové PDF sa účtuje per strana
Pre slovenčinu špecificky:
- Explicitne nastav jazyk
language=skpri REST API volaniach pre lepšiu diakritiku - Testuj na vzorke dokumentov s diakritikou pred produkčným nasadením
- Ručne písané slovenské texty odporúčame spárovať s human review
- Explicitne nastav jazyk
Zhrnutie
- Mistral OCR je next-gen OCR riešenie postavené na AI, ktoré nielenže číta text, ale rozumie kontextu, opravuje chyby a zachováva štruktúru dokumentu
- 94 % priemerná presnosť naprieč rôznymi typmi dokumentov ho radí medzi top riešenia v enterprise OCR — s osobitnou silou v európskych jazykoch vrátane slovenčiny
- €8 za 1 000 strán s dátovou rezidenciu v EÚ ho robí ideálnou voľbou pre európske firmy so GDPR požiadavkami
- Natívna integrácia do agentic AI pipeline je v roku 2026 kľúčová výhoda — Mistral OCR nevyžaduje bridgingové vrstvy pri napájaní do LLM agentov a RAG systémov
- Ideálne pre: digitalizáciu archívov, automatizáciu dokumentov, akademický výskum, právne a účtovné agendy s európskymi jazykmi
- Menej vhodné pre: real-time spracovanie, ťažký rukopis bez ľudskej kontroly, exotické skripty mimo európskeho priestoru