Mistral OCR

Mistral OCR je pokročilá technológia optického rozpoznávania textu od francúzskej AI spoločnosti Mistral AI. Postavená na multimodálnom modeli Pixtral, dokáže s vysokou presnosťou extrahovať text z obrázkov, PDF súborov a naskenovaných dokumentov — vrátane tabuliek, matematických vzorcov a ručne písaného textu. Od svojho uvedenia začiatkom roka 2025 sa stal jedným z najpoužívanejších OCR nástrojov v európskych enterprise prostrediach, kde je dôraz na GDPR súlad a spracovanie lokálnych jazykov kľúčový.


1. Čo to je a prečo je to podstatné

  • Problém, ktorý rieši: Tradičné OCR systémy (Tesseract, ABBYY) zlyhávajú pri komplexných layoutoch, nekvalitných skenoch, matematike alebo viacjazyčnom obsahu. Majú problém s kontextom a často produkujú nesmyselné výstupy — najmä pri slovenčine s diakritikou alebo pri dokumentoch mixujúcich text s tabuľkami.

  • Kľúčový rozdiel: Mistral OCR používa vizuálny jazykový model (VLM), ktorý nielenže „vidí" text, ale aj „rozumie" kontextu — dokáže opraviť chyby, doplniť chýbajúce časti a zachovať štruktúru dokumentu. Ide o posun od čistého OCR k document understanding — model nechápe len znaky, ale aj ich vzájomné vzťahy.

  • Hlavné vlastnosti:

    • 98,5 % presnosť na štandardných dokumentoch (vs. 92 % Tesseract)
    • Kontextové opravy — automaticky fixuje OCR chyby na základe sémantického kontextu
    • Štruktúrovaný výstup — Markdown, JSON, LaTeX podľa potreby
    • Multilingválny — 80+ jazykov vrátane slovenčiny a češtiny
    • Natívna podpora PDF — vrátane PDF s vloženými obrázkami a hybridných dokumentov
  • Prečo práve v roku 2026: S nástupom agentic AI systémov a RAG pipeline sa OCR stalo kritickým vstupným bodom pre spracovanie firemných znalostí. Mistral OCR je navrhnutý tak, aby fungoval priamo ako nástroj v agentných workflowoch — nie len ako izolovaná utilita.


2. Technická architektúra

  • Základný model: Pixtral

    • Multimodálny model s vision encoderom a textovým dekodérom
    • Vision encoder spracováva obrázky vo vysokom rozlíšení s dynamickým rozdeľovaním na tiles
    • Text decoder generuje výstup s pochopením layoutu a sémantiky
    • Tréning: 100M+ dokumentov z rôznych domén a 50+ jazykov
  • Proces spracovania:

Krok Operácia Technológia Čas
1. Preprocessing Denoise, deskew, binarization OpenCV, PIL 50–100 ms
2. Layout detection Identifikácia blokov textu, tabuliek, obrázkov YOLO-based detector 100–200 ms
3. Visual encoding Konverzia na embeddings s tile-based prístupom Vision Transformer 200–300 ms
4. Text generation Dekódovanie textu s kontextom a layoutom Transformer decoder 300–500 ms
5. Post-processing Formátovanie, validácia, štruktúrovanie Rule engine + LLM 50–100 ms
  • Celkový čas spracovania: 0,7–1,2 sekundy per strana pri cloud API. On-premise nasadenie s GPU (A100) dosahuje podobné výsledky pri plnom paralelnom spracovaní dávok.

  • Document Understanding vs. čisté OCR: Tradičné OCR extrahuje text ako sekvenciu znakov. Mistral OCR navyše:

    • Rozpoznáva hierarchiu dokumentu (nadpisy, odseky, poznámky pod čiarou)
    • Extrahuje tabuľky ako štruktúrované dáta, nie len text
    • Zachováva väzbu medzi obrázkom/grafom a jeho popisom
    • Identifikuje typ dokumentu (faktúra, zmluva, vedecký článok)

3. Podporované formáty a presnosť

Typ dokumentu Presnosť Špecifické funkcie
Štandardný tlačený text 98,5 % Font-agnostic, multi-column support
Tabuľky 95,2 % Zachováva štruktúru, exportuje do CSV/JSON
Matematické vzorce 93,7 % LaTeX výstup, podporuje komplexné notácie
Ručne písaný text 87,3 % Kurzíva, print, mixed styles
Faktúry a formuláre 96,8 % Key-value extraction, checkbox detection
Technické výkresy 91,5 % Text v diagramoch, anotácie
Historické dokumenty 84,2 % Fraktur, staré fonty, poškodené stránky
  • Vstupné formáty: PNG, JPG, PDF, TIFF, BMP, WebP, HEIC
  • Výstupné formáty: Plain text, Markdown, JSON, XML, LaTeX, HTML, DOCX
  • Maximálna veľkosť: 50 MB per dokument, 1 000 strán per volaní API

4. API a praktické použitie

Mistral OCR je dostupný cez štandardné Mistral AI API. Model mistral-ocr-latest vždy ukazuje na aktuálnu produkčnú verziu.

  • Python — základné použitie:
from mistralai import Mistral

client = Mistral(api_key="your-api-key")

# Spracovanie PDF súboru (upload + OCR)
with open("faktura.pdf", "rb") as f:
    uploaded = client.files.upload(
        file={"file_name": "faktura.pdf", "content": f},
        purpose="ocr"
    )

result = client.ocr.process(
    model="mistral-ocr-latest",
    document={
        "type": "document_url",
        "document_url": uploaded.url
    }
)

# Výsledok ako Markdown
for page in result.pages:
    print(page.markdown)
  • Python — štruktúrovaná extrakcia s JSON schemou:
import json

result = client.ocr.process(
    model="mistral-ocr-latest",
    document={"type": "document_url", "document_url": uploaded.url},
    response_format={
        "type": "json_schema",
        "json_schema": {
            "name": "invoice",
            "schema": {
                "type": "object",
                "properties": {
                    "vendor": {"type": "string"},
                    "amount": {"type": "number"},
                    "currency": {"type": "string"},
                    "date": {"type": "string"}
                }
            }
        }
    }
)

data = json.loads(result.pages[0].markdown)
print(f"Dodávateľ: {data['vendor']}, Suma: {data['amount']} {data['currency']}")
  • REST API príklad:
curl -X POST https://api.mistral.ai/v1/ocr \
  -H "Authorization: Bearer $MISTRAL_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mistral-ocr-latest",
    "document": {
      "type": "document_url",
      "document_url": "https://example.com/dokument.pdf"
    }
  }'
  • Kľúčové integrácie:
Platforma Typ integrácie Typický use case
LangChain / LlamaIndex Python knižnica OCR → chunking → RAG chatbot
n8n No-code workflow Scan → Extract → Databáza
Zapier No-code automation Email príloha → OCR → Google Sheets
Make.com Visual workflow Faktúra → OCR → účtovný systém
Hugging Face Model hosting Fine-tuning na doménovom datasete
Apache Airflow Orchestrácia dávok Nočné spracovanie archívov

5. Cenník a dostupnosť (2026)

Plán Cena Limity Funkcie
Free tier €0 1 000 strán/mesiac Basic OCR, 5 jazykov
Developer €49/mesiac 10 000 strán Všetky jazyky, plný API prístup
Business €299/mesiac 100 000 strán Priority processing, SLA 99,9 %
Enterprise Custom Unlimited On-premise, custom modely, dedikovaná podpora
  • Pay-as-you-go API:

    • €0,008 per strana (základná cena)
    • Objemové zľavy: −20 % nad 100 k strán/mesiac, −40 % nad 1 M strán/mesiac
    • Voči konkurencii ide o výraznú úsporu pri zachovaní európskeho dátového rezidencie
  • Deployment možnosti:

    • Cloud API: api.mistral.ai/v1/ocr — najrýchlejší štart, GDPR dáta v EU
    • Docker kontajner: Pre Business a Enterprise plány, on-site spracovanie
    • On-premise: Vlastný server (min. 32 GB RAM, NVIDIA GPU odporúčané pre produkciu)

6. Porovnanie s konkurenciou (2026)

Funkcia Mistral OCR Tesseract 5 Google Document AI Azure AI Document Intelligence AWS Textract
Priemerná presnosť 94,3 % 85,2 % 93,1 % 92,8 % 91,5 %
Kontextové opravy Čiastočne Čiastočne
LaTeX matematika Obmedzene
Tabuľky → JSON Manuálne
Cena / 1 000 str. €8 Zadarmo $10–15 $10 $1,50–15
On-premise Enterprise
GDPR — dáta v EU Čiastočne Čiastočne
Slovenčina / čeština ✅ natívne ✅ (slabšie) Obmedzene
Agentná integrácia ✅ natívne Cez wrapper Cez wrapper Cez wrapper

Kde Mistral OCR vyhráva: Jazyková kvalita pre stredoeurópske jazyky, natívna integrácia s agentmi, GDPR dátová rezidencia v EÚ, LaTeX matematika.

Kde zaostáva: AWS Textract je lacnejší pre jednoduché use cases, Google Document AI má silnejšiu podporu pre formuláre v špecifických vertikálach.


7. Integrácia do agentic AI a RAG pipeline

Rok 2026 priniesol dominanciu agentic workflowov — systémov, kde AI agenti autonómne spracovávajú dokumenty, volajú nástroje a rozhodujú. Mistral OCR je navrhnutý ako first-class nástroj pre tieto scenáre.

  • Typická RAG architektúra s Mistral OCR:
PDF/sken → Mistral OCR → Markdown chunks → Embedding model → Vektorová DB → LLM agent
  • Príklad: Firemný knowledge base chatbot

    1. Nové dokumenty (zmluvy, príručky, faktúry) prídu emailom
    2. n8n workflow ich zachytí a pošle na Mistral OCR API
    3. Výsledný Markdown sa rozdelí na chunks a uloží do vektorovej databázy (Qdrant, Weaviate)
    4. Interný chatbot (napr. na Mistral Large) odpovedá na otázky s citáciami zo zdrojových dokumentov
  • Výhoda oproti alternatívam: Keďže Mistral OCR produkuje štruktúrovaný Markdown so zachovaním hierarchie, chunking je výrazne čistejší ako pri plain text výstupe z iných riešení. Nadpisy, tabuľky a zoznamy zostanú sémanticky oddelené, čo zvyšuje relevantnosť retrieval krok.

  • Podpora anotácií a bounding boxov:

    • API vracia aj pozičné informácie pre každý textový blok
    • Umožňuje highlight-back v originálnom dokumente (napr. v PDF vieweroch)
    • Užitočné pre legal review nástroje, kde audítor potrebuje vidieť presné miesto v origináli

8. Reálne use cases a príklady nasadenia

  • Digitalizácia archívov:

    • Národná knižnica Francúzska: 2 M historických dokumentov spracovaných v pilotnom projekte
    • Čas spracovania: z 6 mesiacov (manuálne) na 3 týždne (Mistral OCR + human review)
    • Presnosť na starých textoch: 89 % vs. 71 % Tesseract
  • Automatizácia účtovníctva (slovenský kontext):

    • Extrakcia dát z 10 000+ faktúr mesačne vrátane IČO, DPH čísla a položiek
    • Automatické párovanie s objednávkami v ERP systémoch (SAP, Pohoda)
    • Spracovanie faktúr v slovenčine, češtine a angličtine bez manuálnej konfigurácie
    • ROI: návratnosť investície za 2 mesiace pri tíme 3+ účtovníkov
  • Akademický výskum:

    • Konverzia vedeckých papers (vrátane fyzikálnych a matematických) do searchable formátu
    • Extrakcia vzorcov do LaTeX pre opätovné použitie
    • Budovanie knowledge graphs z vedeckej literatúry pre AI výskum
  • Legal tech:

    • Spracovanie zmlúv a právnych dokumentov v slovenčine
    • Identifikácia kľúčových klauzúl, termínov a rizikových pasáží
    • Cross-referencing s právnymi databázami
  • Zdravotníctvo:

    • Digitalizácia papierových zdravotných záznamov
    • Extrakcia štruktúrovaných dát pre EHR systémy
    • Prísne on-premise nasadenie pre splnenie zdravotníckych regulácií

9. Limity a známe problémy

Limitácia Popis Workaround
Veľkosť súboru Max 50 MB per dokument Rozdeliť na menšie časti pred uploadom
Kvalita obrazu Min 150 DPI odporúčané, ideálne 300 DPI Preprocessing s ImageMagick alebo Pillow
Exotické skripty Slabšia podpora arabčiny, thajčiny, niektorých CJK variantov Špecializované modely pre tieto jazyky
Real-time video Nie je vhodné pre frame-by-frame video OCR Batch processing vybraných snímok
Rukopis 87 % presnosť nepostačuje pre kritické právne/medicínske dokumenty Human-in-the-loop verifikácia
Šifrované PDF Potrebné odšifrovanie pred spracovaním Lokálne odšifrovanie pred API volaním
Latencia Nie je vhodné pre sub-100ms real-time aplikácie Asynchrónne spracovanie s webhooks

10. Tipy pre optimálne výsledky

  • Kvalita vstupu:

    • Skenuj v 300 DPI pre najlepšie výsledky (150 DPI minimum)
    • Použi kontrastné pozadie — tmavý text na bielom papieri
    • Vyrovnaj dokument pred skenovaním — aj malé natočenie znižuje presnosť
    • Pre historické dokumenty zvýš kontrast lokálne pred uploadom
  • API optimalizácia:

    • Batch processing pre veľké objemy (až 100 dokumentov naraz pri asynchrónnom mode)
    • Cachuj výsledky pre opakované dokumenty pomocou hashu súboru
    • Použi webhooks namiesto pollingu pre asynchrónne spracovanie
    • Nahraj súbory raz cez Files API a referencuj ich URL-kou — zabraňuje duplicitným uploadom
  • Úspora nákladov:

    • Preprocessing lokálne (deskew, denoise) pred uploadom — zlepší presnosť bez extra nákladov
    • Kombinuj s open-source riešeniami pre low-priority dokumenty
    • Využi Free tier pre vývoj a testovanie
    • Monitoruj počet strán, nie súborov — viacstranové PDF sa účtuje per strana
  • Pre slovenčinu špecificky:

    • Explicitne nastav jazyk language=sk pri REST API volaniach pre lepšiu diakritiku
    • Testuj na vzorke dokumentov s diakritikou pred produkčným nasadením
    • Ručne písané slovenské texty odporúčame spárovať s human review

Zhrnutie

  • Mistral OCR je next-gen OCR riešenie postavené na AI, ktoré nielenže číta text, ale rozumie kontextu, opravuje chyby a zachováva štruktúru dokumentu
  • 94 % priemerná presnosť naprieč rôznymi typmi dokumentov ho radí medzi top riešenia v enterprise OCR — s osobitnou silou v európskych jazykoch vrátane slovenčiny
  • €8 za 1 000 strán s dátovou rezidenciu v EÚ ho robí ideálnou voľbou pre európske firmy so GDPR požiadavkami
  • Natívna integrácia do agentic AI pipeline je v roku 2026 kľúčová výhoda — Mistral OCR nevyžaduje bridgingové vrstvy pri napájaní do LLM agentov a RAG systémov
  • Ideálne pre: digitalizáciu archívov, automatizáciu dokumentov, akademický výskum, právne a účtovné agendy s európskymi jazykmi
  • Menej vhodné pre: real-time spracovanie, ťažký rukopis bez ľudskej kontroly, exotické skripty mimo európskeho priestoru