GLM-4.6V / GLM-4.7 / GLM-OCR

Rodina GLM od Z.ai (Zhipu AI) patrí k najzaujímavejším čínskym AI projektom, ktoré sa v roku 2026 výrazne presadili aj na globálnom trhu. Pokrýva tri odlišné typy úloh a tri rôzne filozofie spracovania informácií:

  • GLM-4.6V je vision-language model (VLM) – spracúva text, obrázky, video aj dokumenty a je stavaný na princípe „vidím → pochopím → spravím".
  • GLM-4.7 je flagship LLM – silný na agentické kódovanie, dlhé multi-step úlohy, tool-calling a stabilnejší reasoning s mysliacimi režimami.
  • GLM-OCR je špecializované OCR – cieľ je presne vyťažiť text + tabuľky + vzorce + štruktúru z PDF a scanov a vrátiť výsledok v použiteľnom formáte (Markdown, JSON).

Táto triáda pokrýva väčšinu reálnych enterprise scenárov: spracovanie dokumentov, vizuálna analýza, automatizované kódovanie a dlhé agentické workflow.


1. Úvodný prehľad: kedy ktorý model použiť

  • Keď máš screenshot, UI dizajn alebo PDF so slidmi a chceš z toho vygenerovať kód, report alebo zhrnutie – začni GLM-4.6V.
  • Keď riešiš programovanie, refaktoring, debugging, návrh architektúry alebo plánovanie krokov a chceš stabilný agentický výkon – začni GLM-4.7.
  • Keď potrebuješ extrahovať obsah z dokumentov do presnej štruktúry (tabuľky, faktúry, manuály, finančné výkazy) – začni GLM-OCR a až potom to prípadne nechaj dovyrozprávať LLM.

2. Porovnávacia tabuľka modelov

Vlastnosť GLM-4.6V GLM-4.7 GLM-OCR
Primárna úloha Multimodálna analýza Kódovanie + reasoning Extrakcia z dokumentov
Vstupy text, obr., video, súbor text PDF, JPG, PNG
Výstup text text text, Markdown, JSON
Kontext 128K tokenov 200K tokenov podľa limitov súboru
Max. výstup – 128K tokenov –
Thinking režim nie áno nie
Tool-calling áno (multimodálny) áno nie
Open-weights čiastočne áno nie
Typické nasadenie cloud / produkcia cloud / lokálne cloud
Licencia (weights) MIT (Flash varianty) MIT proprietárny endpoint

3. Čo je na týchto modeloch podstatné (hlavné inovácie)

GLM-4.6V – multimodálny agent bez zbytočných medzikrokov

Klasický problém multimodálnych pipeline je fragmentácia: najprv OCR, potom text, potom LLM. GLM-4.6V to rieši natívnym multimodálnym tool-use.

  • Natívne multimodálne function calling – obrázky a strany dokumentov vieš posielať priamo do rozhodovacieho procesu bez manuálneho preliatu cez OCR.
  • Silné scenáre použitia:
    • Replikácia frontendu zo screenshotu („design → code").
    • Vizuálne vyhľadávanie a generovanie ilustrovaných reportov.
    • Dlhé dokumenty so zmiešaným obsahom (text + grafy + tabuľky + obrázky) bez straty kontextu.
    • Analýza videozáznamov – popis scén, extrakcia klúčových momentov, generovanie titulkov.
  • Flash varianty znižujú latenciu a náklady pre produkčné pipeline – vhodné, keď presnosť nie je absolútna priorita (napríklad pri veľkoobjemovom predsortovaní dokumentov).

GLM-4.7 – kódovanie a stabilné multi-step cez myslenie

Kľúčový problém dlhých agentických úloh je „rozpad kontextu" – model postupne stráca prehľad o rozhodnutiach z predchádzajúcich krokov. GLM-4.7 to rieši cez tri typy thinking režimov:

  • Interleaved thinking – model si „premyslí" krok pred každou odpoveďou alebo tool-callom. V praxi dramaticky zlepšuje výkon na viacstupňových kódovacích úlohách.
  • Preserved/retention thinking – model si udržiava konzistentnejšiu logiku naprieč turnami. Menej „zabúdania rozhodnutí" v dlhých tasks.
  • Turn-level control – thinking vieš zapnúť alebo vypnúť podľa potreby: rýchlo pri jednoduchých dotazoch, dôsledne pri zložitých architektonických rozhodnutiach.

Praktická výhoda: GLM-4.7 je vhodný, keď chceš, aby model dokončil úlohu end-to-end (pochopiť zadanie → rozbiť na kroky → produkovať kompletný kód/patch → vysvetliť riziká → navrhnúť testy) bez toho, aby si ho musel neustále korigovať.

Kontext 200K tokenov s výstupom až 128K tokenov je pri generovaní veľkých kódových patchov, dokumentácie alebo veľkých JSON štruktúr reálna výhoda oproti modelom s kratším výstupným oknom.

GLM-OCR – document parsing ako produkt, nie len prečítanie textu

Bežné OCR nástroje vrátia text po riadkoch. GLM-OCR cieli na vyššiu úroveň:

  • Tabuľky – reálne 2D štruktúry, nie len odhadované riadky oddelené medzerami.
  • Vzorce – matematické a chemické vzorce v LaTeX formáte.
  • Layout – zachovanie štruktúry stránky vrátane stĺpcov, hlavičiek, pät a marginálnych poznámok.
  • Information extraction – faktúry, pečiatky, ručné písmo, formuláre s políčkami.

V praxi je GLM-OCR výborný ako prvý krok pred RAG pipeline, archiváciou, databázou alebo automatickým vyhodnocovaním dokumentov. Výstup priamo v Markdown alebo JSON minimalizuje ďalšie čistenie dát.


4. Technické detaily, ktoré reálne rozhodujú

GLM-4.6V

  • Vstupy: video, image, text, súbor (PDF, DOCX)
  • Výstup: text
  • Kontext: 128K tokenov
  • Varianty:
    • Plná verzia – vyššia presnosť, väčší model
    • Flash/FlashX – nižšia latencia a náklady, vhodné na produkčné pipeline alebo prototypy
  • Praktická poznámka: pri dlhých multimodálnych dokumentoch (desiatky strán, grafy, tabuľky, obrázky) je GLM-4.6V presne ten typ modelu, ktorý „nezomrie" na mixovanom obsahu – kontext 128K je dostatočný na spracovanie celého dokumentu naraz.

GLM-4.7

  • Vstup/výstup: text → text
  • Kontext: 200K tokenov, maximálny výstup 128K – reálna výhoda pri generovaní veľkých patchov, dokumentácie alebo rozsiahlejších JSON výstupov
  • API parametre:
    • model id: glm-4.7
    • streaming: stream=true, pri tool streamingu tool_stream=true
    • sampling defaults: temperature=1.0, top_p=0.95 (odporúča sa meniť len jeden)
    • thinking aktivácia: thinking={"type": "enabled"} alebo per-turn konfigurácia
  • Lokálne nasadenie (open-weights): podporované inference runtimes zahŕňajú vLLM, SGLang a Ollama. Pri nasadení na vlastnom stacku otestuj praktické limity kontextu – tokenizer/config konfigurácia môže zaviesť nižší efektívny limit ako uvádzajú parametre modelu.
  • Coding integrácie: GLM-4.7 je k dispozícii aj priamo v populárnych kódovacích nástrojoch cez „coding plan" predplatné.

GLM-OCR

  • Vstupy: PDF, JPG, PNG
  • Praktické limity pre pipeline:
    • Maximálna veľkosť súboru v MB (závisí od plánu)
    • Maximálny počet strán PDF: typicky 100 strán na volanie
    • Pre väčšie dokumenty je nutné deliť na dávky
  • Výstupy: text, Markdown, JSON, odkazy na extrahované obrázky
  • API štýl: špecializovaný endpoint na layout parsing – model="glm-ocr", vstup ako URL súboru alebo base64 encoded obsah

5. Dostupnosť a nasadenie

Cloud (Z.ai API)

Najjednoduchšia cesta pre prototypovanie aj produkciu. Registrácia, API kľúč, prvé volanie zvládneš za menej ako 10 minút. Výhody:

  • Žiadna infraštruktúra na správu
  • Automatické aktualizácie modelov
  • Škálovanie bez starostí o GPU kapacitu

Obmedzenie: dáta opúšťajú tvoju infraštruktúru – pri citlivých dokumentoch je nutné zvážiť zmluvné podmienky spracovania dát.

Lokálne / self-hosted (open-weights)

Pre GLM-4.7 a čiastočne GLM-4.6V sú k dispozícii open-weights verzie pod MIT licenciou. Výhody:

  • Plná kontrola nad dátami – ideálne pre zmluvy, HR dokumenty, interné finančné reporty
  • Možnosť fine-tuningu na vlastnej doméne
  • Bez per-token nákladov pri vysokom objeme

Praktické nároky na hardware: GLM-4.7 v plnej verzii vyžaduje viacero GPU s dostatočnou VRAM. Pre produkčné nasadenie odporúčame vLLM alebo SGLang s tensor parallelism.

Hybridné nasadenie

V praxi mnoho tímov kombinuje obidve možnosti: bežné úlohy cez cloud API, citlivé dokumenty lokálne. GLM-OCR je zatiaľ dostupné primárne cez cloud endpoint.


6. Ceny a licencie

  • Všetky modely sa cenia per 1M tokenov (input/output, niekedy aj cached input).
  • GLM-OCR je typicky nacenené veľmi lacno a symetricky pre input aj output – vhodné pri veľkoobjemovom spracovaní dokumentov.
  • GLM-4.6V má free a Flash varianty vhodné na prototypy alebo lacné spracovanie veľkých dávok.
  • GLM-4.7 má okrem štandardného API aj „coding plan" balíky integrované do populárnych kódovacích nástrojov (IDE pluginy, kódovacie platformy).
  • Open-weights modely sú väčšinou pod MIT licenciou – vhodné pre komerčné aj interné použitie. Vždy si však overí konkrétne podmienky pri danom repozitári a verzii modelu, keďže licenčné podmienky sa môžu líšiť medzi variantmi.

7. Bezpečnosť a súkromie

Citlivé dokumenty

Ak ide o faktúry, zmluvy, HR záznamy alebo interné finančné reporty:

  • Preferuj lokálne spracovanie, najmä pre OCR pipeline.
  • Ak musíš použiť cloud, anonymizuj alebo pseudonymizuj citlivé polia pred odoslaním.
  • Skontroluj, či poskytovateľ ponúka zmluvy o spracovaní dát (DPA) kompatibilné s GDPR alebo príslušnou legislatívou.

Validácia výstupov

Pri extrakcii do JSON alebo databázy:

  • Nastav validáciu schémy (JSON Schema alebo Pydantic model) – aby sa do databázy nedostali „domyslené" polia, ktoré model vygeneroval pri nízkej istote.
  • Polia s nízkou istotou nechaj model označiť ako null s notes poľom namiesto halucinácie hodnoty.
  • Loguj len nevyhnutné minimum – žiadne celé dokumenty v application logoch.

Agentické workflow a tool-calling

  • Definuj allowlist nástrojov – čo model smie volať a čo nie.
  • Stanov limity: povolené URL schémy a domény, typy súborov, maximálne veľkosti, maximálny počet strán.
  • Loguj všetky tool-cally s výsledkami pre audit trail – pri automatizovanom spracovaní dokumentov je to kľúčové pri kontrole dodržiavania procesov.

8. Odporúčané workflow

Dokument → štruktúra → analýza

  1. GLM-OCR: vyťažiť text a tabuľky do Markdown alebo JSON.
  2. GLM-4.7: normalizácia, sumarizácia, kontrola konzistencie, generovanie reportu.

Príklad: faktúry z rôznych dodávateľov → GLM-OCR extrahuje položky → GLM-4.7 normalizuje na jednotnú schému → INSERT do databázy.

Screenshot UI → hotový web

  1. GLM-4.6V: pixel-presná replikácia layoutu + návrh komponentizácie.
  2. GLM-4.7: refaktoring, typovanie (TypeScript), testy, build pipeline.

Agentické kódovanie (dlhý task)

  1. GLM-4.7 s thinking režimom: analýza zadania → plán krokov → implementácia → testy → finálna kontrola.
  2. Thinking zapni na začiatku task planniningu a pri kľúčových architektonických rozhodnutiach, vypni pri jednoduchých generatívnych krokoch (tým ušetríš tokeny a latenciu).

Veľkoobjemová archivácia dokumentov

  1. Rozdeliť dokumenty do dávok podľa limitov GLM-OCR (max. 100 strán/volanie).
  2. Paralelizovať OCR cez async API volania.
  3. Agregovaný výstup spracovať cez GLM-4.7 pre deduplikáciu a normalizáciu.
  4. Výsledok uložiť do vektorovej databázy pre RAG.

9. Prompt šablóny

GLM-OCR

Vyťaž z tohto PDF všetky tabuľky a vráť ich ako JSON podľa nasledujúcej schémy:
{ "tables": [{ "title": string, "headers": string[], "rows": string[][] }] }
Ak si nie si istý hodnotou, použi null a pridaj pole "notes" s vysvetlením.
Preveď priložený manuál do Markdown. Zachovaj:
- hierarchiu nadpisov (H1–H4)
- zoznamy a číslovanie
- tabuľky ako Markdown tabuľky
- matematické vzorce ako LaTeX ($$...$$)
- obrázky označ ako [Obrázok N: popis]

GLM-4.6V

Podľa priloženého screenshotu vygeneruj HTML/CSS/JS.
Zopakuj layout, typografiu a spacing čo najpresnejšie.
Navrhni komponentovú štruktúru a popiš hlavné komponenty.
Použij [framework/plain HTML] a [CSS framework/vanilla CSS].
Pozri sa na tieto slidy (príloha) a vytvor:
1. Stručný report (max. 500 slov) zachytávajúci hlavné tézy.
2. Zoznam 5 najdôležitejších grafov/vizualizácií s vysvetlením každého.
3. Sekciu „Otvorené otázky" – čo slidy neriešia.

GLM-4.7

Úloha: [popis úlohy]
Postup:
1. Najprv navrhni plán krokov (bez implementácie).
2. Počkaj na moje potvrdenie.
3. Potom implementuj krok po kroku.
4. Po každom kroku stručne zhrň, čo si spravil a čo nasleduje.
Daj dôraz na testy a regresnú kontrolu.
Refaktoruj priložený modul na čistú architektúru.
Požiadavky:
- Minimalizuj breaking changes pre existujúcich volajúcich.
- Zachovaj alebo vylepši test coverage.
- Vráť: (1) diff/patch, (2) migration notes pre volajúcich, (3) zoznam breaking changes ak nevyhnutné.

10. Kontext: Kde stojí GLM rodina v roku 2026

V roku 2026 sa trh foundation modelov výrazne konsolidoval okolo niekoľkých pólov: americké modely (Claude, GPT, Gemini), open-source európska komunita a čínske modely so silným regionálnym a globálnym dosahom. Rodina GLM patrí do poslednej skupiny a vyznačuje sa niekoľkými špecifickými vlastnosťami:

  • Silná podpora čínskeho jazyka – vrátane tradičnej čínštiny, odbornej terminológie a dokumentov v čínskych formátoch (štandardy, legislatíva).
  • Open-weights prístup – Z.ai konzistentne uvoľňuje váhy modelov pod permisívnymi licenciami, čo je v kontexte zvyšujúcich sa regulačných tlakov na AI transparentnosť výrazná výhoda.
  • Špecializácia namiesto generalizácie – namiesto jedného „everything model" ponúka triádu modelov optimalizovaných pre konkrétne úlohy, čo v praxi vedie k lepšiemu výkonu a nižším nákladom pri správnom výbere modelu.
  • Enterprise integrácie – coding plan balíky a priame integrácie do IDE nástrojov ukazujú, že Z.ai cieli primárne na vývojárske a enterprise trhy.

Pre slovenské a české organizácie je rodina GLM zaujímavá najmä v kontexte spracovania dokumentov (GLM-OCR) a agentického kódovania (GLM-4.7), kde ponúka konkurencieschopný výkon pri nižších nákladoch oproti niektorým alternatívam.