GLM-4.6V / GLM-4.7 / GLM-OCR

Rodina GLM od Z.ai (Zhipu AI) patrí k najzaujímavejším čínskym AI projektom, ktoré sa v roku 2026 výrazne presadili aj na globálnom trhu. Pokrýva tri odlišné typy úloh a tri rôzne filozofie spracovania informácií:

  • GLM-4.6V je vision-language model (VLM) – spracúva text, obrázky, video aj dokumenty a je stavaný na princípe „vidím → pochopím → spravím".
  • GLM-4.7 je flagship LLM – silný na agentické kódovanie, dlhé multi-step úlohy, tool-calling a stabilnejší reasoning s mysliacimi režimami.
  • GLM-OCR je špecializované OCR – cieľ je presne vyťažiť text + tabuľky + vzorce + štruktúru z PDF a scanov a vrátiť výsledok v použiteľnom formáte (Markdown, JSON).

Táto triáda pokrýva väčšinu reálnych enterprise scenárov: spracovanie dokumentov, vizuálna analýza, automatizované kódovanie a dlhé agentické workflow.


1. Úvodný prehľad: kedy ktorý model použiť

  • Keď máš screenshot, UI dizajn alebo PDF so slidmi a chceš z toho vygenerovať kód, report alebo zhrnutie – začni GLM-4.6V.
  • Keď riešiš programovanie, refaktoring, debugging, návrh architektúry alebo plánovanie krokov a chceš stabilný agentický výkon – začni GLM-4.7.
  • Keď potrebuješ extrahovať obsah z dokumentov do presnej štruktúry (tabuľky, faktúry, manuály, finančné výkazy) – začni GLM-OCR a až potom to prípadne nechaj dovyrozprávať LLM.

2. Porovnávacia tabuľka modelov

Vlastnosť GLM-4.6V GLM-4.7 GLM-OCR
Primárna úloha Multimodálna analýza Kódovanie + reasoning Extrakcia z dokumentov
Vstupy text, obr., video, súbor text PDF, JPG, PNG
Výstup text text text, Markdown, JSON
Kontext 128K tokenov 200K tokenov podľa limitov súboru
Max. výstup 128K tokenov
Thinking režim nie áno nie
Tool-calling áno (multimodálny) áno nie
Open-weights čiastočne áno nie
Typické nasadenie cloud / produkcia cloud / lokálne cloud
Licencia (weights) MIT (Flash varianty) MIT proprietárny endpoint

3. Čo je na týchto modeloch podstatné (hlavné inovácie)

GLM-4.6V – multimodálny agent bez zbytočných medzikrokov

Klasický problém multimodálnych pipeline je fragmentácia: najprv OCR, potom text, potom LLM. GLM-4.6V to rieši natívnym multimodálnym tool-use.

  • Natívne multimodálne function calling – obrázky a strany dokumentov vieš posielať priamo do rozhodovacieho procesu bez manuálneho preliatu cez OCR.
  • Silné scenáre použitia:
    • Replikácia frontendu zo screenshotu („design → code").
    • Vizuálne vyhľadávanie a generovanie ilustrovaných reportov.
    • Dlhé dokumenty so zmiešaným obsahom (text + grafy + tabuľky + obrázky) bez straty kontextu.
    • Analýza videozáznamov – popis scén, extrakcia klúčových momentov, generovanie titulkov.
  • Flash varianty znižujú latenciu a náklady pre produkčné pipeline – vhodné, keď presnosť nie je absolútna priorita (napríklad pri veľkoobjemovom predsortovaní dokumentov).

GLM-4.7 – kódovanie a stabilné multi-step cez myslenie

Kľúčový problém dlhých agentických úloh je „rozpad kontextu" – model postupne stráca prehľad o rozhodnutiach z predchádzajúcich krokov. GLM-4.7 to rieši cez tri typy thinking režimov:

  • Interleaved thinking – model si „premyslí" krok pred každou odpoveďou alebo tool-callom. V praxi dramaticky zlepšuje výkon na viacstupňových kódovacích úlohách.
  • Preserved/retention thinking – model si udržiava konzistentnejšiu logiku naprieč turnami. Menej „zabúdania rozhodnutí" v dlhých tasks.
  • Turn-level control – thinking vieš zapnúť alebo vypnúť podľa potreby: rýchlo pri jednoduchých dotazoch, dôsledne pri zložitých architektonických rozhodnutiach.

Praktická výhoda: GLM-4.7 je vhodný, keď chceš, aby model dokončil úlohu end-to-end (pochopiť zadanie → rozbiť na kroky → produkovať kompletný kód/patch → vysvetliť riziká → navrhnúť testy) bez toho, aby si ho musel neustále korigovať.

Kontext 200K tokenov s výstupom až 128K tokenov je pri generovaní veľkých kódových patchov, dokumentácie alebo veľkých JSON štruktúr reálna výhoda oproti modelom s kratším výstupným oknom.

GLM-OCR – document parsing ako produkt, nie len prečítanie textu

Bežné OCR nástroje vrátia text po riadkoch. GLM-OCR cieli na vyššiu úroveň:

  • Tabuľky – reálne 2D štruktúry, nie len odhadované riadky oddelené medzerami.
  • Vzorce – matematické a chemické vzorce v LaTeX formáte.
  • Layout – zachovanie štruktúry stránky vrátane stĺpcov, hlavičiek, pät a marginálnych poznámok.
  • Information extraction – faktúry, pečiatky, ručné písmo, formuláre s políčkami.

V praxi je GLM-OCR výborný ako prvý krok pred RAG pipeline, archiváciou, databázou alebo automatickým vyhodnocovaním dokumentov. Výstup priamo v Markdown alebo JSON minimalizuje ďalšie čistenie dát.


4. Technické detaily, ktoré reálne rozhodujú

GLM-4.6V

  • Vstupy: video, image, text, súbor (PDF, DOCX)
  • Výstup: text
  • Kontext: 128K tokenov
  • Varianty:
    • Plná verzia – vyššia presnosť, väčší model
    • Flash/FlashX – nižšia latencia a náklady, vhodné na produkčné pipeline alebo prototypy
  • Praktická poznámka: pri dlhých multimodálnych dokumentoch (desiatky strán, grafy, tabuľky, obrázky) je GLM-4.6V presne ten typ modelu, ktorý „nezomrie" na mixovanom obsahu – kontext 128K je dostatočný na spracovanie celého dokumentu naraz.

GLM-4.7

  • Vstup/výstup: text → text
  • Kontext: 200K tokenov, maximálny výstup 128K – reálna výhoda pri generovaní veľkých patchov, dokumentácie alebo rozsiahlejších JSON výstupov
  • API parametre:
    • model id: glm-4.7
    • streaming: stream=true, pri tool streamingu tool_stream=true
    • sampling defaults: temperature=1.0, top_p=0.95 (odporúča sa meniť len jeden)
    • thinking aktivácia: thinking={"type": "enabled"} alebo per-turn konfigurácia
  • Lokálne nasadenie (open-weights): podporované inference runtimes zahŕňajú vLLM, SGLang a Ollama. Pri nasadení na vlastnom stacku otestuj praktické limity kontextu – tokenizer/config konfigurácia môže zaviesť nižší efektívny limit ako uvádzajú parametre modelu.
  • Coding integrácie: GLM-4.7 je k dispozícii aj priamo v populárnych kódovacích nástrojoch cez „coding plan" predplatné.

GLM-OCR

  • Vstupy: PDF, JPG, PNG
  • Praktické limity pre pipeline:
    • Maximálna veľkosť súboru v MB (závisí od plánu)
    • Maximálny počet strán PDF: typicky 100 strán na volanie
    • Pre väčšie dokumenty je nutné deliť na dávky
  • Výstupy: text, Markdown, JSON, odkazy na extrahované obrázky
  • API štýl: špecializovaný endpoint na layout parsing – model="glm-ocr", vstup ako URL súboru alebo base64 encoded obsah

5. Dostupnosť a nasadenie

Cloud (Z.ai API)

Najjednoduchšia cesta pre prototypovanie aj produkciu. Registrácia, API kľúč, prvé volanie zvládneš za menej ako 10 minút. Výhody:

  • Žiadna infraštruktúra na správu
  • Automatické aktualizácie modelov
  • Škálovanie bez starostí o GPU kapacitu

Obmedzenie: dáta opúšťajú tvoju infraštruktúru – pri citlivých dokumentoch je nutné zvážiť zmluvné podmienky spracovania dát.

Lokálne / self-hosted (open-weights)

Pre GLM-4.7 a čiastočne GLM-4.6V sú k dispozícii open-weights verzie pod MIT licenciou. Výhody:

  • Plná kontrola nad dátami – ideálne pre zmluvy, HR dokumenty, interné finančné reporty
  • Možnosť fine-tuningu na vlastnej doméne
  • Bez per-token nákladov pri vysokom objeme

Praktické nároky na hardware: GLM-4.7 v plnej verzii vyžaduje viacero GPU s dostatočnou VRAM. Pre produkčné nasadenie odporúčame vLLM alebo SGLang s tensor parallelism.

Hybridné nasadenie

V praxi mnoho tímov kombinuje obidve možnosti: bežné úlohy cez cloud API, citlivé dokumenty lokálne. GLM-OCR je zatiaľ dostupné primárne cez cloud endpoint.


6. Ceny a licencie

  • Všetky modely sa cenia per 1M tokenov (input/output, niekedy aj cached input).
  • GLM-OCR je typicky nacenené veľmi lacno a symetricky pre input aj output – vhodné pri veľkoobjemovom spracovaní dokumentov.
  • GLM-4.6V má free a Flash varianty vhodné na prototypy alebo lacné spracovanie veľkých dávok.
  • GLM-4.7 má okrem štandardného API aj „coding plan" balíky integrované do populárnych kódovacích nástrojov (IDE pluginy, kódovacie platformy).
  • Open-weights modely sú väčšinou pod MIT licenciou – vhodné pre komerčné aj interné použitie. Vždy si však overí konkrétne podmienky pri danom repozitári a verzii modelu, keďže licenčné podmienky sa môžu líšiť medzi variantmi.

7. Bezpečnosť a súkromie

Citlivé dokumenty

Ak ide o faktúry, zmluvy, HR záznamy alebo interné finančné reporty:

  • Preferuj lokálne spracovanie, najmä pre OCR pipeline.
  • Ak musíš použiť cloud, anonymizuj alebo pseudonymizuj citlivé polia pred odoslaním.
  • Skontroluj, či poskytovateľ ponúka zmluvy o spracovaní dát (DPA) kompatibilné s GDPR alebo príslušnou legislatívou.

Validácia výstupov

Pri extrakcii do JSON alebo databázy:

  • Nastav validáciu schémy (JSON Schema alebo Pydantic model) – aby sa do databázy nedostali „domyslené" polia, ktoré model vygeneroval pri nízkej istote.
  • Polia s nízkou istotou nechaj model označiť ako null s notes poľom namiesto halucinácie hodnoty.
  • Loguj len nevyhnutné minimum – žiadne celé dokumenty v application logoch.

Agentické workflow a tool-calling

  • Definuj allowlist nástrojov – čo model smie volať a čo nie.
  • Stanov limity: povolené URL schémy a domény, typy súborov, maximálne veľkosti, maximálny počet strán.
  • Loguj všetky tool-cally s výsledkami pre audit trail – pri automatizovanom spracovaní dokumentov je to kľúčové pri kontrole dodržiavania procesov.

8. Odporúčané workflow

Dokument → štruktúra → analýza

  1. GLM-OCR: vyťažiť text a tabuľky do Markdown alebo JSON.
  2. GLM-4.7: normalizácia, sumarizácia, kontrola konzistencie, generovanie reportu.

Príklad: faktúry z rôznych dodávateľov → GLM-OCR extrahuje položky → GLM-4.7 normalizuje na jednotnú schému → INSERT do databázy.

Screenshot UI → hotový web

  1. GLM-4.6V: pixel-presná replikácia layoutu + návrh komponentizácie.
  2. GLM-4.7: refaktoring, typovanie (TypeScript), testy, build pipeline.

Agentické kódovanie (dlhý task)

  1. GLM-4.7 s thinking režimom: analýza zadania → plán krokov → implementácia → testy → finálna kontrola.
  2. Thinking zapni na začiatku task planniningu a pri kľúčových architektonických rozhodnutiach, vypni pri jednoduchých generatívnych krokoch (tým ušetríš tokeny a latenciu).

Veľkoobjemová archivácia dokumentov

  1. Rozdeliť dokumenty do dávok podľa limitov GLM-OCR (max. 100 strán/volanie).
  2. Paralelizovať OCR cez async API volania.
  3. Agregovaný výstup spracovať cez GLM-4.7 pre deduplikáciu a normalizáciu.
  4. Výsledok uložiť do vektorovej databázy pre RAG.

9. Prompt šablóny

GLM-OCR

Vyťaž z tohto PDF všetky tabuľky a vráť ich ako JSON podľa nasledujúcej schémy:
{ "tables": [{ "title": string, "headers": string[], "rows": string[][] }] }
Ak si nie si istý hodnotou, použi null a pridaj pole "notes" s vysvetlením.
Preveď priložený manuál do Markdown. Zachovaj:
- hierarchiu nadpisov (H1–H4)
- zoznamy a číslovanie
- tabuľky ako Markdown tabuľky
- matematické vzorce ako LaTeX ($$...$$)
- obrázky označ ako [Obrázok N: popis]

GLM-4.6V

Podľa priloženého screenshotu vygeneruj HTML/CSS/JS.
Zopakuj layout, typografiu a spacing čo najpresnejšie.
Navrhni komponentovú štruktúru a popiš hlavné komponenty.
Použij [framework/plain HTML] a [CSS framework/vanilla CSS].
Pozri sa na tieto slidy (príloha) a vytvor:
1. Stručný report (max. 500 slov) zachytávajúci hlavné tézy.
2. Zoznam 5 najdôležitejších grafov/vizualizácií s vysvetlením každého.
3. Sekciu „Otvorené otázky" – čo slidy neriešia.

GLM-4.7

Úloha: [popis úlohy]
Postup:
1. Najprv navrhni plán krokov (bez implementácie).
2. Počkaj na moje potvrdenie.
3. Potom implementuj krok po kroku.
4. Po každom kroku stručne zhrň, čo si spravil a čo nasleduje.
Daj dôraz na testy a regresnú kontrolu.
Refaktoruj priložený modul na čistú architektúru.
Požiadavky:
- Minimalizuj breaking changes pre existujúcich volajúcich.
- Zachovaj alebo vylepši test coverage.
- Vráť: (1) diff/patch, (2) migration notes pre volajúcich, (3) zoznam breaking changes ak nevyhnutné.

10. Kontext: Kde stojí GLM rodina v roku 2026

V roku 2026 sa trh foundation modelov výrazne konsolidoval okolo niekoľkých pólov: americké modely (Claude, GPT, Gemini), open-source európska komunita a čínske modely so silným regionálnym a globálnym dosahom. Rodina GLM patrí do poslednej skupiny a vyznačuje sa niekoľkými špecifickými vlastnosťami:

  • Silná podpora čínskeho jazyka – vrátane tradičnej čínštiny, odbornej terminológie a dokumentov v čínskych formátoch (štandardy, legislatíva).
  • Open-weights prístup – Z.ai konzistentne uvoľňuje váhy modelov pod permisívnymi licenciami, čo je v kontexte zvyšujúcich sa regulačných tlakov na AI transparentnosť výrazná výhoda.
  • Špecializácia namiesto generalizácie – namiesto jedného „everything model" ponúka triádu modelov optimalizovaných pre konkrétne úlohy, čo v praxi vedie k lepšiemu výkonu a nižším nákladom pri správnom výbere modelu.
  • Enterprise integrácie – coding plan balíky a priame integrácie do IDE nástrojov ukazujú, že Z.ai cieli primárne na vývojárske a enterprise trhy.

Pre slovenské a české organizácie je rodina GLM zaujímavá najmä v kontexte spracovania dokumentov (GLM-OCR) a agentického kódovania (GLM-4.7), kde ponúka konkurencieschopný výkon pri nižších nákladoch oproti niektorým alternatívam.