GLM-4.6V / GLM-4.7 / GLM-OCR
Rodina GLM od Z.ai (Zhipu AI) patrí k najzaujímavejším čínskym AI projektom, ktoré sa v roku 2026 výrazne presadili aj na globálnom trhu. Pokrýva tri odlišné typy úloh a tri rôzne filozofie spracovania informácií:
- GLM-4.6V je vision-language model (VLM) – spracúva text, obrázky, video aj dokumenty a je stavaný na princípe „vidím → pochopím → spravím".
- GLM-4.7 je flagship LLM – silný na agentické kódovanie, dlhé multi-step úlohy, tool-calling a stabilnejší reasoning s mysliacimi režimami.
- GLM-OCR je špecializované OCR – cieľ je presne vyťažiť text + tabuľky + vzorce + štruktúru z PDF a scanov a vrátiť výsledok v použiteľnom formáte (Markdown, JSON).
Táto triáda pokrýva väčšinu reálnych enterprise scenárov: spracovanie dokumentov, vizuálna analýza, automatizované kódovanie a dlhé agentické workflow.
1. Úvodný prehľad: kedy ktorý model použiť
- Keď máš screenshot, UI dizajn alebo PDF so slidmi a chceš z toho vygenerovať kód, report alebo zhrnutie – začni GLM-4.6V.
- Keď riešiš programovanie, refaktoring, debugging, návrh architektúry alebo plánovanie krokov a chceš stabilný agentický výkon – začni GLM-4.7.
- Keď potrebuješ extrahovať obsah z dokumentov do presnej štruktúry (tabuľky, faktúry, manuály, finančné výkazy) – začni GLM-OCR a až potom to prípadne nechaj dovyrozprávať LLM.
2. Porovnávacia tabuľka modelov
| Vlastnosť | GLM-4.6V | GLM-4.7 | GLM-OCR |
|---|---|---|---|
| Primárna úloha | Multimodálna analýza | Kódovanie + reasoning | Extrakcia z dokumentov |
| Vstupy | text, obr., video, súbor | text | PDF, JPG, PNG |
| Výstup | text | text | text, Markdown, JSON |
| Kontext | 128K tokenov | 200K tokenov | podľa limitov súboru |
| Max. výstup | – | 128K tokenov | – |
| Thinking režim | nie | áno | nie |
| Tool-calling | áno (multimodálny) | áno | nie |
| Open-weights | čiastočne | áno | nie |
| Typické nasadenie | cloud / produkcia | cloud / lokálne | cloud |
| Licencia (weights) | MIT (Flash varianty) | MIT | proprietárny endpoint |
3. Čo je na týchto modeloch podstatné (hlavné inovácie)
GLM-4.6V – multimodálny agent bez zbytočných medzikrokov
Klasický problém multimodálnych pipeline je fragmentácia: najprv OCR, potom text, potom LLM. GLM-4.6V to rieši natívnym multimodálnym tool-use.
- Natívne multimodálne function calling – obrázky a strany dokumentov vieš posielať priamo do rozhodovacieho procesu bez manuálneho preliatu cez OCR.
- Silné scenáre použitia:
- Replikácia frontendu zo screenshotu („design → code").
- Vizuálne vyhľadávanie a generovanie ilustrovaných reportov.
- Dlhé dokumenty so zmiešaným obsahom (text + grafy + tabuľky + obrázky) bez straty kontextu.
- Analýza videozáznamov – popis scén, extrakcia klúčových momentov, generovanie titulkov.
- Flash varianty znižujú latenciu a náklady pre produkčné pipeline – vhodné, keď presnosť nie je absolútna priorita (napríklad pri veľkoobjemovom predsortovaní dokumentov).
GLM-4.7 – kódovanie a stabilné multi-step cez myslenie
Kľúčový problém dlhých agentických úloh je „rozpad kontextu" – model postupne stráca prehľad o rozhodnutiach z predchádzajúcich krokov. GLM-4.7 to rieši cez tri typy thinking režimov:
- Interleaved thinking – model si „premyslí" krok pred každou odpoveďou alebo tool-callom. V praxi dramaticky zlepšuje výkon na viacstupňových kódovacích úlohách.
- Preserved/retention thinking – model si udržiava konzistentnejšiu logiku naprieč turnami. Menej „zabúdania rozhodnutí" v dlhých tasks.
- Turn-level control – thinking vieš zapnúť alebo vypnúť podľa potreby: rýchlo pri jednoduchých dotazoch, dôsledne pri zložitých architektonických rozhodnutiach.
Praktická výhoda: GLM-4.7 je vhodný, keď chceš, aby model dokončil úlohu end-to-end (pochopiť zadanie → rozbiť na kroky → produkovať kompletný kód/patch → vysvetliť riziká → navrhnúť testy) bez toho, aby si ho musel neustále korigovať.
Kontext 200K tokenov s výstupom až 128K tokenov je pri generovaní veľkých kódových patchov, dokumentácie alebo veľkých JSON štruktúr reálna výhoda oproti modelom s kratším výstupným oknom.
GLM-OCR – document parsing ako produkt, nie len prečítanie textu
Bežné OCR nástroje vrátia text po riadkoch. GLM-OCR cieli na vyššiu úroveň:
- Tabuľky – reálne 2D štruktúry, nie len odhadované riadky oddelené medzerami.
- Vzorce – matematické a chemické vzorce v LaTeX formáte.
- Layout – zachovanie štruktúry stránky vrátane stĺpcov, hlavičiek, pät a marginálnych poznámok.
- Information extraction – faktúry, pečiatky, ručné písmo, formuláre s políčkami.
V praxi je GLM-OCR výborný ako prvý krok pred RAG pipeline, archiváciou, databázou alebo automatickým vyhodnocovaním dokumentov. Výstup priamo v Markdown alebo JSON minimalizuje ďalšie čistenie dát.
4. Technické detaily, ktoré reálne rozhodujú
GLM-4.6V
- Vstupy: video, image, text, súbor (PDF, DOCX)
- Výstup: text
- Kontext: 128K tokenov
- Varianty:
- Plná verzia – vyššia presnosť, väčší model
- Flash/FlashX – nižšia latencia a náklady, vhodné na produkčné pipeline alebo prototypy
- Praktická poznámka: pri dlhých multimodálnych dokumentoch (desiatky strán, grafy, tabuľky, obrázky) je GLM-4.6V presne ten typ modelu, ktorý „nezomrie" na mixovanom obsahu – kontext 128K je dostatočný na spracovanie celého dokumentu naraz.
GLM-4.7
- Vstup/výstup: text → text
- Kontext: 200K tokenov, maximálny výstup 128K – reálna výhoda pri generovaní veľkých patchov, dokumentácie alebo rozsiahlejších JSON výstupov
- API parametre:
- model id:
glm-4.7 - streaming:
stream=true, pri tool streamingutool_stream=true - sampling defaults:
temperature=1.0,top_p=0.95(odporúča sa meniť len jeden) - thinking aktivácia:
thinking={"type": "enabled"}alebo per-turn konfigurácia
- model id:
- Lokálne nasadenie (open-weights): podporované inference runtimes zahŕňajú vLLM, SGLang a Ollama. Pri nasadení na vlastnom stacku otestuj praktické limity kontextu – tokenizer/config konfigurácia môže zaviesť nižší efektívny limit ako uvádzajú parametre modelu.
- Coding integrácie: GLM-4.7 je k dispozícii aj priamo v populárnych kódovacích nástrojoch cez „coding plan" predplatné.
GLM-OCR
- Vstupy: PDF, JPG, PNG
- Praktické limity pre pipeline:
- Maximálna veľkosť súboru v MB (závisí od plánu)
- Maximálny počet strán PDF: typicky 100 strán na volanie
- Pre väčšie dokumenty je nutné deliť na dávky
- Výstupy: text, Markdown, JSON, odkazy na extrahované obrázky
- API štýl: špecializovaný endpoint na layout parsing –
model="glm-ocr", vstup ako URL súboru alebo base64 encoded obsah
5. Dostupnosť a nasadenie
Cloud (Z.ai API)
Najjednoduchšia cesta pre prototypovanie aj produkciu. Registrácia, API kľúč, prvé volanie zvládneš za menej ako 10 minút. Výhody:
- Žiadna infraštruktúra na správu
- Automatické aktualizácie modelov
- Škálovanie bez starostí o GPU kapacitu
Obmedzenie: dáta opúšťajú tvoju infraštruktúru – pri citlivých dokumentoch je nutné zvážiť zmluvné podmienky spracovania dát.
Lokálne / self-hosted (open-weights)
Pre GLM-4.7 a čiastočne GLM-4.6V sú k dispozícii open-weights verzie pod MIT licenciou. Výhody:
- Plná kontrola nad dátami – ideálne pre zmluvy, HR dokumenty, interné finančné reporty
- Možnosť fine-tuningu na vlastnej doméne
- Bez per-token nákladov pri vysokom objeme
Praktické nároky na hardware: GLM-4.7 v plnej verzii vyžaduje viacero GPU s dostatočnou VRAM. Pre produkčné nasadenie odporúčame vLLM alebo SGLang s tensor parallelism.
Hybridné nasadenie
V praxi mnoho tímov kombinuje obidve možnosti: bežné úlohy cez cloud API, citlivé dokumenty lokálne. GLM-OCR je zatiaľ dostupné primárne cez cloud endpoint.
6. Ceny a licencie
- Všetky modely sa cenia per 1M tokenov (input/output, niekedy aj cached input).
- GLM-OCR je typicky nacenené veľmi lacno a symetricky pre input aj output – vhodné pri veľkoobjemovom spracovaní dokumentov.
- GLM-4.6V má free a Flash varianty vhodné na prototypy alebo lacné spracovanie veľkých dávok.
- GLM-4.7 má okrem štandardného API aj „coding plan" balíky integrované do populárnych kódovacích nástrojov (IDE pluginy, kódovacie platformy).
- Open-weights modely sú väčšinou pod MIT licenciou – vhodné pre komerčné aj interné použitie. Vždy si však overí konkrétne podmienky pri danom repozitári a verzii modelu, keďže licenčné podmienky sa môžu líšiť medzi variantmi.
7. Bezpečnosť a súkromie
Citlivé dokumenty
Ak ide o faktúry, zmluvy, HR záznamy alebo interné finančné reporty:
- Preferuj lokálne spracovanie, najmä pre OCR pipeline.
- Ak musíš použiť cloud, anonymizuj alebo pseudonymizuj citlivé polia pred odoslaním.
- Skontroluj, či poskytovateľ ponúka zmluvy o spracovaní dát (DPA) kompatibilné s GDPR alebo príslušnou legislatívou.
Validácia výstupov
Pri extrakcii do JSON alebo databázy:
- Nastav validáciu schémy (JSON Schema alebo Pydantic model) – aby sa do databázy nedostali „domyslené" polia, ktoré model vygeneroval pri nízkej istote.
- Polia s nízkou istotou nechaj model označiť ako
nullsnotespoľom namiesto halucinácie hodnoty. - Loguj len nevyhnutné minimum – žiadne celé dokumenty v application logoch.
Agentické workflow a tool-calling
- Definuj allowlist nástrojov – čo model smie volať a čo nie.
- Stanov limity: povolené URL schémy a domény, typy súborov, maximálne veľkosti, maximálny počet strán.
- Loguj všetky tool-cally s výsledkami pre audit trail – pri automatizovanom spracovaní dokumentov je to kľúčové pri kontrole dodržiavania procesov.
8. Odporúčané workflow
Dokument → štruktúra → analýza
- GLM-OCR: vyťažiť text a tabuľky do Markdown alebo JSON.
- GLM-4.7: normalizácia, sumarizácia, kontrola konzistencie, generovanie reportu.
Príklad: faktúry z rôznych dodávateľov → GLM-OCR extrahuje položky → GLM-4.7 normalizuje na jednotnú schému → INSERT do databázy.
Screenshot UI → hotový web
- GLM-4.6V: pixel-presná replikácia layoutu + návrh komponentizácie.
- GLM-4.7: refaktoring, typovanie (TypeScript), testy, build pipeline.
Agentické kódovanie (dlhý task)
- GLM-4.7 s thinking režimom: analýza zadania → plán krokov → implementácia → testy → finálna kontrola.
- Thinking zapni na začiatku task planniningu a pri kľúčových architektonických rozhodnutiach, vypni pri jednoduchých generatívnych krokoch (tým ušetríš tokeny a latenciu).
Veľkoobjemová archivácia dokumentov
- Rozdeliť dokumenty do dávok podľa limitov GLM-OCR (max. 100 strán/volanie).
- Paralelizovať OCR cez async API volania.
- Agregovaný výstup spracovať cez GLM-4.7 pre deduplikáciu a normalizáciu.
- Výsledok uložiť do vektorovej databázy pre RAG.
9. Prompt šablóny
GLM-OCR
Vyťaž z tohto PDF všetky tabuľky a vráť ich ako JSON podľa nasledujúcej schémy:
{ "tables": [{ "title": string, "headers": string[], "rows": string[][] }] }
Ak si nie si istý hodnotou, použi null a pridaj pole "notes" s vysvetlením.
Preveď priložený manuál do Markdown. Zachovaj:
- hierarchiu nadpisov (H1–H4)
- zoznamy a číslovanie
- tabuľky ako Markdown tabuľky
- matematické vzorce ako LaTeX ($$...$$)
- obrázky označ ako [Obrázok N: popis]
GLM-4.6V
Podľa priloženého screenshotu vygeneruj HTML/CSS/JS.
Zopakuj layout, typografiu a spacing čo najpresnejšie.
Navrhni komponentovú štruktúru a popiš hlavné komponenty.
Použij [framework/plain HTML] a [CSS framework/vanilla CSS].
Pozri sa na tieto slidy (príloha) a vytvor:
1. Stručný report (max. 500 slov) zachytávajúci hlavné tézy.
2. Zoznam 5 najdôležitejších grafov/vizualizácií s vysvetlením každého.
3. Sekciu „Otvorené otázky" – čo slidy neriešia.
GLM-4.7
Úloha: [popis úlohy]
Postup:
1. Najprv navrhni plán krokov (bez implementácie).
2. Počkaj na moje potvrdenie.
3. Potom implementuj krok po kroku.
4. Po každom kroku stručne zhrň, čo si spravil a čo nasleduje.
Daj dôraz na testy a regresnú kontrolu.
Refaktoruj priložený modul na čistú architektúru.
Požiadavky:
- Minimalizuj breaking changes pre existujúcich volajúcich.
- Zachovaj alebo vylepši test coverage.
- Vráť: (1) diff/patch, (2) migration notes pre volajúcich, (3) zoznam breaking changes ak nevyhnutné.
10. Kontext: Kde stojí GLM rodina v roku 2026
V roku 2026 sa trh foundation modelov výrazne konsolidoval okolo niekoľkých pólov: americké modely (Claude, GPT, Gemini), open-source európska komunita a čínske modely so silným regionálnym a globálnym dosahom. Rodina GLM patrí do poslednej skupiny a vyznačuje sa niekoľkými špecifickými vlastnosťami:
- Silná podpora čínskeho jazyka – vrátane tradičnej čínštiny, odbornej terminológie a dokumentov v čínskych formátoch (štandardy, legislatíva).
- Open-weights prístup – Z.ai konzistentne uvoľňuje váhy modelov pod permisívnymi licenciami, čo je v kontexte zvyšujúcich sa regulačných tlakov na AI transparentnosť výrazná výhoda.
- Špecializácia namiesto generalizácie – namiesto jedného „everything model" ponúka triádu modelov optimalizovaných pre konkrétne úlohy, čo v praxi vedie k lepšiemu výkonu a nižším nákladom pri správnom výbere modelu.
- Enterprise integrácie – coding plan balíky a priame integrácie do IDE nástrojov ukazujú, že Z.ai cieli primárne na vývojárske a enterprise trhy.
Pre slovenské a české organizácie je rodina GLM zaujímavá najmä v kontexte spracovania dokumentov (GLM-OCR) a agentického kódovania (GLM-4.7), kde ponúka konkurencieschopný výkon pri nižších nákladoch oproti niektorým alternatívam.