Gemma 3
Gemma 3 je tretia generácia open-source jazykových modelov od Google DeepMind, navrhnutá pre efektívny beh na lokálnom hardvéri – od notebookov až po single-GPU servery. Od svojho vydania v marci 2025 sa stala jedným z najpopulárnejších open-source modelov a referenčným bodom pre efektívne lokálne nasadenie. Pokračuje v tradícii sprístupňovania výskumných modelov širokej komunite a v roku 2026 si udržuje silnú pozíciu voči nástupcom.
1. Čo je Gemma 3
Gemma 3 je rodina modelov s veľkosťami 1B, 4B, 12B a 27B parametrov, pričom každá varianta je optimalizovaná pre konkrétny typ hardvéru:
- 1B – smartfóny, Raspberry Pi a edge zariadenia
- 4B – notebooky s integrovanou grafikou, NPU čipy
- 12B – bežné herné GPU (RTX 3080/4070)
- 27B – vlajková loď, ideálna pre RTX 4090 alebo profesionálne GPU
Kľúčové vlastnosti celej rodiny:
- Multimodálny vstup – od 4B vyššie dokáže spracovať nielen text, ale aj obrázky – prvá multimodálna Gemma
- Kontext 128K tokenov – umožňuje spracovanie dlhých dokumentov, kódových báz a rozsiahle konverzácie
- Sliding window attention – kombinácia lokálnej (1024 tokenov) a globálnej pozornosti pre efektívnu prácu s pamäťou
- Kvantizácia – oficiálna podpora 4-bitovej (Q4) aj 8-bitovej (Q8) kvantizácie; 27B beží na 16 GB VRAM v Q4
- Inštruktívne varianty – každá veľkosť má base aj IT (instruction-tuned) verziu
2. Architektúra a technické inovácie
Gemma 3 prináša niekoľko architektonických zmien oproti Gemma 2, ktoré spoločne zabezpečujú lepší pomer výkonu k veľkosti.
Sliding Window Attention (SWA)
Namiesto klasickej plnej pozornosti na všetky tokeny striedajú sa dva typy vrstiev:
- Lokálne vrstvy – pozornosť len na najbližších 1024 tokenov (rýchle, pamäťovo úsporné)
- Globálne vrstvy – plná pozornosť na celý kontext (každá 5. vrstva)
Výsledok: dramaticky nižšie pamäťové nároky pri zachovaní schopnosti pracovať s kontextom 128K tokenov.
Multimodálny encoder (SigLIP)
Pre spracovanie obrázkov slúži encoder postavený na SigLIP (Sigmoid Loss for Image-Language Pre-Training):
- Obrázok sa rozdelí na patches a zakóduje do embeddings
- Pan & Scan rozloženie – adaptívne rozrezanie na menšie časti pre lepšie zachytenie detailov na vysokom rozlíšení
- Podporuje vstupné rozlíšenia od 224×224 do 896×896 pixelov
Rozšírený tokenizátor
Gemma 3 používa tokenizátor s 262 144-položkovým slovníkom (oproti 256K v Gemma 2). Väčší slovník priamo zlepšuje efektivitu tokenizácie jazykov mimo angličtiny – slovenčina a čeština profitujú z nižšieho počtu tokenov na vetu, čo znižuje náklady aj latenciu.
Kvantizácia s tréningovou podporou (QAT)
Google vydal aj QAT (Quantization Aware Training) varianty, kde kvantizácia prebehla priamo počas tréningu. Tieto modely strácajú pri prechode na 4 bity výrazne menej kvality ako post-tréningová kvantizácia.
3. Výkon a porovnanie
Gemma 3 27B dosahuje výsledky porovnateľné s výrazne väčšími modelmi. Nasledujúca tabuľka zahŕňa hlavných konkurentov vrátane modelov vydaných po Gemme 3:
| Model | Parametre | Min. VRAM | Multimodálne | Kontext | MMLU | HumanEval |
|---|---|---|---|---|---|---|
| Gemma 3 27B | 27B | 16 GB (Q4) | ✅ Áno | 128K | 75.6% | 78.0% |
| Llama 4 Scout | ~17B aktívnych | 12 GB (Q4) | ✅ Áno | 10M | ~79% | ~80% |
| Qwen 3 32B | 32B | 20 GB (Q4) | ✅ Áno | 128K | ~85% | ~86% |
| Llama 3.3 70B | 70B | 40+ GB | ❌ Nie | 128K | 86.0% | 88.4% |
| Mistral Small 3.1 | 24B | 16 GB (Q4) | ✅ Áno | 128K | ~81% | ~79% |
Poznámka k interpretácii: Benchmarky sú vodítko, nie zákon. Gemma 3 27B dosahuje nižšie čísla ako Qwen 3 32B, no vo viacerých praktických testoch – najmä pri slovenčine a strednej Európe – sú rozdiely minimálne. Kľúčová výhoda Gemmy 3 zostáva dostupnosť na jedinom GPU pri zachovaní multimodality.
4. Gemma 3n – mobilná vetva
V máji 2025 Google DeepMind predstavil Gemma 3n, samostatnú vetvu optimalizovanú pre zariadenia s obmedzeným výkonom:
- E2B a E4B varianty – „Effective 2B/4B", teda modely s 2 resp. 4 miliardami aktívnych parametrov počas inferencie
- MatMul-free komponenty – architektúra redukuje závislosť na násobení matíc, čo umožňuje efektívny beh na NPU čipoch (Qualcomm Hexagon, Apple Neural Engine, Google Tensor)
- Audio vstup – Gemma 3n ako prvá Gemma priamo spracúva zvukové vstupy bez externého ASR modelu
- On-device nasadenie – optimalizovaná pre Android AI Edge SDK a MediaPipe LLM Inference API
Gemma 3n nie je určená pre lokálne PC, ale pre produkčné mobilné aplikácie kde latencia pod 100 ms je kritická požiadavka.
5. Praktické využitie
Lokálny AI asistent
Gemma 3 je ideálna pre offline AI asistentov cez nástroje ako Ollama alebo llama.cpp:
# Stiahnutie a spustenie
ollama pull gemma3:27b
ollama run gemma3:27b
# Alebo 12B pre menej výkonné GPU
ollama run gemma3:12b
Model beží plne offline bez odosielania dát – vhodné pre prácu s citlivými dokumentmi v právnych, medicínskych alebo firemných kontextoch.
Fine-tuning a prispôsobenie
Vďaka LoRA a QLoRA je Gemma 3 efektívne doladiteľná na špecifické domény. Príklad s Unsloth frameworkom (populárna voľba pre efektívny fine-tuning):
from unsloth import FastLanguageModel
model, tokenizer = FastLanguageModel.from_pretrained(
model_name="google/gemma-3-12b-it",
max_seq_length=8192,
load_in_4bit=True,
)
Typické use cases:
- Zákaznícka podpora v slovenčine alebo češtine
- Analýza domén-špecifických dokumentov (právne zmluvy, lekárske správy)
- Generovanie kódu v internom frameworku firmy
- Klasifikácia a extrakcia entít z neštruktúrovaných textov
Multimodálne aplikácie
- Popis a analýza obrázkov (výrobné kontroly, e-commerce)
- Extrakcia textu a štruktúry z fotografií dokumentov (OCR-like schopnosti)
- Vizuálne otázky a odpovede (VQA) v chatbotoch
- Analýza mediálneho obsahu bez cloudových závislostí
Vektorizácia a RAG
Gemma 3 sa dobre kombinuje s Retrieval-Augmented Generation pipeline – dlhý kontext 128K tokenov umožňuje vkladať väčšie chunky dokumentov priamo do promptu namiesto závislosti na vektorovom vyhľadávaní.
6. Bezpečnosť a ShieldGemma
Google DeepMind vydal ako doplnok k Gemme 3 model ShieldGemma – špecializovaný klasifikátor obsahu:
- Trénovaný na detekciu nebezpečného obsahu (hate speech, CSAM, násilie)
- Navrhnutý ako filter pre vstup aj výstup hlavného modelu
- Dostupný vo veľkostiach 2B a 9B pre rozličné výkonnostné požiadavky
- Integrovaný do Vertex AI Safety filters
Pre produkčné nasadenie Gemmy 3 v aplikáciách s používateľskými vstupmi je ShieldGemma odporúčanou vrstvou ochrany.
Samotná Gemma 3 prešla rozsiahlym RLHF (Reinforcement Learning from Human Feedback) a red-teamingom pred vydaním. Gemma License explicitne zakazuje použitie modelu na generovanie dezinformácií, CSAM a zbraní hromadného ničenia.
7. Licencia a ekosystém
Gemma 3 používa Gemma License – permisívnu licenciu, ktorá umožňuje:
- Komerčné použitie bez poplatkov
- Modifikáciu, redistribúciu a fine-tuning
- Vytváranie derivátov a produktov postavených na modeli
Obmedzenia sa týkajú primárne generovania škodlivého obsahu, zneužitia modelu a porušovania práv tretích strán.
Ekosystém (stav 2026):
- Google AI Studio – bezplatný playground s multimodálnym rozhraním, API prístup
- Hugging Face – oficiálne váhy, stovky komunitných fine-tunov, Spaces demá
- Kaggle – notebooky, datasety, súťaže postavené na Gemme 3
- Vertex AI – managed deployment, auto-scaling, SLA pre enterprise
- Ollama / LM Studio – jednoduchý lokálny beh bez technickej konfigurácie
- llama.cpp / llama-server – výkonný inference server, podpora GGUF formátu
- Jan.ai / Open WebUI – chatové rozhrania pre lokálne modely
8. Gemma 3 vs konkurencia
Nasledujúca tabuľka sumarizuje kľúčové rozdiely pre výber modelu pri lokálnom nasadení:
| Aspekt | Gemma 3 27B | Llama 4 Scout | Qwen 3 32B | Mistral Small 3.1 24B |
|---|---|---|---|---|
| Parametre | 27B | ~109B celkom | 32B | 24B |
| Aktívne parametre | 27B | ~17B (MoE) | 32B | 24B |
| Min. VRAM (Q4) | 16 GB | 12 GB | 20 GB | 16 GB |
| Kontext | 128K | 10M | 128K | 128K |
| Multimodálne | ✅ Áno | ✅ Áno | ✅ Áno | ✅ Áno |
| Licencia | Gemma (permis.) | Llama (permis.) | Apache 2.0 | Apache 2.0 |
| Slovenčina | Dobrá | Priemerná | Veľmi dobrá | Dobrá |
Gemma 3 27B zostáva silnou voľbou pre používateľov s jedným GPU do 24 GB VRAM, kde konkurenti buď vyžadujú viac pamäte (Qwen 3 32B), alebo prinášajú kompromisy v architektúre MoE (Llama 4 Scout s nerovnomernou kvalitou pri menších batch sizes).
9. Inštalácia a prvé kroky
Najrýchlejší štart pre nových používateľov:
# 1. Inštalácia Ollama (Linux/macOS)
curl -fsSL https://ollama.com/install.sh | sh
# 2. Stiahnutie modelu (zvoľ podľa VRAM)
ollama pull gemma3:27b # ~16 GB VRAM
ollama pull gemma3:12b # ~8 GB VRAM
ollama pull gemma3:4b # ~4 GB VRAM
# 3. Interaktívny chat
ollama run gemma3:12b
# 4. API volanie (kompatibilné s OpenAI API formátom)
curl http://localhost:11434/api/chat -d '{
"model": "gemma3:12b",
"messages": [{"role": "user", "content": "Vysvetli mi transformer architektúru."}]
}'
Pre grafické rozhranie odporúčame Open WebUI – open-source chatové rozhranie s podporou multimodality, histórie konverzácií a správy modelov.
Zhrnutie
Gemma 3 je viac ako rok po vydaní stále jedným z najdostupnejších vysoko-kvalitných open-source modelov od Google DeepMind. Kombinácia multimodality, dlhého kontextu 128K tokenov, efektívnej SWA architektúry a QAT kvantizácie z nej robí silného kandidáta pre lokálne AI aplikácie. Doplnená o Gemma 3n pre mobilné zariadenia a ShieldGemma pre bezpečnostné filtre tvorí Gemma rodina kompletný ekosystém pre rôzne produkčné scenáre.
Ak disponujete GPU s 16+ GB VRAM, Gemma 3 27B zostáva jednou z najlepších volieb pre lokálny AI – najmä tam, kde záleží na ochrane dát alebo offline prevádzke.