LLaMA
LLaMA/Llama je rodina veľkých jazykových modelov od Meta, pri ktorých je kľúčová myšlienka „otvorené váhy": model si vieš stiahnuť, nasadiť na vlastnom hardvéri a prispôsobiť ho. V praxi to znamená viac kontroly nad nákladmi, súkromím aj nad tým, čo presne model robí.
1. Čo to je a prečo je to podstatné
- Nie úplne open-source: Okolo Llama je dôležitá nuansa: „open-weights" neznamená automaticky open-source v zmysle OSI. Licencia má podmienky a obmedzenia, ktoré pri klasickom open-source softvéri nebývajú — napriek tomu je Llama jedna z najvoľnejšie dostupných rodín frontier modelov na svete.
- Ekosystém okolo modelu: Keď sú váhy dostupné mimo jedného poskytovateľa, prirodzene vzniká ekosystém nástrojov — lokálne inference, kvantizácie, RAG, fine-tuning, bezpečnostné „guard" modely, integrátory a frameworky. Ekosystém okolo Llama je jeden z najaktívnejších v branži, prirovnateľný k ekosystému okolo PyTorch.
- Referenčná úroveň v branži: Llama modely sa bežne používajú ako baseline pri porovnávaní iných modelov — keď niekto tvrdí, že jeho model „prekonáva Llamu", vieš, čo to v praxi znamená.
- Prečo ťa to zaujme: Ak riešiš firemné dokumenty, interný chatbot, asistenta v aplikácii alebo automatizácie, Llama je často cesta, ako to spraviť bez toho, aby si všetko posielal do cudzieho cloudu.
2. História a vývoj: od Llama 1 po Llama 4
Llama si prešla rýchlou evolúciou od prvého vydania v roku 2023 po dnešné multimodálne MoE modely.
- Llama 1 (február 2023): Prvá verejná rodina — dostupná len pre výskum, ale únik váh na internet spustil masívnu vlnu komunitného vývoja. Modely od 7B do 65B parametrov.
- Llama 2 (júl 2023): Komerčné použitie povolené, lepšie výsledky, modely s RLHF ladením (Llama 2-Chat). Prvá verzia s jasnejšími bezpečnostnými guardrails.
- Llama 3 / 3.1 / 3.2 / 3.3 (2024): Dramatický skok v kvalite. Llama 3.1 405B bola prvý otvorený model, ktorý sa reálne meral s GPT-4 úrovňou na mnohých benchmarkoch. Llama 3.2 priniesla multimodalitu (vision) a malé modely pre edge a mobilné zariadenia. Llama 3.3 70B ponúkla výkonnosť veľkých modelov v kompaktnejšom balení.
- Llama 4 (apríl 2025): Prechod na Mixture of Experts architektúru, natively multimodálne, dramaticky dlhší kontext. Vydané varianty Scout a Maverick; Behemoth (cca 2T parametrov) bol oznámený ako tréningový frontier model s obmedzeným prístupom.
3. Technické detaily, ktoré ťa reálne budú zaujímať
- Architektúra: Llama 3.x je „dense" Transformer — v každom kroku sa používa celý model. Llama 4 prešla na Mixture of Experts (MoE): model má viac „špecialistov" a pre každý token aktivuje len časť z nich. Výsledok: väčší model na disku, ale výrazne nižšia výpočtová záťaž pri inferenci.
- Kontextové okno:
- Llama 3.x: štandardne 128K tokenov — rádovo stovky strán textu.
- Llama 4 Scout: 10 miliónov tokenov — celé databázy kódov, archívy dokumentácie, dlhodobé konverzačné logy.
- Multimodalita:
- Llama 3.2 má vision modely (text + obrázok → text) v 11B a 90B veľkostiach.
- Llama 4 je „natively multimodal" — obraz a text sú súčasťou základného tréningu, nie add-on vrstvy pridanej neskôr.
- Aktívne vs. celkové parametre (pri MoE): Llama 4 Scout má 109B celkových parametrov, ale pri inferenci aktivuje ~17B. Llama 4 Maverick: 400B total, ~17B aktívnych. Toto je kľúčové pre pochopenie výpočtových nárokov — inference platíš za aktívne parametre, nie za celkový počet.
- Špecializované modely v rodine: Meta vydáva aj varianty optimalizované pre konkrétne úlohy — Llama Guard na bezpečnostnú moderáciu vstupov a výstupov, Prompt Guard na detekciu injection útokov, modely optimalizované na kód.
Prehľad hlavných variantov Llama:
| Vetva | Kľúčové modely | Kontext | Architektúra | Multimodalita | Typické použitie |
|---|---|---|---|---|---|
| Llama 3.1 | 8B, 70B, 405B | 128K | Dense | nie | Textové úlohy, serverové nasadenie |
| Llama 3.2 | 1B, 3B (text); 11B, 90B (vision) | 128K | Dense | 11B/90B áno | Edge/mobil, práca s obrazom |
| Llama 3.3 | 70B | 128K | Dense | nie | Efektívna alternatíva k 3.1 70B |
| Llama 4 Scout | 109B total / 17B aktívnych | 10M | MoE (16 expertov) | áno | Extrémne dlhý kontext, multimodálne úlohy |
| Llama 4 Maverick | 400B total / 17B aktívnych | 1M | MoE (128 expertov) | áno | Náročný reasoning, zložité multi-step úlohy |
| Llama 4 Behemoth | ~2T parametrov | TBD | MoE | áno | Frontierový výskum (obmedzený prístup) |
4. Dostupnosť: kde a ako to vieš použiť
- Stiahnutie váh a lokálne spustenie: Cez Hugging Face repozitáre Meta — vyžaduje odsúhlasenie licenčných podmienok, čo je štandardný online formulár. Väčšina modelov je dostupná v priebehu hodín od vydania.
- Lokálne runtime nástroje:
- llama.cpp — najrozšírenejší spôsob lokálneho behu, GGUF formát, kvantizácia, funguje aj na CPU a Apple Silicon.
- Ollama — „klikni a spusti" wrapper nad llama.cpp a ďalšími backendmi; vhodné pre vývojárov, ktorí chcú lokálne LLM bez hĺbkového operačného nastavovania.
- vLLM, TGI (Text Generation Inference) — produkčné inference servery pre serverové nasadenie s vyšším throughputom a pokročilým schedulovaním.
- LM Studio — grafické rozhranie pre lokálne testovanie modelov bez príkazového riadka.
- Cloud poskytovatelia: AWS Bedrock, Azure AI, Google Cloud Vertex, Groq, Together AI, Fireworks AI — všetci ponúkajú Llama modely ako API. Kompromis: pohodlie nasadenia verzus dáta mimo vlastnej infraštruktúry.
- Llama API od Meta: Meta prevádzkuje vlastné API pre prístup k aktuálnym modelom — dostupné priamo bez tretích strán, regionálne podmienky sa líšia.
- Meta AI v produktoch: Llama pohára Meta AI asistenta vo WhatsApp, Messengeri, Instagrame a Facebooku. V roku 2025 prebehlo rozšírenie na európske trhy.
5. Fine-tuning a prispôsobenie modelu
Fine-tuning je jedna z kľúčových výhod otvorených váh — môžeš model „doladiť" na vlastné dáta a úlohy spôsobom, ktorý pri uzatvorených API jednoducho nie je možný.
Kedy to má zmysel:
- Špecifický doménový jazyk (právo, medicína, interná firemná terminológia).
- Konzistentný štýl odpovede, ktorý base model neposkytuje.
- Naučiť model konkrétny formát výstupu (JSON schema, tabuľky, firemný template).
- Malý model priblížiť väčšiemu v konkrétnej, úzkej úlohe.
Metódy fine-tuningu:
- LoRA / QLoRA — najpopulárnejší prístup. Trénujú sa len „adaptér" vrstvy, nie celý model. QLoRA navyše kvantizuje základný model, takže celý proces beží aj na jednom spotrebiteľskom GPU (RTX 3090/4090) pre modely do ~13B parametrov.
- Full fine-tuning — celý model sa trénuje nanovo. Vyžaduje viac GPU a dát, ale môže dávať lepšie výsledky pri dostatočnom datasete.
- DPO / RLHF — používa sa na zlepšenie „správania" modelu: lepšie sledovanie inštrukcií, odmietanie nevhodných požiadaviek, preferovaný štýl odpovedí.
Praktické nástroje: Unsloth, Axolotl, TRL (Hugging Face), LLaMA-Factory — všetky natívne podporujú Llama modely a LoRA/QLoRA pipeline.
Čo treba:
- Dáta v JSONL formáte s pármi prompt/response (minimálne stovky, ideálne tisíce príkladov).
- GPU s dostatkom VRAM — pre QLoRA stačí 24 GB pre modely do ~13B.
- Hodnotenie cez benchmark sady alebo ľudské anotácie — bez merania nevieš, či sa model zlepšil alebo zhoršil.
6. Ceny a licencie: čo si všímať
- Model samotný vs. prevádzka: Váhy sú dostupné, ale výpočet nie je zadarmo. Pri lokálnom behu platíš hardvér a elektrinu; pri cloude platíš tokeny alebo GPU čas podľa cenníka poskytovateľa.
- Komunitná licencia (nie OSI open-source): Llama licencia je „source-available"/community štýl — povoľuje široké komerčné použitie, ale s podmienkami. Nejde o Apache 2.0 ani MIT.
- Klauzula pre veľké platformy: Subjekty nad 700 miliónov mesačne aktívnych používateľov musia žiadať dodatočné povolenie. Bežného vývojára alebo firmu sa to netýka, ale je to dôvod debaty o „open-source" titule.
- Rôzne licencie pre rôzne verzie: Llama 2, 3 a 4 majú mierne odlišné podmienky — vždy si prečítaj konkrétnu verziu licencie pred produkčným nasadením.
- API ceny: Menia sa a dlhodobo klesajú. Vždy kontroluj aktuálny cenník príslušného poskytovateľa, nie staré porovnania.
7. Bezpečnosť a súkromie: rozdiel medzi lokálne a v cloude
- Lokálne nasadenie = viac súkromia (ak to spravíš dobre): Citlivé texty nemusia opustiť tvoju infraštruktúru. No stále platí: logy, monitoring a zálohy môžu omylom ukladať citlivé dáta — nastav to vedome, nie náhodou.
- Cloud/API = pohodlie, ale iné riziká: Vstupy sa spracúvajú na serveroch poskytovateľa. Pravidlá logovania, retencie a prípadného použitia na tréning sa líšia provider od providera. Pred firemným nasadením si prečítaj DPA (Data Processing Agreement).
- Prompt injection: Ak robíš RAG nad dokumentmi alebo dávaš modelu nástroje, rátaj s tým, že text v dokumentoch môže obsahovať škodlivé inštrukcie. Na obranu slúžia:
- Prompt Guard — detekcia injection a jailbreak pokusov ešte pred spracovaním.
- Llama Guard — moderácia vstupov aj výstupov podľa bezpečnostných kategórií (násilie, dezinformácie, CBRN, atď.).
- Supply-chain pri váhach: Sťahuj výlučne z oficiálnych Meta repozitárov na Hugging Face. Upravené checkpointy v komunite existujú — niektoré legitímne (kvantizácia), iné nie.
- Model alignment: Inštruktážne varianty (Llama-Instruct) majú zabudované bezpečnostné správanie, ale nie je neprekonateľné. Pri citlivých aplikáciách kombinuj s guard modelmi a aplikačnou vrstvou filtrácii.
8. Porovnanie s inými otvorenými modelmi
Llama nie je jediná voľba v ekosystéme otvorených váh. Tu je orientačný obraz konkurenčného prostredia v roku 2026:
| Model | Organizácia | Výrazné veľkosti | Silné stránky | Licencia |
|---|---|---|---|---|
| Llama 4 | Meta | Scout 109B, Maverick 400B | Dlhý kontext, multimodalita, ekosystém | Llama 4 Community |
| Mistral / Mixtral | Mistral AI | 7B, 8x7B, 8x22B | Efektivita, rýchlosť, európsky vendor | Apache 2.0 / Mistral |
| Gemma 3 | Google DeepMind | 1B – 27B | Malé modely, mobilné nasadenie | Apache 2.0 |
| Qwen 3 | Alibaba | 0.6B – 235B | Ázijské jazyky, kód, veľká rodina | Apache 2.0 |
| DeepSeek V3 / R1 | DeepSeek | 671B MoE | Reasoning, kód, nízka cena inference | MIT |
| Command R+ | Cohere | 104B | RAG-optimalizovaný, enterprise nasadenie | CC-BY-NC / komerčná |
Kedy vybrať Llamu oproti alternatívam:
- Chceš najväčší a najaktívnejší ekosystém nástrojov → Llama.
- Potrebuješ striktne permisívnu licenciu (Apache/MIT) → Gemma, DeepSeek R1.
- Riešiš multilingválne úlohy s dôrazom na ázijské jazyky → Qwen.
- Priorita je inference rýchlosť pri malých modeloch → Mistral.
- Nízka cena API s dobrým reasoningom → DeepSeek.
9. Praktické tipy: kedy to použiť a ako z toho dostať lepšie výsledky
- Vyber veľkosť podľa úlohy, nie podľa ega:
- 1B/3B: jednoduché sumarizácie, klasifikácie, asistent v aplikácii, edge zariadenia.
- 8B/11B: dobrý pomer výkon/nároky; zvládne väčšinu bežných produkčných úloh.
- 70B: komplexný reasoning, dlhšie dokumenty, kód — ale vyžaduje seriózny GPU.
- Scout/Maverick: extrémne dlhý kontext, multimodálne úlohy, zložitý multi-step reasoning.
- RAG je často lepší než „nalievanie všetkého do promptu": Namiesto 200 strán dokumentácie v kontexte — RAG pipeline: embed → retrieve → generate. Lacnejšie, rýchlejšie, kontrolovateľnejšie.
- Kvantizácia umožňuje lokálne bežanie: Q4_K_M alebo Q5_K_M cez llama.cpp alebo Ollama — výrazne nižšie nároky na VRAM bez dramatickej straty kvality pre väčšinu bežných úloh.
- Štruktúrovaný prompt = lepší výstup: Nadpisy, odrážky, jasná definícia úlohy a formátu výstupu. Model pri veľkom kontexte potrebuje orientačné body, nie len „text v jednom bloku".
- Dlhý kontext ≠ automaticky lepšie odpovede: 10M tokenov kontextu je mocný nástroj, ale model stále trpí „lost in the middle" efektom — dôležité informácie vlož na začiatok alebo koniec kontextu, nie do stredu.
- Kedy Llama nie je najlepšia voľba:
- Potrebuješ garantované SLA a auditovateľné enterprise politiky → komerčné API s jasnými zmluvami.
- Chceš „klikni a hotovo" bez správy infraštruktúry → managed serving.
- Licenčné podmienky tvojho produktu vyžadujú striktne OSI open-source → Gemma alebo DeepSeek R1.
- Úloha vyžaduje absolútne state-of-the-art reasoning a otvorené modely zaostávajú → zváž frontier komerčné modely.
Zhrnutie
- Llama je praktická cesta k AI, ktorú vieš mať pod kontrolou — od lokálneho behu až po nasadenie vo vlastnom cloude.
- Llama 4 v roku 2025 posunula latku: MoE architektúra, 10M tokenov kontextu a natively multimodálne modely zmenili, čo môžeš od otvorených modelov očakávať.
- Najväčší rozdiel oproti API-only modelom je otvorenosť váh — no treba počítať s licenčnými podmienkami, vlastnou zodpovednosťou za infraštruktúru a potrebou bezpečnostnej hygieny.
- Fine-tuning je kľúčová výhoda open-weights: Môžeš model adaptovať na vlastné dáta spôsobom, ktorý pri uzatvorených API jednoducho nie je možný.
- Ekosystém okolo Llama je jej skutočná sila — nie len samotný model, ale stovky nástrojov, frameworkov a aktívna komunita, ktorá na Llame stavia reálne produkty.
- Bezpečnosť si vyrieš aktívne: Prompt Guard, Llama Guard, správne logovanie a supply-chain hygiena nie sú voliteľné pri akomkoľvek produkčnom nasadení.