LLaMA

LLaMA/Llama je rodina veľkých jazykových modelov od Meta, pri ktorých je kľúčová myšlienka „otvorené váhy": model si vieš stiahnuť, nasadiť na vlastnom hardvéri a prispôsobiť ho. V praxi to znamená viac kontroly nad nákladmi, súkromím aj nad tým, čo presne model robí.


1. Čo to je a prečo je to podstatné

  • Nie úplne open-source: Okolo Llama je dôležitá nuansa: „open-weights" neznamená automaticky open-source v zmysle OSI. Licencia má podmienky a obmedzenia, ktoré pri klasickom open-source softvéri nebývajú — napriek tomu je Llama jedna z najvoľnejšie dostupných rodín frontier modelov na svete.
  • Ekosystém okolo modelu: Keď sú váhy dostupné mimo jedného poskytovateľa, prirodzene vzniká ekosystém nástrojov — lokálne inference, kvantizácie, RAG, fine-tuning, bezpečnostné „guard" modely, integrátory a frameworky. Ekosystém okolo Llama je jeden z najaktívnejších v branži, prirovnateľný k ekosystému okolo PyTorch.
  • Referenčná úroveň v branži: Llama modely sa bežne používajú ako baseline pri porovnávaní iných modelov — keď niekto tvrdí, že jeho model „prekonáva Llamu", vieš, čo to v praxi znamená.
  • Prečo ťa to zaujme: Ak riešiš firemné dokumenty, interný chatbot, asistenta v aplikácii alebo automatizácie, Llama je často cesta, ako to spraviť bez toho, aby si všetko posielal do cudzieho cloudu.

2. História a vývoj: od Llama 1 po Llama 4

Llama si prešla rýchlou evolúciou od prvého vydania v roku 2023 po dnešné multimodálne MoE modely.

  • Llama 1 (február 2023): Prvá verejná rodina — dostupná len pre výskum, ale únik váh na internet spustil masívnu vlnu komunitného vývoja. Modely od 7B do 65B parametrov.
  • Llama 2 (júl 2023): Komerčné použitie povolené, lepšie výsledky, modely s RLHF ladením (Llama 2-Chat). Prvá verzia s jasnejšími bezpečnostnými guardrails.
  • Llama 3 / 3.1 / 3.2 / 3.3 (2024): Dramatický skok v kvalite. Llama 3.1 405B bola prvý otvorený model, ktorý sa reálne meral s GPT-4 úrovňou na mnohých benchmarkoch. Llama 3.2 priniesla multimodalitu (vision) a malé modely pre edge a mobilné zariadenia. Llama 3.3 70B ponúkla výkonnosť veľkých modelov v kompaktnejšom balení.
  • Llama 4 (apríl 2025): Prechod na Mixture of Experts architektúru, natively multimodálne, dramaticky dlhší kontext. Vydané varianty Scout a Maverick; Behemoth (cca 2T parametrov) bol oznámený ako tréningový frontier model s obmedzeným prístupom.

3. Technické detaily, ktoré ťa reálne budú zaujímať

  • Architektúra: Llama 3.x je „dense" Transformer — v každom kroku sa používa celý model. Llama 4 prešla na Mixture of Experts (MoE): model má viac „špecialistov" a pre každý token aktivuje len časť z nich. Výsledok: väčší model na disku, ale výrazne nižšia výpočtová záťaž pri inferenci.
  • Kontextové okno:
    • Llama 3.x: štandardne 128K tokenov — rádovo stovky strán textu.
    • Llama 4 Scout: 10 miliónov tokenov — celé databázy kódov, archívy dokumentácie, dlhodobé konverzačné logy.
  • Multimodalita:
    • Llama 3.2 má vision modely (text + obrázok → text) v 11B a 90B veľkostiach.
    • Llama 4 je „natively multimodal" — obraz a text sú súčasťou základného tréningu, nie add-on vrstvy pridanej neskôr.
  • Aktívne vs. celkové parametre (pri MoE): Llama 4 Scout má 109B celkových parametrov, ale pri inferenci aktivuje ~17B. Llama 4 Maverick: 400B total, ~17B aktívnych. Toto je kľúčové pre pochopenie výpočtových nárokov — inference platíš za aktívne parametre, nie za celkový počet.
  • Špecializované modely v rodine: Meta vydáva aj varianty optimalizované pre konkrétne úlohy — Llama Guard na bezpečnostnú moderáciu vstupov a výstupov, Prompt Guard na detekciu injection útokov, modely optimalizované na kód.

Prehľad hlavných variantov Llama:

Vetva Kľúčové modely Kontext Architektúra Multimodalita Typické použitie
Llama 3.1 8B, 70B, 405B 128K Dense nie Textové úlohy, serverové nasadenie
Llama 3.2 1B, 3B (text); 11B, 90B (vision) 128K Dense 11B/90B áno Edge/mobil, práca s obrazom
Llama 3.3 70B 128K Dense nie Efektívna alternatíva k 3.1 70B
Llama 4 Scout 109B total / 17B aktívnych 10M MoE (16 expertov) áno Extrémne dlhý kontext, multimodálne úlohy
Llama 4 Maverick 400B total / 17B aktívnych 1M MoE (128 expertov) áno Náročný reasoning, zložité multi-step úlohy
Llama 4 Behemoth ~2T parametrov TBD MoE áno Frontierový výskum (obmedzený prístup)

4. Dostupnosť: kde a ako to vieš použiť

  • Stiahnutie váh a lokálne spustenie: Cez Hugging Face repozitáre Meta — vyžaduje odsúhlasenie licenčných podmienok, čo je štandardný online formulár. Väčšina modelov je dostupná v priebehu hodín od vydania.
  • Lokálne runtime nástroje:
    • llama.cpp — najrozšírenejší spôsob lokálneho behu, GGUF formát, kvantizácia, funguje aj na CPU a Apple Silicon.
    • Ollama — „klikni a spusti" wrapper nad llama.cpp a ďalšími backendmi; vhodné pre vývojárov, ktorí chcú lokálne LLM bez hĺbkového operačného nastavovania.
    • vLLM, TGI (Text Generation Inference) — produkčné inference servery pre serverové nasadenie s vyšším throughputom a pokročilým schedulovaním.
    • LM Studio — grafické rozhranie pre lokálne testovanie modelov bez príkazového riadka.
  • Cloud poskytovatelia: AWS Bedrock, Azure AI, Google Cloud Vertex, Groq, Together AI, Fireworks AI — všetci ponúkajú Llama modely ako API. Kompromis: pohodlie nasadenia verzus dáta mimo vlastnej infraštruktúry.
  • Llama API od Meta: Meta prevádzkuje vlastné API pre prístup k aktuálnym modelom — dostupné priamo bez tretích strán, regionálne podmienky sa líšia.
  • Meta AI v produktoch: Llama pohára Meta AI asistenta vo WhatsApp, Messengeri, Instagrame a Facebooku. V roku 2025 prebehlo rozšírenie na európske trhy.

5. Fine-tuning a prispôsobenie modelu

Fine-tuning je jedna z kľúčových výhod otvorených váh — môžeš model „doladiť" na vlastné dáta a úlohy spôsobom, ktorý pri uzatvorených API jednoducho nie je možný.

Kedy to má zmysel:

  • Špecifický doménový jazyk (právo, medicína, interná firemná terminológia).
  • Konzistentný štýl odpovede, ktorý base model neposkytuje.
  • Naučiť model konkrétny formát výstupu (JSON schema, tabuľky, firemný template).
  • Malý model priblížiť väčšiemu v konkrétnej, úzkej úlohe.

Metódy fine-tuningu:

  • LoRA / QLoRA — najpopulárnejší prístup. Trénujú sa len „adaptér" vrstvy, nie celý model. QLoRA navyše kvantizuje základný model, takže celý proces beží aj na jednom spotrebiteľskom GPU (RTX 3090/4090) pre modely do ~13B parametrov.
  • Full fine-tuning — celý model sa trénuje nanovo. Vyžaduje viac GPU a dát, ale môže dávať lepšie výsledky pri dostatočnom datasete.
  • DPO / RLHF — používa sa na zlepšenie „správania" modelu: lepšie sledovanie inštrukcií, odmietanie nevhodných požiadaviek, preferovaný štýl odpovedí.

Praktické nástroje: Unsloth, Axolotl, TRL (Hugging Face), LLaMA-Factory — všetky natívne podporujú Llama modely a LoRA/QLoRA pipeline.

Čo treba:

  • Dáta v JSONL formáte s pármi prompt/response (minimálne stovky, ideálne tisíce príkladov).
  • GPU s dostatkom VRAM — pre QLoRA stačí 24 GB pre modely do ~13B.
  • Hodnotenie cez benchmark sady alebo ľudské anotácie — bez merania nevieš, či sa model zlepšil alebo zhoršil.

6. Ceny a licencie: čo si všímať

  • Model samotný vs. prevádzka: Váhy sú dostupné, ale výpočet nie je zadarmo. Pri lokálnom behu platíš hardvér a elektrinu; pri cloude platíš tokeny alebo GPU čas podľa cenníka poskytovateľa.
  • Komunitná licencia (nie OSI open-source): Llama licencia je „source-available"/community štýl — povoľuje široké komerčné použitie, ale s podmienkami. Nejde o Apache 2.0 ani MIT.
  • Klauzula pre veľké platformy: Subjekty nad 700 miliónov mesačne aktívnych používateľov musia žiadať dodatočné povolenie. Bežného vývojára alebo firmu sa to netýka, ale je to dôvod debaty o „open-source" titule.
  • Rôzne licencie pre rôzne verzie: Llama 2, 3 a 4 majú mierne odlišné podmienky — vždy si prečítaj konkrétnu verziu licencie pred produkčným nasadením.
  • API ceny: Menia sa a dlhodobo klesajú. Vždy kontroluj aktuálny cenník príslušného poskytovateľa, nie staré porovnania.

7. Bezpečnosť a súkromie: rozdiel medzi lokálne a v cloude

  • Lokálne nasadenie = viac súkromia (ak to spravíš dobre): Citlivé texty nemusia opustiť tvoju infraštruktúru. No stále platí: logy, monitoring a zálohy môžu omylom ukladať citlivé dáta — nastav to vedome, nie náhodou.
  • Cloud/API = pohodlie, ale iné riziká: Vstupy sa spracúvajú na serveroch poskytovateľa. Pravidlá logovania, retencie a prípadného použitia na tréning sa líšia provider od providera. Pred firemným nasadením si prečítaj DPA (Data Processing Agreement).
  • Prompt injection: Ak robíš RAG nad dokumentmi alebo dávaš modelu nástroje, rátaj s tým, že text v dokumentoch môže obsahovať škodlivé inštrukcie. Na obranu slúžia:
    • Prompt Guard — detekcia injection a jailbreak pokusov ešte pred spracovaním.
    • Llama Guard — moderácia vstupov aj výstupov podľa bezpečnostných kategórií (násilie, dezinformácie, CBRN, atď.).
  • Supply-chain pri váhach: Sťahuj výlučne z oficiálnych Meta repozitárov na Hugging Face. Upravené checkpointy v komunite existujú — niektoré legitímne (kvantizácia), iné nie.
  • Model alignment: Inštruktážne varianty (Llama-Instruct) majú zabudované bezpečnostné správanie, ale nie je neprekonateľné. Pri citlivých aplikáciách kombinuj s guard modelmi a aplikačnou vrstvou filtrácii.

8. Porovnanie s inými otvorenými modelmi

Llama nie je jediná voľba v ekosystéme otvorených váh. Tu je orientačný obraz konkurenčného prostredia v roku 2026:

Model Organizácia Výrazné veľkosti Silné stránky Licencia
Llama 4 Meta Scout 109B, Maverick 400B Dlhý kontext, multimodalita, ekosystém Llama 4 Community
Mistral / Mixtral Mistral AI 7B, 8x7B, 8x22B Efektivita, rýchlosť, európsky vendor Apache 2.0 / Mistral
Gemma 3 Google DeepMind 1B – 27B Malé modely, mobilné nasadenie Apache 2.0
Qwen 3 Alibaba 0.6B – 235B Ázijské jazyky, kód, veľká rodina Apache 2.0
DeepSeek V3 / R1 DeepSeek 671B MoE Reasoning, kód, nízka cena inference MIT
Command R+ Cohere 104B RAG-optimalizovaný, enterprise nasadenie CC-BY-NC / komerčná

Kedy vybrať Llamu oproti alternatívam:

  • Chceš najväčší a najaktívnejší ekosystém nástrojov → Llama.
  • Potrebuješ striktne permisívnu licenciu (Apache/MIT) → Gemma, DeepSeek R1.
  • Riešiš multilingválne úlohy s dôrazom na ázijské jazyky → Qwen.
  • Priorita je inference rýchlosť pri malých modeloch → Mistral.
  • Nízka cena API s dobrým reasoningom → DeepSeek.

9. Praktické tipy: kedy to použiť a ako z toho dostať lepšie výsledky

  • Vyber veľkosť podľa úlohy, nie podľa ega:
    • 1B/3B: jednoduché sumarizácie, klasifikácie, asistent v aplikácii, edge zariadenia.
    • 8B/11B: dobrý pomer výkon/nároky; zvládne väčšinu bežných produkčných úloh.
    • 70B: komplexný reasoning, dlhšie dokumenty, kód — ale vyžaduje seriózny GPU.
    • Scout/Maverick: extrémne dlhý kontext, multimodálne úlohy, zložitý multi-step reasoning.
  • RAG je často lepší než „nalievanie všetkého do promptu": Namiesto 200 strán dokumentácie v kontexte — RAG pipeline: embed → retrieve → generate. Lacnejšie, rýchlejšie, kontrolovateľnejšie.
  • Kvantizácia umožňuje lokálne bežanie: Q4_K_M alebo Q5_K_M cez llama.cpp alebo Ollama — výrazne nižšie nároky na VRAM bez dramatickej straty kvality pre väčšinu bežných úloh.
  • Štruktúrovaný prompt = lepší výstup: Nadpisy, odrážky, jasná definícia úlohy a formátu výstupu. Model pri veľkom kontexte potrebuje orientačné body, nie len „text v jednom bloku".
  • Dlhý kontext ≠ automaticky lepšie odpovede: 10M tokenov kontextu je mocný nástroj, ale model stále trpí „lost in the middle" efektom — dôležité informácie vlož na začiatok alebo koniec kontextu, nie do stredu.
  • Kedy Llama nie je najlepšia voľba:
    • Potrebuješ garantované SLA a auditovateľné enterprise politiky → komerčné API s jasnými zmluvami.
    • Chceš „klikni a hotovo" bez správy infraštruktúry → managed serving.
    • Licenčné podmienky tvojho produktu vyžadujú striktne OSI open-source → Gemma alebo DeepSeek R1.
    • Úloha vyžaduje absolútne state-of-the-art reasoning a otvorené modely zaostávajú → zváž frontier komerčné modely.

Zhrnutie

  • Llama je praktická cesta k AI, ktorú vieš mať pod kontrolou — od lokálneho behu až po nasadenie vo vlastnom cloude.
  • Llama 4 v roku 2025 posunula latku: MoE architektúra, 10M tokenov kontextu a natively multimodálne modely zmenili, čo môžeš od otvorených modelov očakávať.
  • Najväčší rozdiel oproti API-only modelom je otvorenosť váh — no treba počítať s licenčnými podmienkami, vlastnou zodpovednosťou za infraštruktúru a potrebou bezpečnostnej hygieny.
  • Fine-tuning je kľúčová výhoda open-weights: Môžeš model adaptovať na vlastné dáta spôsobom, ktorý pri uzatvorených API jednoducho nie je možný.
  • Ekosystém okolo Llama je jej skutočná sila — nie len samotný model, ale stovky nástrojov, frameworkov a aktívna komunita, ktorá na Llame stavia reálne produkty.
  • Bezpečnosť si vyrieš aktívne: Prompt Guard, Llama Guard, správne logovanie a supply-chain hygiena nie sú voliteľné pri akomkoľvek produkčnom nasadení.