OLMo 3

OLMo 3 je rodina plne otvorených jazykových modelov od Allen Institute for AI (Ai2), zameraná na chat, nástroje (tool use) a silnejšie uvažovanie. Dôležité je, že nejde len o „stiahni si váhy" — Ai2 zverejňuje celú cestu vzniku modelu (tzv. model flow): tréningové dáta, checkpointy, recepty aj medzikroky.


1. Čo to je a prečo je to podstatné

„Fully open" v praxi: OLMo 3 sa snaží byť otvorený nielen váhami modelu, ale aj tým, čo bežne nevidíš — tréningové artefakty, checkpointy a recepty, aby si vedel model nielen používať, ale aj skúmať a meniť. Predstav si to ako kuchárku, kde nedostaneš len hotové jedlo, ale aj suroviny, postup, medzikroky a poznámky z testovania. Toto je priamy kontrast voči modelom ako Llama 4 alebo Gemma 3, kde sú váhy dostupné, ale tréningové detaily ostávajú nepriehľadné.

Kto za tým stojí: Ai2 (Allen Institute for AI, neziskový výskumný inštitút v Seattli) buduje OLMo ako „glass-box" alternatívu k modelom, ktoré síce majú open-weights, ale tréningový pôvod je nejasný alebo licenčne komplikovaný. Projekt OLMo existuje od roku 2023; verzia 3 z roku 2026 prináša výrazné skoky vo výkone aj v post-training receptoch.

Rodina modelov, nie jeden kus: OLMo 3 vychádza v niekoľkých variantoch:

  • Base — základ na ďalší tréning a fine-tuning, bez špeciálneho post-trainingu,
  • Instruct — hotový na bežný chat a inštrukčné úlohy,
  • Think — post-training zameraný na náročné viac-krokové uvažovanie, matematiku a plánovanie.

Prečo to zaujíma aj bežného používateľa: ak chceš model, ktorý môžeš spustiť lokálne, prispôsobiť ho na firemné dáta, alebo potrebuješ vysvetliteľnejší pôvod (compliance, audit), OLMo 3 je práve o tejto „kontrole nad strojom".


2. Technické detaily, ktoré ťa v praxi zaujímajú

Veľkosti a architektúra: OLMo 3 je dostupný v mierkach 7B a 32B parametrov. Obe varianty používajú architektúru transformer s grouped-query attention (GQA) a RoPE pozicinálnym kódovaním.

Kontextové okno: 65 536 tokenov — prakticky to znamená, že vieš naraz tlačiť väčšie dokumenty, dlhšie konverzácie alebo viac kódu bez toho, aby model „zabúdal" hneď po pár stranách.

Tréningové dáta: základné (pre-training) modely sú trénované na Dolma 3 datasete — otvorenom korpuse textov s jasnými zdrojmi a licenciami. Post-training pre Instruct/Think sa opiera o datasety označované ako Dolci (v artefaktoch Ai2), ktoré obsahujú syntetické aj ľudsky anotované príklady konverzácií.

„Model flow" a checkpointy: Ai2 zdôrazňuje, že uvoľňuje viac než finálny model — môžeš si vybrať aj skorší checkpoint alebo zmeniť fázu, v ktorej do tréningu vstúpiš (napr. doménové mid-training dáta). Pre výskumníkov ide o unikátnu možnosť: vidíš, ako sa model menili počas tréningu, nie len výsledok.

Post-training recept (zrozumiteľne):

  • SFT (supervised fine-tuning): model sa „učí odpovedať" podľa príkladov konverzácií,
  • DPO (direct preference optimization): dolaďuje sa podľa preferencií (ktorá odpoveď je lepšia),
  • RLVR (reinforcement learning with verifiable rewards): posilnenie správania na overiteľných úlohách — najmä matematike a logike — kde existuje objektívna správna odpoveď.

Tieto kroky sú priamo viditeľné v zverejnenom lineáži modelov.

Kľúčové parametre:

Model Tréningové tokeny Vrstvy Hidden size Q heads KV heads Kontext
OLMo 3 7B 5,93T 32 4096 32 32 65 536
OLMo 3 32B 5,50T 64 5120 40 8 65 536

Praktická poznámka k hardvéru: pamäťová stopa len pre váhy v BF16 je ~14 GB pre 7B a ~64 GB pre 32B (plus overhead aktivácií). S kvantizáciou (napr. Q4_K_M) sa to dá stlačiť na ~5 GB (7B) a ~20 GB (32B), výmenou za čiastočný pokles kvality.


3. Výkonnosť a porovnanie s inými modelmi

OLMo 3 sa v benchmarkoch pohybuje konkurencieschopne voči modelom podobnej veľkosti s otvoreným prístupom. Nižšie je orientačné porovnanie na vybraných benchmarkoch — čísla sú informatívne a závisí od konkrétnej verzie a podmienok testovania.

Benchmark OLMo 3 7B OLMo 3 32B Llama 3.1 8B Mistral 7B v0.3
MMLU (0-shot) ~64 % ~74 % ~66 % ~60 %
GSM8K (8-shot) ~72 % ~84 % ~76 % ~52 %
HumanEval (pass@1) ~48 % ~62 % ~62 % ~40 %
HellaSwag ~80 % ~87 % ~82 % ~81 %
IFEval (prompt) ~68 % ~78 % ~71 % ~55 %

Čo z toho vyplýva v praxi:

  • OLMo 3 7B si drží solidné výsledky voči ôsmimiliardovým riváľom a v matematike (GSM8K) za aktuálny tréningový recept s RLVR získava body.
  • OLMo 3 32B je pre väčšinu lokálnych nasadení praktický strop — na bežných firemných úlohách, sumarizácii a kóde dosahuje výsledky blízke oveľa väčším modelom.
  • Think varianty (s predĺženým uvažovaním cez chain-of-thought) výrazne zlepšujú výsledky na matematike a viac-krokových úlohách — pri rovnakých váhach môžeš získať lepší výkon za cenu pomalšej odpovede.

4. Tréningové dáta: Dolma 3 a Dolci

Otvorenosť OLMo 3 nestojí len pri váhach — stojí pri dátach. Dolma 3 je verejne dostupný korpus, ktorý Ai2 zostavil s explicitnou dokumentáciou zdrojov (Common Crawl, The Stack, Wikipedia, arXiv, knihy a ďalšie). Každý zdroj má zdokumentovanú licenciu a spôsob spracovania.

Prečo to je prakticky dôležité:

  • Regulované odvetvia (zdravotníctvo, právo, finančníctvo) môžu overovať, aké typy textov boli v tréningových dátach zahrnuté — a argumentovať pri audite.
  • Výskumníci môžu reprodukovať a porovnávať experimenty, čo je základ vedeckej práce.
  • Fine-tuning — keď vieš, čo model videl, vieš lepšie odhadnúť, čo treba dopĺňať doménovo-špecifickými dátami.

Dolci (post-training datasety) obsahujú kombináciu synteticky generovaných konverzácií, matematických riešení a ľudsky anotovaných preferencií pre DPO fázu. Aj tieto sú buď priamo dostupné, alebo ich zloženie je zdokumentované.


5. Dostupnosť: kde to vieš reálne použiť

Open-weights distribúcia: modely a súvisiace kolekcie artefaktov sú dostupné na Hugging Face pod organizáciou allenai. Nájdeš tam oddelené kolekcie pre pre-training aj post-training artefakty, vrátane checkpointov z rôznych fáz.

Playground a demá: Ai2 prevádzkuje vlastnú webovú stránku pre OLMo s interaktívnym chatom, kde si môžeš jednotlivé varianty (Instruct, Think) priamo vyskúšať bez toho, aby si čokoľvek inštaloval.

Integrácia do existujúcich pipelines: OLMo 3 je plne kompatibilný s ekosystémom Hugging Face Transformers — do existujúcej pipeline ho zapojíš rovnako ako Llama či Mistral. Tokenizer, chat šablóny aj inference kód sú zdokumentované štandardným spôsobom.

Inference servery: model funguje s bežnými inference frameworkmi — vLLM, Ollama, llama.cpp (cez GGUF konverziu) aj TGI (Text Generation Inference). Pre produkčné nasadenie na GPU infraštruktúre odporúčame vLLM s jeho optimalizovanou pozornostnou vrstvou.


6. Ceny a licencie

Cena za model: pri open-weights modeli typicky neplatíš „za model", ale za výpočty — ak beží lokálne, platíš hardvér a elektrinu; ak v cloude, platíš za GPU čas (napr. Lambda Labs, RunPod alebo vlastná infra).

Licencia: OLMo 3 je vydaný pod Apache 2.0 licenciou — permisívna, vhodná aj pre komerčné použitie bez povinnosti zverejňovať odvodené práce.

Praktický dopad licencie:

  • Môžeš model fine-tunovať a výsledok predávať ako súčasť produktu.
  • Nie si viazaný „non-commercial only" obmedzením, ktoré trápi niektoré community licencie.
  • Na rozdiel od niektorých modelov (Meta Llama s vlastnou licenciou, Gemma s podmienkami Google) Apache 2.0 nevyžaduje špeciálne preskúmanie právnym tímom pri komerčnom nasadení.

7. Bezpečnosť a súkromie: na čo si dať pozor

Kde sa spracúvajú dáta: ak OLMo 3 spúšťaš lokálne, vstupy ostávajú u teba. Ak používaš playground alebo cudzie API, vstupy odchádzajú mimo tvoje prostredie — riaď sa podmienkami konkrétnej služby.

Tréningové dáta a memorovanie: ako pri iných LLM, aj tu platí riziko, že model môže občas „vypluť" niečo nevhodné alebo príliš podobné tréningovým textom. Pri nasadení do firmy:

  • neposielaj do promptu heslá, privátne kľúče, interné osobné údaje,
  • pri citlivých use-casoch používaj redakciu a policy vrstvy (napr. DLP nástroje).

Transparentnosť ako bezpečnostný nástroj: Ai2 pracuje na nástrojoch pre trasovanie pôvodu výstupov smerom k tréningovým dátam. Pre teba to znamená, že sa dá jednoduchšie riešiť „odkiaľ sa toto tvrdenie vzalo?" pri audite alebo pri hľadaní halucinácií — čo pri čiernych skrinkách jednoducho nie je možné.

Tool use = nové riziko: ak z OLMo 3 spravíš agenta, ktorý vie volať nástroje (API, shell príkazy, interné systémy), riziko už nie je len „zlá odpoveď", ale aj „zlá akcia". Drž sa zásad:

  • least privilege — minimálne oprávnenia pre každý nástroj,
  • sandbox pre nebezpečné operácie,
  • logovanie a schvaľovanie kritických krokov pred vykonaním.

Guardrails a content filtering: OLMo 3 Instruct má základné guardrails zabudované cez post-training, ale na úrovni otvoreného modelu sú tenšie ako pri komerčných službách. Ak nasadzuješ do prostredia s konečnými používateľmi, zvyš input/output filtering na aplikačnej vrstve.


8. Praktické tipy: kedy to použiť a kedy radšej nie

Kedy sa OLMo 3 oplatí:

  • Fine-tuning a doménové modely: Base verzia je dobrý základ, ak chceš model pre konkrétnu oblasť — interná dokumentácia, právnické texty, zákaznícka podpora v špecifickom jazyku.
  • Auditovateľné nasadenie: keď potrebuješ vysvetliť pôvod modelu a tréningový proces — regulované odvetvia, verejný sektor, výskum.
  • Náročnejšie uvažovanie: Think varianty dávajú zmysel pri úlohách typu „urob plán, skontroluj ho, oprav chyby", matematike, viac-krokovom rozhodovaní.
  • Reprodukovateľné experimenty: ak robíš výskum a potrebuješ, aby tvoje výsledky mohol niekto iný zopakovať, Dolma 3 + OLMo 3 checkpointy sú na to stvorené.

Kedy to nemusí byť ideálne:

  • Multimodál (obrázky, audio): OLMo 3 je primárne textový model.
  • Najpohodlnejší consumer chat: ak chceš hotového asistenta bez ladenia, komerčné služby (Claude, ChatGPT) majú agresívnejší product tuning, nástroje a guardrails.
  • Extrémna rýchlosť na slabom hardvéri: 32B model je náročný; pre nízku latenciu na slabšom HW zvažuj 7B alebo kvantizovanú verziu.

Ako z toho dostať lepšie výsledky:

  • Jasná rola + formát výstupu: „Si asistent pre interný IT helpdesk. Odpovedaj v bodoch: Diagnóza / Kroky / Riziká."
  • Daj mu kontext, ale nie balast: pri 65k kontexte je lákavé nalepiť všetko — lepšie funguje selekcia relevantných častí a sumarizácií.
  • Pre nástroje urob „zmluvu": presný JSON formát pre tool-calls, validácia, fallback keď chýbajú dáta.
  • Think variant pre zložité úlohy: ak riešiš problém s viacerými krokmi, zmeň na Think variantu — model si „premyslí" riešenie pred tým, ako ho vypíše, čo viditeľne zlepšuje kvalitu.

Zhrnutie

OLMo 3 je v roku 2026 jednou z mála skutočne otvorených alternatív — otvorených nielen váhami, ale aj dátami, checkpointmi a post-training receptmi. Rodina pokrýva mierky 7B a 32B s kontextom 65 536 tokenov, vo variantoch Base, Instruct a Think. Licencia Apache 2.0 umožňuje komerčné použitie bez právnych komplikácií.

Najviac z neho vyťažíš, keď chceš kontrolu, auditovateľnosť a možnosť úprav — fine-tuning, agentické nasadenia, regulované odvetvia. Nie je to ideálna voľba pre tých, ktorí hľadajú len ďalší chatbot bez ladenia. Pri nasadení riešiš najmä privacy vstupov, riziká okolo tool use a realistické nároky na hardvér.