Falcon

Falcon je rodina veľkých jazykových modelov od Technology Innovation Institute (TII) v Abú Zabí. Modely si vieš stiahnuť a prevádzkovať vo vlastnej infraštruktúre – od kompaktných variantov spustiteľných na bežnom laptopu až po obrovské verzie vyžadujúce serverový výkon. Používajú sa na chat, sumarizáciu, extrakciu informácií, generovanie textu a v niektorých vetvách aj na multimodálne úlohy. V roku 2025 TII rozšírilo rodinu o Falcon H1 – sériu modelov na novej hybridnej architektúre, ktorá výrazne posúva pomer výkon/cena inference.


1. Čo to je a prečo je to podstatné

Falcon si predstav ako „rodinu motorov" pre textové aplikácie: rovnaký základ (generovanie a porozumenie textu), ale rôzne veľkosti a zamerania podľa toho, či chceš nízku cenu inference, dlhší kontext alebo vyšší výkon.

Prečo open-weights modely vôbec riešiť?

Komerčné API (OpenAI, Anthropic, Google) sú pohodlné, ale máš nad nimi obmedzenú kontrolu – dáta odchádzajú mimo tvoju infraštruktúru, ceny sa menia a pri výpadku API si odkázaný na dodávateľa. Falcon (a podobné open-weights modely) ti dáva iný kompromis:

  • Súkromie a dátová suverenita – vstupy a výstupy ostávajú v tvojej sieti.
  • Predvídateľné náklady – platíš za HW/cloud compute, nie za token.
  • Možnosť doladenia – môžeš model trénovať na vlastných dátach bez prístupu tretej strany.
  • Offline nasadenie – funguje aj bez pripojenia na internet, čo je kľúčové pre niektoré priemyselné scenáre.

Nevýhoda? Sám zodpovedáš za prevádzku, aktualizácie, bezpečnosť a hardware.


2. Prehľad generácií modelov

Falcon prešiel od svojho vzniku v roku 2023 niekoľkými generáciami. Každá prináša výrazné vylepšenia v kontexte, efektivite a schopnostiach.

Model / vetva Veľkosť Kontext Tréning (tokeny) Architektúra Poznámka
Falcon 1 – 7B 7B 2 048 1,5T Decoder-only (MQA) Historická referencia; dnes prekonaná
Falcon 1 – 40B 40B 2 048 1T Decoder-only (MQA) Silný model pri vydaní (2023)
Falcon 1 – 180B 180B 2 048 3,5T Decoder-only (MQA) Veľmi náročný na HW
Falcon 2 – 11B 11B 8 192 >5T Decoder-only (GQA) Dobrý kompromis; existuje VLM variant
Falcon 3 – 1B/3B/7B/10B 1–10B 32 768 14T Decoder-only (GQA) Moderná séria, dlhý kontext, dec. 2024
Falcon H1 – 0.5B–34B 0,5–34B 256K+ Hybrid Mamba-2 + Attention Nová arch.; výrazne nižšia pamäť pri inference

Vysvetlenie skratiek:

  • MQA (Multi-Query Attention) – zrýchľuje inference, šetrí KV-cache.
  • GQA (Grouped Query Attention) – lepší kompromis medzi rýchlosťou a kvalitou.
  • Hybrid Mamba-2 + Attention – pozri sekciu 4 o Falcon H1.

3. Technické detaily, ktoré ťa v praxi zaujímajú

Architektúra. Väčšina Falcon modelov sú decoder-only transformery (podobné GPT), optimalizované na generovanie textu. Od generácie Falcon 2 sa používa Grouped Query Attention, čo znižuje pamäťové nároky pri inference.

Kontextové okno. Falcon 3 prináša 32K tokenov – to znamená, že model dokáže naraz spracovať dlhý dokument, transkripty stretnutí alebo rozsiahlu databázu FAQ. Falcon 1 bol limitovaný na 2 048 tokenov, čo bolo pri mnohých reálnych use-case výrazné obmedzenie.

Varianty modelov. Pri každej generácii nájdeš minimálne dve verzie:

  • Base – surový predtrénovaný model, vhodný na vlastné doladenie (fine-tuning).
  • Instruct – doladený na nasledovanie pokynov (instruction-following). Na bežné chat/asistent scenáre chceš vždy Instruct.

Falcon 2 VLM. Falcon 2 11B má aj multimodálnu vetvu (Vision-Language Model), ktorá dokáže spracovávať obrázky spolu s textom – napríklad popis fotografie, analýza diagramov alebo extrakcia informácií z naskenovaných dokumentov.

Jazyková podpora. Falcon 3 10B je explicitne trénovaný na štyri jazyky (angličtina, francúzština, španielčina, portugalčina). Falcon 2 má širší jazykový mix vrátane viacerých európskych jazykov. Slovenčina nie je v žiadnom z modelov explicitne cielená – ak je kvalita slovenčiny pre teba kritická, urob si benchmark na vlastných textoch.


4. Falcon H1 – hybridná architektúra pre dlhé kontexty

V máji 2025 TII vydalo sériu Falcon H1, ktorá predstavuje najväčší architektonický skok rodiny od jej vzniku. Namiesto čistého transformer dekodera Falcon H1 kombinuje dve paradigmy:

  • Mamba-2 (State Space Model) – efektívne spracovanie dlhých sekvencií s lineárnou zložitosťou. Oproti klasickému self-attention sa pamäťové nároky pri dlhom kontexte nerastú kvadraticky, ale lineárne.
  • Klasický Attention – zachovaný pre úlohy, kde je potrebná presná „pozornosť" na konkrétne tokeny v kontexte.

Prečo to je dôležité v praxi?

Klasické transformery majú kvadratickú zložitosť pri self-attention – čím dlhší kontext, tým exponenciálne viac pamäte. Hybridný model tento problém výrazne zmierňuje. Falcon H1 dokáže pracovať s kontextovými oknami nad 256K tokenov pri oveľa nižšej pamäťovej stope oproti čistým transformerom rovnakej veľkosti.

Dostupné veľkosti Falcon H1: 0,5B, 1,5B, 7B, 34B – všetky v Base aj Instruct variante na Hugging Face.

Kedy Falcon H1 dáva zmysel:

  • Potrebuješ spracovať veľmi dlhé dokumenty (zmluvy, technická dokumentácia, výskumné správy).
  • Máš obmedzené GPU VRAM, ale potrebuješ dlhý kontext.
  • Chceš modernejšiu architektúru s potenciálom lepšej efektivity pri fine-tuningu.

Pozor: Hybridné SSM modely sa správajú mierne odlišne od čistých transformerov pri niektorých typoch úloh (napr. presné kopírovanie, counting). Pred nasadením otestuj na tvojich konkrétnych dátach.


5. Dostupnosť a nasadenie

Kde stiahneš modely. Všetky generácie Falcon nájdeš v repozitároch TII na Hugging Face (tiiuae/falcon-*). Každý model má README s licenčnými podmienkami a odporúčaným hardwarom.

Rýchly štart bez integrácie. Niekoľko Falcon modelov (najmä Falcon 3) je dostupných cez Ollama – jednoduchý nástroj na lokálne spustenie LLM príkazom ollama run falcon3. Vhodné na rýchle otestovanie správania bez programátorskej integrácie.

Produkčná integrácia. Pre produkčné nasadenie sa Falcon bežne kombinuje s:

  • Hugging Face Transformers / TGI (Text Generation Inference) – optimalizovaný server pre inference, podporuje batching, streaming, kvantizáciu.
  • vLLM – populárna alternatíva k TGI, výborne škáluje na viacerých GPU.
  • llama.cpp / GGUF – pre CPU inference alebo nízkopamäťové scenáre (Falcon 3 modely sú dostupné v GGUF kvantizáciách na Hugging Face).

Odporúčané HW minimum (orientačne):

Model VRAM (FP16) Bežná konfigurácia
Falcon 3 – 1B ~3 GB Laptop s dedikovanou GPU, Apple Silicon
Falcon 3 – 7B ~14 GB RTX 3080/4070, Apple M2 Pro+
Falcon 3 – 10B ~20 GB RTX 4090, A100 (40 GB)
Falcon 2 – 11B ~22 GB RTX 4090, A100
Falcon H1 – 7B ~14 GB Porovnateľné s Falcon 3 7B
Falcon H1 – 34B ~68 GB 2× A100 alebo H100

Pri kvantizácii (4-bit, 8-bit) sú VRAM požiadavky výrazne nižšie – napr. Falcon 3 10B v Q4 sa zmestí do ~6 GB.


6. Fine-tuning: doladenie na vlastné dáta

Jednou z hlavných výhod open-weights modelu je možnosť doladenia (fine-tuningu) na vlastnom datasete bez posielania dát tretej strane.

Kedy fine-tuning dáva zmysel:

  • Chceš model, ktorý hovorí „hlasom" tvojej firmy alebo domény (napr. právnická terminológia, interné procesy).
  • Instruct model generuje príliš generické odpovede na tvoje špecifické úlohy.
  • Potrebuješ, aby model konzistentne dodržiaval konkrétny formát výstupu.

Kedy fine-tuning nedáva zmysel:

  • Úlohu vieš vyriešiť dobrým system promptom alebo few-shot príkladmi v kontexte – ušetríš čas aj náklady.
  • Nemáš kvalitný dataset (aspoň niekoľko stovák príkladov).

Bežné metódy:

  • LoRA / QLoRA – parameter-efficient fine-tuning; trénuješ iba malú sadu adaptérových váh, pôvodný model ostáva nezmenený. Zvládnuteľné aj na jednom A100.
  • SFT (Supervised Fine-Tuning) – priame doladenie na pároch otázka-odpoveď alebo inštrukcia-výstup.
  • Continued Pre-Training – pokračovanie predtrénovania na doménovom texte (napr. slovenská legislatíva, technická dokumentácia).

Pre Falcon 3 a H1 modely sú dostupné trénovacie skripty kompatibilné s Hugging Face TRL knižnicou.


7. Ceny a licencie

Cena za stiahnutie. Samotné stiahnutie a použitie váh je bez priameho poplatku. Platíš za compute (vlastný HW alebo cloud instance).

Licenčný rámec. Falcon používa TII Falcon LLM License (vychádzajúca z Apache 2.0) doplnenú o Acceptable Use Policy. Kľúčové body:

  • Interné firemné nasadenie a vlastné aplikácie sú bežne povolené bez osobitného súhlasu.
  • Poskytovanie modelu ako verejnej hosted inference/fine-tuning služby (model-as-a-service pre tretie strany) môže pre niektoré vetvy (najmä väčšie modely) vyžadovať osobitné povolenie od TII.
  • Použitie v citlivých oblastiach (zbrane, dezinformácie, nelegálny obsah) je zakázané cez Acceptable Use Policy.

Praktická rada: Pre interný nástroj alebo aplikáciu pre vlastných zamestnancov/zákazníkov na vlastnej infraštruktúre je situácia typicky priamočiara. Ak plánuješ prevádzkovať Falcon ako zdieľané API pre externých klientov, skontaktuj TII alebo si detailne prečítaj licenciu pre konkrétny model.


8. Bezpečnosť a súkromie

Model je len „motor" – bezpečnosť a súkromie závisí od toho, kde beží a čo doň posielaš.

Lokálne vs. cloud inference. Ak Falcon beží on-prem, vstupy a výstupy ostávajú v tvojej infraštruktúre. Ak ho voláš cez cudziu hosted službu, dáta odchádzajú mimo tvoju kontrolu – rovnaké pravidlá ako pri OpenAI alebo Anthropic API.

Bias a halucinácie. Tréningové dáta pochádzajú prevažne z webu, čo znamená, že model môže niesť predsudky, stereotypy alebo generovať nepresné informácie. Pre produkčné nasadenie odporúčame:

  • Testovanie na reprezentatívnych vstupoch z tvojej domény pred spustením.
  • Kontrolné vrstvy na výstupoch (content filtering, faktická verifikácia pre kritické informácie).
  • Human-in-the-loop pre vysokorizikové rozhodnutia.

Citlivé domény. Pre zdravotníctvo, právo, financie a aplikácie pre deti sú vyžadované jasné pravidlá, logovanie incidentov a mechanizmy odvolania/opravy výstupov – toto platí bez ohľadu na to, aký LLM používaš.


9. Praktické tipy: kedy Falcon použiť a ako z neho dostať viac

Vyber si správnu generáciu a veľkosť:

  • Falcon H1 (0,5B–7B): Ak potrebuješ dlhý kontext (desiatky až stovky tisíc tokenov) na obmedzenej VRAM – toto je dnes najlepšia voľba v rodine.
  • Falcon 3 (1B–10B): Moderná séria pre štandardné use-case s 32K kontextom. Dobrý pomer výkon/cena na väčšinu bežných úloh.
  • Falcon 2 11B: Stále relevantný, najmä ak potrebuješ VLM (multimodálnu) schopnosť spolu s textom.
  • Falcon 180B: Len ak máš vážny dôvod a zodpovedajúci HW. Pre väčšinu tímov lepšie alternatívy existujú.

Prompt engineering pred fine-tuningom. Skôr než investuješ čas do doladenia, skús najprv quality system prompt s príkladmi (few-shot). Falcon Instruct modely reagujú dobre na štruktúrované pokyny s jasnými inštrukciami, formátom výstupu a príkladmi.

Dlhý kontext ≠ automaticky lepší výsledok. Aj keď Falcon 3 zvládne 32K tokenov, model reaguje presnejšie, keď mu dáš štruktúru: nadpisy, odrážky, jasné otázky. Nekopíruj do kontextu „všetko čo máš" – filtruj relevantný obsah.

Slovenčina – realistické očakávania. Žiadny Falcon model nemá slovenčinu ako primárny jazyk. Falcon 2 má širší európsky mix, Falcon 3 je explicitne zameraný na EN/FR/ES/PT. V praxi to znamená, že slovenčina funguje primerane na bežné texty, ale pre náročné úlohy (generovanie dlhých textov, právna terminológia, kreatívne písanie) môžeš narážať na chyby. Odporúčame: urob si benchmark na 20–30 vzorových vstupoch z tvojej domény a porovnaj výsledky s alternatívami.


Zhrnutie

  • Falcon je rodina open-weights LLM od TII – od kompaktných modelov (Falcon 3, H1) po obrovské (Falcon 180B). Najsilnejšia stránka: prevádzka vo vlastnej infraštruktúre s plnou dátovou kontrolou.
  • Falcon H1 (2025) prináša hybridnú Mamba-2 + Attention architektúru s extrémne dlhým kontextom (256K+) a nižšou pamäťovou stopou – podstatný pokrok pre use-case s dlhými dokumentmi.
  • Falcon 3 je dnes solídna voľba pre štandardné scenáre: 32K kontext, moderná architektúra, dostupná aj cez Ollama na rýchle testovanie.
  • Licencie sú Apache-like, ale čítaj Acceptable Use Policy – hosting ako verejné API pre tretie strany môže vyžadovať osobitné povolenie.
  • Slovenčina nie je explicitne cielená – vždy si urob vlastný benchmark na reprezentatívnych dátach.