Falcon
Falcon je rodina veľkých jazykových modelov od Technology Innovation Institute (TII) v Abú Zabí. Modely si vieš stiahnuť a prevádzkovať vo vlastnej infraštruktúre – od kompaktných variantov spustiteľných na bežnom laptopu až po obrovské verzie vyžadujúce serverový výkon. Používajú sa na chat, sumarizáciu, extrakciu informácií, generovanie textu a v niektorých vetvách aj na multimodálne úlohy. V roku 2025 TII rozšírilo rodinu o Falcon H1 – sériu modelov na novej hybridnej architektúre, ktorá výrazne posúva pomer výkon/cena inference.
1. Čo to je a prečo je to podstatné
Falcon si predstav ako „rodinu motorov" pre textové aplikácie: rovnaký základ (generovanie a porozumenie textu), ale rôzne veľkosti a zamerania podľa toho, či chceš nízku cenu inference, dlhší kontext alebo vyšší výkon.
Prečo open-weights modely vôbec riešiť?
Komerčné API (OpenAI, Anthropic, Google) sú pohodlné, ale máš nad nimi obmedzenú kontrolu – dáta odchádzajú mimo tvoju infraštruktúru, ceny sa menia a pri výpadku API si odkázaný na dodávateľa. Falcon (a podobné open-weights modely) ti dáva iný kompromis:
- Súkromie a dátová suverenita – vstupy a výstupy ostávajú v tvojej sieti.
- Predvídateľné náklady – platíš za HW/cloud compute, nie za token.
- Možnosť doladenia – môžeš model trénovať na vlastných dátach bez prístupu tretej strany.
- Offline nasadenie – funguje aj bez pripojenia na internet, čo je kľúčové pre niektoré priemyselné scenáre.
Nevýhoda? Sám zodpovedáš za prevádzku, aktualizácie, bezpečnosť a hardware.
2. Prehľad generácií modelov
Falcon prešiel od svojho vzniku v roku 2023 niekoľkými generáciami. Každá prináša výrazné vylepšenia v kontexte, efektivite a schopnostiach.
| Model / vetva | Veľkosť | Kontext | Tréning (tokeny) | Architektúra | Poznámka |
|---|---|---|---|---|---|
| Falcon 1 – 7B | 7B | 2 048 | 1,5T | Decoder-only (MQA) | Historická referencia; dnes prekonaná |
| Falcon 1 – 40B | 40B | 2 048 | 1T | Decoder-only (MQA) | Silný model pri vydaní (2023) |
| Falcon 1 – 180B | 180B | 2 048 | 3,5T | Decoder-only (MQA) | Veľmi náročný na HW |
| Falcon 2 – 11B | 11B | 8 192 | >5T | Decoder-only (GQA) | Dobrý kompromis; existuje VLM variant |
| Falcon 3 – 1B/3B/7B/10B | 1–10B | 32 768 | 14T | Decoder-only (GQA) | Moderná séria, dlhý kontext, dec. 2024 |
| Falcon H1 – 0.5B–34B | 0,5–34B | 256K+ | – | Hybrid Mamba-2 + Attention | Nová arch.; výrazne nižšia pamäť pri inference |
Vysvetlenie skratiek:
- MQA (Multi-Query Attention) – zrýchľuje inference, šetrí KV-cache.
- GQA (Grouped Query Attention) – lepší kompromis medzi rýchlosťou a kvalitou.
- Hybrid Mamba-2 + Attention – pozri sekciu 4 o Falcon H1.
3. Technické detaily, ktoré ťa v praxi zaujímajú
Architektúra. Väčšina Falcon modelov sú decoder-only transformery (podobné GPT), optimalizované na generovanie textu. Od generácie Falcon 2 sa používa Grouped Query Attention, čo znižuje pamäťové nároky pri inference.
Kontextové okno. Falcon 3 prináša 32K tokenov – to znamená, že model dokáže naraz spracovať dlhý dokument, transkripty stretnutí alebo rozsiahlu databázu FAQ. Falcon 1 bol limitovaný na 2 048 tokenov, čo bolo pri mnohých reálnych use-case výrazné obmedzenie.
Varianty modelov. Pri každej generácii nájdeš minimálne dve verzie:
- Base – surový predtrénovaný model, vhodný na vlastné doladenie (fine-tuning).
- Instruct – doladený na nasledovanie pokynov (instruction-following). Na bežné chat/asistent scenáre chceš vždy Instruct.
Falcon 2 VLM. Falcon 2 11B má aj multimodálnu vetvu (Vision-Language Model), ktorá dokáže spracovávať obrázky spolu s textom – napríklad popis fotografie, analýza diagramov alebo extrakcia informácií z naskenovaných dokumentov.
Jazyková podpora. Falcon 3 10B je explicitne trénovaný na štyri jazyky (angličtina, francúzština, španielčina, portugalčina). Falcon 2 má širší jazykový mix vrátane viacerých európskych jazykov. Slovenčina nie je v žiadnom z modelov explicitne cielená – ak je kvalita slovenčiny pre teba kritická, urob si benchmark na vlastných textoch.
4. Falcon H1 – hybridná architektúra pre dlhé kontexty
V máji 2025 TII vydalo sériu Falcon H1, ktorá predstavuje najväčší architektonický skok rodiny od jej vzniku. Namiesto čistého transformer dekodera Falcon H1 kombinuje dve paradigmy:
- Mamba-2 (State Space Model) – efektívne spracovanie dlhých sekvencií s lineárnou zložitosťou. Oproti klasickému self-attention sa pamäťové nároky pri dlhom kontexte nerastú kvadraticky, ale lineárne.
- Klasický Attention – zachovaný pre úlohy, kde je potrebná presná „pozornosť" na konkrétne tokeny v kontexte.
Prečo to je dôležité v praxi?
Klasické transformery majú kvadratickú zložitosť pri self-attention – čím dlhší kontext, tým exponenciálne viac pamäte. Hybridný model tento problém výrazne zmierňuje. Falcon H1 dokáže pracovať s kontextovými oknami nad 256K tokenov pri oveľa nižšej pamäťovej stope oproti čistým transformerom rovnakej veľkosti.
Dostupné veľkosti Falcon H1: 0,5B, 1,5B, 7B, 34B – všetky v Base aj Instruct variante na Hugging Face.
Kedy Falcon H1 dáva zmysel:
- Potrebuješ spracovať veľmi dlhé dokumenty (zmluvy, technická dokumentácia, výskumné správy).
- Máš obmedzené GPU VRAM, ale potrebuješ dlhý kontext.
- Chceš modernejšiu architektúru s potenciálom lepšej efektivity pri fine-tuningu.
Pozor: Hybridné SSM modely sa správajú mierne odlišne od čistých transformerov pri niektorých typoch úloh (napr. presné kopírovanie, counting). Pred nasadením otestuj na tvojich konkrétnych dátach.
5. Dostupnosť a nasadenie
Kde stiahneš modely. Všetky generácie Falcon nájdeš v repozitároch TII na Hugging Face (tiiuae/falcon-*). Každý model má README s licenčnými podmienkami a odporúčaným hardwarom.
Rýchly štart bez integrácie. Niekoľko Falcon modelov (najmä Falcon 3) je dostupných cez Ollama – jednoduchý nástroj na lokálne spustenie LLM príkazom ollama run falcon3. Vhodné na rýchle otestovanie správania bez programátorskej integrácie.
Produkčná integrácia. Pre produkčné nasadenie sa Falcon bežne kombinuje s:
- Hugging Face Transformers / TGI (Text Generation Inference) – optimalizovaný server pre inference, podporuje batching, streaming, kvantizáciu.
- vLLM – populárna alternatíva k TGI, výborne škáluje na viacerých GPU.
- llama.cpp / GGUF – pre CPU inference alebo nízkopamäťové scenáre (Falcon 3 modely sú dostupné v GGUF kvantizáciách na Hugging Face).
Odporúčané HW minimum (orientačne):
| Model | VRAM (FP16) | Bežná konfigurácia |
|---|---|---|
| Falcon 3 – 1B | ~3 GB | Laptop s dedikovanou GPU, Apple Silicon |
| Falcon 3 – 7B | ~14 GB | RTX 3080/4070, Apple M2 Pro+ |
| Falcon 3 – 10B | ~20 GB | RTX 4090, A100 (40 GB) |
| Falcon 2 – 11B | ~22 GB | RTX 4090, A100 |
| Falcon H1 – 7B | ~14 GB | Porovnateľné s Falcon 3 7B |
| Falcon H1 – 34B | ~68 GB | 2× A100 alebo H100 |
Pri kvantizácii (4-bit, 8-bit) sú VRAM požiadavky výrazne nižšie – napr. Falcon 3 10B v Q4 sa zmestí do ~6 GB.
6. Fine-tuning: doladenie na vlastné dáta
Jednou z hlavných výhod open-weights modelu je možnosť doladenia (fine-tuningu) na vlastnom datasete bez posielania dát tretej strane.
Kedy fine-tuning dáva zmysel:
- Chceš model, ktorý hovorí „hlasom" tvojej firmy alebo domény (napr. právnická terminológia, interné procesy).
- Instruct model generuje príliš generické odpovede na tvoje špecifické úlohy.
- Potrebuješ, aby model konzistentne dodržiaval konkrétny formát výstupu.
Kedy fine-tuning nedáva zmysel:
- Úlohu vieš vyriešiť dobrým system promptom alebo few-shot príkladmi v kontexte – ušetríš čas aj náklady.
- Nemáš kvalitný dataset (aspoň niekoľko stovák príkladov).
Bežné metódy:
- LoRA / QLoRA – parameter-efficient fine-tuning; trénuješ iba malú sadu adaptérových váh, pôvodný model ostáva nezmenený. Zvládnuteľné aj na jednom A100.
- SFT (Supervised Fine-Tuning) – priame doladenie na pároch otázka-odpoveď alebo inštrukcia-výstup.
- Continued Pre-Training – pokračovanie predtrénovania na doménovom texte (napr. slovenská legislatíva, technická dokumentácia).
Pre Falcon 3 a H1 modely sú dostupné trénovacie skripty kompatibilné s Hugging Face TRL knižnicou.
7. Ceny a licencie
Cena za stiahnutie. Samotné stiahnutie a použitie váh je bez priameho poplatku. Platíš za compute (vlastný HW alebo cloud instance).
Licenčný rámec. Falcon používa TII Falcon LLM License (vychádzajúca z Apache 2.0) doplnenú o Acceptable Use Policy. Kľúčové body:
- Interné firemné nasadenie a vlastné aplikácie sú bežne povolené bez osobitného súhlasu.
- Poskytovanie modelu ako verejnej hosted inference/fine-tuning služby (model-as-a-service pre tretie strany) môže pre niektoré vetvy (najmä väčšie modely) vyžadovať osobitné povolenie od TII.
- Použitie v citlivých oblastiach (zbrane, dezinformácie, nelegálny obsah) je zakázané cez Acceptable Use Policy.
Praktická rada: Pre interný nástroj alebo aplikáciu pre vlastných zamestnancov/zákazníkov na vlastnej infraštruktúre je situácia typicky priamočiara. Ak plánuješ prevádzkovať Falcon ako zdieľané API pre externých klientov, skontaktuj TII alebo si detailne prečítaj licenciu pre konkrétny model.
8. Bezpečnosť a súkromie
Model je len „motor" – bezpečnosť a súkromie závisí od toho, kde beží a čo doň posielaš.
Lokálne vs. cloud inference. Ak Falcon beží on-prem, vstupy a výstupy ostávajú v tvojej infraštruktúre. Ak ho voláš cez cudziu hosted službu, dáta odchádzajú mimo tvoju kontrolu – rovnaké pravidlá ako pri OpenAI alebo Anthropic API.
Bias a halucinácie. Tréningové dáta pochádzajú prevažne z webu, čo znamená, že model môže niesť predsudky, stereotypy alebo generovať nepresné informácie. Pre produkčné nasadenie odporúčame:
- Testovanie na reprezentatívnych vstupoch z tvojej domény pred spustením.
- Kontrolné vrstvy na výstupoch (content filtering, faktická verifikácia pre kritické informácie).
- Human-in-the-loop pre vysokorizikové rozhodnutia.
Citlivé domény. Pre zdravotníctvo, právo, financie a aplikácie pre deti sú vyžadované jasné pravidlá, logovanie incidentov a mechanizmy odvolania/opravy výstupov – toto platí bez ohľadu na to, aký LLM používaš.
9. Praktické tipy: kedy Falcon použiť a ako z neho dostať viac
Vyber si správnu generáciu a veľkosť:
- Falcon H1 (0,5B–7B): Ak potrebuješ dlhý kontext (desiatky až stovky tisíc tokenov) na obmedzenej VRAM – toto je dnes najlepšia voľba v rodine.
- Falcon 3 (1B–10B): Moderná séria pre štandardné use-case s 32K kontextom. Dobrý pomer výkon/cena na väčšinu bežných úloh.
- Falcon 2 11B: Stále relevantný, najmä ak potrebuješ VLM (multimodálnu) schopnosť spolu s textom.
- Falcon 180B: Len ak máš vážny dôvod a zodpovedajúci HW. Pre väčšinu tímov lepšie alternatívy existujú.
Prompt engineering pred fine-tuningom. Skôr než investuješ čas do doladenia, skús najprv quality system prompt s príkladmi (few-shot). Falcon Instruct modely reagujú dobre na štruktúrované pokyny s jasnými inštrukciami, formátom výstupu a príkladmi.
Dlhý kontext ≠ automaticky lepší výsledok. Aj keď Falcon 3 zvládne 32K tokenov, model reaguje presnejšie, keď mu dáš štruktúru: nadpisy, odrážky, jasné otázky. Nekopíruj do kontextu „všetko čo máš" – filtruj relevantný obsah.
Slovenčina – realistické očakávania. Žiadny Falcon model nemá slovenčinu ako primárny jazyk. Falcon 2 má širší európsky mix, Falcon 3 je explicitne zameraný na EN/FR/ES/PT. V praxi to znamená, že slovenčina funguje primerane na bežné texty, ale pre náročné úlohy (generovanie dlhých textov, právna terminológia, kreatívne písanie) môžeš narážať na chyby. Odporúčame: urob si benchmark na 20–30 vzorových vstupoch z tvojej domény a porovnaj výsledky s alternatívami.
Zhrnutie
- Falcon je rodina open-weights LLM od TII – od kompaktných modelov (Falcon 3, H1) po obrovské (Falcon 180B). Najsilnejšia stránka: prevádzka vo vlastnej infraštruktúre s plnou dátovou kontrolou.
- Falcon H1 (2025) prináša hybridnú Mamba-2 + Attention architektúru s extrémne dlhým kontextom (256K+) a nižšou pamäťovou stopou – podstatný pokrok pre use-case s dlhými dokumentmi.
- Falcon 3 je dnes solídna voľba pre štandardné scenáre: 32K kontext, moderná architektúra, dostupná aj cez Ollama na rýchle testovanie.
- Licencie sú Apache-like, ale čítaj Acceptable Use Policy – hosting ako verejné API pre tretie strany môže vyžadovať osobitné povolenie.
- Slovenčina nie je explicitne cielená – vždy si urob vlastný benchmark na reprezentatívnych dátach.