Diffusion Models

Diffusion models sú generatívne AI modely, ktoré vytvárajú nové dáta (najčastejšie obrázky, čoraz viac však aj video, audio a 3D) tak, že sa naučia postupne odšumovať náhodný šum až na zmysluplný výstup. V praxi sú jadrom väčšiny moderných text-to-image systémov — Stable Diffusion, FLUX, Nano Banana 2 — a od roku 2024 dominujú aj generátorom videa (Sora, Kling, Wan) a audia (Stable Audio, Suno). Diffusion models definitívne vytlačili GAN-y z pozície štandardu v generatívnej AI pre vizuálny obsah a v roku 2026 sú základnou stavebnou jednotkou takmer celého ekosystému generatívnych médií.


1. Definícia

  • Diffusion model = generátor cez odšumovanie:
    • Začneš náhodným šumom (Gaussovský noise).
    • Model v desiatkach až stovkách krokov „uhádne", ako šum zmeniť, aby vznikol obraz (alebo audio, video…).
  • Prečo „diffusion":
    • Pri tréningu sa simuluje proces, kde sa do dát postupne pridáva šum (ako difúzia/rozptyl v fyzike — molekuly sa rozptyľujú z koncentrovaného miesta do okolia).
    • Model sa učí opačný proces: reverznú difúziu (denoising).
  • Čo sa trénuje:
    • Neurónová sieť (U-Net alebo Diffusion Transformer) sa trénuje predpovedať, aký šum bol pridaný do obrázka v danom kroku t. Takýto tréning je stabilný a škálovateľný — preto diffusion models dominujú.
  • Kde sa dnes používajú:
    • Generovanie obrázkov (Stable Diffusion, FLUX, Midjourney), videa (Sora, Kling, Wan), audia (Stable Audio, AudioLDM, Suno), 3D obsahu (RFDiffusion, DreamFusion, Zero123++) a syntetických tréningových dát pre iné modely.

2. Forward a reverse proces

  • Forward process (trénovací rozklad): zoberieš reálny obrázok x0 a postupne doň pridávaš Gaussovský šum → x1, x2, …, xT. Po T krokoch (typicky 1000) je to takmer čistý šum bez rozoznateľného obsahu.
  • Reverse process (generovanie): model sa učí predpovedať buď priamo šum ε (noise prediction), alebo čistý obraz x0 (x-prediction), alebo „smer" zmeny v priestore pravdepodobnosti (score matching). Pri generovaní začneš xT ~ N(0, I) a ideš späť xT → … → x0.

Zjednodušená denoising slučka:

x = torch.randn(shape)              # čistý šum xT
for t in reversed(range(T)):        # postupné odšumovanie
    eps = model(x, t, text_emb)     # predikuj šum v tomto kroku
    x = scheduler.step(eps, t, x)   # odober kúsok šumu
return x                            # x0 = hotový obraz

Dôležitá nuansa — predikčné ciele:

Predikčný cieľ Čo model predikuje Typické použitie
ε-prediction pridaný šum DDPM, Stable Diffusion 1.x/2.x
x0-prediction čistý obraz niektoré Consistency Models
v-prediction kombinovaný „velocity" vektor SDXL, mnohé novšie modely
flow (flow matching) vektor smeru z šumu k dátam Stable Diffusion 3, FLUX

Stochastický vs. deterministický sampling: Originálny DDPM sampling je stochastický — v každom kroku sa pridáva malá náhodná zložka, čo vedie k rozmanitejším výstupom, ale vyžaduje viac krokov. DDIM a väčšina moderných schedulerov sú deterministické — rovnaký seed vždy dá rovnaký výstup, a krokov stačí 20–50. Pri flow matching modeloch je trajektória prirodzene priamočiarejšia, čo ešte viac znižuje potrebný počet krokov.


3. Flow Matching a moderné alternatívy

Od roku 2024 sa popri klasickom DDPM formalizme presadil Flow Matching — matematicky čistejší rámec, ktorý trénuje model predpovedať priamy smer (vektor toku) medzi distribúciou šumu a distribúciou dát, namiesto šumu v konkrétnom kroku.

Prečo Flow Matching?

  • Umožňuje priamejšie (rektifikované) trajektórie → menej krokov na rovnakú kvalitu.
  • Tréning je stabilnejší a výsledky sú lepšie škálovateľné.
  • Dnes ho používa Stable Diffusion 3, FLUX.1 aj veľká väčšina frontálnych video modelov.
  • Matematická formulácia: namiesto predpovedania šumu ε model predpovedá vektorové pole v(x, t) také, že dx/dt = v(x, t) opisuje tok od x0 (dáta) k xT (šum) a späť.

Rectified Flow je konkrétna verzia flow matchingu, kde sú trajektórie cielene priamočiare (rektifikované) — výsledkom sú plynulejšie, rýchlejšie sampleovateľné cesty. Používa ho FLUX a rad video modelov.

Consistency Models sú ďalšia vetva: tréning tak, aby model vedel odšumovať v jedinom kroku (alebo vo veľmi malom počte krokov). V roku 2025–2026 sa Consistency Distillation stala štandardom pre rýchle inference — LCM (Latent Consistency Model), Turbo varianty modelov, SDXL-Turbo, Hyper-SD.

Distillation (destilácia): väčší, pomalý „teacher" model sa destiluje do menšieho/rýchlejšieho „student" modelu, ktorý zvládne generovanie v 1–8 krokoch namiesto 20–50. V roku 2026 je toto štandardný postup pre produkčné nasadenie. Existujú tri hlavné prístupy:

  • Progresívna destilácia: teacher učí studenta krok po kroku, kým student nezvládne N krokov namiesto 2N.
  • Adversariálna destilácia (ADD): pridáva diskriminátor, ktorý rozoznáva „falošné" rýchle generovanie od reálnych dát — výrazne zlepšuje kvalitu pri 1–4 krokoch. Používa ju SDXL-Lightning (ByteDance, 1–8 krokov, open weights) aj Hyper-SDXL.
  • Distribution Matching Distillation (DMD): student sa trénuje tak, aby jeho výstupná distribúcia čo najpresnejšie zodpovedala distribúcii teachera — bez potreby párových sample-ov. Nástupca ADD prístupu, objavuje sa v najnovších modeloch 2025–2026.

Prehľad rýchlych distilovaných modelov:

Model Počet krokov Metóda Licencia
SDXL-Turbo 1–4 ADD (adversarial) research
SDXL-Lightning 1–8 ADD open (ByteDance)
Hyper-SDXL 1–8 Distribution matching open
LCM (SDXL) 2–8 Consistency distillation open
FLUX.1 schnell 1–4 Guidance distillation Apache 2.0
Hyper-FLUX 1–8 Hyper distillation open
SD 3.5 Large Turbo 4 Flow matching + destilácia open weights

4. Architektúra: U-Net vs. Diffusion Transformer (DiT)

Historicky bola páteľou diffusion modelov U-Net — enkóder-dekóder sieť so skip-connections, pôvodne navrhnutá pre segmentáciu medicínskych snímok.

U-Net v diffusion kontexte:

  • Encoder komprimuje vstup do latentnej reprezentácie.
  • Decoder ho rekonštruuje, pričom skip-connections zachovávajú priestorové detaily.
  • Attention vrstvy v strede a na rôznych úrovniach umožňujú conditioning cez text.
  • Nevýhoda: konvolučné vrstvy majú obmedzené receptívne pole a ťažšie škálujú do veľkých rozlíšení.

Diffusion Transformer (DiT) — od roku 2023–2024 dominantná architektúra nových modelov:

  • Nahrádza konvolučné vrstvy U-Netu transformer blokmi (podobné Vision Transformer).
  • Obraz sa rozloží na patche (malé štvorce, typicky 2×2 alebo 4×4 pixely v latentnom priestore), každý patch je token — model pracuje s nimi ako s jazykovým modelom s tokmi.
  • Výrazne lepšie škálovanie: väčší DiT = lepší výsledok (platí zákon škálovania podobne ako pri LLM).
  • Používa ho FLUX.1, Stable Diffusion 3, PixArt, mnoho video modelov (CogVideoX, HunyuanVideo, Wan).
Vlastnosť U-Net DiT (Diffusion Transformer)
Základný blok konvolúcia + attention self-attention (transformer)
Škálovanie ťažšie (dimenzie fixnejšie) excelentné (ako LLM)
Text conditioning cross-attention cross-attention alebo MMDiT
Typické modely SD 1.5, SD 2.x, SDXL SD3, FLUX, PixArt, video modely
Pozičné kódovanie implicitné (konv.) RoPE alebo 2D sinusoid
Pamäťová náročnosť stredná vyššia (kvadratická pozornosť)
Podpora rôznych rozlíšení obmedzená prirodzená (patch-based)

MMDiT (Multimodal DiT) — variant používaný v SD3 a FLUX: text aj obraz sú rovnocenné tokeny, ktoré si navzájom dávajú pozornosť bez asymetrie cross-attention. Text "vidí" obraz a obraz "vidí" text — výsledkom je lepšie dodržiavanie komplexných promptov a prirodzenejšie zakomponovanie textu do obrázka.

Pozičné kódovanie v DiT:

  • RoPE (Rotary Position Embedding): rotuje reprezentácie podľa pozície, škáluje sa na väčšie rozlíšenia ako pri tréningu.
  • 2D sinusoidálne kódovanie: klasický prístup pre 2D mriežku patchov.
  • Extrapolácia rozlíšenia: DiT modely s RoPE vedia generovať pri väčšom rozlíšení ako pri tréningu, čo U-Net nezvláda dobre.

5. Conditioning, latent diffusion a sampling

Text conditioning a CFG:

  • Text sa zakóduje text encoderom (CLIP, T5, alebo kombinácia oboch) na sekvenciu embeddingov.
  • Novšie modely používajú duálne text encoding: FLUX.1 kombinuje CLIP-L + T5-XXL; SD3 používa CLIP-L + CLIP-G + T5-XXL. T5 encoder oveľa lepšie rozumie dlhým a gramaticky komplexným promptom ako CLIP.
  • Do modelu vstupuje cez cross-attention: obrázkové tokeny sa „pýtajú" textových tokenov, čo by mali zobrazovať.
  • Classifier-free guidance (CFG): model sa trénuje aj bez podmienky (prázdny prompt). Pri inferenci sa zmieša predikcia „bez podmienky" a „s podmienkou" s váhou w (CFG scale). Vyššie w = silnejšie drží prompt, ale riskuje presýtenie farieb a artefakty.
  • CFG-Distillation / Guidance Distillation: novšie modely (FLUX schnell) majú CFG „zapeceného" priamo do váh — nepotrebujú dvojitý forward pass, čím sa inference zrýchli 2×.

Latent diffusion:

  • Namiesto práce priamo v pixelovom priestore (napr. 1024×1024 × 3 = 3M hodnôt) sa obraz komprimuje cez VAE (Variational Autoencoder) do latentného priestoru (~8–16× menší v každej dimenzii).
  • Denoising prebieha v latente — výrazne rýchlejšie a lacnejšie.
  • Na konci VAE decoder latent rozbalí späť na pixely.
  • Stable Diffusion popularizoval tento prístup v roku 2022; dnes je štandardom.
  • VAE kvality: starší SD 1.5 VAE trpel farebným posunom; SD 3 a FLUX používajú vylepšené VAE s 16-kanálovým latentom (oproti 4-kanálovému v SD 1.5) — výrazne lepšie detaily a farebná presnosť.

Scheduler/sampler:

  • Určuje, ako sa odberá šum v každom kroku.
  • DDPM (pôvodný, 1000 krokov), DDIM (deterministický, 20–50 krokov), DPM-Solver++ (20 krokov, veľmi kvalitný), Euler, Heun.
  • Pri flow matching modeloch: FlowMatchEulerDiscrete, FlowMatchHeun.
  • Menej krokov = rýchlejšie, ale horšia kvalita (pokiaľ nie je použitá destilácia).

Ďalšie formy conditioningu:

  • img2img: vstupný obrázok sa zašumí len čiastočne (nie na xT, ale na xt kde t < T) → model ho dokončí; zachová kompozíciu, zmení štýl.
  • Inpainting / outpainting: maska určí, ktoré pixely sa prepíšu; zvyšok sa zachová.
  • ControlNet: pomocná sieť dostane hrany, hĺbkovú mapu, pose, normálovú mapu atď. a riadi priestorovú kompozíciu; od roku 2023 štandard v profesionálnom workflow. Pre FLUX existujú natívne ControlNet varianty (FLUX.1 Canny, FLUX.1 Depth) ako samostatné modely od Black Forest Labs.
  • IP-Adapter: podmieňovanie cez referenčný obrázok (štýl, tvár) bez dotrénovávania základného modelu.
  • LoRA (Low-Rank Adaptation): malý modul natrénovaný na konkrétnom štýle alebo osobe, ktorý sa pripojí k základnému modelu.
  • In-context editing (FLUX Kontext): nový prístup z roku 2025, kde sa referenčný obrázok aj cieľový obrázok vložia spolu do jednej sekvencie tokenov — model vie meniť konkrétne prvky obrázka podľa textového pokynu pri zachovaní zvyšku. V praxi ide o najdôležitejší posun v editácii obrázkov od zavedenia inpaintingu.
  • Regional prompting: rozdielne textové podmienky pre rôzne oblasti obrázka (napr. ľavá polovica = les, pravá = mesto) — realizuje sa cez attention masking alebo špecializované extensions.

6. Video Diffusion Models

Video je najnáročnejšou modalitou pre diffusion modely — k priestorovým dimenziám (výška × šírka) pribúda časová dimenzia (počet snímok). Toto výrazne zvyšuje výpočtovú náročnosť aj architektonickú zložitosť.

Kľúčové architektonické rozdiely oproti obrázkovým modelom:

  • Temporálna attention: pridáva self-attention cez časovú os — každý priestorový patch sa „pozerá" na rovnaký patch v iných snímkach. Umožňuje zachovanie konzistentnosti pohybu.
  • 3D attention (full space-time attention): tokeny sú trojrozmerné (výška × šírka × čas) a model ich všetky navzájom porovnáva. Výpočtovo drahšie, ale lepšia koherencia.
  • Kauzálna temporálna pozornosť: snímka t sa pozerá iba na predchádzajúce snímky 0…t-1, nie na budúce — umožňuje streaming generovanie a dlhšie klipy.
  • 3D VAE: namiesto 2D VAE komprimuje aj časovú dimenziu — HunyuanVideo a Wan používajú kauzálny 3D VAE, ktorý spracúva video ako jeden komprimovaný objem namiesto sekvencie obrázkov.

Tréningový postup:

  • Väčšina video modelov začína ako pretrained image model a video schopnosti sa dofajnujú pridaním temporálnych vrstiev.
  • Tréningové dáta sú rádovo väčšie (video datasety sú terabyty až petabyty).
  • Výpočtové nároky sú 10–100× vyššie ako pre obrazové modely rovnakej kvality.

AnimateDiff — animácia existujúcich image modelov: Samostatná kategória video diffusion je AnimateDiff (2023, open-source): namiesto trénovania celého video modelu od nuly sa do existujúceho image modelu (SD 1.5 alebo SDXL) vloží Motion Module — špeciálny temporal attention blok trénovaný na video dátach. Výhodou je, že akýkoľvek existujúci image LoRA alebo DreamBooth model okamžite „oživie" bez potreby video trénovania. AnimateDiff zostáva v roku 2026 populárny v komunite pre svoju modulárnosť a kompatibilitu s ekosystémom SD modelov.

Stable Video Diffusion (SVD): Stability AI vydalo SVD koncom roka 2023 ako špecializovaný image-to-video model. SVD je trénovaný na obrovskom video datasete a generuje krátke klipy (14–25 snímok) z vstupného obrázka. Architektonicky vychádza zo SDXL, no s pridaným temporálnym podmieňovaním. Silnou stránkou je konzistentnosť identity subjektu z referenčného obrázka; slabšou je schopnosť nasledovať komplexné pohybové inštrukcie.

World Foundation Models — nová kategória (2025–2026): Súbežne s kreatívnymi video generátormi sa objavila kategória world foundation models — modely trénované na fyzikálne simulovanie reálneho sveta, nie len na vytvorenie esteticky príjemného obsahu. NVIDIA Cosmos (open weights, 2025) je prototypom: model trénovaný na priemyselných videách, robotike a fyzikálnych simuláciách. Výstupy sú fyzikálne koherentnejšie než výstupy kreatívnych video modelov — objekty padajú správne, kvapaliny sa správajú realisticky. Cosmos slúži primárne ako syntetický generátor tréningových dát pre autonómne systémy a robotické agenty. Google DeepMind Genie 2 je ďalší príklad: interaktívny world model schopný generovať explorovateľné 3D prostredia z jedného obrázka.

Hlavné výzvy vo video generovaní:

  • Temporálna konzistentnosť: tváre, objekty a textúry musia zostať rovnaké naprieč snímkami.
  • Fyzikálna pravdepodobnosť: pohyb musí vyzerať realisticky — gravitácia, tuhosť telies, plynulosť kvapalín.
  • Dlhé klipy: dnešné modely spoľahlivo generujú 5–15 sekúnd; dlhšie klipy trpia drift efektom alebo stratou konzistentnosti.
  • Riadenie pohybu: ovplyvniť pohyb kamery (pan, zoom, orbit) alebo pohyb konkrétnych objektov cez text zostáva ťažké, hoci Veo 2 a Kling 2.0 tu urobili výrazný pokrok.

Prehľad video modelov v roku 2026:

Model Tvorca Prístup Charakteristika
Sora OpenAI DiT (video) Dlhé klipy, vysoká konzistentnosť
Veo 2 Google DeepMind DiT Fotorealistické video, riadenie kamery
Kling 2.0 Kuaishou DiT Dostupný komerčne; silný pohyb postáv
Wan 2.1 Alibaba DiT + kauzálny 3D VAE Open weights; 1.3B a 14B varianty; multilingválny
HunyuanVideo Tencent DiT (kauzálny) Open weights; 13B parametrov; dlhá konzistentnosť
CogVideoX Zhipu AI DiT Open weights; dobrá text adherence
LTX-Video Lightricks DiT Open weights; rýchla inference; real-time preview
Mochi 1 Genmo DiT Open weights (Apache 2.0); plynulý pohyb
Runway Gen-3 Alpha Runway proprietárny Kreativita, kamera riadenie; API
Stable Video Diffusion Stability AI U-Net + temporálny Open weights; image-to-video
AnimateDiff komunita Motion Module pre SD Open; modulárny; SD ekosystém
Cosmos NVIDIA World Foundation Model Fyzikálne simulácie, robotika; open weights
Genie 2 Google DeepMind World model Interaktívne prostredia z jedného obrázka

Štandard v roku 2026: väčšina produkčných video modelov používa DiT s kauzálnou temporálnou attention a flow matching pre sampling. Open-source ekosystém videa výrazne zaostal za ekosystémom obrazov — oveľa vyššie GPU nároky na inference (HunyuanVideo potrebuje 60+ GB VRAM), čo obmedzuje komunitu. Wan 2.1 a LTX-Video sú výnimkami — bežia na consumer GPU.


7. Audio Diffusion Models

Rovnaké princípy reverznej difúzie, ktoré fungujú pre obrázky, sa aplikujú na generovanie audia — zvukových efektov, hudby, ambientných prostrení aj syntézy reči. Audio diffusion je v roku 2026 rýchlo rastúca oblasť, hoci stále menej maturovaná ako obrazová.

Reprezentácia audia v diffusion modeloch:

Audio je zo svojej podstaty 1D signál (priebeh vlny v čase), no difúzne modely s ním typicky pracujú v jednej z troch reprezentácií:

  • Mel spektrogram: audio sa transformuje na 2D reprezentáciu (čas × frekvencia), s ktorou model pracuje podobne ako s obrázkom v odtieňoch šedej. Latentný diffusion model komprimuje spektrogram cez VAE a denoising prebieha v latente. Na konci vocoder (napr. HiFi-GAN alebo EnCodec dekóder) prevedie spektrogram späť na zvuk. Tento prístup používa AudioLDM.
  • Waveform diffusion: model pracuje priamo s priebehom vlny (1D tenzor vzoriek). WaveGrad a DiffWave sú pionierske modely; zachováva viac jemných detailov, ale je výpočtovo náročnejší.
  • Diskrétne audio tokeny (codec-based): audio sa zakóduje neuronovým kodekom (EnCodec od Meta, Descript Audio Codec / DAC) na sekvencie diskrétnych tokenov. Diffusion alebo autoregresívny model generuje tokeny; kodek ich prevedie späť na zvuk. Tento prístup dominuje v najnovších modeloch hudby a TTS.

Špecifické výzvy audio generovania:

  • Temporálna koherencia na dlhých úsekoch: hudba má štruktúru (verš, refrén, bridge) ktorú model musí zachovať cez celý klip.
  • Artefakty na spojoch segmentov: prechodové šumy a diskontinuity pri dlhšom generovaní sú časté.
  • Kontrola tempa, tóniny a inštrumentácie: textový prompt je v hudbe menej presný než vo vizuálnom obsahu.
  • Realtime streaming TTS: syntéza reči pre konverzačné aplikácie vyžaduje kauzálne architektúry s latenciou pod 200 ms.

Prehľad kľúčových modelov (2025–2026):

Model Tvorca Prístup Modalita
AudioLDM 2 CUHK Latent diffusion (mel spektrogram) Zvukové efekty, prostredia
Stable Audio 2 Stability AI Latent diffusion (komprimovaný waveform) Hudba, zvukové efekty; API
MusicGen Meta Autoregresívny + EnCodec tokeny Hudba s text a melody podmienkou; open
AudioCraft Meta Sada (MusicGen + AudioGen + EnCodec) Komplexný open-source audio framework
Suno v4 Suno AI Hybridný proprietárny Kompletné piesne s vokálmi
Udio Udio AI Hybridný proprietárny Hudba s detailnou kontrolou štýlu
VoiceBox Meta Flow matching TTS a hlasová konverzia (non-commercial)
F5-TTS / E2-TTS komunita Flow matching Open-source TTS s nízkou latenciou
Chatterbox Resemble AI Diffusion-based Open-source expresívny TTS s emóciami

Vzťah k video modelom: audio a video generovanie začínajú konvergovať — väčšina video generátorov produkuje obraz bez zvuku a pipeline-y ich kombinujú s audio diffusion modelmi v post-processingu. Ďalší vývoj smeruje k joint audio-video generation, kde jeden model generuje oba modalitné výstupy z jedného promptu.


8. 3D a priestorový obsah

Generovanie trojrozmerného obsahu je oblasť, kde diffusion modely zaznamenali medzi rokmi 2023–2026 obzvlášť rýchly pokrok. Na rozdiel od obrázkov a videa existuje pre 3D viacero konkurujúcich si reprezentácií — každá s inými výhodami pre diffusion prístup.

Reprezentácie 3D obsahu:

Reprezentácia Popis Výhody pre diffusion
NeRF (Neural Radiance Field) implicitná neurónová reprezentácia objemu ľubovoľné pohľady, differenciabilná
Gaussian Splatting (3DGS) mrak 3D gaussiánov s farbou a priehľadnosťou rýchly rendering, editovateľný
Mesh + textúra explicitná geometria s textúrnou mapou kompatibilita so štandardnými nástrojmi
Point cloud mrak bodov v 3D priestore jednoduchá štruktúra, škálovateľná
Voxel grid diskrétna 3D mriežka jednoduchá, ale pamäťovo náročná

Score Distillation Sampling (SDS) — kľúčová technika:

DreamFusion (2022, Google) zaviedol prístup, kde sa 2D diffusion model používa ako loss funkcia pre tréning 3D reprezentácie (NeRF). Ide o tzv. score distillation sampling: diffusion model hodnotí, či renderovaný pohľad na 3D scénu vyzerá ako reálna fotografia; táto spätná väzba optimalizuje NeRF. Krok za krokom:

  1. Inicializuj náhodný NeRF.
  2. Renderuj 2D pohľad z náhodného uhla.
  3. Zašumí renderovaný obraz a nechaj diffusion model predpovedať „lepší" smer.
  4. Zpätná propagácia aktualizuje NeRF.

SDS je výpočtovo náročné (hodiny aj na A100), no umožňuje text-to-3D bez akýchkoľvek 3D tréningových dát. ProlificDreamer (2023) vylepšil SDS na VSD (Variational Score Distillation) — odstraňuje preosvetlenie a over-smoothing typické pre pôvodný DreamFusion.

Multi-view generovanie — rýchlejšia cesta:

Namiesto iteratívnej optimalizácie cez SDS sa novší prístup spolieha na priame generovanie konzistentných pohľadov z viacerých uhlov:

  • Zero123 / Zero123++: diffusion model natrénovaný na generovanie nových pohľadov daného objektu z jediného vstupného obrázka. Zero123++ (2023) výrazne zlepšil konzistentnosť pohľadov.
  • MVDiffusion: generuje simultánne koherentné pohľady — model dostane jeden pohľad a predikuje niekoľko ďalších naraz, čím sa vynúti konzistentnosť.
  • One-2-3-45 / Wonder3D: pipeline, kde multi-view diffusion generuje pohľady a následná 3D rekonstrukcia (SDF alebo mesh) ich spája do 3D modelu v rádovo kratšom čase (45 sekúnd vs. hodiny pri SDS).

Gaussian Splatting + diffusion:

GaussianDreamer a DreamGaussian kombinujú Gaussian Splatting s diffusion: namiesto NeRF sa optimalizuje mrak gaussiánov, čo je výrazne rýchlejšie na rendering a editovanie. Výstupom je priamo exportovateľná 3D scéna kompatibilná s modernými game engine-mi.

Textúrovanie existujúcich 3D modelov:

Samostatná oblasť je text-to-texture — diffusion model nanesie textúru na existujúcu geometriu podľa textového promptu. TEXTure, Text2Tex a ďalšie nástroje generujú UV textúry iteratívnym projekčným prístupom: renderujú model z viacerých pohľadov, inpaintingom doplňajú textúru z každého pohľadu a výsledky spoja. Umožňuje rýchle prototypovanie 3D assetov.

Proteínový dizajn — najdôležitejšia vedecká aplikácia:

RFDiffusion (David Baker lab, 2023) je diffusion model pre návrh proteínových štruktúr. Na rozdiel od kreatívnych aplikácií tu model generuje 3D koordináty atómov tak, aby výsledná proteínová štruktúra splňala zadané funkčné požiadavky (väzba na konkrétnu molekulu, katalytická aktivita, tvar aktivného miesta). RFDiffusion v experimentoch navrhol proteíny s vlastnosťami, ktoré sa v prírode nevyskytujú — a laboratórne testy potvrdili ich funkčnosť. Tento prístup otvára cestu k de novo návrhu liečiv a enzýmov s cielenými vlastnosťami.

Nasledovníci RFDiffusion rozšírili prístup na celé molekulárne systémy — DiffDock generuje pravdepodobné pózy malých molekúl na proteíne (molekulárny docking), FrameDiff a Genie navrhujú proteíny s ešte väčšou diverzitou.

Stav ekosystému v roku 2026:

  • Text-to-3D pipeline (text → multi-view → mesh) sa dostala na úroveň využiteľnú v game dev prototypovaní; kvalita a konzistentnosť však stále zaostávajú za obrazovými modelmi.
  • Open-source nástroje: TripoSR, Shap-E (OpenAI, open weights), One-2-3-45++ sú dostupné pre komunitu.
  • Gaussian Splatting sa stala de facto štandardom pre rýchle 3D zachytávanie a editovanie scén.
  • Proteínový dizajn cez diffusion je v roku 2026 aktívna oblasť výskumu s reálnym klinickým dopadom.

9. Fine-tuning ekosystém

Trénovať diffusion model od nuly vyžaduje stovky GPU-dní a milióny dolárov. Preto existuje bohatý ekosystém fine-tuning techník, ktoré personalizujú existujúce modely s oveľa menšími zdrojmi.

LoRA (Low-Rank Adaptation):

  • Do váh modelu sa injektujú malé matice nízkej hodnoty (rank 4–128), ktoré zachytávajú špecifický štýl alebo postavu.
  • Tréning na 10–100 obrázkoch trvá hodiny na jednej GPU.
  • LoRA súbory sú malé (2–200 MB) a dajú sa kombinovať — viac LoRA naraz s rôznymi váhami.
  • DoRA (Weight-Decomposed LoRA): vylepšená verzia, ktorá separuje adaptáciu magnitúdy a smeru váh — lepšie výsledky pri rovnakých parametroch.

Varianty LoRA v ekosystéme LyCORIS:

Typ Popis Kedy použiť
LoRA základná nízkohodnostná adaptácia štýl, postava, objekt
LoCon (LoRA-Conv) LoRA aj pre konvolučné vrstvy detailnejšie textúry
LoHa (Hadamard Product) Hadamardov súčin matíc komplexnejšie štýly
LoKr (Kronecker Product) Kroneckerov súčin vysoká efektivita parametrov
DoRA dekompozícia magnitúdy a smeru najvyššia kvalita

DreamBooth:

  • Full fine-tune (alebo LoRA fine-tune) celého modelu na 3–30 obrázkoch konkrétnej osoby, zvieraťa alebo objektu.
  • Učí model nový „identifikátor" (napr. sks person) ktorý reprezentuje daný subjekt.
  • Výstup je plný model alebo LoRA; kvalita zachovania identity je vyššia ako pri IP-Adapter.

Textual Inversion:

  • Naučiť nový token (embedding) v text encoder priestore, ktorý reprezentuje štýl alebo objekt.
  • Tréning je rýchly, ale výsledky sú slabšie ako LoRA — dnes menej populárny prístup.

Hypernetwork:

  • Malá sieť generuje váhy pre attention vrstvy — staršia technika, dnes nahradená LoRA.

Nástroje na fine-tuning:

  • kohya_ss: najpopulárnejší GUI/CLI nástroj pre LoRA a DreamBooth tréning (SD 1.5, SDXL, FLUX).
  • SimpleTuner: moderný tréner so zameraním na SDXL a FLUX, dobre optimalizovaný.
  • AI Toolkit (ostris): flexibilný tréner, priamo podporovaný Black Forest Labs pre FLUX LoRA.
  • Diffusers Trainer: HuggingFace natívny tréner, vhodný pre custom pipeline.

10. Diffusion vs. GAN

Predtým dominovali generovaniu obrázkov GAN-y. Diffusion ich z veľkej časti nahradil:

Vlastnosť Diffusion GAN
Stabilita tréningu vysoká nízka (mode collapse)
Kvalita / diverzita výborná, bohatá diverzita dobrá, ale užšia
Rýchlosť generovania pomalšia (iteratívna) rýchla (jeden prechod)
Kontrola (prompt, maska) veľmi dobrá obmedzená
Škálovanie excelentné ťažšie
Tréningová dátová závislosť stredná veľká (GAN potrebuje vyvážené dáta)
Typické artefakty ruky, text, opakujúce sa vzory grid artefakty, farbové bloby
Fine-tuning ekosystém bohatý (LoRA, DreamBooth, …) obmedzený

GAN-y zostávajú relevantné v niektorých nišách (real-time super-resolution, video upscaling, tváre v kontrolovaných podmienkach), no vo fotorealistickom a kreatívnom generovaní dominujú diffusion modely. V roku 2026 sa GAN prakticky prestali objavovať v nových state-of-the-art prácach pre generatívny obsah. Zaujímavou hybridnou výnimkou sú adversariálne destilovaní modely (SDXL-Lightning, ADD), ktoré kombinujú GAN diskriminátor s diffusion učením — čo dokazuje, že hranica medzi paradigmami nie je nepriepustná.


11. Kľúčové modely v roku 2026

Ekosystém sa rýchlo vyvíja. Prehľad modelov, na ktoré narážaš v praxi:

Obrázkové modely:

Model Tvorca Architektúra Poznámka
Stable Diffusion 3.5 Large Stability AI MMDiT + Flow Matching Open weights; silný text v obraze; 8B parametrov
Stable Diffusion 3.5 Large Turbo Stability AI MMDiT + FM + destilácia 4-krokový; open weights; rýchly
FLUX.1 dev Black Forest Labs DiT + Flow Matching Otvorené váhy (non-commercial); výborná fotorealistickosť
FLUX.1 schnell Black Forest Labs DiT + Guidance Distillation Open weights (Apache 2.0); 1–4 kroky; rýchly deployment
FLUX.1 pro Black Forest Labs DiT + Flow Matching Proprietárny; najvyššia kvalita z FLUX rodiny
FLUX.1 Kontext Black Forest Labs DiT + in-context editing Natívna editácia obrázkov cez text; zachováva identitu
FLUX.1 Fill Black Forest Labs DiT + inpainting Natívny inpainting a outpainting pre FLUX ekosystém
FLUX.1 Canny / Depth Black Forest Labs DiT + ControlNet Natívna priestorová kontrola (hrany, hĺbka)
Midjourney v7 Midjourney proprietárny Esteticky silný; iba cez web/Discord
Ideogram 3 Ideogram proprietárny Najlepší text v obraze; typografia
Imagen 3 Google DeepMind DiT Prístupný cez Gemini; vynikajúci v detailoch
Adobe Firefly 4 Adobe proprietárny Komerčne bezpečný (tréning na licencovaných dátach); integrovaný v Creative Cloud
SDXL-Lightning ByteDance U-Net + ADD destilácia Open weights; 1–8 krokov; rýchle produkčné nasadenie

Video modely:

Model Tvorca Poznámka
Sora OpenAI Dlhé klipy, vysoká konzistentnosť
Veo 2 Google DeepMind Riadenie kamery, fotorealizmus
Kling 2.0 Kuaishou Dostupný komerčne; silný pohyb postáv
Wan 2.1 Alibaba Open weights; 1.3B a 14B varianty
HunyuanVideo Tencent Open weights; 13B; dlhá konzistentnosť
LTX-Video Lightricks Open weights; bežia na consumer GPU
Mochi 1 Genmo Open weights (Apache 2.0); plynulý pohyb
Runway Gen-3 Alpha Runway Kreativita a kamera; API dostupné
Cosmos NVIDIA Open weights; world foundation model; fyzika

3D modely:

Model Tvorca Poznámka
Zero123++ Stability AI Multi-view generovanie z jedného obrázka
TripoSR Tripo / Stability AI Rýchla 3D rekonštrukcia; open weights
Shap-E OpenAI Text/image-to-3D; open weights
RFDiffusion Baker Lab / IPD Proteínový dizajn; vedecké aplikácie
GaussianDreamer komunita Text-to-3DGS pipeline

12. Inferenčná optimalizácia

Nasadenie diffusion modelov v produkcii vyžaduje kompromisy medzi kvalitou, rýchlosťou a VRAM nárokmi.

Kvantizácia (Quantization):

  • Znižuje presnosť váh z float32/bfloat16 na int8, fp8 alebo nf4.
  • Šetrí 2–4× VRAM pri minimálnej strate kvality.
  • bitsandbytes: int8 a nf4 kvantizácia, populárna v HuggingFace pipeline.
  • GGUF formát: portuje kvantizačný štandard z LLM sveta do diffusion modelov — umožňuje spustiť FLUX na CPU alebo slabšom GPU.
  • FP8 tréning a inference: NVIDIA H100 a novšie GPU natívne podporujú FP8; väčšina frontier modelov 2025–2026 je trénovaná v BF16 a nasadzovaná v FP8 pre inference.

Kompilácia a optimalizovaná attention:

  • torch.compile: JIT kompilácia PyTorch grafu; 20–40% zrýchlenie na moderných GPU.
  • Flash Attention 2/3: pamäťovo efektívna implementácia attention operácie; povinné pre veľké modely.
  • xFormers: alternatívna pamäťovo efektívna attention knižnica; staršia, no stále rozšírená.
  • TensorRT / ONNX Runtime: export modelu do optimalizovaného formátu pre produkčné nasadenie na NVIDIA GPU.

CPU offloading:

  • Vrstvy modelu sa ukladajú v RAM a presúvajú na GPU iba pri spracovaní.
  • sequential_cpu_offload: radikálne znižuje VRAM (FLUX 8B možno spustiť na 8 GB GPU), ale pomalšie.
  • model_cpu_offload: vyváženejší kompromis.

Cachovanie medzivýsledkov:

  • DeepCache: attention výstupy z hlbších vrstiev sa recyklujú každé N krokov — 2× zrýchlenie bez výraznej straty kvality.
  • TeaCache (Timestep Embedding Aware Cache): inovatívnejší prístup, kde sa cachuje podľa podobnosti timestep embeddingov — lepší kompromis ako DeepCache.
  • Attention caching v ControlNet: referenčné attention mapy sa predpočítajú raz a recyklujú.

TAESD (Tiny AutoEncoder for Stable Diffusion):

  • Miniatúrny decoder (~5 MB), ktorý vie rýchlo zobraziť latentný priestor ako náhľad počas generovania — žiadna čakacia doba na finálny VAE decode každý krok.

Orientačné VRAM nároky (inference, bfloat16):

Model Min. VRAM Odporúčané Poznámka
SD 1.5 4 GB 6 GB Legacy model
SDXL 8 GB 12 GB S CPU offload 6 GB
FLUX.1 schnell 10 GB 16 GB S GGUF Q4: 6 GB
FLUX.1 dev 12 GB 24 GB S GGUF Q4: 8 GB
SD 3.5 Large 14 GB 24 GB S FP8: 10 GB
HunyuanVideo (video) 60 GB 80 GB Výzva aj pre A100
Wan 2.1 (1.3B) 8 GB 12 GB Consumer-friendly video model

13. Hodnotenie kvality generatívnych modelov

Meranie kvality generatívnych modelov je netriviálny problém — subjektívne estetické vnímanie sa ťažko zachytí automatickými metrikami. V praxi sa používa kombinácia kvantitatívnych metrík, reward modelov a ľudského hodnotenia.

Automatické metriky pre obrázky:

Metrika Čo meria Typické hodnoty Obmedzenia
FID (Fréchet Inception Distance) Distribučná zhoda reálnych vs. generovaných obrázkov v Inception feature priestore Nižšie = lepšie; dobrý model: FID < 10 Necitlivý na promptovú adherenciu; závisí od referenčnej sady
IS (Inception Score) Kvalita a diverzita cez Inception softmax predikcie Vyššie = lepšie Ignoruje zhodu s promptom; dá sa optimalizovať umelo
CLIP Score Kosinusová podobnosť CLIP embeddingov obrázka a promptu 0–1; > 0.28 je solídne Bias z CLIP tréningových dát; slepý voči jemným detailom
PickScore / HPSv2 Ľudské preferencie (reward model na párových hodnoteniach) Relatívne (porovnanie modelov) Závisí od kvality anotátorov a distribúcie promptov
ImageReward Reward model trénovaný na ľudských hodnoteniach Relatívne Podobné obmedzenia ako HPSv2
DINO similarity Konzistentnosť vizuálnej identity (napr. tváre pri fine-tuningu) 0–1 Meria identitu subjektu, nie celkovú kvalitu
Aesthetic Score Estetická kvalita (LAION aesthetic predictor) 1–10 Subjektívne; bias voči LAION tréningovým dátam

Automatické metriky pre video:

Metrika Čo meria
FVD (Fréchet Video Distance) Video ekvivalent FID v I3D feature priestore; distribučná zhoda klipov
CLIP-SIM temporal Priemerná CLIP podobnosť susedných snímok — temporálna konzistentnosť
Optical flow consistency Plynulosť pohybu; detekuje trhané alebo fyzicky nepravdepodobné pohyby
Video CLIP Score Zhoda celého videoklipu s textovým promptom

Leaderboardy a ľudské hodnotenie — zlatý štandard:

  • ELO systémy (Artificial Analysis, GenAI Arena): modely sa porovnávajú v anonymných párových súbojoch — používatelia volia, ktorý výstup je lepší. Výsledky sa agregujú do ELO ratingu. Odrážajú reálne ľudské preferencie oveľa vierohodnejšie ako FID alebo CLIP score.
  • Aspektové hodnotenie: hodnotitelia posudzujú samostatne: vizuálnu kvalitu, dodržanie promptu, estetiku, prítomnosť artefaktov.
  • Špecifické benchmarky: T2I-CompBench (kompozičné porozumenie), DrawBench (ťažké prompty), GenAI-Bench (komplexná sada), EvalCrafter (video).

Dôležitá nuansa — Goodhartov zákon v praxi: keď sa metrika stáva tréningovým cieľom, prestáva byť dobrou metrikou. Model môže mať nízke FID pri nízkej diverzite výstupov (jednoducho pamätá tréningovú distribúciu), alebo vysoký CLIP score pri vizuálne nekvalitných, no sémanticky presných obrázkoch. Dôveryhodné hodnotenie v roku 2026 kombinuje automatické metriky, ľudské leaderboardy a testovanie na cielených benchmarkoch — žiadna jednotlivá metrika nestačí.


14. Výhody a nevýhody

Výhody:

  • Vysoká kvalita generovania (detaily, textúry, svetlo, kompozícia).
  • Dobrá kontrola cez podmienky: text (prompt), obrázok (img2img), maska (inpainting), hrany/pose/depth (ControlNet), referenčný obrázok (IP-Adapter).
  • Stabilný tréning oproti GAN; škáluje sa predvídateľne podľa zákonov škálovania podobných LLM.
  • Bohatá diverzita výstupov — neopakuje rovnaké kompozície.
  • Moderné distilované modely generujú v 1–8 krokoch (rýchlosť porovnateľná s GAN).
  • Rozvinutý fine-tuning ekosystém (LoRA, DreamBooth, DoRA) umožňuje personalizáciu bez potreby drahej infraštruktúry.
  • Multimodálne rozšírenie: rovnaké princípy fungujú pre obraz, video, audio, 3D aj molekulárne štruktúry.
  • In-context editing (FLUX Kontext) umožňuje presné editácie pri zachovaní identity subjektu.

Nevýhody:

  • Základné (nedestilované) modely sú pomalšie — iteratívne kroky.
  • Citlivosť na nastavenia: CFG scale, počet krokov, seed, sampler → vyžaduje skúsenosť s tuningom.
  • Pretrvávajúce artefakty: ruky so zlým počtom prstov, text v obraze (zlepšuje sa u SD3/FLUX/Ideogram), opakujúce sa vzory pri veľkých rozlíšeniach.
  • Riziká z tréningových dát: bias voči určitým kultúram, štýlom, pohlaviám; možné kopírovanie trénovaných štýlov; nejasné licencie open datasetov.
  • Výpočtové nároky na tréning sú obrovské; len niekoľko organizácií trénuje modely od nuly.
  • Video modely násobne náročnejšie na inference ako obrázkové; open-source video generovanie je stále obmedzené na výkonnejší hardware.
  • 3D generovanie zaostáva za 2D v kvalite aj konzistentnosti — text-to-3D pipeline je využiteľná pre prototypovanie, nie produkciu.
  • Hodnotenie kvality je komplexné — žiadna jednotlivá automatická metrika nespoľahlivo odráža ľudské vnímanie.

15. Praktické aplikácie

Vizuálny obsah:

  • Text-to-image: ilustrácie, koncept art, marketingové vizuály, produktové fotografie, architektúrne vizualizácie.
  • Image editing: inpainting (doplnenie/odstránenie objektu), outpainting (rozšírenie scény), img2img (zachovať kompozíciu, zmeniť štýl alebo lighting).
  • In-context editing: modely ako FLUX Kontext umožňujú presné textom riadené úpravy (zmeň farbu auta, odstráň pozadie, vlož objekt) pri zachovaní identity subjektu.
  • Upscaling a enhancement: AI upscalery (RealESRGAN, Magnific AI) na zvýšenie rozlíšenia s halucináciou detailov.

Video a animácia:

  • Text-to-video: generovanie klipov z textového popisu (Sora, Kling, Wan, Veo 2). V roku 2026 zvládajú modely klipy 5–15 sekúnd vo vysokej kvalite.
  • Image-to-video: animovanie statického obrázka — vznik pohybu, kamera, výraz tváre. SVD, Kling a Wan sú v tejto kategórii najsilnejšie.
  • Video-to-video: zmena štýlu videa, re-lighting, zmena oblečenia postavy.
  • Interpolácia a frame generation: generovanie chýbajúcich snímok, zvýšenie FPS.
  • Animácia z image modelov: AnimateDiff umožňuje animovať akýkoľvek SD model bez nutnosti video trénovania.

Audio:

  • Generovanie zvukových efektov a hudobných textúr (AudioLDM 2, Stable Audio, AudioCraft).
  • Text-to-music s vokálmi (Suno, Udio).
  • Syntéza a klonovanie hlasu (F5-TTS, Chatterbox, VoiceBox).
  • Dubbing a lokalizácia obsahu — generovanie hlasu v cieľovom jazyku pri zachovaní identity hlasu.

3D a priestorový obsah:

  • Generovanie textúr pre 3D modely (TEXTure, Text2Tex).
  • Multi-view generovanie (Zero123++, MVDiffusion): z jedného obrázka vygeneruj pohľady z rôznych uhlov.
  • Rýchla 3D rekonštrukcia (TripoSR, One-2-3-45++) pre prototypovanie assetov.
  • Optimalizačné pipeline (DreamFusion, GaussianDreamer): diffusion model ako loss pre tréning NeRF alebo Gaussian Splatting.
  • World models (NVIDIA Cosmos, Genie 2): generovanie fyzikálne koherentných virtuálnych prostredí pre tréning robotov a autonómnych systémov.

Špecializované domény:

  • Medicínske zobrazovanie: syntéza tréningových dát (CT, MRI) pre medicínske AI modely.
  • Molekulárny dizajn: diffusion modely na generovanie proteínových štruktúr (RFDiffusion) a docking malých molekúl (DiffDock) — aktívne uplatnenie v drug discovery.
  • Materiálová veda a fyzikálne simulácie (NVIDIA Cosmos).
  • Syntéza tréningových dát pre iné AI modely: generovanie labeled dát v doménach kde reálne dáta sú vzácne alebo drahé.

16. Quick Reference

Pojem Čo znamená Prečo je dôležité
noise steps (T) počet krokov odšumovania viac krokov = lepšia kvalita, ale pomalšie; destilácia to obchádza
scheduler / sampler spôsob reverzného procesu DPM-Solver++ a Euler sú dnes štandard pre DDPM; FlowMatchEuler pre FM modely
CFG scale sila vedenia promptom 3–7 pre fotorealizmus, 7–12 pre ilustrácie; príliš vysoké = artefakty
seed náhodné semienko rovnaký seed = reprodukovateľný výsledok; dôležité pri ladení
latent diffusion denoising v komprimovanom priestore VAE výrazne šetrí výkon, dnes štandard
flow matching rektifikované trajektórie namiesto šumu rýchlejší a stabilnejší tréning, SD3 a FLUX
LoRA malý adaptér dotrénovaý na štýl/postavu umožňuje personalizáciu bez trénovania celého modelu
DoRA LoRA s dekompozíciou magnitúdy/smeru lepšia kvalita fine-tuningu ako štandardná LoRA
ControlNet podmieňovanie cez hrany/pose/hĺbku priestorová kontrola kompozície
DiT transformer namiesto U-Netu lepšie škáluje, dnes dominantná architektúra
MMDiT multimodálny DiT (text = obraz = tokeny) text aj obraz si navzájom dávajú pozornosť; SD3, FLUX
distillácia rýchly student model z pomalého teacher produkčné nasadenie s 1–8 krokmi
ADD adversariálna diffusion destilácia GAN diskriminátor zlepšuje kvalitu pri 1–4 krokoch; SDXL-Lightning
GGUF kvantizačný formát pôvodne z LLM sveta FLUX spustiteľný na bežnom GPU s 6–8 GB VRAM
temporálna attention attention naprieč snímkami vo videu zachováva konzistentnosť pohybu a identity
in-context editing editácia obrázka vložením do kontextu modelu presné textom riadené úpravy bez straty identity subjektu
AnimateDiff motion module pre existujúce image modely animovanie bez video trénovania, kompatibilný so SD ekosystémom
FID Fréchet Inception Distance distribučná metrika kvality; nižšie = lepšie; nie jediný ukazovateľ
FVD Fréchet Video Distance video ekvivalent FID pre hodnotenie video modelov
dual text encoding kombinácia CLIP + T5 encoderov T5 lepšie rozumie dlhým promptom; FLUX, SD3
mel spektrogram 2D časo-frekvenčná reprezentácia audia umožňuje aplikovať image diffusion princípy na audio
SDS Score Distillation Sampling používa 2D diffusion model ako loss pre optimalizáciu 3D scény (DreamFusion)
Gaussian Splatting 3D reprezentácia cez mrak gaussiánov rýchly rendering; diffusion modely ho optimalizujú priamo
world foundation model diffusion model trénovaný na fyzikálnej koherencii generuje simulácie pre robotiku a autonómne systémy (Cosmos, Genie 2)
3D VAE variačný autoencoder pre video s časovou dimenziou komprimuje video ako objem namiesto sekvencie obrázkov; HunyuanVideo, Wan
RFDiffusion diffusion model pre proteínové štruktúry de novo návrh proteínov s cielenou funkciou; drug discovery

17. Bezpečnosť a súkromie

  • Licencie a tréningové dáta: open modely (FLUX, SD) majú rôzne licencie pre komerčné použitie — vždy overiť pred nasadením v produkte. FLUX.1 schnell je Apache 2.0 (voľné komerčné použitie); FLUX.1 dev má non-commercial licenciu. Tréningové datasety (LAION) obsahujú kontroverzné materiály, čo sa odráža na správaní modelov. Adobe Firefly je výnimkou — trénovaný výlučne na licencovaných dátach, čo ho robí komerčne bezpečnejším, no za cenu menšej flexibility.
  • Watermarking a proveniencia: SynthID (Google) a podobné riešenia embeddujú neviditeľné vodoznaky do AI generovaného obsahu. Od roku 2025 platformy implementujú C2PA (Coalition for Content Provenance and Authenticity) metadáta — štandard pre sledovanie pôvodu obsahu. Prehliadače a sociálne siete začínajú C2PA metadáta zobrazovať používateľom. V roku 2026 je C2PA podporovaný v Adobe Creative Cloud, Midjourney, DALL-E a väčšine komerčných platforiem.
  • EU AI Act (účinný 2025–2026): diffusion modely nasadené v EÚ ako general-purpose AI systémy s vysokým dopadom podliehajú transparentnosti a hodnoteniu rizík. Syntetický obsah zobrazujúci osoby musí byť označený. Platformy sú zodpovedné za obsah generovaný ich systémami. Modely s viac ako 10^25 FLOP tréningu sa klasifikujú ako „systémové riziko" a podliehajú dodatočným povinnostiam hlásenia incidentov Európskej komisii.
  • Promptový logging: cloudové API služby môžu logovať vstupné prompty — pri citlivých zadaniach (osoby, interné materiály, dôverné informácie) zvážiť lokálne nasadenie.
  • Deepfakes a misuse: diffusion modely sú technológiou s duálnym použitím. Platformy implementujú filtre (CSAM detekcia, face recognition), no lokálne open modely sú voľne dostupné. V mnohých jurisdikciách existuje alebo vzniká legislatíva k AI generovanému obsahu osôb — v EÚ pokrytá AI Act, v USA fragmentovaná na úrovni štátov.
  • Autorské práva: právna situácia okolo generovania v štýle konkrétnych umelcov zostáva čiastočne nevyriešená v roku 2026. Kauzy Getty Images vs. Stability AI a kolektívne žaloby umelcov v USA pokročili — prvé rozsudky naznačujú, že tréning na verejne dostupných obrázkoch bez súhlasu je problematický, hoci konečné rozhodnutia sú stále vo fáze odvolaní. Pri komerčnom použití dokumentuj, aké modely a dáta boli použité.
  • Označovanie AI obsahu: pri publikovaní výstupov riešiť transparentnosť AI pôvodu — metadáta (C2PA), textové označenie, watermark. Niektoré platformy (LinkedIn, Adobe Stock) automaticky detekujú AI obsah a označujú ho bez ohľadu na tvoje rozhodnutie.
  • Reprodukcia tréningových dát: štúdie ukázali, že diffusion modely môžu za určitých podmienok reprodukovať tréningové dáta (memorization) — riziko pri generovaní obsahov blízkych konkrétnym tréningovým príkladom.
  • Audio deepfakes: modely syntézy reči (F5-TTS, Chatterbox, VoiceBox) umožňujú klonovanie hlasu z niekoľkých sekúnd referenčného audia — rovnaké etické a právne otázky ako pri obrazových deepfakoch, s dodatočným rizikom v podvode a phishingu. V roku 2026 viacero krajín zaviedlo legislatívu priamo kriminalizujúcu klonovanie hlasu bez súhlasu.
  • 3D a biometrické dáta: generovanie 3D modelov ľudských tvárí a tiel cez diffusion vytvára nové kategórie rizík — syntetické biometrické dáta môžu obchádzať face liveness detection systémy. Výskum v tejto oblasti je aktívny na oboch stranách (útok aj obrana).

Zhrnutie

  • Diffusion models generujú obsah tak, že z čistého šumu spravia v krokoch zmysluplný výstup — cez reverznú difúziu alebo flow matching.
  • Stoja na forward/reverse procese v latentnom priestore s cross-attention conditioning; architektúra sa posunula od U-Netu k DiT (Diffusion Transformer) a MMDiT; novšie modely používajú duálne text encoding (CLIP + T5).
  • Flow Matching a destilácia (LCM, ADD, Guidance Distillation, Hyper) riešia pomalosť — moderné modely generujú v 1–8 krokoch.
  • Video diffusion je najrýchlejšie rastúca oblasť: temporálna attention a kauzálne DiT architektúry umožňujú koherentné klipy; výzvy zostávajú v dlhých klipoch a fyzikálnej presnosti. AnimateDiff, Wan 2.1 a LTX-Video priniesli video schopnosti do open-source ekosystému.
  • Audio diffusion (mel spektrogram, codec-based tokeny) napĺňa medzeru v generatívnom audio obsahu — od zvukových efektov cez hudbu až po expresívnu syntézu reči.
  • 3D diffusion sa rozvetvila na kreatívne aplikácie (text-to-3D cez SDS a multi-view generovanie) a vedecké (proteínový dizajn cez RFDiffusion, molekulárny docking). World foundation models (Cosmos, Genie 2) sú ďalšou vetvou — fyzikálna koherencia pred estetickou kvalitou.
  • Fine-tuning ekosystém (LoRA, DreamBooth, DoRA) demokratizoval personalizáciu modelov — štýl alebo postava sa dajú naučiť v hodinách na bežnom GPU.
  • Inferenčná optimalizácia (kvantizácia, torch.compile, DeepCache, GGUF) posúva modely z data center na spotrebiteľský hardware.
  • Hodnotenie kvality sa neopiera o jedinú metriku — kombinácia FID/CLIP/PickScore s ELO leaderboardmi (Artificial Analysis, GenAI Arena) a špecifickými benchmarkmi dáva najvernejší obraz.
  • Ekosystém v roku 2026: FLUX.1 a SD3.5 dominujú open image modelom, Wan / HunyuanVideo / LTX-Video open video modelom, Sora / Veo 2 / Kling proprietárnym video modelom. Regulačný rámec (EU AI Act, C2PA) sa stáva realitou a ovplyvňuje nasadenie v produkcii.