AlphaGenome
AlphaGenome je AI model od Google DeepMind zameraný na genomiku: z dlhej DNA sekvencie predpovedá regulačný dopad — expresiu génov, splicing, dostupnosť chromatínu a ďalšie biologické signály. Zjednodušene: namiesto čítania knihy života písmeno po písmene sa snaží odhadnúť, čo tá konkrétna kapitola v tele spôsobí a prečo.
Model bol predstavený v roku 2025 a odvtedy prešiel viacerými aktualizáciami. V roku 2026 patrí medzi referenčné nástroje pre genomické predikcie v nekódujúcich oblastiach DNA, kde tradičné bioinformatické metódy zaostávajú.
1. Čo to je a prečo je to podstatné
Väčšina genetického výskumu sa historicky sústredila na kódujúce oblasti DNA — teda na samotné gény. Problém je, že iba asi 2 % ľudského genómu kóduje proteíny. Zvyšných 98 % tvorí regulačné oblasti, introny, nekódujúce RNA a oblasti, ktorých funkcia stále nie je úplne objasnená. Práve tieto „neviditeľné" časti pritom zodpovedajú za veľkú časť genetických rizík pri bežných chorobách — od cukrovky až po rakovinu.
AlphaGenome sa zameriava práve sem:
Regulačné oblasti ako hlavný cieľ: Model je natrénovaný tak, aby rozumel kontextu nekódujúcich sekvencií — kde sú enhancery, silencery, promotory a ako sa vzájomne ovplyvňujú.
Predikcia účinku variantov: Kľúčová funkcia je porovnať referenčnú (
wild-type) a alternatívnu (mutant) sekvenciu a dostať kvantifikované skóre zmeny. To umožňuje zoradiť tisíce variantov podľa pravdepodobného biologického dopadu bez toho, aby si musel každý testovať mokrou cestou.Viac výstupov súčasne: Nejde o binárne „choroba / zdravý". Model produkuje tisíce biologických „trackov" — rôznych meraných signálov — čo zodpovedá tomu, ako laboratóriá skutočne merajú biologickú aktivitu.
Urýchlenie výskumného cyklu: Namiesto rokov experimentov v laboratóriu dostaneš hypotézy: ktoré varianty testovať prvé, aký mechanizmus je najpravdepodobnejší, čo merať.
2. Technické detaily a architektúra
AlphaGenome kombinuje viacero prístupov do jedného modelu, ktorý musí zvládnuť veľmi dlhé sekvencie aj zachytiť jemné lokálne vzory.
Vstup a kontext:
- Model pracuje s úsekmi DNA v dĺžke rádovo až milión báz (1 Mb). To je zásadné — regulačné prvky (napr. enhancery) môžu byť vzdialené stovky kilobáz od génu, ktorý ovplyvňujú. Kratší kontext by tieto interakcie jednoducho nezachytil.
Architektúra — kombinácia dvoch pohľadov:
Konvolučné vrstvy spracúvajú DNA lokálne — rozpoznávajú krátke sekvenčné motívy (väzbové miesta transkripčných faktorov, splice sites a podobne). Fungujú ako lupa na detail.
Transformerové vrstvy prenášajú informáciu na dlhé vzdialenosti — modelujú interakcie typu enhancer–promoter cez celé rozsiahlé úseky. Fungujú ako panoramatický pohľad.
Výsledná architektúra je hierarchická: lokálne motívy sa spracúvajú konvolúciami, dlhodobé závislosti transformermi. Tento prístup prekonáva modely, ktoré používajú len jeden z týchto mechanizmov.
Výstupy:
- Expresia génov (RNA-seq signál v rôznych tkanivách)
- Dostupnosť chromatínu (ATAC-seq, DNase-seq)
- Splicing (ktoré exony sa spájajú)
- Väzba proteínov na DNA (ChIP-seq pre transkripčné faktory a histónové modifikácie)
- Kontaktové mapy (Hi-C — priestorová organizácia chromatínu)
Tabuľka: kľúčové parametre a ich praktický význam
| Parameter | Hodnota / popis | Praktický dopad |
|---|---|---|
| Dĺžka vstupu | až ~1 000 000 báz | Zachytí vzdialené regulačné vplyvy (enhancer–promoter) |
| Počet výstupných trackov | tisíce | Pokrýva expresiu, chromatin, splicing, väzbu proteínov |
| Variant scoring | wild-type vs. mutant diff | Prioritizácia variantov bez wet-lab experimentu |
| Tkanivová špecificita | predikcie per tkanivo/bunková línia | Rozlíši, kde mutácia zasiahne a kde nie |
| Priestorová organizácia | Hi-C predikcie | Modeluje 3D usporiadanie genómu |
| Primárne použitie | výskum, nie klinická diagnostika | Hypotézy, nie lekárske verdikty |
3. Porovnanie s inými modelmi
AlphaGenome nie je prvý pokus o hlboké učenie v genomike. Je užitočné vedieť, kde stojí voči existujúcim nástrojom.
Enformer (DeepMind, 2021): Predchodca AlphaGenome. Taktiež pracoval s dlhým kontextom a predikoval génovú expresiu. AlphaGenome rozširuje tento základ o väčší počet výstupných modalít, lepšie zachytenie splicingu a vyššiu presnosť variant scoringu.
Borzoi (Calico/Arcadia, 2023): Iný model s dlhým kontextom, zameraný na viacero modalít. AlphaGenome a Borzoi sú porovnateľní pri predikciách expresie, AlphaGenome reportuje lepšie výsledky pri variant interpretácii v GWAS štúdiách.
Sei / DeepSEA / Basenji: Staršia generácia modelov s kratším kontextom (1–2 kb). Stále užitočné pre špecifické úlohy, ale zaostávajú pri zachytávaní dlhodobých regulačných interakcií.
Evo (Arc Institute, 2024): Generatívny model pre celú biológiu sekvencií (DNA, RNA, proteíny). Iný cieľ — generovanie a porozumenie sekvencií naprieč druhmi — nie predikcia regulačných fenotípov.
Záver: AlphaGenome má najsilnejšiu pozíciu práve v interpretácii nekódujúcich variantov a predikciách naprieč viacerými regulačnými modalitami pri dlhom kontexte.
4. Výsledky a benchmarky (2025–2026)
Pri uvedení modelu DeepMind reportoval výsledky na štandardných genomických benchmarkoch:
Variant effect prediction: AlphaGenome dosiahol stav-of-the-art na viacerých datasetoch vrátane CADD-podobných skórovacích úloh pre nekódujúce varianty z GWAS štúdií.
Splicing predikcia: Presnosť pri identifikácii kryptických splice sitov (relevantných pre choroby ako SMA alebo niektoré formy rakoviny) výrazne prekonala predchádzajúce modely.
Expresia naprieč tkanivami: Na GTEx dátach (expresia génov vo viac ako 50 tkanivách) model dosahoval vysokú koreláciu medzi predikovanou a meranou expresiou.
Chromatin accessibility: Na ENCODE dátach model správne predpovedal dostupnosť chromatínu v bunkových líniách, na ktorých nebol trénovaný — čo naznačuje generalizáciu.
V roku 2026 sa objavili prvé nezávislé reprodukcie a rozšírenia: výskumné skupiny aplikovali model na vzácne choroby, onkogenomiku a vývojovú biológiu, pričom reportujú konzistentné výsledky s DeepMind publikáciami.
5. Dostupnosť a licencie
Výskumný prístup cez API: Model bol od úvodu sprístupnený ako preview pre nekomerčný výskum. Prístup vyžaduje registráciu a súhlas s podmienkami.
Nie je to consumer produkt: AlphaGenome nie je určený na osobnú genetickú diagnostiku. Je to nástroj pre vedcov a výskumné tímy, ktorí rozumejú kontextu biologických predikcií.
Open weights / open source otázky: Na rozdiel od niektorých iných DeepMind modelov (napr. AlphaFold 2, ktorý bol plne open-source) AlphaGenome zatiaľ nie je publikovaný ako open weights model. Komunita tlačí na väčšiu otvárenosť, ale oficiálny postoj zostáva „riadený prístup pre výskum".
Komerčné použitie: Farmaceutické a biotechnologické spoločnosti môžu prístup riešiť cez Google Cloud partnerstvá. Podmienky sa môžu líšiť — vždy overuj aktuálne zmluvné podmienky priamo u DeepMind/Google.
6. Bezpečnosť a súkromie pri práci s genetickými dátami
Práca s genetickými dátami prináša zvýšené bezpečnostné a etické nároky. DNA sekvencia nie je bežný identifikátor — nedá sa zmeniť ako heslo.
Hlavné riziká:
Znovuidentifikácia: Aj anonymizované genetické dáta môžu byť znovuidentifikované pri kombinácii s inými zdrojmi (verejné genealogické databázy, zdravotné záznamy).
Familiárna väzba: Genetické dáta informujú nielen o jednotlivcovi, ale aj o jeho biologickej rodine bez ich súhlasu.
Regulačné nároky: GDPR explicitne zaraďuje genetické dáta medzi zvláštne kategórie osobných údajov s prísnejšou ochranou.
Praktické odporúčania:
- Minimalizuj dáta: Posielajte API-u iba úsek potrebný na konkrétnu analýzu, nie celé genómy.
- Riešte právny rámec pred analýzou: Súhlas dotknutých osôb, GDPR compliance, interné smernice inštitúcie, miesto spracovania (EU vs. mimo EU).
- Oddeľte výskum od kliniky: Predikcie modelu sú výskumné hypotézy. Nie sú klinickým diagnostickým nástrojom a nesmú byť prezentované pacientom ako diagnóza.
- Audit prístupu: Logujte, kto má prístup k akým genetickým dátam a na aký účel.
7. Praktické tipy: kedy (a kedy nie) použiť AlphaGenome
Vhodné scenáre:
Máš dlhý zoznam variantov z WGS/WES a nevieš, kde začať: AlphaGenome zoradí kandidátov podľa predpokladaného regulačného dopadu — ušetrí mesiace wet-lab práce na nesprávnych cieľoch.
Hľadáš mechanizmus: Mutácia „súvisí s chorobou" z GWAS ešte nie je mechanizmus. Model ti dá hypotézu — napríklad „táto SNP narúša väzbové miesto transkripčného faktora X v pečeňových bunkách".
Navrhuješ experiment: Predikcia definuje, čo merať (RNA-seq pre expresiu, ATAC-seq pre chromatin, minigene assay pre splicing) a v akom tkanive.
Komparatívna genomika: Porovnávanie regulačných predikcií naprieč druhmi môže odhaliť evolučne konzervované funkčné prvky.
Nevhodné scenáre:
- Klinická diagnostika: Predikcia nie je verdikt. Lekárske rozhodnutia vyžadujú klinicky validované testy.
- Bez biologického kontextu: Signál závisí od tkaniva, vývojovej fázy a bunkovej identity. Predikcia „v genóme" bez špecifikácie kontextu je neúplná.
- Ako náhrada za funkčné validácie: Model generuje hypotézy, nie dôkazy. Funkčná validácia (experimenty) zostáva nevyhnutná.
Zhrnutie
AlphaGenome od Google DeepMind je v roku 2026 jedným z najsilnejších nástrojov pre predikciu regulačných efektov genetických variantov, najmä v nekódujúcich oblastiach genómu.
Kľúčové silné stránky:
- Dlhý kontext (až 1 Mb) umožňuje zachytiť vzdialené regulačné interakcie.
- Multimodálne výstupy (expresia, chromatin, splicing, proteínová väzba, kontaktové mapy) v jedinom modeli.
- Variant scoring pre prioritizáciu kandidátov bez wet-lab experimentu.
Hlavné obmedzenia:
- Nie je open-source, prístup je viazaný na podmienky.
- Výstupy sú výskumné predikcie, nie klinické závery.
- Práca s genetickými dátami prináša zvýšené nároky na súkromie a právny rámec.
Pre výskumné tímy pracujúce s GWAS dátami, vzácnymi chorobami alebo funkčnou genomiku ide o nástroj, ktorý zásadne mení to, ako sa dá efektívne prioritizovať experimentálna práca.