AlphaGenome

AlphaGenome je AI model od Google DeepMind zameraný na genomiku: z dlhej DNA sekvencie predpovedá regulačný dopad — expresiu génov, splicing, dostupnosť chromatínu a ďalšie biologické signály. Zjednodušene: namiesto čítania knihy života písmeno po písmene sa snaží odhadnúť, čo tá konkrétna kapitola v tele spôsobí a prečo.

Model bol predstavený v roku 2025 a odvtedy prešiel viacerými aktualizáciami. V roku 2026 patrí medzi referenčné nástroje pre genomické predikcie v nekódujúcich oblastiach DNA, kde tradičné bioinformatické metódy zaostávajú.


1. Čo to je a prečo je to podstatné

Väčšina genetického výskumu sa historicky sústredila na kódujúce oblasti DNA — teda na samotné gény. Problém je, že iba asi 2 % ľudského genómu kóduje proteíny. Zvyšných 98 % tvorí regulačné oblasti, introny, nekódujúce RNA a oblasti, ktorých funkcia stále nie je úplne objasnená. Práve tieto „neviditeľné" časti pritom zodpovedajú za veľkú časť genetických rizík pri bežných chorobách — od cukrovky až po rakovinu.

AlphaGenome sa zameriava práve sem:

  • Regulačné oblasti ako hlavný cieľ: Model je natrénovaný tak, aby rozumel kontextu nekódujúcich sekvencií — kde sú enhancery, silencery, promotory a ako sa vzájomne ovplyvňujú.

  • Predikcia účinku variantov: Kľúčová funkcia je porovnať referenčnú (wild-type) a alternatívnu (mutant) sekvenciu a dostať kvantifikované skóre zmeny. To umožňuje zoradiť tisíce variantov podľa pravdepodobného biologického dopadu bez toho, aby si musel každý testovať mokrou cestou.

  • Viac výstupov súčasne: Nejde o binárne „choroba / zdravý". Model produkuje tisíce biologických „trackov" — rôznych meraných signálov — čo zodpovedá tomu, ako laboratóriá skutočne merajú biologickú aktivitu.

  • Urýchlenie výskumného cyklu: Namiesto rokov experimentov v laboratóriu dostaneš hypotézy: ktoré varianty testovať prvé, aký mechanizmus je najpravdepodobnejší, čo merať.


2. Technické detaily a architektúra

AlphaGenome kombinuje viacero prístupov do jedného modelu, ktorý musí zvládnuť veľmi dlhé sekvencie aj zachytiť jemné lokálne vzory.

Vstup a kontext:

  • Model pracuje s úsekmi DNA v dĺžke rádovo až milión báz (1 Mb). To je zásadné — regulačné prvky (napr. enhancery) môžu byť vzdialené stovky kilobáz od génu, ktorý ovplyvňujú. Kratší kontext by tieto interakcie jednoducho nezachytil.

Architektúra — kombinácia dvoch pohľadov:

  • Konvolučné vrstvy spracúvajú DNA lokálne — rozpoznávajú krátke sekvenčné motívy (väzbové miesta transkripčných faktorov, splice sites a podobne). Fungujú ako lupa na detail.

  • Transformerové vrstvy prenášajú informáciu na dlhé vzdialenosti — modelujú interakcie typu enhancer–promoter cez celé rozsiahlé úseky. Fungujú ako panoramatický pohľad.

  • Výsledná architektúra je hierarchická: lokálne motívy sa spracúvajú konvolúciami, dlhodobé závislosti transformermi. Tento prístup prekonáva modely, ktoré používajú len jeden z týchto mechanizmov.

Výstupy:

  • Expresia génov (RNA-seq signál v rôznych tkanivách)
  • Dostupnosť chromatínu (ATAC-seq, DNase-seq)
  • Splicing (ktoré exony sa spájajú)
  • Väzba proteínov na DNA (ChIP-seq pre transkripčné faktory a histónové modifikácie)
  • Kontaktové mapy (Hi-C — priestorová organizácia chromatínu)

Tabuľka: kľúčové parametre a ich praktický význam

Parameter Hodnota / popis Praktický dopad
Dĺžka vstupu až ~1 000 000 báz Zachytí vzdialené regulačné vplyvy (enhancer–promoter)
Počet výstupných trackov tisíce Pokrýva expresiu, chromatin, splicing, väzbu proteínov
Variant scoring wild-type vs. mutant diff Prioritizácia variantov bez wet-lab experimentu
Tkanivová špecificita predikcie per tkanivo/bunková línia Rozlíši, kde mutácia zasiahne a kde nie
Priestorová organizácia Hi-C predikcie Modeluje 3D usporiadanie genómu
Primárne použitie výskum, nie klinická diagnostika Hypotézy, nie lekárske verdikty

3. Porovnanie s inými modelmi

AlphaGenome nie je prvý pokus o hlboké učenie v genomike. Je užitočné vedieť, kde stojí voči existujúcim nástrojom.

Enformer (DeepMind, 2021): Predchodca AlphaGenome. Taktiež pracoval s dlhým kontextom a predikoval génovú expresiu. AlphaGenome rozširuje tento základ o väčší počet výstupných modalít, lepšie zachytenie splicingu a vyššiu presnosť variant scoringu.

Borzoi (Calico/Arcadia, 2023): Iný model s dlhým kontextom, zameraný na viacero modalít. AlphaGenome a Borzoi sú porovnateľní pri predikciách expresie, AlphaGenome reportuje lepšie výsledky pri variant interpretácii v GWAS štúdiách.

Sei / DeepSEA / Basenji: Staršia generácia modelov s kratším kontextom (1–2 kb). Stále užitočné pre špecifické úlohy, ale zaostávajú pri zachytávaní dlhodobých regulačných interakcií.

Evo (Arc Institute, 2024): Generatívny model pre celú biológiu sekvencií (DNA, RNA, proteíny). Iný cieľ — generovanie a porozumenie sekvencií naprieč druhmi — nie predikcia regulačných fenotípov.

Záver: AlphaGenome má najsilnejšiu pozíciu práve v interpretácii nekódujúcich variantov a predikciách naprieč viacerými regulačnými modalitami pri dlhom kontexte.


4. Výsledky a benchmarky (2025–2026)

Pri uvedení modelu DeepMind reportoval výsledky na štandardných genomických benchmarkoch:

  • Variant effect prediction: AlphaGenome dosiahol stav-of-the-art na viacerých datasetoch vrátane CADD-podobných skórovacích úloh pre nekódujúce varianty z GWAS štúdií.

  • Splicing predikcia: Presnosť pri identifikácii kryptických splice sitov (relevantných pre choroby ako SMA alebo niektoré formy rakoviny) výrazne prekonala predchádzajúce modely.

  • Expresia naprieč tkanivami: Na GTEx dátach (expresia génov vo viac ako 50 tkanivách) model dosahoval vysokú koreláciu medzi predikovanou a meranou expresiou.

  • Chromatin accessibility: Na ENCODE dátach model správne predpovedal dostupnosť chromatínu v bunkových líniách, na ktorých nebol trénovaný — čo naznačuje generalizáciu.

V roku 2026 sa objavili prvé nezávislé reprodukcie a rozšírenia: výskumné skupiny aplikovali model na vzácne choroby, onkogenomiku a vývojovú biológiu, pričom reportujú konzistentné výsledky s DeepMind publikáciami.


5. Dostupnosť a licencie

  • Výskumný prístup cez API: Model bol od úvodu sprístupnený ako preview pre nekomerčný výskum. Prístup vyžaduje registráciu a súhlas s podmienkami.

  • Nie je to consumer produkt: AlphaGenome nie je určený na osobnú genetickú diagnostiku. Je to nástroj pre vedcov a výskumné tímy, ktorí rozumejú kontextu biologických predikcií.

  • Open weights / open source otázky: Na rozdiel od niektorých iných DeepMind modelov (napr. AlphaFold 2, ktorý bol plne open-source) AlphaGenome zatiaľ nie je publikovaný ako open weights model. Komunita tlačí na väčšiu otvárenosť, ale oficiálny postoj zostáva „riadený prístup pre výskum".

  • Komerčné použitie: Farmaceutické a biotechnologické spoločnosti môžu prístup riešiť cez Google Cloud partnerstvá. Podmienky sa môžu líšiť — vždy overuj aktuálne zmluvné podmienky priamo u DeepMind/Google.


6. Bezpečnosť a súkromie pri práci s genetickými dátami

Práca s genetickými dátami prináša zvýšené bezpečnostné a etické nároky. DNA sekvencia nie je bežný identifikátor — nedá sa zmeniť ako heslo.

Hlavné riziká:

  • Znovuidentifikácia: Aj anonymizované genetické dáta môžu byť znovuidentifikované pri kombinácii s inými zdrojmi (verejné genealogické databázy, zdravotné záznamy).

  • Familiárna väzba: Genetické dáta informujú nielen o jednotlivcovi, ale aj o jeho biologickej rodine bez ich súhlasu.

  • Regulačné nároky: GDPR explicitne zaraďuje genetické dáta medzi zvláštne kategórie osobných údajov s prísnejšou ochranou.

Praktické odporúčania:

  • Minimalizuj dáta: Posielajte API-u iba úsek potrebný na konkrétnu analýzu, nie celé genómy.
  • Riešte právny rámec pred analýzou: Súhlas dotknutých osôb, GDPR compliance, interné smernice inštitúcie, miesto spracovania (EU vs. mimo EU).
  • Oddeľte výskum od kliniky: Predikcie modelu sú výskumné hypotézy. Nie sú klinickým diagnostickým nástrojom a nesmú byť prezentované pacientom ako diagnóza.
  • Audit prístupu: Logujte, kto má prístup k akým genetickým dátam a na aký účel.

7. Praktické tipy: kedy (a kedy nie) použiť AlphaGenome

Vhodné scenáre:

  • Máš dlhý zoznam variantov z WGS/WES a nevieš, kde začať: AlphaGenome zoradí kandidátov podľa predpokladaného regulačného dopadu — ušetrí mesiace wet-lab práce na nesprávnych cieľoch.

  • Hľadáš mechanizmus: Mutácia „súvisí s chorobou" z GWAS ešte nie je mechanizmus. Model ti dá hypotézu — napríklad „táto SNP narúša väzbové miesto transkripčného faktora X v pečeňových bunkách".

  • Navrhuješ experiment: Predikcia definuje, čo merať (RNA-seq pre expresiu, ATAC-seq pre chromatin, minigene assay pre splicing) a v akom tkanive.

  • Komparatívna genomika: Porovnávanie regulačných predikcií naprieč druhmi môže odhaliť evolučne konzervované funkčné prvky.

Nevhodné scenáre:

  • Klinická diagnostika: Predikcia nie je verdikt. Lekárske rozhodnutia vyžadujú klinicky validované testy.
  • Bez biologického kontextu: Signál závisí od tkaniva, vývojovej fázy a bunkovej identity. Predikcia „v genóme" bez špecifikácie kontextu je neúplná.
  • Ako náhrada za funkčné validácie: Model generuje hypotézy, nie dôkazy. Funkčná validácia (experimenty) zostáva nevyhnutná.

Zhrnutie

AlphaGenome od Google DeepMind je v roku 2026 jedným z najsilnejších nástrojov pre predikciu regulačných efektov genetických variantov, najmä v nekódujúcich oblastiach genómu.

Kľúčové silné stránky:

  • Dlhý kontext (až 1 Mb) umožňuje zachytiť vzdialené regulačné interakcie.
  • Multimodálne výstupy (expresia, chromatin, splicing, proteínová väzba, kontaktové mapy) v jedinom modeli.
  • Variant scoring pre prioritizáciu kandidátov bez wet-lab experimentu.

Hlavné obmedzenia:

  • Nie je open-source, prístup je viazaný na podmienky.
  • Výstupy sú výskumné predikcie, nie klinické závery.
  • Práca s genetickými dátami prináša zvýšené nároky na súkromie a právny rámec.

Pre výskumné tímy pracujúce s GWAS dátami, vzácnymi chorobami alebo funkčnou genomiku ide o nástroj, ktorý zásadne mení to, ako sa dá efektívne prioritizovať experimentálna práca.