Verbatim Recall

Verbatim recall je schopnosť (alebo problém) jazykového modelu reprodukovať úseky tréningových dát presne slovo za slovom. Je to ako keď model namiesto generovania novej odpovede "skopíruje" celé pasáže z knihy alebo článku, ktorý videl počas tréningu — vrátane citlivých údajov, autorsky chránených textov či osobných informácií.

V roku 2026 je táto téma aktuálnejšia než kedykoľvek predtým: modely sú väčšie, tréningové datasety obrovskejšie a regulačné požiadavky (EU AI Act, GDPR) striktnejšie. Verbatim recall prestáva byť len akademickým problémom — stáva sa obchodným a právnym rizikom.


1. Definícia a kontext

  • Technická definícia: Model pri určitých promptoch reprodukuje sekvencie tokenov identické s tréningovými dátami, namiesto generovania originálneho obsahu

  • Prečo je to problém: Model môže neúmyselne vyzradiť súkromné informácie, porušiť copyright, alebo ukázať, že si "pamätá" namiesto toho aby "rozumel"

  • Aktuálny stav (2026): Výskum z MIT a ETH Zürich (2025) ukázal, že moderné modely s viac ako 100B parametrami môžu pri cielenom promptovaní reprodukovať 0.3–2% svojich tréningových dát. Menšie, doménovo špecializované modely vykazujú vyššiu mieru memorácie — niekedy až 5% — pretože opakujú úzky korpus mnohokrát.

  • Dôležité rozlíšenie: Nie každá memorácia je škodlivá. Model "musí" memorovať fakty (Bratislava je hlavné mesto SR), dátumy, matematické konštanty. Problém nastáva pri memorácii PII, autorsky chránených textov a dôverných dát.


2. Ako verbatim recall funguje

  • Mechanizmus memorácie:

    1. Počas tréningu sa určité sekvencie opakujú mnohokrát (napr. citáty, definície, populárne články)
    2. Model si vytvorí silné neurónové spojenia presne pre tieto sekvencie
    3. Pri správnom prompte sa aktivujú tieto "memorované" cesty
    4. Output je identický alebo takmer identický s tréningovými dátami
  • Faktory ovplyvňujúce memoráciu:

Faktor Efekt Vysvetlenie
Frekvencia v datasete Priamo úmerný Text opakovaný 100× sa memoruje oveľa silnejšie než text videný raz
Unikátnosť textu Paradoxne vyšší Špecifické reťazce (napr. API kľúče, čísla kariet) sa memorujú ľahšie
Pozícia v tréningu Neskoršie epochy > skoršie Efekt podobný "recency bias" u ľudí
Veľkosť modelu Väčší = viac memorácie Viac parametrov = väčšia kapacita pre ukladanie sekvencií
Kontextová dĺžka Dlhší kontext = lepšia extrakcia Útočník môže "primovať" model dlhším kontextom
Teplota generovania Nižšia teplota = viac memorácie Temperature=0 maximalizuje pravdepodobnostné memorované cesty
  • Prečo väčšie modely memorujú viac: Ide o fundamentálny dôsledok ich kapacity. Väčší model má viac parametrov na uloženie vzorcov — a neurónové siete nemajú mechanizmus na aktívne "zabudnutie" konkrétnej informácie počas štandardného tréningu.

3. Hlavné prejavy a príklady

Typ obsahu Príklad verbatim recall Riziko
Osobné údaje Emailové adresy, telefónne čísla z web scrape Vysoké — GDPR/privacy
Kód a API kľúče Celé funkcie z GitHub, exposed secrets Kritické — security
Literárne diela Celé básne, úryvky z kníh pod copyright Vysoké — legal
Akademické texty Abstrakty papers, celé definície Stredné — plagiarism
Novinové články Prvé odseky z NY Times, BBC Vysoké — copyright
Tréningové prompty Systémové inštrukcie, RLHF templaty Stredné — competitive
Medicínske záznamy Pacientske dáta zo zle anonymizovaných datasetov Kritické — HIPAA/GDPR
  • Reálny príklad (2024–2025): Výskumníci z Google DeepMind a akademických inštitúcií extrahovali z verejne dostupných modelov:

    • Stovky kompletných emailových adries a telefónnych čísel
    • Celé odseky z Harry Pottera a iných autorsky chránených diel
    • Funkčné kryptografické kľúče z tréningových repozitárov
    • Časti zdrojového kódu z proprietárnych projektov, ktoré sa dostali do verejného datasetu
  • Scalable extraction attack (2025): Nová technika "divergence-based extraction" dokáže systematicky vyhľadávať memorované sekvencie bez predchádzajúcej znalosti obsahu tréningových dát — stačí porovnávať distribúcie tokenov pri rôznych promptoch.


4. Metódy detekcie a merania

  • Extraction attacks:
# Príklad jednoduchého extraction promptu
prompt = "Continue the following text exactly as written: 'The quick brown'"
# Model pri nízkej teplote dokončí memorovanými sekvenciami

# Sofistikovanejší prístup — divergence-based extraction
def check_memorization(model, candidate_text, reference_model):
    p_main = model.log_prob(candidate_text)
    p_ref = reference_model.log_prob(candidate_text)
    return p_main - p_ref  # vysoký rozdiel = pravdepodobná memorácia
  • Membership inference:

    • Test či konkrétny text bol v tréningových dátach
    • Meranie perplexity: memorované texty majú výrazne nižšiu perplexitu
    • Porovnanie s referenčným (nezortrénovaným) modelom — kľúčová technika od roku 2024
  • Metriky:

    • Extraction rate: Percento úspešných extrakcií z N pokusov
    • Memorization score: Rozdiel log-pravdepodobností medzi cieľovým a referenčným modelom
    • Leakage ratio: Pomer extrahovaných vs. unikátnych tokenov v datasete
    • k-eidetic memorization: Text je memorovaný ak existuje prompt dĺžky k, ktorý ho deterministicky vyvolá
Benchmark Čo meria Typické skóre (2025)
MemTest Extraction rate pre PII Frontier modely: 0.05–0.3%
MIRAGE Membership inference accuracy 70–90% pre cielené útoky
CanaryTokens Detekcia planted strings 95%+ recall pri 10+ opakovaniach
MIMIR Komplexné MI hodnotenie Štandard pre výskum od 2024

5. Bezpečnostné a právne dôsledky

  • Privacy riziká:

    • PII leakage: Mená, adresy, rodné čísla z tréningových dát
    • Medical records: Pacientske záznamy zo zle anonymizovaných datasetov
    • Corporate secrets: Interné dokumenty, finančné dáta, stratégie firiem
    • Biometrické dáta: Hlasové vzorky, obrazové dáta s osobami
  • Copyright problémy:

    • Knihy a články: Celé kapitoly z chránených diel
    • Kód: Proprietárny source code s rôznymi licenciami (GPL, MIT, komerčné)
    • Akademické práce: Dizertácie, research papers za pay-wall
  • Právne precedensy a stav 2026:

    • GitHub Copilot lawsuit (2022–2025): Prípad nakoniec vyústil do mimosúdneho vyrovnania; GitHub zaviedol povinné filtre na kód s reštrikčnými licenciami
    • NYT vs. OpenAI (2024–2026): Prípad stále prebieha; súd v roku 2025 potvrdil, že verbatim reprodukcia článkov môže zakladať porušenie copyrightu, aj keď ide o "malé percento" výstupov
    • EU AI Act (platný od 2025): Vyžaduje dokumentáciu tréningových dát a mechanizmy na riešenie copyright námietok; poskytovatelia modelov musia viesť register zdrojov
  • GDPR a "right to be forgotten": Európske DPA (Data Protection Authorities) vydali v roku 2025 prvé pokuty za neschopnosť odstrániť osobné údaje z AI modelov po žiadosti dotknutých osôb. Technická implementácia zostáva výzvou.


6. Techniky mitigácie

Technika Implementácia Účinnosť Trade-offs
Deduplication Odstránenie duplicít z tréningových dát 50–70% redukcia Menší dataset, strata diverzity
Differential Privacy Pridanie kalibrovaného šumu (DP-SGD) 80–90% redukcia Znížená kvalita na edge cases
Output filtering Detekcia a blokovanie memorovaného obsahu 60–80% redukcia Vyššia latencia, false positives
Goldfish loss Penalizácia presných reprodukcií počas tréningu 70–85% redukcia Horšie faktické úlohy
Canary tokens Vloženie umelých markerov na detekciu leakage 95%+ detekcia Len monitoring, nie prevencia
RLHF/RLAIF tuning Tréning modelu odmietať doslovné reprodukcie 40–60% redukcia Nákladné, obchádzateľné
Machine Unlearning Cielené "zabudnutie" konkrétnych dát 60–95% (závisí od techniky) Výskumná fáza, riziko regressie
Selective Data Filtering Vylúčenie vysoko-rizikových kategórií dát Závisí od rozsahu Vyžaduje kvalitnú klasifikáciu
  • Best practice stack pre rok 2026:
    1. Preprocessing: Agresívna deduplikácia (MinHash, exact-match) + PII scrubbing
    2. Tréning: Differential privacy s kalibrovaným epsilon (ε < 8 pre production systémy)
    3. Post-training: Targeted unlearning pre identifikované rizikové sekvencie
    4. Runtime: Output content filtering + rate limiting na opakované extrakčné pokusy
    5. Monitoring: Pravidelné canary token audity + membership inference testy

7. Machine Unlearning — nová hranica

Táto téma si zaslúži vlastnú sekciu, pretože v rokoch 2025–2026 sa z teoretického konceptu stala praktická požiadavka.

  • Čo je machine unlearning: Proces selektívneho odstránenia vplyvu konkrétnych tréningových príkladov z už natrénovaného modelu — bez nutnosti retrénovať od nuly.

  • Prečo je ťažké: Model neukladá informácie na konkrétne adresy ako databáza. Vedomosť je distribuovaná naprieč miliardami parametrov. "Vymazanie" jednej informácie môže narušiť súvisiace schopnosti.

  • Hlavné prístupy:

    • Gradient ascent unlearning: Spustí inverzné učenie na zabudnutých príkladoch — jednoduchý, ale nestabilný
    • SISA training (Sharded, Isolated, Sliced, Aggregated): Tréning v izolovaných shardoch umožňuje efektívne odobranie konkrétneho shardu
    • Influence function unlearning: Analytický odhad ako by vyzerali parametre bez daného príkladu — presné, ale výpočtovo nákladné
    • Task vector subtraction: Odčítanie "task vektora" reprezentujúceho nežiaducu znalosť
  • Výzvy v praxi:

    • Ťažko overiť, či unlearning skutočne fungoval (membership inference ako kontrola)
    • Riziko "catastrophic forgetting" — model zabudne aj veci, ktoré zabudnúť nemal
    • Škálovanie na frontier modely (100B+ parametrov) zostáva otvorenou výskumnou otázkou
  • Regulačný tlak: EU AI Act a niektoré národné regulácie v roku 2026 explicitne požadujú, aby poskytovatelia vedeli reagovať na žiadosti o unlearning v rozumnom časovom rámci.


8. Praktické odporúčania

  • Pre AI vývojárov:

    • Audit tréningových dát: Skenuj na PII, secrets, copyright — ideálne automatizovanými nástrojmi (napr. Presidio, PIIvot)
    • Implementuj safeguards: Content filtering, rate limiting, canary monitoring
    • Dokumentuj datasety: EU AI Act vyžaduje "data provenance" dokumentáciu
    • Privacy-first design: Minimalizuj osobné dáta; ak ich potrebuješ, aplikuj DP
  • Pre používateľov AI:

    • Nikdy nezadávaj: Skutočné heslá, API kľúče, rodné čísla, medicínske záznamy
    • Over výstupy: Kontroluj či AI nevracia "príliš presné" informácie ktoré nemohla vygenerovať
    • Buď opatrný s: Žiadosťami o citácie, presné znenia zákonov, lekárske informácie — môže ísť o memorované (a teda zastarané alebo chybné) dáta
  • Pre organizácie:

    • Data governance: Klasifikuj dáta pred použitím v AI systémoch
    • Access control: Obmedz kto môže používať AI na citlivé úlohy; loguj interakcie
    • Vendor due diligence: Pýtaj sa dodávateľov modelov na ich tréningové dáta, DP záruky a unlearning kapacity
    • Incident response: Priprav plán pre prípad že verbatim leak nastane — kto sa notifikuje, ako sa dokumentuje

9. Súvislosť s hallucináciami a fakticitou

Verbatim recall a halucinácie sú opačné konce spektra — a oba sú problematické:

  • Verbatim recall: Model reprodukuje niečo presne, čo mohlo byť pravdivé v čase tréningu, ale je dnes zastarané alebo privátne

  • Halucinácia: Model vymýšľa niečo čo nikdy neexistovalo, s falošnou istotou

  • Paradox spoľahlivosti: Výskum ukazuje, že modely trénované s agresívnejšou anti-memoráciou majú tendenciu halucinovať viac — snažia sa "generovať" namiesto "reprodukovať" aj v prípadoch kde by reprodukcia bola správna (napr. citovanie definície zákonného pojmu).

  • Praktický dôsledok: Optimálna miera memorácie nie je nula — je to nejaký bod rovnováhy kde model reprodukuje overiteľné fakty, ale nie osobné dáta. Nájsť tento bod je jednou z kľúčových výziev výskumu v roku 2026.


10. Budúcnosť a výskumné smery

  • Technické smery pre 2026–2028:

    • Scalable machine unlearning: Efektívne algoritmy pre 100B+ modely sú aktívnym výskumným problémom (NeurIPS 2025 mal dedikovaný workshop)
    • Certified unlearning: Kryptograficky overiteľné záruky že informácia bola odstránená
    • Watermarking: Označenie generovaného vs. memorovaného obsahu v reálnom čase
    • Federated learning: Tréning bez centralizácie dát znižuje riziko pri zbere, nie pri inference
    • Synthetic data pipelines: Nahradenie skutočných dát syntetickými ekvivalentmi bez PII
  • Regulačný vývoj:

    • EU AI Act je v plnej sile — poskytovatelia General Purpose AI modelov musia zverejniť súhrn tréningových dát
    • GDPR enforcement naberá tempo: DPA v Írsku a Francúzsku začali aktívne prešetrovanie
    • US: Federálna regulácia stále fragmentovaná, ale niekoľko štátov (California, Illinois) má vlastné AI privacy zákony s implikáciami pre memoráciu
    • Čína: Nové pravidlá z roku 2025 vyžadujú lokálne ukladanie a auditovanie tréningových dát
  • Otvorené výzvy:

    • Balans medzi užitočnou memoráciou (fakty, definície) a škodlivou (PII, copyright)
    • Škálovateľná detekcia memorácie bez znalosti tréningových dát
    • Štandardizácia: čo vlastne znamená "dostatočne nízka" miera memorácie pre compliance?

Zhrnutie

  • Verbatim recall je inherentná vlastnosť súčasných LLM — nie bug, ale prirodzený dôsledok trénovania na veľkých datasetoch s opakujúcim sa obsahom
  • Riziko extrakcie 0.05–2% tréningových dát (podľa veľkosti a architektúry modelu) robí z toho vážny privacy a právny problém v ére EU AI Act a GDPR enforcement
  • Najúčinnejšia ochrana: Kombinácia deduplikácie, differential privacy, machine unlearning a output filteringu — 100% eliminácia nie je možná ani teoreticky
  • Machine unlearning sa stáva regulatórnou požiadavkou — firmy musia vedieť reagovať na žiadosti o "zabudnutie" konkrétnych dát
  • Pre prax: Nikdy nezadávaj citlivé údaje do AI systémov; pri výstupoch kontroluj, či nie sú "príliš dokonalou" kópiou; ako vývojár investuj do privacy-first data pipeline