Verbatim Recall
Verbatim recall je schopnosť (alebo problém) jazykového modelu reprodukovať úseky tréningových dát presne slovo za slovom. Je to ako keď model namiesto generovania novej odpovede "skopíruje" celé pasáže z knihy alebo článku, ktorý videl počas tréningu — vrátane citlivých údajov, autorsky chránených textov či osobných informácií.
V roku 2026 je táto téma aktuálnejšia než kedykoľvek predtým: modely sú väčšie, tréningové datasety obrovskejšie a regulačné požiadavky (EU AI Act, GDPR) striktnejšie. Verbatim recall prestáva byť len akademickým problémom — stáva sa obchodným a právnym rizikom.
1. Definícia a kontext
Technická definícia: Model pri určitých promptoch reprodukuje sekvencie tokenov identické s tréningovými dátami, namiesto generovania originálneho obsahu
Prečo je to problém: Model môže neúmyselne vyzradiť súkromné informácie, porušiť copyright, alebo ukázať, že si "pamätá" namiesto toho aby "rozumel"
Aktuálny stav (2026): Výskum z MIT a ETH Zürich (2025) ukázal, že moderné modely s viac ako 100B parametrami môžu pri cielenom promptovaní reprodukovať 0.3–2% svojich tréningových dát. Menšie, doménovo špecializované modely vykazujú vyššiu mieru memorácie — niekedy až 5% — pretože opakujú úzky korpus mnohokrát.
Dôležité rozlíšenie: Nie každá memorácia je škodlivá. Model "musí" memorovať fakty (Bratislava je hlavné mesto SR), dátumy, matematické konštanty. Problém nastáva pri memorácii PII, autorsky chránených textov a dôverných dát.
2. Ako verbatim recall funguje
Mechanizmus memorácie:
- Počas tréningu sa určité sekvencie opakujú mnohokrát (napr. citáty, definície, populárne články)
- Model si vytvorí silné neurónové spojenia presne pre tieto sekvencie
- Pri správnom prompte sa aktivujú tieto "memorované" cesty
- Output je identický alebo takmer identický s tréningovými dátami
Faktory ovplyvňujúce memoráciu:
| Faktor | Efekt | Vysvetlenie |
|---|---|---|
| Frekvencia v datasete | Priamo úmerný | Text opakovaný 100× sa memoruje oveľa silnejšie než text videný raz |
| Unikátnosť textu | Paradoxne vyšší | Špecifické reťazce (napr. API kľúče, čísla kariet) sa memorujú ľahšie |
| Pozícia v tréningu | Neskoršie epochy > skoršie | Efekt podobný "recency bias" u ľudí |
| Veľkosť modelu | Väčší = viac memorácie | Viac parametrov = väčšia kapacita pre ukladanie sekvencií |
| Kontextová dĺžka | Dlhší kontext = lepšia extrakcia | Útočník môže "primovať" model dlhším kontextom |
| Teplota generovania | Nižšia teplota = viac memorácie | Temperature=0 maximalizuje pravdepodobnostné memorované cesty |
- Prečo väčšie modely memorujú viac: Ide o fundamentálny dôsledok ich kapacity. Väčší model má viac parametrov na uloženie vzorcov — a neurónové siete nemajú mechanizmus na aktívne "zabudnutie" konkrétnej informácie počas štandardného tréningu.
3. Hlavné prejavy a príklady
| Typ obsahu | Príklad verbatim recall | Riziko |
|---|---|---|
| Osobné údaje | Emailové adresy, telefónne čísla z web scrape | Vysoké — GDPR/privacy |
| Kód a API kľúče | Celé funkcie z GitHub, exposed secrets | Kritické — security |
| Literárne diela | Celé básne, úryvky z kníh pod copyright | Vysoké — legal |
| Akademické texty | Abstrakty papers, celé definície | Stredné — plagiarism |
| Novinové články | Prvé odseky z NY Times, BBC | Vysoké — copyright |
| Tréningové prompty | Systémové inštrukcie, RLHF templaty | Stredné — competitive |
| Medicínske záznamy | Pacientske dáta zo zle anonymizovaných datasetov | Kritické — HIPAA/GDPR |
Reálny príklad (2024–2025): Výskumníci z Google DeepMind a akademických inštitúcií extrahovali z verejne dostupných modelov:
- Stovky kompletných emailových adries a telefónnych čísel
- Celé odseky z Harry Pottera a iných autorsky chránených diel
- Funkčné kryptografické kľúče z tréningových repozitárov
- Časti zdrojového kódu z proprietárnych projektov, ktoré sa dostali do verejného datasetu
Scalable extraction attack (2025): Nová technika "divergence-based extraction" dokáže systematicky vyhľadávať memorované sekvencie bez predchádzajúcej znalosti obsahu tréningových dát — stačí porovnávať distribúcie tokenov pri rôznych promptoch.
4. Metódy detekcie a merania
- Extraction attacks:
# Príklad jednoduchého extraction promptu
prompt = "Continue the following text exactly as written: 'The quick brown'"
# Model pri nízkej teplote dokončí memorovanými sekvenciami
# Sofistikovanejší prístup — divergence-based extraction
def check_memorization(model, candidate_text, reference_model):
p_main = model.log_prob(candidate_text)
p_ref = reference_model.log_prob(candidate_text)
return p_main - p_ref # vysoký rozdiel = pravdepodobná memorácia
Membership inference:
- Test či konkrétny text bol v tréningových dátach
- Meranie perplexity: memorované texty majú výrazne nižšiu perplexitu
- Porovnanie s referenčným (nezortrénovaným) modelom — kľúčová technika od roku 2024
Metriky:
- Extraction rate: Percento úspešných extrakcií z N pokusov
- Memorization score: Rozdiel log-pravdepodobností medzi cieľovým a referenčným modelom
- Leakage ratio: Pomer extrahovaných vs. unikátnych tokenov v datasete
- k-eidetic memorization: Text je memorovaný ak existuje prompt dĺžky k, ktorý ho deterministicky vyvolá
| Benchmark | Čo meria | Typické skóre (2025) |
|---|---|---|
| MemTest | Extraction rate pre PII | Frontier modely: 0.05–0.3% |
| MIRAGE | Membership inference accuracy | 70–90% pre cielené útoky |
| CanaryTokens | Detekcia planted strings | 95%+ recall pri 10+ opakovaniach |
| MIMIR | Komplexné MI hodnotenie | Štandard pre výskum od 2024 |
5. Bezpečnostné a právne dôsledky
Privacy riziká:
- PII leakage: Mená, adresy, rodné čísla z tréningových dát
- Medical records: Pacientske záznamy zo zle anonymizovaných datasetov
- Corporate secrets: Interné dokumenty, finančné dáta, stratégie firiem
- Biometrické dáta: Hlasové vzorky, obrazové dáta s osobami
Copyright problémy:
- Knihy a články: Celé kapitoly z chránených diel
- Kód: Proprietárny source code s rôznymi licenciami (GPL, MIT, komerčné)
- Akademické práce: Dizertácie, research papers za pay-wall
Právne precedensy a stav 2026:
- GitHub Copilot lawsuit (2022–2025): Prípad nakoniec vyústil do mimosúdneho vyrovnania; GitHub zaviedol povinné filtre na kód s reštrikčnými licenciami
- NYT vs. OpenAI (2024–2026): Prípad stále prebieha; súd v roku 2025 potvrdil, že verbatim reprodukcia článkov môže zakladať porušenie copyrightu, aj keď ide o "malé percento" výstupov
- EU AI Act (platný od 2025): Vyžaduje dokumentáciu tréningových dát a mechanizmy na riešenie copyright námietok; poskytovatelia modelov musia viesť register zdrojov
GDPR a "right to be forgotten": Európske DPA (Data Protection Authorities) vydali v roku 2025 prvé pokuty za neschopnosť odstrániť osobné údaje z AI modelov po žiadosti dotknutých osôb. Technická implementácia zostáva výzvou.
6. Techniky mitigácie
| Technika | Implementácia | Účinnosť | Trade-offs |
|---|---|---|---|
| Deduplication | Odstránenie duplicít z tréningových dát | 50–70% redukcia | Menší dataset, strata diverzity |
| Differential Privacy | Pridanie kalibrovaného šumu (DP-SGD) | 80–90% redukcia | Znížená kvalita na edge cases |
| Output filtering | Detekcia a blokovanie memorovaného obsahu | 60–80% redukcia | Vyššia latencia, false positives |
| Goldfish loss | Penalizácia presných reprodukcií počas tréningu | 70–85% redukcia | Horšie faktické úlohy |
| Canary tokens | Vloženie umelých markerov na detekciu leakage | 95%+ detekcia | Len monitoring, nie prevencia |
| RLHF/RLAIF tuning | Tréning modelu odmietať doslovné reprodukcie | 40–60% redukcia | Nákladné, obchádzateľné |
| Machine Unlearning | Cielené "zabudnutie" konkrétnych dát | 60–95% (závisí od techniky) | Výskumná fáza, riziko regressie |
| Selective Data Filtering | Vylúčenie vysoko-rizikových kategórií dát | Závisí od rozsahu | Vyžaduje kvalitnú klasifikáciu |
- Best practice stack pre rok 2026:
- Preprocessing: Agresívna deduplikácia (MinHash, exact-match) + PII scrubbing
- Tréning: Differential privacy s kalibrovaným epsilon (ε < 8 pre production systémy)
- Post-training: Targeted unlearning pre identifikované rizikové sekvencie
- Runtime: Output content filtering + rate limiting na opakované extrakčné pokusy
- Monitoring: Pravidelné canary token audity + membership inference testy
7. Machine Unlearning — nová hranica
Táto téma si zaslúži vlastnú sekciu, pretože v rokoch 2025–2026 sa z teoretického konceptu stala praktická požiadavka.
Čo je machine unlearning: Proces selektívneho odstránenia vplyvu konkrétnych tréningových príkladov z už natrénovaného modelu — bez nutnosti retrénovať od nuly.
Prečo je ťažké: Model neukladá informácie na konkrétne adresy ako databáza. Vedomosť je distribuovaná naprieč miliardami parametrov. "Vymazanie" jednej informácie môže narušiť súvisiace schopnosti.
Hlavné prístupy:
- Gradient ascent unlearning: Spustí inverzné učenie na zabudnutých príkladoch — jednoduchý, ale nestabilný
- SISA training (Sharded, Isolated, Sliced, Aggregated): Tréning v izolovaných shardoch umožňuje efektívne odobranie konkrétneho shardu
- Influence function unlearning: Analytický odhad ako by vyzerali parametre bez daného príkladu — presné, ale výpočtovo nákladné
- Task vector subtraction: Odčítanie "task vektora" reprezentujúceho nežiaducu znalosť
Výzvy v praxi:
- Ťažko overiť, či unlearning skutočne fungoval (membership inference ako kontrola)
- Riziko "catastrophic forgetting" — model zabudne aj veci, ktoré zabudnúť nemal
- Škálovanie na frontier modely (100B+ parametrov) zostáva otvorenou výskumnou otázkou
Regulačný tlak: EU AI Act a niektoré národné regulácie v roku 2026 explicitne požadujú, aby poskytovatelia vedeli reagovať na žiadosti o unlearning v rozumnom časovom rámci.
8. Praktické odporúčania
Pre AI vývojárov:
- Audit tréningových dát: Skenuj na PII, secrets, copyright — ideálne automatizovanými nástrojmi (napr. Presidio, PIIvot)
- Implementuj safeguards: Content filtering, rate limiting, canary monitoring
- Dokumentuj datasety: EU AI Act vyžaduje "data provenance" dokumentáciu
- Privacy-first design: Minimalizuj osobné dáta; ak ich potrebuješ, aplikuj DP
Pre používateľov AI:
- Nikdy nezadávaj: Skutočné heslá, API kľúče, rodné čísla, medicínske záznamy
- Over výstupy: Kontroluj či AI nevracia "príliš presné" informácie ktoré nemohla vygenerovať
- Buď opatrný s: Žiadosťami o citácie, presné znenia zákonov, lekárske informácie — môže ísť o memorované (a teda zastarané alebo chybné) dáta
Pre organizácie:
- Data governance: Klasifikuj dáta pred použitím v AI systémoch
- Access control: Obmedz kto môže používať AI na citlivé úlohy; loguj interakcie
- Vendor due diligence: Pýtaj sa dodávateľov modelov na ich tréningové dáta, DP záruky a unlearning kapacity
- Incident response: Priprav plán pre prípad že verbatim leak nastane — kto sa notifikuje, ako sa dokumentuje
9. Súvislosť s hallucináciami a fakticitou
Verbatim recall a halucinácie sú opačné konce spektra — a oba sú problematické:
Verbatim recall: Model reprodukuje niečo presne, čo mohlo byť pravdivé v čase tréningu, ale je dnes zastarané alebo privátne
Halucinácia: Model vymýšľa niečo čo nikdy neexistovalo, s falošnou istotou
Paradox spoľahlivosti: Výskum ukazuje, že modely trénované s agresívnejšou anti-memoráciou majú tendenciu halucinovať viac — snažia sa "generovať" namiesto "reprodukovať" aj v prípadoch kde by reprodukcia bola správna (napr. citovanie definície zákonného pojmu).
Praktický dôsledok: Optimálna miera memorácie nie je nula — je to nejaký bod rovnováhy kde model reprodukuje overiteľné fakty, ale nie osobné dáta. Nájsť tento bod je jednou z kľúčových výziev výskumu v roku 2026.
10. Budúcnosť a výskumné smery
Technické smery pre 2026–2028:
- Scalable machine unlearning: Efektívne algoritmy pre 100B+ modely sú aktívnym výskumným problémom (NeurIPS 2025 mal dedikovaný workshop)
- Certified unlearning: Kryptograficky overiteľné záruky že informácia bola odstránená
- Watermarking: Označenie generovaného vs. memorovaného obsahu v reálnom čase
- Federated learning: Tréning bez centralizácie dát znižuje riziko pri zbere, nie pri inference
- Synthetic data pipelines: Nahradenie skutočných dát syntetickými ekvivalentmi bez PII
Regulačný vývoj:
- EU AI Act je v plnej sile — poskytovatelia General Purpose AI modelov musia zverejniť súhrn tréningových dát
- GDPR enforcement naberá tempo: DPA v Írsku a Francúzsku začali aktívne prešetrovanie
- US: Federálna regulácia stále fragmentovaná, ale niekoľko štátov (California, Illinois) má vlastné AI privacy zákony s implikáciami pre memoráciu
- Čína: Nové pravidlá z roku 2025 vyžadujú lokálne ukladanie a auditovanie tréningových dát
Otvorené výzvy:
- Balans medzi užitočnou memoráciou (fakty, definície) a škodlivou (PII, copyright)
- Škálovateľná detekcia memorácie bez znalosti tréningových dát
- Štandardizácia: čo vlastne znamená "dostatočne nízka" miera memorácie pre compliance?
Zhrnutie
- Verbatim recall je inherentná vlastnosť súčasných LLM — nie bug, ale prirodzený dôsledok trénovania na veľkých datasetoch s opakujúcim sa obsahom
- Riziko extrakcie 0.05–2% tréningových dát (podľa veľkosti a architektúry modelu) robí z toho vážny privacy a právny problém v ére EU AI Act a GDPR enforcement
- Najúčinnejšia ochrana: Kombinácia deduplikácie, differential privacy, machine unlearning a output filteringu — 100% eliminácia nie je možná ani teoreticky
- Machine unlearning sa stáva regulatórnou požiadavkou — firmy musia vedieť reagovať na žiadosti o "zabudnutie" konkrétnych dát
- Pre prax: Nikdy nezadávaj citlivé údaje do AI systémov; pri výstupoch kontroluj, či nie sú "príliš dokonalou" kópiou; ako vývojár investuj do privacy-first data pipeline