Terminal-Bench 2.0
Terminal-Bench 2.0 je „hard" benchmark — sada úloh a hodnotiaci harness — ktorý meria, ako dobre si AI agent poradí s reálnymi, viac-krokovými úlohami priamo v termináli / CLI. Nejde o písanie textu či kódu na papieri: agent musí naozaj vykonávať príkazy, pracovať so súbormi, buildovať projekty, debugovať chyby, nastavovať služby a úspešne prejsť verifikačnými testami v izolovaných kontajneroch.
V roku 2026 sa Terminal-Bench 2.0 etabloval ako jeden z mála benchmarkov, kde nestačí „znieť správne" — výsledok je buď funkčný, alebo nie. To z neho robí cenný nástroj pre každého, kto chce porovnávať reálnu schopnosť agentov na produkčne podobných workflowoch.
1. Prečo Terminal-Bench (a prečo 2.0)
Väčšina jazykových benchmarkov (MMLU, HumanEval, GSM8K a pod.) meria schopnosť modelu odpovedať — generovať správny text alebo kód. Terminal-Bench ide ďalej: meria schopnosť agenta konať v prostredí s reálnym stavom.
Verzia 1.0 ukázala, že myšlienka funguje, ale narazila na problémy:
- úlohy závislé od externých služieb prestávali fungovať po týždňoch,
- niektoré testy boli príliš krehké (flaky),
- chýbal štandardný spôsob škálovania behov.
Verzia 2.0 tieto problémy priamo adresuje:
- 89 starostlivo kurátorovaných úloh s plne izolovanými kontajnerovými prostrediami,
- rozšírené validačné testy na každú úlohu (nielen jeden assertion),
- oficiálny harness Harbor na reprodukovateľné a škálovateľné spúšťanie,
- lepšia dokumentácia referenčných riešení pre debugovanie zlyhání.
2. Kategórie úloh — čo agent musí zvládnuť
Úlohy v Terminal-Bench 2.0 pokrývajú reálne oblasti inžinierskej práce. Nie sú to abstraktné puzzle — sú to zmenšené verzie vecí, ktoré robí senior engineer alebo DevOps špecialistu.
| Kategória | Príklady úloh | Typická náročnosť |
|---|---|---|
| Systémová administrácia | konfigurácia služieb, správa oprávnení, cron joby | stredná |
| Build & CI | oprava rozbitého buildu, nastavenie závislostí, Docker multi-stage | vysoká |
| Debugovanie | nájdenie a oprava runtime chýb, analýza log súborov | vysoká |
| Sieťovanie & API | volanie REST endpointov, parsovanie odpovedí, retry logika | stredná |
| Dáta & skripty | transformácia dát, pipeline v Bashu/Pythone, práca s CSV/JSON | stredná |
| Bezpečnosť | audit oprávnení, detekcia misconfigurácie, základná hardening | veľmi vysoká |
| DevOps automatizácia | nasadenie aplikácie, rollback, health check integrácii | vysoká |
Každá úloha dostane skóre 0 alebo 1 — prešla, alebo nie. Výsledkom je celkový success rate (podiel úspešných úloh), čo umožňuje priame porovnanie medzi agentmi a modelmi.
3. Ako to funguje — architektúra od úlohy po skóre
Každá úloha v Terminal-Bench 2.0 má štyri komponenty:
- Zadanie v prirodzenom jazyku — agent dostane inštrukcie tak, ako by mu ich dal človek cez Slack alebo README.
- Kontajnerizované prostredie — Docker sandbox s presne definovaným stavom (nainštalované balíky, súbory, konfigurácie).
- Verifikačné testy — sada automatizovaných testov, ktoré objektivne overia, či agent splnil zadanie.
- Referenčné riešenie (oracle) — správne riešenie použité pri vývoji testov a pri debugovaní pochybných výsledkov.
Priebeh jedného behu:
Harbor → spustí kontajner → vloží agenta → agent vykonáva CLI kroky → testy prebehú → 0/1 výsledok
Harbor zaznamenáva celý priebeh — každý príkaz, každý výstup — čo umožňuje analýzu prečo agent zlyhal, nielen že zlyhal.
4. Technické nastavenie a spúšťanie
Požiadavky
- Docker (lokálne behy) alebo cloudový runtime (pre škálovanie)
- Python 3.10+ s
pipalebouv - API kľúče pre modely, ktoré chceš testovať
Inštalácia
# Odporúčaný spôsob cez uv
uv tool install harbor
# Alternatíva cez pip
pip install harbor
Základné príkazy
# Zoznam dostupných datasetov
harbor datasets list
# Spustenie Terminal-Bench 2.0 (šablóna)
harbor run \
--dataset terminal-bench@2.0 \
--agent <agent> \
--model <model> \
--n-concurrent 4
# Pomoc a všetky parametre
harbor run --help
Dôležité parametre
| Parameter | Popis | Odporúčanie |
|---|---|---|
--n-concurrent |
Počet paralelných úloh | 4–8 lokálne, 16+ v cloude |
--dataset |
Verzia datasetu | terminal-bench@2.0 |
--agent |
Typ agenta (napr. claude, openai) | závisí od testu |
--model |
Konkrétny model | napr. claude-sonnet-4-6 |
--output-dir |
Kam sa uložia výsledky a logy | odporúča sa nastaviť vždy |
API kľúče sa nastavujú cez environment premenné:
export ANTHROPIC_API_KEY="sk-ant-..."
export OPENAI_API_KEY="sk-..."
5. Výsledky a kontext v roku 2026
Terminal-Bench 2.0 sa stal de facto štandardom pre meranie „agentic CLI capability". Leaderboardy sú verejne dostupné a aktualizujú sa s každým majoritným vydaním modelov.
Trendy pozorované v roku 2026:
- Modely Claude 4.x a GPT-5 klasy dosahujú výrazne vyššie success rates ako modely z roku 2024 — zlepšenie v kontexte dlhých multi-krokových úloh je merateľné.
- Debugovacie úlohy zostávajú najtažšou kategóriou pre všetky modely — vyžadujú kombináciu sledovania stavu, hypotéz a iterácie.
- Jednoduché administračné úlohy (kategória „systémová administrácia") sú dnes riešené spoľahlivo aj menšími modelmi.
- Rozdiely medzi modelmi sú najväčšie práve v bezpečnostných a DevOps úlohách — tu sa prejaví, či agent naozaj rozumie dôsledkom svojich príkazov.
Terminal-Bench 2.0 sa líši od benchmarkov ako SWE-bench (oprava GitHub issues) alebo WebArena (webová navigácia) tým, že sa zameriava výhradne na terminálové prostredie — bez GUI, bez browserov, len CLI a súborový systém.
6. Bezpečnosť a súkromie pri spúšťaní
Aj keď sú úlohy v sandboxe, spúšťanie agentov v termináli prináša špecifické riziká, ktoré treba vedome riadiť:
- Nepoužívaj reálne sekrety v eval prostredí. API kľúče pre produkčné systémy nikdy nevkladaj do kontajnerov určených na benchmarking.
- Nastav sieťový egress. Niektoré prostredia Terminal-Bench 2.0 vyžadujú sieťový prístup, iné nie. Obmedz egress na minimum potrebné pre konkrétnu úlohu.
- Sanitizuj logy pred zdieľaním. Výpisy z behov môžu obsahovať citlivé hodnoty (cesty, tokeny v error messages, environment premenné).
- Izoluj Docker runtime. Spúšťaj behy v prostredí s obmedzenými hostiteľskými oprávneniami — rootless Docker alebo dedikovaný VM je bezpečnejší.
- Monitoruj spotrebu compute. Paralelné behy s veľkým
--n-concurrentmôžu neočakávane vyčerpať disk alebo RAM — nastav resource limity na úrovni Dockeru.
7. Dostupnosť, licencie a ekosystém
Open-source repozitáre:
terminal-bench— úlohy, ekosystém, pôvodná CLI/harness vetvaharbor— framework na spúšťanie a škálovanie evalov v kontajneroch
Licencia: kód harnessu a frameworku je dostupný pod Apache-2.0. Samotné úlohy a datasety majú vlastnú licenciu — skontroluj repozitár pred komerčným použitím.
Integrácie:
- Inspect Evals (od UK AI Safety Institute) — Terminal-Bench 2.0 je dostupný ako balík evalov v tomto ekosystéme
- Kompatibilita s vlastnými agentmi cez štandardizované Harbor rozhranie
Skutočné náklady nevznikajú licenčne, ale operačne:
- API usage — pri komerčných modeloch (Anthropic, OpenAI, Google) sa náklady rýchlo nasčítajú pri 89 úlohách × viacero behov
- Compute — lokálne behy sú zadarmo (okrem elektriny), cloudové škálovanie má vlastné náklady
- Odporúča sa začať s malou podmnožinou úloh (
--subset) pri ladení agenta pred plným behom
8. Quick Reference
# Inštalácia
uv tool install harbor
# Zoznam datasetov
harbor datasets list
# Plný beh Terminal-Bench 2.0
harbor run \
--dataset terminal-bench@2.0 \
--agent claude \
--model claude-sonnet-4-6 \
--n-concurrent 4 \
--output-dir ./results
# Pomoc
harbor run --help
Zhrnutie
Terminal-Bench 2.0 je v roku 2026 jeden z najrelevantnejších benchmarkov pre meranie reálnej schopnosti AI agentov. Zatiaľ čo väčšina benchmarkov meria vedomosti, Terminal-Bench meria schopnosť konať — v prostredí, kde záleží na každom príkaze a každom vedľajšom efekte.
Kľúčové vlastnosti:
- 89 kurátorovaných úloh pokrývajúcich engineering, DevOps, debugovanie a automatizáciu
- Objektívne 0/1 skórovanie — bez subjektivity, plne reprodukovateľné
- Harbor harness — lokálne aj cloudové škálovanie s jedným príkazom
- Open-source pod Apache-2.0, s aktívnou komunitou a verejnými leaderboardmi
Pre každého, kto vyvíja alebo hodnotí AI agentov na reálne inžinierske úlohy, je Terminal-Bench 2.0 dnes štandardným referenčným bodom.