Terminal-Bench 2.0

Terminal-Bench 2.0 je „hard" benchmark — sada úloh a hodnotiaci harness — ktorý meria, ako dobre si AI agent poradí s reálnymi, viac-krokovými úlohami priamo v termináli / CLI. Nejde o písanie textu či kódu na papieri: agent musí naozaj vykonávať príkazy, pracovať so súbormi, buildovať projekty, debugovať chyby, nastavovať služby a úspešne prejsť verifikačnými testami v izolovaných kontajneroch.

V roku 2026 sa Terminal-Bench 2.0 etabloval ako jeden z mála benchmarkov, kde nestačí „znieť správne" — výsledok je buď funkčný, alebo nie. To z neho robí cenný nástroj pre každého, kto chce porovnávať reálnu schopnosť agentov na produkčne podobných workflowoch.


1. Prečo Terminal-Bench (a prečo 2.0)

Väčšina jazykových benchmarkov (MMLU, HumanEval, GSM8K a pod.) meria schopnosť modelu odpovedať — generovať správny text alebo kód. Terminal-Bench ide ďalej: meria schopnosť agenta konať v prostredí s reálnym stavom.

Verzia 1.0 ukázala, že myšlienka funguje, ale narazila na problémy:

  • úlohy závislé od externých služieb prestávali fungovať po týždňoch,
  • niektoré testy boli príliš krehké (flaky),
  • chýbal štandardný spôsob škálovania behov.

Verzia 2.0 tieto problémy priamo adresuje:

  • 89 starostlivo kurátorovaných úloh s plne izolovanými kontajnerovými prostrediami,
  • rozšírené validačné testy na každú úlohu (nielen jeden assertion),
  • oficiálny harness Harbor na reprodukovateľné a škálovateľné spúšťanie,
  • lepšia dokumentácia referenčných riešení pre debugovanie zlyhání.

2. Kategórie úloh — čo agent musí zvládnuť

Úlohy v Terminal-Bench 2.0 pokrývajú reálne oblasti inžinierskej práce. Nie sú to abstraktné puzzle — sú to zmenšené verzie vecí, ktoré robí senior engineer alebo DevOps špecialistu.

Kategória Príklady úloh Typická náročnosť
Systémová administrácia konfigurácia služieb, správa oprávnení, cron joby stredná
Build & CI oprava rozbitého buildu, nastavenie závislostí, Docker multi-stage vysoká
Debugovanie nájdenie a oprava runtime chýb, analýza log súborov vysoká
Sieťovanie & API volanie REST endpointov, parsovanie odpovedí, retry logika stredná
Dáta & skripty transformácia dát, pipeline v Bashu/Pythone, práca s CSV/JSON stredná
Bezpečnosť audit oprávnení, detekcia misconfigurácie, základná hardening veľmi vysoká
DevOps automatizácia nasadenie aplikácie, rollback, health check integrácii vysoká

Každá úloha dostane skóre 0 alebo 1 — prešla, alebo nie. Výsledkom je celkový success rate (podiel úspešných úloh), čo umožňuje priame porovnanie medzi agentmi a modelmi.


3. Ako to funguje — architektúra od úlohy po skóre

Každá úloha v Terminal-Bench 2.0 má štyri komponenty:

  1. Zadanie v prirodzenom jazyku — agent dostane inštrukcie tak, ako by mu ich dal človek cez Slack alebo README.
  2. Kontajnerizované prostredie — Docker sandbox s presne definovaným stavom (nainštalované balíky, súbory, konfigurácie).
  3. Verifikačné testy — sada automatizovaných testov, ktoré objektivne overia, či agent splnil zadanie.
  4. Referenčné riešenie (oracle) — správne riešenie použité pri vývoji testov a pri debugovaní pochybných výsledkov.

Priebeh jedného behu:

Harbor → spustí kontajner → vloží agenta → agent vykonáva CLI kroky → testy prebehú → 0/1 výsledok

Harbor zaznamenáva celý priebeh — každý príkaz, každý výstup — čo umožňuje analýzu prečo agent zlyhal, nielen že zlyhal.


4. Technické nastavenie a spúšťanie

Požiadavky

  • Docker (lokálne behy) alebo cloudový runtime (pre škálovanie)
  • Python 3.10+ s pip alebo uv
  • API kľúče pre modely, ktoré chceš testovať

Inštalácia

# Odporúčaný spôsob cez uv
uv tool install harbor

# Alternatíva cez pip
pip install harbor

Základné príkazy

# Zoznam dostupných datasetov
harbor datasets list

# Spustenie Terminal-Bench 2.0 (šablóna)
harbor run \
  --dataset terminal-bench@2.0 \
  --agent <agent> \
  --model <model> \
  --n-concurrent 4

# Pomoc a všetky parametre
harbor run --help

Dôležité parametre

Parameter Popis Odporúčanie
--n-concurrent Počet paralelných úloh 4–8 lokálne, 16+ v cloude
--dataset Verzia datasetu terminal-bench@2.0
--agent Typ agenta (napr. claude, openai) závisí od testu
--model Konkrétny model napr. claude-sonnet-4-6
--output-dir Kam sa uložia výsledky a logy odporúča sa nastaviť vždy

API kľúče sa nastavujú cez environment premenné:

export ANTHROPIC_API_KEY="sk-ant-..."
export OPENAI_API_KEY="sk-..."

5. Výsledky a kontext v roku 2026

Terminal-Bench 2.0 sa stal de facto štandardom pre meranie „agentic CLI capability". Leaderboardy sú verejne dostupné a aktualizujú sa s každým majoritným vydaním modelov.

Trendy pozorované v roku 2026:

  • Modely Claude 4.x a GPT-5 klasy dosahujú výrazne vyššie success rates ako modely z roku 2024 — zlepšenie v kontexte dlhých multi-krokových úloh je merateľné.
  • Debugovacie úlohy zostávajú najtažšou kategóriou pre všetky modely — vyžadujú kombináciu sledovania stavu, hypotéz a iterácie.
  • Jednoduché administračné úlohy (kategória „systémová administrácia") sú dnes riešené spoľahlivo aj menšími modelmi.
  • Rozdiely medzi modelmi sú najväčšie práve v bezpečnostných a DevOps úlohách — tu sa prejaví, či agent naozaj rozumie dôsledkom svojich príkazov.

Terminal-Bench 2.0 sa líši od benchmarkov ako SWE-bench (oprava GitHub issues) alebo WebArena (webová navigácia) tým, že sa zameriava výhradne na terminálové prostredie — bez GUI, bez browserov, len CLI a súborový systém.


6. Bezpečnosť a súkromie pri spúšťaní

Aj keď sú úlohy v sandboxe, spúšťanie agentov v termináli prináša špecifické riziká, ktoré treba vedome riadiť:

  • Nepoužívaj reálne sekrety v eval prostredí. API kľúče pre produkčné systémy nikdy nevkladaj do kontajnerov určených na benchmarking.
  • Nastav sieťový egress. Niektoré prostredia Terminal-Bench 2.0 vyžadujú sieťový prístup, iné nie. Obmedz egress na minimum potrebné pre konkrétnu úlohu.
  • Sanitizuj logy pred zdieľaním. Výpisy z behov môžu obsahovať citlivé hodnoty (cesty, tokeny v error messages, environment premenné).
  • Izoluj Docker runtime. Spúšťaj behy v prostredí s obmedzenými hostiteľskými oprávneniami — rootless Docker alebo dedikovaný VM je bezpečnejší.
  • Monitoruj spotrebu compute. Paralelné behy s veľkým --n-concurrent môžu neočakávane vyčerpať disk alebo RAM — nastav resource limity na úrovni Dockeru.

7. Dostupnosť, licencie a ekosystém

Open-source repozitáre:

  • terminal-bench — úlohy, ekosystém, pôvodná CLI/harness vetva
  • harbor — framework na spúšťanie a škálovanie evalov v kontajneroch

Licencia: kód harnessu a frameworku je dostupný pod Apache-2.0. Samotné úlohy a datasety majú vlastnú licenciu — skontroluj repozitár pred komerčným použitím.

Integrácie:

  • Inspect Evals (od UK AI Safety Institute) — Terminal-Bench 2.0 je dostupný ako balík evalov v tomto ekosystéme
  • Kompatibilita s vlastnými agentmi cez štandardizované Harbor rozhranie

Skutočné náklady nevznikajú licenčne, ale operačne:

  • API usage — pri komerčných modeloch (Anthropic, OpenAI, Google) sa náklady rýchlo nasčítajú pri 89 úlohách × viacero behov
  • Compute — lokálne behy sú zadarmo (okrem elektriny), cloudové škálovanie má vlastné náklady
  • Odporúča sa začať s malou podmnožinou úloh (--subset) pri ladení agenta pred plným behom

8. Quick Reference

# Inštalácia
uv tool install harbor

# Zoznam datasetov
harbor datasets list

# Plný beh Terminal-Bench 2.0
harbor run \
  --dataset terminal-bench@2.0 \
  --agent claude \
  --model claude-sonnet-4-6 \
  --n-concurrent 4 \
  --output-dir ./results

# Pomoc
harbor run --help

Zhrnutie

Terminal-Bench 2.0 je v roku 2026 jeden z najrelevantnejších benchmarkov pre meranie reálnej schopnosti AI agentov. Zatiaľ čo väčšina benchmarkov meria vedomosti, Terminal-Bench meria schopnosť konať — v prostredí, kde záleží na každom príkaze a každom vedľajšom efekte.

Kľúčové vlastnosti:

  • 89 kurátorovaných úloh pokrývajúcich engineering, DevOps, debugovanie a automatizáciu
  • Objektívne 0/1 skórovanie — bez subjektivity, plne reprodukovateľné
  • Harbor harness — lokálne aj cloudové škálovanie s jedným príkazom
  • Open-source pod Apache-2.0, s aktívnou komunitou a verejnými leaderboardmi

Pre každého, kto vyvíja alebo hodnotí AI agentov na reálne inžinierske úlohy, je Terminal-Bench 2.0 dnes štandardným referenčným bodom.