
Terminal-Bench
ターミナル型エージェントが実際に置かれる環境、すなわちコンテナ内のシェルで能力を測る
Terminal-Benchとは
飽和して差が付かなくなる固定セットではなく、継続的に更新されるベンチマークです。課題は時間とともに追加・修正され、データセットはタグ付きリリースとして公開され、Harborという別の実行基盤から動かします。この設計が強みであり同時に厄介さでもあります。データセットの版を伴わない数字はほとんど意味を持たず、1.0は独立したリポジトリにあって元のURLはそちらへ転送されます。さらに、結果を信頼する前に、まず模範解答を繰り返し実行して自分のサンドボックスが健全かを確かめる手順が案内されています。
Terminal-Benchで何ができますか?
- 1コマンドでエージェントを走らせる — Harborがデータセットを取得して実行します。どのエージェントとどのモデルを対象にするかはフラグで指定するため、2つのモデルの比較は環境の作り直しではなく引数の変更で済みます。
- 数字を信じる前にサンドボックスを検証する — 案内されている最初の手順は、模範解答を複数回実行して全課題が自分の環境で正しく動くことを確認することです。模範解答が不安定なら、出てくるスコアは自分のインフラを測っていることになります。
- クラウドで実際の並列度で回す — 実行環境としてModalに対応し、数百件の同時実行が可能です。課題群の通し実行が一晩がかりではなく一区切りの時間で終わるのはこのためです。
- 動き続ける最前線を追う — 課題は継続的に追加・修正され、タグ付きのデータセットとして公開されます。エージェントの性能向上に対して、上限に張り付かず差を付け続けられます。
- 納得できない課題を直す — 課題の不具合はIssueとして報告し、改善や新規課題はプルリクエストとして提出します。ロードマップも公開されており、課題群は与えられるものではなく編集できるものです。
Terminal-Benchを選ぶ前に
- データセットは実行基盤とは別に版管理され、設計上変わり続けます。Terminal-Benchのスコアは、どのデータセット版で得たかを双方が明示して初めて比較できます。
- 1.0は別リポジトリにあり、元のプロジェクトURLは現在こちらではなくそちらへ転送されます。過去に公開された結果は、どちらで得たものかを確認する必要があります。
スター推移
8月21日〜8月28日 · +32
よくある質問
Terminal-Benchは商用利用できますか?
Terminal-BenchはApache-2.0ライセンスで公開されています。OSI承認のオープンソースライセンスで、商用利用が認められています。
Terminal-Benchはどの形で使えますか?
Terminal-Benchはローカル実行・セルフホストの形で利用できます。
ドキュメント
harbor-framework/terminal-bench のREADMEより転載(Apache-2.0)。 原文を読む ↗
Terminal-Bench
Terminal-Bench is a benchmark designed to measure the frontier of agent work with a diverse, difficult, high quality set of tasks that evolve over time. All frontier agent builders use Terminal-Bench to track progress and compare capabilities.
Terminal-Bench is a continuous benchmark, with tagged releases published on the Harbor Hub. Open an issue to report any task bugs and open a PR for task improvements or new tasks. Our roadmap is publicly visible.
Tasks
The latest published version of the dataset is available on the Harbor Hub.
Running the Benchmark
Install Harbor and run the oracle solutions 5x to confirm all tasks work as expected in your the sandboxing environment. We develop our tasks using Modal in our CI/CD and leaderboard experiments - if the oracle flakes on your setup, please open an issue.
uv tool install 'harbor[modal]'
uv run harbor run -d terminal-bench/terminal-bench@latest \
-k 5 \
--agent oracle \
--n-concurrent 500 \
--env modal
To test an agent and model, pass --agent and --model:
uv run harbor run -d terminal-bench/terminal-bench@latest \
--agent claude-code \
--model anthropic/claude-fable-5 \
--ak reasoning_effort=max \
--n-concurrent 100 \
--env modal
If your agent runs encounter any problems, please open an issue.
Resources
- Harbor Documentation: learn more about the framework that Terminal-Bench is built on
- Dataset & leaderboard: Terminal-Bench on Harbor Hub
- Discord: join the terminal-bench channel for questions or contributions