ベンチマーク / データセット

エージェントを比較するための標準タスクとデータセット。方向性の把握には有用ですが、順位を選定基準にする前に、そのベンチマークが実際に何を測っているかを確認してください。

10件

promptfoo可観測性

テストケースはYAMLです。プロンプト、いくつかの入力、そして出力に対する表明を書きます。それだけで、同じ入力に対して複数のプロンプトやモデルを並べた比較表が得られ、変更で品質が下がったときにビルドを失敗させられます。同じツールがアプリケーションへの攻撃も行い、敵対的な入力を生成して脆弱性やコンプライアンス上のリスクを洗い出します。ただし外側から、プロンプトを入れて回答を見る形で動きます。稼働中のエージェントのどの段階で問題が起きたかを知りたい場合、この道具は向きません。

公式MIT24.6k+208
DeepEval可観測性

形は意図的にpytestそのものです。テスト関数の中に表明を書き、それを発見して実行するランナーがあり、引数を変えたケースも書けます。違うのは、表明の対象が「回答が文脈に忠実だったか」「エージェントがタスクを完了したか」である点です。この形にした狙いは明確で、品質の劣化を、構文エラーを捕まえるのと同じ関門の前に持ち込むことにあります。想定しておくべきなのは、これらの指標の多くがモデルによって採点されることです。通常のテストには無い費用とばらつきが伴います。

公式Apache-2.017.9k+174
camelマルチエージェント制御

CAMELは、エージェント同士に会話をさせることを出発点にした研究寄りのライブラリです。RolePlayingは指示を出す側と実行する側の2つのエージェントを組ませ、Workforceでは調整役が分割したサブタスクを複数の作業者へ配ります。その周囲には、80を超えるツール群、約50のモデル接続、GAIAやBrowseCompなどのベンチマーク実行環境、対話の記録を微調整用データセットへ変換するパイプラインが揃っています。実験を回す用途ならこの幅広さ自体が強みですが、本番で1つのエージェントを堅実に動かしたいだけなら使わない部分を大量に抱え込むことになりますし、2023年の公開以来バージョンは0.2系のままです。

公式Apache-2.017.7k+35
garakガードレール

チャットボットやモデルに向けると、プロンプトインジェクション、脱獄、符号化による回避、データ漏洩と再現、有害表現、誤った推論といった攻撃の系統を順に試し、どれが通ってしまったかを報告します。攻撃、判定、対象への接続を別々の部品として保つ設計により、新しいプローブや新しいバックエンドを、他を書き換えずに追加できます。担うのはセキュリティの発見側であって修正側ではありません。出力が示すのは、どのプローブが成功したかであり、それに対してどんな方針を書くべきかではありません。

公式Apache-2.09.1k+177
SWE-benchベンチマーク

課題はコードベースとIssueを与えてパッチを求めるもので、失敗していたテストが通り、通っていたテストが通ったままである場合にのみ合格とします。判定にプロジェクト自身のテスト群を使うため、採点基準による評価ではなく具体的な意味を持つ結果になります。その分、測っている範囲は限定的です。誰かが既に発見し、起票し、説明した問題に対する修正を書けるかどうかであり、何を作るかの判断、レビュー、Issueという手掛かりなしにコードベースを辿る力は対象外です。

公式MIT5.7k+51
AgentBenchベンチマーク

うまく答えられるモデルが、何かを操作させると使い物にならないことはあります。問答形式のベンチマークではそれが見えません。AgentBenchは、反応が返ってくる環境の中にモデルを置きます。作業しなければならないシェル、問い合わせを組み立てるデータベース、知識グラフ、テキストの世界、そして正しい商品が注文されて初めて成功となる買い物サイトです。採点の基準は課題を達成できたかどうかで、推論の読みやすさではありません。現行版はこれらの環境をコンテナとして動かし、関数呼び出し形式で操作させるため、自前の機材で再現できます。ただし公開されている実務上の注意もあり、約16GBのメモリを要する環境や、ワーカーを再起動するまで資源を消費し続ける環境が含まれます。

Apache-2.03.7k
OSWorldベンチマーク

コンピュータ操作系のプロジェクトが揃って引用する共通尺度であり、重みを持つ理由は環境が本物である点にあります。仮想マシン上のUbuntuまたはWindowsで実際のアプリケーションが動き、VMware、VirtualBox、KVM付きのDocker、並列実行用のAWS・Azure・Modalから利用できます。その現実性は同時に費用でもあり、導入にはハイパーバイザ、仮想マシンイメージ、中断した実行の後始末が伴います。結果は版にも敏感です。Verifiedへの更新で課題と評価信号が変わっており、プロジェクトは再実行後の数値と比較するよう求めています。

公式Apache-2.03.1k+11
Inspect AIベンチマーク

この分類の他の項目がそれぞれ1つの計測であるのに対し、これは計測を作るための機構です。データセットが入力と正解を与え、ソルバーが応答を生成し、スコアラーが正誤を判定し、タスクがこの3つを束ねます。ソルバーは単一のモデル呼び出しでも、多ターンのエージェント全体でも構いません。200を超える既製の評価が同梱され、モデルが書いたコードはサンドボックス内で実行され、ログビューアで各サンプルの実際の経過を確認できます。できないのは、何を測る価値があるかを教えてくれることです。

公式MIT2.7k+59
Windows Agent Arenaベンチマーク

デスクトップ操作エージェントのベンチマークはほぼLinux上で動く一方、商業的に重要なデスクトップの大半はWindowsです。これはその隙間に対するMicrosoftの答えで、再現可能なWindows環境に、人が実際に使うアプリケーションを対象とした課題を並べ、達成できたかどうかで採点します。有用なのは並列実行です。クラウドのマシンに分散させられるため、数百件の課題が1日以上ではなく数分で終わります。発表時だけでなく開発中にも回せるのはこのためです。ただし前提にする前に最終更新日を確認してください。これは2024年の論文に紐づく研究成果物で、その後の動きは緩やかです。

公式MIT891
Terminal-Benchベンチマーク

飽和して差が付かなくなる固定セットではなく、継続的に更新されるベンチマークです。課題は時間とともに追加・修正され、データセットはタグ付きリリースとして公開され、Harborという別の実行基盤から動かします。この設計が強みであり同時に厄介さでもあります。データセットの版を伴わない数字はほとんど意味を持たず、1.0は独立したリポジトリにあって元のURLはそちらへ転送されます。さらに、結果を信頼する前に、まず模範解答を繰り返し実行して自分のサンドボックスが健全かを確かめる手順が案内されています。

公式Apache-2.0556+32