可観測性 / 評価
エージェントが実際に何をしたかを可視化し、その実行記録を評価データセットへ変換する基盤。これがないと、本番のエージェントは改善不能なブラックボックスになります。
19件
ライブラリとしては、1つの関数呼び出しで対応プロバイダのどれにでも、OpenAI形式のリクエストとレスポンスのまま到達できます。多くのチームが導入する理由は後者のゲートウェイのほうです。自己ホストのサーバーが、個別の予算と流量制限を持つ仮想キーを発行し、プロバイダの障害時には代替へ切り替え、複数の配備先へ負荷を分散し、キーごとの費用を記録します。代償として、リクエスト経路に自分で運用する構成要素が1つ増えます。またenterpriseディレクトリ配下のコードはMITの対象外です。
追記が中心で値の種類が多いデータ——モデル呼び出しごとに1行を記録し、後からモデル名やコスト、エラーで絞り込む——に向いた列指向エンジンです。Langfuseは2024年12月にトレースの保存先をPostgreSQLからClickHouseへ移し、2026年1月にはClickHouseがLangfuseを買収したため、セルフホストの可観測性基盤を組むと下層にこれが入る構成が増えています。一方でトランザクション処理には向かず、更新や削除は行の書き換えではなく列パート単位の再作成になるため、アプリケーションの状態を書き込む先ではなく、エージェントの実行記録が着地する場所として扱ってください。
エージェントが実際に何をしたか——各呼び出し、ツール実行、コスト——を記録し、そのトレースを評価用データセットへ変換できます。マネージド版とDocker Composeでセルフホストする版が同一コードベースのため、どちらの方向にも移行コストが低いのが利点です。一部のエンタープライズ機能はMITのコア部分に含まれないため、必要な機能の提供範囲を事前に確認してください。
MLflowがエージェント向けに効いてくるのは、すでにそこにあるからです。モデルの学習管理として動かしている組織が多く、GenAI向けの機能はエージェントの実行記録、評価の実行、プロンプトの版を、その同じ実験画面に並べます。計測は多数のエージェント関連ライブラリに対して自動で行われ、1行足すだけでプロンプト、検索、ツール呼び出し、応答が記録されます。形式はOpenTelemetryのGenAI規約に沿うため、他の道具からも読めます。記録された実行はそのまま評価用のデータになり、既製の判定役や自作の判定役で採点できます。難点は、MLflowがライブラリではなく基盤である点です。実行記録だけが目的でも、データベースと成果物置き場を伴う管理サーバーを動かすことになります。
エージェントは指示文とモデルを与えて宣言し、ツールは入力と出力の両方をスキーマで検証します。ワークフローはステップを繋いで組み立て、実行状態をストレージに書き出すため、途中で中断して後から再開できます。検索・メモリ・評価・トレースが別々の部品の寄せ集めではなく同じパッケージに入っている点が魅力ですが、その広さは覚える対象の広さでもあります。またApache-2.0の範囲は、別の商用ライセンスで留保されたいくつかのディレクトリの手前で止まります。
テストケースはYAMLです。プロンプト、いくつかの入力、そして出力に対する表明を書きます。それだけで、同じ入力に対して複数のプロンプトやモデルを並べた比較表が得られ、変更で品質が下がったときにビルドを失敗させられます。同じツールがアプリケーションへの攻撃も行い、敵対的な入力を生成して脆弱性やコンプライアンス上のリスクを洗い出します。ただし外側から、プロンプトを入れて回答を見る形で動きます。稼働中のエージェントのどの段階で問題が起きたかを知りたい場合、この道具は向きません。
関数にデコレータを付けるか、クライアントを包むだけでトレースの記録が始まります。同じデータがそのまま実験機能に流れ、幻覚・回答の関連性・文脈の再現率といった指標で、手作業ではなく自動的に応答を採点します。30を超える連携が主要なフレームワークとプロバイダを覆い、ホスト型サービスとしてだけでなく、ローカルやKubernetes上でも全体を動かせます。難点は機能ではなく重複です。本カタログに既に載る2つのプラットフォームと真正面から競合するため、選択の分かれ目は不足している機能ではなく、連携先と運用形態になります。
Googleが自ら書いた運用知識を100件超のskillディレクトリに収めたリポジトリで、`npx skills add google/skills`から必要なものだけを選んで導入します。中心は`skills/cloud`で、GKEやBigQuery、Agent Platform、Well-Architected Frameworkの6つの柱までを扱い、`skills/ads`と`skills/analytics`にはGoogle Ads API、Google Mobile Ads SDK、IMA SDK、Google Analyticsの2種類のAPI向けのskillが並びます。厚みは一様ではなく、`skills/cloud/gke-*`だけで29件を占める一方、Cloud RunとFirebaseは各1件にとどまり、README自身がactive developmentの段階だと断っています。Google Cloudも広告・アナリティクス製品も使わない構成には得るものがなく、アプリ開発側の守備範囲もGoogle Mobile Ads SDKまでで、Android・Flutter・Dart・Genkit・ADKのskillはREADMEがリンクを張るだけの別リポジトリにあります。
形は意図的にpytestそのものです。テスト関数の中に表明を書き、それを発見して実行するランナーがあり、引数を変えたケースも書けます。違うのは、表明の対象が「回答が文脈に忠実だったか」「エージェントがタスクを完了したか」である点です。この形にした狙いは明確で、品質の劣化を、構文エラーを捕まえるのと同じ関門の前に持ち込むことにあります。想定しておくべきなのは、これらの指標の多くがモデルによって採点されることです。通常のテストには無い費用とばらつきが伴います。
検索を使う仕組みで最も多い失敗は、外から見えません。答えは読みやすいのに、引いてきた文書のどこにも根拠がない、という状態です。Ragasはそれを直接測ります。処理を2つに分け、必要な内容を含む文書を引けていたか、生成された答えがその範囲に収まっているかを別々に採点します。手持ちの文書から試験用のデータを作ることもできるため、最初の評価のために質問を100件手書きするところから始めずに済みます。ほとんどの指標自体がモデルの呼び出しである点は、あらかじめ織り込んでおくべきです。一通り走らせれば費用がかかり、同じデータで2回実行しても数値は完全には一致しません。
OpenTelemetryベースのため、トレースが特定ベンダーに固定されず可搬です。デバッグ中のコードの隣でローカル実行できます。ライセンスはElastic 2.0で、社内利用には問題ありませんが、マネージドサービスとして提供する場合には制約があります。
同分類の他の選択肢は専用バックエンドを持つ製品であり、導入すると運用対象が増え、テレメトリの半分が他と切り離された場所に置かれます。こちらは計装の層です。モデル呼び出しとベクトルデータベース呼び出しを標準的なOpenTelemetryのスパンとして出力し、Datadog、Grafana、New Relic、Splunk、Honeycombなど、既存のトレースの送り先へそのまま流します。引き換えに、汎用のバックエンドで見えるのはスパンとレイテンシであって、専用プラットフォームが中心に据えるプロンプトの版管理や評価の画面ではありません。
多くのガードレール製品は1か所で1つのことを検査します。こちらは介入点を5つ定義します。モデルが要求を見る前、検索が取り込んだ内容、会話の流れ、ツール呼び出しの周囲、そして応答が利用者に届く前です。アプリケーションとモデルの間に位置するため、既に稼働中のシステムに、どちら側も変えずに後付けできます。代償はレイテンシと語彙です。強力な制御のいくつかはそれ自体がモデル呼び出しであり、対話の規則はColangという専用言語で記述します。
多くの記録ツールは呼び出しを包むことを求めますが、見たいコードがライブラリの中や別のジョブ、他人が持つサービスの中にあると、その方法は使えません。Helicone は別の道を取ります。接続先のURLを向けるだけで、通過するリクエストがすべて記録され、経路上にSDKは入りません。すでにその位置にいるため、ゲートウェイの仕事も兼ねます。複数の提供元を1つの鍵で扱い、片方が落ちたら自動で切り替え、繰り返しのプロンプトはキャッシュから返します。引き換えはその位置そのものです。アプリケーションとモデルの間にプロキシが入るため、運用する部品と経路が1つ増えます。エージェントの実行はセッションとしてまとまるので、多段の記録が無関係な30件の呼び出しではなく1つのまとまりとして読めます。
評価で分かるのは、自分が思いついた質問に対する出来です。安全性についてはそれでは形が合いません。問題になるのは、思いつかなかった質問のほうだからです。Giskardはそこを反転させます。スキャンが敵対的な入力を自ら生成し、拒否すべきだったのに答えてしまったものを報告するため、試験項目は想像力ではなくツールが用意します。あわせて、検索を使う仕組みが静かに壊れていく典型的な形を調べるスキャンと、期待する振る舞いを通常のテストとして書き、pytestで合否を出す仕組みがあります。一度気になった確認事項を、変更のたびに走る確認に変えられます。開発元は、指摘ゼロが安全性や法令遵守の保証ではないと明記しています。
エージェントと、その呼び出し先——モデルプロバイダ、MCPサーバー、他のエージェント——の間に置くRust製のデータプレーンです。認証、RBAC、レート制限、OpenTelemetryへの送出をエージェントごとに実装せず、ここで一度だけ設定します。Solo.ioが2025年8月にLinux Foundationへ寄贈し、2026年6月にはMCPやgooseと同じAgentic AI Foundationの傘下へ移りました。ただしリクエスト経路上に置く基盤としては歴史が浅く、下流のMCPサーバーへ利用者ごとの識別情報を引き渡す仕組みは未対応の課題として残っているため、必要な認証方式を先に確認してください。
障害対応で時間がかかるのは修正ではなく、ダッシュボードを開き、急変をデプロイと突き合わせ、実際に落ちたポッドを見つけるまでの20分です。HolmesGPTはその部分を担います。すでに運用しているPrometheus、Grafana、Datadog、Kubernetes、任意のREST APIに接続し、必要なものを取得しては見つかった手がかりをたどる形で調査を進め、結論を元のアラートへ書き戻します。特徴的なのは、素朴な作りの道具が壊れる規模を前提にしている点です。絞り込みはサーバー側で行い、大きな出力はディスクへ流し、ツールごとにメモリ上限があるため、巨大な監視データを問い合わせても文脈が埋まったりプロセスが落ちたりしません。CNCFのサンドボックスプロジェクトです。
この分類の他の項目がそれぞれ1つの計測であるのに対し、これは計測を作るための機構です。データセットが入力と正解を与え、ソルバーが応答を生成し、スコアラーが正誤を判定し、タスクがこの3つを束ねます。ソルバーは単一のモデル呼び出しでも、多ターンのエージェント全体でも構いません。200を超える既製の評価が同梱され、モデルが書いたコードはサンドボックス内で実行され、ログビューアで各サンプルの実際の経過を確認できます。できないのは、何を測る価値があるかを教えてくれることです。
デスクトップ・CLI・IDE・ゲートウェイの各エージェントの動きをhookやplugin、OTLP/HTTPのログエクスポータ経由で取り込み、単一のイベントモデルへ正規化したうえでローカルのCELルールで評価し、events・findings・enforcement決定をバージョン付きNDJSONとして書き出します。`numbat scan`はディスク上のセッション成果物を読むため、事前に計装していなかった過去の作業も後から再構成できます。一方で遮断は保守的な設計で、enforceモードは既定で無効、同梱ルールはすべて監視専用なので、実際に止めるにはルールYAMLを運用側のディレクトリへ複製し、idを保ったままenforce: trueを追加してversionを上げる手順が必要です。観測できる範囲はエージェントとサーフェスごとにcoverage matrixで決まり、永続化されなかった活動は後から復元できず、findingsは実行された事実の証明ではなくルールの一致にすぎません。網羅的な記録や確定的な事実認定を期待する用途には向きません。