コーディングエージェント

実際のリポジトリに対してコードを読み・書き・実行するエージェント。ベンチマークのスコアは出発点にすぎません。実務では、サンドボックスの安全性、大規模コードベースでのトークンコスト、生成結果のレビューしやすさのほうが効いてきます。

22件

opencodeコーディングエージェント

特徴は、何もかもが埋め込みではなく宣言である点です。名前付きのエージェントをJSONかMarkdownで定義し、それぞれに使うモデルと、ツールごとの権限を与えます。読み取り・編集・コマンド実行のそれぞれについて、許可・確認・拒否のいずれかを選べます。切り替えはキー1つです。標準でも、全権限を持つものと、編集や実行の前に必ず確認するものの2種類が同じ仕組みで用意されています。MITでプロバイダにも依存しませんが、変化が速いうえ最近リポジトリの所有者が変わったため、古いリンクや固定したバージョンはすぐ古びます。

公式MIT202k+2.3k
Codex CLIコーディングエージェント

リポジトリを読み、変更を提案し、コマンドを実行するという動き自体は他のターミナル型と同じですが、境界の引き方が特徴的です。macOSとLinuxではOSのサンドボックス機構を使い、触れるファイルと実行できるコマンドを制限します。制限がモデルの善意に依存しない、という点が違います。サインインはChatGPTのプランかOpenAIのAPIキーを経由します。コードはApache-2.0でも、背後のモデルは開かれた部分ではない、というのが取引条件です。

公式Apache-2.0120k+8.4k
Ponytailコーディングエージェント

日付の入力欄を頼んだだけで、依存パッケージが入り、ラッパーのコンポーネントができ、スタイルシートが増え、タイムゾーンの議論が始まることがあります。ブラウザには何年も前から専用の入力欄があるのにです。Ponytailはその癖に狙いを定めた1つのスキルで、動く範囲で最も小さい実装へ、そして環境が既に備えているものは書かない方向へエージェントを押します。冗談で終わらないのは、開発元が実際に測っている点です。実在のリポジトリで12件の作業を、スキルの有無で比較し、数値と一緒に測定方法も公開しています。以前のより見栄えのする数値は平均ではなく最良の場合だった、という訂正まで書かれています。

エージェントスキルMIT116k
gemini-cliコーディングエージェント

ターミナルの1つのプロンプトから、リポジトリを読み、ファイルを編集し、シェルコマンドを実行し、Google検索で最新の情報を確かめるところまでを任せられます。書き込みを禁じたプランモードで下調べと計画を先に済ませ、TOML形式のポリシーでどのツールを許すかを事前に決め、拡張機能でMCPサーバーやスキル、フックをまとめて配れます。ただし接続先はGeminiモデルに限られるため、モデルの乗り換えやオフラインでの利用を前提にするなら向きません。さらに2026年6月18日以降は個人アカウントでのGoogleログインが使えなくなり、APIキー、Vertex AI、Code AssistのStandardまたはEnterpriseライセンスのいずれかを用意する必要があります。

公式Apache-2.0107k+132
Addy Osmani's Agent Skillsコーディングエージェント

放っておくと、コーディングエージェントは指示を言い終えた瞬間からコードを書き始めます。これは、そこに本来の開発の順序を戻すスキル集です。9つのコマンドが、何を作るかを決める段階から公開までを覆い、背後のスキルは作業内容に応じて自動で有効になります。インターフェースの設計を始めればその担当スキルが、画面側に触れればそちら向けのスキルが働きます。注目すべきは自動モードの扱いで、省かれるのは各作業の合間に人が入ることだけであり、確認は残ります。各作業は引き続きテスト駆動で行われ、個別にコミットされ、失敗すれば止まります。実体はMarkdownなので、共通のskillsコマンドで70種類ほどのエージェントに導入できます。

エージェントスキルMIT90.5k
OpenHandsコーディングエージェント

隔離されたコンテナ内でファイル編集・テスト実行・ドキュメント参照を行うため、実行が失敗してもホスト環境を壊しません。SWE-bench系のベンチマークでは上位の成績を出していますが、実際のリポジトリに向ける前にコスト試算を勧めます。長時間の自律実行はトークン消費が大きく、生成結果はマージ前に人間のレビューが前提になります。

公式MIT85.5k+746
MetaGPTマルチエージェント制御

`metagpt "Create a 2048 game"`と一行打つだけで、要件定義書・設計書・ソースコードが`workspace/`以下に書き出されます。ただし働く顔ぶれは入手経路で変わります。PyPIで配布されている0.8.2は製品担当・設計担当・進行担当・エンジニアの4役ですが、READMEが案内するgit cloneのmainではチームリーダーとデータアナリストが加わり、進行担当は外れています。デモの下にあるのは汎用のフレームワークで、RoleとActionを継承し、どのActionの結果に反応するかを宣言すれば、共有のEnvironmentがメッセージを配って作業順を決めます。データ分析だけならData Interpreter単体で完結します。限界もはっきりしていて、公式FAQは生成コードが500行を超えると未実装の関数が残ると認めています。

公式MIT70.1k+151
openinterpreterコーディングエージェント

プロジェクトのディレクトリで`i`と打つと、ファイルを読み、コードを編集し、設定したサンドボックスの中でコマンドを実行します。特徴は`/harness`で、システムプロンプト、ツール定義、メッセージの変換方法を丸ごと、そのモデルの提供元が想定する作法に入れ替えられます。DeepSeekやKimiのような安価なモデルから実用的な仕事を引き出すための設計です。ただし中身はOpenAIのCodex CLIをRustで作り直したフォークで、リリースは2026年6月に始まった0.0.x系のままです。多くの人が知るPython製のOpen Interpreterとは、名前とリポジトリを共有しているだけの別物だと考えてください。

公式Apache-2.068.2k+76
Clineコーディングエージェント

VS Code上で動作し、ファイル書き込みやターミナルコマンドの実行前に都度承認を求めます。作業の流れを断ち切らずに人間を関与させられるのが利点です。MCP対応により、エディタ外のツールにも到達できます。この承認プロンプトこそが安全機構であり、すべて無効化すると本ツールを選ぶ主要な理由が失われます。

公式Apache-2.067.1k+473
Gooseコーディングエージェント

CLIまたはデスクトップアプリとしてローカルで動作し、固定のツール一覧ではなくMCP拡張によって機能を獲得します。そのため、同一のエージェントでコード、インフラ、外部サービスを扱えます。モデル非依存の設計は、プロバイダの切り替えを想定する場合に効いてきます。

公式Apache-2.053.6k+444
Aiderコーディングエージェント

すべての変更がgitコミットとして記録されるため、AIによる編集が同僚の編集と同じようにレビュー可能・巻き戻し可能になります。リポジトリマップの仕組みにより、コンテキストウィンドウを大きく超える規模のコードベースでも作業できます。ターミナル専用という設計は、そこで作業する人には強みですが、エディタ内での利用を求める場合は選択肢になりません。

公式Apache-2.048.6k+168
Continueコーディングエージェント

補完・チャット・編集を、指定した任意のモデルで動かせます。自前のハードウェア上で動くモデルも指定可能です。コードを社外に出せない環境で現実的に選べる数少ない選択肢のひとつになります。その柔軟性の代償として、設定はホスティング型の代替手段より手間がかかります。

公式Apache-2.035.7k+91
smolagentsフレームワーク

中心にあるのはCodeAgentで、モデルは構造化されたツール呼び出しを返す代わりに短いPythonコードを書き、ツールを直接呼びます。呼び出しを繰り返しや条件分岐の中に入れる操作は、フレームワークの機能ではなくPython自体から得られます。エージェントのループ全体がおよそ1000行という小ささは利点であると同時に上限でもあり、永続的な状態、ワークフローの記述、保存機構は自分で組むことになります。従来のJSON形式が合う場面向けにToolCallingAgentも同梱されています。

公式Apache-2.029k+118
Crushコーディングエージェント

ほぼどのパッケージマネージャからでも単一のGoバイナリとして入り、Windows PowerShell、WSL、Android、各種BSDを含む幅広い環境で動きます。セッションはプロジェクトごとに保持され、会話の途中で文脈を失わずにモデルを差し替えられ、言語サーバーがエディタと同等のコード情報を供給します。最初に読むべきはライセンスです。OSI承認ではなく、競合製品としての提供を禁じており、各リリースがMITになるのは公開から2年後です。

公式ソース公開型27.8k+203
Planning with Filesメモリ / コンテキスト

長い作業には特有の壊れ方があります。エージェントは計画を持っていたのに、文脈が消去または圧縮され、戻ってきたエージェントが自信満々に別の仕事を仕上げてしまう、という壊れ方です。このスキルは計画を会話から外し、ディスク上に移します。計画のファイル、分かったことのファイル、済んだことのファイルの3つで、毎ターンそれらをエージェントの目の前に戻します。計画がファイルである以上、消去や異常終了、圧縮を越えて残り、実行中に人が自分で読むこともできます。任意で有効にできる関門は、計画がそう示すまでエージェントに完了を宣言させません。開発元は盲検のA/B比較結果を公開しており、これは多くのスキルにはない点です。

エージェントスキルMIT26.4k
Devikaコーディングエージェント

Devikaを動かすと、番号付きの計画、エージェントの独り言、閲覧中ページのスクリーンショット、ターミナルの出力、消費トークン数が1つの画面に並びます。目標を1行送ると、プランナーが手順を書き出し、リサーチャーが最大3件の検索クエリに絞り、各クエリの1件目のリンクだけをPlaywrightのブラウザで開いて本文を抜き出し、コーダーがプロジェクトフォルダにファイルを書き出す、という決まった順序で進みます。一方、READMEが掲げたSWE-benchでDevinに並ぶという目標は一度も計測されず、結果を書くはずのファイルは空のものと1行のプレースホルダが残るだけです。コード自体の更新も2024年で止まっているため、これから何かを載せる土台としてではなく、当時の「オープンソース版Devin」がどこまで動いていたのかを自分の手で確かめられる実装として見るのが妥当です。

公式MIT19.6k+3
codex-securityガードレール

基本形は`npx @openai/codex-security scan .`で、結果のJSONはstdoutに出ます。`--mode deep`ではworkerとsubagentを並べ、新しい検出が出なくなるまで探索を続けます。再スキャン時は`scans compare BEFORE_SCAN_ID AFTER_SCAN_ID`が根本原因で前回と突き合わせ、new/persisting/reopened/resolved/unknownに分類するため、差分だけを追えます。ただし探索は既定で96時間まで回る長丁場であり、コミット前の軽量チェックには向きません。実行にはCodex Securityへのアクセスが前提で、一部のサイバーセキュリティ要求やprotected findingsはTrusted Access for Cyberの承認が必要になる点も、導入前に確認しておきたいところです。

公式Apache-2.010.2k+203
cloudflare-os実行環境

Cloudflare OSは、エージェントとの対話と、そのエージェントが書き上げる小型アプリ(Gadget)を同じ画面に載せた業務環境です。Gadgetのサーバー側はインターネット接続を無効化したDynamic Worker、クライアント側はサンドボックス化したiframeで動き、両者の通信はpostMessage経由のCap'n Web RPCに限られます。外部サービスへは利用者が明示的に「紹介」したリソースだけにGatekeeper経由で到達し、副作用のある操作はいったん模擬結果を返してエージェントを止めずに進ませ、実行そのものは後からまとめて承認・却下できます。ただし設計はWorkers固有の機能に深く依存しており、ワークスペースはDurable Object、GadgetはDynamic WorkerのFacetとして動きます。自前サーバーのworkerdへ載せる手順はREADMEでもCOMING SOONのままで、実質的な選択肢はCloudflareアカウントへのデプロイになります。2026年8月時点のv2は開発元自身がearly accessと位置づけているうえ、Gatekeeper側にも接続先ごとの設定が必要なものが多く、サービスによってはOAuthクライアント資格情報の取得が必要です。

公式Apache-2.09.3k+623
XcodeBuildMCPツール連携

iOSプロジェクトを扱うコーディングエージェントは、Swiftをいくら書いてもそれがビルドできるかを確かめられません。確かめるためのコマンドが長く、細かく、少しずつ間違えやすいからです。これはそれらをきちんと渡します。スキームのビルド、シミュレータの起動、アプリの導入と実行、ログの読み取り、テストの実行ができます。エージェントが行動に移せる結果を受け取れるため、ループが閉じます。差分を渡して人に試させるのではなく、自分が出したエラーを自分で直せるようになります。MCPサーバーとしても通常のコマンドとしても提供され、導入したほうの使い方をエージェントに教えるスキルも任意で付けられます。動作環境はmacOSのみで、Xcodeは新しめの版が必要です。

MCPサーバーMIT6.3k
Sembleツール連携

コーディングエージェントの費用がかさむ癖は、grepして一致した8ファイルを読み、そこに答えがなくてさらに3ファイル読む、という流れです。Sembleはこれを、平易な言葉での問い1つと、返ってくる少数の該当箇所に置き換えます。grepして読む場合と比べたトークンの削減はおよそ99%だと開発元は述べています。動作は完全に手元のマシンのCPU上で完結し、APIの鍵も呼び出す先のサービスも要りません。リポジトリ全体の索引作成は1秒未満で終わるため、エージェントがそのとき触っている対象に対して気軽に向けられます。導入時には手元のエージェントを検出し、MCPのツール、エージェントの指示書への追記、検索専用のサブエージェントという3つの入口を提示します。

MIT6k
SWE-benchベンチマーク

課題はコードベースとIssueを与えてパッチを求めるもので、失敗していたテストが通り、通っていたテストが通ったままである場合にのみ合格とします。判定にプロジェクト自身のテスト群を使うため、採点基準による評価ではなく具体的な意味を持つ結果になります。その分、測っている範囲は限定的です。誰かが既に発見し、起票し、説明した問題に対する修正を書けるかどうかであり、何を作るかの判断、レビュー、Issueという手掛かりなしにコードベースを辿る力は対象外です。

公式MIT5.7k+51
Terminal-Benchベンチマーク

飽和して差が付かなくなる固定セットではなく、継続的に更新されるベンチマークです。課題は時間とともに追加・修正され、データセットはタグ付きリリースとして公開され、Harborという別の実行基盤から動かします。この設計が強みであり同時に厄介さでもあります。データセットの版を伴わない数字はほとんど意味を持たず、1.0は独立したリポジトリにあって元のURLはそちらへ転送されます。さらに、結果を信頼する前に、まず模範解答を繰り返し実行して自分のサンドボックスが健全かを確かめる手順が案内されています。

公式Apache-2.0556+32