モデルサービング

自前のハードウェア上でモデルを動かし、OpenAI互換エンドポイントとして提供する層。エージェントは呼び出し回数が多いため、単発のレイテンシよりスループットと同時実行性が重要になります。

6件

Ollamaモデルサービング

量子化済みのモデル、つまり少ないメモリで動くよう圧縮された形式のモデルを取得し、呼び出し用のローカルHTTP APIまで起動して、コマンド1つで使える状態にします。手元のハードウェアでモデルを動かして開発を始めるなら妥当な選択です。ただし多人数へ同時に配信する用途では、処理量を稼ぐことに特化したサーバーのほうが明確に有利です。

公式MIT180k+545
llama.cppモデルサービング

ここでの量子化の成果が、データセンターGPUのないハードウェアで実用的なモデルを動かせるようにしました。ローカルモデル関連エコシステムの多くがこの上に構築されています。直接扱う場合は、上位のラッパーが隠しているビルドフラグやハードウェア固有の事情に向き合うことになります。

公式MIT126k+1.1k
vLLMモデルサービング

処理待ちのリクエストをまとめて捌く工夫により、素朴な実装よりはるかに多くの同時利用をGPU1枚で支えられます。エージェントは呼び出し回数が多くなりがちなので、この差が効いてきます。OpenAIと同じ形式で呼び出せるため、多くのフレームワークは接続先の変更だけで移れます。一方でGPUメモリの見積もりやモデルの読み込み時間など、運用の手間は相応にかかります。

公式Apache-2.090.3k+686
LiteLLMモデルサービング

ライブラリとしては、1つの関数呼び出しで対応プロバイダのどれにでも、OpenAI形式のリクエストとレスポンスのまま到達できます。多くのチームが導入する理由は後者のゲートウェイのほうです。自己ホストのサーバーが、個別の予算と流量制限を持つ仮想キーを発行し、プロバイダの障害時には代替へ切り替え、複数の配備先へ負荷を分散し、キーごとの費用を記録します。代償として、リクエスト経路に自分で運用する構成要素が1つ増えます。またenterpriseディレクトリ配下のコードはMITの対象外です。

公式MIT57.5k+553
LocalAIモデルサービング

OpenAI向けのクライアントをそのまま向ければ応答します。ツール呼び出し付きのチャット、埋め込み、画像生成、文字起こしと読み上げ、リランカー、リアルタイム音声対話までで、AnthropicやElevenLabs、OllamaのAPIの模倣も持っています。小さな本体がハードウェアを検出し、llama.cpp・vLLM・MLX・whisper.cppといった推論バックエンドを必要になった時点で取得します。Webのギャラリーからモデルをクリックで導入でき、MCP対応の自律エージェントも同梱、APIキー・OIDC・クォータで複数ユーザーにも対応します。正直に比較すると、ノートPCでモデルと会話するだけならOllamaの方が簡単で、1モデルのスループットを追い込むなら素のvLLMの方が身軽です。そしてWindowsのネイティブ版はなく、コンテナかWSLに限られます。

MIT48.7k+116
SGLangモデルサービング

プレフィックスキャッシュは、長く同一のシステムプロンプトを多数の呼び出しが共有するエージェント用途でこそ効きます。レスポンスをスキーマに一致させる制約付きデコーディングにも強みがあります。この領域の主な比較対象はvLLMです。自分のトラフィック特性で双方を計測することを勧めます。

公式Apache-2.032.6k+395