llama.cpp と Ollama の比較
低レベルの推論ランタイムと一式をまとめた実行環境から、ローカルで言語モデルを動かす方法を選びます。
基本情報の比較
| 基本情報の比較 | llama.cpp | Ollama |
|---|---|---|
| ライセンス | MIT | MIT |
| 言語 | C++, C | Go |
| 提供形態 | ローカル実行 / セルフホスト | ローカル実行 / セルフホスト |
| 成熟度 | 安定 | 安定 |
| スター | 126k | 180k |
| 直近7日間のスター増加数 | +1.1k ★ | +545 ★ |
| フォーク | 22.4k | 17.6k |
| オープンIssue | 2.3k | 3.8k |
| 最終コミット | 2026年8月28日 | 2026年8月28日 |
| 開発状況 | 活発 | 活発 |
それぞれの位置づけ
llama.cpp
ここでの量子化の成果が、データセンターGPUのないハードウェアで実用的なモデルを動かせるようにしました。ローカルモデル関連エコシステムの多くがこの上に構築されています。直接扱う場合は、上位のラッパーが隠しているビルドフラグやハードウェア固有の事情に向き合うことになります。
詳細を見る →Ollama
量子化済みのモデル、つまり少ないメモリで動くよう圧縮された形式のモデルを取得し、呼び出し用のローカルHTTP APIまで起動して、コマンド1つで使える状態にします。手元のハードウェアでモデルを動かして開発を始めるなら妥当な選択です。ただし多人数へ同時に配信する用途では、処理量を稼ぐことに特化したサーバーのほうが明確に有利です。
詳細を見る →できること
llama.cpp
- 1コマンドでモデルを実行 — llama cli -hf ggml-org/Qwen3.5-0.8B-GGUFのように指定すればHugging FaceからGGUFを取得してそのまま対話セッションが始まり、Python環境は不要です。
- OpenAI互換APIとして公開 — llama serveで起動するとOpenAI互換のRESTサーバーになり、既存クライアントの接続先を差し替えるだけで使えます。付属のWeb UIからも動作を確認できます。
- VRAMを超えるモデルも動かす — 1.5ビットから8ビットまでの整数量子化に加え、モデルの一部だけをGPUに載せて残りをCPUで処理するハイブリッド推論に対応しています。
- 手元のハードウェアに合わせる — Apple SiliconのMetalとARM NEON、NVIDIAのCUDA、AMDのHIP、Moore ThreadsのMUSAに加え、Vulkan・SYCL・OpenCL・WebGPU・CANNなどのバックエンドを同一ソースから選べます。
- GBNF文法で出力形式を固定 — GBNF形式の文法ファイルを渡すと生成結果を指定した構文に強制でき、小さなローカルモデルからも構造化された出力を安定して得られます。
Ollama
- コマンド1つでモデルを動かす —
ollama run gemma4のように指定すると、必要なファイルの取得から会話の開始までを続けて行います。動かせるモデルの一覧はollama.com/libraryにあります。 - 手元で動かすか、提供元のクラウドを使うか選ぶ — 同じコマンドのまま、自分の機械で動かす方法と、手元には大きすぎるモデルをOllama側のクラウドで動かす方法を選べます。
- 自作アプリから呼び出す —
http://localhost:11434/api/chat宛にJSONを送れば応答が返ります。PythonとJavaScript向けの公式クライアントもpip install ollamaやnpm i ollamaで入ります。 - コーディング支援ツールを手元のモデルで動かす —
ollama launch claudeと指定すると、手元で動くモデルを相手にClaude Codeが起動します。Codex、Copilot CLI、OpenCode、Droid、DeepSeek Harnessも同じ方式です。 - 普段のチャットアプリから使う —
ollama launch openclawでOpenClawが立ち上がり、WhatsAppやTelegram、Slack、Discordから手元のモデルを呼び出せます。