llama.cpp と Ollama の比較

低レベルの推論ランタイムと一式をまとめた実行環境から、ローカルで言語モデルを動かす方法を選びます。

基本情報の比較

基本情報の比較llama.cppOllama
ライセンスMITMIT
言語C++, CGo
提供形態ローカル実行 / セルフホストローカル実行 / セルフホスト
成熟度安定安定
スター126k180k
直近7日間のスター増加数+1.1k ★+545 ★
フォーク22.4k17.6k
オープンIssue2.3k3.8k
最終コミット2026年8月28日2026年8月28日
開発状況活発活発

それぞれの位置づけ

llama.cpp

ここでの量子化の成果が、データセンターGPUのないハードウェアで実用的なモデルを動かせるようにしました。ローカルモデル関連エコシステムの多くがこの上に構築されています。直接扱う場合は、上位のラッパーが隠しているビルドフラグやハードウェア固有の事情に向き合うことになります。

詳細を見る →

Ollama

量子化済みのモデル、つまり少ないメモリで動くよう圧縮された形式のモデルを取得し、呼び出し用のローカルHTTP APIまで起動して、コマンド1つで使える状態にします。手元のハードウェアでモデルを動かして開発を始めるなら妥当な選択です。ただし多人数へ同時に配信する用途では、処理量を稼ぐことに特化したサーバーのほうが明確に有利です。

詳細を見る →

できること

llama.cpp

  • 1コマンドでモデルを実行 — llama cli -hf ggml-org/Qwen3.5-0.8B-GGUFのように指定すればHugging FaceからGGUFを取得してそのまま対話セッションが始まり、Python環境は不要です。
  • OpenAI互換APIとして公開 — llama serveで起動するとOpenAI互換のRESTサーバーになり、既存クライアントの接続先を差し替えるだけで使えます。付属のWeb UIからも動作を確認できます。
  • VRAMを超えるモデルも動かす — 1.5ビットから8ビットまでの整数量子化に加え、モデルの一部だけをGPUに載せて残りをCPUで処理するハイブリッド推論に対応しています。
  • 手元のハードウェアに合わせる — Apple SiliconのMetalとARM NEON、NVIDIAのCUDA、AMDのHIP、Moore ThreadsのMUSAに加え、Vulkan・SYCL・OpenCL・WebGPU・CANNなどのバックエンドを同一ソースから選べます。
  • GBNF文法で出力形式を固定 — GBNF形式の文法ファイルを渡すと生成結果を指定した構文に強制でき、小さなローカルモデルからも構造化された出力を安定して得られます。

Ollama

  • コマンド1つでモデルを動かす — ollama run gemma4のように指定すると、必要なファイルの取得から会話の開始までを続けて行います。動かせるモデルの一覧はollama.com/libraryにあります。
  • 手元で動かすか、提供元のクラウドを使うか選ぶ — 同じコマンドのまま、自分の機械で動かす方法と、手元には大きすぎるモデルをOllama側のクラウドで動かす方法を選べます。
  • 自作アプリから呼び出す — http://localhost:11434/api/chat宛にJSONを送れば応答が返ります。PythonとJavaScript向けの公式クライアントもpip install ollamaやnpm i ollamaで入ります。
  • コーディング支援ツールを手元のモデルで動かす — ollama launch claudeと指定すると、手元で動くモデルを相手にClaude Codeが起動します。Codex、Copilot CLI、OpenCode、Droid、DeepSeek Harnessも同じ方式です。
  • 普段のチャットアプリから使う — ollama launch openclawでOpenClawが立ち上がり、WhatsAppやTelegram、Slack、Discordから手元のモデルを呼び出せます。