← プロジェクト一覧に戻る

llama.cpp

ノートPCからシングルボードまで動く、可搬なC++推論エンジン

公式MIT
スター
124k
フォーク
21.7k
オープンIssue
2k
最終コミット
2026年8月15日

概要

ここでの量子化の成果が、データセンターGPUのないハードウェアで実用的なモデルを動かせるようにしました。ローカルモデル関連エコシステムの多くがこの上に構築されています。直接扱う場合は、上位のラッパーが隠しているビルドフラグやハードウェア固有の事情に向き合うことになります。

llama.cppで何ができますか?

  • 1コマンドでモデルを実行llama cli -hf ggml-org/Qwen3.5-0.8B-GGUFのように指定すればHugging FaceからGGUFを取得してそのまま対話セッションが始まり、Python環境は不要です。
  • OpenAI互換APIとして公開llama serveで起動するとOpenAI互換のRESTサーバーになり、既存クライアントの接続先を差し替えるだけで使えます。付属のWeb UIからも動作を確認できます。
  • VRAMを超えるモデルも動かす1.5ビットから8ビットまでの整数量子化に加え、モデルの一部だけをGPUに載せて残りをCPUで処理するハイブリッド推論に対応しています。
  • 手元のハードウェアに合わせるApple SiliconのMetalとARM NEON、NVIDIAのCUDA、AMDのHIP、Moore ThreadsのMUSAに加え、Vulkan・SYCL・OpenCL・WebGPU・CANNなどのバックエンドを同一ソースから選べます。
  • GBNF文法で出力形式を固定GBNF形式の文法ファイルを渡すと生成結果を指定した構文に強制でき、小さなローカルモデルからも構造化された出力を安定して得られます。

ドキュメント

ggml-org/llama.cpp のREADMEより転載(MIT)。 原文を読む ↗

llama.cpp

llama

LLM inference in C/C++

Server Docker Winget

manifesto / ggml / ops / maintainer PRs / compile times / lib llama API / llama-server REST API

Quick start

A few options to get llama.cpp installed on your machine:

Once installed:

# Download and run a model directly from Hugging Face
llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF

# Launch OpenAI-compatible API server
llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF

Description

The main goal of llama.cpp is to enable LLM (and VLM) inference with minimal setup and state-of-the-art performance on a wide range of hardware - locally and in the cloud.

  • Plain C/C++ implementation without any dependencies
  • Apple silicon is a first-class citizen - optimized via ARM NEON, Accelerate and Metal frameworks
  • AVX, AVX2, AVX512 and AMX support for x86 architectures
  • RVV, ZVFH, ZFH, ZICBOP and ZIHINTPAUSE support for RISC-V architectures
  • 1.5-bit, 2-bit, 3-bit, 4-bit, 5-bit, 6-bit, and 8-bit integer quantization for faster inference and reduced memory use
  • Custom CUDA kernels for running LLMs on NVIDIA GPUs (support for AMD GPUs via HIP and Moore Threads GPUs via MUSA)
  • Vulkan and SYCL backend support
  • CPU+GPU hybrid inference to partially accelerate models larger than the total VRAM capacity

The llama.cpp project is build on top of the ggml library.

Supported backends

BackendTarget devices
BLASAll
BLISAll
CANNAscend NPU
CUDANvidia GPU
HIPAMD GPU
Hexagon [In Progress]Snapdragon
IBM zDNNIBM Z & LinuxONE
MUSAMoore Threads GPU
MetalApple Silicon
OpenCLAdreno GPU
OpenVINO [In Progress]Intel CPUs, GPUs, and NPUs
RPCAll
SYCLIntel GPU
VirtGPUVirtGPU APIR
VulkanGPU
WebGPUAll
ZenDNNAMD CPU

Documentation

Tools

Development