llama.cpp(CPU/边缘推理) b5000+
llama.cpp系列 · Georgi Gerganov 等 · 2023-03发布
模型介绍
C/C++ 编写的轻量推理引擎,支持纯 CPU 与量化(GGUF)推理,可在无显卡的笔记本、树莓派上运行大模型,是端侧部署核心。
模型基础信息
免费额度与收费政策
免费规则详情
llama.cpp 完全开源免费,可自由商用。
收费标准简介
免费;纯 CPU 即可运行,无显卡也能使用。
模型能力介绍
✅ 核心优势
- 纯 C/C++ 实现,无显卡也能跑大模型
- GGUF 量化格式体积小(4bit 约省 75%)
- 支持树莓派
- 笔记本等低配设备
- 生态完善(LM Studio / Ollama 均基于 GGUF)
⚠️ 短板与局限
- 速度较 GPU 推理慢
- 需手动下载 GGUF 模型文件
- 配置对新手有一定门槛
🎯 适用场景
- 无显卡设备的本地推理
- 隐私敏感的边缘 / 端侧部署
- 量化模型测试与调优
- 低成本实验环境
模型使用教程
本章节整理 llama.cpp(CPU/边缘推理) 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。
- 特点:纯 C++、无需 GPU、GGUF 量化格式(4bit 体积缩小约 75%)。
- 适合:无显卡机器、隐私要求高的本地场景。
- 配合工具:LM Studio、Ollama 底层均用到 GGUF 生态。
编译(Windows 用 CMake 或直接下载 release 版 llama-cli.exe)。
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make
Windows 用户:直接下载 GitHub Releases 的预编译包,或使用 llama-b4399-bin-win-* 版本。
下载 GGUF 模型(如 Qwen2.5-7B-Instruct-GGUF,Q4_K_M 量化)。
./llama-cli -m ./models/qwen2.5-7b-q4_k_m.gguf \
-p "你好,请自我介绍" \
-n 128 -t 8
以服务方式启动(OpenAI 兼容):
./llama-server -m ./models/qwen2.5-7b-q4_k_m.gguf --port 8080
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make
下载 GGUF 模型(Q4_K_M 量化):
HF_ENDPOINT=https://hf-mirror.com huggingface-cli download Qwen/Qwen2.5-7B-Instruct-GGUF --local-dir ./gguf
命令行对话:
./llama-cli -m ./gguf/qwen2.5-7b-instruct-q4_k_m.gguf -p "你好,请自我介绍" -n 128 -t 8
以服务方式启动(OpenAI 兼容,端口 8080):
./llama-server -m ./gguf/qwen2.5-7b-instruct-q4_k_m.gguf --port 8080
💡 使用小技巧
常用启动:./llama-cli -m ./models/qwen2.5-7b-q4_k_m.gguf -p "你好" -n 128。
优先选 Q4_K_M 量化,质量与体积平衡最好。
❓ 常见问题 FAQ
Q1:纯 CPU 能跑多大模型?
A1:7B 量化后约 5GB 内存即可流畅对话,速度取决于内存带宽。
Q2:怎么找 GGUF 模型?
A2:在 Hugging Face 搜索模型名 + GGUF,选 Q4_K_M 版本。
访问备注与注意事项
- Windows 用户直接用 GitHub Releases 预编译包
- GGUF 模型国内可走 hf-mirror 镜像
Aitishiku.com