llama
访问官网
开源软件
模型运行
本地运行AI
详情介绍
llama.cpp 是由 ggml-org 开发的开源 LLM 推理引擎,使用纯 C/C++ 实现,零依赖、轻量高效。它最初为运行 LLaMA 模型而设计,现已支持几乎所有主流开源模型,能够在 CPU、GPU、混合模式下运行,是本地运行大模型最流行的方案之一,GitHub 获 123K+ Stars。
🚀 最新动态(2026年)
- 最新版本 b10362(2026-08-11):持续高频迭代,性能与兼容性不断提升
- 123K+ GitHub Stars:社区极度活跃,数千贡献者
- 多模态支持:支持视觉模型、语音模型等的本地推理
- 硬件覆盖广泛:支持 CPU、CUDA、ROCm、Vulkan、Metal、SYCL 等
⚡ 核心功能
- 纯 C/C++ 实现:零依赖、轻量级,无需 Python 环境即可运行
- 本地推理:完全离线运行,隐私安全,无需网络连接
- 模型量化:支持 2-8 bit 量化,大幅降低显存需求,在普通消费级硬件上运行大模型
- 多后端支持:CPU、CUDA、ROCm、Vulkan、Metal、SYCL 等,适配各种硬件
- 广泛模型兼容:支持 Llama、Qwen、DeepSeek、Mistral、Phi 等主流模型格式(GGUF)
- 绑定生态:提供 Python、Node.js、Go、Rust 等多语言绑定
🎯 适用场景
- 本地 AI 助手:在个人电脑上完全离线运行 AI 模型
- 隐私敏感场景:数据不出本地,保障信息安全
- 边缘计算:在资源受限设备上运行推理
- 开发与测试:快速验证模型效果,无需 GPU 服务器
💪 平台优势
- 零依赖:纯 C/C++,无需 Python、CUDA 等环境
- 极致轻量:从树莓派到高端 GPU 均可运行
- 量化技术领先:GGUF 格式 + 多种量化方案,内存效率极高
- 社区驱动:123K+ Stars,更新极其活跃,问题响应快
- 生态完善:各种 GUI 前端、API 服务器、绑定库齐全