
CoreWeave
面向大规模AI训练、推理和HPC的专业GPU云,提供裸金属Kubernetes、Slurm、Serverless与Dedicated Inference及高速存储网络。
直接结论:llama.cpp适合希望在CPU、消费级GPU、Apple Silicon和多种加速器上本地运行LLM与VLM的开发者;模型大小、量化和上下文配置必须与硬件能力匹配。
资料说明:本文根据该产品截至2026年8月5日的官方页面、官方文档与官方代码仓库整理,不包含虚构的统一条件实测。功能、版本、API、价格和授权规则可能调整,使用前请再次核验官网。
llama.cpp是一套以C/C++实现的高性能本地模型推理项目,目标是在尽量少的依赖下运行GGUF格式的语言与视觉模型。它提供CLI、OpenAI兼容服务器、多种量化方式、CPU与GPU混合推理以及广泛硬件后端。
| 功能 | 说明 |
|---|---|
| 本地模型推理 | 在个人电脑、服务器、移动和边缘设备运行GGUF模型。 |
| 多级量化 | 使用不同位宽降低内存占用并提高推理速度。 |
| llama-server | 启动OpenAI兼容REST API和内置网页界面。 |
| 多硬件后端 | 支持CPU、CUDA、Metal、ROCm、Vulkan、SYCL等当前后端。 |
| CPU与GPU混合 | 把模型部分层卸载到GPU,处理超出显存容量的模型。 |
| CLI与开发接口 | 提供聊天、补全、Embedding、量化和库接口等工具。 |
不是。项目支持大量转换为GGUF并兼容当前架构的语言和视觉模型。
可以使用llama-server启动兼容接口,具体端点以当前文档为准。
资料核验日期:2026年8月5日




