工具速递|llama.cpp:GGML 团队持续优化,本地 LLM 推理标杆
今日 GitHub Trending ggml-org/llama.cpp(+158 stars/day)。本地 LLM 推理的标杆项目。
近期重要更新
- MoE 量化:DeepSeek 671B 量化版可以在 24GB 显存跑
- KV cache 压缩:1M 上下文内存占用降 60%
- Metal 优化:M3 Max 上 70B 模型 20+ tokens/sec
- Speculative decoding:小模型 draft + 大模型 verify,速度 +30%
使用场景
- 本地部署开源 LLM
- 边缘设备(手机、嵌入式)
- 隐私敏感场景
- 成本敏感的 API 替代
GitHub:ggml-org/llama.cpp(+115k stars)