工具速递|llama.cpp:GGML 团队持续优化,本地 LLM 推理标杆

今日 GitHub Trending ggml-org/llama.cpp(+158 stars/day)。本地 LLM 推理的标杆项目。

近期重要更新

  • MoE 量化:DeepSeek 671B 量化版可以在 24GB 显存跑
  • KV cache 压缩:1M 上下文内存占用降 60%
  • Metal 优化:M3 Max 上 70B 模型 20+ tokens/sec
  • Speculative decoding:小模型 draft + 大模型 verify,速度 +30%

使用场景

  • 本地部署开源 LLM
  • 边缘设备(手机、嵌入式)
  • 隐私敏感场景
  • 成本敏感的 API 替代

GitHub:ggml-org/llama.cpp(+115k stars)

Leave a Comment