工具速递|llama.cpp + Ollama + vLLM 三大本地 LLM 推理框架对比
2026 年 6 月本地 LLM 推理三件套对比:llama.cpp(C++),Ollama(Rust + Go),vLLM(Python).从性能,易用,生态 3 维度横评.
DeepLab tag – tech
2026 年 6 月本地 LLM 推理三件套对比:llama.cpp(C++),Ollama(Rust + Go),vLLM(Python).从性能,易用,生态 3 维度横评.
用 llama.cpp + Ollama 在 Apple Silicon 上跑 Llama 3.3 70B-Q4,1M 上下文,性价比分析。
研究者去掉 MoE 专家的非线性,单神经元作为专家,可解释性大幅提升。Language modeling 性能更好。
本周 5 篇影响深远的论文:DeepSeek-R1 推理解剖、LightningLM 120B MoE、DuMate-DeepResearch、CapCode 防作弊、本地语言文化优势。
本周 5 大事件:LightningLM 0.1V 单 8 卡训 120B MoE / DuMate-DeepResearch 拿下 DRB 58% / Hermes-Agent 原生支持 MCP / DeepSeek-R1 推理质疑 / GitHub Trending...
arXiv 2606.07404 展示百亿 MoE 不再需要千卡集群。对中小 AI 创业公司的硬件策略有何影响?
arXiv 2606.07404:研究者从 1.78B dense 种子一路训练到 120B 稀疏 MoE(460 routed experts),单 8 GPU 节点完成全流程。
今日 +158 stars,llama.cpp 在 Apple Silicon、CPU、CUDA 上持续领先。新版本支持 MoE 量化、KV cache 压缩。
LightningLM 0.1V 在单 8 卡节点上完成 120B 稀疏 MoE 全流程训练,激活参数只占 5%,训练 loss 1.78。
arXiv 2606.07500(2026-06-05):SETA 把 LoRA 类持续学习推上新台阶——在 LLaMA-2 7B 和 Qwen3-4B 上同时提升新任务性能和早期任务保留。