教程|Llama 3.3 70B 本地部署:M3 Max 上 20+ tokens/sec 实战
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16
# M3 Max: 20-25 tokens/sec
第 4 步:Ollama 简化
ollama run llama3.3:70b-instruct-q4_K_M
# Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05