教程|Llama 3.3 70B 本地部署:M3 Max 上 20+ tokens/sec 实战
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05
本教程演示如何在 M3 Max 128GB 上本地跑 Llama 3.3 70B 量化版。
硬件要求
- 最低:M2 Max 64GB(70B-Q4 跑得动,慢)
- 推荐:M3 Max 128GB(70B-Q4 流畅)
- 最优:M3 Ultra 192GB(70B-Q8 流畅)
- N 卡:24GB 显存 70B-Q4,48GB 显存 70B-Q8
第 1 步:装 llama.cpp
brew install llama.cpp
# 或从源码
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
make -j
第 2 步:下载模型
# 70B Q4_K_M(~40GB)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf --local-dir ~/models
# 70B Q8_0(~70GB,更精确)
huggingface-cli download NousResearch/Meta-Llama-3.3-70B-Instruct-GGUF Meta-Llama-3.3-70B-Instruct-Q8_0.gguf --local-dir ~/models
第 3 步:跑起来
llama-cli -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 -ngl 99 --threads 16 -p "你好,介绍一下你自己"
# M3 Max: 20-25 tokens/sec
第 4 步:开 server
llama-server -m ~/models/Meta-Llama-3.3-70B-Instruct-Q4_K_M.gguf -c 32768 --port 8080 --host 0.0.0.0
# OpenAI 兼容 API
curl http://localhost:8080/v1/chat/completions -H "Content-Type: application/json" -d '{"model": "llama-3.3-70b", "messages": [{"role":"user","content":"hi"}]}'
第 5 步:Ollama 更简单
ollama run llama3.3:70b-instruct-q4_K_M
# 或 Open WebUI 一键 Web UI
docker run -d -p 3000:8080 -e OLLAMA_BASE_URL=http://host.docker.internal:11434 --name open-webui ghcr.io/open-webui/open-webui:main
性能实测(M3 Max 128GB)
- Llama 3.3 70B Q4_K_M:20-25 tok/s
- Llama 3.3 70B Q8_0:12-15 tok/s
- Qwen2.5-72B Q4:22-28 tok/s(中文更快)
- DeepSeek V3 671B Q2:3-5 tok/s(128GB 内存刚够)
成本对比
- 云 API(GPT-4o):$5/M input tokens
- 本地电费:$0.1/小时(M3 Max 50W)
- 100 万 tokens 推理:云 ~$15,本地 ~$0.05