Mac 48GB 统一内存本地模型运行指南

本文最后更新于:2026年7月24日 晚上

前言

2026 年 7 月这个时间点,48GB 统一内存的 Mac 是个很舒服的档位。核心原则先说清楚:

可用内存怎么算

macOS 会给系统预留一部分,GPU 实际能用到的大概是总内存的 65%-75%。所以名义上的 48GB,实际模型 + context 的预算大概是 34-38GB。经验法则是模型文件本身别超过总内存的 60-70%。

具体推荐(按用途)

用途 模型 量化/大小 说明
综合最优 Qwen3.6 27B Q8(接近 FP16) 目前 48GB 档位的整体最佳选择,质量和速度平衡好
速度优先 Qwen3.6 35B-A3B(MoE) ~22GB 占用 MoE 架构,只有 3B 激活参数,能跑到 ~91 tok/s
写代码 Qwen3-Coder 30B-A3B Instruct 原生适配 48GB 专门代码场景,实测 52 tok/s,交互体验流畅
写代码备选 Devstral Small 24B 24B Mistral 出的代码专用模型,体量更小
轻量/超快 Gemma 4 26B-A4B(MoE) 仅 ~15GB(Q4) 2026 年新出,4B 激活参数,非常快,内存富余多
通用备选 gpt-oss 20B Q8 OpenAI 开源那个,20B 体量在 48GB 上很轻松

明确不适合 48GB 的

  • Llama 3.3 70B — 需要 58-64GB 以上
  • Llama 4 Scout — 同样需要 58GB+
  • 这些得等 64GB 起步的机型

怎么接入(工具层面)

Ollama — 最简单

1
ollama run qwen3-coder

一行命令拉起来,适合快速试用。默认提供 OpenAI 兼容的 API 端点:

1
http://localhost:11434/v1

LM Studio — 图形界面

模型管理和参数调节更直观,同样提供 OpenAI 兼容 API 端点。

MLX — 苹果自家框架

在新款 Apple Silicon 上比 llama.cpp 快 10%-20%。如果你想要极致性能,优先找模型的 MLX 量化版(Hugging Face 上搜 mlx-community 这个组织发布的版本)。

接入现有工作流

如果你想把这些本地模型接入到类似 Claude Code / Cursor 等工具里做 agent 或代码辅助,Ollama 和 LM Studio 都提供 OpenAI 兼容 API endpoint(默认 http://localhost:11434/v1),大部分支持”自定义 OpenAI-compatible endpoint”的工具都能直接接进去。

对接 Hermes Agent

在 Hermes 的 config.yaml 中配置:

1
2
3
4
providers:
ollama:
base_url: http://localhost:11434/v1
model: qwen3-coder

实际场景建议

考虑到如果你在做浏览器指纹/反爬相关的工作,需要本地跑模型来做类似”辨别页面结构””生成绕过策略草稿”等任务,建议优先选:

  1. Qwen3-Coder 30B-A3B — 代码理解 + 逆向辅助
  2. Qwen3.6 27B Q8 — 综合能力最强

Mac 48GB 统一内存本地模型运行指南
https://kingjem.github.io/2026/07/21/Mac-48GB-本地模型运行指南/
作者
Ruhai
发布于
2026年7月21日
许可协议