本地部署:Ollama 与 Mac 硬件配置全解
本地部署:什么时候值得,什么时候别折腾
如果不想把数据发出去,或者想彻底免掉边际成本,Mac 上该怎么跑本地模型?本页给出三件事的判断依据:工具怎么选、硬件门槛在哪、参数档位怎么对。
本地大模型工具对比
Mac 上最常用的 5 个本地模型运行工具,从零基础到极客向全覆盖。提示:本地部署不消耗 Token,但出字速度取决于电脑的内存带宽与内存容量;绝大多数人直接用 API 性价比更高。
一句话选型与工具规格
本地模型跑在你自己这台机器上,请求不经过厂商的 API,因此不产生任何 Token 计费——成本只剩已经买下的硬件与电费, 用量再大也不会多花一分钱。代价从「单价」转移到「速度」:出字快不快取决于内存带宽(每秒能把模型权重搬进计算单元的次数,也就是 token/s 的上限), 能跑多大的模型取决于内存容量;模型常驻内存之后,其余软件可用的内存也会相应减少。所以判断要不要本地部署,看的不是价钱表,而是这两项硬件指标与你的用量是否匹配——具体对照见下一节的硬件表格。
下面先给「一句话选型」,再按工具逐个看规格:星标反映关注度,真正该看的是「Mac 原生优化、是否需要图形界面、能不能对接 VS Code」这三项。
🏆 新手首选 LM Studio
零门槛图形化
🏆 开发者首选 Ollama
生态好、对接方便
🏆 极致性能 llama.cpp
榨干全部性能
🏆 批量推理 vLLM
需要 N 卡服务器
🏆 综合体验 Jan
界面最好用
Ollama
开箱即用,模型库最全;自动优化,生态最完善
来源:星标与仓库状态:GitHub API 实测 · 核对日 2026-09-14
| GitHub 星标 | ★ 180.8k |
|---|---|
| Mac 原生优化 | ✅ 全系列 Metal 优化 |
| 图形界面 | ❌ 主命令行 |
| 命令行 | ✅ |
| 一键部署 | ✅ 一行命令启动 |
| VS Code 对接 | ✅ 插件丰富 |
| 适合人群 | 开发者、日常使用 |
LM Studio
纯图形化操作;搜索下载模型一键运行
来源:见本页文末「数据来源」说明 · 核对日 2026-09-14
| GitHub 星标 | 闭源软件 |
|---|---|
| Mac 原生优化 | ✅ Apple Silicon 专属 |
| 图形界面 | ✅ 非常直观 |
| 命令行 | ✅ 可选 |
| 一键部署 | ✅ 点点就用 |
| VS Code 对接 | ✅ 内置对接 |
| 适合人群 | 普通用户、不想敲命令 |
llama.cpp
性能天花板,所有参数可调;是绝大多数工具的底层引擎
来源:星标与仓库状态:GitHub API 实测 · 核对日 2026-09-14
| GitHub 星标 | ★ 128.1k |
|---|---|
| Mac 原生优化 | ✅ 底层 Metal 优化 |
| 图形界面 | ❌ 纯命令行 |
| 命令行 | ✅ |
| 一键部署 | ❌ 全手动配置 |
| VS Code 对接 | ✅ 自行对接 |
| 适合人群 | 极客、底层调参 |
vLLM
高吞吐批量推理;主要面向 NVIDIA GPU,Mac 不推荐
来源:星标与仓库状态:GitHub API 实测 · 核对日 2026-09-14
| GitHub 星标 | ★ 91.7k |
|---|---|
| Mac 原生优化 | ❌ Mac 支持差 |
| 图形界面 | ❌ 命令行 |
| 命令行 | ✅ |
| 一键部署 | ❌ 部署复杂 |
| VS Code 对接 | ✅ 开发对接 |
| 适合人群 | 科研、批量推理 |
Jan
本地 + 云端统一管理;插件生态好,界面最佳
来源:星标与仓库状态:GitHub API 实测 · 核对日 2026-09-14
| GitHub 星标 | ★ 44.5k |
|---|---|
| Mac 原生优化 | ✅ 全平台适配 |
| 图形界面 | ✅ 美观现代 |
| 命令行 | ✅ |
| 一键部署 | ✅ 一键安装 |
| VS Code 对接 | ✅ 支持扩展 |
| 适合人群 | 追求体验的用户 |
实操:用 Ollama 跑通第一个本地模型
如果你确实想体验本地部署(离线可用、零边际成本、数据不出本机),Ollama 是 Mac 上最省事的路径:一行命令装好、一行命令拉模型,并在本地提供兼容 OpenAI 格式的接口,脚本几乎不用改代码就能在「本地免费」与「云端更强」之间切换。
第 1 步 · 安装
# 方式一:Homebrew(推荐,便于后续升级)brew install ollama
# 方式二:官网下载安装包后拖进「应用程序」# https://ollama.com第 2 步 · 拉取并运行模型
8B 级别的指令模型(Hermes 3 8B、Qwen3-8B、Llama 3.1 8B 等)是 16GB 内存 Mac 的舒适区:量化后约 5GB,对话流畅,512GB 硬盘完全放得下。
ollama pull hermes3 # 拉取模型,首次约 5GBollama list # 查看本机已有模型ollama run hermes3 # 进入命令行对话,输入 /bye 退出Apple Silicon 是统一内存架构,模型权重与系统共用同一块内存。16GB 机器建议同时只加载一个 7B–8B 模型;若同时开着 Docker 与几十个浏览器标签页,实际可用于模型的显存会被压缩到总内存的 70% 左右。
第 3 步 · 用 Python 调用(自动化脚本的核心)
Ollama 在本地 11434 端口提供 HTTP 接口,格式与 OpenAI 兼容,因此只要替换 base_url 就能复用同一套脚本。
# 依赖:uv pip install requestsimport requests
def ask_local(prompt: str, model: str = "hermes3") -> str: # 调用本地 Ollama 模型,返回纯文本结果 r = requests.post( "http://localhost:11434/api/generate", json={"model": model, "prompt": prompt, "stream": False}, timeout=300, ) r.raise_for_status() return r.json()["response"]
if __name__ == "__main__": print(ask_local("用一句话解释什么是统一内存架构。"))第 4 步 · 函数调用:让模型自己决定动手
Hermes 系列以指令跟随与函数调用见长,适合做「模型判断该调哪个工具」的流程:把工具清单以 JSON Schema 形式交给模型,由它决定是否需要抓网页、查表或执行脚本,再由你的代码真正执行。
# 把工具描述成 JSON Schema,交给模型判断何时调用tools = [{ "type": "function", "function": { "name": "fetch_webpage", "description": "抓取指定 URL 的网页正文", "parameters": { "type": "object", "properties": {"url": {"type": "string", "description": "网页地址"}}, "required": ["url"], }, },}]第 5 步 · 本地还是云端?按场景二选一
同一台 Mac,不同场景的答案并不一样。点开你的场景看结论:
批量洗稿、分类、打标签
量大、质量要求中等,本地零边际成本
敏感数据(合同、病历、客户资料)
数据不出本机,合规压力最小
离线 / 断网环境
不依赖网络可用性
高质量长文、复杂推理、写代码
同价位下云端旗舰的质量仍明显更高
跑 Agent 长任务、要百万级上下文
本地内存装不下,且云端上下文与缓存成本更低
本地部署省的是「API 费用」,花的是「电费 + 硬盘 + 你的调试与运维时间」。除非有隐私或离线硬需求,否则对绝大多数人,云端 API 的总成本更低、效果更好。想搭多 Agent 协作流程,可直接从第六部分「开源能力库」的 Agent 框架切入(LangChain、Dify、CrewAI 都已收录)。
Mac 硬件配置全解:Air 全系 + Pro 五系列
Apple Silicon 采用统一内存架构(UMA),内存与显存共享,不需要把模型从系统内存拷进显存。跑大模型的性能由两个指标决定:统一内存大小决定「能装下多大的模型」,内存带宽决定「生成有多快(token/s)」。同样 16GB 内存,Pro 芯片的生成速度可以是 Air 的 1.5~2 倍,差别就来自带宽。从 M5 起,Apple 在每个 GPU 核心内都集成了神经加速器(Neural Accelerator),提示词处理与端侧 AI 任务的速度提升明显;但它加速的是算力,不改变带宽决定生成速度这条规律。
MacBook Air 系列
Air 全系无风扇,长时间满载会降频,更适合间歇使用。当前在售仅有 M5 一代,13 英寸 ¥9,999 起、15 英寸 ¥11,999 起。
来源:硬件规格:Apple 官方规格页 · 核对日 2026-09-14
| 芯片 | CPU 核心 | GPU 核心(可选) | 可选内存 | 内存带宽 | 可跑模型档位 | 实际表现 |
|---|---|---|---|---|---|---|
| M1 | 8 核(4P+4E) | 7 核 / 8 核 | 8GB / 16GB | 68.2 GB/s | 7B / 14B(低量化) | 8GB 仅能跑 7B Q4,速度偏慢;16GB 可流畅跑 7B,14B 勉强能用 |
| M2 | 8 核(4P+4E) | 8 核 / 10 核 | 8GB / 16GB / 24GB | 100 GB/s | 7B / 14B / 32B(低量化) | 8GB 入门体验;16GB 跑 14B 流畅;24GB 可跑 32B Q4,日常可用 |
| M3 | 8 核(4P+4E) | 8 核 / 10 核 | 8GB / 16GB / 24GB | 100 GB/s | 7B / 14B / 32B(低量化) | 带宽与 M2 相同,靠架构改进让同内存下快 20% 左右;24GB 跑 32B 可满足轻度使用 |
| M4 | 10 核(4P+6E) | 8 核 / 10 核 | 16GB / 24GB / 32GB | 120 GB/s | 14B / 32B | 10 核 CPU 首次下放 Air;16GB 跑 14B 满血,24GB 跑 32B Q6 流畅 |
| M5 在售 | 10 核(4超级+6能效) | 8 核 / 10 核 | 16GB / 24GB / 32GB | 153 GB/s | 14B / 32B | 带宽较 M4 提升 28%,每个 GPU 核心内置神经加速器;32GB 跑 32B Q6 流畅,续航更长 |
注:Air 的 M1~M4 机型均已停产,列在此处仅供二手选购参考。
MacBook Pro 系列
本地跑的模型不按 Token 计费,所以这里比的只有两件事:内存带宽决定生成速度,内存容量决定能跑多大的模型。下面按 M5 / M4 / M3 / M2 / M1 五个芯片系列分组,同一系列的标准版、Pro、Max 放在一张表里对照,而不是按代次把同档位拆散罗列。记法: P = 性能核心,E = 能效核心,超级 = 超级核心(M5 起新增);如「8 核(4P+4E)」即 4 个性能核心加 4 个能效核心。换算口径:Q4 量化、约 8K 上下文;带宽条采用全表统一刻度(以 614 GB/s 为满格),可跨系列直接比较长短。
按芯片代际查看: M5 / M4 / M3 / M2 / M1(下方按系列分组对照)
同一代芯片内部又分标准 / Pro / Max 三档,档位差异(带宽)往往比代际差异更影响跑模型的速度——所以先选档位,再挑代际。
M5 系列
现役在售 2026 年 3 月发布 · 14 英寸(M5 / Pro / Max)· 16 英寸(Pro / Max)
来源:硬件规格:Apple 官方规格页 · 核对日 2026-09-14
| 芯片 | CPU 核心 | GPU 核心 | 统一内存 | 内存带宽 | 可跑模型档位 | 定位与实测表现 |
|---|---|---|---|---|---|---|
| M5 · 标准版 · 14″ | 10 核(4超级+6能效) | 10 核 | 16 / 24 / 32GB | 153 GB/s | 14B 满血 · 32B Q4 | 该系列入门款。带宽较 M4 提升约 28%,且每个 GPU 核心内置神经加速器,提示词处理与本地推理明显加快。 |
| M5 · Pro · 14″ / 16″ | 15 核(5超级+10 性能) 18 核(6超级+12 性能) | 16 / 20 核 | 24 / 48 / 64GB | 307 GB/s | 32B 满血 · 70B Q4 | 两档核心数均配 307GB/s。24GB 起步即可跑 32B 满血;升到 48GB 才能舒服地跑 70B Q4。 |
| M5 · Max · 14″ / 16″ | 18 核(6超级+12 性能) | 32 / 40 核 | 36 / 48 / 64 / 128GB | 460 GB/s / 614 GB/s | 70B 满血 · 120B Q4 | 32 核 GPU 版 460GB/s、40 核 GPU 版 614GB/s。注意:只有 36GB 机型配 32 核 GPU,选 48GB 以上会强制升到 40 核。 |
参考价:14 英寸 ¥15,999 起(M5),16 英寸 ¥24,999 起(M5 Pro)。M5 Pro / M5 Max 机型配三个雷雳 5、N1 无线芯片(Wi-Fi 7 + 蓝牙 6);M5 机型为三个雷雳 4、Wi-Fi 6E + 蓝牙 5.3。
M4 系列
已停产 2024 年 10 月发布 · 14 英寸(M4 / Pro / Max)· 16 英寸(Pro / Max)
来源:硬件规格:Apple 官方规格页 · 核对日 2026-09-14
| 芯片 | CPU 核心 | GPU 核心 | 统一内存 | 内存带宽 | 可跑模型档位 | 定位与实测表现 |
|---|---|---|---|---|---|---|
| M4 · 标准版 · 14″ | 10 核(4P+6E) | 10 核 | 16 / 24 / 32GB | 120 GB/s | 14B 满血 · 32B Q4 | 首次把 10 核 CPU 下放到 Pro 的入门款,带宽比 M3 提升 20%。 |
| M4 · Pro · 14″ / 16″ | 12 核(8P+4E) 14 核(10P+4E) | 16 / 20 核 | 24 / 48GB | 273 GB/s | 32B 满血 · 70B Q4 | 本代最值得关注的一档:带宽从 M3 Pro 的 150GB/s 直接拉到 273GB/s,涨了近一倍,是跑大模型性价比的转折点。 |
| M4 · Max · 14″ / 16″ | 14 核(10P+4E) 16 核(12P+4E) | 32 / 40 核 | 36 / 48 / 64 / 128GB | 410 GB/s / 546 GB/s | 70B 满血 · 120B Q4 | 32 核 GPU 版 410GB/s、40 核 GPU 版 546GB/s。硬件规格上仍是可买到的第二强。 |
与 M5 系列同机身模具,接口同为三个雷雳 5。现已停产,主要在二手与渠道库存中流通;纸面带宽与 M5 系列差距不大,二手价差明显时可作为替代。
M3 系列
已停产 2023 年 10 月发布 · 14 英寸(M3 / Pro / Max)· 16 英寸(Pro / Max)
来源:硬件规格:Apple 官方规格页 · 核对日 2026-09-14
| 芯片 | CPU 核心 | GPU 核心 | 统一内存 | 内存带宽 | 可跑模型档位 | 定位与实测表现 |
|---|---|---|---|---|---|---|
| M3 · 标准版 · 14″ | 8 核(4P+4E) | 10 核 | 8 / 16 / 24GB | 100 GB/s | 7B 满血 · 14B Q4 | 首个 3 nm 世代。14 英寸机身首次提供基础款芯片,但带宽与 M2 持平、内存起步仍为 8GB,跑模型空间很紧。 |
| M3 · Pro · 14″ / 16″ | 11 核(5P+6E) 12 核(6P+6E) | 14 / 18 核 | 18 / 36GB | 150 GB/s | 32B Q4 · 70B 低量化 | ⚠ 这一档是全线唯一的“倒车”:带宽 150GB/s 反而低于上一代 M2 Pro 的 200GB/s,内存上限 36GB 也只比 M2 Pro 的 32GB 多 4GB。目的跑本地大模型,M3 Pro 不如 M2 Pro,甚至不如 M1 Pro(同为 200GB/s)。 |
| M3 · Max · 14″ / 16″ | 14 核(10P+4E) 16 核(12P+4E) | 30 / 40 核 | 36 / 48 / 64 / 96 / 128GB | 300 GB/s / 400 GB/s | 70B 满血 · 120B Q4 | 30 核 GPU 版 300GB/s、40 核 GPU 版 400GB/s。96GB 仅 14 核 CPU 版可选,128GB 仅 16 核 CPU 版可选,两者不能同时要。 |
同为三雷雳 4 接口。这一代全系带宽相对 M2 系列没有提升,选购二手时务必先看带宽而不是代次。
M2 系列
已停产 14″/16″:2023 年 1 月 · 13″ 标准版:2022 年 6 月 · 14 英寸 / 16 英寸 · 标准版为 13.3 英寸
来源:硬件规格:Apple 官方规格页 · 核对日 2026-09-14
| 芯片 | CPU 核心 | GPU 核心 | 统一内存 | 内存带宽 | 可跑模型档位 | 定位与实测表现 |
|---|---|---|---|---|---|---|
| M2 · 标准版 · 13.3″ | 8 核(4P+4E) | 10 核 | 8 / 16 / 24GB | 100 GB/s | 7B 满血 · 14B Q4 | 13 英寸机型,2023 年 10 月停产。带宽 100GB/s 是 M1 的 1.47 倍,但内存仍从 8GB 起,实际跑模型体验与 M3 标准版接近。 |
| M2 · Pro · 14″ / 16″ | 10 核(6P+4E) 12 核(8P+4E) | 16 / 19 核 | 16 / 32GB | 200 GB/s | 32B Q4 · 14B 满血 | 带宽 200GB/s,与 M1 Pro 持平、高于次代 M3 Pro。二手市场里跑本地模型的“隐形性价比”选项。 |
| M2 · Max · 14″ / 16″ | 12 核(8P+4E) | 30 / 38 核 | 32 / 64 / 96GB | 400 GB/s | 70B Q4 · 32B 满血 | 两档 GPU 均为 400GB/s。96GB 内存仅 38 核 GPU 版可选,是当时笔记本内存的天花板。 |
首发价:14 英寸(M2 Pro)¥15,999 起、16 英寸(M2 Pro)¥19,999 起。接口为三个雷雳 4,HDMI 首次支持 8K 外接显示器。
M1 系列
已停产 14″/16″:2021 年 10 月 · 13″ 标准版:2020 年 11 月 · 14 英寸 / 16 英寸 · 标准版为 13.3 英寸
来源:硬件规格:Apple 官方规格页 · 核对日 2026-09-14
| 芯片 | CPU 核心 | GPU 核心 | 统一内存 | 内存带宽 | 可跑模型档位 | 定位与实测表现 |
|---|---|---|---|---|---|---|
| M1 · 标准版 · 13.3″ | 8 核(4P+4E) | 8 核 | 8 / 16GB | 68.25 GB/s | 7B Q4(勉强) | 13 英寸机型,2020 年 11 月发布、2022 年 6 月停产。机身有风扇,可长时间满载不降频;但 68.25GB/s 是全线最低带宽,现在只适合跑 7B 级模型。 |
| M1 · Pro · 14″ / 16″ | 8 核(6P+2E) 10 核(8P+2E) | 14 / 16 核 | 16 / 32GB | 200 GB/s | 32B Q4 · 14B 满血 | 2021 年发布时就是 200GB/s,四年后仍高于 M3 Pro。32GB 版本跑 32B Q4 依然可用。 |
| M1 · Max · 14″ / 16″ | 10 核(8P+2E) | 24 / 32 核 | 32 / 64GB | 400 GB/s | 70B Q4 · 32B 满血 | 400GB/s 与 M2 Max、M3 Max 的 40 核版同档。二手价低时,是跑 70B Q4 的最低门槛方案。 |
接口为三个雷雳 4。这一代的带宽水平(Pro 200 / Max 400)在四年间被 M3 Pro 反超又落后、被 M4 Pro 拉开,是判断“代次不等于性能”的最佳例子。
① 标准版的 8GB 内存不要买来跑模型。 M1 / M2 / M3 标准版起步都是 8GB,装完系统后剩不下多少,7B 模型也只能勉强塞进 Q4。② 内存是焊死的,买时定终身。 统一内存不可后期升级,选配置时必须一次到位——想跑 70B 就至少 48GB,想跑 120B 就至少 64GB。③ Ultra 系列不在 MacBook Pro 上。 M1 Ultra / M2 Ultra / M3 Ultra 只用于 Mac Studio 与 Mac Pro,笔记本产品线从未搭载,选购时不要被混淆。
同档位跨代速查
把三档芯片按代次拉通,纵向比同一档位四年的变化。带宽单位 GB/s,「上限」指该档位可选的最大统一内存。
来源:见本页文末「数据来源」说明 · 核对日 2026-09-14
| 档位 | M1 系列 | M2 系列 | M3 系列 | M4 系列 | M5 系列 |
|---|---|---|---|---|---|
| 标准版 | 68.25上限 16GB | 100上限 24GB | 100上限 24GB | 120上限 32GB | 153上限 32GB |
| Pro | 200上限 32GB | 200上限 32GB | 150上限 36GB | 273上限 48GB | 307上限 64GB |
| Max | 400上限 64GB | 400上限 96GB | 300 – 400上限 128GB | 410 – 546上限 128GB | 460 – 614上限 128GB |
① 代次新 ≠ 带宽高。 M3 Pro 的 150GB/s 低于 M2 Pro 与 M1 Pro 的 200GB/s——整个 M3 世代在统一内存带宽上没有进步。买二手 Mac 跑本地模型,先看带宽数字,再看是第几代。② 档位跨度远大于代次跨度。 同为 M5 系列,Max 的 614GB/s 是标准版 153GB/s 的 4 倍;而标准版从 M1 到 M5 四年只涨了 2.2 倍。预算有限时,升档位比等新一代更划算。
内存带宽排行
带宽直接决定生成速度(token/s),是跑本地大模型最硬的指标。下图把全部 18 种配置按带宽从高到低排列,颜色区分档位。

| 配置 | 带宽(GB/s) |
|---|---|
| M5 Max · 40 核 GPU | 614 |
| M4 Max · 40 核 GPU | 546 |
| M5 Max · 32 核 GPU | 460 |
| M4 Max · 32 核 GPU | 410 |
| M1 Max | 400 |
| M2 Max | 400 |
| M3 Max · 40 核 GPU | 400 |
| M5 Pro | 307 |
| M3 Max · 30 核 GPU | 300 |
| M4 Pro | 273 |
| M1 Pro | 200 |
| M2 Pro | 200 |
| M5 | 153 |
| M3 Pro | 150 |
| M4 | 120 |
| M2 | 100 |
| M3 | 100 |
| M1 | 68.25 |
先找到你的预算能碰到的档位,再看落点。32GB 内存 + 200GB/s 是“能舒服跑 32B”的起点(M1 Pro / M2 Pro 即可满足);要到 400GB/s 才能跑 70B Q4(M1 Max 起);想跑 120B 级则需要 460GB/s 以上加 64GB 内存,目前只有 M5 Max 能同时给到。
标注约定与选购建议
- 核心标注: P = 性能核心,E = 能效核心,超级核心为 M5 起新增(性能最强的核心类型)。同一芯片提供多档核心数时,对应不同售价档位,核心数越高内存上限也越高。
- 可选范围: MacBook Air 全系 CPU 固定,仅 GPU 核心可选(如 8 核 → 10 核);MacBook Pro 的 Pro / Max 芯片,CPU 与 GPU 均有多档核心数可选。
- 带宽联动: 带宽随 GPU 核心数变化。例如 M5 Max 的 32 核 GPU 版为 460GB/s、40 核 GPU 版为 614GB/s;选大内存往往会被绑定到高配 GPU。
- 跑大模型看什么: 先看内存容量(决定能装多大),再看内存带宽(决定多快)。CPU / GPU 核心数主要影响多任务、渲染、编译等通用负载,对纯文本生成的影响远小于带宽。
- 预算有限时的顺序: 内存容量 > 内存带宽(即档位)> 代次。宁可买上一代的 Max,也不要买当代的标准版——前者 400GB/s 对后者 153GB/s,跑模型的差距远大于两代之间的架构改进。
- 数据口径: 本节全部参数取自 Apple 官方技术规格页(M5 系列为 2026 年现行页面;M1~M4 系列为 Apple 支持文档与新闻稿中的历史规格),核对日期 2026-09-14。不含任何推测值;已停产机型的价格随行情波动,未在此列。
参数档位与开源模型清单
知道自己机器的「可跑档位」后,用这张表反查该下载哪些模型——档位由内存容量决定,实际出字速度由内存带宽决定,两者缺一不可。
来源:见本页文末「数据来源」说明 · 核对日 2026-09-14
| 参数档位 | 级别 | 对应开源模型 | 能做什么 | 适合人群 |
|---|---|---|---|---|
| 7B ~ 9B | 入门级 | Qwen3-8B、GLM-4.5-9B、Gemma 3-12B、Llama 3.1-8B | 日常问答、邮件摘要、文档总结;简单脚本生成、代码补全、轻量 RAG | 学生、普通办公、轻度 AI 使用者 |
| 14B ~ 16B | 进阶级 | Qwen3-14B、GLM-4.5-Air(激活 12B)、MiniMax M2.5、DeepSeek-R1-Distill-14B | 中等复杂度代码编写与审查;本地知识库问答、数据处理、数学推理 | 开发者、科研人员、中度 AI 使用者 |
| 32B ~ 34B | 专业级 | Qwen3-32B、Qwen3-30B-A3B、DeepSeek-R1-Distill-32B、GLM-4.7-Thinking(355B / 激活 32B) | 复杂代码重构、架构设计;深度科研推理、专业领域分析、高质量长文本 | 专业开发者、研究员、重度 AI 使用者 |
| 70B+ | 旗舰级 | Qwen3-235B-A22B、DeepSeek-V4(671B / 激活 28B)、GLM-5(744B / 激活 40B)、Llama 4 Maverick(400B / 激活 17B)、Kimi K2.5(200B / 激活 20B) | 接近云端 API 的推理质量;企业级私有化部署、超复杂多步推理 | 企业、团队、极致隐私需求用户 |
- 以上为 Q4 量化版本的参考需求;量化越低速度越快,质量略有下降。
- 统一内存需预留系统占用,实际可用显存约为总内存的 70%~80%。
- 绝大多数普通用户不需要本地部署,直接用 API 性价比最高、效果最好。
- 闭源模型(GPT、Claude、Gemini、Kimi)不公开完整参数,表中为激活参数估算值。
- DeepSeek V4.1 Flash 例外:它是开放权重的(552B MoE、MIT 许可),但规模远超消费级 Mac 的内存上限,本地跑不动——这类新模型的正确用法是走 API,而不是下载到本地。
接下来:路线判断完,接下来是纯操作:把密钥配好、把第一行代码跑通、把账单看住。
本文档仅供个人学习与研究使用, 不得用于商业用途 ,亦不构成任何收益承诺。
支持与分享
如果这篇文章对你有帮助,欢迎分享给更多人或打赏支持!














