本地跑大模型第一步不是选模型,是算清楚显存或内存够不够。8B 模型 8GB 就能跑,32B 要 20GB 以上,70B 量化后最低也要 40GB,这三道门槛决定了你该买什么机器,而不是先看谁的跑分高。
这篇按 2026 年 8 月能查到的真实价格,把 Mac 统一内存路线和 N 卡显存路线摆在一起对比。
三个模型量级要多少内存/显存
| 模型量级 | Q4 量化最低需求 | 典型代表 | 能跑的机器 |
|---|---|---|---|
| 7B-8B | 8GB | Llama 3.1 8B、Qwen 2.5 7B | 任意 16GB 内存的 Mac、8GB 显存的入门显卡 |
| 32B | 20-24GB | Qwen 2.5 32B、QwQ-32B | 24GB 显存显卡(4090)、24GB 以上统一内存 Mac |
| 70B | 40-48GB(Q4_K_M 约 43GB) | Llama 3.3 70B | 双卡 4090(48GB 组合)、64GB 以上统一内存 Mac |
排序逻辑很直接:数字是硬门槛,内存或显存不够,模型根本加载不进去,跟推理速度快慢无关。先卡量级,再谈买哪台机器。
Mac 统一内存路线:一次买够容量,带宽是短板
2026 年 8 月,M4 Mac mini 16GB/256GB 版本 799 美元起,M4 Pro 版 24GB/512GB 起价 1599 美元。想要更大内存容量得看 MacBook Pro 或 Mac Studio:M5 Pro 14 寸机型起价 2199 美元,但 128GB 统一内存目前只有 M5 Max 芯片支持,顶配拉满的 M5 Max MacBook Pro 价格约 7349 美元。
统一内存的好处是 CPU 和 GPU 共享同一块内存池,一次配够容量就能跑很大的模型,不用像独显那样考虑多卡显存合并的复杂度。局限是内存带宽通常低于高端独立显卡的显存带宽,同样参数量下推理速度一般跟不上顶级 N 卡。
N 卡显存路线:速度更快,但高显存卡要么缺货要么贵
2026 年 8 月的显卡市场不太正常:RTX 5090 因为显存供应紧张,街价已经涨到约 4300 美元,远超 1999 美元的发布价,VRAM 本身在这个价格里就占了大约 820 美元。RTX 5080(16GB VRAM)价格在 999 到 1199 美元,性能大约是 5090 的 75% 到 80%,性价比明显更高。
RTX 4090(24GB VRAM)已经在 2024 年停产,市场只剩存量。国内二手 90 新的 4090 参考价在 1.1 万到 1.3 万元人民币,比 2026 年初涨了约 20%,新卡则要 1.3 万到 1.5 万元。它的显存带宽约 1008 GB/s,比 5090 的 1792 GB/s 慢,但对 32B 级别的模型来说完全够用。
独显路线的好处是同等参数量下推理速度普遍快于统一内存方案,适合对响应速度敏感的场景。局限是想要 40GB 以上的显存,要么等显存价格降下来买 5090,要么上双卡方案,单卡目前没有性价比选项能覆盖 70B。
按预算给的具体建议
| 预算 | 推荐配置 | 能跑到什么量级 |
|---|---|---|
| 5000-8000 元 | 二手 RTX 4090(24GB,约 1.1-1.3 万元,需搭配主机)或 Mac mini M4 Pro 24GB | 32B Q4 |
| 1.5-2 万元 | RTX 5080 主机(16GB VRAM,999-1199 美元卡价) | 32B 舒适跑,7B/8B 高并发 |
| 3 万元以上 | MacBook Pro M5 Max 64GB 起 | 70B Q4,视内存档位而定 |
| 5 万元以上 | 双卡 RTX 4090(48GB 显存组合)或 M5 Max 128GB | 70B Q4 舒适跑 |
我的判断
先按你要跑的模型量级倒推需求,不要先定预算再凑合。32B 是目前性价比最高的一档,一张 4090 或一台 24GB 内存的 Mac 就能跑,日常够用。想跑 70B 才需要认真考虑双卡或高配 Mac,这笔钱花下去之前先想清楚是不是真的需要 70B 级别的能力,很多任务 32B 量化模型已经够用,没必要为了参数量多花一倍预算。现在(2026 年 8 月)不适合为了 RTX 5090 去追高价,显存供应紧张的情况下等一等或者退而求其次选 5080 更划算。