先说结论:本地跑大模型,24GB显存是分水岭。低于这个数,你能跑的基本是7B到8B级别的量化模型;到了24GB,Qwen3.8-27B这类27B级别的开源模型才能舒服跑起来,这也是目前个人开发者能落地的实际天花板。至于Qwen3.8-Max那种2.4万亿参数的完整版,权重就有4.8TB,普通显卡再多也装不下,这条路直接可以排除。
但2026年8月配显卡,比往年多一层变数:内存和显存芯片同时缺货,业内叫这次短缺"RAMageddon",NVIDIA显卡价格被搅得有点乱,尤其是RTX 4090这张卡,停产以后二手价格反而比新卡还离谱。这篇按预算分三档给建议,也把这个变数摆出来,免得照着老攻略的价格做预算,配置单列出来才发现涨了一倍。
2026年8月的特殊情况:显卡为什么这么贵
往年配显卡,参考半年前的攻略问题不大,价格波动通常在10%以内。今年不是这样。
DDR5和GDDR7显存芯片今年同时出现供应紧张,行业里管这次短缺叫"RAMageddon"。这直接反映在两张热门卡上:
- RTX 4090(24GB):已经停产,发布价是1599美元,但截至2026年8月,新卡在Amazon标价约2755美元,二手在eBay也要2268美元左右,个别高端定制版(华硕ROG Strix、微星Suprim X)甚至冲到3200到3765美元。停产加上AI算力需求,让这张卡的二手行情比很多新卡还贵。
- RTX 5090(32GB):发布价1999美元,2026年8月的中位价已经涨到4699美元左右,Amazon报价4299美元,部分定制版甚至到6810美元。换算下来每GB显存的成本从发布时约62美元涨到了约147美元,翻了一倍还多。
这个背景直接影响了本文的建议:不要假设"买张4090就完事了",先看清楚你要花的钱是不是也被这波涨价卷进去了;同样预算,二手RTX 3090或者Mac Studio的统一内存路线,今年反而可能比咬牙上新4090划算。
入门档:预算有限,先把流程跑通
如果你是第一次在本地跑大模型,只是想跑通7B到8B参数的量化模型(比如Qwen3:8b、Llama系列的中小版本),不需要一步到位配24GB显存的卡。
RTX 4060 Ti 16GB是这个档位比较合理的选择,Amazon现价约424美元,二手市场能压到270美元左右。16GB显存跑7B级模型的4-bit或8-bit量化绰绰有余,但这张卡是纯PCIe架构,没有NVLink,不适合多卡扩展,只能单卡跑,算力也只够应付中小模型的推理,不建议指望它跑27B级别的大模型或者做微调训练。
这一档适合谁:想先摸清楚Ollama、vLLM这些工具怎么用,或者只是偶尔跑跑本地翻译、代码补全这类轻量任务的人。不适合谁:如果目标从一开始就是跑27B以上的模型,这张卡撑不住,钱等于白花,不如直接跳到下一档。
进阶档:24GB显存,本地部署的实际门槛
这是本文最想说清楚的一档,因为24GB显存对应的是目前开源社区里最有性价比的模型规格,比如同为2026年8月发布的Qwen3.8-27B:278亿参数的Dense架构,配Q4_K_M量化后,权重能完整塞进24GB显存,还能留出空间给上下文和KV缓存,实测速度在30到47 tok/s之间,日常对话和代码任务够用。
达到24GB门槛有两条路:
| 方案 | 参考价格(2026年8月) | 特点 |
|---|---|---|
| RTX 3090 24GB(二手) | 约700到1050美元 | 性价比最高,社区公认的"30B模型最优解",只是功耗和噪音比新卡大 |
| RTX 4090 24GB(新/二手) | 2268到3765美元 | 速度更快,但因停产+缺货,价格被推得很高,性价比明显不如3090 |
如果单看"能不能跑起来",两张卡的显存容量一样,效果差不多;差别主要在推理速度和功耗噪音上。以Qwen3.8-27B为例,用GGUF量化配合内存offload,16GB显存的卡也有人跑通了,但代价是速度打折、能用的上下文变短,不如直接上24GB来得省心。系统内存建议64GB起步,量化加载和长上下文场景对内存的需求比想象中高,内存不够会频繁触发swap,比显存不够还难受。
这一档适合谁:想认真跑本地大模型做日常开发辅助、内容处理或者数据不能出本地的场景。不适合谁:如果你的目标是跑Qwen3.8-Max那种完整版旗舰模型,24GB显存连边都摸不到,官方给出的部署门槛是8张B300级GPU起步,这不是消费级显卡能碰的量级。
专业档:更大上下文、多任务并发,或者绕开显卡涨价
如果24GB还不够用,比如需要同时跑多个模型、处理更长的上下文,或者干脆不想在这波显卡涨价里凑热闹,有两条路可以走:
双卡RTX 3090(48GB):拿两张二手3090(约1400到2000美元)组一台机器,显存翻倍到48GB,能跑更大的量化模型或者同时跑两个中等模型。缺点是要处理多卡供电、散热和PCIe通道分配,对硬件动手能力有要求,不是插上就能用。
Mac Studio统一内存:思路完全不同。M4 Max版本起价2499美元,标配36GB统一内存(受内存缺货影响,苹果已经把上限压到64GB,M3 Ultra版本起价5299美元,上限96GB)。统一内存架构的好处是CPU和GPU共享同一块内存池,跑大模型时不受"显存墙"限制,能装下独立显卡装不下的模型规格;代价是推理速度通常比同价位的独立显卡慢一截,更适合看重"能不能跑起来"而不是"跑多快"的场景。市场传闻M5 Max和M5 Ultra可能在2026年10月更新,M5 Max上限或到128GB,M5 Ultra理论上能到768GB,但受供应链影响能不能足量供货还不确定。
这一档适合谁:小团队需要本地跑更大的模型服务多人调用,或者预算充足但不想在显卡涨价潮里当冤大头的个人开发者。不适合谁:需要极致推理速度(比如实时语音交互)的场景,统一内存架构在这方面不如独立显卡直接。
我的判断
按官方定价和实测数据算下来,24GB显存这一档是目前本地跑大模型的甜蜜点:花小几百美元的二手RTX 3090,就能跑Qwen3.8-27B这种同代最强的开源模型之一,性价比明显好于咬牙上被停产涨价卷进去的RTX 4090。如果预算更紧,RTX 4060 Ti 16GB先把工具链跑熟也不亏,但别指望它顶到27B档;如果预算更松、又不想陷进显卡涨价的漩涡,Mac Studio的统一内存是个值得认真考虑的替代路线,尤其是这波"RAMageddon"看不出短期内会缓解。真正跑Qwen3.8-Max那种万亿参数完整版的念头,个人和小团队现阶段可以直接放弃,走云端API是唯一现实的路。
相关阅读
参考
- RTX 4090 Price Tracker US - Aug 2026
- Why Is the RTX 4090 So Expensive in 2026?
- RTX 5090 Price Tracker – August 2026
- Gaming GPU Prices 2026: RTX 5090 Tops $5,000
- A used RTX 3090 is still the best GPU for local AI in 2026
- RTX 3090 24GB Used Price & History (Aug 2026)
- RTX 4060 Ti 16GB price tracker
- Mac Studio 2026: New Leaks Tease M5 Power, Price, and Launch Timeline
- M5 Ultra Mac Studio Could Launch in 2026 With Up to 768GB of RAM