DeepSeek V4 在 2026 年 4 月 24 日发布了 Preview 版本,分两个型号:V4-Pro 总参数 1.6T、激活参数 49B;V4-Flash 总参数 284B、激活参数 13B。两者都是 MoE 架构,官方默认 1M token 上下文,权重开源在 HuggingFace,MIT 协议可商用。这篇只回答一个问题:这东西能不能在自己的机器上跑起来,需要多少显存或内存。
结论先给:V4-Flash 有社区 GGUF 能跑,但入门门槛是 100GB+ 内存/显存,普通消费级设备碰不到;V4-Pro 官方不发 GGUF,社区量化版本体积依然是几百 GB 量级,实用性很低。绝大多数个人开发者更现实的路径是走云端 API。
一、V4-Flash 量化版本与硬件门槛
Unsloth 官方文档给出的 GGUF 变体和硬件建议如下(数据来自 Unsloth 官方文档,2026-08 核对):
| 量化档位 | 大致体积 | 官方最低内存建议 |
|---|---|---|
| UD-IQ3_XXS (3-bit) | 约 103GB | 约 110GB |
| UD-Q4_K_XL (4-bit) | 约 155GB | 约 162GB |
| UD-Q8_K_XL (近乎无损) | 约 162GB | 约 169GB |
Unsloth 的 UD- 系列是他们自己的动态量化方案:MoE 路由相关的非专家张量被固定保留在 Q8_0 精度(约占模型 4% 的参数量),只对专家权重做深度量化,官方说法是这样比"一刀切"的标准 Q4_K_M 更小也更快。截至 2026-08-16, 这是本文能查到的最完整来源,不同来源(如社区镜像 teamblobfish/DeepSeek-V4-Flash-GGUF)给出的体积数字在个位数 GB 范围内有出入,属于打包方式差异,不影响量级判断。
多卡场景可以用 IQ2 系列(IQ2_XS-XL 约 81GB)分摊到双卡 48GB 显卡上,但这属于牺牲精度换体积的极限压缩,实测质量损失需要自己评估,本文没有查到官方给出的具体 benchmark 分数对比,不确定的地方就不编。
二、V4-Pro:官方不发 GGUF,社区量化不实用
V4-Pro 的 1.6T 总参数量级远超个人硬件能承受的范围。官方没有发布对应的 GGUF 文件,社区尝试量化过的版本,即便压到 Q2_K 这种极限档位,体积依然在约 400GB 左右,对个人设备来说既装不下也没有实际意义(精度损失会很严重)。如果确实需要 V4-Pro 级别的能力,走 API 或云端托管的多卡集群是唯一现实选项。
三、Ollama 怎么拉
截至 2026-08-16,Ollama 官方模型库还没有专门的 deepseek-v4 标准 tag,可以用指向 HuggingFace 仓库的写法间接拉取社区 GGUF:
ollama pull hf.co/unsloth/DeepSeek-V4-Flash-GGUF:Q4_K_M
要认准 Unsloth 这类做过 MoE 路由特殊处理的构建版本。早期一批社区量化在 MoE 路由层处理上出过问题,会导致模型输出质量明显下降;另外 llama.cpp 主线是在一次 PR(#24162)后才加入 V4 支持,紧接着的补丁修复了量化 KV 缓存在多轮对话里的一个 bug,如果用的工具链版本较旧,建议先确认更新到修复之后的版本。
四、更现实的路径:云端 API
个人开发机大概率碰不到 100GB+ 内存/显存这个门槛,接 API 是更现实的选择。DeepSeek 官方 API 截至 2026-08-16 的价格(deepseek-v4-flash,缓存未命中):输入 $0.14/M token,输出 $0.28/M token;deepseek-v4-pro 相应贵一些,输入约 $0.435/M,输出约 $0.87/M。官方公告有峰谷时段价格调整,具体以 DeepSeek 官方定价页 当天数字为准,这里给的是查到时的截图数据,不保证长期有效。
我的判断
V4-Flash 本地部署适合已经有 128GB+ 统一内存工作站或多卡服务器的团队,图的是数据不出内网;普通开发者电脑(16-64GB 内存/8-24GB 显存这个区间)碰不到门槛,硬凑量化档位精度损失太大,不如接 API。V4-Pro 目前阶段基本不用考虑本地部署,等社区出现更成熟的极限量化方案再看。查不到官方公开的 V4-Pro 量化基准分数, 这里不编数字。
相关阅读
- 本地跑 Kimi-K2.6 与 GLM-5.2:Ollama 完整部署与选型实操指南
- Ollama 报 CUDA out of memory 怎么办:显存不足排查清单
- Dify Agentic RAG 管线搭建指南