50 分。
比上一版跳了 10 分。
比 GPT-5.6 Luna,只差 1 分。
这三个数字放在一起看有点反常识:一个"只是升级了 API 版本号"的模型,跑分居然涨了这么多。更反常识的是,DeepSeek 官方自己说,这次架构一个参数都没动。
一、官方说了什么:逐句读原文
7 月 31 日,DeepSeek 官方账号发了条推文,专门解释这次 V4-Flash-0731 升级到底改了什么。原文分了几条,逐句拆开看,信息密度不低:
“DeepSeek-V4-Flash-0731 keeps the exact same model architecture and size as the preview version. Today’s upgrade applies ONLY to the DeepSeek-V4-Flash API. The DeepSeek-V4-Pro API and App/Web models remain unchanged for now.”
翻成大白话就是三件事:
- 架构和参数量完全没变:还是那个 2840 亿总参数、每次推理只激活 130 亿参数的 MoE 模型,上下文窗口维持 100 万 token。
- 只升级了 API 一侧:App、网页版模型都没跟着变,V4 Pro 更是原地不动。
- V4 Pro 正式版还没来:这条推文末尾提到"the official release of DeepSeek-V4-Pro",暗示 Pro 版的正式发布还在路上,这次轮不到它。
也就是说,这不是一次新模型发布,连"小版本升级"都算不上,官方给它的定位就是同一个模型换了一套后训练权重。API 端点没变,延迟表现没变,定价也没变。据 DigitalApplied 和 MarkTechPost 的报道,这次改动的重心全部压在了 coding、agent、推理和工具调用这几个方向的后训练管线上,模型本体是 4 月发布的 V4 Flash 预览版,“退回去重新调过”。
一个不长架构、不涨参数的模型,靠后训练就能把跑分拉高 10 分,这件事本身比跑分数字更值得琢磨。
二、第三方跑分怎么跳的
Artificial Analysis 是目前跟踪大模型能力最系统的第三方评测机构之一,8 月初专门发了一篇文章讲这次升级,标题直接写着"DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence Index, 10 points above previous DeepSeek V4 Flash"。
把几个关键分数摆在一张表里看会更直观:
| 模型 | AA 智能指数 | 相对上一版 | 备注 |
|---|---|---|---|
| DeepSeek V4 Flash(4 月预览版) | 40 | 基准 | 同一模型的旧后训练版本 |
| DeepSeek V4 Flash-0731(本次) | 50 | +10 | 架构、参数、定价全部不变 |
| DeepSeek V4 Pro(官方未发布) | 44 | 被反超 6 分 | 自家更大的模型反被 Flash 超过 |
| GPT-5.6 Luna(max 档位) | 51 | 领先 1 分 | 目前该指数的头部模型之一 |
| Gemini 3.6 Flash | 50 | 打平 | 与本次 V4 Flash-0731 持平 |
据 Artificial Analysis 官方文章和其在 X 上的 同步说明,涨分最猛的地方不在通用知识类基准,而在 agent 相关任务:GDPval-AA v2 的 Elo 从 1189 跳到 1559,Terminal-Bench 2.1 提高了 17 个百分点,来到 79%。这两个基准分别对应"真实经济任务执行能力"和"命令行环境里独立完成任务的能力",都是最近一年模型竞争最卷的方向。
幻觉率这项也有改善。V4 Flash-0731 在 AA-Omniscience Hallucination Rate 上是 84%,比上一版低了 12 个百分点,和 GPT-5.6 Terra(max,85%)、Mistral Medium 3.5(82%)大致处在同一水平线上。
价格这块是这次升级最"划算"的部分。据聚合了官方 API 文档的 pricepertoken 等站点整理的数据,V4 Flash 的定价维持原样:每百万 token 缓存命中输入 0.0028 美元,缓存未命中输入 0.14 美元,输出 0.28 美元。据 the-decoder 的报道,按 Artificial Analysis 的每任务成本口径测算,V4 Flash-0731 完成同等难度任务的花费,比智能水平相近的 GPT-5.6 Luna(max)低约 60%。放到那张常见的"智能指数 × 每百万 token 成本"帕累托前沿图上,这次升级直接把 DeepSeek 的坐标点往左上方推了一截,此前占据同价位区间的主要是 Gemini 3.6 Flash 和一些开源模型,现在多了一个跑分更高的对手。
三、静默升级说明了什么
先说结论:这次的核心变量不是算力,是后训练。
参数量没变,激活参数没变,训练数据规模官方也没提大改,唯一能解释 10 分涨幅的,只有 DeepSeek 自己承认的那句话,“聚焦在编程、agent、推理和工具调用方向重做了后训练”。这跟过去两年"参数越堆越大、上下文越拉越长"的路子明显不是一回事。
这背后其实是一个正在发生的转向:当基座模型的规模已经摸到了性价比拐点,继续加参数带来的边际收益变小,后训练、强化学习、agent 场景的针对性调优,成了性价比更高的增量来源。V4 Flash-0731 在 agent 类基准上的涨幅(GDPval 提升 370 Elo,Terminal-Bench 提升 17 个百分点)远大于通用知识类基准,正好印证了这一点,训练资源被优先砸在了"能不能独立完成一个真实任务"上,而不是"能不能多背几道题"。
再看时机。这次升级发生在 7 月 31 日,一周后的 8 月 6 日,DeepSeek 又官宣计划上调整体 API 定价,虽然没公布具体新价格和生效时间,但"即将大幅涨价"的信号已经放出来了。把两件事连起来看,这次免费的能力升级,更像是涨价前的最后一轮口碑窗口:用同样的钱,让开发者先尝到更聪明的模型,等真正涨价的时候,用户已经习惯了这个新的性价比基准线,接受度自然更高。
架构不动、价格不动、跑分猛涨,说明国产模型这一轮竞争的胜负手,已经从"谁的模型更大"悄悄挪到了"谁的后训练管线更会调"。这件事对普通开发者的实际意义,可能比跑分本身更大:换模型不一定非要等新架构,一次静默的版本号升级也可能是免费的能力跃升。
值得留意的另一层:V4 Pro 作为参数更大的旗舰款,这次反而被自家的 Flash 版反超了 6 分。这多少说明"更大的模型"和"调得更好的模型"已经不是同一件事,至少在 DeepSeek 目前的产品矩阵里,谁的后训练团队先啃下 agent 场景,谁就先冒头。
四、本周其他模型动态速览
除了 DeepSeek 这次静默升级,最近一个月的模型发布节奏依然很密集,几个值得记一笔的动作:
| 模型 | 厂商 | 发布日期 | 一句话看点 |
|---|---|---|---|
| GPT-5.6 Luna | OpenAI | 2026-07-09 | 目前 AA 智能指数头部模型之一,本期是 V4 Flash 的对标基准 |
| Gemini 3.6 Flash | 2026-07-21 | 智能指数与本次 V4 Flash-0731 打平 | |
| Claude Opus 5 | Anthropic | 2026-07-24 | 本月 Anthropic 侧的旗舰更新 |
| Qwen3.8 Max | 阿里 | 2026-08-02 | 国产模型阵营最新一轮跑分冲击 |
| Muse Spark 1.2 | Meta | 2026-08-05 | Meta 近期发布节奏加快的信号之一 |
据行业追踪站点 llm-stats 的统计,目前模型发布的平均间隔已经缩短到大约每两天一个新版本,速度战、价格战、生态分发战叠在一起打。这种密度下,“静默升级"会越来越常见,厂商未必每次都用发布会级别的动静来官宣一次能力跃升,反而是像这次 DeepSeek 一样,一条推特、一个版本号后缀,就把事情说完了。这也是为什么盯着第三方评测站的实时数据,比等厂商的官方通稿更靠谱。
写在最后
这期周刊的主角其实不是某个新模型,而是一次"没有新模型的升级”。DeepSeek 用一句"架构不变"堵住了外界对参数规模的想象空间,转头用后训练把跑分拉到了逼近 GPT-5.6 Luna 的位置,价格还没动。对国内在做 agent、coding 相关应用的团队来说,这可能是最近一个月性价比最高的一次模型可替换窗口,尤其是考虑到官方已经预告要涨价。
真正该留意的不是这一次涨了多少分,而是这个模式会不会成为常态:模型厂商把"重做后训练"当成比"训练新架构"更便宜、更快的迭代方式,那评测榜单的更新频率,可能比新模型发布的频率还要快。
参考资料: