先说结论:如果任务是让模型自己调用工具、跑多轮循环去完成一件事,选 DeepSeek V4-Flash,谷时段价格只要 Qwen3.8-Max 的十分之一左右,Agent 基准分数却相差无几。如果任务是要模型独立写出正确率最高的代码,或者严格按复杂指令产出内容,Qwen3.8-Max 的分数明显更高,值得多付几倍的钱。
这两款模型是 2026 年 8 月国产阵营里价格和定位两个极端的代表,一个把单价做到接近免费,一个把参数规模堆到 2.4 万亿。放在一起比,比单看任何一份评测都更有用。
基本参数:同样 1M 上下文,价格差一个量级
| 项目 | Qwen3.8-Max | DeepSeek V4-Flash |
|---|---|---|
| 发布日期 | 2026-08-03 | 0731 版本 2026-07-31 转正 |
| 参数规模 | 2.4 万亿 MoE | 284B MoE |
| 上下文窗口 | 1M token | 1M token |
| 最大输出 | 131,072 token | 384K token |
| 输入价格(每百万 token) | $2 | $0.22(谷)/ $0.44(峰) |
| 输出价格(每百万 token) | $6 | $0.66(谷)/ $1.32(峰) |
| 缓存命中价格 | $0.17-0.25 | $0.007(谷)/ $0.014(峰) |
Qwen3.8-Max 的定价策略是"1M 上下文一口价":不管你塞 5000 token 还是 90 万 token 进去,单价都不变,没有长文本附加费。DeepSeek V4-Flash 则是峰谷两档,峰值时段是 UTC 01:00-04:00 和 06:00-10:00(周一到周五,对应北京时间 09:00-12:00 和 14:00-18:00),把批量任务排到谷时段,成本还能再打对折。
单看参数规模,Qwen3.8-Max 是 DeepSeek V4-Flash 的 8 倍多,这也是它价格更高的直接原因。但参数规模不直接等于任务表现,具体看下面的基准。
Agent 与工具调用:DeepSeek V4-Flash 的分数追得很近
DeepSeek V4-Flash-0731 这次更新官方说得很明确:没换基座模型,只是重跑了后训练,专门针对 Agent 行为和工具调用对齐做优化。改完之后九项官方 Agent 基准全面超过自家更贵的 V4-Pro-Preview:
| 基准 | DeepSeek V4-Flash-0731 | Qwen3.8-Max |
|---|---|---|
| Terminal-Bench 2.1 | 82.7 | 86.6 |
| DeepSWE | 54.4 | 未公开 |
| Cybergym | 76.7 | 未公开 |
Qwen3.8-Max 在 Terminal-Bench 2.1 上确实分数更高(86.6 对 82.7),但这 4 分差距换来的是近 10 倍的单价。对跑批量自动化、定时任务、工具链调度这类"次数多、单次要求不用最高"的场景,DeepSeek V4-Flash 的性价比明显更合适,尤其是把任务排到谷时段之后。
反过来,如果 Agent 任务里包含大量文件读取、长文档摘要、多轮上下文累积,Qwen3.8-Max 的 131,072 token 单次输出上限配合它更强的指令遵循能力,出错率会更低,值得为关键任务多付这笔钱。
纯代码任务:Qwen3.8-Max 领先, 但没有想象中那么绝对
在 SWE-bench Pro 这个更偏"真实软件工程"的基准上,Qwen3.8-Max 拿到 67.7 分,超过 GPT-5.6 Sol 的 64.6,但落后于 Opus 4.8 的 69.2,更是被 Fable 5 的 80.0 拉开明显差距。FrontierSWE 上 Qwen3.8-Max 是 73.5 分,同样落后于 Fable 5 的 88.8。
结合官方的定位描述,Qwen3.8-Max 更擅长的是终端类 Agent 任务、文档理解、指令遵循和电脑操作,不是最顶尖的纯代码推理引擎。这一点和它面向的场景吻合:多数需要 Qwen3.8-Max 的场合,是要模型稳定按格式产出,而不是解一道高难度算法题。
DeepSeek 这边没有公开对应的 SWE-bench Pro 分数,但 DeepSWE 基准从升级前的 7.3 冲到 54.4,说明它在这次更新里补的正是"独立写代码解决问题"这块短板,只是幅度上还没追平 Qwen3.8-Max。
我的判断
按现在这套价格和分数,我会把两者用在不同活儿上,而不是二选一定死。批量、高频、允许偶尔出错重跑的 Agent 自动化任务(比如定时抓取、文件整理、多轮工具调用的日常流水线),DeepSeek V4-Flash 谷时段的价格摆在那,没理由多付十倍钱去换 4 分的 Terminal-Bench 提升。但涉及复杂指令的长文档处理、需要一次成型的正式稿件,或者代码逻辑本身比较绕的任务,Qwen3.8-Max 的指令遵循和 SWE-bench 分数更值得信赖,出错返工的成本往往比模型调用费本身更高。真要抠成本,可以先用 DeepSeek V4-Flash 跑草稿或探路,确认方向后再上 Qwen3.8-Max 精修关键结果,两边各取所长。
参考
- Qwen 3.8 Max Ships: 2.4T MoE, 1M Context, $2/$6 per MTok, Open Weights Next Week
- Qwen3.8 Max - API Pricing & Benchmarks | OpenRouter
- Qwen3.8 Benchmarks: A Coding-Agent Evaluation Guide
- DeepSeek-V4-Flash Goes Official: Agent Benchmarks Beat V4-Pro-Preview
- DeepSeek API Pricing | DeepSeek API Docs
- DeepSeek V4 Flash: 284B MoE, 1M Context, Benchmarks, Pricing