Newsroom
AIEII

Qwen3.8-Max 和 DeepSeek V4-Flash 该选哪个

Qwen3.8-Max 走 2.4 万亿参数 MoE + 1M 上下文单价路线,DeepSeek V4-Flash 靠 0731 后训练把 Agent 基准全面拉高,价格差近 10 倍。按写作、编程、Agent 自动化三类场景给出选型判断。

TL;DR
  • 价格差近 10 倍:Qwen3.8-Max 输入 $2/输出 $6(每百万 token),DeepSeek V4-Flash 谷时段输入 $0.22/输出 $0.66,同样是 1M 上下文。
  • Agent 任务上 DeepSeek V4-Flash 更划算:Terminal-Bench 2.1 拿到 82.7 分,比 Qwen3.8-Max 的 86.6 只差一点,但价格只要后者的十分之一。
  • 写复杂代码或要最高正确率时选 Qwen3.8-Max:SWE-bench Pro 上 67.7 分明显高于 DeepSeek 同代产品,长文档、指令遵循也是它的强项。
Qwen3.8-Max 和 DeepSeek V4-Flash 该选哪个

先说结论:如果任务是让模型自己调用工具、跑多轮循环去完成一件事,选 DeepSeek V4-Flash,谷时段价格只要 Qwen3.8-Max 的十分之一左右,Agent 基准分数却相差无几。如果任务是要模型独立写出正确率最高的代码,或者严格按复杂指令产出内容,Qwen3.8-Max 的分数明显更高,值得多付几倍的钱。

这两款模型是 2026 年 8 月国产阵营里价格和定位两个极端的代表,一个把单价做到接近免费,一个把参数规模堆到 2.4 万亿。放在一起比,比单看任何一份评测都更有用。


基本参数:同样 1M 上下文,价格差一个量级

项目Qwen3.8-MaxDeepSeek V4-Flash
发布日期2026-08-030731 版本 2026-07-31 转正
参数规模2.4 万亿 MoE284B MoE
上下文窗口1M token1M token
最大输出131,072 token384K token
输入价格(每百万 token)$2$0.22(谷)/ $0.44(峰)
输出价格(每百万 token)$6$0.66(谷)/ $1.32(峰)
缓存命中价格$0.17-0.25$0.007(谷)/ $0.014(峰)

Qwen3.8-Max 的定价策略是"1M 上下文一口价":不管你塞 5000 token 还是 90 万 token 进去,单价都不变,没有长文本附加费。DeepSeek V4-Flash 则是峰谷两档,峰值时段是 UTC 01:00-04:00 和 06:00-10:00(周一到周五,对应北京时间 09:00-12:00 和 14:00-18:00),把批量任务排到谷时段,成本还能再打对折。

单看参数规模,Qwen3.8-Max 是 DeepSeek V4-Flash 的 8 倍多,这也是它价格更高的直接原因。但参数规模不直接等于任务表现,具体看下面的基准。


Agent 与工具调用:DeepSeek V4-Flash 的分数追得很近

DeepSeek V4-Flash-0731 这次更新官方说得很明确:没换基座模型,只是重跑了后训练,专门针对 Agent 行为和工具调用对齐做优化。改完之后九项官方 Agent 基准全面超过自家更贵的 V4-Pro-Preview:

基准DeepSeek V4-Flash-0731Qwen3.8-Max
Terminal-Bench 2.182.786.6
DeepSWE54.4未公开
Cybergym76.7未公开

Qwen3.8-Max 在 Terminal-Bench 2.1 上确实分数更高(86.6 对 82.7),但这 4 分差距换来的是近 10 倍的单价。对跑批量自动化、定时任务、工具链调度这类"次数多、单次要求不用最高"的场景,DeepSeek V4-Flash 的性价比明显更合适,尤其是把任务排到谷时段之后。

反过来,如果 Agent 任务里包含大量文件读取、长文档摘要、多轮上下文累积,Qwen3.8-Max 的 131,072 token 单次输出上限配合它更强的指令遵循能力,出错率会更低,值得为关键任务多付这笔钱。


纯代码任务:Qwen3.8-Max 领先, 但没有想象中那么绝对

在 SWE-bench Pro 这个更偏"真实软件工程"的基准上,Qwen3.8-Max 拿到 67.7 分,超过 GPT-5.6 Sol 的 64.6,但落后于 Opus 4.8 的 69.2,更是被 Fable 5 的 80.0 拉开明显差距。FrontierSWE 上 Qwen3.8-Max 是 73.5 分,同样落后于 Fable 5 的 88.8。

结合官方的定位描述,Qwen3.8-Max 更擅长的是终端类 Agent 任务、文档理解、指令遵循和电脑操作,不是最顶尖的纯代码推理引擎。这一点和它面向的场景吻合:多数需要 Qwen3.8-Max 的场合,是要模型稳定按格式产出,而不是解一道高难度算法题。

DeepSeek 这边没有公开对应的 SWE-bench Pro 分数,但 DeepSWE 基准从升级前的 7.3 冲到 54.4,说明它在这次更新里补的正是"独立写代码解决问题"这块短板,只是幅度上还没追平 Qwen3.8-Max。


我的判断

按现在这套价格和分数,我会把两者用在不同活儿上,而不是二选一定死。批量、高频、允许偶尔出错重跑的 Agent 自动化任务(比如定时抓取、文件整理、多轮工具调用的日常流水线),DeepSeek V4-Flash 谷时段的价格摆在那,没理由多付十倍钱去换 4 分的 Terminal-Bench 提升。但涉及复杂指令的长文档处理、需要一次成型的正式稿件,或者代码逻辑本身比较绕的任务,Qwen3.8-Max 的指令遵循和 SWE-bench 分数更值得信赖,出错返工的成本往往比模型调用费本身更高。真要抠成本,可以先用 DeepSeek V4-Flash 跑草稿或探路,确认方向后再上 Qwen3.8-Max 精修关键结果,两边各取所长。

参考

相关阅读

常见问题

Qwen3.8-Max 和 DeepSeek V4-Flash 上下文窗口一样大吗?
都是 1M token,但输出上限不同。Qwen3.8-Max 最大输出 131072 token,DeepSeek V4-Flash 最大输出 384K token,长内容生成场景 DeepSeek 的输出空间更大。
两者价格具体差多少?
Qwen3.8-Max 固定价输入 $2/输出 $6(每百万 token)。DeepSeek V4-Flash 走峰谷双价,谷时段输入 $0.22/输出 $0.66,峰值时段(UTC 01:00-04:00 和 06:00-10:00,工作日)翻倍到 $0.44/$1.32。就算按峰值算,V4-Flash 也只是 Qwen3.8-Max 价格的四分之一左右,谷时段则差出近 10 倍。
做 Agent 自动化任务该选哪个?
优先 DeepSeek V4-Flash。它的 0731 版本专门重跑了 Agent 相关的后训练,Terminal-Bench 2.1 从 61.8 冲到 82.7,DeepSWE 从 7.3 冲到 54.4,跟 Qwen3.8-Max 的 86.6 分差距很小,但单价只有对方的十分之一。除非任务本身要求极高的代码正确率,否则谷时段跑 V4-Flash 更省钱。
写公众号文章、长文案这类任务呢?
两个都能跑 1M 上下文,差别在细节控制力。Qwen3.8-Max 在指令遵循和文档理解上评测分数更高,对格式、字数、多重约束要求严的稿子更稳;DeepSeek V4-Flash 便宜到可以多轮反复生成再挑,适合先走量再精修的工作流。
广告合作联系
立即联系 →
加入会员申请
了解详情 →
← MiniMax H3怎么用,视频生成本地部署与API教程
💬 Comments
4 min read