Newsroom
AIEII

中国开源三强对垒:DeepSeek V4、Qwen 3.6 Max、GLM 5.2 谁更能打

OpenCompass 七月榜单显示 DeepSeek V4、阿里 Qwen 3.6 Max Preview、智谱 GLM 5.2 三足鼎立。这篇把三家的定位、擅长场景和选型建议摊开讲,帮你决定手头项目该押哪一个。

2026年07月25日

中国开源三强对垒:DeepSeek V4、Qwen 3.6 Max、GLM 5.2 谁更能打

三个开源冠军,你的项目只能选一个。

这是 2026 年 7 月最真实的选型困境。

DeepSeek V4-Pro、Qwen 3.6 Max Preview、GLM 5.2,三家都在刷榜,各有绝活,没有哪一家输得体面。问题是它们擅长的事情不一样,选错了不是小事,是整套工程白搭一半。


三家的身世和定位

先把背景讲清楚,才好谈分数。

DeepSeek V4-Pro

深度求索今年 4 月 24 日发布。架构是 1.6T 参数的 MoE,实际推理时激活的参数量比总量小很多,这让它的计算成本相对可控。API 报价 $0.87/M 输出 token,在同级别模型里算是真便宜,不是打折促销的那种便宜。

NIST 下属机构 CAISI 做了独立评估,结论是它的综合能力比当前前沿模型落后约 8 个月。乍一听像缺点,但它是开源的,还便宜,这个"落后 8 个月"放在这个背景里,反而是一种背书。

上下文窗口 1M token,处理超长文档时有实际价值。

Qwen 3.6 Max Preview

阿里云 4 月 20 日上线,比 DeepSeek 早了几天。上下文 262K,API 定价 $1.30/M 输入、$7.80/M 输出,比 DeepSeek 贵,特别是输出价格贵了将近 9 倍。

“Preview"这个后缀不是谦虚,是阿里的发布策略,后面还有正式版。在中文能力和编程覆盖度上,Qwen 系列一直是国产开源里最认真的一家。输出速度 41 tokens/秒,用起来不卡。

GLM 5.2

智谱(Z.ai)6 月 13 日发布,MIT 协议,完全开源可商用。这是三家里发布最晚的一个,定位也最明确,就是给写代码用的。1M 上下文,“Coding-First"是他们自己打的标签,不是泛泛宣传那种。

值得注意的是,智谱在发布时没有公开系统性的评测数字,现在外界看到的大部分数据来自第三方机构,比如 Artificial Analysis。这不是坏事,只是选型时要留意数据来源。

模型发布时间上下文API 输出价格协议
DeepSeek V4-Pro2026-04-241M$0.87/M开源开权重
Qwen 3.6 Max Preview2026-04-20262K$7.80/M开源
GLM 5.22026-06-131M待更新MIT

评测榜单怎么读

榜单很多,结论不一。原因很简单,任务不同,排名就不同。

7 月中旬,OpenCompass 周榜显示 DeepSeek-V4-Pro 和 Qwen3.6-Max-Preview 都在国产开源前列。GLM 5.2 在编程专项和 Agentic 任务上的评测名列前茅,据 techsy.io 7 月榜单报道,在 agentic coding 和 reasoning 维度上 GLM 5.2 在开源模型里排名靠前。没有哪一家全部维度都领先。

理解下面这张表,比背下来某个模型"多少分"更有用:

榜单考核重点谁适合参考
SWE-bench Verified真实 GitHub issue 修复率做工程工具
GPQA Diamond博士级理科推理题科研、分析类产品
LiveCodeBench编程竞赛题通过率算法类工程师
QwenChineseBench中文理解与生成中文内容产品
Terminal-Bench命令行、Agent 任务完成率做 AI Agent
MATH-500数学解题精度教育、金融量化

同一个模型在不同榜单上的位置可以差很多。DeepSeek V4-Pro 在 GPQA Diamond 拿到 90.1%,在 MATH-500 达到 96.1%,这两个数字指向的用户,根本不是想做中文写作辅助的人。

看 OpenCompass 的建议:别只看综合总分,优先看跟你任务直接相关的子榜。总分高不代表你的场景里它最好用。


三个场景,逐个比

场景一:写代码

这是竞争最激烈的地方。

DeepSeek V4-Pro 的数字是目前三家里最完整的。LiveCodeBench Pass@1 达到 93.5,Codeforces 评级 3206,SWE-bench Verified 80.6%。这三个数字合在一起,说明它不只是能做算法选择题,修真实代码库里的 bug 也很稳。来源是 morphllm.com 的深度测评和 DataCamp 的独立评估,不是厂商自报。

Qwen 3.6 Max Preview 声称在 6 个主要编程榜单排名第一,包括 SkillsBench、SciCode、NL2Repo。对比上一个版本,SkillsBench 提升了 9.9 分,SciCode 提升 10.8 分。这些是阿里自己发布的对比数字,第三方的交叉验证还在陆续出来。

GLM 5.2 的厂商数字是 SWE-bench Pro 62.1%、Terminal-Bench 2.1 达到 81.0%。两个注意点:一是这是厂商自报,不是独立机构数字;二是 Terminal-Bench 考的是 Agent 执行命令行任务的能力,跟传统代码补全是不同的测试场景。如果你要做的是给开发者的本地 AI Agent,这个 81% 很值得关注。

MIT 协议的实际意义在这里出来了。GLM 5.2 可以完全私有化部署,代码不出境,数据不上云。对有合规要求的金融、医疗类项目,这是真实优势。

场景二:中文与写作

Qwen 最强,没什么争议。

阿里在中文上的投入是持续性的,不是临时加料。QwenChineseBench 对比上一版提升了 5.3 分,中文长文的逻辑连贯性在同类模型里表现最稳。Qwen 系列背后有阿里自己的中文语料积累,这不是靠微调能短期追上的。

DeepSeek 的中文也不差,但它没有把中文作为主要发力点。GLM 来自国内学术圈,清华技术基因,中文基础训练扎实,但具体的对比数字目前公开有限。

结论:做面向中文用户的产品,Qwen 是默认选择,除非你有成本或合规方面的硬约束。

场景三:复杂推理

DeepSeek V4-Pro 在这里有最硬的第三方数据。

GPQA Diamond 90.1%,这个榜单的题目是博士级科学推理,不是中学物理。MATH-500 96.1%,MMLU-Pro 87.5%,三个数字加在一起,数理推理是它的真实强项。

CAISI 评估(NIST 下属)专门做了一轮独立测试,结论是 DeepSeek V4-Pro 的能力比前沿模型落后约 8 个月,但在所有被评估的开源模型里属于第一梯队。

Qwen 3.6 Max Preview 的 SuperGPQA 也有提升,但详细分数没有完整公开。GLM 5.2 的定位是编程,复杂推理不是它的主赛道,没必要强行对比。

要做科研辅助、法律条文解析、复杂财务建模?DeepSeek V4-Pro 是目前开源里最接近 o3 推理体验的选择,数据说话。


选哪家:五类场景的决策建议

没有万能答案,但可以按场景给出明确优先级。

编程工具、代码助手、IDE 插件

第一选 DeepSeek V4-Pro。数据最全,第三方独立验证最多,API 最便宜。如果需要私有化部署,GLM 5.2 的 MIT 协议是真实优势,不是门面功夫。

中文内容产品,公众号、文案工具、本地化服务

第一选 Qwen 3.6 Max Preview。中文能力领先,262K 上下文处理长文够用。注意 API 输出价格 $7.80/M,高调用量场景要认真算成本账,跑多了不便宜。

科研工具、企业分析、复杂推理场景

DeepSeek V4-Pro。推理能力的数字有独立来源,不只是榜单刷出来的。数学和逻辑推理在开源圈里目前还没遇到对手。

AI Agent、长工具链调用、本地 CLI 自动化

GLM 5.2 值得认真考虑,Terminal-Bench 的表现和 1M 上下文都有实际意义。但第三方评测还不够完整,现在重押风险偏高。Qwen 3.6 Max Preview 的工具调用也做了优化,是相对稳妥的备选。

成本优先

DeepSeek V4-Pro,$0.87/M 输出,三家里最低。Qwen 3.6 Max 的输出价格是 $7.80/M,快 9 倍的差距,不是小数字。

场景首选备选主要风险
编程工具DeepSeek V4-ProGLM 5.2(私有化)GLM 厂商数据待第三方验证
中文内容Qwen 3.6 MaxDeepSeek V4-ProQwen API 成本高
复杂推理DeepSeek V4-ProQwen 3.6 Max两者差距不大
AI Agent观望 GLM 5.2Qwen 3.6 MaxGLM 评测完整度不足
成本优先DeepSeek V4-Pro自部署 GLMQwen 明显偏贵
私有化部署GLM 5.2DeepSeek(开放权重)硬件成本

写在最后

国产开源这一轮跑得很快。从去年 DeepSeek V3 一家独秀,到今天三家互相缠斗,用了不到一年时间。

但"三强"这个说法有点误导。它们擅长的事情不一样,不是同一条赛道在赛跑。Qwen 往中文和多模态走,DeepSeek 往推理和成本效率走,GLM 押注在编程和私有化这条线上。

对你来说,重要的不是哪家"赢了”,而是你的任务是什么,你的预算是多少,你的数据能不能出境。

答好这三个问题,选型就有了答案。

数据来源

广告合作联系
立即联系 →
加入会员申请
了解详情 →
← 模型发布周报:谷歌 Gemini 三连发 + 启动 … AI 眼镜赛道升温:Even Realities 拿下美团腾 … →
💬 Comments
6 min read