三个开源冠军,你的项目只能选一个。
这是 2026 年 7 月最真实的选型困境。
DeepSeek V4-Pro、Qwen 3.6 Max Preview、GLM 5.2,三家都在刷榜,各有绝活,没有哪一家输得体面。问题是它们擅长的事情不一样,选错了不是小事,是整套工程白搭一半。
三家的身世和定位
先把背景讲清楚,才好谈分数。
DeepSeek V4-Pro
深度求索今年 4 月 24 日发布。架构是 1.6T 参数的 MoE,实际推理时激活的参数量比总量小很多,这让它的计算成本相对可控。API 报价 $0.87/M 输出 token,在同级别模型里算是真便宜,不是打折促销的那种便宜。
NIST 下属机构 CAISI 做了独立评估,结论是它的综合能力比当前前沿模型落后约 8 个月。乍一听像缺点,但它是开源的,还便宜,这个"落后 8 个月"放在这个背景里,反而是一种背书。
上下文窗口 1M token,处理超长文档时有实际价值。
Qwen 3.6 Max Preview
阿里云 4 月 20 日上线,比 DeepSeek 早了几天。上下文 262K,API 定价 $1.30/M 输入、$7.80/M 输出,比 DeepSeek 贵,特别是输出价格贵了将近 9 倍。
“Preview"这个后缀不是谦虚,是阿里的发布策略,后面还有正式版。在中文能力和编程覆盖度上,Qwen 系列一直是国产开源里最认真的一家。输出速度 41 tokens/秒,用起来不卡。
GLM 5.2
智谱(Z.ai)6 月 13 日发布,MIT 协议,完全开源可商用。这是三家里发布最晚的一个,定位也最明确,就是给写代码用的。1M 上下文,“Coding-First"是他们自己打的标签,不是泛泛宣传那种。
值得注意的是,智谱在发布时没有公开系统性的评测数字,现在外界看到的大部分数据来自第三方机构,比如 Artificial Analysis。这不是坏事,只是选型时要留意数据来源。
| 模型 | 发布时间 | 上下文 | API 输出价格 | 协议 |
|---|---|---|---|---|
| DeepSeek V4-Pro | 2026-04-24 | 1M | $0.87/M | 开源开权重 |
| Qwen 3.6 Max Preview | 2026-04-20 | 262K | $7.80/M | 开源 |
| GLM 5.2 | 2026-06-13 | 1M | 待更新 | MIT |
评测榜单怎么读
榜单很多,结论不一。原因很简单,任务不同,排名就不同。
7 月中旬,OpenCompass 周榜显示 DeepSeek-V4-Pro 和 Qwen3.6-Max-Preview 都在国产开源前列。GLM 5.2 在编程专项和 Agentic 任务上的评测名列前茅,据 techsy.io 7 月榜单报道,在 agentic coding 和 reasoning 维度上 GLM 5.2 在开源模型里排名靠前。没有哪一家全部维度都领先。
理解下面这张表,比背下来某个模型"多少分"更有用:
| 榜单 | 考核重点 | 谁适合参考 |
|---|---|---|
| SWE-bench Verified | 真实 GitHub issue 修复率 | 做工程工具 |
| GPQA Diamond | 博士级理科推理题 | 科研、分析类产品 |
| LiveCodeBench | 编程竞赛题通过率 | 算法类工程师 |
| QwenChineseBench | 中文理解与生成 | 中文内容产品 |
| Terminal-Bench | 命令行、Agent 任务完成率 | 做 AI Agent |
| MATH-500 | 数学解题精度 | 教育、金融量化 |
同一个模型在不同榜单上的位置可以差很多。DeepSeek V4-Pro 在 GPQA Diamond 拿到 90.1%,在 MATH-500 达到 96.1%,这两个数字指向的用户,根本不是想做中文写作辅助的人。
看 OpenCompass 的建议:别只看综合总分,优先看跟你任务直接相关的子榜。总分高不代表你的场景里它最好用。
三个场景,逐个比
场景一:写代码
这是竞争最激烈的地方。
DeepSeek V4-Pro 的数字是目前三家里最完整的。LiveCodeBench Pass@1 达到 93.5,Codeforces 评级 3206,SWE-bench Verified 80.6%。这三个数字合在一起,说明它不只是能做算法选择题,修真实代码库里的 bug 也很稳。来源是 morphllm.com 的深度测评和 DataCamp 的独立评估,不是厂商自报。
Qwen 3.6 Max Preview 声称在 6 个主要编程榜单排名第一,包括 SkillsBench、SciCode、NL2Repo。对比上一个版本,SkillsBench 提升了 9.9 分,SciCode 提升 10.8 分。这些是阿里自己发布的对比数字,第三方的交叉验证还在陆续出来。
GLM 5.2 的厂商数字是 SWE-bench Pro 62.1%、Terminal-Bench 2.1 达到 81.0%。两个注意点:一是这是厂商自报,不是独立机构数字;二是 Terminal-Bench 考的是 Agent 执行命令行任务的能力,跟传统代码补全是不同的测试场景。如果你要做的是给开发者的本地 AI Agent,这个 81% 很值得关注。
MIT 协议的实际意义在这里出来了。GLM 5.2 可以完全私有化部署,代码不出境,数据不上云。对有合规要求的金融、医疗类项目,这是真实优势。
场景二:中文与写作
Qwen 最强,没什么争议。
阿里在中文上的投入是持续性的,不是临时加料。QwenChineseBench 对比上一版提升了 5.3 分,中文长文的逻辑连贯性在同类模型里表现最稳。Qwen 系列背后有阿里自己的中文语料积累,这不是靠微调能短期追上的。
DeepSeek 的中文也不差,但它没有把中文作为主要发力点。GLM 来自国内学术圈,清华技术基因,中文基础训练扎实,但具体的对比数字目前公开有限。
结论:做面向中文用户的产品,Qwen 是默认选择,除非你有成本或合规方面的硬约束。
场景三:复杂推理
DeepSeek V4-Pro 在这里有最硬的第三方数据。
GPQA Diamond 90.1%,这个榜单的题目是博士级科学推理,不是中学物理。MATH-500 96.1%,MMLU-Pro 87.5%,三个数字加在一起,数理推理是它的真实强项。
CAISI 评估(NIST 下属)专门做了一轮独立测试,结论是 DeepSeek V4-Pro 的能力比前沿模型落后约 8 个月,但在所有被评估的开源模型里属于第一梯队。
Qwen 3.6 Max Preview 的 SuperGPQA 也有提升,但详细分数没有完整公开。GLM 5.2 的定位是编程,复杂推理不是它的主赛道,没必要强行对比。
要做科研辅助、法律条文解析、复杂财务建模?DeepSeek V4-Pro 是目前开源里最接近 o3 推理体验的选择,数据说话。
选哪家:五类场景的决策建议
没有万能答案,但可以按场景给出明确优先级。
编程工具、代码助手、IDE 插件
第一选 DeepSeek V4-Pro。数据最全,第三方独立验证最多,API 最便宜。如果需要私有化部署,GLM 5.2 的 MIT 协议是真实优势,不是门面功夫。
中文内容产品,公众号、文案工具、本地化服务
第一选 Qwen 3.6 Max Preview。中文能力领先,262K 上下文处理长文够用。注意 API 输出价格 $7.80/M,高调用量场景要认真算成本账,跑多了不便宜。
科研工具、企业分析、复杂推理场景
DeepSeek V4-Pro。推理能力的数字有独立来源,不只是榜单刷出来的。数学和逻辑推理在开源圈里目前还没遇到对手。
AI Agent、长工具链调用、本地 CLI 自动化
GLM 5.2 值得认真考虑,Terminal-Bench 的表现和 1M 上下文都有实际意义。但第三方评测还不够完整,现在重押风险偏高。Qwen 3.6 Max Preview 的工具调用也做了优化,是相对稳妥的备选。
成本优先
DeepSeek V4-Pro,$0.87/M 输出,三家里最低。Qwen 3.6 Max 的输出价格是 $7.80/M,快 9 倍的差距,不是小数字。
| 场景 | 首选 | 备选 | 主要风险 |
|---|---|---|---|
| 编程工具 | DeepSeek V4-Pro | GLM 5.2(私有化) | GLM 厂商数据待第三方验证 |
| 中文内容 | Qwen 3.6 Max | DeepSeek V4-Pro | Qwen API 成本高 |
| 复杂推理 | DeepSeek V4-Pro | Qwen 3.6 Max | 两者差距不大 |
| AI Agent | 观望 GLM 5.2 | Qwen 3.6 Max | GLM 评测完整度不足 |
| 成本优先 | DeepSeek V4-Pro | 自部署 GLM | Qwen 明显偏贵 |
| 私有化部署 | GLM 5.2 | DeepSeek(开放权重) | 硬件成本 |
写在最后
国产开源这一轮跑得很快。从去年 DeepSeek V3 一家独秀,到今天三家互相缠斗,用了不到一年时间。
但"三强"这个说法有点误导。它们擅长的事情不一样,不是同一条赛道在赛跑。Qwen 往中文和多模态走,DeepSeek 往推理和成本效率走,GLM 押注在编程和私有化这条线上。
对你来说,重要的不是哪家"赢了”,而是你的任务是什么,你的预算是多少,你的数据能不能出境。
答好这三个问题,选型就有了答案。
数据来源
- China’s Top AI Models in 2026, Medium/Coinmonks
- DeepSeek V4 架构与评测, MorphLLM
- DeepSeek V4 Review, DataCamp
- DeepSeek V4 CAISI 独立评估, NIST
- Qwen 3.6 Max Preview, Artificial Analysis
- Qwen 3.6 Max Preview 完整指南, aimadetools
- GLM 5.2 发布, Codersera
- GLM 5.2 编程评测, Technology.org
- Best Open-Source LLMs July 2026, Techsy
- Qwen vs DeepSeek vs GLM 2026, Techsy