这一周四家实验室的模型更新叠在一起: 一个降价, 一个开源权重, 一个号称最强开源但权重还没放, 一个专打长任务。放进同一张表看差异更直观。
一张表看懂这一周
| 模型 | 发布方 | 发布日期 | 是否开源权重 | 价格 (每百万 token) |
|---|---|---|---|---|
| Gemini 3.7 Flash | 2026-08-13 | 否, 闭源 API | 输入 0.75 美元 / 输出 3.75 美元 (引入价, 到 2026 年底) | |
| GLM-5.3 | Zhipu (Z.ai) | 2026-08-14 | 号称开源, 权重 8 月底才放 | 官方 API 未上线定价, 现只能走 GLM Coding Plan 订阅 |
| DeepSeek V4 Pro 0813 | DeepSeek | 2026-08-12/13 | 是, MIT 协议, 已上 Hugging Face | 输入 0.435 美元 (缓存未命中) / 0.003625 美元 (缓存命中) / 输出 0.87 美元 |
| Grok 4.6 | xAI | 2026-08-12 | 否, 闭源 API | 输入 2 美元 / 输出 6 美元 |
逐个看关键变化
Gemini 3.7 Flash: 半价换更强调试能力
Google 在 8 月 13 日发布, 距上一代 3.6 Flash 只隔了三周, 直接是稳定版没有预览标签。上下文窗口 1,048,576 token。官方给出的基准里, DeepSWE v1.1 从 49.0% 涨到 65.3%, FrontierCode 1.1 Main 从 34.4% 涨到 43.6%, 提升主要在调试和问题修复类任务。价格是上一代同期的一半, 但这是限时引入价, 2027 年 1 月 1 日起涨回 1.50 美元和 7.50 美元。
GLM-5.3: 沿用旧底座, 靠后训练涨了 50%
Zhipu 8 月 14 日发布, 没有换新的预训练底座, 沿用 GLM-5.2 的基座继续训练, 官方口径编程能力提升 50%。上下文窗口 1M token, 最大输出 128K token。这次专门为找代码漏洞训练了数据和环境, CyberGym 上跑到 84.5%, 略高于 GPT-5.6 Sol。但权重要两周后才放, 现在只能靠订阅的 GLM Coding Plan 或等待中的标准 API 用。
DeepSeek V4 Pro 0813: 唯一真开源, 但跑分没赢
DeepSeek 这次是把预览版转正, 1.6 万亿总参数、每次推理约 490 亿激活参数, 上下文窗口 1,048,576 token, 最大输出 384,000 token, MIT 协议权重直接放上 Hugging Face, 商用、修改、再分发都不受限。agent 类任务提升明显, DeepSWE 从 12.8 跳到 62.7, Terminal Bench 2.1 从 72.1 涨到 87.9。但综合跑分不算最强, Artificial Analysis 智能指数给到 53 分, 和 Zhipu 上一代 GLM-5.2 打平, 落后 GPT-5.6 系列的 Terra 档位 4 分。
Grok 4.6: 专攻长任务, 不是新底座
xAI 8 月 12 日发布, 用的还是和 Grok 4.5 一样的 1.5 万亿参数 V9 基座, 靠后训练和强化学习提升编码、推理、指令遵循能力。上下文窗口 500K token, 定位是长时间运行的 agent 任务和多步编码。官方已经预告更大的 Grok 4.7 会用全新的 2.1 万亿参数底座, 预计几周后 (8 月底或 9 月初) 到来。
我的判断
想现在就自己部署跑代理任务的团队, DeepSeek V4 Pro 0813 是这一周唯一现实的选择, MIT 协议加已经放出的权重比另外三家都实际。追求性价比又不想自托管的, Gemini 3.7 Flash 的引入价窗口值得抓紧用, 但记得它 2027 年会涨价。GLM-5.3 现在更像一个预告, 权重没放出来之前谈不上真正可用, 先观望。
相关阅读
- AI 编码 Agent 现在怎么收费: Devin、Cursor、Codex、Claude Code、Jules 价格表 2026-08
- Ollama 本地跑 Kimi、GLM 完整指南
- 中国开源模型三强对决
上一期回顾: AI 周刊 #27。
参考
- Google 官方: Gemini 3.7 Flash 发布公告
- Axios: Google’s Gemini 3.7 Flash arrives before Gemini 3.5 Pro
- the-decoder: Zhipu AI releases GLM-5.3, claims it’s the strongest open-weights coding model
- Unite.AI: DeepSeek Ships V4 Pro as Its Flagship Model Leaves Preview
- Hugging Face: deepseek-ai/DeepSeek-V4-Pro-0813
- SCMP: DeepSeek’s updated V4 Pro AI model struggles on benchmarks, shines in cybersecurity
- testingcatalog: xAI releases Grok 4.6 for long-running agent work