7 月 20 日,月之暗面在官网挂出一行公告:Kimi K3 因需求超出算力承载上限,暂停新用户订阅。
这是一个有点荒谬的局面。
编程评测拿了全球第一,注册页面关了。
同一周,谷歌一口气推出三款 Gemini,顺带官宣 Gemini 4 的预训练已经启动。发布密度创了新高,供给侧的硬约束同样创了新高。
两件事放在一起,就是这轮模型竞赛最真实的横截面:卷到停不下来,但算力这道门没人能绕过去。
Gemini 三连发:三款各有用处
7 月 21 日,谷歌 DeepMind 在官方博客同时上线三款模型,没有发布会,没有 CEO 发言,就是一篇技术博客。
三款覆盖三个不同场景,逻辑上没有重叠。
| 模型 | 定位 | 关键数字 |
|---|---|---|
| Gemini 3.6 Flash | 日常主力工作模型 | 比 3.5 Flash 减少 17% 输出 token |
| Gemini 3.5 Flash-Lite | 高吞吐批量处理 | 350 tokens/秒输出速度 |
| Gemini 3.5 Flash Cyber | 漏洞挖掘与修复 | 仅限政府及受信任合作方 |
Gemini 3.6 Flash 是三款里用途最广的。核心改进有两点:输出 token 比 3.5 Flash 减少 17%,知识截止日期从 2025 年 1 月前进到 2026 年 3 月。后者看起来不起眼,但在这个月月有大事的节点,5 个月的信息差相当可观。
Gemini 3.5 Flash-Lite 走另一条路,主打吞吐量,350 tokens/秒,适合批量处理、高并发 API 调用。它不追评测分数,追的是成本和速度的比值。
三款里最特别的是 Gemini 3.5 Flash Cyber。这是一个专门针对软件安全漏洞的模型,可以在沙箱环境里自己写利用代码验证漏洞,同时生成补丁。谷歌用 OSV.dev 上超过 70 万条开源漏洞记录,加上 10 年的 OSS-Fuzz 模糊测试数据,对 3.5 Flash 做了专项微调。在 V8 JavaScript 引擎的测试中,Flash Cyber 发现了 55 个经确认的独立漏洞,其中 10 个是 3.5 Flash 和 Claude Opus 4.6 没有检测到的。
Flash Cyber 不对公众开放。谷歌表示,鉴于此类技术的双重用途属性,将通过 CodeMender 平台优先向政府和受信任合作方提供有限访问,之后再逐步扩大范围,目前没有公开的申请入口或时间表。
这个决策本身值得注意。漏洞挖掘模型一旦滥用,等同于把攻击自动化。先走政府渠道而不是直接上 API,是谷歌对这类技术的主动约束。
Gemini 4:预训练启动,没有上线日期
三款模型之外,谷歌确认了一个早有猜测的事实:Gemini 4 的预训练已正式启动,谷歌将其描述为旗舰模型继任者,定位覆盖编程、知识推理和多模态任务。
但这里有一句话需要单独拎出来:Gemini 4 将在 2026 年余下时间里持续训练,谷歌没有附上任何上线时间窗口。
这意味着,至少在今年,Gemini 4 不会出现在用户面前。预训练本身就是多则几个月的事,结束之后还有对齐、安全测试、内测,全部走完再到公开发布,保守估计 2027 年之前不太可能。
宣布预训练启动,和宣布产品发布,是两件不同的事。前者是里程碑,后者才是用户能感知到的。谷歌在这个节点公开说这件事,更多是在跟 OpenAI 和 Anthropic 的下一代模型赛跑中打出信号。
3.5 Pro 连跳三次票,DeepMind 人才出走
谷歌这周发了三款新模型,唯独没有 3.5 Pro。
3.5 Pro 最早承诺 6 月发布,没发。推到 7 月,7 月 17 日传出可能是新节点,依然没发。TechCrunch 直接在标题里点出这件事:“Google releases three new Gemini models — but no 3.5 Pro”。
TechTimes 引用的细节更具体:3.5 Pro 在内部经历了完整重建,但连续三次未通过关键可靠性标准,包括幻觉频率过高,以及在代码任务上达不到 GPT-5.6 的水平。
| 时间节点 | 事件 |
|---|---|
| 2026 年 6 月 | 3.5 Pro 原承诺发布时间 |
| 2026 年 7 月初 | 首次跳票延期 |
| 2026 年 7 月 17 日 | 传出节点,再次未发布 |
| 2026 年 7 月 21 日 | 三连发,无 3.5 Pro |
| 截至发稿 | 无新发布日期 |
问题不只在模型本身。发布前后几周,DeepMind 内部连续出现人才离职:Gemini 联席负责人之一 Noam Shazeer 去了 OpenAI,诺贝尔奖得主 John Jumper 去了 Anthropic,Jonas Adler 和 Alexander Pritzel 也落地 Anthropic。一周内走了四个高级研究员,据 The Agent Report 报道,Alphabet 股价随之受影响,市值蒸发约 2250 亿美元。
谷歌目前没有给出 3.5 Pro 的新日期。
Kimi K3:榜一模型,开不出新账号
月之暗面于 7 月 16 日发布了 Kimi K3。核心规格:2.8 万亿参数(2.8T),MoE 架构,每次推理激活 896 个专家中的 16 个,1M token 上下文窗口。这是目前已知第一个突破 2.8T 参数的开源模型。
编程评测方面,K3 在发布数小时内,从 LMArena 前端代码竞技场的第 18 名升至第 1 名,超过了 Claude Fable 5。
然后是现实层面。
7 月 20 日,也就是发布四天后,月之暗面暂停了 Kimi K3 的新用户订阅。官方理由是需求超出了当前算力的承载上限。模型权重按计划将于 7 月 27 日前公开发布(Modified MIT 协议),但开源不等于门槛消失,2.8T 参数的推理需要的显卡量级不是普通用户能随手解决的。
Kimi K3 暂停新订阅,是算力约束最直白的一次现身。评测榜单的第一名,和能开放给所有人用,中间还隔着一道物理世界的门槛。
这件事有一个值得回味的地方:如果一家公司做出了编程评测第一的模型,却没有足够算力支撑用户规模,这是胜利还是困境?
从技术角度说是前者。K3 的参数规模和评测成绩,在国内大模型里是实打实的突破。从商业角度说,这把刀有点两面。暂停新订阅意味着增量用户无法进来,而算力采购的时间窗口不会等人。
这也是国内头部大模型公司共同面对的结构性问题:英伟达 H100/H200 在国内的可获得量受限,国产替代(华为昇腾、寒武纪等)在超大规模推理上的成熟度还在爬坡。做出最强模型,和能够大规模服务用户,这两件事之间的距离,比参数量更难量化。
写在最后
这一周的模型发布,有一种奇特的节奏感。
谷歌一天三款,官宣 Gemini 4 预训练启动,但旗舰 3.5 Pro 还在延期,高级研究员往外走。Kimi K3 编程评测拿第一,四天后关了注册入口。
发布速度不缺,算力供给才是真正的稀缺资源。
模型能力的天花板在快速提升,但支撑这些模型落地的基础设施,包括芯片、集群、能源,根本跟不上节奏。谷歌在大手笔投资数据中心,月之暗面在等算力排期,背后是同一个约束。
所以,当你看到一个模型发布公告,最值得关注的不只是 benchmark 分数,还有:这个模型现在能不能用,能用多少人,稳不稳定。
K3 开不出账号,3.5 Pro 开不出发布日期,都是同一道题的不同面。
数据来源
- Google 官方博客 · 三款 Gemini 发布公告
- Google DeepMind · Gemini 3.5 Flash Cyber 详细介绍
- TechCrunch · Google releases three new Gemini models — but no 3.5 Pro
- TechTimes · Rebuilt Gemini 3.5 Pro Misses Third Deadline
- 9to5Google · Gemini 3.5 Pro delays due to coding performance
- The Agent Report · Google Gemini 3.5 Pro Delayed to July 2026
- whatllm.org · Kimi K3 完整介绍
- trilogyai.substack.com · Kimi K3 Is Live: Pricing, Benchmarks