Newsroom
AIEII

模型发布周报:谷歌 Gemini 三连发 + 启动 Gemini 4,Kimi K3 火到暂停新订阅

谷歌一天甩出三款 Gemini 并官宣史上最大规模的 Gemini 4 预训练,Pro 却再度跳票;月之暗面 Kimi K3 编程登顶后被需求打爆,被迫暂停新用户订阅。发布狂欢背后是算力这道硬约束。

2026年07月25日

模型发布周报:谷歌 Gemini 三连发 + 启动 Gemini 4,Kimi K3 火到暂停新订阅

7 月 20 日,月之暗面在官网挂出一行公告:Kimi K3 因需求超出算力承载上限,暂停新用户订阅。

这是一个有点荒谬的局面。

编程评测拿了全球第一,注册页面关了。


同一周,谷歌一口气推出三款 Gemini,顺带官宣 Gemini 4 的预训练已经启动。发布密度创了新高,供给侧的硬约束同样创了新高。

两件事放在一起,就是这轮模型竞赛最真实的横截面:卷到停不下来,但算力这道门没人能绕过去。

Gemini 三连发:三款各有用处

7 月 21 日,谷歌 DeepMind 在官方博客同时上线三款模型,没有发布会,没有 CEO 发言,就是一篇技术博客。

三款覆盖三个不同场景,逻辑上没有重叠。

模型定位关键数字
Gemini 3.6 Flash日常主力工作模型比 3.5 Flash 减少 17% 输出 token
Gemini 3.5 Flash-Lite高吞吐批量处理350 tokens/秒输出速度
Gemini 3.5 Flash Cyber漏洞挖掘与修复仅限政府及受信任合作方

Gemini 3.6 Flash 是三款里用途最广的。核心改进有两点:输出 token 比 3.5 Flash 减少 17%,知识截止日期从 2025 年 1 月前进到 2026 年 3 月。后者看起来不起眼,但在这个月月有大事的节点,5 个月的信息差相当可观。

Gemini 3.5 Flash-Lite 走另一条路,主打吞吐量,350 tokens/秒,适合批量处理、高并发 API 调用。它不追评测分数,追的是成本和速度的比值。

三款里最特别的是 Gemini 3.5 Flash Cyber。这是一个专门针对软件安全漏洞的模型,可以在沙箱环境里自己写利用代码验证漏洞,同时生成补丁。谷歌用 OSV.dev 上超过 70 万条开源漏洞记录,加上 10 年的 OSS-Fuzz 模糊测试数据,对 3.5 Flash 做了专项微调。在 V8 JavaScript 引擎的测试中,Flash Cyber 发现了 55 个经确认的独立漏洞,其中 10 个是 3.5 Flash 和 Claude Opus 4.6 没有检测到的。

Flash Cyber 不对公众开放。谷歌表示,鉴于此类技术的双重用途属性,将通过 CodeMender 平台优先向政府和受信任合作方提供有限访问,之后再逐步扩大范围,目前没有公开的申请入口或时间表。

这个决策本身值得注意。漏洞挖掘模型一旦滥用,等同于把攻击自动化。先走政府渠道而不是直接上 API,是谷歌对这类技术的主动约束。

Gemini 4:预训练启动,没有上线日期

三款模型之外,谷歌确认了一个早有猜测的事实:Gemini 4 的预训练已正式启动,谷歌将其描述为旗舰模型继任者,定位覆盖编程、知识推理和多模态任务。

但这里有一句话需要单独拎出来:Gemini 4 将在 2026 年余下时间里持续训练,谷歌没有附上任何上线时间窗口。

这意味着,至少在今年,Gemini 4 不会出现在用户面前。预训练本身就是多则几个月的事,结束之后还有对齐、安全测试、内测,全部走完再到公开发布,保守估计 2027 年之前不太可能。

宣布预训练启动,和宣布产品发布,是两件不同的事。前者是里程碑,后者才是用户能感知到的。谷歌在这个节点公开说这件事,更多是在跟 OpenAI 和 Anthropic 的下一代模型赛跑中打出信号。

3.5 Pro 连跳三次票,DeepMind 人才出走

谷歌这周发了三款新模型,唯独没有 3.5 Pro。

3.5 Pro 最早承诺 6 月发布,没发。推到 7 月,7 月 17 日传出可能是新节点,依然没发。TechCrunch 直接在标题里点出这件事:“Google releases three new Gemini models — but no 3.5 Pro”。

TechTimes 引用的细节更具体:3.5 Pro 在内部经历了完整重建,但连续三次未通过关键可靠性标准,包括幻觉频率过高,以及在代码任务上达不到 GPT-5.6 的水平。

时间节点事件
2026 年 6 月3.5 Pro 原承诺发布时间
2026 年 7 月初首次跳票延期
2026 年 7 月 17 日传出节点,再次未发布
2026 年 7 月 21 日三连发,无 3.5 Pro
截至发稿无新发布日期

问题不只在模型本身。发布前后几周,DeepMind 内部连续出现人才离职:Gemini 联席负责人之一 Noam Shazeer 去了 OpenAI,诺贝尔奖得主 John Jumper 去了 Anthropic,Jonas Adler 和 Alexander Pritzel 也落地 Anthropic。一周内走了四个高级研究员,据 The Agent Report 报道,Alphabet 股价随之受影响,市值蒸发约 2250 亿美元。

谷歌目前没有给出 3.5 Pro 的新日期。

Kimi K3:榜一模型,开不出新账号

月之暗面于 7 月 16 日发布了 Kimi K3。核心规格:2.8 万亿参数(2.8T),MoE 架构,每次推理激活 896 个专家中的 16 个,1M token 上下文窗口。这是目前已知第一个突破 2.8T 参数的开源模型。

编程评测方面,K3 在发布数小时内,从 LMArena 前端代码竞技场的第 18 名升至第 1 名,超过了 Claude Fable 5。

然后是现实层面。

7 月 20 日,也就是发布四天后,月之暗面暂停了 Kimi K3 的新用户订阅。官方理由是需求超出了当前算力的承载上限。模型权重按计划将于 7 月 27 日前公开发布(Modified MIT 协议),但开源不等于门槛消失,2.8T 参数的推理需要的显卡量级不是普通用户能随手解决的。

Kimi K3 暂停新订阅,是算力约束最直白的一次现身。评测榜单的第一名,和能开放给所有人用,中间还隔着一道物理世界的门槛。

这件事有一个值得回味的地方:如果一家公司做出了编程评测第一的模型,却没有足够算力支撑用户规模,这是胜利还是困境?

从技术角度说是前者。K3 的参数规模和评测成绩,在国内大模型里是实打实的突破。从商业角度说,这把刀有点两面。暂停新订阅意味着增量用户无法进来,而算力采购的时间窗口不会等人。

这也是国内头部大模型公司共同面对的结构性问题:英伟达 H100/H200 在国内的可获得量受限,国产替代(华为昇腾、寒武纪等)在超大规模推理上的成熟度还在爬坡。做出最强模型,和能够大规模服务用户,这两件事之间的距离,比参数量更难量化。

写在最后

这一周的模型发布,有一种奇特的节奏感。

谷歌一天三款,官宣 Gemini 4 预训练启动,但旗舰 3.5 Pro 还在延期,高级研究员往外走。Kimi K3 编程评测拿第一,四天后关了注册入口。

发布速度不缺,算力供给才是真正的稀缺资源。

模型能力的天花板在快速提升,但支撑这些模型落地的基础设施,包括芯片、集群、能源,根本跟不上节奏。谷歌在大手笔投资数据中心,月之暗面在等算力排期,背后是同一个约束。

所以,当你看到一个模型发布公告,最值得关注的不只是 benchmark 分数,还有:这个模型现在能不能用,能用多少人,稳不稳定。

K3 开不出账号,3.5 Pro 开不出发布日期,都是同一道题的不同面。


数据来源

广告合作联系
立即联系 →
加入会员申请
了解详情 →
← AI 资本周报:Shield AI 22.5 亿美元 … 中国开源三强对垒:DeepSeek V4、Qwen 3.6 … →
💬 Comments
5 min read