Kimi K3 发布刷屏的是跑分和开源承诺,但真正让研究圈坐直了的是另一件事:月之暗面同步开源了 Adam 优化器、注意力机制和残差连接的替代方案。 有投资人评价这"可能是 AI 的重要转折点"。
这句话听着夸张,拆开看这三样东西的资历就明白了:
- Adam 优化器:2014 年提出,统治模型训练 12 年
- 注意力机制:2017 年随 Transformer 登基,统治 9 年
- 残差连接:2015 年 ResNet 带火,几乎所有深层网络的标配
今天你能叫出名字的每一个大模型,GPT、Claude、Gemini、Llama、Qwen,全部建立在这三块地基上。月之暗面说:三块我们都换了,而且换完训出了 K3。
为什么这三块地基一直没人动
不是没人想动,是动的代价太大。
深度学习圈每年都有几十篇论文宣称"超越 Adam"或"改进注意力",绝大多数死在同一个地方:小规模实验有效,大规模训练翻车。 一次旗舰模型的训练要烧几千万美元,没有人敢拿这种预算去赌一个新优化器。于是行业陷入一个循环:越贵越保守,越保守越没人验证新方案,地基就越焊越死。
打破循环只有一种方式:有人真的在旗舰规模上把新方案跑通,还把结果开源出来让所有人检查。这就是 K3 这波操作的分量。
三个替代方案各自解决什么
具体技术细节要等论文和代码放出后细读,但从公开信息能看清方向:
| 被替换的组件 | 老方案的痛点 | 新方案的目标 |
|---|---|---|
| Adam | 显存占用大(要存两份动量状态)、超大规模下不稳定 | 更省显存、收敛更稳,直接降低训练成本 |
| 注意力机制 | 计算量随序列长度平方增长,长上下文又贵又慢 | 把长上下文的成本从平方拉向线性 |
| 残差连接 | 超深网络中的信号传播和训练稳定性问题 | 让更深、更大的模型训得动 |
注意这三件事共同指向一个词:成本。 训练成本、推理成本、长上下文成本。这不是学术炫技,是奔着经济账去的工程革命。
为什么是中国公司干了这件事
这个问题值得琢磨。我的理解是:算力受限反而逼出了架构创新。
美国实验室手握最多的 GPU,最优策略是用成熟配方猛堆算力,改架构的风险收益比不划算。中国公司拿不到顶级算力供给,同样的模型能力必须用更少的卡训出来,于是"把地基换成更省的"从疯狂变成了理性选择。
约束条件不同,最优解就不同。这跟当年日本车企在石油危机里搞出省油技术是一个逻辑。
冷静的部分
三点保留意见:
- 可复现性待验证。 开源之后,其他团队能不能在自己的数据和算力上复现收益,才是真正的检验
- 通用性待验证。 在 K3 的配置里有效,不代表在所有规模、所有模态上都有效
- 行业惯性巨大。 就算全部被验证,主流实验室迁移地基也要以年为单位
我的看法
跑分会过时,地基级的贡献不会。如果这三个替代方案有哪怕一个被行业采纳,K3 在历史上的地位就会超过它的所有跑分。
更大的启示是:Transformer 配方不是物理定律,只是还没人付得起质疑它的成本。 现在有人付了,还把答案公开了。接下来两年,训练效率可能会成为比参数量更重要的军备竞赛维度。
等代码放出后,我们做一期逐组件的深度拆解。