Newsroom
AIEII

月之暗面换掉了 AI 训练的三块地基:Adam、注意力机制、残差连接

Kimi K3 最被低估的部分:月之暗面同步开源了 Adam 优化器、注意力机制和残差连接的替代方案。这三样东西分别统治了深度学习 12 年、9 年和 10 年,动它们等于动整个行业的地基。

2026年07月18日

月之暗面换掉了 AI 训练的三块地基:Adam、注意力机制、残差连接

Kimi K3 发布刷屏的是跑分和开源承诺,但真正让研究圈坐直了的是另一件事:月之暗面同步开源了 Adam 优化器、注意力机制和残差连接的替代方案。 有投资人评价这"可能是 AI 的重要转折点"。

这句话听着夸张,拆开看这三样东西的资历就明白了:

  • Adam 优化器:2014 年提出,统治模型训练 12 年
  • 注意力机制:2017 年随 Transformer 登基,统治 9 年
  • 残差连接:2015 年 ResNet 带火,几乎所有深层网络的标配

今天你能叫出名字的每一个大模型,GPT、Claude、Gemini、Llama、Qwen,全部建立在这三块地基上。月之暗面说:三块我们都换了,而且换完训出了 K3。


为什么这三块地基一直没人动

不是没人想动,是动的代价太大。

深度学习圈每年都有几十篇论文宣称"超越 Adam"或"改进注意力",绝大多数死在同一个地方:小规模实验有效,大规模训练翻车。 一次旗舰模型的训练要烧几千万美元,没有人敢拿这种预算去赌一个新优化器。于是行业陷入一个循环:越贵越保守,越保守越没人验证新方案,地基就越焊越死。

打破循环只有一种方式:有人真的在旗舰规模上把新方案跑通,还把结果开源出来让所有人检查。这就是 K3 这波操作的分量。

三个替代方案各自解决什么

具体技术细节要等论文和代码放出后细读,但从公开信息能看清方向:

被替换的组件老方案的痛点新方案的目标
Adam显存占用大(要存两份动量状态)、超大规模下不稳定更省显存、收敛更稳,直接降低训练成本
注意力机制计算量随序列长度平方增长,长上下文又贵又慢把长上下文的成本从平方拉向线性
残差连接超深网络中的信号传播和训练稳定性问题让更深、更大的模型训得动

注意这三件事共同指向一个词:成本。 训练成本、推理成本、长上下文成本。这不是学术炫技,是奔着经济账去的工程革命。

为什么是中国公司干了这件事

这个问题值得琢磨。我的理解是:算力受限反而逼出了架构创新。

美国实验室手握最多的 GPU,最优策略是用成熟配方猛堆算力,改架构的风险收益比不划算。中国公司拿不到顶级算力供给,同样的模型能力必须用更少的卡训出来,于是"把地基换成更省的"从疯狂变成了理性选择。

约束条件不同,最优解就不同。这跟当年日本车企在石油危机里搞出省油技术是一个逻辑。

冷静的部分

三点保留意见:

  1. 可复现性待验证。 开源之后,其他团队能不能在自己的数据和算力上复现收益,才是真正的检验
  2. 通用性待验证。 在 K3 的配置里有效,不代表在所有规模、所有模态上都有效
  3. 行业惯性巨大。 就算全部被验证,主流实验室迁移地基也要以年为单位

我的看法

跑分会过时,地基级的贡献不会。如果这三个替代方案有哪怕一个被行业采纳,K3 在历史上的地位就会超过它的所有跑分。

更大的启示是:Transformer 配方不是物理定律,只是还没人付得起质疑它的成本。 现在有人付了,还把答案公开了。接下来两年,训练效率可能会成为比参数量更重要的军备竞赛维度。

等代码放出后,我们做一期逐组件的深度拆解。

广告合作联系
立即联系 →
加入会员申请
了解详情 →
← Grok CLI 被抓到上传用户本地文件:AI 编程工具的信 … Vibe Coding 逃出终端:当写代码这件事开始面向不写 … →
💬 Comments
3 min read