scripod.com

143: 阿里、Kimi 都在用的 DeltaNet 是什么?|与杨松琳聊线性注意力新改进

晚点聊 LateTalk

Shownote

「不仅是提效,线性注意力在数据受限情况下的更多潜力。」 今年初的两期节目(103、104 期)里也讨论过注意力机制,这是大语言模型的核心机制。 9 月 和 10 月,阿里和 Kimi 都发布了相关进展,而且都用到了一个线性注意力成果,DeltaNet。 本期嘉宾,就是 DeltaNet 的核心贡献者之一,现在在 MIT 读博士的杨松琳,她也是线性注意力开源小组 FLA 的发起者。 这期节目在 25 分钟以前很硬核,松琳讲了线性注意力和 DeltaNet 的发展脉络,为何 21 年刚被提出时没引起太多注意,后来怎么进化的。 25 分钟以后,是关注 AI 比较多的文科生,比如我也能完全跟上的部分。我们讨论了,重新去做 full attention 的 MiniMax,以及未来要在旗舰模型上用线性注意力的 Kimi 和阿里的不同选择;线性注意力的优劣势;以及一些脑洞 —— 如果算力无限,还需要线性注意力?松琳给了很有启发的回答。 最后半小时,松琳分享了她作为研究员,怎么习得交叉技能的,怎么开始发起 FLA 小组等成长经历。 本期嘉宾:杨松琳,MIT 博士生在读,DeltaNet 贡献者 本期主播:程曼祺,《晚点 LatePost》科技报道负责人 时间线跳转: -DeltaNet 的诞生演进与近期动向 02:07 注意力机制是什么? 04:21 DeltaNet 的提出,用 Delta Rule 来增强 in-context retrieval 09:41 近年的改进主要是模型架构,而非 “更新规则” 14:25 阿里 Qwen 团队 apple to apple 比较几种线性注意力混合方式;Kimi Linear 对 Gated Delta 的具体改进 17:00 更新规则和模型架构改进的区别:更新规则是在算子层面 “动刀” 19:50 算法出身,自学 Infra;学习 Hazy Research Group 的风格 23:28 Qwen 和 Kimi 大概率在下一代旗舰模型用线性注意力,而 MiniMax 用回 full attention;DeepSeek 目前释放的改进都是 “稀疏注意力” 37:07 稀疏注意力 vs 线性注意力潜力对比 39:40 即使算力无限,线性注意力仍有价值,因为它在有限数据中的学习效率更高,而高质量数据正是当前瓶颈 42:28 线性注意力在状态追踪上也可能有效果优势,而状态追踪对 Agentic 很重要 47:33 线性注意力的 “归纳偏见” 和 The Bitter Lesson:先验与 scalable 并不矛盾 49:30 回应 RWKV(原始智能)彭博:从未说发明 DeltaNet,一直在给 Schmidhuber 署名 -Householder 与 DeltaNet 的联想,像运营产品一样运营技术社区 51:51 关注注意力改进的起点,数学知识、Infra,交叉能力怎么积累? 58:48 发现 Hoseholder 累乘和 DeltaNet 关联的过程 01:02:44 AI 何时能像人这样产生联想?——Prompt 合适,大模型应该能独立发现这个算法 01:04:11 FLA 小组的产生,受 Tri Dao 做 FlashAttention 的启发,像运营产品一样运营技术社区;Kimi 从 FLA 小组招募了线性注意力研究者 - 注意力改进的未来趋势 01:11:24 稀疏注意力的改进,DeepSeek 年初 NSA 到最近 DSA 的变化 01:16:44 线性注意力的改进,从线性混合全注意力,到线性混合稀疏注意力(比如混合 DeepSeek DSA 和 Kimi KDA 😀 01:21:10 更广泛来说,关注何种模型演进?—— 持续学习 相关链接: 图文版:《再谈注意力:阿里、Kimi 都在用的 DeltaNet 和线性注意力新改进丨晚点播客》 [https://mp.weixin.qq.com/s/bjRAqIn9sEVE03dW6ToEEg] 晚点聊 103 期:《用 Attention 串起大模型优化史,详解 DeepSeek、Kimi 最新注意力机制改进》 [https://www.xiaoyuzhoufm.com/episode/67bf356952a6af799c558399?s = eyJ1IjogIjYwZDg0ZWU1ZTBmNWU3MjNiYjc3YjhmMCJ9] 晚点聊 104 期:《我给线性注意力找 “金主”,字节 say No,MiniMax say Yes》 [https://www.xiaoyuzhoufm.com/episode/67c63718e24b741ee8e2ee63?s = eyJ1IjogIjYwZDg0ZWU1ZTBmNWU3MjNiYjc3YjhmMCJ9] 剪辑制作:Nick 附录,本期提到的一些论文(更多具体名词解释,见本期文字版): Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention [https://arxiv.org/abs/2006.16236] Linear Transformers Are Secretly Fast Weight Programmers [https://arxiv.org/abs/2102.11174] Parallelizing Linear Transformers with the Delta Rule over Sequence Length [https://arxiv.org/abs/2406.06484] Gated Linear Attention Transformers with Hardware-Efficient Training [https://arxiv.org/abs/2312.06635] Recurrence-Complete Frame-based Action Models [https://arxiv.org/abs/2510.06828] 本期主播: 小红书 @曼祺_火柴 Q [https://www.xiaohongshu.com/user/profile/5dfa9e92000000000100626f?xsec_token = YBSKzbnOGWpnyJ5fxw_yafTdnAUIDw - EfCtqmFTkCIM2o=&xsec_source = app_share & xhsshare = CopyLink & appuid = 5dfa9e92000000000100626f & apptime = 1736682459 & share_id = 331aecb9ca7941f498d81fb9c32ea810] 即刻 @曼祺_火柴 Q [https://okjk.co/FBoH1Q] [https://cdn.z.wiki/autoupload/20250129/p96l/1428X298/% E6%92% AD% E5% AE% A2-% E7% BB%93% E5% B0% BE% E4% BD%9C% E8%80%85% E7% AD% BE% E5%90%8D.png] ☆《晚点聊 LateTalk》建立「 播客听友群」啦!☆ 欢迎关注科技、商业大公司动态和创业创新的小伙伴进群交流,第一时间收听新节目。 这里有更多互动,更多话题讨论。欢迎贡献选题 & 推荐嘉宾。 请先添加「晚点」小助手的微信号,备注:“晚点聊”,我们邀请您入群。 [https://pic9.fukit.cn/autoupload/7qt2TZ8aBx6Rbe7VtyeHlpmesdO83n0jJRcmVXjsIsc/20260211/lsS9/998X396/IMG_0409.jpg] 关注公众号《晚点 LatePost》和《晚点对话》,阅读更多商业、科技文章: [https://hv.z.wiki/autoupload/20250129/DqTi/1452X514/% E6%92% AD% E5% AE% A2% E7% BB%93% E5% B0% BE% E6%88% AA% E5%9B% BE.png]

Highlights

本期节目深入探讨了线性注意力机制的技术演进,聚焦其在大模型效率与能力平衡中的关键作用。嘉宾杨松琳作为 DeltaNet 的核心贡献者,系统梳理了该技术从学术提出到产业落地的转变过程。
02:07
注意力机制通过平方关系计算词间相关性,是处理上下文信息的基础方法
05:45
DeltaNet 通过 Delta Rule 机制增强模型的 In-context Retrieval 能力
12:32
Gated DeltaNet 引入衰减机制防止记忆‘爆棚’
14:30
KDA 将衰减机制细化到每个维度,实现独立遗忘率以增强长序列记忆能力
17:01
更改更新规则是在算子层面动刀,可搭配不同网络架构
22:53
Linear Transformers Are Secretly Fast Weight Programmers 是与 Tri Dao 合作的重要成果
31:11
多跳推理是 agentic AI 的关键能力,混合注意力在此类任务上准确率明显下降。
38:27
混合线性注意力可将 KV Cache 大小减少四分之三
41:15
若有无限数据和算力,会选用 Full Attention 架构
42:32
线性注意力可减少对长思维链的依赖,提升状态追踪效果
48:42
可扩展性要求算法在效率和性能上均能随规模增长而持续有效。
50:55
发言者未宣称发明 DeltaNet,仅改进其可扩展训练方法
57:21
若按传统方式先教行列式,可能就不会对线性代数产生兴趣
58:48
WY 算法将 Householder 累乘转化为累加,使 DeltaNet 可并行化
1:02:49
AI 可能通过强化学习自主解决并行 DeltaNet 目标
1:10:44
Kimi 的 Gated Delta 与 DeepSeek 的 NSA / DSA 形成技术对标
1:15:23
稀疏注意力推理效率高于全注意力,但面临 KV cache 存储负担问题
1:19:14
混合 DSA 与 KDA 可降低 Kimi cache 大小并提升推理速度
1:23:54
快速权重编程可将每个 token 作为训练样本,通过梯度下降实时更新权重矩阵

Chapters

聚焦线性注意力技术发展
00:00
DeltaNet 的诞生演进与近期动向
注意力机制是什么?
02:07
DeltaNet 的提出,用 Delta Rule 来增强 in-context retrieval
04:21
近年的改进主要是模型架构,而非 “更新规则”
09:41
阿里 Qwen 团队 apple to apple 比较几种线性注意力混合方式;Kimi Linear 对 Gated Delta 的具体改进
14:25
更新规则和模型架构改进的区别:更新规则是在算子层面 “动刀”
17:00
算法出身,自学 Infra;学习 Hazy Research Group 的风格
19:50
Qwen 和 Kimi 大概率在下一代旗舰模型用线性注意力,而 MiniMax 用回 full attention;DeepSeek 目前释放的改进都是 “稀疏注意力”
23:28
稀疏注意力 vs 线性注意力潜力对比
37:07
即使算力无限,线性注意力仍有价值,因为它在有限数据中的学习效率更高,而高质量数据正是当前瓶颈
39:40
线性注意力在状态追踪上也可能有效果优势,而状态追踪对 Agentic 很重要
42:28
线性注意力的 “归纳偏见” 和 The Bitter Lesson:先验与 scalable 并不矛盾
47:33
回应 RWKV(原始智能)彭博:从未说发明 DeltaNet,一直在给 Schmidhuber 署名
49:30
Householder 与 DeltaNet 的联想,像运营产品一样运营技术社区
关注注意力改进的起点,数学知识、Infra,交叉能力怎么积累?
51:51
发现 Hoseholder 累乘和 DeltaNet 关联的过程
58:48
AI 何时能像人这样产生联想?——Prompt 合适,大模型应该能独立发现这个算法
1:02:44
FLA 小组的产生,受 Tri Dao 做 FlashAttention 的启发,像运营产品一样运营技术社区;Kimi 从 FLA 小组招募了线性注意力研究者
1:04:11
注意力改进的未来趋势
稀疏注意力的改进,DeepSeek 年初 NSA 到最近 DSA 的变化
1:11:24
线性注意力的改进,从线性混合全注意力,到线性混合稀疏注意力(比如混合 DeepSeek DSA 和 Kimi KDA 😀
1:16:44
更广泛来说,关注何种模型演进?—— 持续学习
1:21:10

Transcript

程曼祺: 欢迎收听晚点聊,我是程曼祺。今天的主题是我们年初的两期节目里,讨论过的注意力机制,这是大语言模型的核心机制。9 月和 10 月,阿里和 Kimi 月之岸面都发布了相关进展。而且都用到了一个线性注意力的成果 DeltaNet 本期嘉宾就是 DeltaNet 的核心贡献者之一。现在在 MIT 读博士的杨松琳,他也是线性注意力开源小组 FLA 的发起者。这期节目的 25 分钟以前非常硬核,杨松琳讲了线性注意力和 DeltaNet 的发展脉络。为什么 2021 年刚被提出时,它没有引起太多注意,后来是怎么...