119. Kimi Linear、Minimax M2?和杨松琳考古算法变种史,并预演未来架构改进方案
张小珺Jùn|商业访谈录
2025/11/03
119. Kimi Linear、Minimax M2?和杨松琳考古算法变种史,并预演未来架构改进方案
119. Kimi Linear、Minimax M2?和杨松琳考古算法变种史,并预演未来架构改进方案

张小珺Jùn|商业访谈录
2025/11/03

今天这集节目,我们将讨论一个在当下非常关键的话题:人工智能的算法与架构创新。
嘉宾是我们的往期嘉宾返场,她是 MIT 在读博士杨松琳,研究方向是线性注意力机制。
我们将从最新发布的几个模型 Kimi Linear、Minimax M2、Qwen3-Next 切入。松琳参与讨论 Kimi Linear 和 Qwen3-Next 的部分工作,是 Kimi Linear 论文的作者之一。
算法创新为什么在 2025 年变得尤为重要?
它的背后原因是,数据、算力和算法是驱动人工智能的三驾火车,在数据撞墙的无奈前提下,各个模型公司不得不重新开始 “雕模型架构”,以期 Scaling Law 的魔法继续。而由于中国的算力相对美国有限,这反而让中国的 AI 算法创新走在了世界前沿。
这集节目你将听到,近几年架构最大突破是 DeepSeek 的 MoE(混合专家模型),它让 MoE 成为了全球共识;而下一个突破的重要方向可能就是 Attention(注意力机制)。
中国公司在 Attention 展开了不同技术 bet(押注):
- 截至目前已发布模型,DeepSeek 正在探索 Sparse Attention(稀疏注意力机制);
- Kimi 正在探索 Linear Attention(线性注意力机制);
- Minimax 在年初的 M1 版本中探索 Linear Attention,而在刚发布的 M2 版本中又回退到 Full Attention(全局注意力机制)。
节目中,松琳将讲解她参与的这篇《Kimi Linear: An Expressive, Efficient Attention Architecture》的工作,并分析以上这些公司在 Attention 上的不同抉择;
与此同时,她也将带领大家考古人工智能算法变种史,并预演未来算法与架构的改进方案。
本集比较硬核,会有一些专业难度,大家可以根据自己的实际需要收听嗷:) 因为嘉宾的工作环境会出现中英夹杂,希望大家多多理解和支持。



04:00 个人、研究主线与线性注意力机制的探索之路
06:27 松琳做过一个开源库:flash-linear-attention(简称 FLA)
07:04 怎么通俗理解 Linear Attention 的 Linear?
11:19 聊聊最近参与的新工作,前几天刚发布的《Kimi Linear: An Expressive, Efficient Attention Architecture》(Kimi Linear:一种具有强表达能力与高效率的注意力架构)
(FLA 库的另一个作者 Zhang, Yu 邀请)
12:20 为什么 Kimi 在年初开始需要重新设计注意力机制?设计的背景和目标
在 Linear Attention 下,推理阶段的计算与显存成本都显著降低;而使用 Full Attention 时,长文本解码的代价会非常高昂
14:39《Kimi Linear》论文重点讲解:KDA 模块(Kimi Delta Attention,增量注意力机制)
18:56 Kimi 内部有一个 Scaling Ladder(规模阶梯),在一个规模下面表现好就在下一个规模下面去 scale,就像通关
20:20 Kimi Linear Attention vs DeepSeek Sparse Attention:Kimi 走线性注意力路线,DeepSeek 走稀疏注意力路线,都想解决长文本 decoding(长上下文生成)的效率问题
23:01Minimax 从 M1 到 M2 的架构变化,从 Linear Attention 退回到 Full Attention,为什么?
27:00 硅谷的注意力机制方案不方便说,但可以浅聊一下 OpenAI 有 paper 的方案
28:05 Linear Attention 从 2020 年发明出来开始后的前进线索
每一次大家关心 Linear Attention 都是因为大家撞到了 Context Wall
最近长文本的 decoding 卷土重来,让人们不由自主审视这一套技术
38:16 纯 Linear Attention 是无效的,混合注意力机制还是有很多全局注意力层,这样下限有保证
40:30Kimi Linear 每 3 层 KDA 插入 1 层全注意力层,三比一的比例快变成共识了
Minimax 之前用的是七比一,但现在大家逐渐回到三比一 —— 这成为不共识的混合注意力机制中的共识了
42:32 权衡(Trade-off)表达能力(expressivity)与计算效率(efficiency)
Minimax 曾经也提到,混合线性注意力 / 混合滑窗注意力在 “多跳推理” 上会有缺陷
对于 “多跳推理”,如果我们开发一些硬件高效但表达能力更好的 RNN(循环神经网络),这个 GAP 有可能缩小
46:28 chunkwise algorithm for parallelization(分块并行算法)
47:55 如何设计 Attention?两条主流和一些非主流路线
49:36结合 Linear Attention 和 Sparse Attention 的未来理想方案
Linear Attention 和 Sparse Attention 没什么竞争关系,Linear Attention 的竞争对手可能是 Sliding-Window Attention(滑窗注意力)
工业界 Linear Attention 和 Sparse Attention 结合的探索似乎还没开始
我想象中的理想方案是:把混合注意力的全局注意力(Full Attention)换成稀疏注意力(Sparse Attention)
只要 Sparse Attention 选得准,完全可以取代 Full Attention,但现在的问题是它选不准
55:36 公平的比较:Linear Attention vs Sliding-Window Attention(滑窗注意力)
57:05 Transformer → MoE → Linear / Sparse Attention 的算法演变,背后动因是给定你相同的 FLOPs(浮点运算量),利用这些 FLOPs,取得更低的损失函数
MoE(混合专家)是更高效的 FNN(前馈神经网络)的替代品
58:26近几年架构方面突破最大的是 MoE,下一个突破可能是 Attention;Transformer 就两个模块,一个是 FFN,一个是 Attention;现在 FFN 已经雕成 MoE,现在 Attention 大家也可以雕一下
01:01:28 数据、算法、算力是驱动人工智能的三驾马车,当数据遇到数据强,算法创新变得更重要
01:02:48 架构的未来:1、能不能干掉全局注意力?它是阻止 context window 继续 scale up 的主要瓶颈
2、Continue Learning,让 AI 自己学习
01:04:30 如何把 Linear Attention 的 Transformer 继续 scale up?
01:07:43 中国 AI 的算法创新相比海外肯定是更强的 —— 因为没有那么多卡(
不过美国公司更多投入优化器一点,国内在逐步重视
01:10:56 其他训练细节:NoPE vs. RoPE
01:12:09 DeepSeek-OCR
01:12:55 松琳也参与了 Qwen3-Next,没有参与 Minimax M2
01:13:39 “雕” 架构的人
01:15:16 自己的心路:“当你很清楚你要做什么的时候,你是不会遇到什么挫折的”
经验分享:PhD 还挺顺利的,得益于我入学之前的半年考古
01:23:12说到考古,我们在最后聊聊从 Transformer 开始的算法变种历史
01:29:50 Delta Rule 算法、硬件亲和、DeepSeek 非常追求硬件和算法的匹配
01:42:23 给更年轻的年轻人的建议
06:27 松琳做过一个开源库:flash-linear-attention(简称 FLA)
07:04 怎么通俗理解 Linear Attention 的 Linear?
11:19 聊聊最近参与的新工作,前几天刚发布的《Kimi Linear: An Expressive, Efficient Attention Architecture》(Kimi Linear:一种具有强表达能力与高效率的注意力架构)
(FLA 库的另一个作者 Zhang, Yu 邀请)
12:20 为什么 Kimi 在年初开始需要重新设计注意力机制?设计的背景和目标
在 Linear Attention 下,推理阶段的计算与显存成本都显著降低;而使用 Full Attention 时,长文本解码的代价会非常高昂
14:39《Kimi Linear》论文重点讲解:KDA 模块(Kimi Delta Attention,增量注意力机制)
18:56 Kimi 内部有一个 Scaling Ladder(规模阶梯),在一个规模下面表现好就在下一个规模下面去 scale,就像通关
20:20 Kimi Linear Attention vs DeepSeek Sparse Attention:Kimi 走线性注意力路线,DeepSeek 走稀疏注意力路线,都想解决长文本 decoding(长上下文生成)的效率问题
23:01Minimax 从 M1 到 M2 的架构变化,从 Linear Attention 退回到 Full Attention,为什么?
27:00 硅谷的注意力机制方案不方便说,但可以浅聊一下 OpenAI 有 paper 的方案
28:05 Linear Attention 从 2020 年发明出来开始后的前进线索
每一次大家关心 Linear Attention 都是因为大家撞到了 Context Wall
最近长文本的 decoding 卷土重来,让人们不由自主审视这一套技术
38:16 纯 Linear Attention 是无效的,混合注意力机制还是有很多全局注意力层,这样下限有保证
40:30Kimi Linear 每 3 层 KDA 插入 1 层全注意力层,三比一的比例快变成共识了
Minimax 之前用的是七比一,但现在大家逐渐回到三比一 —— 这成为不共识的混合注意力机制中的共识了
42:32 权衡(Trade-off)表达能力(expressivity)与计算效率(efficiency)
Minimax 曾经也提到,混合线性注意力 / 混合滑窗注意力在 “多跳推理” 上会有缺陷
对于 “多跳推理”,如果我们开发一些硬件高效但表达能力更好的 RNN(循环神经网络),这个 GAP 有可能缩小
46:28 chunkwise algorithm for parallelization(分块并行算法)
47:55 如何设计 Attention?两条主流和一些非主流路线
49:36结合 Linear Attention 和 Sparse Attention 的未来理想方案
Linear Attention 和 Sparse Attention 没什么竞争关系,Linear Attention 的竞争对手可能是 Sliding-Window Attention(滑窗注意力)
工业界 Linear Attention 和 Sparse Attention 结合的探索似乎还没开始
我想象中的理想方案是:把混合注意力的全局注意力(Full Attention)换成稀疏注意力(Sparse Attention)
只要 Sparse Attention 选得准,完全可以取代 Full Attention,但现在的问题是它选不准
55:36 公平的比较:Linear Attention vs Sliding-Window Attention(滑窗注意力)
57:05 Transformer → MoE → Linear / Sparse Attention 的算法演变,背后动因是给定你相同的 FLOPs(浮点运算量),利用这些 FLOPs,取得更低的损失函数
MoE(混合专家)是更高效的 FNN(前馈神经网络)的替代品
58:26近几年架构方面突破最大的是 MoE,下一个突破可能是 Attention;Transformer 就两个模块,一个是 FFN,一个是 Attention;现在 FFN 已经雕成 MoE,现在 Attention 大家也可以雕一下
01:01:28 数据、算法、算力是驱动人工智能的三驾马车,当数据遇到数据强,算法创新变得更重要
01:02:48 架构的未来:1、能不能干掉全局注意力?它是阻止 context window 继续 scale up 的主要瓶颈
2、Continue Learning,让 AI 自己学习
01:04:30 如何把 Linear Attention 的 Transformer 继续 scale up?
01:07:43 中国 AI 的算法创新相比海外肯定是更强的 —— 因为没有那么多卡(
不过美国公司更多投入优化器一点,国内在逐步重视
01:10:56 其他训练细节:NoPE vs. RoPE
01:12:09 DeepSeek-OCR
01:12:55 松琳也参与了 Qwen3-Next,没有参与 Minimax M2
01:13:39 “雕” 架构的人
01:15:16 自己的心路:“当你很清楚你要做什么的时候,你是不会遇到什么挫折的”
经验分享:PhD 还挺顺利的,得益于我入学之前的半年考古
01:23:12说到考古,我们在最后聊聊从 Transformer 开始的算法变种历史
01:29:50 Delta Rule 算法、硬件亲和、DeepSeek 非常追求硬件和算法的匹配
01:42:23 给更年轻的年轻人的建议

嘉宾往期节目:
《逐篇讲解 DeepSeek、Kimi、MiniMax 注意力机制新论文 ——“硬件上的暴力美学”》
谈到的论文:
《Kimi Linear: An Expressive, Efficient Attention Architecture》
《MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention》
《DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models》
