scripod.com

152. 领读 Kimi K3 技术报告:从架构创新聊起,注意力美学、多教师蒸馏和开源 MoE

Shownote

[https://image.xyzcdn.net/FkZ-gquke6nKJCnJ4di5kQ0lEfAc.png] 今天的节目是一集学习播客,学习 Kimi K3 技术报告,希望和大家一起领略 “技术之美”。 K3 是有效扩展到 2.8T 总参数并全量开源的 MoE 模型。大家可能注意到,这集技术报告的领读距离模型发布已经过去一段时间。期间,我们试图寻找一位合适的嘉宾,我们希望这位嘉宾的学术和工作背景非常适合讲 K3。最后找到孙宇涛。 宇涛目前是清华大学计算机系博士候选人,上海创智学院璞锐学者。他从博士开始的研究方向是 LLM 架构、预训练,架构创新一直是他的兴趣点,这正好是 K3 亮点之一。 宇涛透过领读 K3 技术报告也串联讲解了十多篇相关论文。他的语速非常快 —— 前方语速预警。 OUTLINE: 02:00 宇涛的自我介绍和研究经历,为什么对架构创新最感兴趣? 16:05 从 Kimi K3 论文出发,论文讲解的框架与脉络 19:02 宇涛开始领读论文: 1 导读 Kimi K3 将设计概括为沿 sequence、depth 和 width 三个维度扩展信息流;其中 depth 与 width 本质上仍是模型容量扩展的两种组织⽅式,这⼀ “三维 scaling” 更多是贯穿论⽂的叙事框架。 2 Model Architecture 2.1 线性注意⼒的前世今⽣ [Microsoft Research] RetNet [https://www.microsoft.com/en-us/research/publication/retentive-network-a-successor-to-transformer-for-large-language-models/]:最初的 data-independent decay 与 chunk-recurrent 递归形式 [NVIDIA] Gated DeltaNet [https://research.nvidia.com/publication/2025-04_gated-delta-networks-improving-mamba2-delta-rule]:引⼊ gated delta rule [Moonshot AI] Kimi Linear [https://arxiv.org/abs/2510.26692]:fine-grained decay 及其带来的 infra 变化 2.2 Gated MLA [Alibaba Qwen] Gated Attention for Large Language Models [https://arxiv.org/abs/2505.06708]:attention gating 与训练稳定性 2.3 Attention Residuals [Microsoft Research] On Layer Normalization in the Transformer Architecture [https://arxiv.org/abs/2002.04745]:Pre-LN、Post-LN 与训练稳定性 [ByteDance Seed] Hyper-Connections:残差连接的新维度 [Moonshot AI] Attention Residuals [https://arxiv.org/abs/2603.15031]:以跨深度 attention 取代固定残差累积,使各层选择性聚合此前表⽰ 2.4 Stable LatentMoE 与 SiTU-GLU [NVIDIA] LatentMoE [https://arxiv.org/abs/2601.18089]:通过 latent expert space 降低 MoE 通信与权重访问成本 [OpenAI] GPT - OSS [https://cdn.openai.com/pdf/419b6906-9da6-406c-a19d-1bb078ac7637/oai_gpt-oss_model_card.pdf]:以 clamped SwiGLU 控制激活值 2.5 Muon [Moonshot AI] Moonlight / Muon is Scalable for LLM Training [https://arxiv.org/abs/2502.16982]:更好的优化表现及随之突出的 activation outlier 问题 2.6 Quantile Balancing [科学空间] 《MoE 环游记:6、最优分配促均衡》 [https://kexue.fm/archives/11619]:从最优分配推导 Quantile Balancing 2.7 Native Vision 3 Pre-Training 3.1 Scaling Law [OpenBMB] MiniCPM [https://arxiv.org/abs/2404.06395]:WSD 的训练预算扩展、稳定阶段复⽤、继续训练与提前停⽌ 3.2 Long-Context Extension [Cohere] RNoPE [https://arxiv.org/abs/2501.18795]:交替使⽤ RoPE 与 NoPE,兼顾位置建模与长上下⽂检索 4 Post-Training 4.1 Post-Training Pipeline 4.2 Reinforcement Learning [Moonshot AI] Kimi K1.5 [https://arxiv.org/abs/2501.12599]:提出 partial rollout,通过复⽤未完成轨迹降低长 CoT rollout 开销 [Moonshot AI] Kimi K2.5 [https://arxiv.org/abs/2602.02276]:reasoning-effort budget control 与 Agentic Generative Reward Model 4.3 Multi-Teacher On-Policy Distillation [Microsoft Research] MiniLLM [https://arxiv.org/abs/2306.08543]:基于 student-generated samples 的 on-policy distillation 4.4 Deployment-Aware Post-Training 4.5 Draft Model Fine-Tuning 5 Infrastructure 5.1 Pre-Training 5.1.1 KDA Kernel [FLA] Flash Linear Attention [https://github.com/fla-org/flash-linear-attention]:KDA kernel 与线性注意⼒⾼效实现 5.1.2 Distributed Training [DeepSeek-AI] DeepSeek-V3 Technical Report [https://arxiv.org/abs/2412.19437]:DualPipe 与细粒度 MoE communication–computation overlap MoE overlap 的资源 trade-off 与 cross-PP activation transfer 5.1.3 Perfectly Balanced Expert-Parallel MoE Training 5.1.4 Memory-Efficient Training [Moonshot AI] Mooncake [https://arxiv.org/abs/2407.00079]:Mooncake Transfer Engine 与 cross-PP activation remote offload 5.1.5 Multimodal Encoder Optimization 5.2 RL 5.2.1 Long-Context RL Infrastructure 5.2.2 Sandbox Infrastructure 5.3 Inference 5.3.1 KDA-Aware Prefix Cache Management 5.3.2 High-Performance Kernels 5.3.3 Fleet-Level Scheduling LINKS: 我们的播客在小宇宙 [https://www.xiaoyuzhoufm.com/podcast/626b46ea9cbbf0451cf5a962]、Apple Podcast [https://podcasts.apple.com/cn/podcast/% E5% BC% A0% E5% B0%8F% E7%8F% BAj% C3% B9n-% E5%95%86% E4% B8%9A% E8% AE% BF% E8% B0%88% E5% BD%95/id1634356920]、Spotify 等全音频平台播出; 我们的视频播客在小宇宙 [https://www.xiaoyuzhoufm.com/podcast/626b46ea9cbbf0451cf5a962]、Bilibili [https://b23.tv/FZ0s2Q1]、小红书 [https://xhslink.com/m/4clvm6edHk1]、视频号、抖音等全视频平台播出; 如果你想服用文字版,请搜索我们工作室的公众号:语言即世界 language is world。 DISCLAIMER: 本内容不作为投资建议。 CONTACT: xiaojunzhang@lisw.ai Jump into the new world-and explore with us!😉

Highlights

本期内容围绕 Kimi K3 的技术演进,尝试从架构、训练到系统实现理解大模型创新。
00:03
大模型创新更多是渐进式改良
08:55
解耦计算与存储才能降低推理成本
17:55
集百家之长,串联模型创新
1:59:18
规模增长必须与技术工程体系打通

Chapters

Kimi K3 与大模型架构演进
00:00
宇涛的自我介绍和研究经历,为什么对架构创新最感兴趣?
02:00
从 Kimi K3 论文出发,论文讲解的框架与脉络
16:05
宇涛开始领读论文:
19:02

Transcript

张小珺: Hello,大家好,我是小珺。今天的节目是一集学习播客,学习 Kimi K3 的技术报告,希望和大家一起领略技术之美。K3 是有效扩展到 2.8T 总参数,并全量开源的 MoE 模型。大家可能注意到,这集技术报告的领读播客,距离模型发布已经过去了一段时间。期间我们试图寻找一位合适的嘉宾,我们希望这位嘉宾,他的工作和学术背景非常适合地来讲 K3。最后找到了孙宇涛,宇涛目前是清华大学计算机系博士候选人,上海创智学院璞锐学者。他从博士开始的研究方向是 LLM 架构,预训练架构创新一直都是他的兴趣所在。这...
小宇宙
Open in 小宇宙