scripod.com

152. 领读 Kimi K3 技术报告:从架构创新聊起,注意力美学、多教师蒸馏和开源 MoE

Shownote

今天的节目是一集学习播客,学习 Kimi K3 技术报告,希望和大家一起领略 “技术之美”。 K3 是有效扩展到 2.8T 总参数并全量开源的 MoE 模型。大家可能注意到,这集技术报告的领读距离模型发布已经过去一段时间。期间,我们试图寻找一位合适的嘉宾,我们希望这位嘉宾的学术和工作背景非常适合讲 K3。最后找到孙宇涛。 宇涛目前是清华大学计算机系博士候选人,上海创智学院璞锐学者。他从博士开始的研究方向是 LLM 架构、预训练,架构创新一直是他的兴趣点,这正好是 K3 亮点之一。 宇涛透过领读 K3 技术报告也串联讲解了十多篇相关...

Highlights

本期内容围绕 Kimi K3 的技术演进,尝试从架构、训练到系统实现理解大模型创新。
00:03
大模型创新更多是渐进式改良
08:55
解耦计算与存储才能降低推理成本
17:55
集百家之长,串联模型创新
1:59:18
规模增长必须与技术工程体系打通

Chapters

Kimi K3 与大模型架构演进
00:00
宇涛的自我介绍和研究经历,为什么对架构创新最感兴趣?
02:00
从 Kimi K3 论文出发,论文讲解的框架与脉络
16:05
宇涛开始领读论文:
19:02

Transcript

张小珺: Hello,大家好,我是小珺。今天的节目是一集学习播客,学习 Kimi K3 的技术报告,希望和大家一起领略技术之美。K3 是有效扩展到 2.8T 总参数,并全量开源的 MoE 模型。大家可能注意到,这集技术报告的领读播客,距离模型发布已经过去了一段时间。期间我们试图寻找一位合适的嘉宾,我们希望这位嘉宾,他的工作和学术背景非常适合地来讲 K3。最后找到了孙宇涛,宇涛目前是清华大学计算机系博士候选人,上海创智学院璞锐学者。他从博士开始的研究方向是 LLM 架构,预训练架构创新一直都是他的兴趣所在。这...
小宇宙
Open in 小宇宙