scripod.com

177: 详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?

晚点聊 LateTalk

Shownote

「开源了权重,没开源产生权重的 “流水线”。」 本期我们邀请 RadixArk 创始成员赵晨阳和华盛顿大学博士生曾致远,从推理与算法两条线拆解 K3:它真的比肩 fable 吗?3T 开放权重、混合注意力和智能体训练环境意味着什么?以及开源模型真正开放了什么、又保留了什么? 晨阳是老朋友,他曾在 163 期节目中为我们从 Infra 角度解读了 DeepSeek-V4。在 UCLA 读博期间,晨阳成为 SGLang 核心开发者,SGLang 第一时间适配了 V4 、K3、GLM 5.2 等中国开源模型。...

Highlights

本期播客深入解析了 Kimi K3 模型的技术报告与发布影响,邀请 RadixArk 创始成员赵晨阳和华盛顿大学博士生曾致远,从推理与算法两条线拆解 K3 的架构创新、开源争议及其对 AI 行业的影响。节目探讨了 K3 在长程任务中的表现、混合注意力机制、MoE 方案、优化器改进等核心技术,并讨论了开源模型真正开放的内容与保留的部分。
02:17
K3 发布在硅谷引发巨大反响
10:43
架构和预训练细节增多,后训练细节减少
11:15
模型可能主动寻找规则漏洞
22:39
RSI 缺乏的不是模型而是有效的评估方法
25:34
关注总成本而非单价
31:25
前缀命中与否影响计算量、成本和首 token 延迟
34:42
权重发布后不可收回,社区镜像使其无法下架
41:28
NoPE 扩展上下文时无需处理位置编码
46:25
Quantile Balancing 实现按比例分配 token,更精细
52:48
3:1 的 KDA 与 MLA 配比在验证集上效果最佳
56:03
混合注意力架构是解决遗忘的关键
59:13
能压低百万上下文成本的架构大概率是异构的
1:00:54
混合架构实现 6.3 倍解码加速
1:07:05
理论表达力更高,实际效果看消融实验
1:12:15
Per-Head Muon 对每个注意力头单独正交化,提升训练稳定性
1:14:46
优化器研究适合 AI agent,因目标明确且结果易验证。
1:22:36
MOPD 允许各团队独立优化模型,降低协作复杂度
1:29:17
自我提升需外部可扩展监督信号
1:37:24
用算法宽容换取基础设施自由
1:43:58
Kernel Development Agent 加速国产芯片适配
1:46:51
开源模型与闭源模型存在代差
1:48:34
持续学习能力难以衡量,当前模型泛化性有限

Chapters

Kimi K3 模型技术解析
00:00
K3 为什么成为里程碑
使用体感:长程任务、惊艳的前端能力与被吐槽的不足
05:13
K3 引发的开源、安全与估值大辩论
11:15
Transformer 的「忒修斯之船」
16:50
贵不贵、慢不慢,看单价之外的任务总成本
25:34
K3 为什么现在慢?新架构、Serving Stack 与前缀复用
29:25
权重一旦开放就收不回;真正的护城河在环境、验证和算力
34:42
KDA(K3 采用的注意力) 和 KDA(kenerl 开发 agent),说不好哪个更伟大?
架构总览:让信息沿序列与深度更高效流动
39:36
Quantile Balancing:近千个专家如何保持负载均衡
42:42
KDA+MLA:线性注意力与全局注意力并非二选一
48:38
线性注意力下,百万上下文如何缓解遗忘
54:12
线性注意力给推理系统带来的工程变化
57:27
6.3 倍解码加速来自哪里
1:00:54
Attention Residuals:让深层模型选择性读取浅层信息
1:03:34
优化器、后训练与自动研究
Per-head Muon 与大规模训练稳定性
1:10:23
AI 能否自己发明优化器
1:14:46
MOPD:九个领域专家为什么先分后合
1:20:34
蒸馏的纯技术定义、on-policy 蒸馏与 off-policy 蒸馏的区别
1:27:11
Infra 优化
KDA 结构下,投机采样回退机制的变化
1:31:08
Flash KDA、QAT 与训练 — 推理一致
1:39:47
后面有什么?
下一个开源最强,以及开源能否超过闭源
1:46:50
持续学习、评测与模型平台期
1:48:29

Transcript

曾致远: 我接触到的像美国 Frontier Lab 的一些普通打工人里面,确实有部分人会认为开权重模型能力上涨,对于 Frontier Lab 的估值是有很潜在的影响的。就比如说未来很多公司,他们可能不愿意去把自己的数据发给 Anthropic 或者 OpenAI 这样的第三方。 赵晨阳: 比较好玩的是,我觉得吧,这个世界上是不存在老老实实做 Transformer 这回事的。比如 K3 的注意力是线性注意力,KDA 加上全级注意力 MLA 的混合。然后残差被改成了深度方向上的线性 Attention。而...