177: 详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?
晚点聊 LateTalk
3 DAYS AGO
177: 详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?
177: 详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?

晚点聊 LateTalk
3 DAYS AGO
Shownote
Shownote
「开源了权重,没开源产生权重的 “流水线”。」 本期我们邀请 RadixArk 创始成员赵晨阳和华盛顿大学博士生曾致远,从推理与算法两条线拆解 K3:它真的比肩 fable 吗?3T 开放权重、混合注意力和智能体训练环境意味着什么?以及开源模型真正开放了什么、又保留了什么? 晨阳是老朋友,他曾在 163 期节目中为我们从 Infra 角度解读了 DeepSeek-V4。在 UCLA 读博期间,晨阳成为 SGLang 核心开发者,SGLang 第一时间适配了 V4 、K3、GLM 5.2 等中国开源模型。...
Highlights
Highlights
本期播客深入解析了 Kimi K3 模型的技术报告与发布影响,邀请 RadixArk 创始成员赵晨阳和华盛顿大学博士生曾致远,从推理与算法两条线拆解 K3 的架构创新、开源争议及其对 AI 行业的影响。节目探讨了 K3 在长程任务中的表现、混合注意力机制、MoE 方案、优化器改进等核心技术,并讨论了开源模型真正开放的内容与保留的部分。
Chapters
Chapters
Kimi K3 模型技术解析
00:00K3 为什么成为里程碑
使用体感:长程任务、惊艳的前端能力与被吐槽的不足
05:13K3 引发的开源、安全与估值大辩论
11:15Transformer 的「忒修斯之船」
16:50贵不贵、慢不慢,看单价之外的任务总成本
25:34K3 为什么现在慢?新架构、Serving Stack 与前缀复用
29:25权重一旦开放就收不回;真正的护城河在环境、验证和算力
34:42KDA(K3 采用的注意力) 和 KDA(kenerl 开发 agent),说不好哪个更伟大?
架构总览:让信息沿序列与深度更高效流动
39:36Quantile Balancing:近千个专家如何保持负载均衡
42:42KDA+MLA:线性注意力与全局注意力并非二选一
48:38线性注意力下,百万上下文如何缓解遗忘
54:12线性注意力给推理系统带来的工程变化
57:276.3 倍解码加速来自哪里
1:00:54Attention Residuals:让深层模型选择性读取浅层信息
1:03:34优化器、后训练与自动研究
Per-head Muon 与大规模训练稳定性
1:10:23AI 能否自己发明优化器
1:14:46MOPD:九个领域专家为什么先分后合
1:20:34蒸馏的纯技术定义、on-policy 蒸馏与 off-policy 蒸馏的区别
1:27:11Infra 优化
KDA 结构下,投机采样回退机制的变化
1:31:08Flash KDA、QAT 与训练 — 推理一致
1:39:47后面有什么?
下一个开源最强,以及开源能否超过闭源
1:46:50持续学习、评测与模型平台期
1:48:29Transcript
Transcript
曾致远: 我接触到的像美国 Frontier Lab 的一些普通打工人里面,确实有部分人会认为开权重模型能力上涨,对于 Frontier Lab 的估值是有很潜在的影响的。就比如说未来很多公司,他们可能不愿意去把自己的数据发给 Anthropic 或者 OpenAI 这样的第三方。
赵晨阳: 比较好玩的是,我觉得吧,这个世界上是不存在老老实实做 Transformer 这回事的。比如 K3 的注意力是线性注意力,KDA 加上全级注意力 MLA 的混合。然后残差被改成了深度方向上的线性 Attention。而...
