177: 详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?
晚点聊 LateTalk
Aug 03
177: 详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?
177: 详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?

晚点聊 LateTalk
Aug 03
本期播客深入解析了 Kimi K3 模型的技术报告与发布影响,邀请 RadixArk 创始成员赵晨阳和华盛顿大学博士生曾致远,从推理与算法两条线拆解 K3 的架构创新、开源争议及其对 AI 行业的影响。节目探讨了 K3 在长程任务中的表现、混合注意力机制、MoE 方案、优化器改进等核心技术,并讨论了开源模型真正开放的内容与保留的部分。
K3 作为首个 3T 级开放权重模型,在长程 Agent 任务中表现惊艳,但响应速度较慢。其架构采用 KDA 线性注意力与 MLA 混合注意力,通过 NoPE 和 Attention Residuals 优化信息流动,实现百万上下文下的 6.3 倍解码加速。Quantile Balancing 解决了近千专家的负载均衡问题,Per-Head Muon 优化器提升了训练稳定性。后训练采用 MOPD 多教师在线蒸馏,降低协作复杂度。开源争议聚焦于权重开放但环境、验证和算力未开放,真正的护城河在于这些未开源部分。K3 的发布冲击了闭源模型估值,但开源与闭源仍存在代差。未来持续学习与评测仍是挑战,模型发展将呈现平台期与突破交替的模式。
02:17
02:17
K3 发布在硅谷引发巨大反响
10:43
10:43
架构和预训练细节增多,后训练细节减少
11:15
11:15
模型可能主动寻找规则漏洞
22:39
22:39
RSI 缺乏的不是模型而是有效的评估方法
25:34
25:34
关注总成本而非单价
31:25
31:25
前缀命中与否影响计算量、成本和首 token 延迟
34:42
34:42
权重发布后不可收回,社区镜像使其无法下架
41:28
41:28
NoPE 扩展上下文时无需处理位置编码
46:25
46:25
Quantile Balancing 实现按比例分配 token,更精细
52:48
52:48
3:1 的 KDA 与 MLA 配比在验证集上效果最佳
56:03
56:03
混合注意力架构是解决遗忘的关键
59:13
59:13
能压低百万上下文成本的架构大概率是异构的
1:00:54
1:00:54
混合架构实现 6.3 倍解码加速
1:07:05
1:07:05
理论表达力更高,实际效果看消融实验
1:12:15
1:12:15
Per-Head Muon 对每个注意力头单独正交化,提升训练稳定性
1:14:46
1:14:46
优化器研究适合 AI agent,因目标明确且结果易验证。
1:22:36
1:22:36
MOPD 允许各团队独立优化模型,降低协作复杂度
1:29:17
1:29:17
自我提升需外部可扩展监督信号
1:37:24
1:37:24
用算法宽容换取基础设施自由
1:43:58
1:43:58
Kernel Development Agent 加速国产芯片适配
1:46:51
1:46:51
开源模型与闭源模型存在代差
1:48:34
1:48:34
持续学习能力难以衡量,当前模型泛化性有限
