177: 详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?
晚点聊 LateTalk
3 DAYS AGO
177: 详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?
177: 详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?

晚点聊 LateTalk
3 DAYS AGO
本期播客深入解析了 Kimi K3 模型的技术报告与发布影响,邀请 RadixArk 创始成员赵晨阳和华盛顿大学博士生曾致远,从推理与算法两条线拆解 K3 的架构创新、开源争议及其对 AI 行业的影响。节目探讨了 K3 在长程任务中的表现、混合注意力机制、MoE 方案、优化器改进等核心技术,并讨论了开源模型真正开放的内容与保留的部分。
K3 作为首个 3T 级开放权重模型,在长程 Agent 任务中表现惊艳,但响应速度较慢。其架构采用 KDA 线性注意力与 MLA 混合注意力,通过 NoPE 和 Attention Residuals 优化信息流动,实现百万上下文下的 6.3 倍解码加速。Quantile Balancing 解决了近千专家的负载均衡问题,Per-Head Muon 优化器提升了训练稳定性。后训练采用 MOPD 多教师在线蒸馏,降低协作复杂度。开源争议聚焦于权重开放但环境、验证和算力未开放,真正的护城河在于这些未开源部分。K3 的发布冲击了闭源模型估值,但开源与闭源仍存在代差。未来持续学习与评测仍是挑战,模型发展将呈现平台期与突破交替的模式。
02:17
02:17
K3 发布在硅谷引发巨大反响
10:43
10:43
架构和预训练细节增多,后训练细节减少
11:15
11:15
模型可能主动寻找规则漏洞
22:39
22:39
RSI 缺乏的不是模型而是有效的评估方法
25:34
25:34
关注总成本而非单价
31:25
31:25
前缀命中与否影响计算量、成本和首 token 延迟
34:42
34:42
权重发布后不可收回,社区镜像使其无法下架
41:28
41:28
NoPE 扩展上下文时无需处理位置编码
46:25
46:25
Quantile Balancing 实现按比例分配 token,更精细
52:48
52:48
3:1 的 KDA 与 MLA 配比在验证集上效果最佳
56:03
56:03
混合注意力架构是解决遗忘的关键
59:13
59:13
能压低百万上下文成本的架构大概率是异构的
1:00:54
1:00:54
混合架构实现 6.3 倍解码加速
1:07:05
1:07:05
理论表达力更高,实际效果看消融实验
1:12:15
1:12:15
Per-Head Muon 对每个注意力头单独正交化,提升训练稳定性
1:14:46
1:14:46
优化器研究适合 AI agent,因目标明确且结果易验证。
1:22:36
1:22:36
MOPD 允许各团队独立优化模型,降低协作复杂度
1:29:17
1:29:17
自我提升需外部可扩展监督信号
1:37:24
1:37:24
用算法宽容换取基础设施自由
1:43:58
1:43:58
Kernel Development Agent 加速国产芯片适配
1:46:51
1:46:51
开源模型与闭源模型存在代差
1:48:34
1:48:34
持续学习能力难以衡量,当前模型泛化性有限
