scripod.com
#677.Post-Traning 前沿现状与问题

Highlights

Transcript

Chapters

Pins

#677.Post-Traning 前沿现状与问题

OverviewShownote
Unprocessed episode, you can be the first!

Shownote

📝 本期播客简介 本期我们克隆了:The State of Frontier Post-Training Recipes | Conversation with Finbarr Timbers。节目讨论前沿大模型后训练(post-training)配方的现状与实践。 本期节目来自技术播客《Interconnects》,主持人 Nathan 与 AI2 研究员 Finbarr Timbers 展开了一场关于前沿大模型后训练配方演变的深度对谈。这也是该节目首次迎来返场嘉宾 ——Finbarr 曾在 AI2 与 Nathan 共同参与 OMO 系列模型的后训练工作,而录制当天恰好是他在 AI2 的最后一天,让这场对话多了一层告别与回顾的意味。 对话从经典配方讲起,一路梳理到多教师在线策略蒸馏(Multi-Teacher Online Policy Distillation)等最新趋势。两人不仅回顾了 InstructGPT 三阶段框架、Llama 3 与 TULU3 的实用落地、DeepSeek R1 的推理转向,还穿插了他们在 AI2 的实际经验 —— 包括 OMO3 后训练如何逼近组织能力极限、为什么 DPO 正在从主流配方中消失,以及中国实验室与美国实验室在配方细节分享上的显著差异。如果你关心大模型后训练的技术细节、开源与工业界的差距,或者想了解前沿实验室内部的组织与决策逻辑,这期内容密度极高,值得反复收听。 👨‍⚕️ 本期嘉宾 Finbarr Timbers,AI2(Allen Institute for AI)研究员,专注于大模型后训练与强化学习。他此前曾在 DeepMind 阿尔伯塔办公室工作,参与过计算机扑克与博弈论研究,后加入 AI2 参与 OMO 系列模型的后训练工作。他是《Interconnects》节目首位返场嘉宾,对前沿后训练配方的演变有深入观察和一手经验。 ⏱️ 时间戳 开场 & 节目背景 01:12 欢迎回到 Interconnects,Nathan 与 Finbarr 的开场寒暄 01:39 Finbarr 成为节目首位返场嘉宾 01:48 两人在 AI2 共事后训练的缘起 02:52 今天是 Finbarr 在 AI2 的最后一天 从 OMO3 到经典配方:后训练的组织极限 03:11 从 OMO3 聊起:推理模型后训练的复杂度 03:35 现代后训练的本质:整合组织架构图 04:16 TULU3 之后的分岔点:简单配方 vs 前沿做法 07:35 经典配方综述:InstructGPT、Llama 3、TULU3、DeepSeek R1 配方的工业化演进:从 InstructGPT 到 DeepSeek 09:49 InstructGPT 三步法:SFT、奖励模型、RL 10:40 Llama 2/3 的迭代:拒绝采样、DPO、多轮训练 11:59 TULU3 的简化配方与组织规模的限制 13:03 DeepSeek R1 的配方:RL-first 与冷启动 SFT DPO 的衰落与偏好调优的争议 14:35 DPO 从主流配方中消失的趋势 15:01 为什么配方越干净,DPO 需求越小 16:27 偏好调优是否被低估? 16:54 偏好损失函数带来的惊人提升 多教师在线策略蒸馏:2026 年的新范式 21:06 DeepSeek V4 与多教师在线策略蒸馏 22:00 MIMO Flash V2 命名该术语 22:25 多教师在线策略蒸馏的机制详解 24:51 Nematron 3 Ultra 的实践与挑战 教师模型的困境与行业分歧 26:28 英伟达的关键发现:教师差异过大无法合并 27:18 分阶段蒸馏 vs 收敛后蒸馏的争论 29:05 微软 MAI 的保守配方选择 33:15 中国实验室的细节分享:温度调度与难度课程 开源环境、Tinker API 与算力经济 35:57 开源环境市场的疯狂现状 36:41 环境报价:每个环境十万美金 40:05 Tinker 风格 API 的商业模式与争议 42:14 卖算力、卖推理与卖 API 的利润层级 职业选择与长期价值 45:26 热潮之下:挤进实验室赚钱 vs 长期价值 45:44 探索与利用的取舍:什么工作值得做 48:41 Finbarr 的职业经历:DeepMind 与 AI2 的信念驱动 50:27 大实验室的体量困境与多样化路线 🌟 精彩内容 💡 "把 OMO3 后训练成推理模型,对很多人来说都是一项重大成就" Nathan 坦言,OMO3 的后训练复杂度已经逼近 AI2 组织能力的极限。现代后训练拼的不是单一技术,而是把算力和数据整合进一条工作流的能力 —— 本质上是在整合一张组织架构图。这也是为什么 OMO3 作为推理模型推出得相当晚,且配方相对简单。 "很多现代后训练,拼的就是你把算力和数据整合进一条工作流的能力。" 💡 配方趋同的分岔点出现在 TULU3 之后 在 TULU3 之前,大家还能说 "做法都差不多"——SFT、DPO、RL 三阶段配方。但到了推理模型和带工具使用的 Agent 模型时代,那种简单配方已经不再适用。前沿实验室的做法与开放学术界的差距正在急剧拉大。 "可现在,把那种三阶段配方用在推理模型上,尤其是带工具使用的 Agent 模型上,就真的不太适用了。" 💡 DPO 的消失是配方工业化的必然结果 当后训练流程变得越来越精细、越来越工业化,DPO 能带来的边际收益就消失了。但在配方粗糙的阶段,DPO 依然是从零搭建时算力效率最高的选择之一。Nathan 直言:"用 DPO 的人可能会被看不起,但如果你是想把一个配方从零搭起来,它仍然管用。" "当你的配方越来越干净的时候,这个需求基本上就消失了。" 💡 多教师在线策略蒸馏:把 RL 框架变成教师对齐的舞台 这是 2026 年最值得关注的后训练新范式:在 RL 框架内,让正在训练的学生模型采样轨迹,再路由给各个领域专家教师,用 KL 散度损失对齐。Finbarr 指出,实现起来其实很直接 —— 只需要对现有 RL 配置做一小套调整。 "你拿你现有的 RL 配置,然后只需要对学习者模型做一小套调整,就能实现这个。" 💡 教师模型差异过大,蒸馏会失败 英伟达在 Nematron 3 Ultra 论文中披露了一个关键发现:用差异很大的训练流程训练出来的教师模型,无法通过简单的在线策略蒸馏有效合并。教师和学生若用不同 SFT 数据训练,会习得不同推理行为,导致学生轨迹对教师而言属于分布外数据。 "这种分布差异会导致学生生成的轨迹对教师来说属于分布外数据,从而降低教师提供的监督信号的质量和可靠性。" 💡 中国实验室更愿意分享 "特别特别具体" 的细节 从温度调度到难度课程,KIMI K2.5 和 GLM5 分享了大量可操作的配方细节 —— 尽管两者在温度调度上声称的正好相反。相比之下,英伟达的论文更像一份方法列表,读起来没那么有意思。 "我还是觉得中国实验室更愿意分享那种特别特别具体的细节。" 💡 报酬最高的地方,往往也是你在做最有趣工作的地方 面对 "梯子被抽走之前挤进实验室" 的热潮,Finbarr 给出的判断是:要区分短期套利和长期价值。他职业生涯里反复看到,高薪与有趣工作往往是重合的 —— 关键是追随信念,在某个领域做到足够强。 "往往报酬最高的地方,也正是你在做最有趣工作的地方。" 💡 开放环境市场:一个环境十万美金,但可能不包含提示词 Finbarr 分享了他年初尝试购买 RL 环境的经历:一个 DoorDash 克隆级别的环境,前期成本约十万美金,每年维护费约五万。但 Nathan 指出,真正值钱的是 "我们知道这些提示词能提升某个基准测试"—— 那才能收高得多的溢价。 "如果你能说 ' 我们有提示词,而且我们知道它们能提升某个基准测试或某项能力 ',那就能收高得多的溢价。" 🌐 播客信息补充 本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的 使用 AI 进行翻译,因此可能会有一些地方不通顺; 如果有后续想要听中文版的其他外文播客,也欢迎联系微信:iEvenight 在小宇宙查看该单集文稿 [https://oia.xiaoyuzhoufm.com/player/6a809e6117676351c5726dfe?openTranscript = true & utm_source = rss & as = cHQ9MTIyNjE5MjQ3JmN0PXJzcyZtdD04 & autoOpen = false]

Highlights

Chapters

Transcript

小宇宙
Open in 小宇宙