scripod.com

#683.Rich Sutton:大语言模型不是真正的智能,我们卡在了一个局部最优里

跨国串门儿计划

Shownote

📝 本期播客简介 本期我们克隆了:知名播客 Training Data Rich Sutton and Khurram Javed: Why AI Models Stop Learning, and How to Start It Again。原内容更新时间:2026-08-18。嘉宾 Rich Sutton 与 Khurram Javed 讨论持续学习、合成数据、大世界假设、灾难性遗忘和能持续学习的智能体;由 Sequoia Capital 的 Sonya Huang 与 Alfred Lin 主持。 原内容更新时间:2026-08-18 本期嘉宾是强化学习领域的奠基人 Rich Sutton,以及他的联合创始人、前学生 Khurram Javed。主持人是红杉资本的 Sonya Huang 与 Alfred Lin。Rich Sutton 是那篇经典文章《苦涩的教训》的作者,也是阿尔伯塔大学强化学习研究的核心人物。这期对话围绕持续学习、合成数据的局限,以及他们创办的 Oak Lab 想要实现的新一代智能体展开。 这场对话从《苦涩的教训》出发,直指当前 AI 领域的核心矛盾:大语言模型在部署后权重不再更新,本质上不是持续学习者。Rich 与 Khurram 提出了 "大世界假说",认为世界远比互联网上的一切都要大得多,合成数据无法替代真实经验。他们还分享了 Oak Lab 的野心 —— 打造一个能持续学习、形成抽象、并保持自洽的智能体,并给出了具体的技术路径,包括持续反向传播算法和步长优化。如果你关心 AI 的下一个范式是什么,这期节目会给你一个完全不同的视角。 👨‍⚕️ 本期嘉宾 Rich Sutton,强化学习领域的奠基人之一,阿尔伯塔大学教授,著有奠基性教科书《Reinforcement Learning: An Introduction》,培养了大批该领域的关键学生(如 AlphaGo 的 David Silver)。他的文章《苦涩的教训》被视为深度学习领域的 "圣经"。Khurram Javed 是 Rich 在阿尔伯塔大学的学生,也是 Oak Lab 的联合创始人,专注于持续学习与 "大世界假说" 的研究。 ⏱️ 时间戳 00:00 开场 & 播客简介 "我不怪,这个领域才怪" 01:15 Rich Sutton 的开场宣言:持续学习才是正常思考方式 01:57 主持人介绍 Rich Sutton 与 Khurram Javed 02:53 为什么在 AI 寒冬押注强化学习 03:40 2003 年与癌症搏斗的经历 《苦涩的教训》与大语言模型的局限 07:45 2019 年写下《苦涩的教训》的契机 09:03 苦涩的教训的本质:别被人类知识带偏 10:13 大语言模型是正面还是反面例子? 11:14 合成数据是 "大错误":大世界假说 为什么合成数据无法替代真实经验 11:42 大世界假说:世界比互联网大得多 12:18 谁来判定合成数据的好坏? 14:18 世界无限复杂,任何模拟都渺小得可怜 16:10 自动驾驶模拟器:人类在循环里的瓶颈 持续学习:算法缺口与解药 22:33 大语言模型不是经验型学习者 23:23 预训练与后训练之后,模型就不再学习了 37:58 持续深度学习是算法缺口 39:10 解药:步长优化与持续反向传播 Oak Lab 的野心与未来 35:44 从空谈到行动:创办 Oak Lab 42:34 最有野心的目标:拥有完整跨度的知识 44:25 "这是触手可及的":五到十年的判断 47:53 如果一切顺利,Oak Lab 会变成什么样? 🌟 精彩内容 💡 "我不怪,这个领域才怪" Rich Sutton 反复强调自己并不激进,他只是在用 "普通的方式思考"。在他看来,所有学习都是持续的,我们一直在行动、一直在学习,这才是正常的思考方式。是 AI 领域把 "持续学习" 当成了一个特殊概念,才显得他奇怪。 "所有学习都是持续的。我们一直在行动,一直在学习。这才是正常的思考方式。" 💡 大语言模型既是《苦涩的教训》的正面例子,也是反面例子 正面在于它把计算规模的扩展做到了极致,直接吞下整个互联网;反面在于它最终会被人类知识限制住 —— 互联网是有限的,而世界比互联网上的一切都要大得多得多。 "互联网是有限的,很难再拿到更多样本。而世界很大,世界比我们存在互联网上的一切都要大得多得多。" 💡 合成数据是 "大错误" Rich 与 Khurram 直言,合成数据生成是当前扩展范式的根本问题。谁来判定什么样的合成数据是好的?这需要人类专家,而这就是瓶颈所在。更根本的是,世界无限复杂,任何对它的模拟都渺小得可怜。 "世界是无限复杂的,任何对它的模拟都渺小得可怜。" 💡 大语言模型的权重永远不会变 这是 Rich 对当前主流范式最尖锐的批评:模型在部署后就不再学习了。你可以给它更多上下文,但模型本身已经停止学习。相比之下,Cursor 和 Tab 这类产品因为持续更新权重,反而是真正的持续学习例子。 "它们的权重永远不会变。…… 他们声称能从一种完全不再学习的东西里,榨出博士级的经验和专业能力。" 💡 学校其实无关紧要 Rich 认为,没有哪种动物是通过监督学习来学习的。松鼠不上学也能学会那些东西,学校是非常特殊的东西,就连人类也是直到几百年前才有的。把监督学习当成学习的主要例子,是一种干扰。 "你看,松鼠不上学,也能学会那些东西。动物不是那样学习的。" 💡 我们卡在了一个局部最优里 Khurram 认为,当前的大实验室被产品绑得太死,无法去走一条 "事情会先变差" 的路。新范式在变好之前几乎不可避免地会先变差,而那些大实验室不可能接受这一点。 "当我们开始探索这些新方向时,你不可能第一天就拿到最先进的性能。但这是因为,它是一个不同的范式。" 💡 大语言模型大概只占智能的 20% Rich 明确表示,大语言模型是了不起的科学突破,但它被过度包装成了 " 全部 AI"。全部智能并不只是流畅的语言运用能力,语言只是重要的一部分,还有太多别的东西没做完。 "全部智能并不只是流畅的语言运用能力。还有太多别的东西。语言是重要的一部分。它大概占智能的 20% 或者四分之一。" 🌐 播客信息补充 本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的 使用 AI 进行翻译,因此可能会有一些地方不通顺; 如果有后续想要听中文版的其他外文播客,也欢迎联系微信:iEvenight 在小宇宙查看该单集文稿 [https://oia.xiaoyuzhoufm.com/player/6a86ee8bef65145dfcc2abaa?openTranscript = true & utm_source = rss & as = cHQ9MTIyNjE5MjQ3JmN0PXJzcyZtdD04 & autoOpen = false]

Highlights

本期对话围绕一个根本问题展开:如果智能意味着在行动中理解世界、修正自己,那么今天的主流 AI 是否真的在学习?两位研究者从强化学习的思想出发,重新审视模型、经验与智能之间的关系。
00:00
持续学习才是智能的常态
17:01
算力最终会超越人类知识
18:50
真正的智能来自持续经验
33:29
真正的智能来自自主经验与抽象规划
39:02
持续学习的关键是避免灾难性遗忘
47:50
真正的智能来自持续的真实经验

Chapters

从疾病与低谷中坚持:为什么持续学习才是智能的常态?
00:00
互联网之外还有多大世界:算力扩展为何仍需真实经验?
08:15
模型部署之后就停止学习了吗?重新理解经验型智能体
18:50
不上学也能学会:自主行动如何孕育抽象与规划能力?
25:24
如何边学边记住:持续学习系统对抗灾难性遗忘
35:17
从固定模型走向自洽智能:未来五到十年的新路径
43:51

Transcript

Alfred Lin: 欢迎收听跨国串门儿计划,这是一档专注于让中文听众无障碍欣赏全球优质外语播客的节目。通过先进的 AI 声纹克隆技术,我们不仅将内容翻译成中文,还完美保留了原主持人和嘉宾的独特声音。为您呈现全球顶尖的 AI 财经,健康与科技领域精品内容。我是主播依凯,一位热衷于 AI 领域的产品经理。很荣幸能为您搭建这座跨越语言障碍的桥梁。接下来让我为您简单介绍本期我们克隆的这档节目。本期我们克隆的是知名播客 Training Data 的一期深度对谈。由红杉资本的 Sonya Huang 与 Alfr...
小宇宙
Open in 小宇宙