73. AGI 范式大转移:和广密预言草莓、OpenAI o1 和 self-play RL|全球大模型季报 4
张小珺Jùn|商业访谈录
2024/09/05
73. AGI 范式大转移:和广密预言草莓、OpenAI o1 和 self-play RL|全球大模型季报 4
73. AGI 范式大转移:和广密预言草莓、OpenAI o1 和 self-play RL|全球大模型季报 4

张小珺Jùn|商业访谈录
2024/09/05

今天这集是我和广密【全球大模型季报】第 4 集。这期 2024 年 Q3 季报,提前和大家见面。
我们正进入的 9 月会是 AGI 的一个大月,OpenAI 造势已久且绝密的项目 “草莓(Strawberry)” 将在不久后揭开它神秘的面纱。此外,Anthropic 也会推出 Claude 3.5 Opus,这两个模型将是 AGI 进程是否顺利的关键风向标。
这些项目很可能暗示了硅谷 AGI 范式已经静悄悄地发生剧烈转移。
本集节目带来了对 AGI 发展路径的最大猜想 —— 硅谷 AGI 范式正在发生转移,self-play RL(强化学习)开启了新赛道。大部分人还没意识到,在纯靠语言模型预训练的 Scaling Law 这个经典物理规律遇到瓶颈后,多家硅谷明星公司已经把它们的资源重心押宝在一条新路径上:self-play RL(自博弈强化学习)。只不过,这个范式转移还未形成共识。Self-play RL 到底是什么?它如何有别于传统路径?它能成为继续 Scaling Law 的一把神奇钥匙吗?
这集节目是关于 self-play RL 的一篇高质量科普,也希望为大模型从业者带来方向性的启发。
除了 self-play RL,我们着重探讨了硅谷一级市场的明星赛道(Coding、视频生成、通用机器人),以及 OpenAI 与科技巨头近况。希望我们【全球大模型季报】能帮大家了解最前沿的 AGI 动态,并且能持续给大家带来启示。
本集是《张小珺 Jùn|商业访谈录》和《海外独角兽》的串台节目。
我们的播客节目在腾讯新闻首发,大家可以前往关注哦,这样可以第一时间获取节目信息和更多新闻资讯:)



坏的推演猜测,GPT-5 不乐观;好的推演猜测,RL 开启新赛道
- 02:30 语言模型预训练的范式或许遇瓶颈,模型 scaling 边际效益开始递减
- 05:21 为什么不一定能支持模型在 GPT-4o 基础上大幅跃升?现在处于 “真空死亡地带”?
- 06:43我最担心的是,纯靠语言模型的经典 Scaling Law /Pre train 这个物理规律遇到瓶颈,或者在更大参数比如 2-3T 以上的情况下开始失效了
- 09:37 如果 scaling law 在模型变大的过程中不 work,现在有三条潜在路径:1、多模态尤其是视觉(但还没有证据说能从视觉模态训练涌现智能能力);
- 2、10 万卡集群(但 10 万卡集群充分互联的难度比预期难,可能是全人类最难的项目之一);
- 3、强化学习 self-play RL(这是范式级别的大转变!)
- 12:53如果我是 AI 公司 CEO,我会 200% 资源 all in RL 这条路
- 13:40 概念解释:Reinforcement Learning,简称 RL,中文强化学习(Ilya 用一句话概括强化学习:让 AI 用随机路径去尝试一个新任务,如果效果超出预期,就更新神经网络的权重让 AI 记得多使用成功的实践,再开始下一次尝试)
- 19:05 代码和数学可以变得很强,能不能泛化到更多领域没有证据
- 22:39你也可以把语言和预训练比作人类基因组,携带着人类几千年进化的基因,强化学习 RL 就是人类成长的一生
- 24:55 必须很聪明的模型才能有能力做 self-play RL 的探索
- 27:07 Anthropic Claude 3.5 是这一波标志性的产品,他们不搞 Sora / 搜索,主线是 RL;业内少数人意识到 RL 的重要性是最近两个月
- 28:35 硅谷明星公司现阶段的资源投入?1-2 家公司把 RL 当作最高优先级
- 28:56 2024 年 9 月 OpenAI 和 Anthropic 即将要发布的,什么值得期待?
- 29:42 AGI 范式大转移之下,还会有 GPT-6 和 GPT-7 吗?(可能明年会看到很小的模型比今天 GPT-4o 要聪明非常多,一个期待是实现 AGI 不一定需要巨量参数的模型)
- 30:33 新范式的困境和卡点
- 32:52 Character.AI 出售给 Google 预示 AGI 竞赛上半场结束,下半场开始,创始人 Noam 从 Google 进入 self-play RL 下半场
- 34:36 新范式下,还需要那么多 GPU 吗?很多人关心英伟达股价
- 37:06AGI 范式转移只在最核心的 researcher 中有共识,几百人,还没扩散
- 38:55 Claude 3.5 Sonnet 显著提升,带动了编程工具 Cursor 的火爆出圈
- 40:08OpenAI 在造势的草莓、Q*,猜测背后都是强化学习 RL
- 41:55 国内公司应该应该 all in 200% 跟进 RL
- 42:44 语言模型和 RL 是乘级关系
硅谷 AI 一级市场的四个明星赛道
- 45:12 硅谷的 AI 赛道:围绕 LLM 周边有 3-4 个圈,搜索、代码 Coding、视频、机器人

- 1、Coding:在硅谷出现了 4-5 家独角兽(Devin、Augment 、Magic、Poolside,都已经 20-30 亿美元估值),最近编程工具 Cursor 出圈
- 2、 视频:这个赛道诱人,但格局不稳定、决胜窗口长
- 3、通用机器人:想赌具身领域也有个 OpenAI,现在是基础科学突破的问题,没看到在机器人领域的 “通用泛化能力” 出现
- 57:00 美国通用机器人的明星项目(Pi、The Bot 是业界公认最头部的项目,除此之外融资金额很大、声量也比较高的是 Skild AI、Figure AI)
- 58:31 国内 vs 硅谷机器人:硅谷投 robot foundation model 一个大脑,像 Andorid;在国内投整机,OV 和小米
- 01:01:56 LLM-> 多模态 -> 具身智能 -> 世界模型,这是 AI 发展路径
- 01:05:54 LLM vs 移动互联网,叙事逻辑是什么?哪些明线与暗线?

OpenAI 和科技巨头
- 01:12:37 OpenAI
- 1、有点浪费技术领先的红利,产品没接住
- 2、联合创始人 Greg Brockman、John Schumann 离职
- 3、Ilya 离开应该是 bet on 两个路线(多模态 / 强化学习,大概率是 RL)
- 01:17:10Q* 和草莓和 RL 应该是一件事,草莓是代号,RL 是方法
- 01:18:07 回答红杉美国合伙人 David Cahn 发布最新文章《AI’s $600B Question》
- 01:20:00 在 2024 年 Q3,AI 叙事还有哪些非共识?
- 01:22:45 Character.AI 之后,哪些 AI 公司还会被收购?做个预测
- 01:23:38 2000 年互联网 hype 破灭后只留下 Amazon 一家公司,今天 AI hype 如果破灭了,谁是下一个 Amazon?
- 01:24:24 AGI 第一幕是科技巨头受益,第二幕还没完全展开

【全球大模型季报】系列
2023 年:口述全球大模型这一年:人类千亿科学豪赌与参差的中美景观
2024 年 Q1:和广密聊 AGI 大基建时代:电 + 芯片 = 产出智能
2024 年 Q2:口述全球大模型这半年:Perplexity 突然火爆和尚未爆发的 AI 应用生态
【更多信息】
联络我们:微博@张小珺 - Benita,小红书@张小珺 jùn
更多信息欢迎关注公众号:张小珺

