scripod.com

80. 与梅涛院士的 3 小时访谈:语言、视频、具身终将汇聚,为什么是世界模型?

Shownote

从语言大模型,到多模态至全模态模型,再到走向世界模型… 世界正在经历什么? 本期节目我邀请了加拿大外籍院士、智象未来 Hidream 的创始人梅涛,还原视频生成模型的技术发展史。 梅涛院士是全球首篇文生视频论文的作者,也是最早探索文生视频的人。 2026 年 5 月 20 日,Google I / O 大会上,Pichai 发布了 Gemini Omni —— Google 第一个原生「any-to-any」的全模态模型:文本、图像、视频、语音都在同一个 Transformer 里原生流动,不再是几个模型...

Highlights

本期节目邀请加拿大外籍院士、智象未来创始人梅涛,深入探讨了视频生成模型的技术发展史。梅涛作为全球首篇文生视频论文的作者,从自身在微软亚研院和京东的工业界经历出发,分享了他对多模态、全模态乃至世界模型演进路径的独到见解,并阐述了其创业公司如何通过架构创新在巨头环伺的赛道中寻找差异化机会。
00:06
图片是入口,视频是过程,世界模型是终局
05:19
图片是多模态的入口
15:11
突破认知需反人性努力才能成长
30:47
2B 和 2C 都能成功,取决于团队基因和价值观
38:55
AI 下半场应从模型转向 Agent 和用户交互
44:06
在中国创业需要不断证明商业化能力
1:12:33
多模态视频处于 GPT-2 到 GPT-3 阶段
1:19:01
多模态模型目前仍处于 GPT-2 阶段
1:29:47
视频数据通用性强,能学习底层通用智能
1:56:09
好的领导者需具备宏大目标、清晰路径和利他精神
2:17:53
不做拼凑的多模态,要做底层原生的全模态
2:24:51
创业公司应做差异化,不与巨头在同等规模竞争
2:41:15
做出优秀自研模型是进入下一轮竞争的关键
2:42:16
模型能力越强,应用层越薄
3:03:45
真正的世界模型需 10 倍至 100 倍算力

Chapters

Introduction
00:00
视频领域的 Anthropic :图片是刀, 视频是过程
03:35
院士里少有的「躬身入局」:全职 20 年的工业界履历
08:25
微软 R & D 分离 vs OpenAI 融合:今天模型就是产品
29:00
AI 不是足球赛而是篮球比赛:第一节快结束了
31:27
Sam vs Dario:一号位视角 vs 单点技术执念
42:15
从 TGANs-C 到 UiT:做视频模型,创业公司为什么必须换架构
47:10
像素没有统计意义:多模态还在 GPT-2 阶段
1:17:15
世界模型不是一个模型:三条路还没有交汇
1:27:50
从微软、京东到 HiDream:创业没有标准答案,在迷雾中寻找航向
1:41:16
通往世界模型:下一代架构可能已在萌芽
2:08:53
世界模型不等于具身:图片是扎马步,最大的数据量目前来自视频模型公司
2:19:34
多模态商业化:智能未涌现,表现力先变现
2:28:49
船票的本质:模型能力与商业化都要过关
2:42:06
卖铲子给具身:从世界中学习,再重构世界
2:54:55

Transcript

梅涛: 我们团队在 2017 年的时候,就发表了全球第一篇文生视频的论文。那个论文里面的所有的作者,都在我们公司。我们始终认为图片是入口,这边是过程。那终局可能就是世界模型,还是要看最多的数据在哪里。现在所谓的世界模型,包括具身智能的模型,它们的模型体量大概只有几十 B,或者一两百 B。一个像智象这样的公司,我们一年的数据都是 100 PB,很恐怖的。你只有见过这么多的视频,通用性足够好的情况下,你才能够做更多的泛化。 卫诗婕: 李飞飞是想复刻这个世界,LeCun 觉得不必复刻这个世界。你是哪一派? 梅涛:...
小宇宙
Open in 小宇宙