80. 与梅涛院士的 3 小时访谈:语言、视频、具身终将汇聚,为什么是世界模型?
卫诗婕|漫谈Light the Star
2 DAYS AGO
80. 与梅涛院士的 3 小时访谈:语言、视频、具身终将汇聚,为什么是世界模型?
80. 与梅涛院士的 3 小时访谈:语言、视频、具身终将汇聚,为什么是世界模型?

卫诗婕|漫谈Light the Star
2 DAYS AGO
本期节目邀请加拿大外籍院士、智象未来创始人梅涛,深入探讨了视频生成模型的技术发展史。梅涛作为全球首篇文生视频论文的作者,从自身在微软亚研院和京东的工业界经历出发,分享了他对多模态、全模态乃至世界模型演进路径的独到见解,并阐述了其创业公司如何通过架构创新在巨头环伺的赛道中寻找差异化机会。
梅涛认为,图片是多模态的入口,视频是过程,世界模型是终局。他对比了 OpenAI 与 Anthropic 的不同路线,指出在中国创业需兼顾长期愿景与短期商业化。在技术层面,他回顾了从 GAN 到 DiT 再到其团队独创的 UiT 架构的演进,强调创业公司必须通过架构创新以十分之一的人力物力逼近巨头效果,但架构领先仅能维持约六个月。当前多模态视频仍处于 GPT-2 阶段,视觉信号缺乏统一的 Token 定义,Scaling Law 尚未形成统一范式。梅涛认为,世界模型并非单一模型,而是多条路径的集合,视频模型因其数据通用性最有可能成为基础底座。在商业化上,多模态已出现表现力涌现,智能未至但变现先行,创业公司应聚焦 Agent 和垂直应用,避免与大厂在同等规模竞争。
00:06
00:06
图片是入口,视频是过程,世界模型是终局
05:19
05:19
图片是多模态的入口
15:11
15:11
突破认知需反人性努力才能成长
30:47
30:47
2B 和 2C 都能成功,取决于团队基因和价值观
38:55
38:55
AI 下半场应从模型转向 Agent 和用户交互
44:06
44:06
在中国创业需要不断证明商业化能力
1:12:33
1:12:33
多模态视频处于 GPT-2 到 GPT-3 阶段
1:19:01
1:19:01
多模态模型目前仍处于 GPT-2 阶段
1:29:47
1:29:47
视频数据通用性强,能学习底层通用智能
1:56:09
1:56:09
好的领导者需具备宏大目标、清晰路径和利他精神
2:17:53
2:17:53
不做拼凑的多模态,要做底层原生的全模态
2:24:51
2:24:51
创业公司应做差异化,不与巨头在同等规模竞争
2:41:15
2:41:15
做出优秀自研模型是进入下一轮竞争的关键
2:42:16
2:42:16
模型能力越强,应用层越薄
3:03:45
3:03:45
真正的世界模型需 10 倍至 100 倍算力
