80. 与梅涛院士的 3 小时访谈:语言、视频、具身终将汇聚,为什么是世界模型?
卫诗婕|漫谈Light the Star
2 DAYS AGO
80. 与梅涛院士的 3 小时访谈:语言、视频、具身终将汇聚,为什么是世界模型?
80. 与梅涛院士的 3 小时访谈:语言、视频、具身终将汇聚,为什么是世界模型?

卫诗婕|漫谈Light the Star
2 DAYS AGO
Shownote
Shownote
从语言大模型,到多模态至全模态模型,再到走向世界模型… 世界正在经历什么? 本期节目我邀请了加拿大外籍院士、智象未来 Hidream 的创始人梅涛,还原视频生成模型的技术发展史。 梅涛院士是全球首篇文生视频论文的作者,也是最早探索文生视频的人。 2026 年 5 月 20 日,Google I / O 大会上,Pichai 发布了 Gemini Omni —— Google 第一个原生「any-to-any」的全模态模型:文本、图像、视频、语音都在同一个 Transformer 里原生流动,不再是几个模型...
Highlights
Highlights
本期节目邀请加拿大外籍院士、智象未来创始人梅涛,深入探讨了视频生成模型的技术发展史。梅涛作为全球首篇文生视频论文的作者,从自身在微软亚研院和京东的工业界经历出发,分享了他对多模态、全模态乃至世界模型演进路径的独到见解,并阐述了其创业公司如何通过架构创新在巨头环伺的赛道中寻找差异化机会。
Chapters
Chapters
Introduction
00:00视频领域的 Anthropic :图片是刀, 视频是过程
03:35院士里少有的「躬身入局」:全职 20 年的工业界履历
08:25微软 R & D 分离 vs OpenAI 融合:今天模型就是产品
29:00AI 不是足球赛而是篮球比赛:第一节快结束了
31:27Sam vs Dario:一号位视角 vs 单点技术执念
42:15从 TGANs-C 到 UiT:做视频模型,创业公司为什么必须换架构
47:10像素没有统计意义:多模态还在 GPT-2 阶段
1:17:15世界模型不是一个模型:三条路还没有交汇
1:27:50从微软、京东到 HiDream:创业没有标准答案,在迷雾中寻找航向
1:41:16通往世界模型:下一代架构可能已在萌芽
2:08:53世界模型不等于具身:图片是扎马步,最大的数据量目前来自视频模型公司
2:19:34多模态商业化:智能未涌现,表现力先变现
2:28:49船票的本质:模型能力与商业化都要过关
2:42:06卖铲子给具身:从世界中学习,再重构世界
2:54:55Transcript
Transcript
梅涛: 我们团队在 2017 年的时候,就发表了全球第一篇文生视频的论文。那个论文里面的所有的作者,都在我们公司。我们始终认为图片是入口,这边是过程。那终局可能就是世界模型,还是要看最多的数据在哪里。现在所谓的世界模型,包括具身智能的模型,它们的模型体量大概只有几十 B,或者一两百 B。一个像智象这样的公司,我们一年的数据都是 100 PB,很恐怖的。你只有见过这么多的视频,通用性足够好的情况下,你才能够做更多的泛化。
卫诗婕: 李飞飞是想复刻这个世界,LeCun 觉得不必复刻这个世界。你是哪一派?
梅涛:...

Open in 小宇宙
