scripod.com

80. 与梅涛院士的 3 小时访谈:语言、视频、具身终将汇聚,为什么是世界模型?

从语言大模型,到多模态至全模态模型,再到走向世界模型…
世界正在经历什么?
本期节目我邀请了加拿大外籍院士、智象未来 Hidream 的创始人梅涛,还原视频生成模型的技术发展史。
梅涛院士是全球首篇文生视频论文的作者,也是最早探索文生视频的人。
2026 年 5 月 20 日,Google I / O 大会上,Pichai 发布了 Gemini Omni —— Google 第一个原生「any-to-any」的全模态模型:文本、图像、视频、语音都在同一个 Transformer 里原生流动,不再是几个模型拼接 —— 这与梅涛一直以来的主张不谋而合。
与此同时,OpenAI 悄悄砍掉了 Sora 项目,更多聚焦 Coding—— 硅谷正在做减法。
但中国一侧的多模态战场却没有收敛,从多模态、全模态到世界模型,多模的架构层面正在发生一轮新的分化:DIT、UIT、Omni 各自赌不同的路。
梅涛,作为最懂视频模型的人之一,正是选择从底层架构下场的创业者,他致力于打造「视频界的 Anthropic」。
我们从他的中科大、微软亚研院岁月,一路聊到这场世界模型的创业之旅。梅涛的模型世界观可以用一句话精炼,那就是:
图片是入口,视频是过程,世界模型是终局。
语言、视频、具身,终将汇聚。
这期的信息量极大,但技术门槛较高,不过,其中穿插着大量生动比喻,跟随下来,也能对当下的 AI 趋势进行一场深入的了解。推荐大家收听~

本期嘉宾:梅涛(加拿大工程院外籍院士、智象未来 HiDream 创始人)

本期 Shownotes:

03:35视频领域的 Anthropic :图片是刀, 视频是过程
  • 学 Anthropic 的三件事: 团队从 OpenAI 出来后极度稳定 (智象核心作者从 2017 年起就没走过一个)、坚定做企业服务、通过开源建立自我逼迫的创新节奏
  • 视频领域的刀是图片 : 图片是二维 / 三维信号的入口,今天客户在平台上创作的时间 50%-60% 花在做一张图上
  • 多模的成长路径: 图片模型 → 视频模型 → 全模态模型 → 世界模型
  • 能不能把图片做到全球最好, 是视频公司真正的分水岭:Google 的 Veo 3 之所以强,是因为 Google 本身有很好的图片模型
08:25院士里少有的「躬身入局」:全职 20 年的工业界履历
  • 中科大→微软亚研 10 年→京东探索研究院 5 年→2023 年创立智象; 从没拿过第二份薪水,始终全职
  • 导师张宏江的习惯:看汇报从最后一页往前翻,5 分钟就把半小时的 slides 看完
  • 「用 AI 分析理解视频」的任务,跨越 6 年才完成 —— 多模态、全模态、世界模型都是那份实习任务的延长线
  • 好的 mentor 给的 assignment 都不是「当下能做出来」的, 而是「你的整条职业生涯都要围绕它推进」的
  • 反人性才能获得长久的正反馈,负反馈也是正反馈
  • 微软亚研院的土壤:这样的 R to D 通道今天几乎绝迹
29:00微软 R & D 分离 vs OpenAI 融合:今天模型就是产品
  • 微软时代:研究员做 paper → 10 个工程师转化成产品 → 100 个工程师做产品化,大半年才能进产品线
  • OpenAI 这一代:researcher 和 engineer 完全融合,R & D 之间不再有转化层
  • 研究员今天为什么这么贵 —— 因为他们直接是产品线;研究判断本身就是产品判断
  • 如果你的研究和工程仍是两个团队,你比大厂慢的不是资源,而是决策速度
31:27AI 不是足球赛而是篮球比赛:第一节快结束了
  • toC 是 toB 的放大器——C 端最先感知模型能力的溢出、贡献社区反馈、做 branding
  • 中国 AI 创业的三个关键词:全球化、出海、软硬件一体
  • AI 的四节比赛:大模型比拼、 agent (通用 + 垂直)、终端流量入口 / 软硬件、第四节待定
  • AI 时代,toB 和 toC 的边界越来越模糊:创业公司不必二选一
  • 后面的迭代周期会更短:基模半年一次大迭代,Agent 可能三个月一次,终端和交互还会更快
42:15Sam vs Dario:一号位视角 vs 单点技术执念
  • Dario 是理想主义者 (读社会学、历史、哲学);Sam 是投资人出身, 更现实
  • 讲宏大叙事等不到爆发那天就会死
  • 中国投资人的三重反射弧 —— 需要沿途下蛋、追共识不追共识外、经历过 toC 时代所以对 toB 天花板有本能的低估 ——这些都改变了中国创业者能选的叙事结构:你必须在讲远期愿景的同时不断证明近期商业化
  • 「长期看 Anthropic 和 OpenAI 的曲线一定会交织」
47:10 从 TGANs-C 到 UiT:做视频模型,创业公司为什么必须换架构
  • 做出全球第一篇文生视频论文 TGANs-C (2017):使用 GAN 与卷积神经网络,只能生成约 3—4 秒、48×48 像素的模糊视频,但证明了文本可以反向生成视频
  • 视频生成模型经历了 GAN、Diffusion、DiT 几轮架构变化:主干网络从 CNN 换成 Transformer 后,模型才获得更强的上下文和规模化能力
  • DiT 需要先把文字、图片和视频压进隐空间,再编码、解码;压缩会损失细节,也让像素级控制变得困难 ——字节等大厂可以在此基础上大力出奇迹,但始终有些事做不到
  • 智象在探索的 UiT: 尝试取消外部 VAE,让原始像素、文本 Token 和任务条件进入统一空间,直接完成跨模态交互
  • 创业公司必须思考如何避开大厂的车辙,如何优化成本曲线,逼近大厂的优势
  • 「架构上的领先只能持续六个月」:开源是一场持续创新考试
  • 为什么视频模型目前仍然是创业公司玩得起的游戏?千卡级训练仍给创业公司留有窗口

01:17:15像素没有统计意义:多模态还在 GPT-2 阶段

  • 语言是经过人类数千年压缩的结构化知识,而视觉信号缺少公认的 Token 定义,「像素没有统计意义」
  • 文本可以用 next-token prediction 自监督训练,图像和视频通常需要成对的内容与高质量描述,监督成本更高
  • 视觉 Scaling Law 会出现,但不一定复刻语言模型的路径;数据、算法和算力都还没有形成统一范式
  • 目前视觉不负责产生智能,而在于复刻
  • 多模态消耗数据的速度仍赶不上人类产生视觉数据的速度

01:27:50世界模型不是一个模型:三条路还没有交汇

  • 杨立昆的 JEPA 路线关注 next state 与世界状态预测;李飞飞更侧重 3D 世界重建;视频生成派则希望从海量真实视频中学习物理规律
  • 视频模型的数据更通用、参数体量更大,可以成为世界模型的基础底座,再向具身或交互式任务迁移
  • 图片、第三人称视频、第一人称视频和具身真机数据各自覆盖不同分布,单靠真机数据很难获得足够泛化
  • 生成与理解目前仍是两套路线,真正的大一统架构尚未出现。
  • 世界模型现阶段更像一组不同目标、数据和训练方式的模型家族。具身、3D 和视频都只是路径,过早把它们压成一个答案,会遮住真正的架构问题

01:41:16从微软、京东到 HiDream:创业没有标准答案,在迷雾中寻找航向

  • 通用视频模型底座的商业化
  • 技术创业选赛道时,「未来足够大」还不够。能否沿途形成收入、数据和产品反馈,决定团队有没有机会等到终局。
  • 判断模型是否真正创新,不能只看公开榜单;模型公司会用自己的测试集和极限 Prompt 检查边界能力。
  • 好的 Leadership :清晰目标、可执行路径、利他和技术使命感
  • 快速不仅指把正确路线跑快,也包括更早承认路线不对

02:08:53通往世界模型:下一代架构可能已在萌芽

  • 从多模态、全模态走向世界模型是通向 AGI 或 ASI 的必经阶段
  • 当前的 Transformer 未必足以承载所有模态和交互,下一代架构可能已经在萌芽
  • 让博士生和研究员持续筛论文、做小规模试错,再把有潜力的方向放大到产业级训练
  • 发现下一代架构靠的不是一次灵感,而是一套持续感知机制

02:19:34世界模型不等于具身:图片是扎马步,最大的数据量目前来自视频模型公司

  • 自动驾驶、视频、3D 和机器人都有各自的世界模型叙事。
  • 智象的「具身世界模型」路径:先把图片质量做高,再扩展视频长度、实时性和可交互性,最后延伸到高精度的物理世界任务。
  • 「像智象这样的公司,一年都是 100 PB 级年度视频数据」:视频仍是当前最可规模化的物理世界信号
  • 图片不是视频模型的过渡版本,而是最低成本的基本功测试 —— 构图、像素控制和角色一致性做不稳,视频越长,错误只会被继续放大。

02:28:49多模态商业化:智能未涌现,表现力先变现

  • 「多模不会一家独大」
  • Agent 的价值不只取决于基模,还取决于 Harness、Skills、成本控制和行业 know-how
  • 多模态还没有出现语言模型式的智能涌现,却已经出现表现力涌现。商业化可以早于技术终局。
  • 「Token 将来价值会越来越薄,因为它成为了一种 commodity。」

02:42:06船票的本质:模型能力与商业化都要过关

  • 一张多模态船票首先要求自研模型和公开可验证的能力;只有应用收入,也可能被下一轮模型升级吃掉。
  • 模型层竞争是耐力赛,但资本耐心有限
  • 2024—2025 年,一批视频创业公司批量退出牌桌
  • 一级与二级市场都在寻找模型排名、对标逻辑和增长数字,但对「新型 toB」的共同要求,是不要回到私有化部署和定制研发。

02:54:55 卖铲子给具身:从世界中学习,再重构世界

  • 智象与诺亦腾合作: 具身公司缺少高质量、可规模化的数据
  • 把真人遥操和夹爪数据扩增为不同背景、不同手部外观的第一人称视频
  • 合成数据是否「真实」并非重点,重点是它能否提升 VLA 或 World Action Model,并用轻量模型量化能力增量。
  • 通用世界模型仍缺数据、架构和算力,把触觉、温度、空间、时间、语言与动作放进同一模型,可能需要今天 10—100 倍的计算资源。
  • 图片是入口,视频是过程,世界模型是终局
  • 「我希望能够从世界中学习,把世界进行重构。」

---

欢迎前往视频版,对照字幕获得更好的吸收。也欢迎关注公众号「卫诗婕漫谈 Light the Star」,查看访谈文字版整理。
加入听友群、关注「漫谈 Light the Star」的全网账号 👇

在小宇宙查看该单集文稿