scripod.com

134. 【数据的综述】和谢晨聊,新时代的石油、历史、版图、数据金字塔、定价与 Recipe

本期播客聚焦人工智能三驾马车之一的数据,探讨大模型数据遭遇瓶颈、机器人数据匮乏的现状,以及仿真数据如何成为破局关键。嘉宾谢晨分享了数据产业的演变历程与未来格局。
谢晨将数据产业分为静态数据集、工业化生产和大模型评价反馈三个阶段,指出当前数据需求已从追求完美转向重视多样性与错误样本。针对机器人领域,他提出数据金字塔模型:顶层为真机数据,中间为仿真数据,底层为互联网数据,其中仿真数据是解决规模化数据缺失的核心基础设施。他强调,仿真不仅能提供大规模试错环境,更是实现机器人算法规模化评测的唯一途径,顶级大模型团队已开始主动寻求合作。谢晨认为,未来数据产业将形成数据商、大模型商、本体公司与场景公司共生的协作关系,而具身智能的评测标准正趋于一致,世界模型与 VLA 将长期共生。他预测,随着 AI 能力提升,对数据的渴求不会减少,但学习方式可能转向自我学习,仿真环境将成为强化学习的关键。
00:02
00:02
数据作为 AI 三驾马车之一,大模型数据遇瓶颈,机器人数据匮乏
18:05
18:05
仿真数据是像英伟达 GPU 一样不可或缺的基础设施
31:55
31:55
模型能从错误中学习,更接近人类学习过程
46:23
46:23
世界模型是云端大脑,VLA 是端侧大脑
1:01:51
1:01:51
机器人数据可能不到 0.6 分
1:11:17
1:11:17
越有能力的人越爱学习
1:29:16
1:29:16
世界模型与仿真是共生关系,而非替代
1:42:00
1:42:00
垂直场景落地和迁移的难度被低估
1:50:52
1:50:52
真实机器人数据被高估,仿真数据仍被低估
1:59:48
1:59:48
包含失误和修正过程的数据比完美视频更贵
2:14:15
2:14:15
好的数据像人的学习,没有标准答案
2:21:26
2:21:26
机器人公司正分化,底层是商业模式选择
2:28:52
2:28:52
评测是衡量智能提升的核心卡口