scripod.com

55. 揭秘「机器人造脑」幕后:VLM、VLA,不变的是感知能力的提升

Shownote

[https://image.xyzcdn.net/FjzudYkK1I0jlR8zgroIJavM5oyi.jpg] 上周我受到一个邀约,主持了一场围绕具身大脑的技术分享直播。 [https://image.xyzcdn.net/FrWurLnOS01SA - BIfgN_DgormN9O.jpg] (本期视频将很快登陆 b 站账号。图片从左至右为:诗婕、鞠笑竹、Joy、Selina、Yoyo) 主办方是北京人形机器人创新中心,他们也是今年机器人马拉松大赛的冠军、天工机器人的主创团队。 在当下具身智能这股为机器人造脑的热潮中,北京人形这个团队也交出了自己的研究成果 —— 他们最新开源了具身大脑 Pelican-VL。围绕这个最大尺寸(70B)的开源具身多模态脑模型,我们逐步还原了为机器人造脑背后的全过程,并进行了包含 VLM、VLA 等一系列具身知识的科普,还解析了不同技术路线的差异。 围绕具身智能的学习,我已开辟了一个单独专题「Robot‘s coming!」,过往第 45 期节目 [https://www.xiaoyuzhoufm.com/episode/688aecc28e06fe8de793dc19] 中,我曾陪伴过人形机器人进工厂,非常合适与本期内容一起收听。这期节目的视频版也将在不久后登陆 b 站、视频号、小红书等平台,大家可以对照着 PPT 更直观地理解~也可以关注我的公众号「卫诗婕 商业漫谈」。 让我们一起学习具身领域的知识,共同迎接一种融合文明的到来~ 本期嘉宾:北京人形机器人创新中心研发团队 (男)鞠笑竹 北京人形机器人创新中心大模型负责人 (女)Joy 多模态大模型算法研究员 (女)Selina 多模态大模型算法工程师 (女)Yoyo 多模态大模型算法工程师 本期 SHOWNOTES: 04:28 从自动驾驶到具身智能:传感器、摄像头与激光雷达 > 二者都需要感知环境、判断行动 > 智驾进入深水区,具身智能仍处早期,气氛较自由 05:37 [https://jl2wfton35.feishu.cn/minutes/obcn9cy939gs66kh264pv9dk?t = 337000] AI 浪潮下,机器人运控与造脑的发展 > RT 系列:模仿学习让机器人能完成任务,但像一个没感情的执行机器 > 机器人需更具泛化性,能自主思考、完成多样任务 09:56 [https://jl2wfton35.feishu.cn/minutes/obcn9cy939gs66kh264pv9dk?t = 596000] 概念科普:VLM(Vision- Language-Model,视觉语言模型) & VLA(Vision- Language-Action,视觉语言动作模型) > VL 负责感知,VLA(的其中一种) = VLM + Action > 模型架构不断演进,核心 VL 部分不变 14:10 [https://jl2wfton35.feishu.cn/minutes/obcn9cy939gs66kh264pv9dk?t = 850000] 从通用模型到具身脑模型 > 通用模型和具身之间的 Gap:感知时序、理解空间,具备 function call > 具身智能:模型借机器人的身体,实现与物理世界的接触 16:33 [https://jl2wfton35.feishu.cn/minutes/obcn9cy939gs66kh264pv9dk?t = 993000] 过往 VLM 的卡点及突破 > 大模型工作机制:DPPO(Deliberate Practice Policy Optimization)算法 > 当前大模型的空间感知能力不如 3 岁小孩 > 强化学习(RL)+ 监督微调(SFT):先让模型自己学习,再针对性辅导 30:40 [https://jl2wfton35.feishu.cn/minutes/obcn9cy939gs66kh264pv9dk?t = 1840000] 具身智能的 Scaling Law 何时出现:视频数据 VS 具身数据 > 视频数据 VS 具身数据的特点 > 算力资源、怼数据与模型失智 > 不同尺寸的模型应用 37:46 [https://jl2wfton35.feishu.cn/minutes/obcn9cy939gs66kh264pv9dk?t = 2266000] 一款具身脑模型,能有哪些感知 + 认知能力的表现? > 多维 benchmark:where to place、robospecials… > 英伟达 Cosmos:衡量物理常识推理和具身决策能力 > 李飞飞提出世界模型的三大关键能力:多模态理解、交互、生成 > 为什么物理能力对具身智能很重要? > 可供性(affordance):源自 1977 年心理学概念,对具身至关重要 > 大脑力控 & 触觉反馈修正 01:00:45 [https://jl2wfton35.feishu.cn/minutes/obcn9cy939gs66kh264pv9dk?t = 3645000] 具身智能数据集规模、内容及清洗 01:03:41 [https://jl2wfton35.feishu.cn/minutes/obcn9cy939gs66kh264pv9dk?t = 3821000] 全女模型研究团队:从未遇见过性别阻力 (本期内容专业性较强,可结合「商业漫谈」后续发布的视频中的 PPT 观看,更易理解) 加入漫谈听友群👇 [https://image.xyzcdn.net/FjPfbwSqtdre1sojf43UVZHn3sRH.jpg]

Highlights

在人工智能迈向具身智能的新阶段,机器人不再只是执行预设指令的机械体,而是通过与物理世界的互动实现认知进化。本期节目深入探讨了为机器人造脑的技术路径,聚焦北京人形机器人创新中心最新开源的具身大脑模型 Pelican-VL,揭示其背后的研发逻辑与技术突破。
05:37
自动驾驶和人形机器人需先感知环境、判断任务,常用传感器都是摄像头和激光雷达。
08:53
具身大脑大模型能让机器人像人一样自主思考
11:26
VLA 可理解为 VLM 加上 action 的 head
15:38
Pelican 模型使机器人能直接调用通用 AI 能力
21:32
大模型连一层积木都搭不好,暴露空间推理严重缺陷
35:55
发布当前开源中参数量最大的 72B 具身脑模型
39:04
只有我们的模型能正确判断机器人下一步操作
1:02:09
实习生是大模型训练中的第一生产力,团队中北大实习生来自吉林大学信息计算专业。
1:07:20
开源 Pelican-VL 模型为具身智能提供优秀基座

Chapters

揭秘具身大脑 Pelican-VL
00:00
从自动驾驶到具身智能:传感器、摄像头与激光雷达
04:28
AI 浪潮下,机器人运控与造脑的发展
05:37
概念科普:VLM(Vision- Language-Model,视觉语言模型) & VLA(Vision- Language-Action,视觉语言动作模型)
09:56
从通用模型到具身脑模型
14:10
过往 VLM 的卡点及突破
16:33
具身智能的 Scaling Law 何时出现:视频数据 VS 具身数据
30:40
一款具身脑模型,能有哪些感知 + 认知能力的表现?
37:46
具身智能数据集规模、内容及清洗
1:00:45
全女模型研究团队:从未遇见过性别阻力
1:03:41

Transcript

Joy: 我们通常把 VLM 和 VLA 比喻成大脑和小脑,VLM 它是我们的大脑,它负责感知环境。给到 VLA 模型一个可执行的指令。 鞠笑竹: 不管 VLA 怎么变,始终核心的就是 VLA 的这一部分,它是不变的。现在的训练方式并不是很高效的。非常充足的资金,很多的卡,很多的数据。像一个大象,每天要吃几十公斤的食物,才能够长一点点的体重。 Joy: 我们每天面对着那么多的卡,账单是非常惊人的。 鞠笑竹: 具身智能是人工智能的下一个阶段。如果说机器人,他没有和真实的物理世界发生接触,那苹果对他来说就是一堆...
小宇宙
Open in 小宇宙