E253|谁在给大模型出题、卖题、判卷?聊聊 AI 数据行业的野蛮生长
硅谷101
12 HOURS AGO
E253|谁在给大模型出题、卖题、判卷?聊聊 AI 数据行业的野蛮生长
E253|谁在给大模型出题、卖题、判卷?聊聊 AI 数据行业的野蛮生长

硅谷101
12 HOURS AGO
大模型正在从 “会回答” 走向 “能做事”,也让训练数据从标签和答案扩展到专家判断、真实工作流与可验证环境。本期节目从 Rubric、强化学习环境和 Benchmark 出发,拆解数据公司的生意、评测与真实能力的关系,以及好数据如何被采购、验证和用于训练。
何允中和孙一铀从 Scale AI 与 Agents’ Last Exam 等实践出发,解释 AI 数据行业为何从传统标注转向专家数据、Agent 环境和真实工作流。节目讨论了 Rubric 如何把专业判断变成评分规则,强化学习环境如何通过工具、沙盒和验证机制训练模型,以及主观任务如何借助规则和模型共同评估。嘉宾也分析了 Benchmark 刷榜、数据污染、用户体验和垂直评测之间的张力,说明小型数据公司仍可凭借行业采购、版权资源和研发能力找到机会。最后,节目回到数据使用、训练难度、专家造假和行业并购,强调数据供应商必须持续研发,而不能依赖存量资源。
01:38
01:38
好数据正在从标签走向可验证的工作过程
05:15
05:15
数据公司的基因并不相同
08:16
08:16
Rubric 正在让位于强化学习环境
12:35
12:35
把 Vibe Coding 推广到 Vibe Everything
16:11
16:11
验证器也必须比被训练模型更强
19:55
19:55
好的激励方式才能换来重要数据
22:29
22:29
Benchmark 面向未来,数据解决当下需求
25:57
25:57
好的评测既看核心能力,也看真实场景
28:59
28:59
没上榜的评测,也可能有人在用
35:13
35:13
垂直数据的真正壁垒在采购
38:49
38:49
生物学评测仍是一片空白
42:36
42:36
长期拼的还是研发能力
45:10
45:10
训练数据不只是模拟任务,还要匹配训练方式
47:45
47:45
训练题目不能太难,也不能太简单
51:07
51:07
奖励机制决定数据质量的上限
53:57
53:57
代码是 Agent 的手和脚
56:22
56:22
数据生意不能躺着吃老本