scripod.com

E253|谁在给大模型出题、卖题、判卷?聊聊 AI 数据行业的野蛮生长

硅谷101

11 HOURS AGO
硅谷101

硅谷101

11 HOURS AGO

Shownote

随着 AI 模型能力提升,训练需求更复杂,一批为模型公司提供训练数据的新公司正在快速增长:AfterQuery 今年 4 月宣布 A 轮融资时,估值为 3 亿美元,到了 9 月,据媒体报道,新一轮融资已经将其估值推至 32 亿美元。另一家提供训练数据与智能体环境的公司 Bespoke Labs,也在今年 7 月宣布,种子轮与 A 轮融资合计达到 4000 万美元。 虽然估值水涨船高,AI 数据行业对外界来说却极其不透明。问题来了:这些公司究竟在卖什么? 过去提到数据标注,我们容易想到给图片打标签、给模型回答打分。但随着 AI 从回答问题走向执行任务,数...

Highlights

大模型正在从 “会回答” 走向 “能做事”,也让训练数据从标签和答案扩展到专家判断、真实工作流与可验证环境。本期节目从 Rubric、强化学习环境和 Benchmark 出发,拆解数据公司的生意、评测与真实能力的关系,以及好数据如何被采购、验证和用于训练。
01:38
好数据正在从标签走向可验证的工作过程
05:15
数据公司的基因并不相同
08:16
Rubric 正在让位于强化学习环境
12:35
把 Vibe Coding 推广到 Vibe Everything
16:11
验证器也必须比被训练模型更强
19:55
好的激励方式才能换来重要数据
22:29
Benchmark 面向未来,数据解决当下需求
25:57
好的评测既看核心能力,也看真实场景
28:59
没上榜的评测,也可能有人在用
35:13
垂直数据的真正壁垒在采购
38:49
生物学评测仍是一片空白
42:36
长期拼的还是研发能力
45:10
训练数据不只是模拟任务,还要匹配训练方式
47:45
训练题目不能太难,也不能太简单
51:07
奖励机制决定数据质量的上限
53:57
代码是 Agent 的手和脚
56:22
数据生意不能躺着吃老本

Chapters

AI 数据从标注走向可验证工作流
00:00
拆解数据生意和玩家
数据公司之间的区别:招聘平台、众包标注、合成数据
05:03
从预训练到后训练,模型需要的数据发生了哪些变化?
08:27
Rubric 数据:把专业判断变成评分标准
09:32
强化学习(RL)环境:从回答问题到动手干活
10:46
从 vibe coding,到 vibe everything:详解 Agents’ Last Exam
12:18
游戏好不好玩、作品好不好看,主观判断能被量化吗?
14:10
Rubric 与环境如何配合:人与 Agent 协作
17:33
评测与模型真实能力
20:05
从做评测到卖数据:benchmark 的生意
23:25
什么样的评测值得刷?核心能力与真实场景
27:29
没上热门榜单的评测,也可能带来真实的数据需求
31:39
什么是好数据:采购、版权与小众行业工作流
两三个人的数据创业公司,为什么也能找到机会?
33:30
模型越来越会自己造数据,外部供应商的机会还能持续多久?
38:56
模型公司为什么仍然需要外部数商?研发周期与行业采购的难题
40:48
有了数据,之后呢?
数据买回来之后怎么用?从 SFT、强化学习到模型训练模型
44:04
训练数据不是越难越好:为不同模型匹配难度与解题轨迹
47:03
SWE-bench Verified 的争议:测试缺陷与数据污染
48:22
专家交来的数据也可能造假,如何验证真实的工作过程?
50:04
数据行业的下一步:收购企业、获取数据,还是持续投入研发?
54:03

Transcript

Yiwen: 哈喽大家好, 欢迎回到硅谷 101, 我是逸文。很多投资人在和我们聊天的时候都提到了他们最近很关注的一个赛道, 那就是数据。随着模型能力的不断提升, 模型公司对训练数据的需求也变得越来越复杂, 越来越具体。硅谷因此出现了一批增长很快的数据公司, 专门为这些模型公司提供服务。比如由三名二十多岁的年轻人创办的 AfterQuery。今年 4 月宣布 A 轮融资的时候,估值还是 3 亿美元。到了 9 月呢,新一轮融资就已经把他的估值推到了 32 亿美元。不到半年啊,涨到了 10 倍之多。创下了 YC...