scripod.com

一个人、两周、数百美元,如何训出登顶 Hugging Face 的模型 | 对谈研究员逯雨鑫

42章经

1 DAYS AGO
42章经

42章经

1 DAYS AGO

Shownote

活动预告🥳:9 月 12 日,我们会请到雨鑫做一场线上活动,大家记得翻到 shownotes 末尾查看报名信息! 最近硅谷有了新热点:主权 AI 和 Personal Intelligence。简单来说,就是很多人开始相信,未来会有越来越多的应用公司和个人,训练自己的模型。 对绝大多数人来说,训练模型仍然是一件听起来遥不可及、门槛很高的事,但我们这期节目的嘉宾逯雨鑫却认为,它非常简单,简单到他此前没有 AI Lab 的经历,也不是 AI PhD,只用了 2 周和数百美元,就后训练出了两个登顶 Hugging Face Model Trending 榜首的小模型。 [https://image.xyzcdn.net/FrxXoYrPSiAhuCG2D138TZaZ-prz.png] 他具体是怎么做到的、摸索出了怎样的 Pipeline?过程中踩过哪些坑?以及无论对个人还是公司来说,训练模型最大的卡点都是数据,那么他是怎么攻克这个难题的?在蒸馏路线、数据来源上,又有哪些 secret sauce? 节目后半段,我们还进一步讨论了主权 AI、Personal Intelligence 和 Local AI 相关的各种问题,比如这些事情普及开来的门槛在哪里、未来 AI Lab 和应用公司的分工与价值会有什么变化等等。 就在一个月前,我们还在讲 AI 应用遭受的冷遇;但录完这期,我们好像又看到了应用的曙光。也许在不久的将来,越来越多的应用公司都会成为 Neo Lab,Local AI 也可能成为一个 PC 级别的机会。而拥抱模型训练和 Local AI,最好的时间可能就是现在。 希望雨鑫摸索出的实践路径,能给应用公司和个人带来一些启发。如果你还想了解更多,也欢迎报名 shownote 末尾的线上活动,来和雨鑫直接交流(尤其欢迎应用创业者!) 【人类博物馆】 导游:曲凯,42 章经创始人 52 号珍藏:逯雨鑫,Mind Lab 研究员;以个人开发者身份、数百美元成本微调的模型两次登顶 Hugging Face 热度榜;focus 在 post-training(蒸馏、SFT)与数据工程,近期方向为 continued pre-training 【时光机】 Part 1 训模型的实操经验 * 01:33 非 PhD / AI Lab 背景,凭什么能训出榜一模型? * 03:23 训这两个模型的成本具体有多少? * 06:08 个人训模型的完整 Pipeline 和避坑经验 * 11:33 最大的难点和卡点:数据 * 11:48 合成数据效果并不好? * 12:16 数据从哪来、具体要用多少、如何配比? * 15:34 数据难以提前预估效果的原因:Capacity Gap * 17:18 简评蒸馏的各种路线,以及到底什么叫「聪明地蒸」? * 20:01 自己训、自己用,性价比真的更高吗? * 22:10 坑最少的开源模型是? Part 2 对主权 AI 的思考 * 23:44 自己训模型会成为应用公司的标配吗? * 25:25 训模型可能会成为一件商品化的事情? * 27:01 应用公司反而可能会成为 Neo Lab? * 32:07 AI Lab 和应用公司之间的分工可能会有什么变化? * 33:39 现在 AI Lab 砸钱买数据,就有点像移动互联网早期字节砸钱买用户 * 35:31 如果主权 AI 真的兴起,AI Lab 的价值会有什么变化? * 36:59 Local AI 会不会成为 PC 级别的机会? * 40:17 用户最终会不会还是希望用上 SOTA 级别的智能,而不是 Local AI? 【活动预告🥳】 9 月 12 日,我们会请到雨鑫做一场线上活动,感兴趣的朋友欢迎点击链接 [https://my.feishu.cn/share/base/form/shrcnoBYrZhfPLGz8RO2qKv7PQc] 或扫描下面的二维码,一起来认识 & 交流! [https://image.xyzcdn.net/Ftnz-T44LXTl2Kl9sJ0FEu2csTFx.png] 【The gang that made this happen】 * 制作人:陈皮 * 剪辑:陈皮 * 片头:Mondo Bongo - Joe Strummer & The Mescaleros * 片尾:Spacemen 3 - Set Me Free (Reprise) 在小宇宙查看该单集文稿 [https://oia.xiaoyuzhoufm.com/player/6a8ed6e7ef65145dfcc5d249?openTranscript = true & utm_source = rss & as = cHQ9MTIyNjE5MjQ3JmN0PXJzcyZtdD04 & autoOpen = false]

Highlights

本期节目聚焦个人与应用公司如何进入模型训练领域,分享从数据工程转向 AI 研究的实践经验,并进一步讨论主权 AI、应用公司的角色变化与 Local AI 的发展前景。
00:20
个人开发者也能登顶模型榜单
01:33
AI 学习不设学历门槛
05:32
模型训练的门槛远低于想象
08:22
真正的难点在于数据质量
13:27
训练难点在数据处理而非算力
15:34
蒸馏效果需要反复训练验证
19:15
Benchmark 只是考试,目标是满足真实需求
20:03
真正昂贵的是模型落地
22:10
更多人参与,社区才能持续壮大
23:44
模型训练将从大公司走向更多企业
25:25
模型训练将成为可购买的完整服务
31:17
数据质量决定模型表现
32:07
应用公司将逐步成为新的 AI 实验室
33:39
真实使用数据才是模型进化的燃料
35:31
应用公司应尽早掌握后训练能力
38:52
真正的竞争力来自数据与模型能力
42:31
模型选择首先要服从真实需求

Chapters

从数据工程师到 AI 研究者
00:00
Part 1 训模型的实操经验
非 PhD / AI Lab 背景,凭什么能训出榜一模型?
01:33
训这两个模型的成本具体有多少?
03:23
个人训模型的完整 Pipeline 和避坑经验
06:08
最大的难点和卡点:数据
11:33
数据难以提前预估效果的原因:Capacity Gap
15:34
简评蒸馏的各种路线,以及到底什么叫「聪明地蒸」?
17:18
自己训、自己用,性价比真的更高吗?
20:01
坑最少的开源模型是?
22:10
Part 2 对主权 AI 的思考
自己训模型会成为应用公司的标配吗?
23:44
训模型可能会成为一件商品化的事情?
25:25
应用公司反而可能会成为 Neo Lab?
27:01
AI Lab 和应用公司之间的分工可能会有什么变化?
32:07
现在 AI Lab 砸钱买数据,就有点像移动互联网早期字节砸钱买用户
33:39
如果主权 AI 真的兴起,AI Lab 的价值会有什么变化?
35:31
Local AI 会不会成为 PC 级别的机会?
36:59
用户最终会不会还是希望用上 SOTA 级别的智能,而不是 Local AI?
40:17

Transcript

曲凯: 我们今天很开心请到了雨昕,因为雨昕之前一段时间,最有名的一件事情,就是她自己做了一个,基于 Jama 跟 Fable 微调的一个模型,然后当时是在 Hugging Face 里面。排名开源模型的榜一,超过了众多大家,耳熟能详的这些模型。然后雨昕来简单介绍一下。 逯雨鑫: 我叫逯雨鑫。然后我之前呢,是做过一阵 Data Engineer,然后后来呢。因为也对 AI 方向比较感兴趣,读了一个关于 AI 方向的研,目前也是在一家 AI lab 做一名 AI researcher。 曲凯: 对,但我的了解就...
小宇宙
Open in 小宇宙