scripod.com

117. 开源一段论文探索之旅:模型范式、Infra 和数据、语言、多模态的完整变迁史

今天的嘉宾是谢青池,他是美团光年之外的产品负责人。
一个月前,青池找到我,说他用了一年多的时间一篇一篇地啃完了 200 多篇 AI 论文,从开始全然不得要领,到后来逐渐地入门 ——而他希望将他的论文探索之旅开源给大家。
就这样,我们有了今天这集特别的节目。
他从 200 多篇论文中精选了 36 篇经典,4 小时讲解,带你穿越 AI 变迁史。
他说,读论文是 “给你打开一扇门”,让你能直接 “与这个世界最聪明的头脑对话”。
2025 年,期待我们和 AI 共同进步!
01:30 探索的缘起
07:25 怎么读论文?(用 AI 学 AI)
10:20 辅助小工具和路书
论文讲解的主干:
19:35 Part 1:模型的范式变迁
故事要从 1999 年的第一颗 GPU 开始讲起
Brook: 用 GPU 进行计算 (2004.08)
AlexNet: 深度学习的开端(2012.10)
对序列建模:seq2seq 和 Attention 的引入(2014.09)
蒸馏:模型能被学习吗?(2015.03)
ResNet: 比深更深(2015.12)
Transformer 来了!拉开一个时代的序幕(2017.06)
AlphaGo Zero: 强化学习的突破(2017.10)
现代 MoE 的开端(2017.01)
CoT: Prompt Engineering 的奠基之作(2022.01)
LoRA: 那个我们每天都在用的东西(2021.06)
ReAct: Agent 从理论到落地(2022.10)
The Bitter Lesson: 过去 70 年的教训(2018.08)
01:52:58 Part 2:Infra 与数据的变迁
ZeRO: 大规模的 GPU 并行计算(2019.10)
Scaling Law & Chinchilla: 上帝的指挥棒(2020.01 2022.03)
LAION - 5B: 开源社区的英雄主义(2022.10)
The RefinedWeb: 互联网的数据也很够用(2023.06)
MegaScale: 万卡 GPU 集群的训练(2024.02)
02:21:29 Part 3:语言模型的发展
Word2Vec: 用机器学习将单词向量化(2013.01)
Google Translate: 神经网络的大规模线上部署(2016.09)
GPT-1,它来了(2018.06)
BERT: 曾经的王(2018.10)
GPT-2: 是时候告别微调了(2019.02)
GPT-3: ChatGPT 来临前夜(2020.05)
InstructGPT: 给 LLM 以文明(2022.03)
Tulu 3: 后训练的开源(2024.11)
03:08:08 Part 4:多模态模型的发展
DeepVideo: 深度学习进入视频领域,Andrej 初出茅庐(2014.06)
双流网络: Karén 和学术重镇牛津登场(2014.06)
图像生成的序章: GAN 来了(2014.06)
Diffusion: 在 GAN 的阴影下,悄然成长(2015.03)
DDPM: Diffusion 重回图像舞台的中央(2020.06)
ViT: 当图像遇到 Transformer(2020.10)
CLIP: 文生图的奠基石(2021.03)
Stable Diffusion,它来了(2021.12)
DiT: 人们期待一个融合的未来(2022.12)
03:56:38 最后的聊天
架构抱住了硬件的大腿
今天技术的边界到达了哪?
给 “站在 AI 世界门外张望的人” 和 “已经在体系中工作多年的人” 的建议
【技术之美】系列:

逐句讲解 DeepSeek-R1、Kimi K1.5、OpenAI o1 技术报告 ——“最优美的算法最干净”

逐篇讲解 DeepSeek 关键 9 篇论文及创新点 ——“勇敢者的游戏”

逐篇讲解 DeepSeek、Kimi、MiniMax 注意力机制新论文 ——“硬件上的暴力美学”

逐篇讲解机器人基座模型和 VLA 经典论文 ——“人就是最智能的 VLA”

逐段讲解 Kimi K2 报告并对照 ChatGPT Agent、Qwen3-Coder 等:“系统工程的力量”

【更多信息】
50 页完整 PPT 开源地址(所有论文链接附在 PPT 上):https://w7py8ou4dk.feishu.cn/wiki/KacewdlmSiSGC9kUOKDch9gwnKf?from=from_copylink