scripod.com

E255|模型越来越强,为什么用户没感觉?再访阿里国际站总裁张阔

硅谷101

15 HOURS AGO
硅谷101

硅谷101

15 HOURS AGO

Shownote

模型在榜单上越来越强,为什么真正把工作交给 AI,还是需要人反复解释、检查和兜底? 半年前,我们与阿里国际站总裁张阔聊了 Accio Work,以及 Agent 如何参与采购和日常经营。半年后,我们再次请到他,聊聊这半年来商家使用 Accio Work 的真实案例,试图回答这个问题:模型能力的提升,究竟有多少变成了商家工作里的进步? 张阔分享,很多模型的通用评测成绩已经接近满分,但团队在真实经营中,并没有感受到同样幅度的提升。为此,他们从实际业务中整理了 107 个任务,包括比较供应商报价、识别钓鱼邮件、预订船期和处理交易...

Highlights

模型榜单不断刷新,为什么商家把工作交给 AI,仍然需要反复解释、检查和兜底?本期张阔从 Accio Work 的真实案例、107 个商业任务评测和商家的经营选择出发,拆解 Agent 从 “会回答” 走向 “能交付” 还缺少什么。
00:04
榜单刷新,不等于工作进步
03:45
商业任务的反馈闭环很长
09:20
Agent 可以把数月采购流程压缩到一天
13:26
SaaS 的价值在于理解企业经营上下文
15:49
Agent 能力取决于三项要素的乘积
18:57
模型与 Harness 必须一起优化
22:11
最前沿模型在真实任务中的通过率只有约 61%
25:34
商业任务不是答对一步,而是完成全部环节
29:20
有流水,不代表有利润
32:55
把创意变成产品,第一步是判断它是否值得做
36:34
没有 Benchmark,就无法量化模型到底好不好
39:10
交易成功不等于商业成功
42:13
商业经营本身就是长程任务
44:50
不需要大公司,也能把生意做大

Chapters

榜单成绩与真实经营的落差
00:00
从写代码到做生意,Agent 还差什么?
AI 同事市场:编程之外,专业工作走到了哪一步?
01:18
商业任务为什么比编程更难?
02:38
从采购搜索到日常经营,Accio Work 的任务边界如何扩展
03:48
商家案例:植物监测产品,从创意走到设计、供应链和销售
06:12
找工厂、比报价、拿样品:采购流程里,人和 AI 如何协作
07:47
通用模型越来越强,垂直产品还有什么优势?
中美 Agent 生态的差异:垂直 SaaS 与平台工具
10:13
AI 会替代 SaaS 吗?
11:30
独立站与平台电商:不同市场如何影响产品设计
14:11
Agent 公式:模型 × 工程框架 × 上下文
15:16
模型与工程联合优化,不能只等模型升级
17:46
榜单接近满分,真实工作为什么还会失败?
107 个真实任务:无人干预条件下,最前沿模型通过率约 61%
20:29
报价、钓鱼邮件、订船和纠纷:怎样才算真正完成任务?
24:32
新版本也可能退步,评测必须持续做
26:33
多平台经营:有流水,不代表有利润
28:55
产品品味、市场判断与预算分配:老板仍要做的选择
32:39
最贵的模型,不一定是最好的选择
多模型路由:如何为不同任务匹配能力与成本?
33:44
多个 Agent 建议冲突,商家该听谁的?
38:05
上云、定时任务、事件响应与长期经营,是不同的能力
40:35
CoCreate 现场:商家对 Agent 有哪些期待?
43:05
小企业如何借助 AI,把生意做得更大
44:43

Transcript

Yiwen: 大家好, 欢迎回到硅谷 101, 我是 Yiwen。之前我们聊到了大模型的训练数据和榜单, 提到每次新模型发布各种榜单上的成绩都在刷新, 但这种进步对于我们用户来说很多时候并没有变成工作中的进步。以电商为例,从一个产品创意到把它做出来,卖到全世界。中间要研究市场,找工厂,比较报价,安排物流,还要在不同平台上开店,发布商品。最后算清楚这笔生意到底赚不赚钱。这些工作 AI 现在能接手多少,又会在哪一步卡住呢?半年前我们请到了阿里国际站总裁张阔,聊了他们刚发布的 Accio Work。半年过去,Ag...