E255|模型越来越强,为什么用户没感觉?再访阿里国际站总裁张阔
硅谷101
15 HOURS AGO
E255|模型越来越强,为什么用户没感觉?再访阿里国际站总裁张阔
E255|模型越来越强,为什么用户没感觉?再访阿里国际站总裁张阔

硅谷101
15 HOURS AGO
Shownote
Shownote
模型在榜单上越来越强,为什么真正把工作交给 AI,还是需要人反复解释、检查和兜底? 半年前,我们与阿里国际站总裁张阔聊了 Accio Work,以及 Agent 如何参与采购和日常经营。半年后,我们再次请到他,聊聊这半年来商家使用 Accio Work 的真实案例,试图回答这个问题:模型能力的提升,究竟有多少变成了商家工作里的进步? 张阔分享,很多模型的通用评测成绩已经接近满分,但团队在真实经营中,并没有感受到同样幅度的提升。为此,他们从实际业务中整理了 107 个任务,包括比较供应商报价、识别钓鱼邮件、预订船期和处理交易...
Highlights
Highlights
模型榜单不断刷新,为什么商家把工作交给 AI,仍然需要反复解释、检查和兜底?本期张阔从 Accio Work 的真实案例、107 个商业任务评测和商家的经营选择出发,拆解 Agent 从 “会回答” 走向 “能交付” 还缺少什么。
Chapters
Chapters
榜单成绩与真实经营的落差
00:00从写代码到做生意,Agent 还差什么?
AI 同事市场:编程之外,专业工作走到了哪一步?
01:18商业任务为什么比编程更难?
02:38从采购搜索到日常经营,Accio Work 的任务边界如何扩展
03:48商家案例:植物监测产品,从创意走到设计、供应链和销售
06:12找工厂、比报价、拿样品:采购流程里,人和 AI 如何协作
07:47通用模型越来越强,垂直产品还有什么优势?
中美 Agent 生态的差异:垂直 SaaS 与平台工具
10:13AI 会替代 SaaS 吗?
11:30独立站与平台电商:不同市场如何影响产品设计
14:11Agent 公式:模型 × 工程框架 × 上下文
15:16模型与工程联合优化,不能只等模型升级
17:46榜单接近满分,真实工作为什么还会失败?
107 个真实任务:无人干预条件下,最前沿模型通过率约 61%
20:29报价、钓鱼邮件、订船和纠纷:怎样才算真正完成任务?
24:32新版本也可能退步,评测必须持续做
26:33多平台经营:有流水,不代表有利润
28:55产品品味、市场判断与预算分配:老板仍要做的选择
32:39最贵的模型,不一定是最好的选择
多模型路由:如何为不同任务匹配能力与成本?
33:44多个 Agent 建议冲突,商家该听谁的?
38:05上云、定时任务、事件响应与长期经营,是不同的能力
40:35CoCreate 现场:商家对 Agent 有哪些期待?
43:05小企业如何借助 AI,把生意做得更大
44:43Transcript
Transcript
Yiwen: 大家好, 欢迎回到硅谷 101, 我是 Yiwen。之前我们聊到了大模型的训练数据和榜单, 提到每次新模型发布各种榜单上的成绩都在刷新, 但这种进步对于我们用户来说很多时候并没有变成工作中的进步。以电商为例,从一个产品创意到把它做出来,卖到全世界。中间要研究市场,找工厂,比较报价,安排物流,还要在不同平台上开店,发布商品。最后算清楚这笔生意到底赚不赚钱。这些工作 AI 现在能接手多少,又会在哪一步卡住呢?半年前我们请到了阿里国际站总裁张阔,聊了他们刚发布的 Accio Work。半年过去,Ag...