E255|模型越来越强,为什么用户没感觉?再访阿里国际站总裁张阔
硅谷101
16 HOURS AGO
E255|模型越来越强,为什么用户没感觉?再访阿里国际站总裁张阔
E255|模型越来越强,为什么用户没感觉?再访阿里国际站总裁张阔

硅谷101
16 HOURS AGO
模型榜单不断刷新,为什么商家把工作交给 AI,仍然需要反复解释、检查和兜底?本期张阔从 Accio Work 的真实案例、107 个商业任务评测和商家的经营选择出发,拆解 Agent 从 “会回答” 走向 “能交付” 还缺少什么。
节目围绕模型能力与真实商业结果之间的落差展开。张阔介绍 Accio Work 如何从 AI 搜索和采购,扩展到产品设计、供应链、多平台经营与企业日常管理;同时指出,商业任务比编程更难,因为数据、流程和评价标准更复杂,结果验证周期也更长。团队以 107 个真实任务测试模型,最前沿模型在无人干预下的通过率约为 61%,说明通用榜单高分不能直接代表电商经营能力。要让 Agent 真正可用,除了模型,还需要工程框架、工具、记忆、授权和行业上下文,并通过多模型路由控制成本。AI 可以接手重复执行、数据整合和风险预警,但产品品味、市场判断、预算分配以及关键采购决策仍应由人负责。
00:04
00:04
榜单刷新,不等于工作进步
03:45
03:45
商业任务的反馈闭环很长
09:20
09:20
Agent 可以把数月采购流程压缩到一天
13:26
13:26
SaaS 的价值在于理解企业经营上下文
15:49
15:49
Agent 能力取决于三项要素的乘积
18:57
18:57
模型与 Harness 必须一起优化
22:11
22:11
最前沿模型在真实任务中的通过率只有约 61%
25:34
25:34
商业任务不是答对一步,而是完成全部环节
29:20
29:20
有流水,不代表有利润
32:55
32:55
把创意变成产品,第一步是判断它是否值得做
36:34
36:34
没有 Benchmark,就无法量化模型到底好不好
39:10
39:10
交易成功不等于商业成功
42:13
42:13
商业经营本身就是长程任务
44:50
44:50
不需要大公司,也能把生意做大