先确认任务能否被说清
评估自动化不能只看模型会不会做,还要看人能否把问题隔离出来并准确描述。若同一任务连交给真人都很难讲清,换成更强模型也未必能解决交互与部署问题。
DEPTH PROFILE
Benedict Evans
独立科技分析师
Benedict Evans Newsletter
EDITOR'S SELECTION
12 条经过五问筛选的核心判断
评估自动化不能只看模型会不会做,还要看人能否把问题隔离出来并准确描述。若同一任务连交给真人都很难讲清,换成更强模型也未必能解决交互与部署问题。
新技术起初总被塞进旧流程,真正原生的产品通常出现得更晚。宽带不会自动生出 Instagram,图像生成也只有变成虚拟试穿这类具体解决方案,才可能越过短暂的新鲜感。
技术反复替代会计工作的具体步骤,但会计人数仍长期增长,因为人们不只是把旧任务做得更多,而是在做过去不存在的新工作。只统计将消失的任务,会落入劳动总量固定的误区。
客户购买咨询服务,并不只是购买最后那份 PowerPoint;放射科、法律和会计同样包含责任、关系与组织协作。若 benchmark 只测可见产物,就会把职业中真正难替代的部分漏掉。
同一种平台技术能摧毁出租车市场,却只在酒店业旁边增加一个新市场;互联网也没有改变记者的写作任务,却先摧毁了本地广告。AI 的真正冲击可能来自任务清单之外,有些行业甚至不会发生结构变化。
移动网络、TSMC 和 AWS 都是庞大且盈利的基础设施,却没有因此拥有上层所有产品。模型公司即使成为关键基础层,应用分发、行业知识与产品能力仍会让价值沿技术栈分散。
当前模型领先者频繁轮换,也没有搜索或社交网络那样的壁垒。若 scaling 持续抬高训练成本,前沿玩家会像先进半导体厂商一样减少,但大量任务仍会按 ROI 选择不同价格和能力档位。
把 AI 比作电力、移动网络或半导体,并不能证明它会沿同一路径发展。历史类比的价值,是枚举成本结构、竞争层次和价值流向等问题,再检查哪些机制可能重现。
大多数人看不见值得解决的问题,也不会把领域经验转成新的软件工作流,即使两者都具备,也未必有权改动受监管数据和核心系统。模型降低写代码的门槛,并没有同时消除发现、设计与组织授权的门槛。
给每个人一个 Copilot 没有自动产生新工作方式,逐个部署 pilot 也只是局部止痛。企业要重构流程、数据和组织,但内部通常没有齐全的复合人才,因此实施与专业服务仍是长期工程。
开发者既是工具用户也是工具构建者,代码又有海量训练数据和可重复运行的验证机制。咨询等知识工作依赖隐性知识且结果难以规模化校验,因此不能假定它们会照搬 coding 的进步曲线。
模型擅长从训练数据生成多数人可能给出的答案,但原创策略不仅缺少样本,也缺少像棋局胜负那样可扩展的验证器。模仿既有流行风格与发明 punk 或 hip hop,是两类不同的问题。
ALL INSIGHTS
按当前资料入库顺序排列
coding 已有明确的产品市场匹配,少数灵活知识工作者也会高频使用 AI,但大多数人只在一周内偶尔打开一两次。用户数量不能代表使用深度,硅谷重度用户更不能代表普通人的工作方式。
评估自动化不能只看模型会不会做,还要看人能否把问题隔离出来并准确描述。若同一任务连交给真人都很难讲清,换成更强模型也未必能解决交互与部署问题。
新技术起初总被塞进旧流程,真正原生的产品通常出现得更晚。宽带不会自动生出 Instagram,图像生成也只有变成虚拟试穿这类具体解决方案,才可能越过短暂的新鲜感。
技术反复替代会计工作的具体步骤,但会计人数仍长期增长,因为人们不只是把旧任务做得更多,而是在做过去不存在的新工作。只统计将消失的任务,会落入劳动总量固定的误区。
客户购买咨询服务,并不只是购买最后那份 PowerPoint;放射科、法律和会计同样包含责任、关系与组织协作。若 benchmark 只测可见产物,就会把职业中真正难替代的部分漏掉。
同一种平台技术能摧毁出租车市场,却只在酒店业旁边增加一个新市场;互联网也没有改变记者的写作任务,却先摧毁了本地广告。AI 的真正冲击可能来自任务清单之外,有些行业甚至不会发生结构变化。
移动网络、TSMC 和 AWS 都是庞大且盈利的基础设施,却没有因此拥有上层所有产品。模型公司即使成为关键基础层,应用分发、行业知识与产品能力仍会让价值沿技术栈分散。
当前模型领先者频繁轮换,也没有搜索或社交网络那样的壁垒。若 scaling 持续抬高训练成本,前沿玩家会像先进半导体厂商一样减少,但大量任务仍会按 ROI 选择不同价格和能力档位。
AI 推理不像过去的软件分发那样接近零边际成本。一个真正吸引十亿人的应用可能先撞上基础设施容量和账单,因此创业者很难先免费扩张到一亿用户,再慢慢寻找收入模式。
把 AI 比作电力、移动网络或半导体,并不能证明它会沿同一路径发展。历史类比的价值,是枚举成本结构、竞争层次和价值流向等问题,再检查哪些机制可能重现。
模型为何有效、能力边界在哪里都还没有可靠答案,直接争论 AGI 终局很难产生可操作信息。更有效的做法是先构建软件、观察真实用途,并接受当前大量概念和产品都会失败。
若先把 AGI 定义成能做所有人类工作的系统,再推导它会替代所有工作,结论只是在重复前提。判断模型终局必须保留可证伪条件,不能靠定义把未知能力写成必然。
大多数人看不见值得解决的问题,也不会把领域经验转成新的软件工作流,即使两者都具备,也未必有权改动受监管数据和核心系统。模型降低写代码的门槛,并没有同时消除发现、设计与组织授权的门槛。
AI 让开发更快更便宜,也让过去无法自动化的任务进入软件范围,因此软件总量更可能增加。与此同时,功能会在 Excel、核心系统、自建工具和独立应用之间持续捆绑与拆分。
拥有模型、资本或潜在网络效应,并不会自动产出清晰好用的产品。过去的平台赢家也要在产品市场匹配出现前做对团队、界面与分发,技术结构只有经过执行才会变成真实优势。
外行看到广告和咨询,往往先想到自动生成创意或 PowerPoint;从业者却优先用 AI 清理广告投放后台、加速客户研究。真正高价值的用例来自行业流程里的隐蔽瓶颈,而不是最显眼的交付物。
给每个人一个 Copilot 没有自动产生新工作方式,逐个部署 pilot 也只是局部止痛。企业要重构流程、数据和组织,但内部通常没有齐全的复合人才,因此实施与专业服务仍是长期工程。
AI 是让欺诈检测、后台流程和新产品成为可能的使能技术,不只是一台生成文字与图片的机器。许多价值最终会藏在更好的服务里,既不显示 ChatGPT,也不主动标注 AI。
开发者既是工具用户也是工具构建者,代码又有海量训练数据和可重复运行的验证机制。咨询等知识工作依赖隐性知识且结果难以规模化校验,因此不能假定它们会照搬 coding 的进步曲线。
模型擅长从训练数据生成多数人可能给出的答案,但原创策略不仅缺少样本,也缺少像棋局胜负那样可扩展的验证器。模仿既有流行风格与发明 punk 或 hip hop,是两类不同的问题。
EVIDENCE
观点所依赖的证据层
2026-07-16 · 74 分钟 · EN