AI 优先是一种工程纪律,不是一句口号
从 ChatGPT 上线到最近一轮财报电话会之间,“AI 优先”从一个技术判断变成了一个装扮。卖洗衣机的、做保险的、提供会计服务的公司,都开始自称 AI 优先——尽管生产环境里往往一个模型都没有。这个词几乎免费,它背后的运营纪律却并非如此。这篇文章谈的就是纪律:AI 优先应该意味着什么、为什么它对普通公司同样重要,以及真正把它做好的公司看起来是什么样。
“AI 优先”应该意味着什么
AI 优先的公司,不是一家频繁谈论 AI 的公司,而是一家把智能当作一种设计材料的公司:在产品和流程决策的最开始就考虑它,用与其它任何工程选择同等的严格标准去评估它,并且只在有实证能证明它有用的时候使用它。
真正的 AI 优先实践与装饰性表态之间,有三点区别:
- 从工作出发,而不是从模型出发。 分析的单位是一件要完成的工作——一张客服工单、一次销售跟进、一份核保审查——问题在于模型能否改变它的成本、速度或质量。
- 有证据闭环。 关于 AI 价值的说法要用基线数据检验,而不是用演示来证明。
- 人始终对结果负责。 模型负责建议、起草和自动化;人负责决策、批准,并为结果担责。
以上任何一条都不要求你卖一个 AI 产品。它们要求的是:把 AI 当作一种有特殊属性的普通基础设施来管理。
赌注不再是假设
如果只读营销材料,很容易把 AI 归为炒作。但来自普通工作的证据没那么容易被打发。
- 普及速度超过以往任何技术。 ChatGPT 在 2023 年上线后约两个月内达到约 1 亿用户,是有记录以来消费者采纳最快的应用。用户数本身不等于商业价值,但它重置了客户对软件能力的预期。
- 软件开发出现了可测的变化。 GitHub 在 2023 年的一项随机对照实验中,使用 GitHub Copilot 的开发者完成同一任务比对照组快 55.8%(arXiv:2302.06590)。编程是第一个用受控实验、而非口号来度量生产力提升的知识工作类别。
- 客户服务出现了可测的变化。 2023 年针对客服工具的一项研究(Brynjolfsson、Li 与 Raymond,NBER 工作论文 31161)发现,生成式 AI 助手使每小时解决的工单数平均提高约 14%——对经验最少的工作人员更是提高约 34%。关键细节在于谁获益最多:模型压缩的是学习曲线,而不只是打字时间。
- 资本跟了上来。 微软在 2024 年报告其 AI 业务年化收入超过 100 亿美元,并称这是公司历史上达到该规模最快的业务线;多家大型科技公司也为 2025 年安排了数百亿美元的 AI 相关资本开支。无论你怎么看泡沫之争,这些预算都是真实的。
这些不是科幻数字,而是在普通客服与工程工作中实测到的生产力与成本效应。对一家非 AI 公司而言,战略问题因此不再是“我们要不要做一个 AI 产品”,而是:“与那些正在重构同类工作的竞争对手相比,我们的成本曲线、响应质量和速度能不能跟上?”
为什么多数“AI 优先”会失败
失败通常不是技术性的,而是组织性的,而且模式高度相似:
- 买几个订阅,给官网加个聊天机器人,宣布胜利。其它一切照旧。
- 处处试点、处处不度量。没有基线和指标,试点只是带着截止日期的演示。
- 把选型当成战略。供应商的取舍成了全部话题,而模型本该改善的实际工作从未被重新设计。
- 没有负责人、没有预算科目。AI 工作活在某个部门都不拥有的幻灯片里,最终在 IT、产品和运营之间的缝隙中饿死。
- 害怕显得落后,于是为并未上线生产的能力邀功。
共同点是把 AI 当作一次采购,而不是对工作方式的改变。这正是“AI 剧场”——幻灯片光鲜、生产环境空空——如此普遍、又如此廉价的原因。
怎样才能把 AI 优先做好
下面不是“五步实现转型”的配方,而是一组经得起真实预算检验的运营习惯。
一、先选工作,再选模型
挑选那些高频、高成本、且充满判断力的任务——分流、起草、摘要、路由、初审。在动手前先定义指标:处理时长、单张工单成本、缺陷率、转化率。先测基线。说不出指标,就还没准备好开始;模型显然推不动这个指标,就换一个任务。
二、把模型当作可互换的零件
前沿模型进步很快,价格下降的速度比大多数公司更新规划的速度还快。据此行动:
- 把模型调用隔离在一个小的内部接口后面,让更换供应商成为一次配置改动,而不是重写。
- 用自己的任务样本做评测,而不是看那些衡量别的东西的排行榜。
- 定期重跑评测;去年的最优模型可能是今年的次选。
- 当数据合规、延迟或成本重要时,考虑小型或开源模型;前沿并不总是正确答案。
供应商锁定是一种你可以直接选择不犯的错误。
三、重构人机协作的流程,而不只是换界面
最大的收益来自改变人与模型分工的方式,而不是把表单换成聊天窗口。要明确哪些环节由模型起草、哪些环节必须由人批准;设定置信度阈值;设计升级路径。在每一步都要能指出对结果负责的人——无论出于法律、合规还是常识,模型无法担责的后果必须有人来承担。
四、投资于数据与评测的基础设施
模型进步很快,但你对“它是否在为你进步”的判断能力必须更快。这意味着记录每一次生产调用并打上结果标签、从真实使用中构建金标准集、在有条件的地方收集用户反馈,并保留一支小团队专门负责评测。多数失败的 AI 项目都倒在这里:它们能演示,但不能度量。
五、按概率性失败来设计
模型是一位手脚麻利、自信满满、偶尔出错的年轻同事。据此构建:
- 尽量用模式校验输出;
- 加回退与重试,绝不让一次模型故障拖垮整个流程;
- 像盯错误率一样盯单次调用的成本与延迟;
- 设定预算与告警;模型开销的累积速度超出预期。
把错误答案当作一类需要预防的故障,而不是一个等到出错才发现的意外。
六、为它建立组织
给 AI 工作一个真正的负责人和一份真实预算。核心团队保持精简,嵌入到实际业务发生的部门中去。提升全公司的 AI 素养底线——包括高管,他们至少要能区分评测与演示。按业务指标每季度复盘,并在对外汇报中如实说明哪些没有奏效。真正靠 AI 赢得信任的公司,报失败和报成功一样平常。
做得好是什么样
从外部看,一家 AI 优先的公司几乎有点无聊。AI 不在新闻稿里,而在工作流里:客服响应时间下降,而质量投诉没有上升;开发者把更多时间花在设计上,而不是样板代码上;核保、销售资质审核或文档审阅的单元成本曲线逐季下行,背后是一份外人都可以审计的评测报告。
最终赢下 AI 的,不会是口号最好听的公司,而是反馈闭环最好的公司:清晰的问题、测过的基线、有真人负责的人机协作,以及在第一次尝试不及预期时继续迭代的纪律。AI 优先不是对你公司野心的描述,而是对你公司操作系统的描述——而这是一句需要用证据来挣得的断言。