AI 优先的真实成本
一家公司上线的第一个 AI 功能通常很便宜:一个 API key、一个原型、一场在管理层会议上效果不错的演示。钱是在第二年花掉的——而且很少是预算里计划过的那部分。
账单不是推理费
模型调用是最显眼的成本,也正在变成最不重要的一项。过去三年,同等能力水平的单价大约每年下降一个数量级,竞争还在继续压低它。与此同时,围绕模型调用的一圈成本却稳定甚至上升:
- 评测与数据管线。 给每一次交互打上结果标签、维护金标准集、建立回归检查。没有这些,你分不清"变好了"和"噪声"——代价是线上回归。
- 人工复核与升级路径。 只要答错代价高,就必须有人检查输出。这份人力不会因为模型变强而消失,只会转移位置。
- 模型更替带来的维护。 供应商会下线旧版本、改默认值、废弃参数。每一次都要重新测试、调整提示词,有时要重新验证整个功能。
- 合规与安全审查。 数据驻留、留存、子处理者清单、DPA,以及客户和应用商店现在都会问的 AI 专项问题。这是按功能发生一次、按供应商和法域反复发生的工作。
- 概率性软件的客服。 用户反馈的问题常常难以复现,因为每次答案都不一样。客服工具与话术必须为此重写。
- 出错成本。 一个编造的价格、一份合同审阅里的错误摘要、一次被客户看到的冒犯性输出。它很难出现在成本模型里,却是不少 AI 功能被悄悄下线的真正原因。
这些项都不会出现在"每百万 token 多少钱"的对比表里,所以最容易被漏掉。
证据怎么说收益
收益分布并不均匀。同一个市场里,两类证据同时存在。
一边是受控测量出的真实提升,集中在高频、边界清晰的工作上:GitHub 在 2023 年的随机对照实验发现,使用 AI 助手的开发者完成同一任务快 55.8%(arXiv:2302.06590);一项针对客服工具的研究发现,人均每小时解决工单数平均提高约 14%,对经验最少的工作人员提高约 34%(Brynjolfsson、Li 与 Raymond,NBER 工作论文 31161)。
另一边,组合层面的结果并不好看:2025 年一项针对企业生成式 AI 试点的 MIT 研究指出,其中绝大多数没有产生可衡量的损益影响;2024 年 S&P Global 的一项调查也显示,相当比例的公司放弃了大部分 AI 项目。这两项结论应被看作对复杂现实的近似,而非精确测量——但方向一致。
两者并不矛盾。收益出现在"有可衡量指标、体量足够大、产出能被人工快速核对"的工作流里;亏损集中在"指标从未定义、体量太小、或者因为技术上做得到就去做、却没人对结果负责"的地方。
决定成败的那道算术
动手前,把三个数字写下来:
- 有了模型之后,单任务成本,含重试、复核人力与分摊的维护;
- 今天真实的单任务成本,全算进去:人力、工具、纠错;
- 出错的代价,以及人工复核能不能把它框住。
当第一个数字在计入复核成本后仍显著低于第二个、第三个数字被一套真实在运行流程框住、且体量大到差额能复利时,这个 AI 功能才站得住。如果第三个数字是无界的——可能导致人身伤害、违反监管、毁掉一段关系——那么复核环节就不是可选项,必须从第一天起计入成本。
由此有两个推论。第一,最好的 AI 项目往往很小:它替换的是一件狭窄、重复、高频的事。第二,有些功能就该被否掉。这不是反 AI 的立场,这是预算该有的样子。
什么情况下 AI 就是错的工具
- 确定性逻辑。 税务计算、资格规则、库存算术。规则更便宜、更快、可审计、稳定。加一个模型只会让它更差,而不是更现代。
- 低频。 一个月只跑五十次的任务,评测集、复核流程和维护负责人这些固定成本永远收不回来。
- 输入本身是坏的。 底层数据不全、流程没定义,模型只会规模化地输出自信的废话。先把数据修好,模型才有东西可用。
- 出错无界又必须复核。 如果每个输出终究都要人批,那就诚实问一句:模型到底省了什么,还是只是把工作挪了个位置。
诚实地做预算
三个习惯,把"拿到价值"的团队和"收到账单"的团队区分开来。
动手前先设上限。 每个成功任务的成本上限,加上一个体量假设。若在这个体量下达不到上限,就不上线——演示再漂亮也一样。
追踪"每个成功结果"的成本,而不是每次调用的成本。 一个便宜但三分之一概率失败的模型非常贵;用强模型只处理最难的那 20% 场景、其余交给小模型,通常才是当下最省的架构。
提前写下止损条件。 "若到几月几日,在我们自己的评测集上质量仍达不到 X,就停止。" 几乎所有变成长期成本中心的 AI 项目,起点都是一个没人有权叫停的试点。
价格会继续下降,这是好事——但更便宜的推理不会降低复核人力、维护成本,也不会降低一次错误答案的代价。AI 优先不是"到处都用 AI"的决定,而是一种纪律:找到数字真正成立的地方,并在不成立时有胆量说出来。
相关阅读:AI 优先是一种工程纪律,不是一句口号。