你的优势不在模型上

September 20, 2026 共 1,669 字 阅读约 7 分钟

很多公司都开过这样一个会:有人做了一份模型供应商对比,团队选定一家,然后这个选择被写进战略材料,好像它是对未来的判断。它不是。这是一次采购决定,而且保质期很短。

能力是租来的,不是拥有的

三股力量决定了"选模型"无法成为优势的地基。

同等能力的价格持续下降。 竞争压力与架构进步,让固定质量水平的成本在过去三年大约每年下降一个数量级。今天只有靠某个特定模型才付得起的事,很快所有人都付得起。

开放权重模型在持续缩小差距。 对越来越多生产任务——分类、抽取、摘要、常规起草、检索增强问答——自己能跑的模型已经够用,而且一次性解决了按 token 计费、数据出境和供应商存续风险三个问题。前沿模型在最难的推理上仍领先,但"够用且自有"会赢下大量真实负载。

替换正在变容易,而不是更难。 各家的 SDK 形态趋同,网关与适配层成熟,整个生态默认你随时会换。供应商锁定在很大程度上是团队在架构上主动做出的选择——也可以选择不做。

公开榜单救不了这件事。榜单会饱和,头部分数被压缩成噪声,而基准污染在这个领域是有记录的已知问题。一个在通用推理集上夺冠的模型,可能在你的工单、你的合同条款或你的语言组合上输得很惨。唯一能预测你线上质量的基准,是用你自己的任务样本、你自己的正确性标准建起来的那一个。

真正会复利的东西

如果模型只是输入,资产是什么?在那些能长期保持优势的团队里,反复出现的是这五样。

一、工作流集成。 把智能嵌进记录系统——客户、订单、案件都在眼前的地方——建起来慢,竞争对手抄起来也慢。产品旁边挂个聊天窗口很容易复制;被重写的审批、分流、核保流程不容易。

二、专有的反馈数据。 修正、采纳/否决、升级原因、最终结果,都是改进的原材料。多数公司把它们直接丢掉,因为没有任何埋点在采集。这正是客服场景里能测出真实提升的飞轮:同一个工具对经验最少的人帮助最大,因为系统吸收了"好答案长什么样"。

三、编码了你自己标准的评测集。 一套包含你的边界情况、语气要求和监管约束的金标准集,是真正的内部资产。它也是判断"新模型/新提示词/新管线是否比上一季度上线的版本更好"的唯一办法。

四、信任与分发。 经得起客户安全审查的数据处理、高峰期撑得住的可用性,以及清楚说明产品不会做什么。在企业销售里,这常常就是试点与合同之间的差别,而它跟你调用哪个模型毫无关系。

五、服务成本的工程能力。 把简单请求路由给小模型、难的交给前沿模型,做缓存、批处理、按任务设预算。这种纪律会复利:同样一个功能,对手每次请求成本是你的三倍,早晚要在毛利和定价之间做痛苦选择。

会失败的那种模式

失败模式高度一致,值得直说。

团队把"我们用某家的模型"当成战略。没有埋点,于是没有反馈数据积累。没有评测集,于是质量争论靠轶事和热情来裁决。试点的衡量标准是演示效果,而不是与业务结果挂钩的指标——这正是 2025 年一项被广泛报道的 MIT 企业试点研究所描述的地形:其中绝大多数没有产生可衡量的损益影响。十八个月后,公司只是变贵了一点,并且依赖着一个自己无法左右其价格与路线图的供应商。

有意识地建这个闭环

采集结果,而不是点击。 每一次模型交互都记录:输入类别、模型与版本、输出是被采纳/被修正/被升级/被丢弃,以及下游发生了什么。这是 AI 产品里回报最高的那部分管线工程。

维护一个小而活的评测集。 五十到几百个精心挑选的案例、由真实事故不断刷新,胜过几千条静态用例。把它接进发布门禁,回归就无法悄悄溜进生产环境。

保留一层与模型无关的抽象。 一个薄的内部接口负责提示词、模型选择、重试与成本核算,供应商切换就从项目变成一下午的工作量。这样做的团队能吃下每一次降价和能力跃迁;不做的团队只能远远看着。

把资源投在抄不走的地方。 集成、权限、审计日志、离线行为,以及让你的产品对客户而言"正确"的领域逻辑。它们不性感,但可防守。

自己掌握路由与单位经济。 有意识地决定哪些请求值得用前沿模型,并给功能设定"每个成功结果"的成本上限。

把供应商变动当日常,而不是危机。 模型会下线、默认值会改、昨天表现良好的版本今天会开始不一样。有评测集的团队把这当作平常一天;没有的团队把它当作事故。

一个诚实的结论

模型能力正在变得像电力:必不可少,但本身不构成差异化。最终胜出的公司,不会是某个季度里选对了供应商的那家,而是把智能变成了客户离不开的工作流、把这个流程产生的反馈收了下来、并建立起评测纪律从而不必请求任何人许可就能持续改进的那家。

这个闭环是你的。模型是按 token 租的,明年还会更便宜。

相关阅读:AI 优先是一种工程纪律,不是一句口号AI 优先的真实成本