AI 優先的真實成本
一家公司上線的第一個 AI 功能通常很便宜:一組 API key、一個原型、一場在高階主管會議上反應不錯的示範。錢是在第二年花掉的——而且很少是任何人規劃過的那筆錢。
帳單不是推論費用
模型呼叫是最顯眼的成本,也正逐漸變成最不重要的一項。過去三年,同等能力水準的價格大約每年下降一個數量級,競爭壓力還持續把它往下壓。但與此同時,圍繞模型呼叫的那一圈成本卻是持平或上升的:
- 評測與資料基礎建設。 為每一次互動留下紀錄並標註結果、維護黃金標準集、建立迴歸檢查關卡。少了這些,你分不出「變好了」和「雜訊」——而代價會以已經上線的迴歸問題來支付。
- 人工審閱與升級處理。 只要答錯的代價很高,就必須有人檢查輸出。這份人力不是免費的,也不會因為模型變強就縮小;它只是轉移位置。
- 模型更迭帶來的維護。 供應商會淘汰模型版本、更改預設值、停用參數。每一次這樣的事件都會觸發重新測試、調整提示詞,有時還要重新驗證整個功能。
- 合規與安全審查。 資料存放位置、保存期限、子處理者清單、DPA,以及現在客戶和應用程式商店針對 AI 提出的專項問題。這類工作對每個功能只做一次,但會隨供應商和司法管轄區反覆出現。
- 機率性軟體的客服支援。 使用者回報的問題很難重現,因為每次的答案都不一樣。客服工具和教戰手冊必須為此重寫。
- 失敗成本。 一個憑空編造的價格、一份合約審閱裡的錯誤摘要、一次被客戶看見的不當輸出。這些可能永遠不會出現在成本模型裡,卻是好幾個 AI 功能被悄悄下線的原因。
這些項目沒有一個會出現在「每百萬 token 多少錢」的比較表裡,這正是它們容易被忽略的原因。
證據對報酬怎麼說
報酬的分布並不平均。在同一個市場裡,兩種證據同時存在。
一邊是受控測量所顯示、集中在狹窄且高頻工作上的真實提升:GitHub 在 2023 年的隨機實驗發現,使用 AI 助理的開發者完成同一項任務的速度快 55.8%(arXiv:2302.06590);一項針對客服工具的研究則發現,每小時解決的問題數平均提高約 14%,對經驗最少的工作人員更提高約 34%(Brynjolfsson、Li 與 Raymond,NBER 工作論文 31161)。
另一邊則是整體組合層面的結果並不理想。2025 年一項針對企業生成式 AI 試辦的 MIT 研究指出,其中絕大多數沒有產生可衡量的損益影響;2024 年 S&P Global 的一項調查也發現,相當比例的公司已經放棄了大部分 AI 計畫。這兩項發現都應該被解讀為對一個混亂現實的近似描述,而不是精確測量——但它們指向同一個方向。
要調和這兩者並不複雜。收益出現在工作流程有可衡量的指標、有足以產生影響的量體,以及有人能快速核對的產出時。虧損則集中在指標從未定義、量體太小,或是因為做得到就去做、而不是因為有人對結果負責的地方。
決定成敗的那道算式
動手之前,先把三個數字寫下來:
- 有模型之後的單一任務成本,包含重試、審閱人力與分攤後的維護費用。
- 今天的單一任務成本,全部算進去——薪資、工具、錯誤修正。
- 出錯的代價,以及人工審閱環節能否把它框住。
當第一個數字在計入審閱成本之後仍明顯低於第二個數字、第三個數字被一套你真的在運作的流程框住,而且量體大到差額能夠複利累積時,這個 AI 功能才站得住腳。如果第三個數字沒有上限——例如一個可能讓人受傷、違反法規、或毀掉一段關係的決定——那麼審閱環節就不是選項,必須從一開始就計入成本。
由此得出兩個結論。第一,最好的 AI 專案有些其實很小:它們取代的是一件狹窄、重複、高頻的任務。第二,有些功能就應該被拒絕。這不是反 AI 的立場,而是預算本來就該做的事。
什麼情況下 AI 就是不對的工具
- 確定性邏輯。 稅務計算、資格規則、庫存算術。規則更便宜、更快、可稽核、也更穩定。加上一個模型只會讓它變差,而不是變得更現代。
- 低量體。 如果一項任務一個月只跑五十次,評測集、審閱流程和維護負責人的固定成本永遠收不回來。
- 輸入本身是壞的。 如果底層資料不完整、流程沒有定義,模型只會大規模產出自信的胡說八道。先把資料修好;否則模型沒有東西可用。
- 出錯成本無上限又沒有審閱。 如果每個輸出終究都必須由人核准,那就誠實問一句:模型到底省下了什麼,還是只是把工作搬到別的地方。
誠實地編列預算
三個習慣,把真正拿到價值的團隊和只收到帳單的團隊區分開來。
動手前先設上限。 每個成功任務的成本上限,加上一個量體假設。如果在這個量體下達不到上限,就不上線——不管示範有多漂亮。
追蹤每個成功結果的成本,而不是每次呼叫的成本。 一個便宜但三分之一機率會失敗的模型其實很貴。只用能力強的模型處理最難的 20% 案例、其餘交給小模型,通常是最省錢的架構。
事先寫下停損條件。 「如果到 Y 日,品質在我們的評測集上仍達不到 X,我們就停止。」幾乎每一個變成永久成本中心的 AI 計畫,起點都是一場沒有人有權喊停的試辦。
價格會持續下跌,這有幫助——但更便宜的推論並不會降低審閱人力、維護成本,或一個錯誤答案的代價。AI 優先不是「到處都用 AI」的決定,而是一種紀律:找出數字真正成立的地方,並在不成立時有膽子說出來。
相關閱讀:AI 優先是一種紀律,不是一句口號。