問題所在
企業已在生成式 AI 上投入 300 億至 400 億美元,其中約 95% 的 AI 試點未能對損益表產生可衡量的影響。這是麻省理工學院(MIT)NANDA 計畫 2025 年研究《The GenAI Divide》直截了當的發現。錢已經花掉了,而大多數組織卻拿不出任何成果。
失敗漏斗非常陡峭。在探索生成式 AI 工具的 80% 組織中,只有 20% 進入試點階段,僅有微乎其微的 5% 真正達到具可衡量業務成效的全面生產階段;其餘則陷入研究者所稱的「試點煉獄」——永無止境的概念驗證循環,始終無法晉升到真正的實際工作。
您的團隊早已心知肚明。超過 90% 的員工私下使用個人 ChatGPT、Claude 或 Gemini 帳號處理工作,因為公司官方的 AI 工具太過僵化。這種影子 AI 經濟提升了個人生產力,卻沒有產生任何結構化資料,無法反映企業層級的財務影響。您的員工已經用鍵盤投了票,而判決很清楚:您買的工具不管用。
這不是技術問題。MIT 研究人員將其定位為一種「學習落差」——對 AI 在生產環境中能做什麼、不能做什麼的根本誤解。
這對您的業務為何重要
財務曝險巨大,而且還在惡化。麥肯錫 2025 年全球調查發現,88% 的組織表示至少在一項業務職能中使用 AI。但只有 39% 能將任何程度的全企業 EBIT 影響歸因於這些舉措,僅 6% 的組織看到顯著的 EBIT 影響(定義為超過總 EBIT 的 5%)。
領先者與落後者之間的差距正在擴大。這對您的業務意味著什麼:
- 資本浪費。 如果您的組織與平均值相去不遠,很可能正把錢投入永遠無法進入生產環境的 AI 實驗。這些支出直接衝擊損益表,卻沒有任何相抵的營收。
- 隱藏成本飆升。 Token 定價——即執行 AI 模型的每字成本——差異極大。就相同工作負載而言,效率不彰的模型成本可能是高效率模型的 4.5 倍。對一家每天處理 100,000 筆詢問的企業而言,這個差距可能使年度成本從 36,500 美元攀升至超過 164,000 美元。
- 合規曝險。 當 90% 的員工使用未經授權的 AI 工具時,您既沒有稽核軌跡,也沒有資料治理,更無從證明符合法規要求。您的法務長理應高度警惕。
- 競爭風險。 真正達到生產階段的那 5% 企業正在拉開距離。遵循經過驗證的 AI 導入原則的中型市場企業,已在 24 個月內將 EBITDA 提升 160 至 280 個基點。
您在試點煉獄中蹉跎的每一季,都是競爭對手用來擴大差距的一季。
實際底層究竟發生了什麼事
如今大多數企業 AI 工具都是「套殼」(wrapper)——在大型語言模型 API 呼叫之上疊加一層薄薄的使用者介面。這就好比在租來的車上貼上公司標誌:車開得動,但引擎不是您的,變速箱不能改,而且完全不知道引擎蓋底下發生了什麼事。
這些套殼工具通常依賴工程師所稱的「巨型提示」(mega-prompt):您的業務規則、資料和指示全部塞進單一一個龐大的請求送給 AI 模型。這會為您的組織帶來三個關鍵問題。
首先,無法驗證 AI 是否按正確順序執行了您的指示——對高度重視合規的產業而言,這是致命傷。其次,冗長的提示會快速消耗 token,使成本以難以預測和編列預算的方式膨脹。第三,用詞上的細微改動就可能產生天差地遠的結果,導致根本無法訂定穩定的服務水準協議(SLA)。
更深層的問題在於工具與任務之間的不匹配。大型語言模型的設計目的是產出有創意、多樣化的輸出,本質上具有機率性;但您的財務報告、法規申報文件和任務關鍵的客戶服務需要的是精確答案。在合規情境中,「差不多就行」的回答毫無幫助——它是法律責任。
使用者親身印證了這種挫折。在 MIT 的研究中,60% 的受訪者表示模型無法隨時間從回饋中學習;55% 表示他們必須為每一個提示耗費過多人工操作來提供上下文;40% 則表示模型一遇到邊緣案例或非標準輸入就直接失靈。AI 沒有在學習,是您的人員在不斷補救。
什麼有效(什麼無效)
我們先從失效的做法談起。
繼續砸錢在套殼工具上。 當 LLM 供應商下調 API 價格時,您的套殼供應商的毛利隨之崩盤。您是在租用智慧,而不是建構能力。這種做法沒有任何可長期防守的價值。
追逐華而不實的使用案例。 追求博取版面的行銷實驗而非高影響力營運改善的組織,始終無法推動 EBIT 指標。真正的報酬來自「不起眼」的領域,例如營收週期管理和現金收款處理。
把 AI 當成技術專案。 領先的組織遵循 10-20-70 的資源配置:10% 投入演算法,20% 投入資料與技術基礎架構,70% 投入人員、流程與文化變革的管理。如果您的 AI 計畫完全由 IT 部門主導,它很可能淪為那 95% 的一員。
以下是確實有效的做法—— 多代理人編排方法 ,這正是成功的那 5% 企業正在建構的模式。
將任務拆分給專門的代理人。 不要求單一 AI 模型包辦一切,而是指派特定角色:一個代理人處理您的查詢;另一個透過名為檢索增強生成(RAG)的技術,從您的真實原始文件中擷取資料——也就是餵給 AI 經過驗證的公司資料,而不是任憑它猜測;第三個代理人驗證合規規則;第四個則負責摘要輸出。
以確定性邏輯控制工作流程。 每個代理人都遵循既定的順序,系統清楚哪一步在前、哪一步在後,以及出錯時該怎麼辦。這使您的 AI 具備 95% 的確定性——意味著它遵守的是您的規則,而不是自己的創意本能。您只在真正能創造價值的步驟上,才動用昂貴的 AI 推理。
完整記錄以供稽核。 每個請求、每次資料擷取、每個決策點都會被記錄下來。Model Context Protocol(MCP)這類標準化協定——不妨把它想成 AI 與企業資料之間的通用連接器——能夠建立 合規團隊所需的稽核軌跡。
成果不言自明。在醫療領域,採用深度原則的 AI 導入平均投資報酬率達 451%。OSF HealthCare 利用整合至其病歷平台的 AI 虛擬助理,節省 120 萬美元並增加年度營收 120 萬美元。Inova Health System 將未請款索賠積壓削減 50%,每年節省 130 萬美元。在供應鏈方面,UPS 透過 AI 路徑規劃每年節省 4 億美元,DHL 則透過 AI 文件處理將人工文書作業減少 80%。
這些成功案例有一個共同主軸:它們沒有要求 AI 發揮創意,而是將 AI 加以工程化,使其遵循規則、存取真實資料,並證明自己的處理過程——一切都發生在 科技與軟體企業 所要求的治理邊界之內。
從零散的 AI 實驗過渡到可衡量的損益表影響,通常遵循一份 12 至 18 個月的路線圖:從識別高價值、低風險的使用案例開始,接著完成資料整備,建置與既有系統串接的多代理人原型,最後以包含漂移偵測與成本治理的全面生產部署收尾。
關鍵要點
- 根據 MIT 2025 年針對 300 億至 400 億美元企業 AI 投資的研究,95% 的企業 AI 試點未能產生可衡量的損益表影響。
- 只有 6% 的組織從 AI 中看到顯著的 EBIT 影響——領先者與落後者的差距每一季都在擴大。
- 套殼式 AI 工具缺乏稽核軌跡、成本可預測性,以及遵循合規所需確定性業務規則的能力。
- 將任務拆分為專門角色並記錄每項決策的多代理人系統,交付了經過驗證的 ROI——醫療領域達 451%,UPS 節省 4 億美元。
- 成功的因素是 70% 的人員與流程變革、20% 的基礎架構,只有 10% 是演算法——把 AI 當成純技術專案幾乎注定失敗。
總結
企業 AI 高達 95% 的失敗率並非源自糟糕的技術,而是因為把機率性模型包裹在確定性的業務問題之外,卻缺少控制它們的架構。靠 AI 取勝的組織正在建構具備稽核軌跡、專門代理人與確定性工作流程控制的多代理人系統。請問您的 AI 供應商:當系統處理涉及合規的交易並遇到邊緣案例時,它能按順序向您展示所採取的每一步、存取的每一個資料來源,以及套用的每一條規則嗎?