Demo 表現正常,為什麼還是可能是 Agent Washing?
因為 demo 場景幾乎都是廠商自己設計、自己反覆排練過的固定路徑,測的是「這個系統能不能把已經演練過的流程走一遍」,不是「這個系統能不能處理沒見過的情境」。卡內基美隆大學與 Salesforce 合作的 TheAgentCompany 基準測試把這個落差量化出來:在需要自主判斷、跨系統操作的模擬公司環境裡,表現最好的模型也只能自主完成約三成任務。
這代表 demo 順利跑完,只證明了「排練過的路徑可以走」,完全沒有回答「換一個情境會怎樣」這個更重要的問題。
跨對話記憶為什麼是判斷真假 Agent 的關鍵指標之一?
多步驟自主任務通常需要跨越多次互動——今天做了一半的規劃,明天可能要根據新資訊調整,這需要系統記得之前討論過什麼、決定過什麼。如果每次互動都是從零開始,代表系統本質上是無狀態的問答工具,即使外殼包裝成「代理人」的樣子,也無法真正持續執行跨時間的任務。
測試方式很直接:結束一次對話後重新開始,直接問「我們上次談到哪裡」。有記憶的系統會給出具體內容;無狀態工具通常會露出馬腳,要嘛完全答不出來,要嘛給出泛泛而談的通用回應。
Gartner 提到的 40% 專案取消,跟 Agent Washing 有什麼直接關係?
Gartner 預測到 2027 年底前,超過四成的 agentic AI 專案將因成本超支、商業價值不明確等原因遭到取消。這個數字之所以跟 Agent Washing 直接相關,是因為許多專案在採購階段就沒有真的驗證過「這是不是一個能自主運作的系統」——採購方看的是 demo 和行銷語言,等到實際部署、發現系統每一步都需要人工核可,才意識到當初買到的其實是包裝過的自動化腳本,這時專案的成本結構早已無法回本,取消成了唯一選項。
這也是為什麼把「能不能處理沒見過的情境」這類測試題寫進採購驗收條款,比只看 demo 更重要——它把驗證的時間點提前到花錢之前,而不是部署之後才發現落差。
如果我已經簽約用了一套系統,事後發現疑似 Agent Washing,該怎麼辦?
先做前面提到的四項測試(陌生情境處理、跨對話記憶、廠商是否宣稱完全自主、跟聊天機器人的能力差異),把結果具體記錄下來,這是後續無論是要求廠商改善還是重新談判合約條件的證據基礎。如果合約裡原本就寫了具體的驗收條件(例如「須能自主完成 N 個步驟」),疑似落差可以直接對照條款主張;如果當初只驗收了 demo 表現,這種情況通常較難單靠合約主張,但至少能作為續約或加購時的談判籌碼。
更根本的處理方式,是把這次的落差記錄成內部的採購檢查清單,往後任何新系統採購都先跑一次四項測試再簽約,把驗證時間點徹底移到花錢之前。
當每份募資簡報都寫著「autonomous」「self-directed」「AI 員工」,這些詞已經幾乎不再能告訴你任何事。Agent Washing 描述的正是這種現象:把聊天機器人或規則式自動化包裝成自主代理人對外銷售,而實際的自主推理能力並不存在。問題是,光靠聽廠商說「我們是真的 Agent」沒有用——需要幾個能實際測出來的判斷方式。
Demo 之所以是行銷工具裡最容易誤導的環節,是因為 demo 場景通常是廠商自己設計、自己反覆排練過的固定路徑。卡內基美隆大學(Carnegie Mellon)與 Salesforce 合作開發的 TheAgentCompany 基準測試,用一個模擬公司環境(有 CTO、HR、工程師等角色,需要透過內部聊天工具、公司手冊、網站自主完成任務)測試多家主流模型的 Agent 表現,結果是表現最好的模型也只能自主完成約三成的辦公任務,多數模型的成功率遠低於三成五。這個落差凸顯的正是「demo 裡表現正常」和「面對真實情境的不確定性」之間的巨大鴻溝——demo 通常只展示前者。
與其問廠商「你們是不是真的 Agent」,不如換成幾個可以要求現場測試、或用免費試用版驗證的具體問題:
第一,能不能處理沒有事先寫死的情境?把 demo 裡的輸入稍微改一下——換一個沒示範過的任務類型,或給一個帶有矛盾資訊的請求——看系統是卡住、進入迴圈,還是能合理應對。規則式自動化在遇到腳本外的輸入時,通常會直接失敗或給出不相關的回應。
第二,有沒有跨對話的記憶能力?結束一次互動後重新開始,問系統是否記得上一次談過的內容、做過的決定。如果每次互動都從零開始,這通常代表系統是無狀態的工具,而不是具備持續脈絡的代理人。
第三,廠商是否堅稱「完全自主、不需人工介入高風險決策」?這是最明顯的紅旗訊號之一。目前企業場景裡沒有真正完全自主、不需要人工監督的系統,若廠商如此宣稱,通常代表定義被刻意放寬,或對系統實際限制認知不足。
第四,這個系統能做到什麼是一個設定良好的聊天機器人做不到的?如果答案模糊或只能舉出「回答問題更準確」這類程度性差異,而非「能自主規劃多步驟任務、呼叫工具、根據結果動態調整」這類能力性差異,很可能就是把既有工具重新包裝。
Gartner 已將 Agent Washing 列為企業採購 AI 系統時的主要盡職調查風險之一,並預測到 2027 年底前,超過四成的 agentic AI 專案將因成本超支與商業價值不明確而遭到取消,這波取消潮很大一部分源於當初採購時沒有戳破包裝。實務上,把上述四個問題寫進採購合約的驗收條款,比只聽廠商口頭承諾更有約束力——例如明確要求「系統須能在未經預先配置的新任務類型下,完成至少 N 個步驟的自主執行」,並附上驗收測試場景,而不是只驗收 demo 當天的表現。
如果你是採購方,被 Agent Washing 誤導的直接成本,不是「產品不好用」,而是資源配置錯誤:預期能減少人力介入的系統,實際上需要在每個關鍵步驟持續投入人力核可,团队既沒有省下時間,還多了一層「維護一個看起來聰明但其實很依賴人」的管理負擔。如果你是投資人,這個落差會直接反映在你評估的商業模式假設上——一家公司若把 Level 1、2 的自動化包裝成 Level 3、4 的自主系統,它的成本結構、護城河、與規模化路徑的估算,很可能全部建立在錯誤的能力假設上。在簽字或投錢之前,花時間跑一次上述四個測試問題,通常比讀完整份募資簡報更能反映真實狀況。