Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
獨立知識媒體
與任何項目無關聯
拆解加密世界的 AI Agent:機制、風險、經濟模型
aiagent-bible.com
最新
怎麼在採購或投資前戳破 Agent Washing:四個能實測的判斷問題  ·  Kraken 宣布全面重建 App:AI Agent 全天候盯盤,但「執行權」還是握在人類手上  ·  LangGraph 深入實作:一步步搭建一個有循環邏輯的 DeFi Agent,以及踩過的三個坑  ·  上線前怎麼測試 AI Agent:一個實用的測試框架,以及為什麼傳統單元測試不夠用  ·  為什麼你的 Agent 輸出「看起來對」卻不一定「是對的」:格式可靠性和內容真實性之間的落差  ·  新手怎麼選第一個 Agent 框架:不要問「哪個最強」,要問「哪個能讓我今天就跑起來」
risk

怎麼在採購或投資前戳破 Agent Washing:四個能實測的判斷問題

30 秒速讀
最強的模型在模擬公司環境裡也只能自主完成三成辦公任務——demo 好看,不代表 Agent 真的能自己跑。

完整解析 +
01 · 為什麼發生?

Demo 表現正常,為什麼還是可能是 Agent Washing?

因為 demo 場景幾乎都是廠商自己設計、自己反覆排練過的固定路徑,測的是「這個系統能不能把已經演練過的流程走一遍」,不是「這個系統能不能處理沒見過的情境」。卡內基美隆大學與 Salesforce 合作的 TheAgentCompany 基準測試把這個落差量化出來:在需要自主判斷、跨系統操作的模擬公司環境裡,表現最好的模型也只能自主完成約三成任務。

這代表 demo 順利跑完,只證明了「排練過的路徑可以走」,完全沒有回答「換一個情境會怎樣」這個更重要的問題。

02 · 運作原理是什麼?

跨對話記憶為什麼是判斷真假 Agent 的關鍵指標之一?

多步驟自主任務通常需要跨越多次互動——今天做了一半的規劃,明天可能要根據新資訊調整,這需要系統記得之前討論過什麼、決定過什麼。如果每次互動都是從零開始,代表系統本質上是無狀態的問答工具,即使外殼包裝成「代理人」的樣子,也無法真正持續執行跨時間的任務。

測試方式很直接:結束一次對話後重新開始,直接問「我們上次談到哪裡」。有記憶的系統會給出具體內容;無狀態工具通常會露出馬腳,要嘛完全答不出來,要嘛給出泛泛而談的通用回應。

03 · 如何應用

Gartner 提到的 40% 專案取消,跟 Agent Washing 有什麼直接關係?

Gartner 預測到 2027 年底前,超過四成的 agentic AI 專案將因成本超支、商業價值不明確等原因遭到取消。這個數字之所以跟 Agent Washing 直接相關,是因為許多專案在採購階段就沒有真的驗證過「這是不是一個能自主運作的系統」——採購方看的是 demo 和行銷語言,等到實際部署、發現系統每一步都需要人工核可,才意識到當初買到的其實是包裝過的自動化腳本,這時專案的成本結構早已無法回本,取消成了唯一選項。

這也是為什麼把「能不能處理沒見過的情境」這類測試題寫進採購驗收條款,比只看 demo 更重要——它把驗證的時間點提前到花錢之前,而不是部署之後才發現落差。

04 · 我該怎麼做?

如果我已經簽約用了一套系統,事後發現疑似 Agent Washing,該怎麼辦?

先做前面提到的四項測試(陌生情境處理、跨對話記憶、廠商是否宣稱完全自主、跟聊天機器人的能力差異),把結果具體記錄下來,這是後續無論是要求廠商改善還是重新談判合約條件的證據基礎。如果合約裡原本就寫了具體的驗收條件(例如「須能自主完成 N 個步驟」),疑似落差可以直接對照條款主張;如果當初只驗收了 demo 表現,這種情況通常較難單靠合約主張,但至少能作為續約或加購時的談判籌碼。

更根本的處理方式,是把這次的落差記錄成內部的採購檢查清單,往後任何新系統採購都先跑一次四項測試再簽約,把驗證時間點徹底移到花錢之前。

完整內容 +

當每份募資簡報都寫著「autonomous」「self-directed」「AI 員工」,這些詞已經幾乎不再能告訴你任何事。Agent Washing 描述的正是這種現象:把聊天機器人或規則式自動化包裝成自主代理人對外銷售,而實際的自主推理能力並不存在。問題是,光靠聽廠商說「我們是真的 Agent」沒有用——需要幾個能實際測出來的判斷方式。

為什麼光看 demo 沒有用

Demo 之所以是行銷工具裡最容易誤導的環節,是因為 demo 場景通常是廠商自己設計、自己反覆排練過的固定路徑。卡內基美隆大學(Carnegie Mellon)與 Salesforce 合作開發的 TheAgentCompany 基準測試,用一個模擬公司環境(有 CTO、HR、工程師等角色,需要透過內部聊天工具、公司手冊、網站自主完成任務)測試多家主流模型的 Agent 表現,結果是表現最好的模型也只能自主完成約三成的辦公任務,多數模型的成功率遠低於三成五。這個落差凸顯的正是「demo 裡表現正常」和「面對真實情境的不確定性」之間的巨大鴻溝——demo 通常只展示前者。

四個能實際測試的問題

與其問廠商「你們是不是真的 Agent」,不如換成幾個可以要求現場測試、或用免費試用版驗證的具體問題:

第一,能不能處理沒有事先寫死的情境?把 demo 裡的輸入稍微改一下——換一個沒示範過的任務類型,或給一個帶有矛盾資訊的請求——看系統是卡住、進入迴圈,還是能合理應對。規則式自動化在遇到腳本外的輸入時,通常會直接失敗或給出不相關的回應。

第二,有沒有跨對話的記憶能力?結束一次互動後重新開始,問系統是否記得上一次談過的內容、做過的決定。如果每次互動都從零開始,這通常代表系統是無狀態的工具,而不是具備持續脈絡的代理人。

第三,廠商是否堅稱「完全自主、不需人工介入高風險決策」?這是最明顯的紅旗訊號之一。目前企業場景裡沒有真正完全自主、不需要人工監督的系統,若廠商如此宣稱,通常代表定義被刻意放寬,或對系統實際限制認知不足。

第四,這個系統能做到什麼是一個設定良好的聊天機器人做不到的?如果答案模糊或只能舉出「回答問題更準確」這類程度性差異,而非「能自主規劃多步驟任務、呼叫工具、根據結果動態調整」這類能力性差異,很可能就是把既有工具重新包裝。

盡職調查流程要放進去的檢查點

Gartner 已將 Agent Washing 列為企業採購 AI 系統時的主要盡職調查風險之一,並預測到 2027 年底前,超過四成的 agentic AI 專案將因成本超支與商業價值不明確而遭到取消,這波取消潮很大一部分源於當初採購時沒有戳破包裝。實務上,把上述四個問題寫進採購合約的驗收條款,比只聽廠商口頭承諾更有約束力——例如明確要求「系統須能在未經預先配置的新任務類型下,完成至少 N 個步驟的自主執行」,並附上驗收測試場景,而不是只驗收 demo 當天的表現。

這跟你的錢有什麼關係

如果你是採購方,被 Agent Washing 誤導的直接成本,不是「產品不好用」,而是資源配置錯誤:預期能減少人力介入的系統,實際上需要在每個關鍵步驟持續投入人力核可,团队既沒有省下時間,還多了一層「維護一個看起來聰明但其實很依賴人」的管理負擔。如果你是投資人,這個落差會直接反映在你評估的商業模式假設上——一家公司若把 Level 1、2 的自動化包裝成 Level 3、4 的自主系統,它的成本結構、護城河、與規模化路徑的估算,很可能全部建立在錯誤的能力假設上。在簽字或投錢之前,花時間跑一次上述四個測試問題,通常比讀完整份募資簡報更能反映真實狀況。

圖解
自主性分級與 Agent Washing 發生的位置自主性從需要逐步核可到完全自主是一個連續光譜,Agent Washing 指的是用高階語言描述實際落在低階的系統Autonomy Level SpectrumWhere agent washing happens: mislabeling a low level as a high oneLevel 1Step-by-stephuman approvalLevel 2Bounded taskexecutionLevel 3Multi-stepplanningLevel 4Fully autonomous+ governanceAgent Washing:marketing language jumpsTest with: novel input · cross-session memory · vendor autonomy claims · vs. chatbot capabilityAI Agent Bible · aiagent-bible.com
歡迎截圖分享,轉載請註明來源
提問
請至少輸入 10 個字
相關文章
鏈上 Agent 的 Prompt Injection 防禦:為什麼「叫模型不要相信外部指令」是最沒用的防禦,以及真正有效的分層架構
risk · 07/09
AI Agent 的幻覺在 DeFi 裡有多危險:四種來源、真實案例,以及防禦設計
risk · 06/29
當 DeFi 協議跑路,你的 Agent 在做什麼:Rug Pull 對自動化策略的四種衝擊,以及 Agent 特有的防禦設計
risk · 06/27
Onchain Agent 的最壞情況設計:五個你必須預先防禦的場景,以及縱深防禦架構的實作方法
risk · 06/23