公司規定員工每天用 AI、各部門回報使用次數,年終簡報也多了幾十個 AI 案例,工作卻沒有少,返工和錯誤照樣留給人處理。這樣的 AI 轉型更像一場表演。AI 有沒有用對,看的是同一件工作是否少花時間、少出錯,以及員工能不能在 AI 越界前攔下問題。
8 月 7 日,36氪刊出〈九成企業做的「AI轉型」,不過是場表演〉,列出幾種常見情況:員工用 AI 把報告寫長,主管再用 AI 縮短;公司統計使用人次與生成數量,卻沒有計算返工、錯誤和客戶結果。「九成」是作者批評現象的說法,文章沒有提出調查樣本。Deloitte 今年公布的企業調查則顯示,84% 的受訪企業尚未依 AI 能力重新設計職務,只有 30% 提供鼓勵員工運用 AI 的績效誘因。
| 判斷項目 | 有用對AI的工作結果 | 容易變成表演的做法 |
| 工時 | 同一任務花費的時間下降 | 只計算每天使用幾次 |
| 品質 | 錯誤、客訴與返工減少 | 只看生成多少文字或圖片 |
| 人工判斷 | 知道何時查核、停止或上報 | 把 AI 產出直接當成完成品 |
| 工作流程 | 刪除重複步驟並指定負責人 | 原流程不變,再加一份 AI 報告 |
公司人人用AI,工作為何沒有變少
一名員工原本花兩小時整理會議紀錄,改用 AI 後,初稿十分鐘就完成。如果他接著花兩小時核對錯誤、補回漏掉的決議,再另外填一張「AI 使用成果表」,公司得到的是更多文件,工時沒有下降。
36氪文章描述的「表演式 AI」大多有相同特徵:公司先買平台、開課、要求各部門提案例,再用帳號啟用數、提示詞數量或生成件數證明轉型。這些數字只能說明員工打開過工具,無法回答報價有沒有算錯、客服有沒有少轉單、財務對帳有沒有減少人工查找。
有些工作會因 AI 增加新的負擔。員工要改寫不可靠的答案、查找被捏造的來源,還要在交件期限前替系統收尾。公司若沒有記錄這段時間,報表裡只看得到生成速度,看不到人類清理錯誤的成本。
只看產量,考績可能獎錯人
Harvard Business Review 7 月提出「人類績效悖論」:把大量工作交給 AI 的員工,容易在傳統考核裡顯得又快又多;願意停下來核對資料、挑戰答案並修正錯誤的人,產量較少,卻可能替公司避免更大的損失。
這個差異會直接影響考績。客服人員一天關閉一百張工單,看起來勝過只處理七十張的同事;如果前者讓退款條件、客戶身分或承諾內容出錯,件數就掩蓋了返工。後者發現 AI 引用錯誤規定、把案件轉給主管,這次上報應列入工作成果。
HBR 建議分開衡量員工、AI 系統與兩者合作後的結果。員工要看查核、修正與上報是否準確;AI 要看任務完成、錯誤嚴重度與偏離目標的情況;整個流程則看人工接手比例、返工與最後產生的業務結果。這套架構目前是一項管理建議,企業可以先用一條已經使用 AI 的工作流程試算。
AI擅長的任務變快,越界後更容易答錯
Harvard Business School 與 BCG 對 758 名顧問進行實驗。面對 AI 能力範圍內的任務,使用 GPT-4 的參與者平均多完成 12.2% 的工作,速度快 25.1%,品質也較高。當任務超出模型擅長範圍,使用 AI 的參與者答對機率低了 19 個百分點。
同一套工具會在不同任務得到相反結果。整理訪談重點、改寫既有文字,可能很快產生可用初稿;判斷陌生市場、核對例外條款或處理資料不完整的案件,則需要員工辨認 AI 已經越過能力邊界。
公司若只獎勵速度,員工會有動機繼續交件;公司若記錄高風險錯誤、人工修正與上報,員工才有理由在發現問題時停下來。AI 的使用規則因此要跟任務一起寫,不能只發一份全公司的工具名單。
新手做得更快,資深員工負責處理例外
NBER 研究 5,179 名客服人員使用生成式 AI 助理的情況,平均每小時解決的問題增加 14%。新手與技能較低的員工增加 34%,資深、高技能員工受到的影響很小。研究者認為,AI 把熟練員工常用的做法傳給新手,縮短了累積經驗的時間。
這個結果也說明,所有員工不能只用同一個產量增幅考核。新手可以靠 AI 更快找到標準答案;資深員工常處理退款例外、情緒激動的客戶、系統資料互相矛盾等情況。後一類工作花時間,也更依賴責任判斷。
主管評估資深員工時,可以記錄他修正了哪些高影響答案、哪些案件因及時上報而避免重做,以及他整理的處理方式是否讓新手之後少問一次。這些紀錄比「本月用了幾次 AI」更接近他的實際貢獻。
有沒有用對AI,看四個結果
企業可以拿一項每天重複的工作,連續比較使用 AI 前後的四個結果:完成時間、返工次數、錯誤嚴重度,以及客戶或下一個接手人的結果。
客服回信可以計算案件一次解決率與重新開單;行銷內容可以記錄引用錯誤、退稿與修改輪次;採購比價可以檢查漏掉多少條件、最後由誰核准;會議紀錄則看決議、負責人與期限是否正確。每一項都能從現有工作留下資料,不必等公司先建一套大型 AI 儀表板。
測量時也要記下人工處理的時間。AI 十分鐘完成初稿,員工花四十分鐘查核,這項工作的實際時間是五十分鐘。下次調整提示、資料來源或人工確認位置後,再看總時間與錯誤是否下降。
台灣公司先重做一條工作流程
台灣企業可先挑一條範圍小、每天會重複、出錯後仍能修正的流程,例如內部會議摘要、客服回信草稿或商品資料整理。主管和實際承辦人一起寫清楚 AI 讀取什麼資料、產出交給誰、哪幾項一定要由人核對。
試跑兩到四週後,比較總工時、返工、錯誤和客戶結果。數字改善,再擴大到相近任務;錯誤增加,就調整資料、權限或人工確認位置。員工發現 AI 不適合某個案件並及時停止,也應留下紀錄,讓下一個人知道什麼情況要接手。
公司真正要改的是工作方法與考核方式。使用次數可以看工具有沒有人打開,工時、錯誤、返工與問題是否解決,才能回答 AI 有沒有用對。
常見問題
公司要求回報AI使用次數,有用嗎?
使用次數可以觀察員工是否接觸工具,無法單獨證明工作變快或品質改善。回報時再加上原本工時、人工查核時間、返工次數與錯誤類型,才能比較使用前後差異。
第一個AI流程要選哪一項?
先選每天重複、輸入和完成條件清楚、出錯後可以修正的工作。內部摘要、固定格式整理與客服草稿通常比付款、刪除資料或正式核准更適合先試。
員工怎麼證明自己替AI攔下錯誤?
在工作紀錄中留下原始輸出、修正內容、錯誤可能造成的影響,以及是否轉交主管。主管可將高風險錯誤的發現與正確上報列入考核,避免只看最後交件數。
資料來源與更新紀錄
- 2026-08-07:36氪〈九成企業做的「AI轉型」,不過是場表演〉,用於確認作者所列的企業 AI 使用症狀;「九成」為評論性標題,原文未提出調查樣本。
- 2026-08-07:36氪〈別再只看產出數量了,AI時代的考核要看這三層〉,用於確認 HBR 文章的中文編譯內容與三層考核框架。
- 2026-08-07:Harvard Business Review〈Performance Management Needs New Metrics in the AI Era〉,確認人類績效悖論、員工/AI/人機系統三層指標與工作流程試行建議。
- 2026-08-07:Deloitte〈The State of AI in the Enterprise 2026〉,確認 84% 尚未依 AI 重設職務,以及 30% 提供 AI 績效誘因。
- 2026-08-07:Harvard Business School〈Navigating the Jagged Technological Frontier〉,確認 758 名顧問實驗、任務量增加 12.2%、速度加快 25.1% 與能力邊界外正確率下降。
- 2026-08-07:NBER〈Generative AI at Work〉,確認 5,179 名客服人員、平均生產力增加 14%、新手與低技能員工增加 34%,以及資深高技能員工影響很小。






