AI 客服若能查訂單、處理退款、寄 email 或修改帳戶,公開聊天視窗就是攻擊入口。惡意訪客會試著用一段文字讓它偏離客服任務,去查不該查的訂單、建立不該建立的退款,或寄出不該寄的信。服務商要把聊天回覆、資料查詢、退款與寄信拆成關卡:AI 負責組織文字;登入帳號決定能看哪筆訂單;退款、寄信與發布由系統規則和人員決定。
8 月 7 日公開的 AI 安全研究,測試有人改寫危險要求時,模型會不會放棄原本的拒答。研究者在特定模型、資料集與提示模板中,報告部分模型出現較高的違規回答比例。攻擊者會不斷改寫同一個要求,找出模型改口的時機;客服系統若把這一步直接接到訂單、金流或信箱,對話框裡的一句話就可能推動下一個操作。
攻擊先從讓 AI 改口開始
「拒答」是 AI 遇到危險要求時,回覆「我不能協助」的反應。模型公司用訓練和內容檢查,讓 AI 在這一步停下來。攻擊者則用不同說法反覆測試,尋找會讓 AI 改變回答的問法。
這份研究聚焦模型的拒答機制。面向客戶的 AI 還有公開聊天、email、文件和網頁四個入口:訪客在聊天視窗輸入文字,是直接提示注入;客服讀進一封 email、一份文件或一個網頁後,將其中內容當成指令,則是間接提示注入。OWASP 把這兩種輸入都列為 AI 應用的風險來源。
AI 拿到工具,才會造成損害
AI 客服不能自己決定「要查哪位客人的資料」或「要退多少錢」。客人登入後,訂單系統用帳號和訂單編號找出資料;AI 只讀取那一筆資料,再產生客服回覆。退款金額、付款對象、收件人、附件與發布內容,交由訂單系統或後台逐項檢查,再由人員按下確認。
| 客服工作 | AI 負責的部分 | 系統或人員的關卡 |
| 回答商品問題 | 從公開 FAQ 組成回覆 | 不讀取客戶資料 |
| 查詢訂單進度 | 讀取已登入客人的單一訂單資料 | 系統核對帳號與訂單 |
| 處理退款要求 | 整理理由、產生客服草稿 | 訂單系統檢查資格與金額,人員確認退款 |
| 發送後續通知 | 撰寫 email 草稿 | 人員確認收件人、附件與寄送 |
惡意訪客進入客服視窗後,系統要怎麼擋
訪客在公開客服視窗輸入一段試圖改變 AI 行為的文字後,AI 仍只能回答公開商品資訊,不能直接搜尋所有客戶資料。訪客輸入不能覆寫客服後台規則;每次查訂單、退款、寄信或改資料時,程式重新核對登入帳號、訂單資格和可執行範圍。
客服讀取 email、履歷或文件時也使用同一套規則。外部文字供 AI 摘要、分類或草擬回覆;文件裡的命令式句子不會改寫工作規則,也不會增加 AI 的工具權限。
OWASP 建議將高風險功能切成具體的程式介面,例如「查詢已登入客人的單一訂單」或「建立退款待審項目」。付款、寄信、刪除與公開發布由人員確認;操作紀錄和次數上限可讓團隊追查一次異常呼叫,也限制單次事件能影響的範圍。
上線前先測四個地方
| 測試位置 | 要確認的結果 |
| 聊天視窗 | 客人輸入無關或命令式文字,AI 仍維持客服任務,不調用額外功能。 |
| 文件與 email | 外部內容只影響摘要或分類,不影響客服後台規則。 |
| 訂單與帳號 | AI 只讀取測試帳號自己的資料,不能跨帳號查詢或修改。 |
| 退款與寄信 | 退款、寄送、刪除與發布都經過固定規則與人工最後確認。 |
測試使用假客戶、假訂單與假付款資料。產品團隊、客服主管和資安人員一起檢查:AI 呼叫了什麼功能、系統擋住了什麼要求、誰收到通知。模型、提示詞、外掛或資料來源更新後,四個測試位置都要重跑。
異常時先關掉 AI 的動作權
AI 出現異常回覆、跨帳號查詢或準備執行不合理動作時,先關閉它對訂單、信箱、金流與內容後台的連接。團隊接著查看操作紀錄,確認它讀過哪些資料、叫用了哪些功能、建立或送出哪些內容;再撤銷存取權、保留紀錄並通知受影響的人員與客戶。
AI 客服可先只回答公開 FAQ。訂單查詢、退款、寄信與內容發布在測試通過後逐項加入。每多接一個功能,攻擊者就多一個能測試的目標。
模型防護與產品關卡一起上
Anthropic 公開的新版防護會先篩選可疑對話,再檢查輸入與回答。服務商仍要把模型防護接到產品關卡:外部訊息先被當成不可信內容,帳號系統決定資料範圍,退款與寄信由固定規則和人員確認。這幾道關卡把公開對話框和客戶資料、付款功能隔開。
常見問題
公開 AI 客服上線前,先查哪三件事?
先查它能讀哪些資料、能叫哪些工具、哪些動作需要人工確認。公開客服先回答 FAQ;登入後的訂單查詢由系統核對帳號;退款、寄信、帳戶修改、刪除資料與公開發布留在固定規則和人員確認的流程裡。
直接提示注入與間接提示注入差在哪?
直接提示注入來自訪客在聊天視窗輸入的文字;間接提示注入藏在 email、文件、網頁或其他外部內容裡。客服系統要把兩者都當成不可信輸入,不能讓它們改寫工作規則或擴大工具權限。
退款權限怎麼設?
AI 可以整理退款原因與草擬客服回覆。訂單系統核對訂單資格和可退款金額;人員確認付款對象與最後的退款動作。聊天文字不應直接決定退款。
資料來源
- Dumitrescu 等人,Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits,arXiv,2026-08-07
- TU Delft Repository:Diffusion LLMs as Targets and Adversaries,碩士論文,2026
- Anthropic:Next-generation Constitutional Classifiers,2026-01-09
- OWASP Gen AI Security Project:LLM01: Prompt Injection,2025
- OWASP Gen AI Security Project:LLM06: Excessive Agency,2025






