AI 代理幫你讀完信、整理資料,下一步準備寄出附件或送出付款時,最後一次確認應留在你手上。8 月 5 日,一組研究人員分析 8 套 AI 安全測試與 192 個模型,將安全表現拆成過度拒絕、事實正確性與不同對話脈絡下的傷害風險。這讓「按下確認前由誰決定」成為比安全分數更具體的使用問題。
| 關鍵資訊 | 內容 |
| 事件 | 研究團隊 8 月 5 日發布 AI 安全評估研究,分析 8 套基準、192 個模型 |
| 研究發現 | 拒答嚴格度、真實性與情境傷害,會分別影響模型的安全表現 |
| 讀者會遇到的操作 | 寄信、付款、刪檔、公開資料、變更帳號權限 |
| 使用前先做 | 將高影響動作設為人工確認,保留紀錄與撤銷路徑 |
研究用192個模型拆開安全分數
這份題為〈Item Response Theory for AI Safety〉的研究,把常見安全測試拿來逐題比較。作者發現,單一總分會把幾種不同狀況混在一起:有些模型傾向拒絕更多請求,有些模型在回答事實時較可靠,有些模型在需要理解上下文的風險問題上表現不同。
這個拆法碰到使用者最常遇到的落差。AI 拒絕寫一封正常客服信,使用者只會覺得它難用;AI 把一封含客戶資料的信直接寄錯人,後果就不同。前者需要調整服務限制,後者需要在寄出前停下來讓人看過收件人、附件與內容。
研究團隊也提出較少題目的測法,並用它檢視模型是否在測試時出現異常表現。讀者不需要自己做這些測試;產品業者應把結果轉成使用者看得到的規則:哪種操作需要確認、哪些資料不能自動送出、更新後改了什麼。
AI寄信付款前要停在哪一步
AI 代辦最容易出問題的地方,通常不是產出一段文字,而是把文字變成行動。草擬郵件只影響你的草稿匣;按下寄送會把資料交給外部收件人。列出商品比價只提供選擇;提交訂單會動用金錢與帳號。系統把這些步驟混在一起,使用者就很難分辨自己何時仍能改變決定。
OpenAI 為電腦操作型 AI 設計安全措施時,將銀行交易與高風險決策列為主動拒絕的任務;在電子郵件等可能外洩敏感資訊的網站,系統要求使用者保持監看。這套做法提供了一個清楚的產品原則:AI 可以整理資訊與準備動作,高影響操作要回到人手上確認。
產品頁若沒有寫清楚 AI 能讀取哪些資料、會開啟哪些網站、能否送出或刪除內容,先把它當作只能協助草擬的工具使用。需要讓 AI 真的操作帳號時,從一個可撤銷的小任務開始,例如建立草稿而不送出,或把購物清單留在結帳前。
長對話會改變AI的判斷
一段對話的風險常在後面幾句才浮現。有人先談睡不著,後來才提到傷害自己;有人先請 AI 整理工作資料,接著要求它把同一批檔案寄給外部聯絡人。最後一句話可能很平常,前面的資訊卻決定系統應該多問一句、停止提供細節,還是提醒使用者重新確認。
OpenAI 今年 5 月更新 ChatGPT 的敏感對話處理,說明系統會辨識逐漸出現的警訊,再改用較謹慎的回應、拒絕有害細節或引導使用者取得協助。6 月,該公司也公布以經隱私處理的舊對話測試候選模型的方法,藉此觀察新版本在接近實際使用的脈絡裡會如何回答。
長對話帶來的差異,要求安全說明直接列出系統準備採取的動作、前後脈絡的使用方式、中途停止按鈕,以及資料是否會帶進下一個任務。
安全規則要列出版本和處理方式
另一份 7 月發布的研究指出,各家公司公布的 AI 能力門檻差異很大,第三方難以比較不同公司何時會加上限制。研究者嘗試用風險造成的傷害、發生途徑和模型發布條件,替資安與生物濫用等風險建立可比較的門檻。
這個問題已經進入產品與監管要求。美國國家標準與技術研究院(NIST)的生成式 AI 風險管理指引,把安全、可靠、透明、隱私與公平列為持續要處理的項目。歐盟 AI Act 對具系統性風險的通用模型業者,要求評估模型、記錄對抗測試、處理重大風險並通報事件。
使用者看到「安全」兩字時,可以先找四項資訊:這項功能適用哪個模型版本、它測過哪些操作、哪些動作會要求人工確認,以及錯誤發生後怎麼通報與撤銷。寫得出這些內容的服務,才把安全規則接到實際操作。
台灣使用者先分開草擬和送出
台灣使用者採用國際 AI 工具時,先用它整理、翻譯、歸類與建立草稿,再決定是否開放寄信、共享雲端檔案、改動帳號設定或付款。高影響權限只交給有明確確認畫面、操作紀錄、撤銷方式與客服管道的服務。
公司內部導入時,可把同一個原則寫進工作流程:AI 整理資料後由人決定收件人;AI 建議採購項目後由人提交訂單;AI 找出要刪的檔案後由人按下刪除。這些分工不需要等待新法規,也不需要先判斷哪一款模型在排行榜最高。
AI 越能代辦,確認權越值得留在最後一步。那一個按鈕、那一筆操作紀錄與那條撤銷路徑,才是使用者能真正掌握的安全設計。
常見問題
AI 拒絕回答,代表服務更安全嗎?
拒絕可以避免高風險請求,也可能擋住正常任務。使用時看它拒絕的是什麼操作、會不會說明原因、是否提供安全的替代做法。寄信、付款與資料公開前,仍由使用者確認。
安全分數高,就能讓AI代辦付款嗎?
先看付款前的再次確認、交易紀錄、帳號資料處理方式,以及出錯後的撤銷與客服路徑。已完成的交易要依服務商的退款或撤銷流程處理。
公司沒有技術團隊,怎麼開始使用AI代辦?
先選擇只產出草稿、不直接對外執行動作的流程。讓 AI 先整理客戶信件或採購清單,由負責人檢查後再送出。確認權、收件人與付款資料都有明確負責人後,再逐步增加權限。
資料來源與更新紀錄
- 2026-08-07:〈Item Response Theory for AI Safety〉,確認 8 套安全基準、192 個模型、拒答嚴格度、真實性與情境傷害等研究結果。
- 2026-08-07:〈Harmonizing AI Safety Thresholds〉,確認跨公司安全門檻難比較,以及作者提出的風險門檻方法。
- 2026-08-07:OpenAI Operator System Card,確認高風險任務的主動拒絕與電子郵件網站的監看機制。
- 2026-08-07:OpenAI:敏感對話的上下文辨識,確認敏感對話的上下文辨識與回應措施。
- 2026-08-07:OpenAI:部署模擬,確認以隱私保護對話重播觀察候選模型的公司方法。
- 2026-08-07:NIST Generative AI Profile,確認生成式 AI 風險管理中的安全、可靠、透明、隱私與公平脈絡。
- 2026-08-07:EU AI Act 第 55 條,確認具系統性風險的通用模型之測試、風險處理與事件通報義務。






