以客服代理為例,第一次把退款金額寫錯後,團隊在技能檔加上一句「送出前核對訂單金額」。隔週它遇到國外客戶,又在翻譯流程補上一段相同提醒;月底接上 CRM 後,規則再出現在另一條工作分支。這些修正各自都有用,幾個月後卻變成每次執行都要載入的長篇指令。
8 月 11 日,阿里巴巴集團、浙江大學與 Duke University 研究者在 arXiv 公開 SkillZip 預印本,處理的正是這種「代理愈學愈長」的問題。研究把技能當成一份工作合約:它交代何時啟動、依什麼順序操作、工具要帶哪些參數,以及完成時要交出哪些欄位。SkillZip 將重複規則與重複流程集中表達,少見的例外則保留在原本適用的位置。
代理能累積經驗,負責維護的人也得開始管理它留下來的技能債。長技能會占用每次呼叫模型的輸入空間,拉高前置處理成本,也可能讓真正要遵守的規則埋在重複說明裡。
| 技能累積的情境 | 團隊常加上的內容 | 幾輪更新後的問題 |
| 工具呼叫失敗 | 補一條參數、順序或重試規則 | 同一規則散落在多個流程 |
| 交付格式出錯 | 加入範例、檢查表與輸出欄位 | 範例與規格重複載入 |
| 少見客訴或例外 | 為特定條件新增分支 | 維護者難判斷例外要留在哪裡 |
| 新代理接手任務 | 複製既有步驟再小幅改寫 | 相同工作流程逐漸分岔 |
客服代理每補一條規則,技能檔就多一筆維護工作
AI 代理的「技能」可理解成可重複使用的工作說明。它不同於單次聊天提示:除了告訴模型要做什麼,還得寫明什麼需求才適用、先開哪個工具、資料缺漏時怎麼處理、哪些動作要停止,以及最後回傳什麼格式。
客服、採購、行銷與內部 IT 團隊若讓代理從執行紀錄持續修正,更新通常以追加方式進行。一次退款失敗後,多一條核對規則;一次寄信格式錯誤後,多一個範例;一次工具回傳空白後,多一段備用流程。每個補丁都有出處,卻未必有人回頭整理整份技能檔。
今年 3 月公開的另一篇 SkillReducer 預印本,分析 55,315 份公開代理技能,研究者將逾六成正文歸為背景、範例或模板等非核心操作內容。這份研究面對的是公開技能檔普遍混雜規格與說明的情況;SkillZip 則聚焦持續演進的技能,關心成功流程、失敗修正與例外條件如何在更新中重複出現。
規則寫得愈多,代理不一定更可靠。讀取規則時,模型得在長篇文字裡找出目前這一步要用的條件;維護者修改一條全域規則時,也得確認它是否已複製到其他分支。這就是代理的技能債:系統累積了經驗,經驗卻沒有整理成容易更新的共用結構。
SkillZip把規則、流程與例外拆成一份技能合約
SkillZip 先掃描技能檔,抽出五類不能漏掉的內容:啟動條件、工作流程、工具要求、各範圍適用的規則,以及輸出欄位。研究者將這些內容稱為技能合約。壓縮程序接著尋找能共用的結構,再以「重複規則寫一次、各分支引用」的方式改寫。
例如,「不要覆寫原始檔」若在三條流程都適用,可移到共同的工作規則;驗證、修正、再驗證的步驟若多次出現,可抽成共用程序。只有某個客戶類型才需要的額外欄位,仍留在那條分支。工具名稱、必填參數與輸出格式被列為合約的一部分,避免整理文字時把可執行條件一起刪掉。
研究還設計 Zip-on-Write 模式,讓代理收到新的技能補丁時先判斷它屬於哪一種更新:重複既有規則、補強條件、加入新要求,或讓原本分散的內容值得重新整理。這種做法讓每次追加規則前先完成一次小型維護決策,技能檔也不會一律在末尾延長。
論文稱平均壓縮31.2%,早整理比事後清理省事
SkillZip 在 BFCL-V4、LiveMath 與 Spreadsheet 三組研究基準上比較未壓縮技能、SkillReducer 與自身方法。論文報告,SkillZip 平均將技能長度壓縮 31.2%,三組模型與任務的平均分數為 0.577,略高於未壓縮技能的 0.570。
研究的另一項比較是壓縮階段的成本。SkillZip 採取一次結構擷取與確定性最佳化,過程不另外跑下游任務;論文統計平均花 286 秒,對照的 SkillReducer 為 3.5 倍的時間。這些數字來自研究者設計的模型、基準與測量環境,企業實際的成本仍會隨模型計價、技能長度、工具數量與測試流程改變。
在 16 輪自我演進的 LiveMath 實驗裡,研究者讓 Zip-on-Write 從第一輪開始處理每次更新。最終技能長度比未壓縮版本少 38% 到 50%。第 8 輪才開始整理的組別仍能回收部分重複內容,最終長度卻高於從一開始就整理的組別。對團隊而言,這意味著技能進入正式環境前就該有版本、負責人與整理節點;等到規則檔變成數十頁再處理,往往得花更多時間找出規則彼此的關係。
台灣團隊先替一條低風險工作流建立技能版本
目前 SkillZip 是預印本研究。論文附錄列出預期的程式模組與命令列介面,arXiv 頁面尚未提供可直接下載使用的公開程式庫。台灣團隊現在能先採用的,是它整理技能的做法,不必等同一套工具上線。
第一步可選一條低風險、輸出能人工核對的流程,例如:從指定資料夾讀取本週新檔案、列出檔名與待辦、再交由人決定是否寄信。把技能檔拆成「何時啟動」「必做步驟」「工具參數」「輸出欄位」「例外與停止條件」五段,每次修正都留下日期、原因與負責人。
第二步是把共用規則收在一個位置。像是「不得覆寫原檔」「寄信前須列出收件人」或「遇到資料缺漏就建立待辦」,不要在每條流程各寫一遍。分支只寫自己的差異,例如特定客戶、特定產品或特定核准條件。
第三步是把整理後的技能交給原本的測試流程檢查。SkillZip 研究刻意不在壓縮過程使用任務評測,以避免壓縮結果只迎合當下測試集;實際營運的代理仍要在去識別化資料和受控權限下重跑原本工作,確認輸入、工具呼叫、回覆格式與人工核准點都還在。
團隊管理規則變更,技能檔長度只是表象
技能檔變短只是表面結果。團隊若只刪文字,可能刪掉只在少見情境出現的停止條件;若只讓代理自行追加,又會讓同一規則在不同流程各長一份。SkillZip 的研究把這個問題轉成可追蹤的維護工作:每一條規則要知道來源、適用範圍、相依工具與例外條件。
當代理開始讀公司資料、呼叫內部系統與交付草稿,技能也會像程式碼一樣需要版本管理。下一次工具出錯時,負責人先問三件事:這是新規則嗎?它適用於哪些工作?現有流程有沒有同一條規則?把答案寫清楚,代理才不會每次學到新經驗,就多背一段重複的指令。
常見問題
AI代理技能和一般提示詞有什麼差別?
一般提示詞多半服務一次對話。代理技能會持續告訴系統何時啟動、如何呼叫工具、遇到錯誤怎麼處理,以及交付內容要符合哪些規格,因此會隨使用經驗累積而需要維護。
SkillZip能直接降低公司使用 AI 的費用嗎?
研究在特定基準上測得技能文字變短、壓縮步驟花較少時間。公司每次呼叫的成本還取決於模型價格、實際載入的內容、快取、工具呼叫與測試頻率。導入前可先記錄一條工作流的輸入 token、延遲與錯誤率,再比較整理前後的差異。
第一條該整理哪一種技能?
先選內容固定、範圍小、結果可人工比對的任務,例如檔案清單、資料分類或回覆草稿。寄信、付款、發布、刪除資料與帳號權限變更維持人工核准,等到規則、測試紀錄與工具範圍穩定後再擴大。
資料來源與更新紀錄
- 2026-08-13:Xiaofan Bai 等,SkillZip: Evaluation-Free Skill Compression for Self-Evolving Agents by Discovering Reusable Structure,arXiv,2026-08-11
- 2026-08-13:SkillZip 論文 HTML 版:方法、實驗、壓縮成本與限制
- 2026-08-13:Yudong Gao 等,SkillReducer: Optimizing LLM Agent Skills for Token Efficiency,arXiv,2026-03-31
- 2026-08-13:Ziyu Ma 等,SkillClaw: Let Skills Evolve Collectively with Agentic Evolver,arXiv,2026-04-09






