10月 09 星期五
10月09星期五
Cropped new logo.webp

AI代理省token新招:大模型先寫SOP

字級
兩名團隊成員在辦公室檢視大型流程藍圖與簡化執行步驟

採購人員把一批供應商來信交給 AI 代理時,最貴的做法是每封信都交給大模型從頭讀、想、判斷,再輸出結果。信件的欄位、分類與核對步驟若大致固定,團隊可以先讓強模型看過樣本,寫出分流規則、必填欄位與驗證程式;往後由較小模型處理重複部分,例外才回到人手與較強模型。

Salesforce AI Research 等研究者 8 月 13 日在 arXiv 公開 AI4AI 預印本,測試強模型能否在不重新訓練目標模型的情況下,替它建出這套執行環境。研究把流程稱為 harness,可包含任務路由、提示範本、確定性程式、驗證步驟與答案格式。目標模型照流程執行,強模型不必每次跟著處理所有題目。

關鍵資訊 內容
研究名稱 AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses
公開時間 2026 年 8 月 13 日(台灣時間)
做法 強模型先建立規則、路由、驗證與輸出格式;較弱模型在固定流程中執行
研究測試 四組心智推理基準、3,900 筆隱藏測試題
論文數字 GPT-5.4-mini 的平均正確率由 0.488 提升至最佳 0.912
台灣讀者可先做 從一條重複、低風險、可人工抽查的工作流記錄建置與執行成本
目前狀態 預印本研究;論文未公布企業 API token、費用或投資報酬數字

大模型先做一次流程設計,小模型接手重複工作

AI4AI 把兩種工作拆開。強模型擔任建造者,先閱讀規則檔、目標模型的呼叫方式與一小段有答案的驗證資料,接著反覆修改流程。較弱的目標模型不改權重,改由新流程決定它先看到哪些資料、何時走規則、何時需要模型回答,以及答案要用什麼格式交付。

這套流程有點像資深同事先把一項工作寫成可執行的 SOP。能用欄位檢查、日期計算或固定條件處理的部分,交給程式和規則;需要閱讀語意、判斷例外或整理說明的部分,再由模型處理。每次執行少掉的,是大模型重複理解同一套規則與反覆輸出固定格式的 token。

研究者讓建造者只使用四個基準各 5% 的驗證資料,完成流程後再交給人工評估者跑完整隱藏測試。建造者看不到完整題目,因此流程要能重複使用,不能只記住少量範例的答案。

四組心智推理題,正確率由0.488升至最佳0.912

AI4AI 集合 BigToM、Hi-ToM、MMToM-QA 與 MuMA-ToM 四項心智推理資料集,測試模型能否追蹤人物知道什麼、看見什麼,以及如何判斷他人的目標。主要設定以 GPT-5.4-mini 作為目標模型,直接回答時的平均正確率為 0.488。

研究主設定共完成 72 次流程建造。以 GPT-5.4-mini 為目標模型的 57 次流程測試中,加入流程後的平均成績為 0.763;最佳一組由 GPT-5.5 建立的流程達到 0.912。論文把提升歸因於幾個可拆解的步驟:先辨識題型、把可確定的推理交給程式、限制回答格式,再把剩下的判斷交給模型。

這些數字描述的是研究者設定的心智推理題,並非客服、採購或文件系統的實際成效。它們仍指出一個營運上的選擇:每次任務都請大模型重新思考,或先把反覆出現的條件編成一套能反覆執行的流程。

代理成本改成一次建置與每次執行兩筆帳

建置階段同樣要花成本。強模型得讀資料、寫流程、跑驗證;程式與工具呼叫也各有成本。工作量穩定、規則重複、資料格式固定時,這筆前期成本才有機會被大量執行次數攤平。

團隊可把原本只看單次模型價格的帳,改為同時記錄四項數字:建造流程用掉的輸入與輸出 token、驗證與重跑次數、每件任務由較小模型處理的 token、例外案件回到人員或大模型的比例。這四項資料才能回答一條流程到底是減少每件工作的成本,還是只是把成本移到建置階段。

AI4AI 沒有公布這些 API 帳單。論文測量的是基準正確率、流程建立過程與可由規則承接的比例。採購模型服務時,企業仍得以自己的模型價格、快取設定、工具費用與工作量重算。

台灣團隊先從可人工抽查的工作流開始

第一條流程可選每週重複出現、輸入格式固定、結果能由人抽查的工作,例如把供應商來信列成待辦、依發票欄位分類文件,或把客服訊息整理成回覆草稿。團隊先挑 50 到 100 筆去識別化資料,讓強模型寫出欄位規則、例外判斷與輸出格式,再用另一批資料檢查結果。

正式工作中,寄信、付款、發布、刪除資料與帳號權限變更仍要保留人工核准。低風險任務跑穩後,再擴到需讀取內部系統的流程。每次改規則時,負責人要能找回舊版本、知道這條規則為何加入,也要看得出它影響哪些分支。

台灣團隊還得確認資料會送往哪個模型服務、是否能使用既有雲端帳號付款、供應商是否提供企業用的資料處理條款。流程若包含客戶資料、交易紀錄或內部文件,去識別化樣本、權限分層與人工覆核會直接影響能否試跑。

規則寫錯一次,大批工作都會沿著同一條路出錯

流程愈能處理重複工作,一條錯誤規則的影響也愈大。論文觀察到,確定性求解策略有時會因單一邏輯錯誤,在超過千題的完整測試上拉開很大的成績差距。研究者也發現,較強的目標模型在部分原本已經表現好的題目上,加入流程後反而退步。

實務上,這代表規則不能只看第一次是否跑通。團隊要保留一組固定測試資料,更新前後同時比較正確率、每件成本與例外比例。當小模型已能穩定完成某一段工作,流程可以縮短;當例外變多,強模型與人工覆核就要回到那個環節。

AI4AI 把模型使用方式從「每件工作都問最強模型」改成「先建立一條能重複跑的路」。下一次團隊評估 AI 代理費用時,先挑出最常重做、最容易抽查的一段工作,記下建置與執行兩筆帳,再決定小模型要接手到哪一步。

常見問題

AI4AI是可以直接安裝的產品嗎?

AI4AI 目前是公開在 arXiv 的研究論文。論文描述可由模型建立的流程類型與基準測試方法,讀者可先採用「強模型設計、較小模型執行、人工處理例外」的思路規畫內部測試。

這篇論文已經證明能省多少token嗎?

論文沒有公布企業工作流的 API token、帳單金額或投資報酬。它顯示流程能在特定基準提高目標模型的正確率,並把部分判斷交由規則與程式處理。每家團隊的節省幅度會隨工作量、模型價格、快取、工具呼叫與例外比例改變。

哪些工作適合先試?

輸入欄位固定、結果能人工抽查、例外有明確交接人的工作最適合先試。文件分類、待辦整理與回覆草稿可先建立測試資料;涉及付款、對外發布、刪除資料或帳號權限的動作,維持人工核准。

資料來源與更新紀錄

Item added to cart.
0 items - NT$0