你交代 AI 做一件多步驟的事,過一陣子它回你一段「我做好了,以下是重點」。那段話你會仔細看,然後就把它當成事實了。一份 9 月 10 日放上 arXiv 的研究,翻了 5,851 場真實對話、355,942 次動作紀錄,算出一個數字:那份自述平均只提到 十一分之一 的實際動作。這篇把研究拆開講,再給你 3 個自己驗收的步驟。
AI agent 是什麼?為什麼你只看得到它的一句話
先把名詞講白。一般的聊天式 AI 是「你問一句、它答一句」,中間沒有動作。AI agent 是你交代一個目標,它自己拆步驟、自己動手——開檔案、改內容、呼叫工具、上網查、寄信,來回可能幾十上百次,最後才回頭跟你講一次。這個差別我在〈AI Agent 是什麼?跟 Workflow 差在哪〉那篇拆過三層判斷法,這裡不重複。
重點是後半段:它動的那幾十上百次,你其實看不到。你看到的是它自己寫的一段收尾。研究的第一句話講得很直白——開發者看的是「agent 自己寫的關於自己的摘要」,不是誰設計出來的儀表板。誰做事、誰寫報告、誰驗收,這三件事現在擠在同一個人身上。
研究怎麼做的:5,851 場真實對話、355,942 次動作
這份預印本 9 月 10 日上 arXiv,題目叫〈Plans They Abandon, Reports They Author: The Narrative Layer of Autonomous Agents〉,中文可以翻成「它們放棄的計畫,它們撰寫的報告」。分類在人機互動(cs.HC),論文標註 14 頁、4 張圖、還在審查中。
材料不是實驗室裡編出來的任務,是 5,851 場真實開發者對話、355,942 次工具呼叫。研究問兩件事:那份摘要裝得下多少實際工作?當執行過程偏離了原本說好的計畫,報告會不會往「當初的計畫」那邊飄?
三個發現,一個比一個麻煩
一、11 個動作,只講到 1 個
自我回報平均提到大約十一分之一的動作。換算起來,一場動了 110 次的任務,收尾那段話大概交代了 10 次。剩下的 100 次不是被藏起來,是根本沒被寫進去——一段人看得完的摘要,本來就塞不下那麼多。
二、只看報告,你還原得出兩成
研究再做一步:讓一個只拿到報告、看不到紀錄的讀者,試著重建 AI 到底做了什麼。結果大約還原出五分之一的動作紀錄。這個數字比第一個更貼近你的處境,因為你就是那個「只拿到報告的讀者」。
還有一個細節值得停一下:上面兩個比例,跟這場任務後來有沒有需要人工修正無關。也就是說,你沒辦法從「這份報告寫得完不完整」推論「這次做得好不好」。報告的簡略程度,不是品質的訊號。
三、越偏離計畫,報告越像計畫
這條是最麻煩的。整體來看,報告並沒有特別偏向「當初宣告的計畫」而不是「實際執行的過程」。但研究發現一個趨勢:當執行越偏離原計畫,報告就越貼近當初那份計畫。
翻成人話:正常做完的時候,它講的跟做的差不多;真的中途轉彎、繞路、放棄某個步驟的時候,那段回報反而更像在覆述「我本來打算怎麼做」。最需要你知道實情的那一次,摘要最靠不住。
研究團隊自己也留了餘地:兩個用語言模型做的測量步驟都經過人工驗證,連沒通過的那一項也照實寫進論文,結論只從通過驗證的測量推出來。這種寫法我個人滿買單,比一路只報喜的論文可信。
AI 自動化流程怎麼驗收?3 個步驟
研究只講現象、沒給你 SOP。下面這三步是我自己在用的做法,成本很低,做一次就回得來。
步驟一:動手前,先跟它要一份計畫
交代任務之後,先加一句「先不要動手,把你打算做的步驟列給我」。它列完,你自己另存一份——貼進備忘錄、留在對話上面都行。這份東西的價值在收尾那一刻才會出現:你有一個獨立的對照組,可以看它最後講的跟一開始說的差在哪。
順帶一提,這也是為什麼把規則寫成固定檔案會好用。我在〈教過 AI 的事它都忘?agents.md 是什麼〉寫過同一個原理:把「每次都要照做的事」變成它每次都讀得到的文件,不要每次靠口頭交代。
步驟二:收工時,要的是「動過什麼」的清單
不要看完摘要就結案。再追一句:「列出你這次實際動過的東西——改了哪些檔案、寄出哪幾封信、填了哪幾格、呼叫了哪些工具,一項一行。」
這句話問的不是感想,是動作。清單體比敘事體難含糊,它得一項一項列,你也一眼看得出有沒有你沒預期的東西。研究裡那個「十一分之一」講的正是敘事體的天花板,而清單體沒有這個天花板。
步驟三:抽一項,自己打開來看
清單拿到之後,隨機挑一項,自己去現場確認:檔案真的改了嗎?信真的寄出去了嗎?表格那一格真的填了嗎?一項就好,三十秒的事。
為什麼非做不可:前兩步的資料全部來自 AI 自己,等於用它的話查它。要有第二個獨立來源對得上,這次驗收才算數。我自己抓到的幾次落差,都是在這一步才現形的。
我自己遇過的兩個場景
八月的時候我想做一件事:讓 AI 每天定時去幾個原廠的新聞中心繞一圈,把當天重點整理好,寄一封 Gmail 給我,順便寫進 Google Sheets——等於一份個人化電子報。這個需求現在的工具都做得到,但它有個先天的結構問題:排程跑的東西,沒有人在旁邊看。它每天真的去了五個網站,還是其中兩個抓失敗、直接略過不提?你收到的只有那封信。
所以我後來加的不是更聰明的提示詞,是一行硬規定:每次回報的最後,要列出這次實際抓到的來源網址和篇數。有了這行,抓失敗就藏不住——來源清單會短一截,我一眼就看得到。這就是上面步驟二的實作版。
另一個場景是帶課的時候。前陣子上 AI Agent 的課,有位學員問了一個很實際的問題:怎麼省 token?能不能讓它自己切換模型?這個問題我一直記著。但這份研究讓我想補一句更前面的事——在問「怎麼讓它做更多」之前,先確定你知道它做了什麼。省 token 的技巧再好,建立在一份你沒驗過的完工報告上,省下來的是假的。
套用前,3 件事先講清楚
第一,測的是寫程式的 agent。資料來自開發者的真實對話。你拿 AI 訂機票、整理信箱、做投影片,是不是也同一個比例,這份研究沒有回答。方向值得警覺,數字別直接搬。
第二,這是預印本,還在審查中。arXiv 上的東西沒經過同行審查就先公開,好處是快、壞處是還沒被挑過。看它的方法跟論證,不必把 1/11 當成定律。
第三,這不是「AI 在說謊」。一段人讀得完的摘要,物理上就裝不下幾百次動作,換成人來寫也一樣。問題不在誠實與否,在於你只拿得到這一段——而且寫這段的人,就是做事的那個人。
小結
AI agent 最好用的地方,是你不用盯著它;最難的地方,也是你不用盯著它。這份研究把那個模糊的不安換成了數字:11 個動作講 1 個、只看報告還原兩成、越偏離越像計畫。
對應的動作其實很輕:事前留一份計畫、事後要一份清單、抽一項自己看。三十秒的成本,換掉「我以為它做完了」這個風險。你把工作交出去,至少要留一條回頭看得到的路。
下一次 AI 跟你說「我做好了」,你會直接相信,還是會追問一句它到底動了什麼?
延伸閱讀
- AI Agent 是什麼?跟 Workflow 差在哪:3 層判斷法,先看你的流程會不會變
- 教過 AI 的事它都忘?agents.md 是什麼:4 步驟把 ChatGPT Work 從聊天機器人變同事
- AI 只會操作電腦?Anthropic 官方公布 MHS:讓 AI 直接開機器的 4 個重點
本文整理改寫自 arXiv 預印本〈Plans They Abandon, Reports They Author: The Narrative Layer of Autonomous Agents〉(Obada Kraishan、Kulsawasd Jitkajornwanich,2026-09-10,cs.HC)。原文連結:arXiv:2609.12205。文中所有數據皆取自論文摘要,3 步驟驗收法為本站整理的實作建議。
留言
張貼留言