同一句話,你跟朋友講,他聽得懂弦外之音;換成 AI,它只照字面做。這不是你的錯覺——有一份 2026 年 9 月剛上線的研究,把人跟人、AI 跟 AI、人跟 AI 的十萬多步合作紀錄攤開來算,發現人類之間有一段「講出來以外的資訊」,而 AI 之間幾乎等於零。這篇把研究拆開講,再給三個馬上能改的提示詞寫法。

這份研究怎麼做的?重放 10 萬步棋
論文標題是〈The Convention Gap: Towards Measuring Implicit Communication in Cooperative AI Evaluation〉,2026 年 9 月 10 日上傳到 arXiv,編號 2609.11489,分類掛在人工智慧(cs.AI)與人機互動(cs.HC)。
它的出發點很直接:現在評估「合作型 AI」,多半是讓 AI 跟 AI 對打、看分數。但人類的合作靠的是隱含慣例——在字面訊息之外,還有一層「我知道你會這樣理解」的共同協定。AI 跟 AI 打分數再高,這層東西量不出來。
研究挑的測試場是卡牌遊戲《花火》(Hanabi)。這款遊戲的規則很適合拿來量:你看不到自己的手牌,隊友只能用規則允許的有限提示告訴你資訊,牌堆是有限的、提示方式也是固定的——所以「照字面推算,這一步該有多大機率失敗」是可以精確算出來的。
拿遊戲當研究場其實已經是這一年的常見做法,我之前寫過的〈AI 混進群組怎麼看?一場狼人殺研究給的 3 個線索〉也是同一個路數:規則封閉、每一步都留紀錄,才好把人跟 AI 的差別逼出來。
研究團隊重放了約 101,000 步棋,資料來自三個公開資料集:hanab.live 的人跟人對局、HOAD 的 AI 跟 AI 對局、HanabiData 的人跟 AI 對局。

「默契差距」是什麼?一句話講完
研究提出的指標叫 convention gap,我翻成「默契差距」。算法是兩個數字相減:
- 預測失敗率:只看字面上講出來的資訊,這一步應該有多少機率出錯。
- 實際失敗率:這一步真的出錯的比例。
兩者一減,就是「講出來以外的東西」值多少。差距越大,代表雙方靠字面之外的默契做了越多事——照字面看應該會出錯,結果沒錯,因為對方讀懂了沒說出口的那一層。
三個數字:人有默契,AI 幾乎是零
三組對局算出來的默契差距長這樣(單位是百分點):
| 對局組合 | 默契差距 | 怎麼解讀 |
|---|---|---|
| 人 × 人 | +26.2 | 字面之外還傳了一大包資訊 |
| AI × AI | −0.7 | 幾乎完全照字面,沒有額外那層 |
| 人 × AI | +16.4 | 中間值,人這一邊仍在讀言外之意 |

AI 對 AI 那個 −0.7 是整篇最值得停下來看的數字。它的意思不是 AI 笨,是 AI 之間的合作幾乎完全建立在字面內容上:訊息裡有什麼就用什麼,沒有「我猜他這樣提示是想暗示我另一件事」。
最關鍵的一格:那張沒被提示過的牌
研究再往下切,發現人類的默契集中在一個特定情境——玩家去打一張完全沒有收到任何提示的牌。這種情況下,人跟人的默契差距衝到 +46 個百分點。
照字面推算,一張沒被提示過的牌幾乎沒有資訊可依據,應該常常打錯。但人類玩家很敢打,而且打對了。他們依據的是「隊友剛剛沒提示這張,代表它應該安全」這種沒說出口的約定。
這件事翻成日常場景就是:你交代同事「這份等等處理」,他知道「等等」是今天下班前、不是下週;你請家人「順便買個東西回來」,他知道是哪一家。這些從來沒寫在句子裡,卻決定了結果對不對。
分數高,不代表它跟你合得來
研究最實用的一段在人跟 AI 的對局裡。受試者分別跟三個不同的 AI 夥伴搭檔,這三個 AI 給出的字面資訊量差不多——照字面推算的失敗率落在 38% 到 41% 之間,差距很小。
但人的實際表現差很多:失敗率從 14.4% 到 34.4%,默契差距則從 +24.1 掉到 +6.2 個百分點。而且方向很一致——讓人產生最大默契差距的那個 AI 夥伴,人類的失誤最少。
研究也順手戳破了一個習慣:用遊戲分數評估 AI 合作能力不可靠。分數會被「這批資料裡有哪些玩家」影響,默契差距才真正在個別 AI 的層級上,把人的玩法跟 AI 的玩法分開來。
為了確認這個指標量到的真的是默契,研究還做了一個已知答案的對照:拿 Off-Belief Learning 這類「默契含量由設計決定」的 AI 來測,在刻意做成無默契的層級量到 +1.6 個百分點,隨著設定層級往上,數字一路單調升到 +21.7 個百分點。指標的反應方向跟預期一致。
結論寫得很保守但很有指向性:能不能預測一個 AI 跟人搭檔的效果,關鍵可能是「默契相容性」,而不是它跟其他 AI 對打的成績。

我家小朋友問寶可夢,示範了一模一樣的事
這篇研究我讀到一半就想到家裡的例子。前陣子我家小朋友開始拿我的 Gemini 問寶可夢——哪一隻要怎麼進化、需要什麼條件。問了幾次他就卡住,因為 AI 回的版本跟他手上玩的對不起來,他一臉「它是不是很笨」。
他少講的那句是:他正在玩的是《寶可夢 Z-A》。在他的腦袋裡,「問寶可夢進化」當然就是問他現在玩的這一款——這就是那張沒被提示過的牌,他以為對方知道。AI 知道他在問寶可夢,但不知道是哪一代、哪一款、玩到哪。
我沒跟他講「上下文」這種詞,只教他多講一句:「我正在玩寶可夢 Z-A,遇到某某問題。」加上這句之後,答案立刻對得上。小二的孩子學得會,代表這件事跟技術程度無關,純粹是有沒有養成把前提講出來的習慣。
另一個場景在課堂上。上次帶 AI Agent 的課,有人問我:怎麼省 Token?有沒有辦法讓它自動切換模型?一般的聊天式模型目前是手動切,但在 Agent 的架構下,這件事是可以靠規則寫死的——執行哪類任務優先用哪個模型、指派子代理時直接指定模型。差別不在 AI 聰不聰明,而在你有沒有把「什麼時候該換」這個原本只存在你腦袋裡的判斷,寫成它讀得到的規則。
三個寫法,把默契補回去
研究量的是遊戲,但推論很好搬:AI 不會讀空氣,那就別讓空氣裡藏東西。三個具體做法:
- 先講背景,再講要求。一句話交代你是誰、在什麼情況、這東西要給誰看。「我在玩寶可夢 Z-A」「這份是要給第一次接觸的同事看的」——這一句通常比後面所有形容詞都有用。
- 把判斷條件寫成規則,不要等它猜。凡是你心裡有「如果……就……」的分岔,直接寫出來:「資料有衝突時以官方公告為準」「超過三百字就自己拆成兩段」。你不寫,它就用自己的預設值填。
- 讓它先複述再動手。任務比較大的時候,加一句「開始前先用三句話講一次你打算怎麼做」。這是最省時間的一步——默契有沒有對上,複述那三句就看得出來,錯了當場改,比做完再重來便宜太多。
第三招其實是我一直在做的事,之前那篇〈AI 用不好?先別急著怪它——我叫 AI 做事前,一定先做這件事〉講的先對齊再動手,跟這份研究算是從兩個方向講同一件事。

幾個要注意的地方
- 這是遊戲情境的量測。《花火》的規則封閉、機率算得出來,所以指標才能精確計算。換到開放式的日常任務,數字沒辦法直接套用。
- 默契差距大不等於「比較聰明」。它量的是「字面之外還傳了多少資訊」,是一種溝通特性,不是能力分數。
- 研究的結論是「可能」。原文用的是 may predict,講的是一個更值得參考的評估方向,不是已經定案的標準。
- 這不代表 AI 永遠學不會默契。研究裡那個刻意調整默契含量的對照實驗就顯示,默契的多寡是可以設計進去的。現階段的實務結論比較單純:不要預設它已經有。
小結
人跟人合作的時候,有 26 個百分點的資訊是沒講出口的;AI 跟 AI 之間,這個數字幾乎是零。所以「它怎麼又做錯」很多時候不是它笨,是那段你沒說的話,它真的沒收到。
能做的事就一件:把腦袋裡的前提、條件、判斷標準寫出來。多打的那一兩句,通常就省掉重來一次的時間。
延伸閱讀
本文整理自 arXiv 論文〈The Convention Gap: Towards Measuring Implicit Communication in Cooperative AI Evaluation〉(arXiv:2609.11489,2026 年 9 月 10 日)。文中所有數字均取自該論文摘要,原文連結:https://arxiv.org/abs/2609.11489
留言
張貼留言