一份 2026 年 8 月 25 日發表在 arXiv 的研究,把 AI 的記憶功能拆成兩件事:「你問它答不答得出來」跟「它自己會不會用上」。同一套系統,前者 78.8%,後者只有 7.9%。這篇把研究看懂,順便講我自己怎麼調整問法。

先講這件事是誰說的
研究論文叫〈MemUse: Moving Memory Evaluation from Direct QA to Natural Integration in Long-Term Human-AI Conversation〉,2026 年 8 月 25 日發表在 arXiv(編號 2608.24189),論文頁上寫著已被 EMNLP 2026 主會議接受。研究團隊把資料集、評分結果跟評分用的提示詞全部公開在 GitHub 上,你想自己驗算也可以。
他們問的問題很白話:「記憶測驗考得好的 AI,用起來就真的比較好嗎?」
這份研究到底測了什麼?
研究做了一次長達 4 個月的實際部署,40 位使用者、累積 1,872 次對話,同時比較 7 種不同的記憶設定。這不是實驗室裡跑一次考卷,是真的讓人用了四個月。
結果第一個意外的地方:那 7 種設定在傳統的記憶測驗上,分數從 19.7% 一路拉到 70.1%,差了三倍多。但使用者的滿意度沒有跟著動。

78.8% 對上 7.9%:71 個百分點差在哪
研究團隊的推論是:傳統測驗跟使用者的感受,量的根本是兩件不一樣的能力。
- 被喚起的回想(測驗量的):你直接問「我上次說我要辦什麼活動」,它翻得到。論文叫這個 Direct QA。
- 自然融入(使用者感受到的):你沒問,但它自己判斷「這時候該提一下你之前說的事」,然後把舊脈絡接進回答裡。
為了測後者,他們從那四個月的真實紀錄裡挑出「使用者自己提起舊事」的那些片刻,做成一組叫 MemUse 的評測,看 AI 在自然的回答裡有沒有把該用的事實用進去。
關鍵數字就在這:模型固定、脈絡固定,同一套系統在 Direct QA 上考 78.8%,但在對話裡只用上其中 7.9% 的事實,中間斷掉 71 個百分點。而且在這些片刻裡,跟使用者滿意度有關的是「自然融入」,不是 Direct QA 的分數。

換成人話:你的 AI 不是失憶,是它沒想到要拿出來用。那些你以為它「忘了」的事,其實好好躺在記憶裡,只是它沒判斷出「現在該提」。
為什麼這件事對一般人有感
因為我們平常對記憶功能的期待,剛好就是後面那個。沒有人會沒事去考 AI「我三個月前跟你說我小孩幾歲」,我們期待的是:我講一件事的時候,它自己知道要接上之前的脈絡。研究量到的落差,正好就是這份期待落空的地方。
ChatGPT 記憶功能怎麼用才有效?我自己的 3 個做法
看完這份研究我最有感的一句話是:AI 是處理材料的地方,不是存放材料的地方。這句是我之前備課時想通的,剛好被這份研究從另一個角度講了一次——它記得住,不代表它會拿出來用,那你就別把「拿出來用」這件事外包給它。

1. 材料直接貼,不要考它記性
要它分析一份資料,就把資料貼進去,不要問「你還記得我上次給你的那份嗎」。前者是零風險,後者是在賭那 7.9%。這也是我在把 NotebookLM 串成 AI Agent 的長期記憶那篇裡的核心邏輯:資料放在一個你隨時翻得到的地方,要用的時候撈出來給它,比期待它自己想起來可靠得多。
2. 常用脈絡寫成一份固定檔,每次開場貼上
你是誰、在做什麼工作、給誰看、要什麼格式,這幾件事幾乎每次都要講。與其每次重打,不如寫成一份固定的檔案,開新對話就貼上去。這跟我之前寫過的〈教過 AI 的事它都忘?agents.md 是什麼〉是同一個原理——把該記的事寫在你手上的檔案裡,而不是寄望在它的記憶功能裡。
3. 開口先點名舊脈絡,再叫它反問你
這是我現在最常用的開場:先說「延續我上次那份給主管看的報告」,把舊脈絡直接點名,然後把「誰要看、要幹嘛、多久、交什麼」一次講完,最後補一句「動手前先問我問題,問到你覺得夠了再開始」。
我實際用的長相大概是這樣:
「延續我上次那份給主管看的報告。我要做一份給非技術同仁的 AI 入門講義,40 分鐘、要能照著操作。動手前先問我問題,問到你覺得夠了再開始。」
差別在哪?脈絡是我主動給的,不是等它自己翻。研究量到的那 71 個百分點,就是「等它自己翻」的失敗率。你提一句,它就用得上。
AI 記憶功能要不要關掉?先看這 3 件事
看完研究別急著把記憶功能關掉,有幾點要放在心上:
- 這是一份研究,不是某個產品的評測。論文測的是對話式 LLM 的記憶系統與 7 種設定,沒有點名任何一個市面產品,所以別直接推論成「某某家的記憶功能只有 7.9%」。
- 樣本規模要看清楚。40 位使用者、1,872 次對話、4 個月,以真實部署來說算紮實,但畢竟不是幾十萬人的大規模統計。
- 記憶功能不是沒用,是別把它當主力。它省下的是你重複交代的力氣,不是幫你保管重要材料。真正重要的東西,還是要留一份在你自己手上。
小結
這份研究最值得帶走的,其實不是那兩個數字,而是它把問題重新定義了一次:評估 AI 記憶,不該只問「記不記得」,要問「該用的時候用不用得上」。
對我們這些每天在用 AI 的人來說,結論很實際:脈絡自己給,別等它想起來。今天就挑一個你最常問 AI 的任務,把開場那段脈絡寫成固定的一段話存起來,下次直接貼——這一步大概花你 10 分鐘,但接下來每一次對話都在省。
延伸閱讀
- 用 AI 還是覺得卡?兩個我自己摸出來的心法:上下文工程 + Chat→Cowork→Agent 三階段
- 教過 AI 的事它都忘?agents.md 是什麼:4 步驟把 ChatGPT Work 從聊天機器人變同事
本文整理自:arXiv 原始論文〈MemUse: Moving Memory Evaluation from Direct QA to Natural Integration in Long-Term Human-AI Conversation〉,arXiv:2608.24189,2026 年 8 月 25 日發表。原文連結:https://arxiv.org/abs/2608.24189。文中所有數據皆取自論文摘要,個人做法為本站自行整理。
留言
張貼留言