AI 記憶功能有用嗎?4 個月實測:記得住 78.8%,聊天時只用上 7.9%

一份 2026 年 8 月 25 日發表在 arXiv 的研究,把 AI 的記憶功能拆成兩件事:「你問它答不答得出來」跟「它自己會不會用上」。同一套系統,前者 78.8%,後者只有 7.9%。這篇把研究看懂,順便講我自己怎麼調整問法。

AI 記憶功能研究解析:記得住卻沒用上,71 個百分點的落差

先講這件事是誰說的

研究論文叫〈MemUse: Moving Memory Evaluation from Direct QA to Natural Integration in Long-Term Human-AI Conversation〉,2026 年 8 月 25 日發表在 arXiv(編號 2608.24189),論文頁上寫著已被 EMNLP 2026 主會議接受。研究團隊把資料集、評分結果跟評分用的提示詞全部公開在 GitHub 上,你想自己驗算也可以。

他們問的問題很白話:「記憶測驗考得好的 AI,用起來就真的比較好嗎?」

這份研究到底測了什麼?

研究做了一次長達 4 個月的實際部署,40 位使用者、累積 1,872 次對話,同時比較 7 種不同的記憶設定。這不是實驗室裡跑一次考卷,是真的讓人用了四個月。

結果第一個意外的地方:那 7 種設定在傳統的記憶測驗上,分數從 19.7% 一路拉到 70.1%,差了三倍多。但使用者的滿意度沒有跟著動。

這份研究怎麼測的:4 個月、40 位使用者、1872 次對話、7 種記憶設定
研究的實測規模(本站自製資訊圖)

78.8% 對上 7.9%:71 個百分點差在哪

研究團隊的推論是:傳統測驗跟使用者的感受,量的根本是兩件不一樣的能力。

  • 被喚起的回想(測驗量的):你直接問「我上次說我要辦什麼活動」,它翻得到。論文叫這個 Direct QA。
  • 自然融入(使用者感受到的):你沒問,但它自己判斷「這時候該提一下你之前說的事」,然後把舊脈絡接進回答裡。

為了測後者,他們從那四個月的真實紀錄裡挑出「使用者自己提起舊事」的那些片刻,做成一組叫 MemUse 的評測,看 AI 在自然的回答裡有沒有把該用的事實用進去。

關鍵數字就在這:模型固定、脈絡固定,同一套系統在 Direct QA 上考 78.8%,但在對話裡只用上其中 7.9% 的事實,中間斷掉 71 個百分點。而且在這些片刻裡,跟使用者滿意度有關的是「自然融入」,不是 Direct QA 的分數。

71 個百分點差在哪:Direct QA 78.8%、自然融入 7.9%
兩種能力的落差(本站自製資訊圖)

換成人話:你的 AI 不是失憶,是它沒想到要拿出來用。那些你以為它「忘了」的事,其實好好躺在記憶裡,只是它沒判斷出「現在該提」。

為什麼這件事對一般人有感

因為我們平常對記憶功能的期待,剛好就是後面那個。沒有人會沒事去考 AI「我三個月前跟你說我小孩幾歲」,我們期待的是:我講一件事的時候,它自己知道要接上之前的脈絡。研究量到的落差,正好就是這份期待落空的地方。

ChatGPT 記憶功能怎麼用才有效?我自己的 3 個做法

看完這份研究我最有感的一句話是:AI 是處理材料的地方,不是存放材料的地方。這句是我之前備課時想通的,剛好被這份研究從另一個角度講了一次——它記得住,不代表它會拿出來用,那你就別把「拿出來用」這件事外包給它。

那我們該怎麼用:材料直接貼、常用脈絡寫成固定檔、開口先點名舊脈絡
三個可以馬上照做的調整(本站自製資訊圖)

1. 材料直接貼,不要考它記性

要它分析一份資料,就把資料貼進去,不要問「你還記得我上次給你的那份嗎」。前者是零風險,後者是在賭那 7.9%。這也是我在把 NotebookLM 串成 AI Agent 的長期記憶那篇裡的核心邏輯:資料放在一個你隨時翻得到的地方,要用的時候撈出來給它,比期待它自己想起來可靠得多。

2. 常用脈絡寫成一份固定檔,每次開場貼上

你是誰、在做什麼工作、給誰看、要什麼格式,這幾件事幾乎每次都要講。與其每次重打,不如寫成一份固定的檔案,開新對話就貼上去。這跟我之前寫過的〈教過 AI 的事它都忘?agents.md 是什麼〉是同一個原理——把該記的事寫在你手上的檔案裡,而不是寄望在它的記憶功能裡。

3. 開口先點名舊脈絡,再叫它反問你

這是我現在最常用的開場:先說「延續我上次那份給主管看的報告」,把舊脈絡直接點名,然後把「誰要看、要幹嘛、多久、交什麼」一次講完,最後補一句「動手前先問我問題,問到你覺得夠了再開始」。

我實際用的長相大概是這樣:

「延續我上次那份給主管看的報告。我要做一份給非技術同仁的 AI 入門講義,40 分鐘、要能照著操作。動手前先問我問題,問到你覺得夠了再開始。」

差別在哪?脈絡是我主動給的,不是等它自己翻。研究量到的那 71 個百分點,就是「等它自己翻」的失敗率。你提一句,它就用得上。

AI 記憶功能要不要關掉?先看這 3 件事

看完研究別急著把記憶功能關掉,有幾點要放在心上:

  • 這是一份研究,不是某個產品的評測。論文測的是對話式 LLM 的記憶系統與 7 種設定,沒有點名任何一個市面產品,所以別直接推論成「某某家的記憶功能只有 7.9%」。
  • 樣本規模要看清楚。40 位使用者、1,872 次對話、4 個月,以真實部署來說算紮實,但畢竟不是幾十萬人的大規模統計。
  • 記憶功能不是沒用,是別把它當主力。它省下的是你重複交代的力氣,不是幫你保管重要材料。真正重要的東西,還是要留一份在你自己手上。

小結

這份研究最值得帶走的,其實不是那兩個數字,而是它把問題重新定義了一次:評估 AI 記憶,不該只問「記不記得」,要問「該用的時候用不用得上」。

對我們這些每天在用 AI 的人來說,結論很實際:脈絡自己給,別等它想起來。今天就挑一個你最常問 AI 的任務,把開場那段脈絡寫成固定的一段話存起來,下次直接貼——這一步大概花你 10 分鐘,但接下來每一次對話都在省。

延伸閱讀


本文整理自:arXiv 原始論文〈MemUse: Moving Memory Evaluation from Direct QA to Natural Integration in Long-Term Human-AI Conversation〉,arXiv:2608.24189,2026 年 8 月 25 日發表。原文連結:https://arxiv.org/abs/2608.24189。文中所有數據皆取自論文摘要,個人做法為本站自行整理。

留言