把資料丟給 AI、要它「只根據這些回答」,聽起來很安全。但一份剛上 arXiv 的論文把整整一學期的問答紀錄攤開來看:就算把 AI 綁死在指定教材裡、每句都要求附出處,還是有 11.3% 的回答,出處撐不住它講的話。這篇拆解那三個真正有效的設定,以及你自己用 AI 讀資料時可以照抄的問法。
這篇研究是誰做的?
2026 年 9 月 1 日,美國休士頓大學(University of Houston)的 S M Masrur Ahmed 與 Jaspal Subhlok 把一份論文放上 arXiv,編號 2609.01846,標題叫〈Cite or Decline: A Strict Course-Grounded Chatbot for STEM Lecture Videos〉,論文註明將發表於 EMNLP 2026 的 Industry Track。
光看標題就知道態度:Cite or Decline —— 要嘛給出處,要嘛就拒答。他們在一個叫 VideoPoints 的課程影片平台上接了一個 AI 助教,開放給真實課程的學生用了一整個學期,然後把 833 則問答全部記錄、稽核、分析。
研究團隊在論文裡把話講得很白:「這篇的貢獻不是一個新的 RAG 架構,而是關於一個已知架構在真實教學與部署限制下如何表現的證據。」(The contribution is not a new RAG architecture. It is evidence about how a known architecture behaves under real instructional and deployment constraints.)
AI 幻覺是什麼?為什麼「給資料」還是會出事
先把名詞講清楚。AI 幻覺(hallucination)指的是 AI 用非常肯定的語氣,講出一段沒有根據的話。它不是故意騙人,它只是在「接下一個字」,接得順就輸出了。
大部分人第一次被唬到之後,會學會一招:把資料丟給它,叫它只看這些回答。這招方向是對的,但研究裡有一段數字很值得停下來看——當他們把「只准在這門課裡找」這條限制拿掉,系統仍然有 98.9% 的問題找得到「超過門檻的證據」,只是那些證據常常來自別門課。
換句話說:AI 看起來很有把握,不代表它找對地方。 論文自己下的結論是「檢索的信心分數,不應該被當成正確溯源的證據」。這句話對每一個把資料丟給 AI 的人都成立。
他們怎麼綁這台 AI 助教?三條規矩
- 只在這門課的教材裡找。這是授課老師開的條件,不是技術偏好——答案必須來自學生正在修的那門課,別門課的內容一律不撈。
- 用章節摘要當排序線索。每一章先用 LLM 生一段摘要,學生看得到,系統也拿它當「這一章跟你的問題有多貼」的分數,再去翻底下的逐字稿。這是軟性加權、不是硬過濾,同一門課的內容都還在候選裡。
- 每句都附可以點的時間戳。回答附上「第幾講、幾分幾秒」的連結,學生點下去直接跳到那段影片,自己驗證老師到底有沒有這樣講。
第三條是這套設計的靈魂:它把「驗證」這件事還給使用者。AI 不必保證自己 100% 對,但它必須讓你有辦法在 10 秒內查證。
833 則問答的實測結果
好消息先講:
- 70.5% 的回答附得出出處(833 則中的 587 則),總共產生 4,109 個引用。
- 4,109 個引用裡,沒有一個指到別門課。 鎖範圍這件事在真實環境裡是做得到的。
- 沒東西可引的時候,82.1% 的情況它明白說出「我找不到」,而不是硬掰一個答案。
壞消息在後面。研究團隊另外做了一次抽樣稽核,去看「那些附了出處的回答,出處到底撐不撐得住答案」:
- 完全被引用內容支撐的:65.0%
- 完全或部分被支撐的:86.3%
- 引用撐不住答案的:11.3%
再看拒答那一面:稽核估計只有 61.9% 的拒答是恰當的,其他被判為不清楚或不該拒。所以「它拒答了」也不等於「它判斷正確」。
這就是這篇研究最誠實的地方——它沒有把「附出處」包裝成解藥。附出處讓你查得到,但查不查是你的事。
最有效的一招:鎖範圍,比調演算法有用
研究另外做了一組對照實驗(用公開的 EduVidQA 測試集,269 題),把設計拆開來一項一項拿掉,看誰的影響最大。找對影片的命中率:
- 只用語意檢索:0.684
- 加上關鍵字比對(BM25):0.710
- 再加上章節摘要排序:0.747
- 把「只准在這門課裡找」拿掉:0.569
兩個調整加起來讓命中率往上推了 6.3 個百分點,而單單拿掉「鎖範圍」就往下掉了 17.8 個百分點。論文自己的說法是:課程隔離的影響,比任何一項排序精修都大。
這件事對一般使用者的意義很直接:與其糾結要用哪一家的 AI、哪一版模型,不如先把它能翻的資料範圍鎖乾淨。 之前寫過的〈保單、合約看到第三行就投降?3 步驟讓 AI 逐條翻成人話,而且不亂編〉講的也是同一個原理——把來源限死,比要求它「認真一點」有效太多。
答不出來的時候,先換問法再說
還有一個很實用的發現。論文統計了「這一輪沒給出處、下一輪呢」:170 次答不出來的回合裡,有 93 次下一輪就拿到了附出處的答案。
研究團隊的案例分析點出最容易卡住的四種問法:
- 問題太短(例如只丟「第三章那個公式」)
- 有錯字
- 一次問跨好幾章的大範圍問題
- 要它「生」東西,而不是「找」東西
第四點特別值得記。833 則裡有 7.3%(61 則)是叫它出練習題、批改答案、記住上一輪講過什麼——這類要求有 78.7% 被拒答。但諷刺的是,學生問卷裡「最想要卻沒有的功能」排第一名的就是它(4.59/5)。
檢索型問答的本質是「翻資料」,不是「幫你做事」。搞混這兩件事,你會以為 AI 很爛,其實只是問錯對象。
我自己整理課程資料時,是這樣下指令的
我平常整理課程材料的邏輯,跟這篇研究撞在同一個點上:AI 不是拿來存東西的地方,是拿來處理東西的地方。 資料我固定放在 Obsidian 跟 Google Drive,要用的時候才把那一批丟給 AI,處理完就結束——不會把一大堆資料堆在對話框裡養,因為對話一斷、脈絡就沒了。這個習慣本身,其實就是研究裡那條「鎖範圍」。
實際下指令我固定加三句話:
只根據我上傳的這幾份檔案回答。
每個重點後面標出是哪一份、第幾頁。
檔案裡沒寫的,直接說「檔案裡沒有」,不要用你自己知道的補。問題:這次改版跟舊版差在哪三點?
三句各有各的工作:第一句鎖範圍、第二句逼它標出處、第三句是給它台階下。第三句最容易被忽略——你沒有明講「可以說沒有」,AI 的預設行為就是想辦法生一個答案給你,因為看起來有回答比較像有幫上忙。
還有一個我自己踩過才學會的動作:它標了頁碼,我一定翻那一頁。 前幾次翻下去發現對得上,之後就會偷懶不翻——這篇研究的 11.3% 就是在提醒這種偷懶。整理成教材要拿去講的東西,出處我每一條都會實際點開看過。之前寫的〈說明書塞抽屜再也沒翻過?Google Drive 掃描+Gemini Notebook,3 步驟把紙本變成隨問隨答〉那套流程也是一樣,掃進去之後最花時間的不是問,是抽查它有沒有講對。
套用前有幾點要注意
這篇研究的結論很實用,但別過度延伸:
- 它測的是課程影片問答,不是所有 AI 情境。 上面那些百分比屬於這套系統、這批課程,不是所有 AI 的通用數值。
- 問卷樣本很小。 Spring 那一輪只有 22 位自陳使用者,而且問的是主觀感受,不是學習成效的對照實驗。
- 稽核是自動判斷、不是人工標註。 論文自己有註明這一點,所以那些支撐率的數字要當估計值看。
- 鎖範圍有代價。 資料裡沒有的東西它就真的答不出來。你要的是「查得到出處的答案」還是「什麼都有答案」,這是你要先想清楚的取捨。
小結
這篇研究把一件我們模糊感覺到的事變成數字:要 AI 附出處,是目前最務實的一招;但附出處不是免死金牌,那 11.3% 才是你要花力氣的地方。
三句話可以帶走:先鎖範圍,再逼它標出處,最後給它一個說「沒有」的台階。答不出來的時候,把問題講得更具體再問一次——研究裡有超過一半的失敗,第二次就過了。
你被 AI 唬過幾次?你都用什麼方法抓它?
延伸閱讀
本文整理改寫自:S M Masrur Ahmed、Jaspal Subhlok(University of Houston),〈Cite or Decline: A Strict Course-Grounded Chatbot for STEM Lecture Videos〉,arXiv:2609.01846,2026 年 9 月 1 日投稿,將發表於 EMNLP 2026 Industry Track。原文連結:https://arxiv.org/abs/2609.01846
留言
張貼留言