ChatGPT 可以把一份答案寫得更完整,但「答案變好」和「思考變廣」其實是兩種不同能力。OpenAI 最新實驗把這個差別拆得很清楚,也給了我們一套可以立刻使用的 3 個反問。
ChatGPT 會讓人變笨嗎?研究真正問的是另一件事
2026 年 8 月,OpenAI Economic Research 與大學研究團隊公布一項隨機對照實驗。他們找了 1,053 名大一學生,請大家在 45 分鐘內完成一份真實的行銷建議,內容是如何提高校內商品店的知名度與使用率。
學生依班級被分成 4 組:不用 ChatGPT、只用 ChatGPT、只接受因果推理訓練,以及兩種方法一起用。ChatGPT 組使用的模型是 GPT-4o。
這項研究不是在測誰背得比較多,而是在問:當新手面對一個有明確評分標準的任務時,AI 與思考訓練各自會改變什麼?
ChatGPT 擅長的是把答案完成得更好
實驗結果顯示,可以使用 ChatGPT 的學生,在 5 分量表上平均提高 0.86 分。對照組的估計分數是 2.09 分,這個提升幅度不小。
研究團隊拆開內容後發現,ChatGPT 組提出的點子數量更多,文字邏輯更連貫,答案也更接近 3 名領域專家的建議。換句話說,AI 很會把一個還不熟悉領域的新手,快速拉到「看起來比較專業」的位置。
但這裡有一個很重要的差別:點子變多,不等於不同人的點子變得更不一樣。ChatGPT 單獨使用時,並沒有明顯拉開學生之間的想法差異。
因果推理訓練,補的是「為什麼」與「何時失敗」
另一組學生接受的是短時間因果推理訓練。他們會練習把想法拆成原因與結果,說明中間的作用機制,並且找出什麼條件出現時,原本的推論可能不成立。
這組學生在一般行銷評分表上沒有拿到更高分,卻更常解釋「為什麼這個方法有效」以及「什麼情況可能失敗」。更有意思的是,他們提出的想法不只在同一份答案裡更多元,跟其他學生相比也更不一樣。
這代表傳統評分表很容易獎勵一份清楚、完整、符合標準的答案,卻不一定看得見「這是不是一個別人沒想到的方向」。
AI 與思考訓練不是二選一
把兩種方法放在一起看,結論其實不是「禁止學生用 AI」,也不是「全部交給 AI」。
ChatGPT 幫助學生做出更完整、點子更多、邏輯更清楚的答案;因果推理訓練則讓學生更會挑戰假設、思考失敗條件,並且提出更不一樣的方向。兩者可以同時出現,但不代表分數會自動疊加。
| 方法 | 主要提升 | 沒有自動解決 |
|---|---|---|
| ChatGPT | 完成度、點子數量、邏輯連貫、接近專家答案 | 不同人之間的點子多樣性 |
| 因果推理訓練 | 解釋原因、找失敗條件、增加點子差異 | 傳統評分表上的分數 |
| 兩者一起 | 同時保留完成度與較廣的思考 | 不保證額外加分 |
我之前整理過「AI 幫你寫完作業,你學會了嗎?」,當時談的是學習工具要不要直接給答案。這次 OpenAI 的實驗補上更清楚的證據:如果只看最後成品,我們可能會高估一個人真正理解了多少。
我的做法:拿到答案後,再追問 3 句
我在做教育訓練、整理教材時,很常把零散的口述與資料交給 AI。它確實能快速排出架構,甚至整理得比我原本想得更完整。
但排得漂亮,不代表方向一定對。所以我不會只停在第一版答案,而是固定再追問 3 句:
- 你的假設是什麼? 把答案背後沒有說出口的前提挖出來。
- 什麼情況下會失效? 找到這個方法的邊界,不把建議當萬用解。
- 請給我一個完全不同的做法。 刻意離開第一條最直覺、也最容易跟別人重複的路。
這跟我平常讓 AI 在回答前先主動提問的習慣很像。背景交代得越清楚,答案通常越好;但要讓思考真的變廣,還要再多做一次假設與反例的檢查。
這也呼應我之前寫的「AI 時代最值錢的能力,是判斷力」。AI 可以幫你加速,但最後要採用哪一個方向,仍然需要人自己判斷。
這項研究不能直接推論到所有學習情境
這份研究很有參考價值,但不能把結果放大成「所有學生、所有科目、所有工作都一樣」。
- 實驗對象是一所大學的 1,053 名大一學生。
- 任務只有一種:45 分鐘的行銷建議。
- 使用的是 GPT-4o,而且這類行銷知識本來就是模型相對熟悉的領域。
- 研究測到的是一次任務的產出,沒有證明長期學習效果。
所以更準確的說法不是「ChatGPT 會讓人變聰明」或「ChatGPT 會讓人變笨」,而是:在標準明確、模型熟悉的任務裡,AI 很會幫新手縮短跟專家的距離;如果希望培養原創、反例與因果推理,評量方式與訓練方法也要一起改。
小結:AI 負責加速,判斷還是自己練
我覺得這項研究最有價值的地方,是它沒有把問題簡化成「要不要用 AI」。
真正該問的是:我們希望 AI 幫忙的是完成度,還是連思考過程也一起外包?
我的答案很簡單。先讓 AI 幫忙把答案做完整,再用「假設、失效條件、不同做法」這 3 個問題,把自己的判斷力叫回來。
如果今天有一份重要任務,你會先問 AI,還是先自己想 3 分鐘?
延伸閱讀
本文整理自 OpenAI 於 2026 年 8 月 27 日發布的研究說明〈Better answers, broader thinking〉與原始論文〈Training novices to think, or giving them LLMs? Evidence from an RCT〉。
留言
張貼留言