AI 只會整理現成資料?OpenAI 用 2,000 美元的 token,解開 10 題卡了十年的數學難題

2026 年 8 月 1 日,OpenAI 在官網一次公布 10 項數學與理論資訊科學的新結果,每一題都是「至少十年沒有人推進」的公開難題。真正讓我停下來的不是題目有多難,而是三個細節:解法來自還沒發表的內部模型 Astra、找出解法的 token 成本換算大約只要 2,000 美元,以及 OpenAI 自己主動說「這些論證是 AI 生成的,不該掛人類作者的名字」。

OpenAI 公布 10 項數學與理論資工新結果

這件事是誰說的、什麼時候說的

來源是 OpenAI 官方網站 2026 年 8 月 1 日發表的〈Ten advances in mathematics and theoretical computer science〉。不是媒體轉述,是原廠自己貼出來的。

他們在文章裡先回顧了一段脈絡:今年 5 月,他們曾經公布一個「AI 生成的反證」,推翻了 Erdős 單位距離猜想,那也是在評估一個還沒發布的模型時發現的。這次是一次公布 10 題,範圍橫跨高維幾何、編碼理論、算術電路複雜度、群論、算子代數、量子複雜度、格密碼學、極值組合。

OpenAI 自己這樣定位這件事:「數學論證本身由我們的系統生成,我們負責論文的整理與正確性。」這句話後面藏著一個很大的態度轉變,等一下會講到。

OpenAI 官方公布了什麼
官方發布重點整理(本站自製資訊圖)

為什麼我覺得這件事跟只用 AI 寫文案的人也有關

大部分人現在用 AI,做的都是「整理已經存在的東西」:整理會議紀錄、改寫一封信、把長文壓成重點、生一張圖。這些事的共同點是——答案本來就在世界上,AI 只是幫你找出來、排整齊。

這次不一樣的地方在於,這 10 題的答案本來不存在。沒有人寫過,網路上查不到,AI 也沒辦法從資料裡「抄」出來。這是從「整理已知」跨到「產出未知」的一步。

我在課堂上最常被問的一句話是:「AI 會不會取代我?」我以前的回答是「它只是工具」。看完這篇,我覺得回答要再修一次:它已經不只是工具,比較像一個能力很強、但需要你出題目、幫它驗收的協作者。

3 個數字,先把規模感抓住

官方文章裡有幾個數字很值得記下來:

  • 10 題:每一題都是至少十年、多數是更久沒有進展的公開問題,而且都是各自數學社群真的在乎的題目。
  • 約 2,000 美元:找出這些解法所需要的 token,用 Sol API 的價格換算大約是這個數。十年沒人解開的題目,運算成本大概是一台筆電的錢。
  • 10 萬名:OpenAI 同步在推 ChatGPT for Academic Researchers,讓 10 萬名科學家與數學家免費用他們最好的模型。

2,000 美元這個數字最刺激。因為它代表「多試幾次」的門檻已經低到不像話——以前一個猜想要花掉一位教授好幾年,現在可以用一個週末的預算,讓模型去撞好幾輪。

3 個數字看懂 OpenAI 這次的數學成果
三個關鍵數字(本站自製資訊圖)

10 題各自在解什麼?挑 4 個講人話

題目名稱看起來都很嚇人,我挑幾個比較有畫面的:

1. 高維球堆積

想像你要把一堆彈珠塞進箱子,怎麼塞最密?這題在三維空間很直覺,但數學家問的是「在 24 維、100 維呢」。這次的結果把密度上界推進到 Cohn–Elkies 門檻。這不是純理論——球堆積跟通訊編碼、資料壓縮是同一家人。

2. 二元碼與球面碼

白話講就是:在一條會出錯的線路上傳資料,最多能塞多少組彼此不會被誤認的訊號?這次把上界做了指數等級的改進。你手機收訊不好還聽得清楚對方講話,底層就是這套學問。

3. 最近向量問題

這題跟後量子密碼學直接相關。現在全世界在換的「抗量子加密」,安全性建立在「格問題很難解」這個假設上,這次給出了多項式因子的近似困難度結果。做資安的人應該要看一眼。

4. 多色 Ramsey 數與極值圖論

解掉了 Erdős 問題 183、146、180。Erdős 是二十世紀留下最多未解問題的數學家,這些編號題目就像是他留給後人的作業本,一題一題被翻開。

最值得學的不是解題,是他們怎麼「驗收」

如果只看到「AI 很強」,這篇就白讀了。我覺得真正該抄回來用的是他們的驗證流程:

  1. 模型產出論證:由內部版本的 Astra 生成數學論證。
  2. 人整理成論文:由人搭配同一個模型,把論證寫成可讀的手稿。
  3. 形式化成證書:再讓模型用 Lean 把每一個論證形式化,程式碼公開在 GitHub(openai/ten-proofs)。Lean 是一套數學證明驗證器,通過了就代表邏輯上沒有偷渡。
  4. 公開思考過程:每一題都附上模型自己的思路敘述,讓別人可以檢查它是怎麼走到答案的。

「產出 → 人類整理 → 機器驗證 → 過程公開」,這四步就是一條完整的品管線。回到我們的日常,道理一模一樣:AI 幫你算出來的數字,要能回到原始報表對得上;AI 幫你寫的話術,要能對得上官方規格。沒有憑據的 AI 產出,只是講得很順的猜測。

OpenAI 主動談的那件事:署名要誠實

這篇文章有一整段在講「對數學社群的責任」,我覺得比成果本身更重要。

他們寫得很直接:把一個完全由 AI 系統生成的證明宣稱為人類作者,會同時誤導兩件事——低估系統的貢獻,也扭曲了真正人類智識工作的本質。他們也提到,理解並尊重那些對此有疑慮的人,包括 Leiden 人工智慧與數學宣言的連署者。

一家做模型的公司,主動跳出來說「這不是我們人做的」,這在現在的環境裡並不常見。

對上班族的三個啟示
三個可以帶回工作現場的啟示(本站自製資訊圖)

我自己怎麼用:AI 的上限,是你的專業

我最近在準備一堂 AI Agent 的入門課,課裡我一直想跟同仁講清楚一件事:Agent 能做到多深,其實取決於你的想像力、工作能力,還有你原本的專業。

同樣一句「幫我做一份簡報」,IT 同事懂架構,他能要求 AI 用特定的方式把程式寫出來;設計背景的人熟悉 banner 的表現手法,他丟進去的 know-how 會讓成果完全不同。工具都一樣,差別在於你原本站在哪裡。

這次數學這件事是同一個道理的極端版:模型很強,但題目是數學家挑的、正確性是人負責的、要怎麼放進學術脈絡也是人要做的。我在做教材的時候也一樣,我會把自己的想法先講進去,再讓 AI 幫我總結,產出的東西才會貼近我真正想表達的事——不然它就只是網路內容的整理。

另外一個我一定會跟學員說的,就是署名。你用 AI 生了一段文案、做了一張圖、跑了一份分析,在內部分享的時候就說是 AI 做的,你負責的是判斷跟驗收。這不是謙虛,是把責任邊界講清楚——哪天出錯了,大家才知道要回頭檢查哪一段。

套用前,有幾點要注意

  • 這 10 個結果還在等數學社群檢驗。 OpenAI 自己也說希望社群深入討論、把它放進脈絡裡。Lean 驗證保證的是「邏輯沒有跳步」,不保證這個結果有多重要。
  • 別把「AI 能解數學難題」直接推論成「AI 能取代你的工作」。 數學是有標準答案、可以被機器驗證的領域,你手上多數的工作不是——客人的情緒、現場的判斷、跨部門的協調,沒有 Lean 可以驗。
  • 成本數字要看清楚前提。 2,000 美元是「找出解法所需要的 token」,不包含訓練模型、也不包含前面失敗的嘗試與研究人員的時間。
  • Astra 還沒正式發布。 官方寫的是「內部版本」,所以你現在打開 ChatGPT 不會拿到同一個東西。

小結

這篇我最想留下的是三句話:AI 已經從「整理已知」走到「產出未知」;沒有驗證流程的 AI 產出,不能當結論用;AI 做的就寫 AI 做的,責任邊界要自己劃清楚。

回到你我的工作現場,明天就可以做的一件小事:找一份你最近讓 AI 幫忙做的東西,問自己一句「如果有人要我證明這是對的,我拿得出憑據嗎?」拿不出來,就補上。


本文整理改寫自:OpenAI 官方部落格〈Ten advances in mathematics and theoretical computer science〉,2026 年 8 月 1 日發表。Lean 證明程式碼公開於 openai/ten-proofs。文中提到的 5 月 Erdős 單位距離猜想反證,見 OpenAI〈AI-generated disproof〉。

留言