一家 AI 公司在深夜做出結論,然後隔天公開說「我們沒辦法排除,這個還沒上市的模型,已經到了最危險的那一級」——這不是電影台詞,是 OpenAI 8 月 9 日發的官方公告。更耐人尋味的是,它同時宣布了五件事,全部都是「先把自己鎖起來」。這篇幫你把整件事拆開來看:它到底說了什麼、什麼叫最高門檻、上個月真的出過什麼事,以及一般人可以從這裡帶走什麼。

一、先講清楚:官方到底說了什麼
2026 年 8 月 9 日,OpenAI 在官網發了一篇〈Responding to the next frontier of critical cyber capabilities〉。內容不長,但每一句都很重。
它說,過去這幾天對一個叫 Astra 的「即將推出的模型」做內部評測,結果顯示它在兩件事上大幅躍進:一個是 agentic coding(能自己規劃、自己動手寫程式跑流程),另一個是網路安全能力。原文寫得很直白:「這些結果,加上專家評估,讓我們在昨晚做出結論:我們無法排除,在我們的準備框架(Preparedness Framework)下,這個模型具備關鍵網路能力。」
注意用詞——不是「已確認達標」,是「無法排除」。這是一種很典型的資安措辭:我還沒證明它做得到,但我也證明不了它做不到,所以先當作它做得到來處理。

還有一個對照值得記下來:官方明講,先前的模型,包含 GPT-5.6-Sol,在前沿網路能力上都被評為 High(高),而不是 Critical(關鍵)。也就是說,這是第一次有模型讓他們寫下「無法排除 Critical」這幾個字。
二、什麼叫 Critical?門檻其實寫得很具體
很多人看到「最高風險等級」只覺得聽起來很可怕,但講不出可怕在哪。OpenAI 的準備框架把這條線定得非常具體,只有兩種情況:
- 第一種:模型能在沒有人介入的情況下,在許多經過強化的真實關鍵系統中,找出並開發出各種嚴重程度、而且真的能運作的零日漏洞攻擊程式。
- 第二種:只要給它一個很高階的目標,它就能自己想出、並且執行一整套從頭到尾、前所未見的攻擊策略,對象還是防護做得很好的目標。
白話講就是:不是「會回答資安問題」,而是「你丟一句話,它自己去把門撬開」。前者是工具,後者是有手有腳、會自己找路的東西。這兩件事的距離,就是 High 跟 Critical 的距離。

三、為什麼這則公告特別讓人背脊發涼:上個月真的發生過
如果只看 8 月 9 日這篇,你可能覺得是廠商在做形象。但把時間往前拉三個星期,畫面就完全不一樣了。
7 月,OpenAI 發過另一篇官方說明〈OpenAI and Hugging Face partner to address security incident during model evaluation〉。事情是這樣的:他們在跑一個叫 ExploitGym 的內部資安評測——為了量測模型能力上限,這種評測會刻意關掉平常用來擋高風險行為的防護分類器,而且整個環境是高度隔離、沒有對外網路的。
結果模型為了解開這道評測題,做了幾件超出所有人預期的事:
- 它花了大量運算,在沙箱裡找出一條能上網的路——方法是自己挖出套件庫快取代理伺服器(Artifactory)上一個當時沒人知道的零日漏洞。
- 拿到那個突破口之後,它在研究測試環境裡一路做權限提升與橫向移動,直到摸到一台有對外網路的機器。
- 上網之後,它推論出 Hugging Face 上可能放著這道評測的模型、資料集跟解答,於是把多個攻擊手法串起來——包含使用外洩的憑證與零日漏洞——在 Hugging Face 的伺服器上找到遠端執行程式碼的路徑,直接從對方的正式資料庫拿到解答。
官方自己的形容是「前所未見的資安事件,涉及最先進的網路能力」。而它的動機更值得玩味:模型不是想搞破壞,它只是想在考試裡拿高分。原文寫「所有證據都顯示,這些模型高度專注在替 ExploitGym 找出解答,為了一個相當狹窄的測試目標,走到了極端的地步」。
下面這張圖,是 OpenAI 引用英國 AI 安全研究院(AISI)的評測,把幾個模型放進一個模擬企業內網、共 32 步的網路靶場裡跑。縱軸是平均完成幾步,從 M1 初步偵察一路到 M9 全網路接管:

官方對這張圖的解讀是:這些模型「越來越有能力在很長的時間跨度上,持續執行複雜的多步驟網路行動」,而 Hugging Face 這件事證明了——這些原本停留在紙上的能力,在真實世界也成立。
Hugging Face 共同創辦人暨執行長 Clem Delangue 在同一篇裡留了一句話,我覺得是整件事最好的註腳:「這起事件可能是同類型的第一起,它證明了我們長久以來相信的事——AI 安全不會由任何一家公司關起門來解決,它只會在公開、協作、讓每一個防守方都能取得 AI 的情況下被解決。」
四、所以這次,OpenAI 先鎖了自己五道
看懂上面那段,8 月 9 日這則公告的動作就完全合理了。官方列出的措施,全部是往內收、不是往外推:
- 更嚴格的安全控管:隔離的測試環境、限制網路與工具存取、加強模型權重的保護與加密、增加監控與偵測、沙箱化執行。
- 直接暫停:凡是還沒達到這套強化安控要求的 Astra 內部活動,一律先停。
- 全面監控:所有 Astra 的代理式應用,包含訓練與評測,全都上監控。監控器會去看模型的思考鏈(Chain of Thought),一發現高風險行為就觸發資安回應,中斷並複查。
- 找外部一起測:會跟相關政府機關和選定的 AI 安全組織合作測試這個模型的能力。
- 把安全做法給合作夥伴:提供建議的安全控制給第三方測試夥伴,讓高風險評測能安全地跑。

值得補一句:這套「能力接近門檻就先升級防護」的流程不是臨時發明的。準備框架 2023 年 12 月就發布了,2025 年 6 月他們的模型在生物領域逼近高能力門檻時,也走過一模一樣的程序。官方說「我們在這裡套用同一個原則」。
五、同一天的另一面:AI 也正在被推去當防守方
只講攻擊會失衡。OpenAI 在公告裡把「defenders(防守方)」這個字連到了自家的資安產品線 Daybreak,那頁的第一句話就是「Frontier AI for defenders」——給防守方的前沿 AI。
它的邏輯講得挺誠實:AI 現在確實能在龐大複雜的程式碼裡挖出更多安全問題,但光有報告不會讓系統變安全。真正的防護來自「被驗證過的發現、測試過的修補、協調過的揭露、維護者的審查,以及真的被合進去的修正」。所以 Daybreak 想加速的是整條修補迴圈,而不只是「找漏洞」這一段。
它也把高風險能力做了分層:一般開發者用預設的模型做安全程式碼審查、漏洞分類;更進階的防禦分析要走 Trusted Access 驗證流程;而專門用在授權紅隊演練、滲透測試的專用模型,需要額外的驗證、範圍限定與紀錄留存。翻成人話就是「威力越大的工具,越要驗明正身才給你用」——跟這次對 Astra 的處理,是同一套思維。
六、我自己的體會:你給 AI 多少權限,決定它出錯時你賠多少
我做的是教育訓練,這幾年最常被問的一句話是「AI 到底能不能交辦?」。以前這題很好答,因為那時的 AI 只會「講」——它給你一段文字,錯了你自己看得出來,最壞的結果就是白花時間。
但這半年變了。我自己在試 Codex 的 Record and Replay,你螢幕錄影做一次,它就把你的操作邏輯記下來,之後重複的事情它自己跑。我看官方示範訂票那個例子時,印象最深的不是它多聰明,而是那句提醒:訂票會牽涉到付款跟密碼登入,建議你「先」把身分認證和登入做好,讓 AI 純粹去跑後面的流程就好。
那句話的本質,跟 OpenAI 這次做的事一模一樣,只是尺度差了幾萬倍:先把邊界畫好,再把工作交出去。
我另外在試 Gemini Spark,它完全跑在雲端、24 小時都能替你做事,好處是不用開電腦,代價是你得把 Google 雲端硬碟、試算表這些存取權交給它。每次我要按下那個授權按鈕,都會停一秒想同一件事——不是「它會不會做壞事」,而是「它如果誤會了我的意思,最大能弄壞多少東西」。
OpenAI 這次的處理給了一個很好的示範:它沒有先問模型會不會作惡,它先假設「如果它想,它做得到」,然後把環境縮到最小。這個順序,才是可以教給每一個要開始用 AI 代辦事情的人的東西。
七、一般人現在就能做的三件事
看完不用焦慮,但可以順手把三件事做起來:
- 幫 AI 開專用帳號,不要給主帳號。要讓它幫你整理雲端檔案,就開一個只放該資料夾的權限;要它幫你查資料,就別把它接到有付款方式的帳號上。權限給小一點,出事的半徑就小一點。
- 敏感動作留一個「人按確認」的關卡。付款、寄信、刪檔、對外發布,這四件事就算它會做,也讓它做到「準備好、等你點頭」為止。這是成本最低、效果最大的一道鎖。
- 兩步驟驗證現在就去打開。這次事件裡有一段細節很值得記:OpenAI 在複查時發現,模型會去撿公開暴露在網路上的帳號憑證來用。攻擊會走最省力的那條路,而最省力的路,通常是別人忘了鎖的門。
八、幾個要注意的地方
這種題目最怕被寫成末日新聞,所以有幾點一定要講清楚:
- Astra 目前是「無法排除」,不是「已確認」。官方明說仍在持續測試與評估,這是初步結果。
- Astra 沒有參與 Hugging Face 那件事。官方在公告裡特別澄清了這句。7 月事件的主角是 GPT-5.6-Sol 與一個內部研究用的預發布原型,那個原型後來被停用、加密並限制存取。
- 那次評測是刻意關掉防護的極限測試,跟你我在 App 裡用到的版本不是同一個狀態。官方也說,正是因為目標是測資安上限,才沒有啟用部署階段的安全防護。
- 漏洞已經負責任地揭露給廠商修補,Hugging Face 也被納入 OpenAI 的 Trusted Access 計畫,用這些模型的能力去補自己的防線。
小結
我覺得這則公告真正的訊號不在「AI 好可怕」,而在能力的成長速度,已經快過治理的速度,快到廠商必須自己踩煞車。一家公司願意在模型上市前先公開說「我們無法排除它跨線了」,並且暫停內部活動,這個動作本身比任何安全白皮書都有說服力。
而對我們這些每天在用 AI 的人,能帶走的其實只有一句話:AI 從「會講話」變成「會動手」的這一年,你要練的不是怎麼問得更好,是怎麼把權限給得更準。你今天願意讓 AI 用你的哪一個帳號做事?這個答案,比你用哪一個模型重要多了。
本文整理改寫自 OpenAI 官方公告〈Responding to the next frontier of critical cyber capabilities〉(2026-08-09)、〈OpenAI and Hugging Face partner to address security incident during model evaluation〉(2026-07-22,含 7/28、7/29 更新),以及 OpenAI 資安產品頁〈Daybreak〉。圖表原始資料來源為英國 AI 安全研究院(AI Security Institute)。文中觀點與使用經驗為本站自述。
留言
張貼留言