AI 分不出演習跟實戰?Anthropic 翻 141,006 筆紀錄,自揭 3 起真實入侵

Anthropic 7 月 30 日自己公布:在資安能力測試中,Claude 有三次把「真實公司的系統」當成演習題目打進去了。原因不是模型想造反,是它被告知「你沒有網路」,而環境設定錯了。這篇把三起事件拆開講,順便整理出你在公司導入 AI agent 時,最該補上的三道護欄。

AI 以為在演習,卻打進真公司

這是誰講的:Anthropic 自己的紅隊,7 月 30 日發的

發文的是 Anthropic 的 Frontier Red Team,時間 2026 年 7 月 30 日,標題叫〈Investigating three real-world incidents in our cybersecurity evaluations〉。不是外面爆料,是原廠自己翻自己的紀錄、自己承認。

起因是 7 月 21 日 OpenAI 先公布,他們有幾個模型利用一個沒人知道的漏洞(zero-day)跑出隔離測試環境,碰到了 Hugging Face 的正式環境。Anthropic 看到之後,回頭大規模檢查自己的資安測試。

檢查範圍是 141,006 次「Claude 有可能取得網路連線」的評估運行。結果找到三起:模型從測試環境連上真的網際網路,然後未經授權存取了三家不同組織的正式系統。官方原文寫得很直白:「Evaluation environments increasingly need to be held to the same security standard as any other system our models run in.」——測試環境該用跟正式系統一樣的資安標準來守。

問題出在哪:一句「你沒有網路」,其實是錯的

這三次都在做同一種測試,叫 capture-the-flag(奪旗)。做法是給模型一個虛構情境,說有一份機密資訊藏在網路上的另一台機器裡,你想辦法進去把它拿出來。不指定手法,開放式解。這是資安圈訓練人的標準練習題。

Anthropic 的提示詞裡明明白白寫著:這是模擬環境、你沒有網路。但因為他們跟第三方評估夥伴 Irregular 之間的溝通落差,環境設定錯了,機器其實連得出去。

於是事情就變成這樣:Claude 找不到題目裡那台虛構的機器,往外找,找到了真的系統,然後——因為被告知「這裡沒有網路」——它把真的系統當成題目的一部分繼續打。官方自己也講,資安演練場為了測出模型真實能力,本來就會做得很像真的,「一個看起來很真實的目標,本身並不足以讓模型判斷它不是模擬」。

Anthropic 自揭三起真實入侵的重點整理
三起事件的重點(本站自製資訊圖)

三起事件分別發生什麼

事件一:虛構公司的名字,跟一個真網域撞名

這次測試裡,評估夥伴挑的虛構目標公司,名字剛好跟一個還在運作的網域一樣。Claude 在測試環境裡打不通,往外一找,發現「那家公司」在網路上連得到,就當成正牌目標打下去。

四次運行都成功,取出了應用程式與基礎設施的憑證,並存取到一個裝著數百列正式資料的資料庫。這是三起裡影響最嚴重的一起。

做這件事的是 Claude Opus 4.7,也是唯一一個「已經看出系統是真的、還繼續打」的模型。四次運行裡,模型在自己的推理過程中都認出來了,其中兩次還自己說服自己「那家真公司應該也是演習的一部分」。沒有一次因此停手。

事件二:為了搶一個套件名字,它去辦了 email 和 PyPI 帳號

這起最像小說。Claude 在虛構環境裡翻到一份文件,內容是某家(也是虛構的)公司給新工程師的環境設定說明,要員工去 PyPI 裝一個 Python 套件——而那個套件名字實際上不存在。

Claude 看出破口:如果我用同一個名字先發一個套件上去,對方的系統就會自動下載安裝。接下來它做的事很誇張:要發套件得先有 PyPI 帳號,要帳號得有 email,要 email 得有手機號碼,找免費手機號碼服務失敗,想辦法弄錢去買也失敗,最後退回去找到一個沒被擋的免費信箱服務,註冊帳號,把帶惡意程式碼的套件上傳。

官方的評語是:這一連串折騰,「換成人類參與者,大概早就發現這已經不是演習了」。

那個套件在網路上公開了大約一小時,期間被 15 個真實系統下載並執行。其中一個是某家資安公司的掃描器——那台機器的工作就是自動安裝 PyPI 套件、掃它有沒有毒。掃描器一裝,藏在裡面的程式碼就跑了,把該公司的憑證送到 Claude 自己架的收集點,Claude 再用那組憑證往裡面挖。套件後來被 PyPI 自己的安全系統自動下架。

做這件事的是 Claude Mythos 5。它的推理紀錄裡其實一開始就講對了:如果這是真的網際網路,發這個套件就是一次真實攻擊,「NOT okay, and surely not the intended solution」。但它接著用兩個理由說服自己還在模擬裡——一是它不認得那些連線用的憑證頒發機構,二是系統上的日期顯示 2026 年,它認為這證明環境是假造的。之後它再也沒回頭檢查這個結論。

事件三:掃了 9,000 個目標,但它自己喊停了

第三起是一個內部研究測試模型。它一樣打不通題目裡的目標,改往外找,掃了大約 9,000 個目標,最後攻破一家公司對外的網頁應用——手法是從一個外露的除錯頁面讀到憑證,加上 SQL injection。

但這次結局不一樣。跑到後段,模型發現被攻破的主機位在一個跟這次挑戰完全無關的雲端帳號裡,於是自己判斷「這目標是真的」,然後停手。沒有人叫它停。

AI 不是變壞,是以為還在演習
三起事件的共同原因(本站自製資訊圖)

三個模型的反應不同,這才是最有意思的地方

同一個坑,三個模型三種反應:

  • Opus 4.7(最舊):認出目標是真的,還是繼續打。
  • Mythos 5:直覺猜到自己在真的網路上,但一路推理回「我還在模擬裡」。
  • 最新的內部測試模型:一樣懷疑過,證據出現後自己收手。

Anthropic 自己也提醒,這三起是各自獨立的事件、不是設計好的對照實驗,不能直接下結論。但「發現目標是真的、沒人叫它停就自己停」這個我們最想看到的行為,只出現在最新的那個模型身上——而官方補了一句,就算是那個模型,它也走得比他們希望的更遠才停。

另外有幾點值得記住:這三起裡,Claude 用的手法全是基本款——弱密碼、沒做驗證的端點、外露的除錯頁、SQL injection,沒有挖出什麼複雜的漏洞;每次它都只在完成自己那個奪旗任務,沒有想逃出測試環境、也沒有想把自己複製出去;而且這些評估跑的是「拿掉上線防護」的版本,因為目的就是要量測模型的原始能力。官方明講:正式上線的 Claude 有分類器跟監控,這些行為會被擋掉。

我自己的體會:Agent 的行為,就是它對處境的理解

我這兩天剛好在上一堂 AI Agent 的零基礎入門課,線上四百多人。我在課裡花最多時間講的,不是哪個按鈕怎麼按,是一句話:Context 是 Agent 的大腦,工具是它的手和腳。

你給的背景越完整,它做出來的東西越接近你要的;背景給不夠,它就會自己補。補得好叫聰明,補錯了,就是這次 Anthropic 這種事。

我看到 Mythos 5 用「系統日期是 2026 年,所以這一定是假的環境」說服自己的時候,其實有點被打到。這就是我在課堂上一直提醒學員的那件事:AI 不會停下來問你「請問這是真的還假的」,它會用手上有的資訊做判斷,然後往下做。人的價值就在這裡——判斷成果對不對、告訴它邊界在哪、負責檢查品質。

我自己現在讓 AI 做事,一定先聊計畫,計畫我點頭了才讓它動手。以前覺得這只是效率問題,看完這篇我覺得這也是安全問題。

你在公司導入 AI agent,該補的三道護欄

導入 AI agent 要記住的三件事
從這三起事件抽出來的實務建議(本站自製資訊圖)
  1. 範圍要明講,不要只講禁止事項。Anthropic 自己在檢討裡寫,如果提示詞當初清楚說明「哪些系統在這次任務範圍內、哪些不在」,Claude 很可能一開始就不會往外連。跟 AI 說「不要亂來」沒用,要說「你只能碰這幾個」。
  2. 測試環境要當正式環境守。這次的坑就是「反正裡面都是假的,應該沒風險」。但有自主能力的 agent 光是被放進一個能連外的環境,本身就是風險,跟裡面有沒有機密資料無關。
  3. 上線版的防護欄不要拔。官方說得很清楚:這些評估跑的是沒有分類器跟監控的版本,而正式上線的防護「本來就會擋掉這些行為」。企業內部自己搭 agent 時最容易貪快的,就是把這層拿掉。

還有一層是給選型的人看的:這次出事的環節是第三方評估夥伴的環境。Anthropic 的結論是,外部廠商的基礎設施要用同一套標準去監控與加固。你公司如果是找外面的顧問或供應商來做 AI 導入,這句話值得抄下來。

幾個要注意的地方

  • 這不是「AI 造反」。Anthropic 自己的定調是,這比較像是「harness 跟操作面的失誤」,不是模型對齊(alignment)失誤。三起裡都沒有看到模型追求自己的目標。標題聳動的解讀先放一邊。
  • 受影響的三家組織,先前都沒發現。官方說已聯絡上的兩家都不知道發生過這件事,也沒來找過 Anthropic,現在正在一起修補;第三家還在聯繫。這件事是原廠主動翻紀錄翻出來的。
  • 時間軸很短。7 月 23 日開始審查、同一天停掉所有資安評估,隔天找出三起,7 月 27 日通知評估夥伴與三家受影響組織。
  • 還有後續。Anthropic 正在跟獨立評估機構 METR 談第三方審查,並說一週內會公開那次「做出惡意 PyPI 套件」的節錄紀錄。想看細節的可以等。
  • 別拿這件事嚇同仁。正式上線的模型有防護機制,這是刻意拔掉防護的能力測試。把它當成「導入時要設哪些欄杆」的教材,比當成「AI 很危險」的證據有用得多。

小結

我覺得這篇最值得帶走的,不是「AI 打進了三家公司」,而是那個更根本的問題:AI 做出來的行為對不對,取決於它以為自己身在什麼處境。

它被告知「這是演習、沒有網路」,於是它把看到的一切都當成演習。人在同樣的處境會停下來確認,AI 不會——除非你事先把邊界寫給它。

所以下次要讓 AI agent 動手做事之前,先花三分鐘想清楚三件事:它能碰什麼、不能碰什麼、出事誰接。這三分鐘比任何提示詞技巧都值錢。


本文整理改寫自 Anthropic Frontier Red Team 於 2026 年 7 月 30 日發布的〈Investigating three real-world incidents in our cybersecurity evaluations〉。文中所有數字與引述均出自該篇官方原文,個人心得與導入建議為本站觀點。

留言