你一定遇過這種狀況:同一個 AI,昨天回答得頭頭是道,今天你問它一份健康檢查報告怎麼看,它突然變得又客氣又空洞,講一堆「建議諮詢專業醫師」。你以為是模型退步了,其實不是。2026 年 8 月 7 日 Anthropic 官方發了一篇文章,直接把這件事攤開講:那不是模型變笨,是一道安全閥在你看不到的地方,先把你的問題攔下來、換一顆能力比較弱的模型來回答你。而這次他們把這道閥門重新校準,生物相關的誤擋大約少了 85%。

誰講的?Anthropic 官方,8 月 7 日
這篇叫〈Improving Fable 5's biology safeguards〉,發在 Anthropic 官方新聞頁,日期是 2026 年 8 月 7 日。內容講的是他們最新的模型 Fable 5,在「生物」這個領域的安全防護做了一次調整。
官方的說法很直白:
「We're making updates to Claude Fable 5's biology safeguards in a way that substantially reduces false positives.」(我們調整了 Fable 5 的生物安全防護,大幅減少誤判。)
還有一句我覺得更關鍵,講出他們為什麼願意動這一刀:
「We believe the greatest opportunity for AI to positively affect the world is in biology and medicine.」(我們相信 AI 能對這個世界產生正面影響的最大機會,就在生物與醫學。)
這不是行銷稿,是一篇技術說明加自我檢討。他們承認:模型上線時,幾乎所有生物類問題都被擋掉,這個做法「會讓正當使用者很不爽」——原文用的字是 frustrating。
為什麼你會覺得「它今天怪怪的」
先搞懂機制,後面才看得懂他們改了什麼。
AI 公司防止模型被拿去做壞事,用的其中一招叫安全分類器(safety classifier)。它是一個比較小、跑得很快的 AI,站在你跟主模型中間,專門看你的問題有沒有踩到高風險範圍。一旦它認為踩到了,你的問題就不會送給最強的那顆模型,而是被轉給另一顆能力比較弱、比較安全的模型來回答。
Anthropic 給這個動作的名字叫 fallback(回退)。重點來了:整個過程你看不到。畫面上不會跳出「您的問題已被轉送」,你只會覺得答案怎麼突然變得又淺又官腔。

為什麼一開始要擋得這麼寬
官方的解釋是:Fable 5 在某些複雜的生物任務上,已經可以贏過專家。這種能力是雙面刃——它可以真的幫到一個正在開發新療法的研究員,但同一組能力落到有惡意的人手上,官方原文寫得毫不修飾:可能被用在開發生物武器。
更麻煩的是,善意跟惡意在生物領域「很難分」。官方舉了兩個很好懂的例子:
- 活性疫苗:要防哪隻病原體,科學家就得先把那隻病原體養出來。查的東西跟壞人查的一模一樣。
- 降血壓藥 captopril:這個藥的來源,是科學家從蛇毒裡分離出會讓人血壓崩掉的毒性成分。你說這是研究毒物還是研究救命藥?兩個都是。
所以他們選了一個很粗暴但保守的做法:Fable 5 上線時,幾乎所有生物相關的問題全部擋掉。用官方的話講,他們知道這會製造大量「誤判」(false positive),但寧可先這樣,也不想承擔另一邊的風險——因為代價「可能是災難性的」。
換句話說,你被降級不是因為你可疑,是因為當時那道網撒得太大,你剛好走進去了。
這次到底改了什麼?三個動作
官方把過程講得很細,我拆成三步:
- 重寫分類器的「規則書」:他們把分類器的 constitution(一組判斷規則)整份重寫,重點是把「哪些是良性用途」一條一條寫清楚、切出來,而不是含糊帶過。
- 找專家來挑毛病:改完的規則,拿去給內部與外部的多方專家看,收回饋再修。
- 重做訓練資料、重訓、再驗證:根據新規則產出新的訓練資料,把分類器重新訓練一次,然後回頭驗證——確認它「該擋的還是擋得住」,有害內容跟雙用途研究照樣會觸發。

官方還放了一張示意圖,我覺得是整篇最好懂的一塊。左邊是放行、右邊是攔截,紅色是明顯有害、橘色是雙用途、綠色是良性;中間還特別留了一條「安全邊界」——那些幾乎確定沒問題、但保險起見還是擋掉的請求。這次的更新,就是把那條分界線往右邊推,讓更多良性的問題走得過去。

數字:少了多少?
這是我最在意的部分,因為有數字才知道是真的動了,還是只是公關文。官方給的實測結果:
- 生物相關的回退(fallback)減少約 85%,這是跨產品線的測試結果
- 連帶所有原因的回退總量也一起降:Claude.ai 少約 67%
- Cowork 少約 55%
- Claude Code 少約 17%
- Claude Platform 少約 7%
你會發現一件有意思的事:越是「一般人在用」的介面(Claude.ai),降幅越大;越是開發者在用的(Platform 只有 7%),降幅越小。這很合理——會問「這張報告的紅字是什麼意思」的,本來就是一般使用者,被誤擋的也是他們。
現在能問什麼、還是不給什麼
官方講得很清楚,我照原文整理:
放行了(會明顯感覺變順):
- 看檢驗報告、解讀數值(interpreting lab results)
- 理解症狀(understanding symptoms)
- 用學習的角度問生物知識(learning about biology in an educational context)
- 醫療專業人員的臨床任務,也能得到更多支援
還是會被降級:
- 病毒學(virology)
- 毒理學(toxicology)
- 分子設計(molecular design)
官方直說,這些雙用途的請求,Fable 5 仍然會回退給 Opus 5,所以「還不能拿來做專業的生物研究與藥物開發」。他們也承諾要用「可信任的存取管道」(trusted access pathways)補上這一段,讓真正的研究者拿得到前沿能力。

我怎麼看:這件事對「教 AI」的人特別有用
我做教育訓練,很大一塊工作是把難懂的機制翻成人話。昨天備 AI Agent 觀念課的教材時,我卡在 API、CLI、MCP 這三個名詞怎麼講,最後是用「餐廳點餐」打通的——API 是跟外場服務生點餐、CLI 是直接走到櫃檯用行話點、MCP 是一套通用的點餐規範,走進哪家餐廳都能點。一句話收尾:都是點餐,差在誰去點、怎麼點。
這次的分類器,我會用同一套講法:它是餐廳門口的保全。保全不是廚師,他不做菜,他只負責判斷你能不能進來。當保全的標準訂得太寬,連來吃飯的客人都被擋在門外,你會覺得「這家店怎麼變難吃了」——但其實菜沒變,是你根本沒進到那個廚房。
為什麼這個比喻對上課有用?因為在課堂上我最常被問的一種問題就是:「我照你教的問,為什麼我的答案跟你的不一樣?」以前只能回「模型有隨機性」,聽起來像推託。現在可以講得更誠實:你的問題可能碰到了某條防護線,被換了一顆模型回答,而你完全不會收到通知。
學員聽懂這件事之後,行為會變。他們不會再對著同一句提示詞硬改十次,而是會換個方式描述情境——比如把「這個藥的成分會怎樣」改成「我要看懂這張報告上的這個數值代表什麼」。同一件事,一個聽起來像在查配方,一個聽起來像在學看報告。這不是話術,這是把你的真實意圖講清楚。
套用前,有幾點要注意
- 誤擋不會歸零。官方自己寫了:安全邊界內還是會有低風險但被攔下來的請求,這是刻意留的保險。所以偶爾還是會遇到,別以為壞掉了。
- 這是 Anthropic 家的機制,不是全業界通則。其他廠牌怎麼處理、有沒有 fallback、擋哪些範圍,各家都不一樣,不要拿這篇的數字去套別家。
- 放行不等於 AI 可以當醫生。官方放寬的是「看報告、懂症狀、學知識」這類理解型任務,不是叫你拿它下診斷。看得懂數值跟決定要不要吃藥,是兩件事。
- 別為了繞過防護而包裝問題。官方文章裡明講,他們防的就是「把危險任務講得像一般研究」的人。你真實的意圖講清楚就好,去學怎麼偽裝,方向完全反了。
小結
這篇官方文章真正有價值的地方,不是那個 85%,而是它把一件平常被藏起來的事講開了:你跟 AI 之間,還隔著一層你看不到的判斷。它會在某些題目上悄悄換一顆模型來回答你,而你只會覺得「它今天狀況不好」。
知道這件事之後,下次 AI 突然變得又客氣又空洞,你可以先別急著罵它笨,回頭看一眼自己的問題——是不是踩到了某條線?換個講法把情境補上,很多時候就過了。
本文整理改寫自 Anthropic 官方新聞〈Improving Fable 5's biology safeguards〉,2026 年 8 月 7 日發布。文中數據與引述皆出自該篇官方原文。
留言
張貼留言