Gemini 3.8 Flash 是什麼?官方 4 個重點看懂費用、去哪用、跟 3.7 差在哪

Google 在 2026 年 9 月 2 日發表了 Gemini 3.8 Flash,同時放出一個資安專用版本 3.8 Flash Cyber。這篇把官方公布的東西拆成四件事:它到底是什麼、比 3.7 Flash 強在哪、要花多少錢、還有一般人在哪些地方會真的碰到它。

Gemini 3.8 Flash 官方發布重點
Gemini 3.8 Flash 與 3.8 Flash Cyber,2026 年 9 月 2 日發表。

先講清楚:這是誰在什麼時候發的

來源是 Google 官方部落格 The Keyword,發表日期 2026 年 9 月 2 日,標題就叫〈Introducing Gemini 3.8 Flash and 3.8 Flash Cyber〉。這次一口氣推兩個版本:

  • Gemini 3.8 Flash:一般人和開發者都用得到的版本。
  • Gemini 3.8 Flash Cyber:資安專用版,只透過 Google 新的 Fairwind 計畫開放給「可信任的防禦方」,要申請。

官方對 3.8 Flash 的定位是「最聰明的 workhorse 模型」。workhorse 這個字直翻是役馬,講白話就是拉車幹活的那匹馬——不是拿來表演的,是每天實際在跑量的那一隻。Google 說它是為軟體工程、代理任務(agentic tasks)和多步驟推理設計的。

官方原文的一句話最能說明它的性格:「3.8 Flash works harder. On complex tasks, it exhibits greater diligence — executing extra reasoning steps, and calling tools iteratively.」翻成人話就是:碰到難題的時候,它會自己多想幾輪、反覆去呼叫工具,而不是一口氣把答案吐出來就結束

Gemini 3.8 Flash 是什麼的三個重點
官方定位、跟 3.7 的差別、代表性分數(本站自製資訊圖)

跟 Gemini 3.7 Flash 差在哪?看官方自己列的對照表

Google 這次做了一件對讀者很友善的事:把 3.8 Flash、3.7 Flash 跟其他家的模型並排放進同一張表,價格和各項測驗分數一起列。這種官方自己攤開來比的表格,比任何轉述都可靠,直接看數字就好。

Gemini 3.8 Flash 官方公布的價格與測驗分數對照表
圖/Google 官方部落格(來源

挑幾個 3.8 Flash 對上自家前一代 3.7 Flash 的差距來看:

  • DeepSWE v1.1(長週期軟體工程):73.7% vs 65.3%,進步 8.4 個百分點。
  • Terminal-bench 2.1(終端機裡的代理式寫程式):89.4% vs 85.8%,而且是這張表裡的最高分。
  • Vals Finance Agent v2(財務分析任務):61.4% vs 59.0%,同樣是全表最高。
  • Harvey's Legal Agent Benchmark(複雜法律工作流程):10.0% vs 8.8%——分數看起來都很低,但那是因為這個測驗本身極難,重點是它在同一把尺上排第一。
  • HLE-Verified(跨 STEM、人文與專業領域的多步推理):54.9% vs 53.6%。
  • OSWorld-2.0(代理式操作電腦):59.0% vs 50.6%,這項跳了 8.4 個百分點。

看得出來一個很清楚的方向:進步幅度最大的都不是「回答得漂不漂亮」,而是「能不能自己把一串事情做完」——寫程式、操作電腦、跑財務分析流程。這也對得上官方那句 works harder。

誠實講,這張表裡 3.8 Flash 沒有項項第一。像 Terminal-bench 4.0(通用代理能力)它拿 19.1%,Claude Opus 5 是 51.8%;OSWorld-2.0 它 59.0%,Claude Opus 5 是 75.4%。官方自己也把這些格子標出來了,沒有藏。Flash 這條線走的一直是「同樣的錢做更多事」,不是「不計成本最強」,這也帶到下一段。

Gemini Flash 費用多少?官方給了兩段價格

這次官方把價格寫得很明確,而且是兩段式,用的人要記一下時間點:

  • 介紹價(即日起到 2026 年 12 月 31 日):每百萬 token 輸入 US$0.75、輸出 US$3.75。跟 3.7 Flash 現行價格一樣。
  • 標準價(2027 年 1 月 1 日起):每百萬 token 輸入 US$1.50、輸出 US$7.50。

也就是說年底一過,價格直接翻一倍。如果你或你的團隊有在用 API 跑量,這個日期要先寫進行事曆,不要等帳單來了才發現。

Gemini 3.8 Flash 的兩段式價格
介紹價、期限、標準價三件事(本站自製資訊圖)

再把官方表格裡別家的價格放進來比,會更有感覺。同樣是每百萬輸入 token:Gemini 3.8 Flash 是 US$0.75,Claude Opus 5 是 US$5.00,GPT-5.6 Sol 是 US$4.00。輸出端的差距更大,3.8 Flash US$3.75,Claude Opus 5 US$25.00。

所以 Flash 這個系列真正的賣點不是「打贏所有模型」,是用零頭的價格做到接近的事。官方自己的話是「often approaching the performance of higher-cost frontier models」——常常接近那些更貴的前沿模型。

不寫程式的人,在哪裡會用到 3.8 Flash?

這是我覺得最多人會問、但最容易被跳過的一段。官方寫的入口分成兩邊:

一般使用者

  • Gemini App(gemini.google.com):開放給 Google AI Pro 和 Ultra 訂閱者。官方明寫的是這兩個付費方案,免費版沒有列在裡面。
  • Google 搜尋的 AI Mode(google.com/ai):直接接進搜尋體驗裡。
  • Google 試算表:表格裡的 Gemini 功能也會用到新模型。

開發者與企業

  • Google AI Studio(用聊天介面直接試)、Gemini API、Android Studio、UI 生成工具 Stitch、代理優先的 Google Antigravity。
  • 企業端走 Gemini Enterprise,從 Google Cloud console 進去。
一般人在哪裡用得到 Gemini 3.8 Flash
Gemini App、搜尋 AI Mode、試算表三個入口(本站自製資訊圖)

所以如果你是免費版使用者,短期內在 App 裡不一定摸得到 3.8 Flash,但搜尋的 AI Mode 是最有機會先碰到的地方。這也是為什麼我一直覺得,與其糾結哪個模型最新,不如先弄清楚自己每天實際用的是哪個入口——之前寫的〈ChatGPT、Claude、Gemini、Grok怎麼選?一支影片實測 10 個用途〉也是同一個結論:工具的差別,遠遠沒有「你拿它來做什麼」的差別大。

還有一個資安專用版:3.8 Flash Cyber

Cyber 版一般人申請不到,但它揭露的幾個數字很值得知道,因為那代表 AI 現在能做到什麼程度:

  • 在 CyberGym(業界標準的漏洞探索測驗)上達到前沿水準,超過比它大很多的模型。
  • Google 內部橫跨 20 種程式語言的真實漏洞探索測驗,成功率超過 70%
  • CWE-Bench 修補能力 Pass@1 是 47.2%,領先的前沿模型是 47.8%——幾乎打平,但成本低很多。
  • Chrome 資安團隊實測,它產出的正確修補數是最好的商用模型的 2.6 倍
  • Google Cloud 漏洞研究團隊用它,在不到 2 小時內找到一個關鍵的基礎漏洞——這種通常要花上幾個月。

另外官方提到 3.8 Flash 在 Gray Swan 這項提示詞注入(prompt injection)防護測驗上有明顯進步。這件事對一般人其實比分數更重要:當 AI 開始會自己去讀網頁、開檔案、接工具,網頁裡藏一句惡意指令就可能把它帶偏。模型能不能認出「這句話不是我的主人講的」,是 AI 幫你辦事這條路上很現實的前提。

我自己看這則發布最有感的一點

前陣子在排一份 AI 工作流程的教學大綱,寫到一半我發現整份東西的重心,已經跟一年前完全不同了。

以前教怎麼用 AI,重點是「提示詞怎麼下」——把問題問清楚,答案就會好。現在我排的流程長這樣:先讓 AI 知道你的背景和身分,接著讓它接手一串重複性的雜事,中間要跨兩三個軟體去撈資料(網頁、個人檔案庫、雲端硬碟),把撈到的原始資料處理成圖表、報告或簡報,最後寄出去或存檔。確認整條路跑得順之後,再把它封裝起來、加上排程,讓它自己定期重複跑。

你會發現,這整條流程要成立,靠的完全不是「模型回答得漂不漂亮」,而是它願不願意、有沒有能力自己多跑幾輪:這一步的結果不對,退回去重試;資料撈不到,換個地方再找一次。這正好就是 3.8 Flash 在 DeepSWE、Terminal-bench、OSWorld 這些代理式測驗上進步最多的那一塊。

所以我看這次發布的心得是:模型的競賽已經從「誰答得好」轉到「誰能自己把事做完」。同樣的道理,上次寫〈逐字稿 AI 老是一堆錯字?Google Gemini 3.5 Transcribe 官方 4 個數字〉時我也提過,官方丟出來的數字要看的不是絕對值,而是那個數字對應到你日常的哪個動作。這次要對照的動作,就是「你有沒有讓 AI 跑過一串連續的工作」。

幾個要注意的地方

  • 分數是特定測驗下的結果:官方的方法論頁面寫在表格下方,換一套測驗、換一個題型,排名可能就變了。不要把單一分數當成全能指標。
  • 更用力=可能更慢、更花 token:官方自己也說了,如果你的應用是以計算效率為第一優先,可以調低 effort 等級,或是繼續用 3.7 Flash——3.7 Flash 仍然完整支援。新的不一定就該全換。
  • 年底價格會變:介紹價到 2026/12/31,之後翻倍。
  • 免費版使用者要有心理準備:官方列的 Gemini App 入口是 AI Pro 和 Ultra。
  • Cyber 版不是給一般人的:要透過 Fairwind 計畫申請,對象是政府單位、關鍵基礎設施營運者和軟體維護者。

小結

四句話總結這次發布:

  1. Gemini 3.8 Flash 是 Google 定位的「主力幹活模型」,強項在代理任務和多步驟推理,不是在文采。
  2. 比 3.7 Flash 進步最多的,全都是「自己把一串事做完」的能力,DeepSWE 和 OSWorld 各跳了 8.4 個百分點。
  3. 價格分兩段,介紹價到 2026/12/31,2027 年起翻倍。
  4. 一般人最先碰到它的地方是搜尋的 AI Mode;Gemini App 官方寫的是 AI Pro 和 Ultra 訂閱者。

下次你在 Gemini 裡丟一個要跑好幾步的任務,注意看它是不是會停下來、換個方式再試一次。那個「不甘心一次就交卷」的動作,就是這次更新真正想給你的東西。

延伸閱讀


本文整理改寫自 Google 官方部落格 The Keyword:Introducing Gemini 3.8 Flash and 3.8 Flash Cyber(2026 年 9 月 2 日發表)。文中所有數字與價格皆取自該篇官方公告與其附上的官方對照表。

留言