token 是什麼?ChatGPT 額度一下就用完,4 個習慣省著用

額度用得快,多半不是你問太多次,是對話拖太長、附檔太大包、影音整支丟進去。這篇用 Google 官方的計量方式講清楚 token 到底怎麼算,再給 4 個今天就能改的習慣,最後回答一個我欠了很久的課堂提問:模型能不能自動切換。

token 是什麼?ChatGPT 額度一下就用完,4 個習慣省著用

token 是什麼?官方說法:大約 4 個字元算一個

先講結論:你花掉的不是「問幾次」,是「處理多少字」。

token 就是 AI 讀字的單位。Google 在 Gemini API 的官方說明講得很白:「Tokens can be single characters like z or whole words like cat. Long words are broken up into several tokens.」短的字可能整個算一個 token,長的字會被拆成好幾個。

換算基準官方也寫了:「For Gemini models, a token is equivalent to about 4 characters.」一個 token 大約 4 個字元,同一段官方說明還補了一句「100 tokens is equal to about 60-80 English words」,100 個 token 大約等於 60 到 80 個英文字。

所以你打的那句「幫我把這份會議記錄整理成三個重點」,對 AI 來說不是「一個問題」,是一串要被拆開逐個計算的單位。這就是為什麼同樣都只問一句,有時候扣得多、有時候扣得少。

Google Gemini API 官方文件「Understanding and counting tokens」頁面
圖/Google Gemini API 官方文件(來源

額度為什麼一下就用完?三個吃量大戶

吃掉 AI 額度的三個大戶:對話長度、附檔、影音
額度用得快,通常是這三件事之一(本站自製資訊圖)

① 對話越長,每問一次越貴

這條最多人不知道:AI 沒有記憶,每一次回你,都是把整串對話從頭重讀一遍。Google 官方文件在講「延續對話」的時候就註明了一句 “Usage includes tokens from both turns”,用量包含兩輪的 token。

意思是你在同一串對話聊到第 30 則,它回你第 30 次時讀的不是「第 30 個問題」,是「第 1 到第 30 則全部」。前面聊的廢話、貼過的整篇文章、它自己寫過的長回覆,通通再算一次。

② 附檔是一大包,不是一句話

丟一份 PDF 進去,你的感覺是「拖一個檔案」,實際上是把整份文件的字全部餵進去。圖片也有官方換算:384 像素以內的圖算 258 個 token,更大的圖會被切成 768×768 的方塊、每塊再算 258 個。一張手機截圖輕鬆就是好幾千。

③ 語音和影片最兇

Google 官方的計量寫得很清楚:音訊每秒 32 個 token、影片每秒 263 個 token。

我照這個數字換算了一下:

  • 一分鐘語音 ≈ 1,920 個 token
  • 一分鐘影片 ≈ 15,780 個 token
  • 一支 10 分鐘的影片 ≈ 15 萬個 token,這還只是「讀進去」

所以有人會覺得「我今天明明沒問幾次,額度就沒了」。不是問太多次,是丟了一支影片。

4 個習慣,讓同樣的額度省著用

省 token 的 4 個習慣:換題開新對話、一次講清楚、雜事給快模型、長文先壓重點
四個習慣,難度都不高,改了就有感(本站自製資訊圖)

1. 換題目就開新對話

最容易改、效果也最直接。同一串對話從「幫我看合約」一路聊到「晚餐吃什麼」,那份合約會全程跟著你,每一輪都重算一次。

判斷標準只有一句話:下一個問題需不需要用到前面的內容?不需要就開新的。

2. 先講清楚要什麼,別讓它猜三輪

我用 AI 有個固定習慣:請它做任何事之前,先跟它聊計畫,確定好了才叫它執行。一開始是為了品質,後來發現順便省了額度。一次講清楚只算一輪;「它猜一次、我改一次、它再猜一次」是三輪,而且第三輪要把前面兩輪重讀一遍。

爛問法:「幫我寫一篇貼文。」

好問法:「幫我寫一篇 300 字的 IG 貼文,主題是怎麼省 AI 額度,讀者是不懂技術的一般人,語氣口語一點,結尾放一個問句。」

多打那 30 個字,省掉的是後面三輪來回。

3. 雜事給快的模型,想事情才用大的

各家 AI 現在都不只一個模型:Gemini 分 Flash 和 Pro 兩條線、Claude 從 Haiku 排到 Opus、ChatGPT 也分即時回答跟深度思考。差別不只是聰明程度,還有速度和吃量。

我的分法很粗暴:

  • 翻譯、抓錯字、整理格式、摘要一段短文 → 快的那個就夠了
  • 要判斷、要權衡、要寫有結構的長東西 → 才動用大的

之前寫過的〈Gemini 3.8 Flash 是什麼?官方 4 個重點看懂費用、去哪用、跟 3.7 差在哪〉就是在拆這條線的差別,可以對照著看快模型到底省在哪。

4. 長文先壓成重點,或直接換工具

要處理的是一本書、一整份財報、幾十頁的說明書,不要整包塞進聊天框。兩個做法:

  • 自己先抓重點,只貼要問的那幾段
  • 換成本來就為長資料設計的工具,例如 NotebookLM,資料放在它自己的來源庫裡、要問的時候才去撈

這兩套的額度制度完全不一樣,我整理過〈NotebookLM 免費版限制怎麼算?官方改制 9/2 上線:額度每 5 小時回補〉,它是算「幾次查詢、幾小時回補」,跟聊天模型一路累加對話的算法是兩回事。

模型可以「自動切換」嗎?一個我欠很久的回答

聊天視窗要手動切換模型,AI Agent 可以寫規則自動指派
同一個問題,在聊天視窗跟在 Agent 裡是兩種答案(本站自製資訊圖)

上次帶一場 AI Agent 的課,最後 Q&A 有位學員舉手,一口氣問了兩件事:「怎麼樣去節省 token?有沒有辦法讓它自動切換模型?」

第一題就是上面那四點。第二題的答案要分兩半講。

用聊天式的 AI(ChatGPT、Gemini 這種對話視窗)→ 目前得手動切。介面上那個模型選單就是唯一的開關,它不會因為你問的是小事就自己降級,也不會因為你問了難題就自動升級。

用 AI Agent → 可以。Agent 跟聊天視窗最大的差別,是它可以被寫規則。你能事先定好:

  1. 執行哪一類任務時,優先叫哪一個模型
  2. 把子任務(subagent)指派出去做的時候,指定那個子任務用哪個模型
  3. 需要大量重複跑的步驟,全部走便宜的那條線

這不是什麼黑魔法,是 Agent 架構本來就支援的設定。差別在於聊天視窗把選擇權留給你「每次自己點」,Agent 把選擇權交給你「事先寫好的規則」。

如果你還在分不清 Agent 跟一般 AI 工具差在哪,可以先看〈AI Agent 是什麼?跟 Workflow 差在哪:3 層判斷法,先看你的流程會不會變〉,這篇講的自動指派要成立,前提就是你的東西真的是 Agent、不是一條寫死的流程。

那位學員的問題我當下只答了一半,這篇算是把另一半補上。

套用前有幾點要注意

  • 省 token ≠ 一律用小模型。該用大模型的時候硬省,答案品質掉下來、你得重問三次,反而更貴。省的重點是「分派」,不是「全部降級」。
  • 各家的計量方式不完全一樣。上面那些 4 個字元、258、32、263 的數字,是 Google 官方對 Gemini 模型的說明。觀念各家通用,數字別直接套到別家去。
  • 免費版的「額度」跟 API 的「token」不是同一件事。免費版大多是「幾則訊息、幾小時回補」的次數制,API 才是按 token 計費。但底層邏輯一樣:你丟的東西越大包,越快撞到牆。
  • 開新對話的代價是它忘了前面。真的需要延續脈絡的事情,不要為了省而硬切。該切的時機是「換題目」,不是「聊到一半」。

小結

額度用得快,多半不是你問太多,是三件事:對話拖太長、附檔太大包、影音整支丟。

四個習慣今天就能改:換題目開新的、一次講清楚、雜事給快模型、長文先壓重點。這四個不需要你懂技術,只需要你改掉「開一串對話用到底」的習慣。

真的想再往前一步,就往 Agent 走。那裡才有「規則寫好、模型自己分派」這回事。

延伸閱讀


本文中的 token 計量數字,出自 Google Gemini API 官方文件〈Understanding and counting tokens〉。

留言