額度用得快,多半不是你問太多次,是對話拖太長、附檔太大包、影音整支丟進去。這篇用 Google 官方的計量方式講清楚 token 到底怎麼算,再給 4 個今天就能改的習慣,最後回答一個我欠了很久的課堂提問:模型能不能自動切換。
token 是什麼?官方說法:大約 4 個字元算一個
先講結論:你花掉的不是「問幾次」,是「處理多少字」。
token 就是 AI 讀字的單位。Google 在 Gemini API 的官方說明講得很白:「Tokens can be single characters like z or whole words like cat. Long words are broken up into several tokens.」短的字可能整個算一個 token,長的字會被拆成好幾個。
換算基準官方也寫了:「For Gemini models, a token is equivalent to about 4 characters.」一個 token 大約 4 個字元,同一段官方說明還補了一句「100 tokens is equal to about 60-80 English words」,100 個 token 大約等於 60 到 80 個英文字。
所以你打的那句「幫我把這份會議記錄整理成三個重點」,對 AI 來說不是「一個問題」,是一串要被拆開逐個計算的單位。這就是為什麼同樣都只問一句,有時候扣得多、有時候扣得少。
額度為什麼一下就用完?三個吃量大戶
① 對話越長,每問一次越貴
這條最多人不知道:AI 沒有記憶,每一次回你,都是把整串對話從頭重讀一遍。Google 官方文件在講「延續對話」的時候就註明了一句 “Usage includes tokens from both turns”,用量包含兩輪的 token。
意思是你在同一串對話聊到第 30 則,它回你第 30 次時讀的不是「第 30 個問題」,是「第 1 到第 30 則全部」。前面聊的廢話、貼過的整篇文章、它自己寫過的長回覆,通通再算一次。
② 附檔是一大包,不是一句話
丟一份 PDF 進去,你的感覺是「拖一個檔案」,實際上是把整份文件的字全部餵進去。圖片也有官方換算:384 像素以內的圖算 258 個 token,更大的圖會被切成 768×768 的方塊、每塊再算 258 個。一張手機截圖輕鬆就是好幾千。
③ 語音和影片最兇
Google 官方的計量寫得很清楚:音訊每秒 32 個 token、影片每秒 263 個 token。
我照這個數字換算了一下:
- 一分鐘語音 ≈ 1,920 個 token
- 一分鐘影片 ≈ 15,780 個 token
- 一支 10 分鐘的影片 ≈ 15 萬個 token,這還只是「讀進去」
所以有人會覺得「我今天明明沒問幾次,額度就沒了」。不是問太多次,是丟了一支影片。
4 個習慣,讓同樣的額度省著用
1. 換題目就開新對話
最容易改、效果也最直接。同一串對話從「幫我看合約」一路聊到「晚餐吃什麼」,那份合約會全程跟著你,每一輪都重算一次。
判斷標準只有一句話:下一個問題需不需要用到前面的內容?不需要就開新的。
2. 先講清楚要什麼,別讓它猜三輪
我用 AI 有個固定習慣:請它做任何事之前,先跟它聊計畫,確定好了才叫它執行。一開始是為了品質,後來發現順便省了額度。一次講清楚只算一輪;「它猜一次、我改一次、它再猜一次」是三輪,而且第三輪要把前面兩輪重讀一遍。
爛問法:「幫我寫一篇貼文。」
好問法:「幫我寫一篇 300 字的 IG 貼文,主題是怎麼省 AI 額度,讀者是不懂技術的一般人,語氣口語一點,結尾放一個問句。」
多打那 30 個字,省掉的是後面三輪來回。
3. 雜事給快的模型,想事情才用大的
各家 AI 現在都不只一個模型:Gemini 分 Flash 和 Pro 兩條線、Claude 從 Haiku 排到 Opus、ChatGPT 也分即時回答跟深度思考。差別不只是聰明程度,還有速度和吃量。
我的分法很粗暴:
- 翻譯、抓錯字、整理格式、摘要一段短文 → 快的那個就夠了
- 要判斷、要權衡、要寫有結構的長東西 → 才動用大的
之前寫過的〈Gemini 3.8 Flash 是什麼?官方 4 個重點看懂費用、去哪用、跟 3.7 差在哪〉就是在拆這條線的差別,可以對照著看快模型到底省在哪。
4. 長文先壓成重點,或直接換工具
要處理的是一本書、一整份財報、幾十頁的說明書,不要整包塞進聊天框。兩個做法:
- 自己先抓重點,只貼要問的那幾段
- 換成本來就為長資料設計的工具,例如 NotebookLM,資料放在它自己的來源庫裡、要問的時候才去撈
這兩套的額度制度完全不一樣,我整理過〈NotebookLM 免費版限制怎麼算?官方改制 9/2 上線:額度每 5 小時回補〉,它是算「幾次查詢、幾小時回補」,跟聊天模型一路累加對話的算法是兩回事。
模型可以「自動切換」嗎?一個我欠很久的回答
上次帶一場 AI Agent 的課,最後 Q&A 有位學員舉手,一口氣問了兩件事:「怎麼樣去節省 token?有沒有辦法讓它自動切換模型?」
第一題就是上面那四點。第二題的答案要分兩半講。
用聊天式的 AI(ChatGPT、Gemini 這種對話視窗)→ 目前得手動切。介面上那個模型選單就是唯一的開關,它不會因為你問的是小事就自己降級,也不會因為你問了難題就自動升級。
用 AI Agent → 可以。Agent 跟聊天視窗最大的差別,是它可以被寫規則。你能事先定好:
- 執行哪一類任務時,優先叫哪一個模型
- 把子任務(subagent)指派出去做的時候,指定那個子任務用哪個模型
- 需要大量重複跑的步驟,全部走便宜的那條線
這不是什麼黑魔法,是 Agent 架構本來就支援的設定。差別在於聊天視窗把選擇權留給你「每次自己點」,Agent 把選擇權交給你「事先寫好的規則」。
如果你還在分不清 Agent 跟一般 AI 工具差在哪,可以先看〈AI Agent 是什麼?跟 Workflow 差在哪:3 層判斷法,先看你的流程會不會變〉,這篇講的自動指派要成立,前提就是你的東西真的是 Agent、不是一條寫死的流程。
那位學員的問題我當下只答了一半,這篇算是把另一半補上。
套用前有幾點要注意
- 省 token ≠ 一律用小模型。該用大模型的時候硬省,答案品質掉下來、你得重問三次,反而更貴。省的重點是「分派」,不是「全部降級」。
- 各家的計量方式不完全一樣。上面那些 4 個字元、258、32、263 的數字,是 Google 官方對 Gemini 模型的說明。觀念各家通用,數字別直接套到別家去。
- 免費版的「額度」跟 API 的「token」不是同一件事。免費版大多是「幾則訊息、幾小時回補」的次數制,API 才是按 token 計費。但底層邏輯一樣:你丟的東西越大包,越快撞到牆。
- 開新對話的代價是它忘了前面。真的需要延續脈絡的事情,不要為了省而硬切。該切的時機是「換題目」,不是「聊到一半」。
小結
額度用得快,多半不是你問太多,是三件事:對話拖太長、附檔太大包、影音整支丟。
四個習慣今天就能改:換題目開新的、一次講清楚、雜事給快模型、長文先壓重點。這四個不需要你懂技術,只需要你改掉「開一串對話用到底」的習慣。
真的想再往前一步,就往 Agent 走。那裡才有「規則寫好、模型自己分派」這回事。
延伸閱讀
- 本機 AI 怎麼跑?NVIDIA 官方 IFA 4 個重點,加 3 步驟用 Ollama 在自己電腦跑模型:完全不想被額度綁住的話,還有把模型跑在自己電腦上這條路。
本文中的 token 計量數字,出自 Google Gemini API 官方文件〈Understanding and counting tokens〉。
留言
張貼留言