說明書塞抽屜再也沒翻過?Google Drive 掃描+Gemini Notebook,3 步驟把紙本變成隨問隨答

我們手邊最該問 AI 的東西,常常都是紙做的——家電說明書、產品規格單、法規條文、旅遊拿到的一疊傳單。AI 再強,碰不到就是碰不到。這篇把「用手機把紙掃進去、再讓 AI 讀懂」的完整做法拆成 3 步驟,重點在第 2 步:別再用傳統 OCR,那條路我試過,走不通。

用手機把紙本說明書掃進 AI 筆記本

先講一個我自己的失敗案例

家裡的飛利浦瞬熱開飲機要除水垢,機器上長按三秒就會開始跑。我那天翻了說明書才發現,除水垢要先倒入 2 公升 4% 的白醋,大概 80cc 的醋。

結果呢?那次我就是忘了。等到下個月想起來,說明書又不知道被塞到哪個抽屜去了。

這件事很小,但它代表一整類問題:資訊明明就在你家裡,你卻拿不到。不是你懶,是紙本這個載體本身就不適合「臨時查一句話」。

方法一(走不通):直接叫 OCR 幫你認字

最直覺的做法是:拍下來、丟給 OCR 軟體認字。這條路我在工作上實際碰過壁。

當時的情況是,我要的資料被對方做成圖片,程式抓不到文字。我那時候的判斷是:AI 已經進入多模態階段,除了一般 OCR 之外,應該可以更準確地辨識圖片裡的資訊。

後來看到 T客邦影新聞的一支影片,剛好把這件事實測給我看了。他把掃好的雜誌 PDF 丟進 Google 雲端硬碟,讓它跑內建的 OCR:

  • 文字是認出來了,但雜誌排版不是線性的,辨識結果變成步驟一講到一半就接到步驟三
  • 加上掃描時有反光,缺字、漏字、錯字一大堆
  • 他自己的結論很直白:「說不定用手打字還比較快」

這就是傳統 OCR 的天花板——它只負責把像素翻成文字,不負責看懂這一頁在講什麼。

傳統 OCR 與多模態模型的差別
差別不在認不認得字,在看不看得懂版面(本站自製資訊圖)

方法二(可行):3 步驟,把紙變成隨問隨答

第 1 步:用 Google Drive 的「掃描」,不要用相機拍

很多人手機相簿裡有幾百張文件照片,最後全都變成找不到的數位垃圾。差別在哪?相機只是把畫面存下來,掃描功能會多做三件事:自動偵測文件邊界、抓最好的時機拍、把歪斜的梯形自動校正回長方形。

操作也不難:打開手機版 Google Drive → 點「掃描」→ 對準文件,出現藍色框就會自動拍 → 拍完按繼續拍下一頁 → 全部掃完,下方選 PDF(多頁一定要選 PDF,不要選 JPG)→ 上傳。

連續掃的手勢是:手機懸在文件上方固定高度,一手翻頁、一手按下一頁,它會自己一直拍。手會痠,找個東西架著手機比較實在。

掃描的四個小技巧
四個小地方調一下,掃描速度差很多(本站自製資訊圖)

四個能讓成功率明顯變高的小技巧:

  1. 墊一張黑色背景:書本跟桌面顏色太接近,邊界判斷會很慢;黑底幾乎是翻頁就立刻拍。
  2. 鏡頭平行放在正上方:軟體校正畢竟是補救,一開始拍正就少失真。
  3. 多頁選 PDF:選 JPG 會變成一堆零散圖片,之後很難管理。
  4. 光線要夠:暗的地方容易手震模糊;亮面雜誌要閃避反光角度。

第 2 步:丟進 Gemini Notebook,不要丟給 OCR

同一份 PDF,換個地方就完全不同結果。把它當來源丟進 Gemini Notebook(就是原本的 NotebookLM,Google 在 2026 年 7 月 16 日正式改名,我之前也寫過這件事:〈NotebookLM 改名 Gemini Notebook?Google 開放 10 萬本正版書丟進筆記本〉),直接開口問,答案就完整地出來了。

原因是它底層用的是多模態模型、不是傳統 OCR——它會像人眼一樣直接看懂圖片裡的文字,再轉成有用的資訊。所以掃描時的反光、輕微糊字,大多還是認得出來,除非糊到非常嚴重才需要重掃。

這裡有個前提要先講清楚:它給你的不是 100% 還原原文,比較像是讀過一遍之後幫你重新整理出來的結論。查操作、找重點很好用;要逐字精確的原文(例如合約條款),還是要自己回去對。

第 3 步:分主題建筆記本,不要全部倒進同一本

我自己的用法是照「什麼時候會用到」來分,三本就夠日常了:

  • 家電說明書:電視、冷氣、清淨機、掃地機的說明書全掃進同一本。以後遙控器的隱藏功能、濾網多久換、怎麼清洗保養,全部用問的。
  • 正式文件:保單、租約、保固說明這類。這個用法我在〈保單、合約看到第三行就投降?3 步驟讓 AI 逐條翻成人話〉裡寫得更完整。
  • 旅遊資料:在觀光案內所、車站拿到的傳單、手繪地圖、巴士時刻表,當下花兩分鐘掃進去。
建議建三本筆記本:家電說明書、正式文件、旅遊資料
照「什麼時候會用到」分本,比照類型分好用(本站自製資訊圖)

旅遊那個例子最有說服力

影片作者在日本小豆島,看著站牌跟當地複雜的巴士路線圖整個人傻掉。他把資料全部掃進筆記本,直接問:「現在是上午 10 點,我在土莊港想要搭公車去坐纜車,我該怎麼去?」

AI 告訴他最近的兩班公車都要先到草壁港換車,還特別提醒他千萬別搭到北迴的公車(當地公車分南迴、北迴),到草壁港之後要換另一線公車到紅雲亭才能坐纜車,而且那班車只有春秋兩季有開,其他季節只能叫計程車。

這種藏在細節裡的陷阱,人就算站在現場看著站牌也解不出來。

我自己會怎麼用它

老實說,這件事我在 2025 年 2 月的筆記裡就寫過了:「AI 筆記本可以用來存放說明書或法規,讓自己隨時隨地查詢。」那時候想的是工作上用得到的勞基法、電信相關法規,還有 NCC 制定的內容。

當時卡住的不是想法,是最後一哩路——那些東西都是紙,我沒有一個夠快的方式把它們送進去。手機掃描補上的就是這一段。

我還有一個一直想做但沒動的:把汽車的使用手冊掃進去,讓 AI 照著手冊建議的保養時程提醒我,多久要換什麼零件,我就不用死背。再進一步,外面車廠保養完,把收據拍下來丟給它,讓它自動填進保養紀錄、順便算出下次該回廠的時間。

上課的時候,我最常被問的其實不是「AI 怎麼用」,而是「我手上這堆東西要怎麼給它」。所以現在我很喜歡用這招當實作題:大家包包裡都有紙——講義、產品 DM、規格單,當場拿手機掃兩頁進筆記本,然後問一個自己真的想知道的問題。體感非常直接,比講十張投影片有效。

我很久以前寫過一句話,到現在還是我對這件事的定義:AI 就是你的圖書館員,你想要什麼東西,它會幫你找出來;找出來之後你再針對它提問,它又會變成一個飽讀詩書的博士教授。而掃描,就是把書搬進圖書館的那台推車。

開始做之前,有幾件事先知道

  • 它是理解後重述,不是複製貼上:要逐字精確的原文(合約條款、法規細則)務必自己回去核對。影片裡也有個活生生的例子——AI 幫忙做食譜簡報時,把「豬排兩面沾麵包粉」理解成「吐司麵包沾了粉」,畫出來的圖是錯的。
  • 全彩滿版的圖片頁不好掃:像食譜、寫真那種一整頁都是照片的,邊界判斷會一直來回收縮。解法是調整鏡頭遠近、改成只掃單頁,或就等它想清楚。
  • 免費版有額度限制:Gemini Notebook 的免費額度制度 9 月剛改過,細節我整理在〈NotebookLM 免費版限制怎麼算?官方改制 9/2 上線〉。
  • 敏感文件想清楚再上傳:保單、合約這類個資濃度高的東西,是要放雲端的,自己先評估一下。

小結

過去我們習慣把紙收進抽屜跟資料夾,但我們真正需要的從來不是紙張本身,是紙張裡面的資訊。

把它掃進 Gemini Notebook 之後,我們只負責提問,不用再花時間去找資料在哪裡——連不同語言的文件都可以統一用中文問、中文答。

今天就從最有感的那一本開始:走到抽屜前,把家裡最常搞不懂的那台家電的說明書拿出來,掃進去,然後問它一個你一直懶得查的問題。

延伸閱讀

▶ 完整影片


本文的操作示範與實測案例,整理改寫自 T客邦影新聞的影片〈Google Drive 掃描 + Gemini Notebook 組合拳攻略:把紙本講義、說明書與實體手冊變成 AI 大腦〉。原片:https://youtu.be/hKTUPZ9-JnU

留言