我們手邊最該問 AI 的東西,常常都是紙做的——家電說明書、產品規格單、法規條文、旅遊拿到的一疊傳單。AI 再強,碰不到就是碰不到。這篇把「用手機把紙掃進去、再讓 AI 讀懂」的完整做法拆成 3 步驟,重點在第 2 步:別再用傳統 OCR,那條路我試過,走不通。

先講一個我自己的失敗案例
家裡的飛利浦瞬熱開飲機要除水垢,機器上長按三秒就會開始跑。我那天翻了說明書才發現,除水垢要先倒入 2 公升 4% 的白醋,大概 80cc 的醋。
結果呢?那次我就是忘了。等到下個月想起來,說明書又不知道被塞到哪個抽屜去了。
這件事很小,但它代表一整類問題:資訊明明就在你家裡,你卻拿不到。不是你懶,是紙本這個載體本身就不適合「臨時查一句話」。
方法一(走不通):直接叫 OCR 幫你認字
最直覺的做法是:拍下來、丟給 OCR 軟體認字。這條路我在工作上實際碰過壁。
當時的情況是,我要的資料被對方做成圖片,程式抓不到文字。我那時候的判斷是:AI 已經進入多模態階段,除了一般 OCR 之外,應該可以更準確地辨識圖片裡的資訊。
後來看到 T客邦影新聞的一支影片,剛好把這件事實測給我看了。他把掃好的雜誌 PDF 丟進 Google 雲端硬碟,讓它跑內建的 OCR:
- 文字是認出來了,但雜誌排版不是線性的,辨識結果變成步驟一講到一半就接到步驟三
- 加上掃描時有反光,缺字、漏字、錯字一大堆
- 他自己的結論很直白:「說不定用手打字還比較快」
這就是傳統 OCR 的天花板——它只負責把像素翻成文字,不負責看懂這一頁在講什麼。

方法二(可行):3 步驟,把紙變成隨問隨答
第 1 步:用 Google Drive 的「掃描」,不要用相機拍
很多人手機相簿裡有幾百張文件照片,最後全都變成找不到的數位垃圾。差別在哪?相機只是把畫面存下來,掃描功能會多做三件事:自動偵測文件邊界、抓最好的時機拍、把歪斜的梯形自動校正回長方形。
操作也不難:打開手機版 Google Drive → 點「掃描」→ 對準文件,出現藍色框就會自動拍 → 拍完按繼續拍下一頁 → 全部掃完,下方選 PDF(多頁一定要選 PDF,不要選 JPG)→ 上傳。
連續掃的手勢是:手機懸在文件上方固定高度,一手翻頁、一手按下一頁,它會自己一直拍。手會痠,找個東西架著手機比較實在。

四個能讓成功率明顯變高的小技巧:
- 墊一張黑色背景:書本跟桌面顏色太接近,邊界判斷會很慢;黑底幾乎是翻頁就立刻拍。
- 鏡頭平行放在正上方:軟體校正畢竟是補救,一開始拍正就少失真。
- 多頁選 PDF:選 JPG 會變成一堆零散圖片,之後很難管理。
- 光線要夠:暗的地方容易手震模糊;亮面雜誌要閃避反光角度。
第 2 步:丟進 Gemini Notebook,不要丟給 OCR
同一份 PDF,換個地方就完全不同結果。把它當來源丟進 Gemini Notebook(就是原本的 NotebookLM,Google 在 2026 年 7 月 16 日正式改名,我之前也寫過這件事:〈NotebookLM 改名 Gemini Notebook?Google 開放 10 萬本正版書丟進筆記本〉),直接開口問,答案就完整地出來了。
原因是它底層用的是多模態模型、不是傳統 OCR——它會像人眼一樣直接看懂圖片裡的文字,再轉成有用的資訊。所以掃描時的反光、輕微糊字,大多還是認得出來,除非糊到非常嚴重才需要重掃。
這裡有個前提要先講清楚:它給你的不是 100% 還原原文,比較像是讀過一遍之後幫你重新整理出來的結論。查操作、找重點很好用;要逐字精確的原文(例如合約條款),還是要自己回去對。
第 3 步:分主題建筆記本,不要全部倒進同一本
我自己的用法是照「什麼時候會用到」來分,三本就夠日常了:
- 家電說明書:電視、冷氣、清淨機、掃地機的說明書全掃進同一本。以後遙控器的隱藏功能、濾網多久換、怎麼清洗保養,全部用問的。
- 正式文件:保單、租約、保固說明這類。這個用法我在〈保單、合約看到第三行就投降?3 步驟讓 AI 逐條翻成人話〉裡寫得更完整。
- 旅遊資料:在觀光案內所、車站拿到的傳單、手繪地圖、巴士時刻表,當下花兩分鐘掃進去。

旅遊那個例子最有說服力
影片作者在日本小豆島,看著站牌跟當地複雜的巴士路線圖整個人傻掉。他把資料全部掃進筆記本,直接問:「現在是上午 10 點,我在土莊港想要搭公車去坐纜車,我該怎麼去?」
AI 告訴他最近的兩班公車都要先到草壁港換車,還特別提醒他千萬別搭到北迴的公車(當地公車分南迴、北迴),到草壁港之後要換另一線公車到紅雲亭才能坐纜車,而且那班車只有春秋兩季有開,其他季節只能叫計程車。
這種藏在細節裡的陷阱,人就算站在現場看著站牌也解不出來。
我自己會怎麼用它
老實說,這件事我在 2025 年 2 月的筆記裡就寫過了:「AI 筆記本可以用來存放說明書或法規,讓自己隨時隨地查詢。」那時候想的是工作上用得到的勞基法、電信相關法規,還有 NCC 制定的內容。
當時卡住的不是想法,是最後一哩路——那些東西都是紙,我沒有一個夠快的方式把它們送進去。手機掃描補上的就是這一段。
我還有一個一直想做但沒動的:把汽車的使用手冊掃進去,讓 AI 照著手冊建議的保養時程提醒我,多久要換什麼零件,我就不用死背。再進一步,外面車廠保養完,把收據拍下來丟給它,讓它自動填進保養紀錄、順便算出下次該回廠的時間。
上課的時候,我最常被問的其實不是「AI 怎麼用」,而是「我手上這堆東西要怎麼給它」。所以現在我很喜歡用這招當實作題:大家包包裡都有紙——講義、產品 DM、規格單,當場拿手機掃兩頁進筆記本,然後問一個自己真的想知道的問題。體感非常直接,比講十張投影片有效。
我很久以前寫過一句話,到現在還是我對這件事的定義:AI 就是你的圖書館員,你想要什麼東西,它會幫你找出來;找出來之後你再針對它提問,它又會變成一個飽讀詩書的博士教授。而掃描,就是把書搬進圖書館的那台推車。
開始做之前,有幾件事先知道
- 它是理解後重述,不是複製貼上:要逐字精確的原文(合約條款、法規細則)務必自己回去核對。影片裡也有個活生生的例子——AI 幫忙做食譜簡報時,把「豬排兩面沾麵包粉」理解成「吐司麵包沾了粉」,畫出來的圖是錯的。
- 全彩滿版的圖片頁不好掃:像食譜、寫真那種一整頁都是照片的,邊界判斷會一直來回收縮。解法是調整鏡頭遠近、改成只掃單頁,或就等它想清楚。
- 免費版有額度限制:Gemini Notebook 的免費額度制度 9 月剛改過,細節我整理在〈NotebookLM 免費版限制怎麼算?官方改制 9/2 上線〉。
- 敏感文件想清楚再上傳:保單、合約這類個資濃度高的東西,是要放雲端的,自己先評估一下。
小結
過去我們習慣把紙收進抽屜跟資料夾,但我們真正需要的從來不是紙張本身,是紙張裡面的資訊。
把它掃進 Gemini Notebook 之後,我們只負責提問,不用再花時間去找資料在哪裡——連不同語言的文件都可以統一用中文問、中文答。
今天就從最有感的那一本開始:走到抽屜前,把家裡最常搞不懂的那台家電的說明書拿出來,掃進去,然後問它一個你一直懶得查的問題。
延伸閱讀
- NotebookLM 改名 Gemini Notebook?Google 開放 10 萬本正版書丟進筆記本,4 個重點看懂怎麼用
- 保單、合約看到第三行就投降?3 步驟讓 AI 逐條翻成人話,而且不亂編
- NotebookLM 免費版限制怎麼算?官方改制 9/2 上線:額度每 5 小時回補,4 個重點看懂
▶ 完整影片
本文的操作示範與實測案例,整理改寫自 T客邦影新聞的影片〈Google Drive 掃描 + Gemini Notebook 組合拳攻略:把紙本講義、說明書與實體手冊變成 AI 大腦〉。原片:https://youtu.be/hKTUPZ9-JnU
留言
張貼留言