如何讓 PDF 可搜尋
掃描的 PDF 是紙張的照片——檔案中沒有文字,只有像素。您無法搜尋、選取、複製或使用螢幕閱讀器。讓它可搜尋意味著執行 OCR(光學字元辨識)以加入置於影像後方的文字層。本指南涵蓋三種 OCR 輸出類型、能做好的本機工具,以及為什麼 IXPDF 今天不在瀏覽器中執行 OCR。
三種 OCR 輸出類型
OCR 工具可以產生三種不同的輸出。您要哪種取決於對結果做什麼。
1. 可搜尋 PDF(影像 + 不可見文字)
最常見且通常是正確的選擇。原始頁面影像保持可見——版面、簽名、戳記、手寫內容完全如前。在影像後方,OCR 加入帶有辨識字元的不可見文字層。您可以搜尋、選取、複製和使用螢幕閱讀器;螢幕上看到的是原始掃描。這是 Adobe Acrobat、Tesseract 和 ABBYY 預設產生的結果。
適用於:封存外觀重要的掃描文件(合約、收據、簽名信件)。
2. 純文字 PDF(辨識文字,無影像)
OCR 以辨識文字完全取代影像。結果小、完全可選取,類似一般文字 PDF——但原始版面是近似的,OCR 無法辨識的內容(簽名、戳記、手寫)消失了。
適用於:只需要文字且原始外觀不重要的情況(例如將掃描信件的內文擷取至知識庫的可搜尋檔案)。
3. 雙層 PDF(影像 + 文字,兩者可見)
較不常見的格式,同時顯示原始影像和辨識文字並排,或將文字疊加在影像上並使影像淡化。用於審閱者需比較 OCR 輸出與原始以偵測辨識錯誤的法律和封存流程。ABBYY FineReader 和 Adobe Acrobat Pro 支援此格式。
適用於:法律審閱、封存品質管控,任何需對照來源驗證 OCR 精確度的流程。
本機 OCR 工具
以下每個工具都在您的機器上執行。都不會上傳您的文件。這很重要:掃描的合約、病歷或稅表不應傳送至「免費線上 OCR」服務——此時內容已在別人的伺服器上。
1. Adobe Acrobat Pro(付費,黃金標準)
開啟掃描的 PDF,然後工具 > 掃描與 OCR > 辨識文字 > 在此檔案中。選擇語言和輸出類型(可搜尋影像是預設值且通常正確)。Acrobat 的 OCR 對真實掃描最精確,處理多欄版面良好,並允許線上修正誤判字詞。缺點是成本——Acrobat Pro 是訂閱制。
2. Tesseract(免費、開源、命令列)
最精確的免費 OCR 引擎。從Tesseract GitHub 專案或套件管理器安裝 (macOS 上 brew install tesseract, Linux 上 apt install tesseract-ocr)。然後:
tesseract input.pdf output -l eng pdf
這會產生 output.pdf,為帶有原始影像和不可見英文文字層的可搜尋 PDF。Tesseract 在複雜版面上不如 Acrobat 精確,但在乾淨的單欄掃描上表現優異。它支援超過 100 種語言——對英/法混合文件傳入 -l eng+fra。
3. macOS 預覽即時文字(免費,macOS 12+)
在 macOS Monterey 及更新版本上,預覽可透過系統的即時文字功能辨識掃描 PDF 和影像中的文字。在預覽中開啟 PDF,您可以直接選取、複製和搜尋文字——macOS 即時加入文字層。若要儲存可搜尋版本,檔案 > 匯出為 PDF。即時文字快速且對英文文件精確,但語言支援比 Tesseract 有限。
4. ABBYY FineReader(付費,高精確度)
商業 OCR 工具,以對困難掃描的高精確度聞名——手寫、低對比、混合字型、多欄版面。它支援雙層輸出以供驗證。當 Tesseract 不夠精確且無法負擔 Acrobat Pro 訂閱時使用。FineReader 是一次購買,非訂閱。
逐步教學:用 Tesseract 讓 PDF 可搜尋
- 安裝 Tesseract。macOS 上
brew install tesseract。Linux 上apt install tesseract-ocr。Windows 上從 Tesseract GitHub 專案下載安裝程式。 - 安裝語言資料。英文預設包含。其他語言請安裝對應語言包(例如 macOS 上
brew install tesseract-lang)。 - 開啟終端機。導覽至包含掃描 PDF 的資料夾。
- 執行 OCR。
tesseract input.pdf output -l eng pdf - 驗證結果。開啟
output.pdf,搜尋影像中可見的字詞並嘗試選取段落。如果搜尋和選取有效,文字層已就位。 - 審閱。OCR 會犯錯。將段落複製至文字編輯器並與影像比較。如果您要依賴文字,請修正任何關鍵誤判。
OCR 精確度:預期什麼
OCR 精確度幾乎完全取決於來源影像品質。300 DPI 的乾淨掃描、以常見字型(Arial、Times New Roman)列印的頁面可達 98–99% 字元精確度。150 DPI 的影印頁面、裝飾字型可能降至 90% 或更低——即每 10 個字元 1 個錯誤,足以破壞搜尋和複製貼上。
損害精確度的因素:低解析度(低於 200 DPI)、傾斜(角度掃描的頁面)、雜訊(骯髒掃描器玻璃的斑點)、混合字型、手寫、多欄版面、表格和彩色背景上的文字。如果您的掃描有這些之一,請預期需要仔細審閱。
常見錯誤
- 對敏感文件使用免費線上 OCR 服務。檔案會上傳至伺服器。請使用本機工具——Tesseract、Acrobat 或 macOS 即時文字。
- 不審閱就信任 OCR 輸出。OCR 會犯錯。如果您將文字複製至合約、引用或資料庫,請對照影像驗證每個字詞。
- 需要原始外觀時選擇純文字輸出。純文字 OCR 捨棄影像。如果簽名、戳記或版面重要,請改用可搜尋 PDF 輸出。
- 對已有文字的 PDF 執行 OCR。如果檔案已有文字層(用 Ctrl+F 測試),OCR 是多餘的且可能降低現有文字品質。請參閱為什麼我無法在 PDF 中選取文字?以確認檔案確實需要 OCR。
- 省略語言包。Tesseract 預設使用英文。用英文模型 OCR 法文文件會產生垃圾。請始終以正確語言傳入
-l。