跳至內容
100% 本地 · 上傳 0 KB壓縮 PDF

如何讓 PDF 可搜尋

🔒 您的檔案永遠不會離開您的裝置。所有處理都在瀏覽器中本地進行。

掃描的 PDF 是紙張的照片——檔案中沒有文字,只有像素。您無法搜尋、選取、複製或使用螢幕閱讀器。讓它可搜尋意味著執行 OCR(光學字元辨識)以加入置於影像後方的文字層。本指南涵蓋三種 OCR 輸出類型、能做好的本機工具,以及為什麼 IXPDF 今天不在瀏覽器中執行 OCR。

IXPDF 今天無法在瀏覽器中執行 OCR
瀏覽器 OCR 引擎存在(Tesseract.js、OCRad.js),但對真實掃描的精確度不夠可靠,無法推出。它們誤判常見字型、難以處理多欄版面,產生的文字對搜尋和無障礙而言比完全沒有文字更糟。我們不會推出靜默傳回錯誤文字的工具(AGENTS.md §16)。這標記為研究待定。以下工具在您的機器上本機執行,不會上傳您的檔案。

三種 OCR 輸出類型

OCR 工具可以產生三種不同的輸出。您要哪種取決於對結果做什麼。

1. 可搜尋 PDF(影像 + 不可見文字)

最常見且通常是正確的選擇。原始頁面影像保持可見——版面、簽名、戳記、手寫內容完全如前。在影像後方,OCR 加入帶有辨識字元的不可見文字層。您可以搜尋、選取、複製和使用螢幕閱讀器;螢幕上看到的是原始掃描。這是 Adobe Acrobat、Tesseract 和 ABBYY 預設產生的結果。

適用於:封存外觀重要的掃描文件(合約、收據、簽名信件)。

2. 純文字 PDF(辨識文字,無影像)

OCR 以辨識文字完全取代影像。結果小、完全可選取,類似一般文字 PDF——但原始版面是近似的,OCR 無法辨識的內容(簽名、戳記、手寫)消失了。

適用於:只需要文字且原始外觀不重要的情況(例如將掃描信件的內文擷取至知識庫的可搜尋檔案)。

3. 雙層 PDF(影像 + 文字,兩者可見)

較不常見的格式,同時顯示原始影像和辨識文字並排,或將文字疊加在影像上並使影像淡化。用於審閱者需比較 OCR 輸出與原始以偵測辨識錯誤的法律和封存流程。ABBYY FineReader 和 Adobe Acrobat Pro 支援此格式。

適用於:法律審閱、封存品質管控,任何需對照來源驗證 OCR 精確度的流程。

本機 OCR 工具

以下每個工具都在您的機器上執行。都不會上傳您的文件。這很重要:掃描的合約、病歷或稅表不應傳送至「免費線上 OCR」服務——此時內容已在別人的伺服器上。

1. Adobe Acrobat Pro(付費,黃金標準)

開啟掃描的 PDF,然後工具 > 掃描與 OCR > 辨識文字 > 在此檔案中。選擇語言和輸出類型(可搜尋影像是預設值且通常正確)。Acrobat 的 OCR 對真實掃描最精確,處理多欄版面良好,並允許線上修正誤判字詞。缺點是成本——Acrobat Pro 是訂閱制。

2. Tesseract(免費、開源、命令列)

最精確的免費 OCR 引擎。從Tesseract GitHub 專案或套件管理器安裝 (macOS 上 brew install tesseract, Linux 上 apt install tesseract-ocr)。然後:

tesseract input.pdf output -l eng pdf

這會產生 output.pdf,為帶有原始影像和不可見英文文字層的可搜尋 PDF。Tesseract 在複雜版面上不如 Acrobat 精確,但在乾淨的單欄掃描上表現優異。它支援超過 100 種語言——對英/法混合文件傳入 -l eng+fra。

3. macOS 預覽即時文字(免費,macOS 12+)

在 macOS Monterey 及更新版本上,預覽可透過系統的即時文字功能辨識掃描 PDF 和影像中的文字。在預覽中開啟 PDF,您可以直接選取、複製和搜尋文字——macOS 即時加入文字層。若要儲存可搜尋版本,檔案 > 匯出為 PDF。即時文字快速且對英文文件精確,但語言支援比 Tesseract 有限。

4. ABBYY FineReader(付費,高精確度)

商業 OCR 工具,以對困難掃描的高精確度聞名——手寫、低對比、混合字型、多欄版面。它支援雙層輸出以供驗證。當 Tesseract 不夠精確且無法負擔 Acrobat Pro 訂閱時使用。FineReader 是一次購買,非訂閱。

逐步教學:用 Tesseract 讓 PDF 可搜尋

  1. 安裝 Tesseract。macOS 上brew install tesseract。Linux 上apt install tesseract-ocr。Windows 上從 Tesseract GitHub 專案下載安裝程式。
  2. 安裝語言資料。英文預設包含。其他語言請安裝對應語言包(例如 macOS 上 brew install tesseract-lang)。
  3. 開啟終端機。導覽至包含掃描 PDF 的資料夾。
  4. 執行 OCR。tesseract input.pdf output -l eng pdf
  5. 驗證結果。開啟 output.pdf,搜尋影像中可見的字詞並嘗試選取段落。如果搜尋和選取有效,文字層已就位。
  6. 審閱。OCR 會犯錯。將段落複製至文字編輯器並與影像比較。如果您要依賴文字,請修正任何關鍵誤判。

OCR 精確度:預期什麼

OCR 精確度幾乎完全取決於來源影像品質。300 DPI 的乾淨掃描、以常見字型(Arial、Times New Roman)列印的頁面可達 98–99% 字元精確度。150 DPI 的影印頁面、裝飾字型可能降至 90% 或更低——即每 10 個字元 1 個錯誤,足以破壞搜尋和複製貼上。

損害精確度的因素:低解析度(低於 200 DPI)、傾斜(角度掃描的頁面)、雜訊(骯髒掃描器玻璃的斑點)、混合字型、手寫、多欄版面、表格和彩色背景上的文字。如果您的掃描有這些之一,請預期需要仔細審閱。

常見錯誤

  • 對敏感文件使用免費線上 OCR 服務。檔案會上傳至伺服器。請使用本機工具——Tesseract、Acrobat 或 macOS 即時文字。
  • 不審閱就信任 OCR 輸出。OCR 會犯錯。如果您將文字複製至合約、引用或資料庫,請對照影像驗證每個字詞。
  • 需要原始外觀時選擇純文字輸出。純文字 OCR 捨棄影像。如果簽名、戳記或版面重要,請改用可搜尋 PDF 輸出。
  • 對已有文字的 PDF 執行 OCR。如果檔案已有文字層(用 Ctrl+F 測試),OCR 是多餘的且可能降低現有文字品質。請參閱為什麼我無法在 PDF 中選取文字?以確認檔案確實需要 OCR。
  • 省略語言包。Tesseract 預設使用英文。用英文模型 OCR 法文文件會產生垃圾。請始終以正確語言傳入 -l。

編輯您可搜尋 PDF 的中繼資料

OCR 加入文字層後,使用 IXPDF 的編輯中繼資料工具設定標題、作者、主題和關鍵字——在您的瀏覽器中本機執行,無上傳。

開啟編輯中繼資料