PDFを検索可能にする方法
スキャンPDFは紙の写真 — ファイル内にテキストはなく、ピクセルだけ。検索・選択・コピー・ スクリーンリーダーの使用ができません。検索可能にするとはOCR(光学式文字認識)を 実行して画像の背後にテキストレイヤーを追加することです。このガイドは3種類のOCR出力、 これをうまく行うローカルツール、そしてIXPDFが今日ブラウザでOCRを行わない理由を解説します。
3種類のOCR出力タイプ
OCRツールは3種類の異なる出力を生成できます。どれが欲しいかは結果で何をするかによります。
1. 検索可能PDF(画像 + 不可視テキスト)
最も一般的で通常は正しい選択。元のページ画像がそのまま表示 — レイアウト、署名、スタンプ、 手書きすべて元の通り。画像の背後にOCRが不可視テキストレイヤーを追加。検索・選択・コピー・ スクリーンリーダー使用が可能。画面に見えるのは元のスキャン。Adobe Acrobat、Tesseract、 ABBYYがデフォルトでこれを生成。
最適: 元の外観が重要なスキャン文書のアーカイブ(契約書、領収書、署名付き手紙)。
2. テキストのみPDF(認識テキスト、画像なし)
OCRが画像を認識テキストで完全に置換。結果は小さく、完全に選択可能で、通常のテキストPDF のように見えます — ただし元のレイアウトは近似で、OCRが認識できなかったコンテント (署名、スタンプ、手書き)は失われます。
最適: テキストだけが必要で元の外観が重要でない場合 (例:スキャン手紙の本文をナレッジベース用の検索可能ファイルに抽出)。
3. デュアルレイヤーPDF(画像 + テキスト、両方表示)
より一般的でない形式で、元の画像と認識テキストを並べて表示、または画像を薄くして テキストを上に重ねて表示。レビューアが誤読を捕捉するためOCR出力をオリジナルと比較 する必要がある法務・アーカイブワークフローで使用。ABBYY FineReaderとAdobe Acrobat Pro がこれをサポート。
最適: 法務レビュー、アーカイブ品質管理、OCR精度をソースに対して 検証する必要があるワークフロー。
ローカルOCRツール
以下のツールはすべてマシン上で実行されます。どれもドキュメントをアップロードしません。 これは重要です:スキャン契約書・診療記録・税務書類は「無料オンラインOCR」サービスに 送るべきではありません — その時点でコンテントが他人のサーバーにあります。
1. Adobe Acrobat Pro(有料、ゴールドスタンダード)
スキャンPDFを開き、ツール > スキャン & OCR > テキストを認識 > このファイル内。言語と出力タイプを選択(検索可能画像がデフォルトで通常は正しい)。 AcrobatのOCRは実世界スキャンで最も精度が高く、段組みレイアウトをうまく処理し、 誤認識単語をインラインで修正可能。欠点はコスト — Acrobat Proはサブスクリプション。
2. Tesseract(無料、オープンソース、コマンドライン)
最も精度の高い無料OCRエンジン。Tesseract GitHubプロジェクトまたはパッケージマネージャー (macOSはbrew install tesseract、Linuxはapt install tesseract-ocr) からインストール。次に:
tesseract input.pdf output -l eng pdf
これでoutput.pdfが元の画像と不可視の英語テキストレイヤーを持つ検索可能PDF として生成。Tesseractは複雑レイアウトではAcrobatほど正確ではありませんが、クリーンな 単一段組みスキャンでは優秀。100以上の言語をサポート — 英語/フランス語混在文書には-l eng+fraを指定。
3. macOS Preview Live Text(無料、macOS 12+)
macOS Monterey以降、PreviewはシステムのLive Text機能を使ってスキャンPDFや画像内の テキストを認識可能。PreviewでPDFを開くと、テキストを直接選択・コピー・検索できます — macOSがその場でテキストレイヤーを追加。検索可能版を保存するにはファイル > PDFとして書き出し。Live Textは英語文書で高速・高精度ですが、 Tesseractより言語サポートが限定的。
4. ABBYY FineReader(有料、高精度)
困難なスキャン — 手書き、低コントラスト、混在フォント、段組みレイアウト — で 高精度で知られる商用OCRツール。検証用のデュアルレイヤー出力をサポート。Tesseractが 精度不足でAcrobat Proのサブスクリプションを正当化できない場合に使用。 FineReaderは買い切りでサブスクリプションではありません。
ステップバイステップ:TesseractでPDFを検索可能に
- Tesseractをインストール。 macOSでは
brew install tesseract。 Linuxではapt install tesseract-ocr。WindowsではTesseract GitHubプロジェクトから インストーラをダウンロード。 - 言語データをインストール。 英語はデフォルトで含まれます。他の言語は 一致する言語パックをインストール(例:macOSでは
brew install tesseract-lang)。 - ターミナルを開く。 スキャンPDFを含むフォルダに移動。
- OCRを実行。
tesseract input.pdf output -l eng pdf - 結果を確認。
output.pdfを開き、画像に見える単語を検索し、 段落を選択してみる。検索と選択が機能すればテキストレイヤーが配置済み。 - 校正。 OCRは誤読します。段落をテキストエディタにコピーし画像と比較。 テキストに依存する場合は致命的な誤認識をソース文書で修正。
OCR精度:期待値
OCR精度はほぼ完全にソース画像の品質に依存。よくあるフォント(Arial、Times New Roman)で 印刷ページのクリーンな300 DPIスキャンは98〜99%の文字精度。装飾フォントでコピーした ページの150 DPIスキャンは90%以下に落ちる可能性 — 10文字に1文字の誤りで、検索や コピー・ペーストを壊すには十分。
精度を下げる要因:低解像度(200 DPI未満)、傾き(角度でスキャンされたページ)、 ノー(汚れたスキャナーガラスからの斑点)、混在フォント、手書き、段組みレイアウト、 表、色背景上のテキスト。スキャンにこれらがあれば、慎重な校正を期待してください。
よくある間違い
- 機密文書に無料オンラインOCRサービスを使用。ファイルがサーバーにアップロードされます。ローカルツールを使用 — Tesseract、Acrobat、 またはmacOS Live Text。
- 校正なしでOCR出力を信頼。OCRは誤読します。契約書・引用・データベースにテキストをコピーする場合は、 画像に対してすべての単語を検証。
- 元の外観が必要なのにテキストのみ出力を選択。テキストのみOCRは画像を破棄。署名・スタンプ・レイアウトが重要なら検索可能PDF出力を 使用。
- 既にテキストがあるPDFにOCRをかける。ファイルに既にテキストレイヤーがある場合(Ctrl+Fでテスト)、OCRは不要で既存テキストを 劣化する可能性。PDFでテキストを選択 できないのはなぜ?でファイルが実際にOCRを必要か確認。
- 言語パックをスキップ。 Tesseractはデフォルトで英語。英語言語モデルで フランス語文書にOCRをかけるとゴミが出ます。常に正しい言語で
-lを指定。
検索可能PDFのメタデータを編集
OCRがテキストレイヤーを追加したら、IXPDFのメタデータ編集ツールでタイトル・作成者・ 主題・キーワードを設定 — ブラウザ内でローカルに、アップロードなし。
メタデータ編集を開く