PDF でテキストを選択できないのはなぜ?
PDF でテキストを選択できない — クリック&ドラッグで単語をなぞっても何もハイライトされない — 場合、テキストはファイルのコンテンツストリームにありません。これは通常 4 つのいずれかを意味します:PDF がスキャン画像、テキストがエクスポート時に画像にベイクされた、テキストレイヤーを失う形でフラット化された、またはフォントエンコーディングが破損。最初の 3 つの修正は OCR です。本ガイドはどの原因かを見分ける方法と対処法を解説します。
4 つのよくある原因
1. PDF がスキャン(画像のみ)
最もよくある原因。スキャン文書は紙の写真 — 各ページが 1 つの大きな画像です。コンテンツストリームにテキストがないため、選択するものがありません。スキャナーはデフォルトで画像のみの PDF を生成します。スキャナーソフトウェアの「検索可能 PDF」オプションがスキャン時に OCR でテキストレイヤーを追加するものです。
確認方法:400% にズーム。テキストがピクセル化(文字の輪郭がギザギザ)すれば画像です。実際のテキストはフォントアウトラインからレンダリングされるため、どのズームでも鮮明です。また Ctrl+F / Cmd+F を試してください — 表示されている単語を検索で見つけられなければ、テキストレイヤーがありません。
修正:OCR を実行して検索可能なテキストレイヤーを追加。PDF を検索可能にする方法でローカルで行うツールを参照。
2. テキストが画像にベイクされている
一部のアプリケーションは、ソースが実際のテキストでも、テキストをラスター化 — ピクセルに変換して画像として埋め込む — PDF をエクスポートします。これはすべてをラスター化する「PDF に印刷」ドライバーや、テキストを背景画像にフラット化するプレゼンテーションエクスポーター、すべてのコンテンツを画像に変換する「フラット化」ステップを経た PDF で発生します。
確認方法:スキャンと同じ — 400% にズームしてピクセル化を確認。元は実際のテキスト PDF だった可能性があり、ラスター化はエクスポート時に発生。
修正:ソースアプリケーションからテキストをテキストとして保持(ラスター化しない)して再エクスポート。ソースがない場合は既存ファイルに OCR を実行。
3. PDF がフラット化された
フラット化はフォームフィールド・注釈・時にテキストを静的コンテンツに変換します。一部のフラット化操作はテキストレイヤーを保持、他はすべてをラスター化します。フラット化ステップがラスター化した場合、結果は画像のみで非選択です。
確認方法:ズームテストを再び。400% でもテキストが鮮明だが選択できない場合、フラット化がテキストをアウトライン(ベクター図形)として保持 — まれだが可能。ピクセル化していればフラット化がラスター化。
修正:テキストレイヤーを保持するツールで再フラット化、またはソースから再エクスポート。PDF をフラット化する方法でテキスト保持とラスター化フラット化の違いを参照。
4. フォントエンコーディング破損(ToUnicode 欠落)
最もまれな原因。テキストはコンテンツストリームに存在し正しくレンダリングされますが、フォントの ToUnicode マッピングが次落または誤りです。ビューアーはグリフを表示できます(フォントアウトラインを持つため)が、選択・コピー・検索のために Unicode 文字に逆マッピングできません。テキストは見えるが選択できません。
確認方法:テキストはどのズームでも鮮明(画像ではなく実際のテキスト)だが選択・コピーできない。検索も失敗。古い CAD ツールやニッチなエクスポーターが生成した PDF でよく見られます。
修正:ソースから適切な Unicode マッピングで再エクスポート。ソースがない場合は OCR を実行 — 正しい Unicode で新しいテキストレイヤーを追加し、破損したものを置換。
クイック診断チェックリスト
- 単語を選択してみる。 クリック&ドラッグで単語をなぞる。何もハイライトされなければテキストはコンテンツストリームにありません。
- 400% にズーム。 テキストがピクセル化すれば画像(スキャン・ラスター化・画像にフラット化)。鮮明なら実際のテキストでエンコーディング破損。
- 検索を試す(Ctrl+F / Cmd+F)。 表示されている単語を検索で見つけられなければ、検索可能なテキストレイヤーがありません。
- ファイルサイズを確認。 スキャン PDF は通常大きい(ページごとに1つの全ページ画像)。非選択テキストの小さなファイルはエンコーディング破損の可能性が高い。
- 必要なら OCR を適用。 ローカル OCR ツールで検索可能なテキストレイヤーを追加。
今すぐ実行できるクイックテスト
PDF がスキャン文書から作成された場合、テキスト抽出は空を返します。IXPDF の PDF to Text ツール を試してください — ファイルをドロップし、実行し、結果を確認。抽出テキストが空なら PDF はスキャン(またはラスター化)で、テキストを選択可能にするには OCR が必要です。PDF を検索可能にする方法で信頼できるローカル OCR オプションを参照。ツールがテキストを返すのに元の PDF で選択できない場合、原因はおそらくフォントエンコーディング破損(上記原因 4) — テキストレイヤーは存在しますが、ビューアーがグリフを Unicode に逆マッピングできません。
OCR が修正(単なる回避策ではない)理由
スキャン・ラスター化・エンコーディング破損 PDF について、OCR は唯一の修正です — 回復すべき元のテキストがありません。OCR は画像を分析し、文字の形を認識し、新しいテキストレイヤーを PDF に書き込みます。結果は「検索可能 PDF」です:元の画像は可視のまま(レイアウトと署名が保持され)、認識されたテキストが選択・コピー・検索用の不可視レイヤーとして背後に配置されます。
OCR の品質が結果の品質を決定します。現代の OCR エンジン(Tesseract 5・ABBYY FineReader・Adobe Acrobat の OCR)はクリーンな 300 DPI スキャンの一般フォントで良好です。手書き・低解像度スキャン・装飾フォント・テキストと画像が混在する段組みレイアウトでは苦戦します。認識されたテキストは依存する前に必ず校正してください。
よくある間違い
- PDF が「暗号化」や「保護」されていると思い込む。 非選択テキストはセキュリティ機能ではほぼありません。通常はスキャンファイルです。Acrobat Reader で開いて ファイル > プロパティ > セキュリティ に制限がなければ保護されていません。
- 機密文書に無料オンライン OCR サービスを使用。 ファイルがサーバーにアップロードされます。ローカルツール — Tesseract・Acrobat・macOS ライブテキスト — を使用。
- OCR 出力を校正せずに信頼。 OCR は誤読します。契約や引用にテキストをコピーする場合、各単語を画像と照合してください。
- 再エクスポートではなく再スキャン。 ソース文書(Word・PowerPoint・InDesign)があれば PDF として再エクスポート — テキストは実際のものになり選択可能。再スキャンは最後の手段。
PDF を検索可能に
IXPDF は今日ブラウザで OCR を行えません — 精度がリリース基準に達しません。ガイドでファイルをアップロードせずにお使いのマシンで実行する信頼できるローカル OCR ツールを参照。
OCR オプションについて学ぶ