PDF からテキスト抽出
PDF からテキストを抽出します。ファイルは端末から送信されません — すべての処理はブラウザ内で行われます。
PDF をここにドロップ
またはクリックしてファイルを選択
ファイルは端末から送信されません。
Extracts the text content stream of each page. Scanned (image-only) PDFs have no text layer — the result will be empty for those files.
PDF からテキスト抽出は、PDF.js を Web Worker で使い、各ページのテキストコンテンツストリームを抽出します。結果はページ内プレビューに表示され、.txt ファイルとしてダウンロードできます。他のアプリに貼り付けるためのクリップボードコピー機能もあります。抽出はすべてブラウザ内で行われ、ファイルがアップロードされることはありません。スキャンのみの PDF(画像のみ)にはテキストレイヤーがなく、結果は空になります。本ツールは OCR を偽装せず、正直に空結果を返します。
仕組み
PDF からテキスト抽出 の使い方
- 1PDF をドロップ. PDF ファイルをドロップゾーンにドラッグ&ドロップするか、クリックして選択します。
- 2ページ範囲を指定(任意). 1,3,5-7 のようにページを指定すると、そのページからのみテキストを抽出します。空欄で全ページ対象。
- 3「PDF からテキスト抽出」を実行. PDF.js を使い、Web Worker であなたの端末内の各ページのテキストコンテンツストリームを読み取ります。
- 4プレビュー・コピー・ダウンロード. 抽出されたテキストがプレビュー領域に表示されます。クリップボードにコピーするか、.txt ファイルとしてダウンロードできます。
機能
このツールの機能
- すべてまたは選択ページからテキストを抽出
- 任意のレイアウト保持(ページレイアウトに基づく改行を挿入)
- ページごとの内訳付きページ内プレビュー
- クリップボードにコピーまたは .txt としてダウンロード
- アップロード不要 — ブラウザ内で完全に動作
制限事項
知っておくべきこと
- スキャンのみの PDF にはテキストレイヤーがなく、結果は空になります(OCR は実行されません。OCR ガイドを参照)
- レイアウト再構築はベストエフォートです。複雑な段組みレイアウトでは視覚的な読み順と一致しない場合があります
- ToUnicode マッピングが壊れた埋め込みフォントは文字化けを生成する場合があります
- 画像内のテキストは抽出されません(実際のテキストコンテンツストリームのみ読み取ります)
よくある質問
よくある質問
結果が空になるのはなぜですか?
PDF がスキャンのみ(画像のみ)か、テキストが画像に焼き込まれている可能性が高いです。コンテンツストリームに抽出すべきテキストがありません。解決策は OCR です — 信頼できるローカル OCR ツールについては「PDF を検索可能にする方法」を参照してください。IXPDF はブラウザで OCR を偽装しません(精度が信頼できるレベルに達しないため)。
暗号化された PDF で動作しますか?
いいえ。PDF がパスワード保護されている場合、「暗号化されています」エラーを表示します。まず復号してからテキストを抽出してください。
「レイアウトを保持」とは何ですか?
オンの場合、ページ上のテキスト項目の y 位置に基づいて改行を挿入し、視覚レイアウトに近いテキストを生成します。オフの場合、テキスト項目をスペースで結合し、全文検索やコピー&ペーストに適した結果を生成します。
抽出されたテキストは正確ですか?
実際のテキストレイヤーを持つ PDF(スキャン以外)の場合、抽出されたテキストは表示内容と一致します。フォントエンコーディングが壊れた PDF(ToUnicode マッピング欠落)は文字化けを生成する場合があります — これはファイルの属性であり、ツールのバグではありません。
特定のページからのみテキストを抽出できますか?
はい。ページ範囲フィールドに 1,3,5-7 のように入力してください。指定したページのみが、記載順に抽出されます。