PDF轉文字
從 PDF 提取文字。您的檔案永遠不會離開您的裝置——所有處理都在您的瀏覽器中本地進行。
將 PDF 拖放至此處
或點擊選擇檔案
您的檔案永遠不會離開您的裝置。
Extracts the text content stream of each page. Scanned (image-only) PDFs have no text layer — the result will be empty for those files.
PDF 轉文字使用 PDF.js 在 Web Worker 中提取每頁的文字內容串流。結果顯示在頁面內預覽中,並提供 .txt 下載,還有複製到剪貼簿按鈕可貼入其他應用。提取完全在瀏覽器內執行,檔案不會被上傳。掃描(純影像)PDF 沒有文字層,會產生空結果;工具會誠實呈現而非偽造 OCR。
運作方式
如何使用 PDF轉文字
- 1拖入 PDF. 將 PDF 檔案拖放到拖放區,或點擊從裝置選擇檔案。
- 2可選設定頁面範圍. 輸入如 1,3,5-7 的頁面以僅從這些頁面提取文字。留空則為所有頁面。
- 3執行「PDF 轉文字」. 工具使用 PDF.js 在 Web Worker 中於您的裝置內讀取每頁的文字內容串流。
- 4預覽、複製或下載. 提取的文字顯示在預覽區域。可複製到剪貼簿或下載為 .txt 檔案。
功能
此工具的用途
- 從所有或選定頁面提取文字
- 可選保留版面(根據頁面版面插入換行)
- 頁面內預覽,含每頁分解
- 複製到剪貼簿或下載為 .txt
- 無需上傳 —— 在瀏覽器內完全執行
限制
注意事項
- 掃描(純影像)PDF 没有文字層 —— 結果將為空(不執行 OCR;請見 OCR 指南)
- 版面重建為盡力而為;複雜的多欄版面可能不符合視覺閱讀順序
- ToUnicode 映射損壞的內嵌字型可能產生亂碼
- 影像內的文字不會被提取(僅讀取真實文字內容串流)
常見問題
常見問題
為什麼結果是空的?
PDF 很可能是掃描的(純影像)或文字被烘焙進影像。內容串流中沒有可提取的文字。解決方案是 OCR —— 請見「如何讓 PDF 可搜尋」以了解可信的本地 OCR 工具。IXPDF 不在瀏覽器中偽造 OCR(準確度不夠可靠到可以發布)。
加密 PDF 能用嗎?
不能。如果 PDF 受密碼保護,工具會顯示「已加密」錯誤。請先解密檔案,再提取文字。
「保留版面」做什麼?
勾選時,工具根據頁面上文字項的 y 位置插入換行,產生更接近視覺版面的文字。不勾選時,文字項以空格連接,更適合全文搜尋和複製貼上。
提取的文字準確嗎?
對於有真實文字層(非掃描)的 PDF,提取的文字與所見一致。字型編碼損壞(缺少 ToUnicode 映射)的 PDF 可能產生亂碼字元 —— 這是檔案的屬性,不是工具的錯誤。
可以僅從特定頁面提取文字嗎?
可以。在頁面範圍欄位輸入如 1,3,5-7。僅這些頁面會按列出順序提取。
檔案會被上傳到某處嗎?
不會。文字提取透過 Web Worker 在瀏覽器內完全完成。您的檔案和提取的文字永遠不會離開您的裝置。