如何從 PDF 擷取文字
從 PDF 擷取文字是最常見的 PDF 任務之一——您有一份 PDF 報告、合約或研究文章,需要將文字放入文字處理器、試算表、搜尋索引,或只是能複製貼上。本指南涵蓋三種免費方法,每種都有誠實的隱私取捨。第一種方法——IXPDF 的 PDF to Text 工具——完全在您的瀏覽器中執行且永不傳送檔案。第二種使用瀏覽器內建的 PDF 檢視器快速複製貼上。第三種使用 Google Docs,可行但會將檔案傳送至 Google 伺服器。對每種方法,我們說明何時使用以及何時改用其他方法。
為什麼要從 PDF 擷取文字
PDF 設計用於檢視和列印,而非編輯。PDF 中的文字儲存在為版面最佳化的內容串流中,而非為重複使用。但有許多原因您可能需要取出文字:
- 複製貼上至其他文件。您需要在電子郵件、報告或引用中引用一段文字,而來源是 PDF。
- 搜尋索引。您想為 PDF 庫建立本機搜尋索引,需要文字內容。
- 無障礙。螢幕閱讀器和其他輔助技術對純文字的處理比某些 PDF 更好。
- 資料分析。您需要擷取表格、數字或關鍵短語以在試算表或腳本中分析。
- 翻譯。您想對 PDF 文件的文字執行翻譯工具。
無論原因為何,目標相同:從 PDF 取出文字並放入可用格式。以下方法都能做到——差異在於如何處理您的檔案和結果的精確度。
方法 1:IXPDF 的 PDF to Text 工具(推薦,本機)
IXPDF 的 PDF to Text 工具透過 PDF.js 在 Web Worker 中讀取每頁的文字內容串流。檔案留在您的瀏覽器中——永不傳送至任何伺服器。擷取的文字顯示在頁面的預覽中並提供 .txt 下載,還有複製至剪貼簿按鈕以便貼上至其他應用程式。
- 開啟 PDF to Text 工具:/tools/pdf-to-text/。
- 選取您的 PDF。將檔案拖至拖放區或點擊瀏覽。檔案名稱和大小顯示在下方。
- 限制頁面(選用)。頁面範圍欄位接受如
1,3,5-7的值。留空以擷取所有頁面的文字。 - 保留版面(選用)。勾選Preserve layout以根據版面插入換行。這會產生更接近視覺閱讀順序的文字。對於全文搜尋和複製貼上(版面不重要時)請取消勾選。
- 執行擷取。點擊Run PDF to Text。工具在您裝置的 Web Worker 中讀取每頁的文字內容串流。
- 預覽、複製或下載。擷取的文字顯示在預覽區中,附有每頁詳情。複製至剪貼簿或下載為 .txt 檔案。
方法 2:在瀏覽器 PDF 檢視器中複製貼上
現代瀏覽器(Chrome、Edge、Firefox、Safari)有內建的 PDF 檢視器可直接開啟 PDF。如果 PDF 有真正的文字層(非掃描),您可以用滑鼠選取文字並用 Ctrl+C / Cmd+C 複製。這是小段擷取最快的方法——無工具、無上傳、無安裝。
- 在瀏覽器中開啟 PDF。雙擊檔案,或拖至瀏覽器分頁。內建 PDF 檢視器開啟它。
- 選取文字。點擊並拖曳至想要的文字。如果無法高亮,PDF 可能是掃描的——請參閱下方疑難排解。
- 複製。按
Ctrl+C/Cmd+C或右鍵並選擇複製。 - 貼上。切換至目標文件並按
Ctrl+V/Cmd+V。
此方法適合幾句話或一個段落。對整份文件會很繁瑣——您需逐頁選取,且選取可能無法跨頁分隔。對完整文件擷取,請使用方法 1。
方法 3:Google Docs 匯入(可行,但會傳送至 Google)
Google Docs 可開啟 PDF 並轉換為可編輯文件。這對版面複雜的 PDF 效果很好,結果是可編輯、分享或匯出為 .docx 的 Google 文件。取捨在於隱私:將 PDF 傳送至 Google 意味著 Google 擁有副本。如果文件敏感,請改用方法 1。
- 前往 Google Drive。登入drive.google.com。
- 上傳 PDF。將檔案拖至 Drive 或點擊新增 → 上傳檔案。檔案現在在 Google 伺服器上。
- 用 Google Docs 開啟。右鍵點擊 PDF 並選擇開啟方式 → Google Docs。Google 將 PDF 轉換為可編輯文件。
- 複製或匯出文字。用
Ctrl+A全選,Ctrl+C複製,貼至想去的地方。或使用檔案 → 下載 → 純文字 (.txt)匯出整份文件。
疑難排解:掃描的 PDF 與 OCR
如果以上方法都無法產生文字——IXPDF 工具傳回空結果、瀏覽器檢視器無法選取、Google Docs 匯入無文字的影像——PDF 很可能是掃描的。掃描的 PDF 是紙張的照片:每頁是一張大影像,內容串流中沒有文字。再多的複製貼上或文字擷取都無法從影像中取出文字。解決方案是 OCR(光學字元辨識),分析影像並在 PDF 中寫入新的文字層。
IXPDF 今天無法在瀏覽器中執行 OCR。基於瀏覽器的 OCR 引擎存在(Tesseract.js、OCRad.js),但對真實掃描的精確度不夠可靠——它們混淆常見字型、難以處理多欄版面,產生的文字對搜尋和無障礙而言比完全沒有文字更糟。我們不會推出靜默傳回錯誤文字的工具。請參閱如何讓 PDF 可搜尋以了解可信的本機 OCR 工具(Adobe Acrobat、Tesseract、macOS 預覽即時文字、ABBYY FineReader),它們在您的機器上執行而不傳送檔案。
如需深入了解為什麼文字選取會失敗以及如何診斷原因(掃描、純影像、壓平或字型編碼損壞),請參閱為什麼我無法在 PDF 中選取文字。
我該使用哪種方法?
- 完整文件,隱私重要:使用IXPDF PDF to Text。本機、免費、無上傳。
- 幾句話,快速:使用瀏覽器的 PDF 檢視器複製貼上。無工具。
- 複雜版面,可接受上傳:使用 Google Docs 匯入。對困難版面轉換品質較好,但檔案會去 Google。
- 掃描的 PDF:以上皆不可行。需要 OCR——請參閱如何讓 PDF 可搜尋。
FAQ
IXPDF PDF to Text 工具真的免費嗎?
是的。免費、無帳號、無註冊、無浮水印、無使用限制。完全在您的瀏覽器中執行——沒有伺服器向您收費。
加密的 PDF 可以使用嗎?
不行。如果 PDF 受密碼保護,工具顯示「已加密」錯誤。請先解密檔案(請參閱如何解鎖 PDF),然後擷取文字。
為什麼擷取的文字是亂碼?
某些 PDF 有損壞的字型編碼(ToUnicode 映射缺失或錯誤)。文字在螢幕上正確顯示(檢視器有字型輪廓),但無法重新映射為 Unicode 字元以供擷取。這是檔案的屬性,不是工具的錯誤。解決方案是從來源應用程式以正確的 Unicode 映射重新匯出,或對檔案執行 OCR 以加入新的文字層。
工具會保留原始 PDF 的版面嗎?
勾選Preserve layout時,工具根據頁面上文字元素的 y 位置插入換行,產生更接近視覺版面的文字。這是最佳效果——複雜的多欄版面、表格和文字方塊可能不符合視覺閱讀順序。對於全文搜尋和複製貼上,請取消勾選,工具會以空格連接文字元素,這對搜尋更可靠。
可以只擷取特定頁面的文字嗎?
可以。在頁面範圍欄位輸入如 1,3,5-7 的範圍。僅擷取這些頁面,按列出順序。留空以擷取所有頁面的文字。
PDF to Text 和 OCR 有什麼區別?
PDF to Text 讀取 PDF 內容串流中已存在的文字。它只對有真正文字層的 PDF 有效(由文字處理器建立、從應用程式匯出等)。OCR(光學字元辨識)分析影像的像素並辨識字母形狀以建立新的文字層。OCR 對掃描的 PDF、照片和文字已燒入影像的 PDF 是必要的。IXPDF 做前者;後者請參閱如何讓 PDF 可搜尋。
想知道 PDF 與 XPS 和 EPUB 等其他文件格式比較如何?請參閱PDF vs XPS vs EPUB的詳細比較。