PDF 提取文本
从 PDF 中提取文本。文件永不离开您的设备 —— 所有处理都在浏览器内本地完成。
设计即私密
您的文件永不离开您的设备。所有处理均在浏览器本地完成 —— 无上传、无服务器。
将 PDF 拖放到此处
或点击选择文件
您的文件永不离开您的设备。
Extracts the text content stream of each page. Scanned (image-only) PDFs have no text layer — the result will be empty for those files.
PDF 提取文本使用 PDF.js 在 Web Worker 中读取每页的文本内容流。结果在页面内预览中显示,并可下载为 .txt 文件,还提供复制到剪贴板按钮以便粘贴到其他应用。提取完全在浏览器内完成,文件不会被上传。仅扫描(纯图像)的 PDF 没有文本层,结果将为空;本工具如实反映这一情况,而非伪造 OCR。
工作原理
如何使用 PDF 提取文本
- 1拖入 PDF. 将 PDF 文件拖放到拖放区,或点击从设备选择文件。
- 2可选:设置页面范围. 输入如 1,3,5-7 仅从这些页面提取文本。留空则提取所有页面。
- 3执行「PDF 提取文本」. PDF.js 在 Web Worker 中于您的设备内读取每页的文本内容流。
- 4预览、复制或下载. 提取的文本显示在预览区。可复制到剪贴板或下载为 .txt 文件。
功能
此工具的功能
- 从所有或选定页面提取文本
- 可选保留布局(根据页面布局插入换行)
- 页面内预览,含每页明细
- 复制到剪贴板或下载为 .txt
- 无需上传 —— 在浏览器内完全运行
限制
须知事项
- 仅扫描(纯图像)的 PDF 没有文本层 —— 结果将为空(不执行 OCR;参见 OCR 指南)
- 布局重建为尽力而为;复杂多栏布局可能与视觉阅读顺序不一致
- ToUnicode 映射损坏的嵌入字体可能产生乱码
- 图像内的文本不会被提取(仅读取真正的文本内容流)
常见问题
常见问题解答
为什么结果为空?
PDF 很可能是仅扫描(纯图像)的,或文本被烘焙到图像中。内容流中没有可提取的文本。解决办法是 OCR —— 关于可信的本地 OCR 工具,请参阅"如何让 PDF 可搜索"。IXPDF 不会在浏览器中伪造 OCR(精度不够可靠,无法发布)。
能处理加密 PDF 吗?
不能。如果 PDF 有密码保护,工具会显示"已加密"错误。请先解密再提取文本。
"保留布局"做什么?
勾选时,工具根据页面上文本项的 y 坐标插入换行,生成更接近视觉布局的文本。不勾选时,文本项以空格连接,更适合全文搜索和复制粘贴。
提取的文本准确吗?
对于有真正文本层(非扫描)的 PDF,提取的文本与所见一致。字体编码损坏(缺少 ToUnicode 映射)的 PDF 可能产生乱码 —— 这是文件属性,非工具 bug。
可以只从特定页面提取文本吗?
可以。在页面范围字段输入如 1,3,5-7。仅这些页面会按所列顺序提取。