跳至内容
100% 本地 · 上传 0 KB压缩 PDF

PDF 文件大小:什么让 PDF 变大?

一页文本 PDF 可以只有 30 KB。同一页扫描后可能达到 3 MB。差异并非魔法 — 它来自文件内部的四个具体因素。理解它们就能准确知道你的字节花在了哪里。

因素 1

嵌入图像

图像通常是 PDF 大小的最大单一贡献因素。以 300 DPI 嵌入的高分辨率照片轻松就能占用数兆字节。同一张图以 72 DPI 的低质量 JPEG 保存可能只有其 5% 的大小。PDF 以原始编码(JPEG、PNG 或未压缩)存储图像,因此过大的源图像会变成过大的 PDF。

解决办法很少是"删除图像"。而是为预期用途(屏幕 vs 打印)使用合适的分辨率,以及合适的压缩格式。用于网站的照片不需要印刷质量的分辨率。

因素 2

嵌入字体

PDF 可以嵌入字体,使文档在未安装这些字体的机器上看起来完全相同。一个完整字体文件可能 200 KB 或更多,使用多种字体的文档可能把大部分体积花在字体数据上。

标准的缓解措施是字体子集化:只嵌入文档中实际使用的字形(字符)。如果一个 200 KB 的字体只用于一句英文文本,子集可能只有 10 KB。大多数 PDF 工具默认子集化,但并非全部 — 嵌入完整字体的 PDF 会明显大于不嵌入的。

因素 3

扫描页面

扫描 PDF 本质上是一叠图像,每页一张。因为每页是全页位图图像而非可选文本和矢量图形,扫描 PDF 是最大的常见类型。一份 20 页的扫描文档轻松就能达到 20–60 MB。

大幅缩小扫描 PDF 的唯一方法是以更低分辨率重新编码图像,或使用专为二值文本设计的压缩格式(如 JBIG2 或 CCITT Group 4)。通过 OCR 将扫描转为可选文本会把图像变成文本和矢量,体积会显著减小 — 但 OCR 质量参差不齐,且并非总是可用。

因素 4

重复对象和元数据

PDF 可能携带冗余数据:每页都放置的同一张图像、字体的多个副本,或来自创作应用的冗余元数据和隐藏内容层。一些办公导出器还会把中间草稿中的未引用对象留在文件里。

重新保存 PDF 可以丢弃这些未引用对象并合并重复项,通常没有可见变化。这就是压缩操作通常所做的:用对象流重写文件并丢弃任何未被引用的内容。

行动

你能做什么

如果你的 PDF 比预期大,原因几乎总是上述四项之一。你可以不上传到任何地方就缩小它:通过本地的压缩 PDF工具重新以对象流保存并丢弃未引用对象。对于图像密集的 PDF,最大的收益来自在图像进入 PDF 之前就重新编码源图像。

继续阅读

相关资源

继续阅读

相关指南