Tamaño de archivo PDF: ¿qué hace que los PDFs sean grandes?
Un PDF de una página de texto puede ocupar 30 KB. La misma página escaneada puede ocupar 3 MB. La diferencia no es magia — proviene de cuatro cosas específicas dentro del archivo. Entenderlas te dice exactamente adónde van tus bytes.
Factor 1
Imágenes incrustadas
Las imágenes suelen ser el mayor contribuyente individual al tamaño de un PDF. Una foto de alta resolución incrustada a 300 DPI puede ocupar fácilmente varios megabytes. La misma imagen guardada como JPEG de baja calidad a 72 DPI podría ser el 5% de ese tamaño. Los PDFs almacenan las imágenes en su codificación original — JPEG, PNG o sin comprimir — así que una imagen de origen demasiado grande se convierte en un PDF demasiado grande.
La solución rara vez es "quitar la imagen". Es usar la resolución correcta para el uso previsto (pantalla vs impresión) y un formato de compresión adecuado. Una foto destinada a una web no necesita resolución de calidad de impresión.
Factor 2
Fuentes incrustadas
Los PDFs pueden incrustar fuentes para que el documento se vea idéntico en máquinas que no tienen esas fuentes instaladas. Un archivo de fuente completo puede ocupar 200 KB o más, y un documento que usa varias fuentes puede gastar la mayor parte de su tamaño solo en datos de fuentes.
La mitigación estándar es el subconjunto de fuentes: incrustar solo los glifos (caracteres) realmente usados en el documento. Si una fuente de 200 KB se usa para una sola frase de texto en inglés, un subconjunto podría ocupar solo 10 KB. La mayoría de las herramientas PDF crean subconjuntos por defecto, pero no todas — y un PDF que incrusta fuentes completas será notablemente más grande que uno que no lo hace.
Factor 3
Páginas escaneadas
Un PDF escaneado es esencialmente una pila de imágenes, una por página. Como cada página es una imagen raster de página completa en lugar de texto seleccionable y gráficos vectoriales, los PDFs escaneados son la variedad común más grande. Un documento escaneado de 20 páginas puede alcanzar fácilmente 20–60 MB.
La única forma de reducir sustancialmente un PDF escaneado es recodificar las imágenes a una resolución menor o usar un formato de compresión diseñado para texto bitonal (como JBIG2 o CCITT Group 4). Convertir un escaneo a texto seleccionable mediante OCR cambia el archivo de imágenes a texto y vectores, lo cual es drásticamente más pequeño — pero la calidad del OCR varía y no siempre está disponible.
Factor 4
Objetos repetidos y metadatos
Los PDFs pueden llevar datos redundantes: la misma imagen colocada en cada página, varias copias de una fuente o metadatos verbosos y capas de contenido ocultas de la aplicación de autoría. Algunos exportadores de oficina también dejan objetos sin usar en el archivo que formaban parte de borradores intermedios.
Volver a guardar un PDF puede eliminar estos objetos sin uso y consolidar duplicados, a menudo sin cambio visible. Esto es lo que suele hacer una operación de compresión: reescribe el archivo con flujos de objetos y descarta cualquier cosa no referenciada.
Acción
Qué puedes hacer
Si tu PDF es más grande de lo esperado, la causa casi siempre es uno de los cuatro anteriores. Puedes reducirlo sin subirlo a ninguna parte: pásalo por una herramienta local decomprimir PDF que vuelva a guardar con flujos de objetos y elimine objetos sin usar. Para PDFs con muchas imágenes, las mayores ganancias vienen de recodificar las imágenes de origen antes de que entren en el PDF.
Sigue leyendo
Recursos relacionados
Sigue leyendo