Taille de fichier PDF : qu'est-ce qui rend les PDF volumineux ?
Un PDF d'une page de texte peut faire 30 Ko. La même page numérisée peut faire 3 Mo. La différence n'est pas magique — elle provient de quatre choses spécifiques dans le fichier. Les comprendre vous dit exactement où vont vos octets.
Facteur 1
Images intégrées
Les images sont généralement le plus grand contributeur individuel à la taille d'un PDF. Une photo haute résolution intégrée à 300 PPP peut facilement occuper plusieurs mégaoctets. La même image enregistrée en JPEG de basse qualité à 72 PPP pourrait faire 5 % de cette taille. Les PDF stockent les images dans leur codage original — JPEG, PNG ou non compressé — donc une image source trop grande devient un PDF trop grand.
La solution est rarement « supprimer l'image ». C'est utiliser la bonne résolution pour l'usage prévu (écran vs impression) et un format de compression approprié. Une photo destinée à un site web n'a pas besoin de résolution qualité impression.
Facteur 2
Polices intégrées
Les PDF peuvent intégrer des polices pour que le document s'affiche identiquement sur des machines qui n'ont pas ces polices installées. Un fichier de police complet peut faire 200 Ko ou plus, et un document utilisant plusieurs polices peut dépenser la majeure partie de sa taille seulement en données de polices.
L'atténuation standard est le sous-ensemble de polices : intégrer seulement les glyphes (caractères) réellement utilisés dans le document. Si une police de 200 Ko est utilisée pour une seule phrase de texte, un sous-ensemble pourrait faire seulement 10 Ko. La plupart des outils PDF créent des sous-ensembles par défaut, mais pas tous — et un PDF qui intègre des polices complètes sera notablement plus grand qu'un qui ne le fait pas.
Facteur 3
Pages numérisées
Un PDF numérisé est essentiellement une pile d'images, une par page. Comme chaque page est une image raster pleine page plutôt que du texte sélectionnable et des graphiques vectoriels, les PDF numérisés sont la variété courante la plus volumineuse. Un document numérisé de 20 pages peut facilement atteindre 20–60 Mo.
La seule façon de réduire substantiellement un PDF numérisé est de réencoder les images à une résolution inférieure ou d'utiliser un format de compression conçu pour le texte bitonal (comme JBIG2 ou CCITT Group 4). Convertir une numérisation en texte sélectionnable via OCR change le fichier d'images en texte et vecteurs, ce qui est drastiquement plus petit — mais la qualité OCR varie et n'est pas toujours disponible.
Facteur 4
Objets répétés et métadonnées
Les PDF peuvent porter des données redondantes : la même image placée sur chaque page, plusieurs copies d'une police ou des métadonnées verbeuses et des couches de contenu cachées de l'application de création. Certains exportateurs bureautiques laissent aussi des objets inutilisés dans le fichier qui faisaient partie de brouillons intermédiaires.
Réenregistrer un PDF peut éliminer ces objets inutilisés et consolider les doublons, souvent sans changement visible. C'est ce que fait typiquement une opération de compression : elle réécrit le fichier avec des flux d'objets et supprime tout ce qui n'est pas référencé.
Action
Ce que vous pouvez faire
Si votre PDF est plus grand que prévu, la cause est presque toujours l'un des quatre ci-dessus. Vous pouvez le réduire sans le téléverser nulle part : passez-le par un outil local decompresser PDF qui réenregistre avec des flux d'objets et supprime les objets inutilisés. Pour les PDF riches en images, les plus grandes gains viennent de réencoder les images source avant qu'elles n'entrent dans le PDF.
À lire aussi
Ressources associées
À lire aussi