Ce que révèlent les métadonnées de votre PDF
Un PDF est plus que ses pages visibles. Il transporte un dictionnaire de métadonnées qui peut enregistrer qui l'a créé, quel logiciel a été utilisé, quand il a été fait et quand il a été modifié pour la dernière fois. Avant de partager un document, il vaut la peine de savoir ce que disent ces métadonnées.
Les bases
Champs de métadonnées courants
Le dictionnaire d'information standard d'un PDF peut contenir :
- Title — le titre du document, souvent défini automatiquement à partir du premier titre ou du nom du fichier source.
- Author — le nom de l'auteur, fréquemment récupéré depuis le compte utilisateur du système d'exploitation ou le profil du logiciel de bureau.
- Subject — une courte description ou ligne de sujet.
- Creator — l'application d'origine qui a produit le document (par ex. « Microsoft Word 365 »).
- Producer — le moteur PDF qui a écrit le fichier final (par ex. « LibreOffice 7.6 » ou une version de bibliothèque spécifique).
- CreationDate et ModDate — horodatages indiquant quand le document a été créé et modifié pour la dernière fois.
Le risque
Ce que cela peut révéler
Aucun de ces champs n'est malveillant en soi, mais ensemble ils peuvent dresser un portrait que vous ne vouliez pas partager. Le champ Author peut contenir un nom réel récupéré depuis l'ordinateur du créateur. Les champs Creatoret Producer révèlent le logiciel exact et la version utilisée, ce qui peut être utile pour des attaques ciblées. Les horodatages peuvent indiquer quand et à quelle vitesse un document a été rédigé, ce qui est occasionnellement sensible dans des contextes juridiques ou commerciaux.
Au-delà du dictionnaire standard, les PDF peuvent aussi transporter des métadonnées XMP — un bloc XML qui peut inclure l'historique des révisions, des commentaires, des modifications suivies, des étiquettes de notation et même des coordonnées GPS depuis certaines applications de caméra ou de scan. XMP est plus riche que le dictionnaire standard et est souvent négligé.
Au-delà des métadonnées
Autre contenu caché dans les PDF
Les métadonnées ne sont pas la seule chose qu'un PDF peut transporter sans qu'elle soit visible sur la page. Un PDF peut contenir des calques cachés issus d'un traitement OCR (une couche de texte invisible sur une image numérisée), des pièces jointes intégrées dans le fichier, des champs de formulaire cachés et des objets supprimés mais non purgés — du contenu qui a été supprimé de la page mais existe encore dans le fichier parce que la table de références croisées n'a pas été compactée.
Ce dernier cas est une fuite de confidentialité silencieuse. Un brouillon de contrat dont un paragraphe a été supprimé avant l'envoi peut encore contenir ce paragraphe dans le corps des objets du fichier, accessible à quiconque inspecte les octets bruts. Une étape approfondie de « nettoyage » ou de « caviardage » supprime ces objets orphelins plutôt que de simplement les masquer. Un simple effacement des métadonnées ne traite pas cela — c'est une opération distincte.
Action
Comment afficher et supprimer les métadonnées
La plupart des lecteurs PDF exposent les champs standard dans un menu « Propriétés du document » ou « Obtenir les infos ». XMP est plus difficile à lire sans outil dédié, mais il voyage avec le fichier de la même manière.
Pour supprimer les métadonnées avant de partager, vous n'avez pas besoin de téléverser le fichier nulle part. Un outil local d'édition des métadonnéespeut effacer ou remplacer les champs dans votre navigateur, produisant une copie propre sans envoyer le document — ni ses métadonnées — sur le réseau. C'est l'approche la plus sûre pour les documents sensibles : vérifier localement, puis partager.
À lire aussi
Ressources associées
À lire aussi