Was Ihre PDF-Metadaten verraten
Ein PDF ist mehr als seine sichtbaren Seiten. Es trägt ein Metadaten-Wörterbuch, das aufzeichnen kann, wer es erstellt hat, welche Software verwendet wurde, wann es erstellt und wann es zuletzt bearbeitet wurde. Bevor Sie ein Dokument teilen, ist es ratsam zu wissen, was diese Metadaten sagen.
Die Grundlagen
Häufige Metadaten-Felder
Das Standard-PDF-Informationswörterbuch kann Folgendes enthalten:
- Title — der Dokumenttitel, oft automatisch aus der ersten Überschrift oder dem Quelldateinamen gesetzt.
- Author — der Autorenname, häufig aus dem Benutzerkonto des Betriebssystems oder dem Profil der Office-Software übernommen.
- Subject — eine kurze Beschreibung oder Betreffzeile.
- Creator — die ursprüngliche Anwendung, die das Dokument erzeugt hat (z. B. „Microsoft Word 365").
- Producer — die PDF-Engine, die die endgültige Datei geschrieben hat (z. B. „LibreOffice 7.6" oder eine bestimmte Bibliotheksversion).
- CreationDate und ModDate — Zeitstempel für Erstellung und letzte Änderung des Dokuments.
Das Risiko
Was dies verraten kann
Keines dieser Felder ist für sich bösartig, aber zusammen können sie ein Bild zeichnen, das Sie nicht teilen wollten. Das Author-Feld kann einen echten Namen enthalten, der vom Computer des Erstellers stammt. Creator und Producer verraten die genaue Software und Version, was für gezielte Angriffe nützlich sein kann. Zeitstempel können zeigen, wann und wie schnell ein Dokument verfasst wurde, was in rechtlichen oder kommerziellen Kontexten gelegentlich sensibel ist.
Über das Standardwörterbuch hinaus können PDFs auch XMP-Metadaten tragen — einen XML-basierten Block, der Revisionshistorie, Kommentare, Änderungsverfolgung, Bewertungs-Tags und sogar GPS-Koordinaten aus einigen Kamera- oder Scan-Apps enthalten kann. XMP ist reichhaltiger als das Standardwörterbuch und wird oft übersehen.
Über Metadaten hinaus
Andere verborgene Inhalte in PDFs
Metadaten sind nicht das Einzige, was ein PDF tragen kann, ohne auf der Seite sichtbar zu sein. Ein PDF kann verborgene Schichten aus der OCR-Verarbeitung (eine unsichtbare Textschicht über einem gescannten Bild), in der Datei eingebettete Anhänge, verborgene Formularfelder und gelöschte, aber nicht bereinigte Objekte enthalten — Inhalte, die von der Seite gelöscht wurden, aber noch in der Datei existieren, weil die Cross-Reference-Tabelle nicht komprimiert wurde.
Dieser letzte Fall ist ein leiser Datenleck. Ein Vertragsentwurf, bei dem vor dem Senden ein Absatz gelöscht wurde, kann diesen Absatz noch im Objektkörper der Datei enthalten, erreichbar für jeden, der die Rohbytes inspiziert. Ein gründlicher „Sanitize"- oder „Redact"-Schritt entfernt diese verwaisten Objekte, statt sie nur zu verbergen. einfaches Metadaten-Löschen behandelt dies nicht — es ist eine separate Operation.
Aktion
Metadaten anzeigen und entfernen
Die meisten PDF-Reader zeigen die Standardfelder unter einem Menü „Dokumenteigenschaften" oder „Informationen abrufen" an. XMP ist ohne dediziertes Werkzeug schwerer zu lesen, reist aber genauso mit der Datei.
Um Metadaten vor der Freigabe zu entfernen, müssen Sie die Datei nirgendwo hochladen. Ein lokalesMetadaten bearbeiten-Werkzeug kann die Felder in Ihrem Browser löschen oder ersetzen und eine saubere Kopie erzeugen, ohne das Dokument — oder seine Metadaten — über das Netzwerk zu senden. Dies ist der sicherste Ansatz für sensible Dokumente: lokal verifizieren, dann teilen.
Weiterlesen
Verwandte Ressourcen
Weiterlesen