PDF のメタデータが明かすこと
PDF は目に見えるページだけのものではありません。誰が作成し、どのソフトウェアを使い、いつ作成され、最後にいつ編集されたかを記録できるメタデータ辞書を保持しています。文書を共有する前に、そのメタデータが何を語るかを知っておく価値があります。
基礎
一般的なメタデータ項目
標準の PDF 情報辞書は以下を含むことができます:
- Title — 文書のタイトル。多くは最初の見出しから元ファイル名から自動的に設定されます。
- Author — 作成者名。多くはオペレーティングシステムのユーザーアカウントやオフィスソフトウェアのプロファイルから取得されます。
- Subject — 短い説明や件名。
- Creator — 文書を作成した元のアプリケーション(例:「Microsoft Word 365」)。
- Producer — 最終ファイルを書き出した PDF エンジン(例:「LibreOffice 7.6」や特定のライブラリバージョン)。
- CreationDate と ModDate — 文書が作成された時刻と最終変更時刻のタイムスタンプ。
リスク
これが明かしうること
これらの項目は単独では悪意あるものではありませんが、組み合わさると意図しない像を描き出すことがあります。Author 項目には作成者のコンピュータから取得された本名が含まれることがあります。Creator と Producer は使用された正確なソフトウェアとバージョンを明かし、標的型攻撃に利用されることがあります。タイムスタンプは文書がいつ、どれだけ迅速に作成されたかを示し、法的・商業的な文脈で時に機密となります。
標準辞書の他に、PDF は XMP メタデータ を保持することもできます — XML ベースのブロックで、改訂履歴、コメント、変更履歴、評価タグ、さらには一部のカメラやスキャンアプリからの GPS 座標まで含むことがあります。XMP は標準辞書より豊富で、見落とされがちです。
メタデータを超えて
PDF に潜むその他の隠し内容
メタデータは、PDF が保持するページ上に見えないものの唯一ではありません。PDF は OCR 処理に由来する非表示レイヤー(走査画像の上に目に見えないテキストレイヤー)、ファイル内に埋め込まれた添付ファイル、非表示フォームフィールド、そして除去されたが消去されていないオブジェクト — ページから削除されたものの、相互参照テーブルが圧縮されていないためファイル内にまだ存在する内容 — を含むことができます。
この最後のケースは静かなプライバシー漏洩です。送信前に段落を削除した契約書の草案が、ファイルのオブジェクト本体にその段落をまだ含み、生バイトを検査する誰にでも取り出せる可能性があります。徹底した「無害化」や「黒塗り」の工程は、単に隠すのではなく、これらの孤立オブジェクトを除去します。単純なメタデータ消去ではこれに対処しません — それは別の操作です。
行動
メタデータの表示と除去方法
ほとんどの PDF リーダーは「文書のプロパティ」や「情報を取得」メニューの下に標準項目を表示します。XMP は専用ツールなしに読むのは難しいですが、ファイルと一緒に移動することに変わりはありません。
共有前にメタデータを除去するために、ファイルをどこへもアップロードする必要はありません。ローカルのメタデータ編集ツール がブラウザ内で項目を消去または置換し、文書 — そのメタデータも — をネットワークに送信せずにきれいなコピーを作り出します。これが機密文書に対する最も安全なアプローチです:ローカルで検証し、それから共有しましょう。
関連記事
関連リソース
関連記事