ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

你发出去的 PDF 里藏着多少隐私?聊聊元数据这件事

你发出去的 PDF 里藏着多少隐私?聊聊元数据这件事 一份删干净了的文件其实什么都没说分享一个真实类型的案例某公司发招标附件前把文档正文里的公司抬头、内部编号都改成了通用字样自认为处理得很干净。结果竞争对手拿到 PDF 一看属性——作者某某部门张工单位XX集团创建时间、软件版本、甚至历史修订记录全在。正文删得再干净元数据把底交了。元数据metadata就是关于文件的数据谁创建的、什么软件做的、什么时间、修订过几轮。PDF 的元数据尤其丰富而且默认全部保留。绝大多数人不知道它们存在更不知道它们会跟着文件传到哪去。PDF 元数据里一般有什么用任意 PDF 属性面板或exiftool打开常见字段标题 / 作者 / 主题 / 关键词写作软件自动填的作者字段泄露人名和单位是重灾区创建程序 / 生产程序暴露内部软件栈和时间线创建时间 / 修改时间两个时间对不上说明文件被二次处理过——对敏感材料这本身就是信息XMP 数据包Adobe 系的扩展元数据藏在文件里的一段 XML普通属性面板不一定展示全隐藏层级的东西被删除的批注和修订记录、文档级附件有的文件里挂着旧版草稿、隐藏图层。最后一条最狠正文干净不等于文件干净。Word 转 PDF 前的删除文档属性和个人信息选项不勾上批注、修订历史可能整包带进 PDF。谁应该在意法务/投标/采购外发文件的元数据可能构成泄密很多纠纷的起点就是一份没人看过的文件属性媒体和公文发布者新闻配图、公开报告的拍摄位置、作者信息都可能被拿来做逆向挖掘个人用户把带 GPS 的照片或合成的 PDF直接发社交平台等于公布家庭住址和出行规律——这是老牌隐私课了只是大家还是会忘。判断标准一句话文件离开你的控制范围之前问自己看到这份文件属性的陌生人能得到什么我不希望他得到的信息。清理先查看再删除正确的顺序是先看见、再动手不然你不知道要清什么。查看工具推荐exiftool命令行全格式通吃exiftool contract.pdf# 看全部字段exiftool-apiLargeFileSupport1contract.pdf# 大文件加这个参数删除分两个层次# 1) 常规元数据字段清空先备份exiftool 会直接改文件exiftool-allcontract.pdf# 2) 保留必要字段的保守清理只清个人字段exiftool-Author-Artist-Creator-CreatorTool-LastModifiedBycontract.pdf-all是核选项清完部分阅读器会显示未知作者一般无所谓但如果文件有合规要求保留创建日期就用第二种定向删除。别忘了 XMP 和隐藏对象-all清不掉某些嵌入的 XMP 块和注释对象。所以清理后要复查——再次 exiftool 看一遍再用阅读器打开检查批注面板是否为空。只清不查等于没清。不想装命令行的场景偶尔处理一两份文件不值得搭环境在线的 PDF 元数据查看/清除工具走浏览器就能完成本地处理型文件不出本机的更稳妥具体操作和字段说明我整理在这份页面里清除 PDF 元数据教程。企业场景则建议把清理做成外发流程的固定环节脚本批处理目录里的所有 PDF比每次靠自觉可靠得多。小结元数据的麻烦在于它默认存在、默认随行、默认没人看。给外发文件做元数据清理的正确心智和出门前撕快递单是一样的不是有人一定会来查而是撕掉的成本是零。把查看 → 清理 → 复查固化成发文件前的最后十秒很多不该发生的暴露就永远不会发生。你们处理过最离谱的元数据泄露是什么场景评论区开开眼。
返回列表