双盲评审的论文因为 PDF 属性里写着作者真名被直接撤稿,这事每年都在发生。作者在正文里删了致谢、把自引改成第三人称、把机构名换成 Anonymous,唯独没想到 Word 导出 PDF 时会把系统账户名写进 Author 字段。
元数据泄露的共同特点就是这个:你检查的是内容,泄露的是容器。下面这份清单按场景组织,因为同一格式在不同场景下的风险点完全不同。
场景一:投简历

会泄露什么:上一家公司的名字、模板来源、你为不同公司准备了几个版本。
从哪泄露:Word 的作者字段常继承自模板作者或系统账户名;最后修改者可能是帮你改简历的朋友;如果是在旧公司电脑上做的,Company 字段大概率写着前东家。
怎么查和怎么清:Windows 右键属性 → 详细信息,面板底部有"删除属性和个人信息";macOS 用预览的显示简介。更彻底的做法是导出 PDF 后再单独清一遍——导出这个动作本身会写入新字段。
顺带一条:文件名也算信息。简历_张三_某某公司版_v4.pdf 这种名字,HR 一眼就知道这是第四版。
场景二:客户交付物

会泄露什么:这份方案是从哪个客户改来的、内部批注和修订、真实工时、参与人员名单。
从哪泄露:这是最危险的场景,因为交付物通常是从模板或前一个项目改的。风险点:文档属性里的作者和公司字段、未接受的修订和批注(视图设为"最终状态"时看不见,数据还在)、Excel 里隐藏的工作表、PPT 里拖到画布外的元素和演讲者备注、PDF 里被黑色矩形"遮盖"的文字(矩形是画上去的,底下的字还能选中复制)。
怎么查和怎么清:Office 的文件 → 信息 → 检查文档,会一次性列出批注、修订、隐藏内容、个人信息,并能一键移除;PDF 的遮盖必须用真正的密文(Redact)功能。最稳的做法是交付前把内容复制进一个全新建的空白文档。
场景三:上传照片到社交平台
会泄露什么:拍摄地点的经纬度(精度通常在十米级)、拍摄时间、手机型号、序列号(部分机型)、用了哪个修图 App。这些藏在 EXIF、XMP 和厂商私有段里。
这里有个反直觉的点:大平台(朋友圈、微博、Instagram)上传时会重新编码并剥掉大部分 EXIF,反而相对安全。真正会原样保留的是私聊发原图、邮件附件、网盘分享链接、个人博客和自建站。风险最高的恰恰是你觉得"只发给一个人"的场景。
怎么查和怎么清:手机上看照片详情就能看到地点。上传前统一过一遍元数据清除,批量处理时注意保留 Orientation 字段(旋转方向),否则清完照片会横过来;印刷用途还要保留 ICC 色彩配置。
另外:截图内容本身可能带着任务栏、书签栏、未读消息角标、桌面文件名——这类肉眼可见的泄露比元数据更常出事。完整字段清单见图片元数据里藏了什么。
场景四:开源项目提交代码和截图
会泄露什么:内部路径、真实姓名和公司邮箱、内网域名、测试凭证。
从哪泄露:
- Git 提交记录:user.name 和 user.email 会永久写进每次提交。改配置只影响之后的提交,历史里的改不掉
- 代码里的绝对路径:
C:\Users\zhangsan\projects\内部系统\...常出现在配置文件、日志、source map 里 - 截图和录屏:演示截图带着浏览器书签栏、系统通知、其他标签页标题、测试环境的真实域名
怎么查和怎么清:git log --format='%an %ae' | sort -u 列出所有提交者身份;截图用干净的浏览器 profile 重新截;图片过一遍元数据清除;路径改成占位符。
场景五:新闻稿和公关素材
会泄露什么:未定稿的措辞、内部审阅意见、代理机构。新闻稿一般是多方会签的产物,Word 文件里往往留着法务和市场部的批注、若干轮未接受的修订、"待老板确认"之类的标注。
特殊风险是时间。配图的 EXIF 显示拍摄于三个月前而稿件称"日前",会被记者当成线索;PDF 创建时间早于宣称的事件时间,同样露馅。
怎么清:正文用纯文本重排,配图统一清元数据,PDF 生成后再清一次文档属性。
场景六:投标文件
会泄露什么:报价的推导过程、成本结构、和竞争对手共用了同一个模板。
从哪泄露:Excel 报价表是重灾区——公式会暴露成本加价逻辑,隐藏工作表可能存着底价和利润率,单元格批注里可能写着"这个数还能再降"。另外,若干投标方的文件属性显示同一个作者,在评标环节可以直接导致废标。
怎么清:报价表整表复制 → 选择性粘贴为数值 → 存为新文件;删除所有隐藏工作表、隐藏行列、批注;转 PDF 后清一遍文档属性。
场景七:学术投稿(双盲评审)
后果最直接的一个:作者信息泄露会直接导致稿件被撤,而泄露渠道往往不在正文里。
- PDF 的 Author 字段(来自系统账户名或 Word 的用户名设置)
- PDF 的 Title 字段,有时是第一次保存时的临时文件名,比如"张三-投稿-第三版"
- LaTeX 源文件里注释掉的
\author{}:注释符只影响排版,字符还在,而有些期刊系统要求同时上传源文件 - 补充材料里的代码注释、数据文件属性、图表源文件里的项目名
怎么查和怎么清:把最终 PDF 的所有元数据字段导出来逐条看;用文本方式打开源文件搜索姓名、单位、邮箱域名。Word 里先改用户名(选项 → 常规 → 用户名)再导出,或导出后单独清 PDF 属性;LaTeX 用条件编译控制匿名版,而不是靠注释。
通用三步法
上面七个场景可以压缩成一个固定动作,任何文件发出去之前跑一遍:
第一步:分清哪些是确定可清的,哪些不是。
文件元数据(EXIF、XMP、文档属性、PDF 信息字典)和文本里的隐形字符属于确定可清、清完可验证的——扫描、删除、再扫一遍确认归零。
但有两类东西清不掉:图像像素域的水印(信息编码在像素值的微小改动里,属于图像本身,重新保存、压缩、裁剪都可能保留,没有可靠移除手段),以及文本生成时嵌入的统计水印(藏在词元选择里,本地扫描不到东西,也没有公开检测器能验证状态)。别指望清元数据能解决这两个,见AI 水印是什么。
第二步:清理,但保留必要字段。
不是所有元数据都该删。摄影作品的版权署名、图片的旋转方向、印刷文件的色彩配置、需要溯源的资产编号,删了都会出问题。工具应该能选,不是一刀切。
第三步:用接收方的视角复查一遍。
打开清理后的文件,装作自己是收件人:点开属性看所有字段、把 PDF 文字全选复制到记事本(看有没有被遮盖的内容)、把 Excel 的工作表取消隐藏、把图片放大到 200% 看边角。这一步花的时间最短,抓到的问题最多。
熟练之后整个流程只要两分钟,但它挡掉的是那种一旦发生就没法补救的事故——文件发出去之后,你再也拿不回来了。
