很多人把 SynthID 理解成"Google 在 AI 生成内容上盖的一个章",好像是同一个东西盖在不同类型的文件上。实际上它是一个品牌名,底下装着四套原理彼此毫不相干的技术。图片那套和文本那套的共同点,大概只有名字。
这个区别不是学术洁癖。它直接决定了一件很实际的事:你能对水印做什么,做不了什么。网上大量"SynthID 移除教程"之所以是错的,就是因为把四条线当成了一条。
四条线,四种原理

图像是 SynthID 最早也最成熟的一条线。原理是在像素值里嵌入一个人眼不可察觉的图案——不是叠加一层半透明 logo,而是把一串信息编码进图像本身的低层结构中,用一对配套的神经网络完成嵌入和提取。嵌入网络学会把水印藏进视觉冗余度高的地方,提取网络学会即使图像被折腾过也能把它读出来。关键在于,这个水印是内容的一部分,不是附着在文件上的标签。
文本走的是完全不同的路。SynthID-Text 干预的是大语言模型的采样过程。模型每生成一个词元时,都会对候选词元打分形成一个概率分布,SynthID-Text 用一个伪随机函数给词元打上"绿/红"标记,然后轻微地把采样偏向绿色那一组。单看一个词看不出任何异常,句子读起来也完全正常,但文本一长,绿色词元的比例就会显著高于随机水平,统计检验能把这个偏差抓出来。Google 已经把这套方案的部分实现开源了,所以它的机制不是黑箱。
音频是把水印编码进频谱表示。原始波形先转成频谱图,水印嵌入其中,再转回波形。可以扛住 MP3 压缩、变速、加噪这类常见处理。
视频基本是图像那条线的逐帧延伸。
鲁棒性的差距有多大

这是整篇文章最需要说清楚的一点。
图像水印能扛住的处理强度,远超大多数人的直觉。裁剪掉一部分、重新压缩成低质量 JPEG、调整尺寸、加滤镜、改变色调——这些常规编辑之后,水印通常仍然可以被检出。原因在前面说过了:它藏在像素分布里,而这些操作虽然改变了像素值,却保留了图像的大部分结构信息。只要图像还认得出是原来那张,携带水印的那部分结构大概率也还在。
要真正破坏图像水印,你得把图像破坏到相当程度——大幅降低分辨率、重度有损压缩、大面积重绘。而做到那个程度时,图片本身通常也没什么用了。这是水印设计上的刻意权衡:让"去水印"的代价高于"重新生成一张"。
文本水印就完全是另一回事。学界对文本水印鲁棒性的研究结论比较一致:改写会明显削弱统计信号。用另一个模型把整段话重写一遍、翻译成别的语言再翻回来(回译)、把长文压缩成大幅精简的摘要——这些操作都会打乱原有的词元序列,绿色词元的统计优势随之下降。文本越短,本来可用的统计样本就越少,稍微改动几个词就可能让检测失效。
差距的根源在信息密度。一张 4K 图片有上千万个像素可以藏东西,一条两百字的短文只有几百个词元。冗余空间不在一个量级上。
所以"删除 SynthID"到底是什么意思
分开谈。
图片的像素域水印,常规工具删不掉,本站的工具也删不掉。 这话没有回旋余地。img.diy 的图片工具处理的是元数据层——EXIF、XMP、以及生成工具写进文件里的那些标注字段(生成器名称、模型版本、有时还有完整提示词)。这些是附着在文件容器上的信息,删掉就是真的删掉了,而且可以验证。但图像本身像素里的东西,元数据清理动不到分毫。
有些人会发现,清掉元数据后某些平台不再标记这张图是 AI 生成的了。这不代表水印没了,只说明那个平台查的是元数据而不是像素。换个查像素的检测器,结果可能完全不同。
文本的统计水印,只能靠大幅改写来削弱,而且你无法验证是否成功。 检测器在 Google 手里,你手上没有。改写到什么程度算够,没人能给你一个确定答案。任何声称"保证去除文本水印"的工具都是在编。
至于隐形字符——零宽空格、特殊 Unicode 控制符、异常的空白字符——那是另一码事,和 SynthID 无关。有些系统会用这类字符做标记或追踪,它们是文本里实实在在存在的字节,可以被完整识别和清除,结果可验证。这部分是确定的。
检测这件事的现实
如果你想知道一张图或一段文本上有没有留下痕迹,能查的和不能查的界限很清楚:
能查:文件里的 EXIF/XMP 字段、C2PA 内容凭证清单、AI 工具写入的生成器标注、文本中的零宽字符和异常 Unicode。这些是确定性检查,有就是有,没有就是没有。
查不了:像素域水印。SynthID 图像水印的提取需要配套的检测模型,Google 没有公开发布通用检测器,第三方也做不出可靠替代。你在网上看到的"AI 图片检测"服务,大多是用另一个分类模型去猜这张图像不像 AI 生成的,那是概率判断,不是读水印,误判率不低。
一个立场问题
写这些不是为了教人规避溯源。水印和内容凭证在新闻打假、版权归属上有实际价值,这点没什么好争的。
但另一面同样成立:你自己拍的照片、自己写的文档,里面被塞进了什么信息、这些信息会跟着文件走到哪里,你有权知道,也有权决定要不要一起发出去。一张随手拍的照片里可能带着 GPS 坐标和相机序列号,一份 AI 生成的图里可能带着你输入的完整提示词。发到公开网络之前把这些清掉,是隐私操作,不是作弊。
技术边界在哪就是哪。元数据能清干净,隐形字符能清干净,像素水印清不掉——把这三件事分开说清楚,比含糊地承诺"一键去水印"对你更有用。
想了解 Google 之外的另一套溯源体系,可以看C2PA 内容凭证是什么;想知道图片文件里到底还藏着哪些字段,看一张照片里到底藏了多少信息。
