一个编辑跟我抱怨,说他手底下的稿子"一眼假",但他说不上来哪里假。我让他把段落发过来,看了三段就明白了:每段都是三句话,每句都在 25 到 30 个字之间,每段结尾都有一个总括句,通篇没有一个具体数字,也没有一个人名。内容没错,逻辑通顺,就是没有人写东西会这么整齐。

这种"整齐"就是所谓的 AI 味。它和很多人以为的"AI 水印"完全不是一回事——前者是文风,后者是数学。混在一起谈会导致两个方向的错误结论:以为把文风改口语化就等于"去掉了水印",或者以为清理了隐藏标记文章就不像 AI 写的了。都不对。

第一层:AI 味是文风问题

"去 AI 味文案实操:为什么"改写"和"去水印"是两件事" — visual 1
第一层:AI 味是文风问题

大模型输出的文本有一套很稳定的风格指纹,中文场景下尤其明显,因为中文训练语料里公文、软文、教辅文本占比不低,模型学到的"正式书面语"就带着这几类文本的毛病。

常见特征列一下,拿自己的稿子对着看:

过度对仗与排比。 "既要……又要……"、"不仅是……更是……"、三个四字词并列。人偶尔用排比加强语气,AI 默认就用,一段里出现两三次。

万能开头和万能结尾。 "在当今……的时代"、"随着……的不断发展"、"综上所述"。这类句子信息量是零,整句删掉段落意思不受影响——这是判断废句最简单的测试。

每段都是三点式。 不是三这个数字有问题,是每段都恰好三点有问题。真实的论述里有的点要展开五条,有的一句话就说完了。

破折号泛滥。 中文的破折号用来做解释性插入,正常密度是几百字一个,AI 生成的中文经常一段两三个。

形容词堆砌。 "高效、稳定、可靠的解决方案"。三个近义形容词并列,删掉两个不影响意思。

结论段永远在升华。 讲完具体操作,非要拔到"这不仅是技术问题,更是思维方式的转变"。人写完操作步骤往往就直接停了。

缺具体数字和专有名词。 说"显著提升"不说"从 2.1 秒降到 0.8 秒"。模型在不确定时倾向于用安全的模糊表述。

没有"我"的视角。 没有"我试过"、"这个方案我不推荐,理由是"。所有判断都以中立的第三人称给出,好像没有作者。

句长过于均匀。 这条最难自查但最致命。统计每句字数,AI 文本的方差通常明显偏小,人类写作会出现三字短句紧跟五十字长句的情况。

真正有效的改法

知道特征之后,改法就是反着来,但有几条比其他的管用得多。

加进只有亲历者才知道的细节。 具体的报错信息、日期、某个版本号踩的坑、当时的对话。这是最有效的一条,因为模型编不出这些,而人写自己经历过的事时自然就带上了。

把万能句整句删掉。 不要改写,直接删。删完读一遍,如果段落还通顺,那句话本来就不该在。

让句长参差。 主动制造几个五字以内的短句。像这样。也允许某个句子长到需要读两遍,因为它描述的是一个确实复杂的条件关系,比如某个设置只在特定版本、特定系统、并且开启了某个开关时才触发。

允许口语和不完美。 可以有"说白了"、"反正"。可以承认"我也不确定为什么"。

砍掉一部分对称结构。 三点里删掉最弱的那点,或者把其中一点扩写成两段。不对称本身就是人味的一部分。

第二层:统计水印是数学问题

"去 AI 味文案实操:为什么"改写"和"去水印"是两件事" — visual 2
第二层:统计水印是数学问题

现在说另一件事,它和上面所有内容都没关系。

有些模型在生成时会往输出里嵌一个统计水印。原理大致是:模型每生成一个词元,会先算出整个词表上的概率分布,水印方案用一个由前文和密钥决定的伪随机函数把词表切成两组,然后让采样在统计上略微偏向其中一组。任何单个词看起来都完全正常,但文本一长,这种偏向会累积成一个可以统计检验的信号。Google 的 SynthID-Text 走的就是这条路。

关键点在于水印藏在词元的选择里,不在文字的外观里。文本的每个字符都是正常字符,没有多余码点。你在本地怎么扫描都扫不出东西,因为确实没有东西可扫。这和零宽字符那类隐形标记是完全不同的层次,后者我在AI 水印是什么里拆过。

所以就有了标题里那个判断:改文风不等于去水印。你删掉万能开头、把句子改得长短不一、加上几个具体数字,文章读起来完全不像 AI 写的了——但如果原文带统计水印,这一轮编辑改动的词元比例可能只有百分之几,剩下的词元选择原封不动,水印信号基本还在。

反过来的方向也要说清楚:大幅改写确实会削弱统计水印。这是原理上成立的——水印信号来自那些被偏好的词元,你替换掉的词越多、重组的句子结构越多,剩下的信号就越弱。换词、拆句合句、调整语序、翻译再译回来,都会实打实降低检出率。

但削弱不等于清除,而且这里有两个必须承认的事实:

第一,没有办法保证清除。信号强度是连续的,检测是个阈值判断,你不知道自己改到了阈值的哪一侧。改动 30% 的词可能不够也可能够了,这取决于原文长度、水印方案参数、检测方设定的阈值——这些你都不知道。

第二,没有公开检测器可以验证。统计水印的检测需要嵌入时用的那把密钥,密钥在模型厂商手里。市面上声称能检测 AI 水印的服务,检的是别的东西(隐形字符,或者困惑度之类的统计特征),不是这类水印。所以你改完之后无法自查确认。

任何工具告诉你"保证清除 AI 水印"、"保证通过检测",都没有技术依据。能确定给出结论的只有两类东西:文本里的隐形字符和文件元数据——扫描、删除、复查计数归零,全程可验证。词元概率里的水印不在这个范畴内。

那这两层各自该怎么处理

如果你的问题是"稿子读起来像机器写的",那是编辑问题,解法在上半篇,跟工具无关,靠改。

如果你的问题是"文本从某个界面复制过来,怀疑夹带了不可见字符",那是确定可解的:扫一遍,删掉,再扫一遍确认归零。发布前顺手做一下没坏处,参见零宽字符与隐形字符:怎么发现、怎么清除

如果你的问题是"我担心统计水印",诚实的回答是:你既没法确认它是否存在,也没法确认自己清掉了。这种情况下与其在改写上做无谓加工,不如接受一个更朴素的路径——重要的东西自己写。这不是道德说教,是从可控性出发的判断:自己写的文本,你能对每一部分负责;经过多轮改写的 AI 文本,你对它的状态一无所知。