一个英文是第二语言的学生,逐字逐句写完一篇课程论文,交上去被检测工具判成 92% AI 生成。他没用过任何生成工具,但他解释不清,因为对面拿着一个数字,而他拿不出反证。
这种事发生得比多数人想象的频繁,而且不是随机的。被误判的人有明确的共性——这篇想讲清楚的就是这个共性从哪来。
检测器实际在测什么

市面上的 AI 检测大致分两类,原理完全不同,能力边界也完全不同。
一、统计特征型
这是绝大多数商业检测服务的做法,包括大家熟知的 GPTZero、Originality 那一类,还有各高校论文系统里附带的 AI 率模块。它不知道你的文本是哪个模型生成的,也没有任何厂商密钥,它只是在测文本的两个统计量:
困惑度(perplexity):用一个语言模型去读你的文本,看它对下一个词的预测有多"意外"。人类写作里经常出现模型预料不到的词——不常见的搭配、跳跃的联想、口语插入、专业黑话——困惑度就高。大模型生成的文本本质上是在高概率区域采样,所以对另一个语言模型来说很好预测,困惑度低。
突发性(burstiness):测的是句子长度和复杂度的波动。人写东西是一阵一阵的:写到兴头上句子拖得很长,然后突然一个五字短句,接着又是个长的。AI 输出更平滑,句长分布集中,方差小。
检测器把这两个量(以及一些衍生特征)喂给分类器,输出一个 0 到 100 的分数。注意这个数字的含义——它不是"有 92% 的部分是 AI 写的",也不是"有 92% 的概率是 AI 写的",它是分类器的置信度分数,经过厂商自己的映射曲线处理过。不同厂商的同一个数字含义都不一样。
二、水印验证型
另一类是验证生成时嵌入的统计水印,比如 Google 的 SynthID-Text 那套。原理是模型生成时用密钥控制词元采样偏向,检测时用同一把密钥重算并做统计检验。
这类检测的准确性远高于第一类,但有两个硬约束:必须持有密钥,只对自家嵌了水印的模型输出有效。所以它不可能成为通用的"查这篇文章是不是 AI 写的"工具,学校和平台手里的也几乎不是这一类。机制细节见AI 水印是什么。
下面讨论的误判,全部指第一类。
误判是系统性的,不是随机的

如果检测器的错误是随机分布的,那还算公平。问题是它不随机——特定人群和特定文体被误判的概率显著更高,而且原因是可推导的。
非母语写作者。 这是最严重的一类。第二语言写作者的用词更规范、句式更简单、更依赖学过的固定搭配,很少用俚语和不常见的比喻。翻译成统计量就是:困惑度低、突发性低。而这正是检测器判 AI 的依据。斯坦福的研究团队做过一组实验,用美国本土高中生和非母语考生的作文分别过多个主流检测器,非母语组被判为 AI 的比例高得离谱,本土组则基本正常。换句话说,检测器在很大程度上是在惩罚"英语不够花哨"。
中文场景下这个效应换了个形式:写得越像标准书面语、用词越接近教材和公文的人,越容易中招。
技术文档和法律文书。 这两类文体天然低突发性,因为写作规范就要求句式统一、术语固定、不使用修辞。API 文档里每个接口的描述结构相同,合同条款里每条的句式相同——这是专业要求,不是缺陷,但检测器读出来就是"平滑、可预测、像 AI"。
模板化写作。 论文摘要有固定的四段结构,周报有固定的三段结构,实验报告、病历、审计意见书都有固定框架。这些文体本来就长得像 AI 输出,因为 AI 输出本来就是在模仿这些文体。
经过语法工具润色的文本。 用语法检查工具把句子改得更"正确",本质上是把低概率表达替换成高概率表达——正好是往 AI 特征的方向推。写完自己改一遍是常规操作,改完 AI 率飙升是常见结果。
短文本。 统计量需要样本量。300 字以内的文本,困惑度和突发性的估计误差极大,分数基本是噪声。很多检测服务会给警告,但用户往往忽略。
反向误判同样普遍
误判有两个方向,上面讲的是把人写的判成 AI(假阳性)。另一个方向是把 AI 写的判成人写的(假阴性),这个方向的漏检率同样很高。
原因也很直接:困惑度和突发性都是文本表层特征,而表层特征很容易改动。AI 生成之后手动改一遍句式、换几个词、拆几个长句、加两句口语,分数就能明显往下走。
这带来一个很尴尬的结论:检测器筛掉的往往不是用 AI 的人,而是不知道要做这一步的人。认真自己写的非母语学生被卡住,随手让模型改一版风格的人顺利通过。这不是工具的偶然失误,是它的原理导致的必然分布。
顺带说一句,正因为这个原因,任何声称"能保证通过 AI 检测"的服务都不值得信——检测器的阈值、模型、特征权重是厂商随时在调的,今天能过的文本下个月未必能过,没有人能对一个自己无法观测的黑箱做保证。
所以这个数字该怎么用
我的立场是:AI 检测分数可以作为参考信号,绝不该作为处罚依据。
理由不是"技术还不成熟,以后会更好"。困惑度和突发性这条路径的天花板是结构性的——它测的是"文本有多典型",而"典型"和"机器生成"本来就是两个不同的概念,只是恰好高度相关。只要还在测这个量,规范写作的人和第二语言写作者就会被系统性误伤,这个缺陷改不掉。
几点具体的:
- 分数本身不构成证据。任何指控都需要独立证据支撑,比如写作过程记录、无法解释的事实错误
- 不同检测器对同一篇文本给出的分数经常差三四十个点。如果几家结论不一致,说明这个信号没有决断力
- 对短文本、模板化文体、非母语写作,分数应该直接降权
- 被判高分的人有权知道判定依据、是哪一段触发的、有没有申诉渠道。只给数字不给理由的流程本身就有问题
如果你正好是被误判的那一方,除了解释原理,更实际的做法是拿出写作过程的证据——版本历史、草稿、笔记、检索记录。同时也值得排查一下文本本身有没有技术层面的异常,比如从别处粘贴带进来的隐形字符、文档元数据里对不上的时间戳,这些东西有时会让情况变得更难解释。这部分我整理成了一份清单,放在论文、作业被判 AI 率高?先排查这几个技术问题里。
