开头先把立场说清楚,因为这决定了这篇文章有没有用。

如果你的内容确实是 AI 生成的,这篇帮不上忙,正确做法是自己重写。不是因为"会被查出来"——检测器的可靠性我在AI 检测器为什么老是判错里说过——而是因为想办法糊弄检测本身就是错的方向,你在这上面花的时间够重写一遍了。

这篇是给另一种人写的:内容确实是自己写的,但被判高分,你需要搞清楚发生了什么。下面这些排查项都属于"技术性异常",跟写作水平无关,但确实会让情况变糟。

排查项一:文本里的隐形字符

"论文、作业被判 AI 率高?先排查这几个技术问题" — visual 1
排查项一:文本里的隐形字符

这是最常被忽略的一条,也是最容易查清的一条。

Unicode 里有一批"有码点但不显形"的字符:零宽空格(U+200B)、零宽不连字(U+200C)、零宽连字(U+200D)、字节序标记(U+FEFF)、标签字符(U+E0020–U+E007F)、各种变体选择符。它们在屏幕上占 0 像素宽,但在文件里是实实在在的字符。

它们怎么进到你的论文里的?主要是复制粘贴。从网页复制参考资料、从聊天窗口复制笔记、从 PDF 复制引文、从在线编辑器复制格式化文本,都可能夹带。有些平台会主动在输出里插标记,有些只是排版残留(比如网页用零宽空格控制换行位置)。

这件事的后果有两层:

第一层是检测工具的行为可能异常。 有些工具做分词时不会正确处理这些码点,一个零宽字符插在词中间,可能让"研究"被切成两个不认识的片段,进而影响困惑度计算。这类影响不稳定,但确实存在。

第二层更麻烦:可能被认定为"刻意规避"。 这几年流传过一种说法,说在文字中间插零宽字符可以干扰检测。姑且不论有没有用(多数检测服务早就做了预清洗),关键在于——如果审查方在你的文档里发现成片的零宽字符,最自然的解释就是有人在做手脚。你说"这是从网上复制资料带进来的",这话是真的,但你怎么证明?

所以正确顺序是:提交前扫一遍清掉,而不是出事之后解释。这一步是确定可解的:扫描全文列出所有非常规码点及位置,删除,再扫一遍确认计数归零。过程可验证,结果没有歧义。

有个坑要提醒:不能无脑全删。U+200C 和 U+200D 在阿拉伯语、波斯语、印地语的正字法里是必需的,删了会改变词形;emoji 的组合序列也靠 U+200D 连接。所以要么用能区分语境的工具,要么先看清单再决定删哪些,展开说明在零宽字符与隐形字符:怎么发现、怎么清除

排查项二:文档元数据里的时间和作者

"论文、作业被判 AI 率高?先排查这几个技术问题" — visual 2
排查项二:文档元数据里的时间和作者

Word、PDF 都是容器格式,正文之外还带着一整套结构化字段,其中几个跟"这东西是不是你写的"直接相关:

  • 作者(Author)和最后修改者(Last Modified By):如果显示的是别人的名字、某个网站的名字、或者你从来没听过的账号名,需要解释
  • 编辑总时长(Total Editing Time):Word 会累计文档打开的分钟数。一篇八千字的论文显示 3 分钟——这个字段比任何 AI 检测分数都更难解释
  • 创建时间和修改时间:创建时间晚于你声称的开题时间,或者创建时间和最后修改时间相差 4 分钟,都是刺眼的信号 这些字段出问题的方式都很日常:在网页版编辑器里写完导出、用了别人给的模板(作者字段继承自模板作者)、最后一刻把内容粘贴进新建文档再导出。每一种都是无辜的,但都会留下一条和你的说法对不上的记录。

建议是提交前看一眼,而不是清空。这里有个分寸:清空元数据在发布场景是完全正当的,但在学术提交场景,一份所有字段全空的文档反而显眼。更稳妥的做法是先看清楚里面写了什么,有明显对不上的地方就准备好解释。

想全面了解文档里到底藏了多少字段,可以看文档元数据会泄露什么

排查项三:润色工具留下的痕迹

这一条很多人是无意的。

语法检查、句式优化、"学术化改写"这类工具的工作原理,本质上是把低概率的表达替换成高概率的表达。而检测器判 AI 的核心依据之一恰好就是"文本的可预测性高"。所以你自己写完、用工具通篇润色一遍、AI 率反而飙升——这个因果链是成立的,不是巧合。

另外,部分润色工具会改变引号、破折号、空格的字符形式(把直引号换成弯引号、把普通空格换成不换行空格)。这些改动本身无害,但会让文本的字符构成出现整齐的模式。

处理办法:把工具的作用限制在"指出问题"而不是"直接替换"。让它标出哪里有语法错误,你自己改。这样既保住了语言个性,也避免整篇被推向统计意义上的"平均文本"。

排查项四:参考文献工具引入的异常字符

文献管理软件从数据库抓条目时,经常带进非常规字符:从出版商页面抓来的非断行空格(U+00A0)和窄空格(U+2009)、DOI 里控制换行的软连字符(U+00AD)、期刊名里的合字(fi、fl,从 PDF 提取时很常见)、全角半角括号混用、姓名字段里残留的 HTML 实体。

这些东西集中出现在参考文献和引文部分,正好是审查者最容易逐条核对的地方。清理方式和第一项一样:扫描、按类型确认、删除或替换成标准字符。

比事后补救有用得多的事:留证据

上面四项都是排查,属于亡羊补牢。真正管用的是提前留下写作过程的痕迹,因为过程证据是唯一能正面证明你写过的东西,而检测分数永远只能被动辩解。

具体可以做的:

用带版本历史的编辑器写。 这类工具会自动保存修订历史,能看到每一句是什么时候敲进去的、改过几版。这份记录比任何辩解都有力——AI 生成的内容是一次性粘贴进来的,版本历史里会显示为一个巨大的单次插入。

保留草稿和中间稿。 不要在同一个文件上反复覆盖。定期另存为 v1、v2、v3,写完不要删。

保留笔记和检索记录。 读文献时的摘录、想法草稿、跑数据的脚本和原始输出。这些东西的存在本身就说明有一个真实的研究过程。

如果用了 AI 辅助,主动说明用在哪一步。 现在多数机构的规定不是"完全禁用"而是"必须披露"。用它查资料、列提纲、检查语法是一回事,让它写正文是另一回事。提前披露比事后被质疑再解释处境好得多。

被判高分时的申诉思路:不要试图论证"检测器是错的"这种抽象命题,直接拿出过程证据,同时说明客观因素(第二语言写作、文体本身高度模板化)。检测分数只是一个统计信号,你手里的版本历史是具体事实。事实赢统计信号。