先说结论
有人把一篇文章放进 AI 文字检测工具,看到“AI 生成可能性较高”,便认为作者一定使用了 ChatGPT; 也有人得到较低分数,就认定文章完全由人工完成。这两种理解都过于绝对。
AI 文字检测有实际用途,但它更适合回答“这段文字是否表现出模型生成特征”,不能单独回答 “究竟是谁写的”或“写作过程中是否使用过 AI”,更不能代替对写作记录、资料来源和具体事实的核查。
可以作为筛查线索,不能作为最终认定
文字检测工具通常根据语言模型生成文本中可能出现的统计规律、结构模式和表达特征作出判断。 当待检测文本与工具见过的样本比较接近,而且篇幅足够、改动较少时,检测结果可能提供有价值的风险信号。
但现实中的文本并不总是“纯人工”或“纯 AI”两种状态。一篇文章可能由人列提纲、AI 扩写,再由人删改; 也可能只使用 AI 调整语法和语气。检测工具看到的是最终文字,而不是完整创作过程,因此结果天然存在边界。
美国国家标准与技术研究院(NIST)的生成式 AI 评测表明,检测模型在特定数据集上可以区分部分人工与机器生成摘要。 与此同时,针对编辑、改写、共同生成和提示变化的压力测试发现,没有一种检测器能在所有变化下始终保持稳定。 两类结论并不矛盾:检测能力存在,但实际效果取决于文本、模型、领域和使用方式。
为什么会误判?
1. 文本太短,可供判断的线索不足
一句标题、几条短评或一小段回复,很难提供稳定的结构和用词分布。即使工具给出一个分数, 这个分数所依据的信息也可能十分有限。
使用山海印进行文字检测时,当前每次支持 350—2,000 个字符。与零散句子相比,主题连贯的完整段落通常更适合分析。 不要为了凑长度,把来自不同作者或不同文章的句子拼在一起,因为拼接本身也会改变文本特征。
2. 固定格式可能看起来“过于规律”
通知、产品说明、实验步骤、客服模板、政策摘要和考试范文往往结构整齐、措辞稳定。 这样的文本即使完全由人工编写,也可能表现出某些与模型生成相似的规律。
相反,AI 也可以按照提示模仿口语、加入错别字或改变句式。因此,“语句工整”或者“读起来机械”只能作为观察, 不能单独用来认定文字来源。
3. 人工与 AI 共同写作模糊了界线
现实中常见的不是一键生成整篇文章,而是让 AI 润色、补写、缩写或调整语气。 2025 年发表的一项研究测试了多种 AI 文字检测器,发现它们经常难以区分轻度 AI 润色与完整 AI 生成, 并可能把只经过少量润色的人工文本标记为 AI 生成。
因此,在判断“这篇文章是否使用 AI”之前,首先需要明确判定标准:
- 使用拼写检查算不算?
- 让 AI 修改一个病句算不算?
- 使用 AI 翻译后再由作者修改算不算?
- 人写提纲、AI 扩写、再由人重写应该如何分类?
只有先明确使用规则,检测结果才有可解释的对象。
4. 改写、翻译和反复编辑会改变特征
AI 生成文字经过人工重写,或者先翻译成另一种语言再修改,原有模式可能被削弱。 反过来,人工文字经过 AI 润色以后,也可能出现新的生成特征。
ACL 2024 年的一项压力测试覆盖编辑、释义改写、人机共同生成和提示变化等情况。 研究发现,受测检测器各有不同的薄弱点,几乎没有检测器能对所有变化保持稳定。 这意味着检测结果针对的是当前提交的文本版本,不能自动代表更早的草稿,更不能完整还原创作过程。
5. 新模型、陌生主题和特殊文体可能超出训练范围
检测模型通常依赖已有的人类文本和 AI 文本样本。如果待检测内容来自更新的生成模型、少见的专业领域或特殊文体, 文本分布与训练样本不同,检测表现就可能发生变化。
中文检测也不能简单照搬英文评测结果。近年的中文基准研究仍在持续扩展模型种类、主题范围和真实提示样本, 这说明跨语言、跨领域的稳定检测仍然是一个发展中的问题。
结果应该怎么看?
正确的阅读方式,不是把一个百分比直接换成“有问题”或“没问题”,而是依次检查四件事。
第一,提交的文本是否足够完整?
短句、拼接文本和缺少上下文的片段,应当降低结论权重。连续、完整、围绕同一主题展开的段落, 通常能提供更多可分析的语言特征。
第二,文本是否经过翻译、润色或多人编辑?
这些处理都会改变最终版本的表达特征。如果已经知道文章经过 AI 润色, 就不应把检测结果解释为“整篇文章都是 AI 写的”。
第三,结果是否与其他信息一致?
写作草稿、版本历史、引用资料、编辑记录和作者说明,通常比一个孤立的检测分数更接近真实创作过程。 如果检测结果与这些材料冲突,应当进一步复核,而不是直接选择相信其中一方。
第四,这次判断会造成什么后果?
普通内容筛查可以使用较宽松的风险提示。如果结果可能导致处分、拒稿、解除合作或公开指控, 就需要更严格的人工复核,并为相关人员提供解释和申诉机会。
“AI 生成可能性较高”表示当前文本命中了较多相关特征,不等于已经确认它由某个具体模型生成。 “未发现明显 AI 特征”也不等于已经证明全文由人工完成。改写、文本过短或生成模型差异,都可能使原有特征变弱。
哪些场景适合使用?
AI 文字检测比较适合:
- 对大量内容进行初步筛查;
- 帮助编辑发现需要进一步复核的文章;
- 比较同一文档不同版本的特征变化;
- 为人工审核增加一条技术线索;
- 在保存原文的前提下形成可供后续核对的检测记录。
它可以帮助审核人员把有限时间放在更需要查看的内容上,但不应代替审核人员作出最终决定。
哪些场景要特别谨慎?
如果要判断学生、员工、作者或投稿人是否违反规则,不应只凭一次检测结果作出决定。更稳妥的方法是同时检查:
- 写作提纲和原始草稿;
- 文档版本历史;
- 使用过的资料和引用;
- 文字修改过程;
- 作者对文章内容的理解;
- 是否使用过翻译、润色或辅助写作工具。
文字检测也不等于抄袭检测或事实核查。AI 生成的文字可能没有抄袭,但包含事实错误; 人工撰写的文字也可能抄袭或传播不实信息。三类问题需要分别检查,不能用一种检测结果替代另外两种。
怎样获得更有参考价值的结果?
- 提交同一作者、同一主题的连续完整段落,不要只检测一句话。
- 优先检测原始版本,并保留润色前后的文本用于比较。
- 记录文本是否经过翻译、语法修正、AI 扩写或多人协作。
- 把结果视为风险提示,同时查看判断依据,不只截取一个百分比。
- 对可能影响个人权益的结论进行人工复核,不公开使用检测分数指控作者。
- 保存原文、检测时间、请求编号和报告,避免以后核对时使用了不同版本。
检测的是文字特征,不是作者身份
AI 文字检测最有价值的作用,是在信息不足时增加一条可以解释和复核的技术线索。 它既不应该被描述成毫无用处,也不应被包装成能够自动裁决作者身份的工具。
如果需要检查一段完整文字,可以使用山海印 AI 文字检测提交 350—2,000 个字符的连续内容。 查看结果时,请同时阅读主要结论、AI 生成可能性和判断依据,并保留请求编号与报告。
对于重要或存在争议的文本,仍应结合草稿、版本记录、资料来源和人工审核作出判断。 你也可以查看支持的文字长度和文件格式、山海印的服务原则与边界以及AI 内容鉴别专栏。
常见问题
AI 文字检测能确定文章是 ChatGPT 写的吗?
不能确定具体作者或生成工具。检测结果表示当前文本是否呈现出模型生成相关特征。不同模型可能产生相似表达,文本也可能经过人工编辑,因此结果应作为线索而不是身份认定。
为什么人工写的文章会被判断为 AI?
固定格式、规律用词、文本过短、专业模板或 AI 润色都可能影响结果。遇到这种情况,应检查原始草稿、版本历史和提交文本是否完整,并进行人工复核。
一句话可以检测是不是 AI 写的吗?
短句提供的语言特征很少,通常不适合得出稳定结论。应尽量提交同一主题下的连续完整段落,同时避免拼接不同来源的句子。
AI 改写或润色的文章还能检测出来吗?
有时能发现相关特征,有时特征会因为人工修改、翻译或多次改写而减弱。检测器也可能把轻度润色的人工文章判断为 AI 生成,因此需要结合写作过程判断。
AI 文字检测和抄袭检测一样吗?
不一样。AI 文字检测分析生成相关特征,抄袭检测查找与既有内容的相似或复制关系。AI 生成文字不一定抄袭,人工文字也可能存在抄袭,两项结果不能相互替代。
参考资料
检测一段完整文字
提交连续、完整的文本,结合主要结论和判断依据阅读结果,并为重要内容保留请求编号与报告。
开始文字鉴别 →