找回密码
 立即注册
休斯顿安稳保险
搜索
查看: 136|回复: 0

独家:AI写作检测可靠吗? 三款热门工具实测

[复制链接]

1万

主题

54

回帖

4万

积分

管理员

积分
44523
发表于 2026-10-1 19:10:35 | 显示全部楼层 |阅读模式
独家:AI写作检测可靠吗? 三款热门工具实测



人工智能专家指出,人工智能检测服务旨在提供有用的线索,但是并非绝对正确。 律师和科技界人士表示,虽然这些工具的准确率高,但是它们不应该取代人类的判断近一段时间,随着保护和优先考虑人类创作内容(human-authored content)的呼声日益高涨,对于出版商、教育工作者和其他专业人士来说,识别人工智能(AI)生成的文字正在成为一个并不陌生的难题。
在这种背景下应运而生的AI写作检测软件已经迎接了这个挑战; 一些工具开发商表示,它们区分人类写作和AI写作的准确率可以高达99%。
然而众多律师表示,必须谨慎对待AI写作检测软件得出的结论。 如果教育工作者、出版商和雇主在判断文章是否为AI生成时,以人工智能检测的评分作为依据,可能会面临严重的法律后果。

人工智能专家——甚至包括那些开发出检测工具的专家——都表示,这些检测服务旨在提供有用的线索,但是并非绝对正确。 事实上,它们似乎都存在一个共同的盲点。
实践检验

研究人员对人工智能检测工具的有效性测评已经进行了一段时间,相关研究和专家都强调了一个关键点:人类仍然需要参与评估过程。
在2026年发表于《教育诚信国际期刊》(International Journal for Educational Integrity,简称IJEI,总部位于澳大利亚)的一项研究中,研究人员指出:「虽然检测工具可以提供有用的初步示警,但是在涉及重大后果的决策时,不应将其视为决策的唯一证据。 应该将检测结果纳入到更全面的评估策略之中。」
研究人员和行业专家也对这些检测工具的准确性表示担忧,担心它们可能将人类写作标记为人工智能写作。

总部位于纽约的AI初创公司GPTZero的一位发言人告诉记者:「检测结果只是一个信号,而不是定论。 它应该引发进一步的调查,而不是成为调查的终结。」
在专业领域,有两件事比检测工具本身更重要。
发言人表示:「首先,一个组织需要制定书面的AI使用政策,然后才需要检测工具。 检测工具可以帮助执行标准,但是它并不能替代标准本身。」
“第二,应关注模式而不是孤立的案例,并将检测结果与流程证据结合起来。”
在两周时间内测试了三款领先的AI写作检测工具——Pangram、GPTZero和 Originality.AI。 测试结果令人大开眼界。




人工智能写作检测工具GPTZero,将ChatGPT生成的100% AI生成的样本,判定为100% AI生成。 (Screenshots via The Epoch TImes/GPTZero)
在每个检测平台的免费版本中,都使用了相同的写作样本,长度在500到2000字之间。 所有写作样本均包含三种类型:100%人工智能写作、100%人类写作,以及人工智能和人类写作比例分别为25:75、50:50和75:25的混合模式。
100%人工智能写作样本由大型语言模型ChatGPT和Claude创建,以确定某些自动写作风格是否比其它风格更容易被检测到。




一款AI写作检测工具 Originality.AI,将ChatGPT生成的100% AI生成的样本,判定为51% AI生成。 (Screenshots via The Epoch TImes/Originality.AI)
在记者的测试中,所有三种检测服务都能轻松识别出100%由人工智能生成的文本样本。
Pangram和GPTZero均给出了100%的人工智能生成概率评分,而 Originality.AI 则认为该文本至少有40%的可能性是由人工智能生成的。
在测试中,三款检测工具在识别100%真人写作样本时表现相近。 然而,当引入混合写作样本时,情况就变得有趣起来。

在测试中,Pangram对人机混合写作样本进行检测时,检测结果的变化最为显著。 原本100%人类撰写的文本经过编辑,加入了25%的AI生成的内容。 检测结果显示,新文本中AI生成文本的比例达到了87%。
而当将人类写作和AI生成的比例反转为25:75时,Pangram在测试中给出的分数是AI写作占100%。



2026年9月16日,英国伦敦,一台平板电脑的屏幕上显示Anthropic公司开发的AI应用Claude的主页。 (Leon Neal/Getty Images)
在测试中,GPTZero和 Originality.AI 也将25:75的混合写作样本比例视为一个触发点。 这两个程序在检测该比例的文本时(无论是正向比例还是反转比例)结果最为可靠,但在检测50:50比例的文本时表现不佳。 在对所有混合写作样本进行评分时,Pangram在检测50:50比例的文本时准确率最高。
但是问题在于:使用Grammarly等AI编辑软件也可能影响检测的分数。
美国女作家米娅‧巴拉德(Mia Ballard)否认使用人工智能创作小说《害羞女孩》(Shy Girl,2025)。 此前有报道称,由于被怀疑大量使用人工智能,她与法国的阿歇特出版集团(Hachette)解约。 巴拉德表示,她的编辑人员可能在修改或编辑过程中使用了人工智能。 报道中只是说怀疑,而不是列出确凿的证据表明巴拉德使用人工智能创作小说。
关于仅仅使用人工智能来编辑文章是否会被检测服务标记为违规,一直存在诸多争议。 然而,Originality.AI 的首席执行官乔纳森‧吉尔汉姆(Jonathan Gillham)表示,这种情况完全有可能发生。




2024年4月29日,法国马拉科夫(Malakoff)的阿歇特出版社(Hachette)与小说《害羞女孩》(Shy Girl)的作者解约。 阿歇特出版社怀疑该小说创作过程中大量使用人工智能技术。 作者否认自己使用人工智能技术来创作小说,但表示她的编辑人员可能在修改或编辑过程中使用了人工智能技术。 (Magali Cohen/Hans Lucas/AFP via Getty Images)
人工智能在编辑中的应用

「如果我使用Grammarly来修改我的文章,其中就包含了很多人工智能技术...... 如果你使用人工智能工具来辅助编辑,它会在编辑过程中输入这些信息。」吉尔汉姆向记者解释道。
这对于那些认为只使用人工智能工具进行编辑,就能安全通过人工智能检测的人来说,这一点令人担忧。 不过,吉尔汉姆表示,这其中还有一些微妙的地方。
吉尔汉姆表示,仅仅纠正标点符号和拼写错误可能不会引起检测工具的注意,但接受修改建议则可能被识别。 他认为,当有人接受对段落和句子进行重新措辞的建议时,这些更改会在文档中留下类似的痕迹,而人工智能检测工具可能会识别出这些痕迹。
吉尔汉姆表示,如果有人撰写书籍、文章或论文,并使用人工智能工具进行编辑和修改,则该作品可能会被标记为人工智能作品。
这就是为什么吉尔汉姆认为,企业制定「人工智能容忍政策」(AI tolerance policy)非常重要。




资料照片:加拿大安大略省科林伍德(Collingwood),Originality.AI的员工拍摄了一张集体照。 (Courtesy of Jonathan Gillham)
「例如,如果和我共事的人在写作中使用人工智能,而公司对人工智能采取零容忍政策,那么我就不能使用Grammarly等辅助工具。」他说道。
为了验证这个理论,我们首先将一篇1,500字的人工撰写的文章直接放入这三个检测工具中,不做任何修改; 然后,在根据Grammarly的建议进行修改后,再次放入这三个检测工具中,看看它是否会生成AI写作的分数。
在第一轮检测中,所有样本均未检测到人工智能写作。 而在第二轮检测中,Originality.AI 和Pangram均未检测到任何非人类因素的影响,但GPTZero检测到了,并给这篇文章的人工智能比例判定为1%。
吉尔汉姆表示,公司或出版商必须明确他们可以允许多大程度使用人工智能写作,这一点至关重要。 明确了这一点,才能避免双方的预期「不符」(mismatch)。 他认为,问题产生的根源是缺乏透明度。
「人工智能检测工具也是讨论的一部分。 在大数据集上,它是一个非常有效的工具,可以帮助我们了解一个组织正在创建多少人工智能内容。」他说道。
当被问及他是否认为人工智能检测工具可以作为最终决策的依据时,吉尔汉姆的态度非常坚决。




2025年8月16日,加拿大多伦多,手机屏幕和电脑屏幕上分别显示着人工智能写作工具Grammarly的界面。 (bella1105/Shutterstock)
「没有任何工具的准确率能达到100%,而且当涉及到混合内容时,就会出现很多关于什么是人类、什么是人工智能的问题。」他说道。
总部位于宾夕法尼亚州的ANTLR Interactive的创始人兼高级软件工程师凯尔‧斯威斯(Kyle Szives)也同意这种观点。
「人工智能写作检测工具在技术上无法完全确定作者身份。 从宏观层面来说,人工智能检测工具通常通过寻找机器生成文本中常见的统计信号,将一段文本归类为人工智能撰写或非人工智能撰写。」斯威斯向记者解释道。
斯威斯曾经开发过人工智能辅助产品,他表示,存在人工智能「概率或信号」(probability or signal)并不能确凿证明某人在其写作中使用了该技术。
「如果一段人工撰写的文本结构僵化、公式化或者可预测,篇幅异常短小,有大量编辑的痕迹,或者遵循清晰但统一的专业风格,那么这段文本可能会被标记为人工智能生成文本。」他说道。
斯威斯指出,反过来也会发生同样的情况,即当人工智能生成的文本被大幅改写或者与人类撰写的文本合并时。 此时还可能出现误判为「非人工智能生成」的情况。
吉尔汉姆表示,人工智能写作检测工具会根据人类和人工智能的写作进行训练,但它们所做的与ChatGPT等系统所做的并没有太大区别——都是模式识别。
当被问及检测工具如何确定人工智能得分时,吉尔汉姆指出:“令人不安的答案是,人工智能系统是一个黑匣子。”而危险就在这里。
「我认为外界对人工智能检测存在一些误解。」他说道,「测试表明这些检测工具的准确率很高,但也有人将它们的准确率视为100%。」



资料照片:手机屏幕上显示了使用ChatGPT进行的对话示例。
法律后果

毫无疑问,人工智能检测服务的市场需求非常迫切。
根据 Originality.AI 研究人员的分析,在对亚马逊(Amazon)上的书籍进行扫描分析后发现,82%的草药疗法类书籍、77%的成功相关的事业鸡汤类书籍,和63%的宗教类书籍被怀疑是人工智能生成的。
这些发现得到了其它研究的支持。 今年7月,纽约石溪大学(Stony Brook University)、哥伦比亚法学院(Columbia Law School)和密歇根大学(University of Michigan)的研究人员发表了他们的研究结果。 他们审查了2023年至2026年间在亚马逊上销售的14,419本自助出版类型小说。 研究人员使用人工智能检测工具后发现,其中20%的小说含有「大量人工智能文本」。 不含人工智能文本的书籍仅占测试组的37%。
「如果对作者的身份存在疑问,应该参考其它的证据,例如草稿、修订记录、来源注释、元数据以及作者本人等等。」斯威斯说道。
2015年10月15日,在德国法兰克福书展上,一位参观者正在使用Kindle电子书阅读器浏览书籍。 (Daniel Roland/AFP via Getty Images)
一些美国律师强调,对员工、客户或合同作出关键决策时,如果仅仅使用人工智能检测工具,可能存在潜在风险。
“如果一家公司主要根据检测工具的分数解雇员工、终止与承包商的合作或拒绝接受工作成果,那么它就有可能基于一个可能错误的工具做出后果严重的决定。”麦克雷迪律师事务所(McCready Law)的创始人迈克尔‧麦克雷迪(Michael McCready)告诉记者。
麦克雷迪提到了联邦贸易委员会(Federal Trade Commission,简称FTC)去年对人工智能检测工具Workado采取的行动。 联邦贸易委员会(FTC)指控Workado向客户宣称其准确率高达98%; 而该案中引用的一项独立调查发现,该工具在通用内容上的准确率约为53%。
麦克雷迪表示:「还有一个主要的问题是歧视。 如果人工智能写作检测工具不成比例地标记某些群体,而雇主又依赖这些检测结果进行招聘、纪律处分或作出解雇决定,那么该公司可能面临法律风险。」
2025年1月9日,美国联邦贸易委员会(FTC)在华盛顿发布禁令,禁止销售人工智能检测工具Workado。 该工具曾向客户宣称其准确率高达98%。
麦克雷迪表示,公司不能仅仅因为「软件告诉我们这样做」就可以逃避责任。
「最终的决定权仍然在企业手中。 如果供应商对工具的准确性或可靠性做出了未经证实的声明,则可能要承担额外的责任。」他说道。
海姆利希律师事务所(Heimlich Law)总裁艾伦‧海姆利希(Alan Heimlich)对此表示赞同。
「最大的风险之一就是,企业可能会将概率误认为证据。 因为在任何情况下,人工智能写作检测工具实际上并不能证明作者身份,而如此笃信这些技术的准确性,最终可能会导致企业承担不必要的责任。」他说道。
吉尔汉姆还强调,当人工智能检测分数出人意表地弹出来的时候,不要操之过急。
「我们认为,只要情况允许,检测评分应该成为展开一场讨论的契机。」他说道。



回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|小黑屋|美国论坛德州华人网

GMT-6, 2026-10-10 09:23 , Processed in 0.011980 second(s), 23 queries .

Powered by Discuz! X5.0

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表