如果一篇文章里频繁出现长破折号,你大概会条件反射地怀疑:这是AI写的吧?

《经济学人》最近做的一项语料实验给出的答案是:这个判断已经过时了。
一个流传甚广、却越来越不准的”常识”
关于大语言模型的写作癖好,网上流传着一份心照不宣的清单:偏爱长破折号,钟情”delve(深入探究)”和”tapestry(织锦)”这类词,喜欢把世界描述成一幅”丰富的织锦”。
问题在于,靠几个词、几个破折号就下结论,本身站不住脚。仅因为一篇文章出现了”delve”就断定出自机器之手,就像因为文中出现”imprudence(轻率)”便认定作者是简·奥斯汀一样荒谬。波兰格但斯克大学语言学家卡罗琳娜·鲁德尼茨卡(Karolina Rudnicka)指出,并不存在统一的AI文风,正如人类写作本来也不存在单一风格——作家各有各的语言癖好,比如艾米莉·狄金森就极其偏爱长破折号,而AI同样会形成自己的习惯。
更麻烦的是,识别的紧迫性正在上升。据一项统计,互联网上超过三分之一的新网站由AI起草。今年英联邦短篇小说奖的获奖作品甚至被人指称为AI创作,评委还称赞其文风”沉静而权威”,尽管英联邦基金会否认了这一说法。
55940个句子、120万个单词的对照实验
为了找出真正可靠的特征,《经济学人》设计了一项对照实验:让当前主流的四款大模型——OpenAI的ChatGPT、Anthropic的Claude、谷歌的Gemini和xAI的Grok——在不联网检索的前提下改写该刊文章,提示词使用的是其近来试验性附加在部分文章上的AI摘要。
由此得到一份人类与AI写作并存的语料库,共比较分析了55940个句子、120万个单词。为确保识别出的是AI的共性特征而非《经济学人》自身文风,研究还将AI文本与美国有线电视新闻网、《纽约时报》《华盛顿邮报》的报道作了对比,并参考了1950年至2022年间出版的畅销小说片段。
结论是:人机差异不只体现在用词和标点上,也体现在句子结构与段落组织方式上;但这些特征远没有大众想象中那么显眼,部分原因在于随着模型迭代,AI的文风一直在变。
三个更靠谱的新破绽
其一,词汇变”端着”了。 AI已经不那么爱用”delve”和”tapestry”,转而大量堆砌多音节词,例如significant(重要的)、increasingly(越来越)、consequences(后果)。它们比人类更爱用生僻词(如interdependence相互依存、reindustrialisation再工业化)和科学术语(如parameter参数、methodology方法论),也偏好把动词名词化(把expand变成expansion)。所有受测模型都有这种倾向,其中Gemini和Claude尤为明显。这大体就是乔治·奥威尔批评过的”矫饰辞藻”——用复杂词汇包装简单表达,只为显得高深;奥威尔当年就讥讽这类作者笃信”拉丁语和希腊语词汇比盎格鲁-撒克逊词汇更高贵”,而数据显示,AI笔下带拉丁语词尾的单词出现频率确实明显高于人类。
其二,破折号翻案,标点整体变少。 在最新版本中,只有Claude使用长破折号的频率高于人类作者,而ChatGPT用得比这项研究中任何一位写作者都少。真正更可靠的信号是标点总量偏少:模型使用的逗号、分号都少于人类,括号更是几乎不用。原因有二,一是它们爱写长句——”and”是被过度使用得最厉害的词;二是它们很少引用专家原话。
其三,句子长而平,套路化修辞扎堆。 AI的句子普遍偏长,段落里几乎不会突然插入一句短促有力的话,读起来难免乏味。为了制造变化,它们高度依赖几种固定结构:”不是X,而是Y””不仅……而且……”,以及”三项并列法则”。每1000个句子中,ChatGPT和Claude使用这些结构的频率高于其他模型,也高于人类作者。
检测工具能撑多久
依靠算法检测是另一条路。行业领先公司Pangram声称其检测准确率达到99.98%,并已与博客平台Substack合作推出工具。但这类检测器本质上是黑箱,可能误判,且无法解释自己为何得出结论。
更值得警惕的是,AI正在飞快地”改掉”自己的破绽。佛罗里达州立大学的汤米·尤泽克(Tommie Juzek)指出,大语言模型本就基于人类写作训练,并持续通过人类反馈优化:人们喜欢什么它就学什么,不喜欢什么就逐渐舍弃。
一个细节颇能说明问题。不久前,《经济学人》记者向旧版ChatGPT提问”AI是不是过度使用破折号”,得到的回答是:”哈——这个问题问得真好!”如今再问同样的问题,它一本正经地答道:”最好还是谨慎使用。”
所以,眼下若要识别AI写作,最值得留意的不再是某个标志性符号,而是那种平淡、端着、拉丁词源词汇密集的整体质感。但《经济学人》的研究也提醒:每一次模型更新,AI的文字都在离人类更近一步,这道识别题只会越来越难。
来源:《经济学人》(How to spot AI writing)







