一家总部位于纽约布鲁克林、仅有 24 名员工、累计融资约 1300 万美元(约为 OpenAI 融资额的 0.0072%)的初创公司 Pangram,正在人工智能文本检测领域被视为「金标准」。在生成式人工智能写作泛滥的当下,这家名不见经传的小公司,正充当着出版、教育等领域判断「文字是否出自机器」的关键裁判。
它如何判断一段文字是不是 AI 写的
Pangram 用约 100 万份公开授权的人写文本,以及 GPT-5 等前沿模型生成的文本训练分类器。系统接收输入文本后做分词与向量化,经神经网络输出预测,判断内容由人写成、AI 生成还是 AI 辅助,并给出大致的比例。
与早期依赖困惑度、突兀度等统计信号的做法不同,2026 年的检测器普遍采用更精细的分类模型,捕捉词汇、节奏与结构中的细微模式。但真正决定一款工具能否放心使用的,不是厂商最爱展示的「准确率」,而是误报率——把人写的文字错判为 AI 的概率。
第三方评测:唯一稳定识别的四款对比
2026 年 6 月,布鲁塞尔自由大学研究人员在一项同行评审研究中,对比了 Pangram、GPTZero、Turnitin、Copyleaks 四款工具。他们用 160 篇每篇超过 4000 词的英文学术论文做测试,数据集均分为人类撰写、AI 生成、混合、以及经「人性化」改写四类。

结果泾渭分明:在纯 AI 生成文本上,Pangram 检测率达 97.5%,且是唯一能稳定识别「人性化改写」文本(95%)的工具;其余三款在纯 AI 集上几乎全部漏判,检测率均为 0%。研究者给出的结论是,在所考察的四款工具中,「目前只有 Pangram 产生了令人满意的结果」。
芝加哥大学布斯商学院的另两项研究也印证了这一点:在多种文体与 ChatGPT、Claude、Gemini 等模型生成的文本上,Pangram 的误报率与漏报率接近零,且单次检测成本最低,约为每篇正确标记 0.0228 美元,低于 Originality.ai 的 0.0416 美元与 GPTZero 的 0.0575 美元。
营销数字与独立基准的落差
Pangram 自称准确率 99.98%、误报率 0.01%。但在 2026 年一项独立基准中,其准确率为 99.1%、误报率 0.05%(仍为市场最低之一)。也就是说,第三方数字低于厂商宣传,但依然很高;误报率虽是宣传值的五倍,仍处行业低位。这种「宣传值与实际值存在差距」的现象,在评测任何检测工具时都值得留意。
短板在哪里
Pangram 的工程技术团队对自身局限相当坦诚。首席技术官 Bradley Emi 直言「在 AI 检测中,误报远比漏报更糟」,并公开了产品最弱的场景:对短句、菜谱、诗歌、操作指南等公式化短文,误报率可达学术长文的 12 至 57 倍,因此不建议用于短列表、数学、极短回答与高度格式化的文本。
更值得关注的是,误报并非随机分布,而是集中在非母语写作者、神经多样性学生等群体身上——这恰恰是教育场景中最需要谨慎对待的部分。
对中国读者的参考
AI 写作检测在中文学术与内容平台同样是热门议题,国内已出现知网、朱雀等检测方案。无论选用哪款工具,准确率与误报率都必须一并考量:对一篇由人认真写就的作业或稿件而言,一次错误的「AI 判定」造成的代价,远高于放过一个机器生成的段落。







