OpenAI 推 textGrain 隐形文本水印,ChatGPT 与 Codex 输出可溯源

OpenAI 于 10 月 5 日公布其应对欧盟《人工智能法案》(EU AI Act)的文本溯源方案。该法案要求生成式人工智能系统的提供方,必须以可识别的方式标记人工智能生成的文本内容。OpenAI 的方案名为 textGrain,通过在模型的用词中嵌入一种肉眼不可见的统计信号来实现标记。
与 Anthropic 思路同源,但范围更窄
此前 Anthropic 为遵守欧盟《人工智能法案》,曾让 Claude 在生成文本时通过微调用词来嵌入水印,并因此引发争议。其做法是:在不影响语义的前提下,让 Claude 偶尔在多个同样合适的词之间按某种隐藏规律做选择,并配套一个只能识别该规律的检测器——由于水印由 Anthropic 专属密钥生成,该检测器无法判断文本是否出自 OpenAI 或其他厂商。
OpenAI 此次公布的 textGrain 采用了类似思路,但上线范围明显更克制。OpenAI 表示,全球范围的 API 客户即日起可以主动选择为部分模型开启文本水印;而在 ChatGPT 与 Codex 中,隐形水印将在未来几周先仅面向欧盟地区符合条件的用户添加。
默认关闭,检测权限受限
在 API 场景中,文本水印目前默认处于关闭状态。OpenAI 同时开放了文本水印检测器的使用申请,但初期仅向通过审核的研究人员和专业机构提供,公司将在此期间持续评估并改进这项技术。
OpenAI 坦言,检测技术仍存在明显局限,既可能出现漏报(假阴性),也可能出现误报(假阳性),在篇幅较短的文本或数学等用词选择余地较小的特定领域尤其明显。公司还强调,水印”不衡量人类贡献””不确立所有权或责任””不识别用户”,也”不验证内容的准确性”;即便未检测到水印,也不能据此证明内容出自人类之手。
编辑会显著削弱水印
OpenAI 公布的评估显示,水印对编辑相当敏感。在 400 个 token 的段落中,仅将 10% 的词语替换为同义词,检测率就从约 92% 下降到 66%;若替换 25%,检测率进一步跌至 17%。
值得注意的是,在多项基准测试中,带水印与不带水印的文本表现几乎没有差异:在 Artificial Analysis 智能指数上,带水印文本得分 49.76,略高于不带水印的 49.57;在 AutomationBench 上分别为 34.86% 与 34.09%;在 Terminal-Bench 4.0 上分别为 56.06% 与 53.90%。OpenAI 表示计划将 textGrain 以开源形式开放,供外部在此基础上继续构建,技术报告也将在未来几周补充更多细节。
OpenAI 表示,随着技术、标准和证据不断演进,公司会重新审视并调整这一方案,并继续研究水印在经历编辑与翻译后能否保持,以及能否更有意义地区分”人工智能辅助”与”人工智能原创”。







