十大聊天机器人测评:假话率一年翻倍,Claude 最稳 Pi 最离谱
新闻事实核查机构 NewsGuard 最新发布的《AI 虚假声称监测》(AI False Claims Monitor)一周年纪念版显示,主流聊天机器人复述假新闻的比例在一年间几乎翻了一倍。这项针对十大生成式 AI 工具的测评提醒读者:模型回答得越多,并不等于越准。

整体数据:从 18% 升至 35%
NewsGuard 的监测选取已被专业事实核查证伪的时事叙事,用「普通用户」「诱导性」「恶意」三种提问方式测试模型,再由人工分析师判定回答属于「辟谣」「拒答」还是「误导」。
2025 年 8 月的测评中,十大聊天机器人在时事类问题里复述虚假说法的比例达到 35%,而一年前的 2024 年 8 月这一数字仅为 18%。与此同时,模型对敏感问题「拒绝回答」或「表示不知道」的比例,从约 31% 骤降到几乎为零——聊天机器人现在几乎来者不拒,但超过三分之一的回答夹带着可证伪的假话。
单模型对比:差距悬殊
把十大模型拆开看,假话率呈现明显梯度:
- Inflection 的 Pi:约 56.67%,全场最高
- Perplexity:约 46.67%,一年前还是 100% 辟谣率,跌幅最猛
- ChatGPT 与 Meta 的 Llama:均约 40%
- 微软 Copilot 与 Mistral 的 Le Chat:均约 36.67%
- xAI 的 Grok、You.com:约 33%
- 谷歌 Gemini:约 16.67%
- Anthropic 的 Claude:约 10%,表现最稳
也就是说,最稳的 Claude 与最离谱的 Pi 之间,假话率相差超过五倍。Perplexity 的滑落尤其刺眼:一年前它对测试中的虚假叙事能做到零失误,如今却在近一半的回答里复述假话。
为什么变差了:联网检索打开了攻击面
NewsGuard 将恶化归咎于产品取舍。过去模型面对数据空白或敏感话题会倾向拒答,这种「不知道就别说」的策略虽让用户恼火,却把风险挡在外面。引入实时联网搜索后,模型不再拒绝回答,却开始从被污染的互联网信息环境中取信——其中既有低质内容,也有蓄意投放的虚假信息。
报告记录了俄罗斯虚假信息网络 Storm-1516 与 Pravda 的运作手法:约 150 个设在莫斯科、模仿正规媒体的亲克里姆林网站,专门向 AI 系统投喂假叙事。测试抛出一个关于摩尔多瓦议长伊戈尔·格罗苏的伪造说法时,十大聊天机器人中有六个(Mistral、Claude、Inflection 的 Pi、Copilot、Meta、Perplexity)把它当成事实复述,并引用 Pravda 网络作来源。微软 Copilot 在 2025 年 3 月停止直接引用 Pravda 后,改用该网络在俄罗斯平台 VK 上的社交媒体帖子当出处,继续被利用。
给用户与企业的提醒
NewsGuard 建议,把任何聊天机器人的输出都当作草稿:要求给出信息来源,在企业流程里建立核查环节,不要在未核实前把 AI 回答当作结论。OpenAI 也曾公开承认,语言模型本质上会「幻觉」,因为它预测的是最可能的下一个词,而非事实本身。
这项测评并非通用准确率排行榜,而是一次针对新闻、政治、健康与企业声誉等高利害场景的压力测试。它的结论很直接:当 AI 成为越来越多人获取信息的入口,模型本身的可靠性反而整体下滑,这给整个行业和普通用户都敲响了警钟。
来源:NewsGuard《AI False Claims Monitor》(多家媒体转述,包括 The Decoder、PC Guide 等)







