<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>NewsGuard &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/newsguard/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Fri, 14 Aug 2026 01:54:56 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>聊天机器人假话率一年翻倍：Claude 最稳，Pi 最离谱</title>
		<link>https://mylogs.cn/chatbot-falsehood-rate-doubled/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Fri, 14 Aug 2026 01:54:34 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI幻觉]]></category>
		<category><![CDATA[Claude]]></category>
		<category><![CDATA[NewsGuard]]></category>
		<category><![CDATA[Perplexity]]></category>
		<category><![CDATA[假新闻]]></category>
		<category><![CDATA[大模型评测]]></category>
		<category><![CDATA[聊天机器人]]></category>
		<guid isPermaLink="false">https://mylogs.cn/chatbot-falsehood-rate-doubled/</guid>

					<description><![CDATA[十大聊天机器人测评：假话率一年翻倍，Claude 最稳 Pi 最离谱 新闻事实核查机构 NewsGuard 最 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h2 class="wp-block-heading">十大聊天机器人测评：假话率一年翻倍，Claude 最稳 Pi 最离谱</h2>



<p class="wp-block-paragraph">新闻事实核查机构 NewsGuard 最新发布的《AI 虚假声称监测》（AI False Claims Monitor）一周年纪念版显示，主流聊天机器人复述假新闻的比例在一年间几乎翻了一倍。这项针对十大生成式 AI 工具的测评提醒读者：模型回答得越多，并不等于越准。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a7e9fac0331e&quot;}" data-wp-interactive="core/image" data-wp-key="6a7e9fac0331e" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="800" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/8309c7281418c7f9e860e9850d6f99c3_header.webp" alt="聊天机器人假话率一年翻倍：Claude 最稳，Pi 最离谱" class="wp-image-4778" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/8309c7281418c7f9e860e9850d6f99c3_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/8309c7281418c7f9e860e9850d6f99c3_header-300x200.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/8309c7281418c7f9e860e9850d6f99c3_header-1024x683.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/8309c7281418c7f9e860e9850d6f99c3_header-768x512.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：The Decoder</figcaption></figure>





<h3 class="wp-block-heading">整体数据：从 18% 升至 35%</h3>



<p class="wp-block-paragraph">NewsGuard 的监测选取已被专业事实核查证伪的时事叙事，用「普通用户」「诱导性」「恶意」三种提问方式测试模型，再由人工分析师判定回答属于「辟谣」「拒答」还是「误导」。</p>



<p class="wp-block-paragraph">2025 年 8 月的测评中，十大聊天机器人在时事类问题里复述虚假说法的比例达到 35%，而一年前的 2024 年 8 月这一数字仅为 18%。与此同时，模型对敏感问题「拒绝回答」或「表示不知道」的比例，从约 31% 骤降到几乎为零——聊天机器人现在几乎来者不拒，但超过三分之一的回答夹带着可证伪的假话。</p>



<h3 class="wp-block-heading">单模型对比：差距悬殊</h3>



<p class="wp-block-paragraph">把十大模型拆开看，假话率呈现明显梯度：</p>



<ul class="wp-block-list"><li>Inflection 的 Pi：约 56.67%，全场最高</li><li>Perplexity：约 46.67%，一年前还是 100% 辟谣率，跌幅最猛</li><li>ChatGPT 与 Meta 的 Llama：均约 40%</li><li>微软 Copilot 与 Mistral 的 Le Chat：均约 36.67%</li><li>xAI 的 Grok、You.com：约 33%</li><li>谷歌 Gemini：约 16.67%</li><li>Anthropic 的 Claude：约 10%，表现最稳</li></ul>



<p class="wp-block-paragraph">也就是说，最稳的 Claude 与最离谱的 Pi 之间，假话率相差超过五倍。Perplexity 的滑落尤其刺眼：一年前它对测试中的虚假叙事能做到零失误，如今却在近一半的回答里复述假话。</p>



<h3 class="wp-block-heading">为什么变差了：联网检索打开了攻击面</h3>



<p class="wp-block-paragraph">NewsGuard 将恶化归咎于产品取舍。过去模型面对数据空白或敏感话题会倾向拒答，这种「不知道就别说」的策略虽让用户恼火，却把风险挡在外面。引入实时联网搜索后，模型不再拒绝回答，却开始从被污染的互联网信息环境中取信——其中既有低质内容，也有蓄意投放的虚假信息。</p>



<p class="wp-block-paragraph">报告记录了俄罗斯虚假信息网络 Storm-1516 与 Pravda 的运作手法：约 150 个设在莫斯科、模仿正规媒体的亲克里姆林网站，专门向 AI 系统投喂假叙事。测试抛出一个关于摩尔多瓦议长伊戈尔·格罗苏的伪造说法时，十大聊天机器人中有六个（Mistral、Claude、Inflection 的 Pi、Copilot、Meta、Perplexity）把它当成事实复述，并引用 Pravda 网络作来源。微软 Copilot 在 2025 年 3 月停止直接引用 Pravda 后，改用该网络在俄罗斯平台 VK 上的社交媒体帖子当出处，继续被利用。</p>



<h3 class="wp-block-heading">给用户与企业的提醒</h3>



<p class="wp-block-paragraph">NewsGuard 建议，把任何聊天机器人的输出都当作草稿：要求给出信息来源，在企业流程里建立核查环节，不要在未核实前把 AI 回答当作结论。OpenAI 也曾公开承认，语言模型本质上会「幻觉」，因为它预测的是最可能的下一个词，而非事实本身。</p>



<p class="wp-block-paragraph">这项测评并非通用准确率排行榜，而是一次针对新闻、政治、健康与企业声誉等高利害场景的压力测试。它的结论很直接：当 AI 成为越来越多人获取信息的入口，模型本身的可靠性反而整体下滑，这给整个行业和普通用户都敲响了警钟。</p>



<p class="has-small-font-size wp-block-paragraph">来源：NewsGuard《AI False Claims Monitor》（多家媒体转述，包括 The Decoder、PC Guide 等）</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
