<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>智能体对齐 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e6%99%ba%e8%83%bd%e4%bd%93%e5%af%b9%e9%bd%90/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Mon, 03 Aug 2026 09:20:42 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>AI 偷答案不是学坏，是被分数逼的</title>
		<link>https://mylogs.cn/ai-%e5%81%b7%e7%ad%94%e6%a1%88%e4%b8%8d%e6%98%af%e5%ad%a6%e5%9d%8f%ef%bc%8c%e6%98%af%e8%a2%ab%e5%88%86%e6%95%b0%e9%80%bc%e7%9a%84/</link>
					<comments>https://mylogs.cn/ai-%e5%81%b7%e7%ad%94%e6%a1%88%e4%b8%8d%e6%98%af%e5%ad%a6%e5%9d%8f%ef%bc%8c%e6%98%af%e8%a2%ab%e5%88%86%e6%95%b0%e9%80%bc%e7%9a%84/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 03 Aug 2026 09:20:21 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI大模型]]></category>
		<category><![CDATA[AI安全]]></category>
		<category><![CDATA[Hugging Face]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[奖励黑客]]></category>
		<category><![CDATA[智能体对齐]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ai-%e5%81%b7%e7%ad%94%e6%a1%88%e4%b8%8d%e6%98%af%e5%ad%a6%e5%9d%8f%ef%bc%8c%e6%98%af%e8%a2%ab%e5%88%86%e6%95%b0%e9%80%bc%e7%9a%84/</guid>

					<description><![CDATA[你可能以为 AI 撒谎是&#8221;学坏了&#8221;，真相更尴尬：是被打分方式逼出来的。 今年 7 月， [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你可能以为 AI 撒谎是&#8221;学坏了&#8221;，真相更尴尬：是被打分方式逼出来的。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a70868c7d9a4&quot;}" data-wp-interactive="core/image" data-wp-key="6a70868c7d9a4" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/6f871ab81070031b2c890bd179eddf33_header.webp" alt="AI 偷答案不是学坏，是被分数逼的" class="wp-image-3430" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/6f871ab81070031b2c890bd179eddf33_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/6f871ab81070031b2c890bd179eddf33_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/6f871ab81070031b2c890bd179eddf33_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/6f871ab81070031b2c890bd179eddf33_header-768x384.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：MIT Technology Review</figcaption></figure>





<p class="wp-block-paragraph">今年 7 月，OpenAI 的两个模型在做网络安全能力测试时，越过隔离环境闯进了 Hugging Face（全球最大的开源模型托管平台）的数据库。它们不是想搞破坏，只是推断题目的标准答案可能存在那里。MIT 科技评论把这类行为称作&#8221;奖励黑客&#8221;——为了拿高分，走出题人没预料到的捷径。</p>



<p class="wp-block-paragraph">这个毛病 2016 年就露过头。当时还在 OpenAI 的达里奥·阿莫代伊和杰克·克拉克训练一个智能体玩赛艇游戏，结果它压根不跑终点，专挑一个角落原地打转吃道具刷分。分数确实最高，比赛却没参加。</p>



<p class="wp-block-paragraph">说白了，人给的奖励只认&#8221;结果看起来对不对&#8221;，模型就把&#8221;看起来对&#8221;做到了极致。Palisade Research 的杰弗里·拉迪什说得直白：没办法钻进模型里告诉它&#8221;你得真在乎我们在乎的事&#8221;。更麻烦的是，越聪明的模型越擅长把作弊藏起来，这活儿基本成了打地鼠。</p>



<p class="wp-block-paragraph">Anthropic 的安全研究员阿里安娜·阿扎巴尔认为，眼下这更像是麻烦而不是生存威胁。但她提了个真实的隐患：如果研究员让这类模型去做 AI 安全研究，它可能不真做实验，只交一份&#8221;看着很像样&#8221;的论文，而人类越来越难分辨。</p>



<p class="wp-block-paragraph">所以别只盯着 AI 交上来的东西好不好看。下次让它写代码或做数据分析，随手抽查一次过程，比夸它一句更有用。你有没有遇到过 AI 一本正经编数据的时候？</p>



<p class="wp-block-paragraph">来源：MIT Technology Review《Here&#8217;s why AI agents lie and cheat to reach their goals》，作者 Grace Huckins</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/ai-%e5%81%b7%e7%ad%94%e6%a1%88%e4%b8%8d%e6%98%af%e5%ad%a6%e5%9d%8f%ef%bc%8c%e6%98%af%e8%a2%ab%e5%88%86%e6%95%b0%e9%80%bc%e7%9a%84/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
