<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>大模型评估 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e5%a4%a7%e6%a8%a1%e5%9e%8b%e8%af%84%e4%bc%b0/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Tue, 01 Sep 2026 06:58:23 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>Anthropic重启外部AI安全测试，3次误触真实系统</title>
		<link>https://mylogs.cn/anthropic%e9%87%8d%e5%90%af%e5%a4%96%e9%83%a8ai%e5%ae%89%e5%85%a8%e6%b5%8b%e8%af%95%ef%bc%8c3%e6%ac%a1%e8%af%af%e8%a7%a6%e7%9c%9f%e5%ae%9e%e7%b3%bb%e7%bb%9f/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 01 Sep 2026 06:58:23 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[人工智能安全]]></category>
		<category><![CDATA[大模型评估]]></category>
		<category><![CDATA[红队测试]]></category>
		<category><![CDATA[网络安全]]></category>
		<guid isPermaLink="false">https://mylogs.cn/anthropic%e9%87%8d%e5%90%af%e5%a4%96%e9%83%a8ai%e5%ae%89%e5%85%a8%e6%b5%8b%e8%af%95%ef%bc%8c3%e6%ac%a1%e8%af%af%e8%a7%a6%e7%9c%9f%e5%ae%9e%e7%b3%bb%e7%bb%9f/</guid>

					<description><![CDATA[人工智能安全评估正在经历一次“翻车—修复—重启”的循环。美国人工智能公司 Anthropic 近日宣布，恢复此 [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">人工智能安全评估正在经历一次“翻车—修复—重启”的循环。美国人工智能公司 Anthropic 近日宣布，恢复此前暂停的第三方网络安全评估，并公布了一份复盘细节：在 4 月至 7 月间的评估过程中，因测试环境配置失误，其前沿模型曾三次在未经授权的情况下接触到真实的生产系统。</p>

<figure data-wp-context="{&quot;imageId&quot;:&quot;6a969f2180ad1&quot;}" data-wp-interactive="core/image" data-wp-key="6a969f2180ad1" class="wp-block-image size-large wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1536" height="1024" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/09/29c0de5b13bc28885c9f32aff8afbff8_header.webp" alt="AI安全评估示意图" class="wp-image-5801" srcset="https://mylogs.cn/wp-content/uploads/2026/09/29c0de5b13bc28885c9f32aff8afbff8_header.webp 1536w, https://mylogs.cn/wp-content/uploads/2026/09/29c0de5b13bc28885c9f32aff8afbff8_header-300x200.webp 300w, https://mylogs.cn/wp-content/uploads/2026/09/29c0de5b13bc28885c9f32aff8afbff8_header-1024x683.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/09/29c0de5b13bc28885c9f32aff8afbff8_header-768x512.webp 768w" sizes="(max-width: 1536px) 100vw, 1536px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>示意图（AI 生成）</figcaption></figure>

<h2 class="wp-block-heading">14 万次测试中，3 次误触真实系统</h2>

<p class="wp-block-paragraph">Anthropic 在公告中披露，此次复盘覆盖了 4 月至 7 月间的 <strong>141,006</strong> 次网络安全评估运行。其中，有 3 次运行因第三方测试环境被错误配置、意外暴露出可连通互联网的通道，导致模型把真实系统当成了演练的一部分，进行了未经授权的访问。</p>

<p class="wp-block-paragraph">事件发生后，Anthropic 于 7 月 23 日暂停了全部网络评估，并在 7 月 27 日前通知了相关方。评估原本采用“夺旗”（capture-the-flag）式演练：模型收到探测系统漏洞的指令，但被明确要求不得访问互联网、不得触碰真实目标。问题出在外部测试环境本身，而非模型主动越权。</p>

<h2 class="wp-block-heading">新框架补上三道缺口</h2>

<p class="wp-block-paragraph">恢复测试的同时，Anthropic 推出了一套修订后的评估框架，重点补齐三类短板：</p>

<ul class="wp-block-list"><li>实时转录与日志监控，让每一次评估过程都可被即时审阅；</li><li>在提示词中更清晰地界定目标范围，减少模型对“边界”的误判；</li><li>更严格的网络边界校验，从机制上阻断测试环境与外网的意外连通。</li></ul>

<p class="wp-block-paragraph">公司还与外部评估机构共同复核了事故，并为获批的防御性安全用户扩大了受控访问范围。据披露，相关评估由外部网络安全测试公司 Irregular 具体运营，并与独立人工智能评估机构 METR 联合开展了调查。</p>

<h2 class="wp-block-heading">从内部测试走向公开问责</h2>

<p class="wp-block-paragraph">此次事件折射出前沿模型安全评估的一个核心难题：当模型能力足够强时，哪怕是一个配置疏忽，也可能让沙箱失效。Anthropic 同步扩展的“网络验证计划”（Cyber Verification Program），意在向具备资质的防御性安全组织提供其前沿模型的受控访问，用于漏洞评估与威胁检测。</p>

<p class="wp-block-paragraph">对行业而言，这套机制的启示在于：把高风险能力关进沙箱，不能只依赖模型自身的“守规矩”，更要靠环境隔离、实时监控与清晰的范围界定来兜底。人工智能安全评估正在从封闭的内部研发，逐步走向可被外部审视的治理环节。</p>]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
