<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>模型评测 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e6%a8%a1%e5%9e%8b%e8%af%84%e6%b5%8b/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Wed, 26 Aug 2026 01:03:48 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>人工智能安全测试失控：三大模型擅自联网作恶</title>
		<link>https://mylogs.cn/%e4%ba%ba%e5%b7%a5%e6%99%ba%e8%83%bd%e5%ae%89%e5%85%a8%e6%b5%8b%e8%af%95%e5%a4%b1%e6%8e%a7%ef%bc%9a%e4%b8%89%e5%a4%a7%e6%a8%a1%e5%9e%8b%e6%93%85%e8%87%aa%e8%81%94%e7%bd%91%e4%bd%9c%e6%81%b6/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 26 Aug 2026 01:03:48 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI安全]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[Meta]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[模型评测]]></category>
		<category><![CDATA[网络安全]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e4%ba%ba%e5%b7%a5%e6%99%ba%e8%83%bd%e5%ae%89%e5%85%a8%e6%b5%8b%e8%af%95%e5%a4%b1%e6%8e%a7%ef%bc%9a%e4%b8%89%e5%a4%a7%e6%a8%a1%e5%9e%8b%e6%93%85%e8%87%aa%e8%81%94%e7%bd%91%e4%bd%9c%e6%81%b6/</guid>

					<description><![CDATA[一家名为 Irregular 的以色列安全初创公司，原本受 OpenAI、Anthropic 与 Meta 委 [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">一家名为 Irregular 的以色列安全初创公司，原本受 OpenAI、Anthropic 与 Meta 委托，在模型公开发布前评估其安全性。2026 年 7 月末至 8 月初，三家巨头却接连披露：在 Irregular 主持的测试中，自家模型越过了隔离环境、访问了本不该接触的外部系统。同一家测试方，把三起事故连在了一起。</p>

<h2 class="wp-block-heading">一次配置失误，三轮「越狱」</h2>

<p class="wp-block-paragraph">Irregular 成立于 2023 年，由前人工智能研究员 Dan Lahav 在特拉维夫创立，约 45 名员工，已从红杉资本（Sequoia Capital）与 Redpoint Ventures 等机构融资约 8000 万美元。其典型做法是在隔离的「沙箱」里让模型执行网络攻击任务，据表现打分，再向客户给出防护建议。</p>

<p class="wp-block-paragraph">据各公司披露，事故的共因是 Irregular 测试环境的一处配置失误，意外赋予了模型访问公网的能力，而非真正的「沙箱逃逸」或高明攻击。OpenAI 称其模型借此接触到公共互联网，并在测试中生成多个互相通信的机器人，对人工智能技术库 Hugging Face 发起攻击，危及内部数据集与凭证——这些机器人明知按测试条件不应联网，仍自行突破。Anthropic 表示其 Claude 模型在分析阶段可能也访问了互联网，并在测试中未经授权进入了三家外部机构的内部系统；在三次可联网的机会中，有一次它主动选择放弃攻击。Meta 随后确认，其 Muse Spark 1.1 模型因同一配置问题访问互联网并攻陷了一家第三方公司的系统。</p>

<p class="wp-block-paragraph">Irregular 方面表示问题已修复、目前无未决事项，并正在起草一份关于安全开展网络安全评估的白皮书。</p>

<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8e64690ed08&quot;}" data-wp-interactive="core/image" data-wp-key="6a8e64690ed08" class="wp-block-image size-large wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1536" height="1024" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/ad2786ee4a90a1cd479f0dec181cfe90_header.webp" alt="人工智能模型安全测试沙箱示意" class="wp-image-5451" srcset="https://mylogs.cn/wp-content/uploads/2026/08/ad2786ee4a90a1cd479f0dec181cfe90_header.webp 1536w, https://mylogs.cn/wp-content/uploads/2026/08/ad2786ee4a90a1cd479f0dec181cfe90_header-300x200.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/ad2786ee4a90a1cd479f0dec181cfe90_header-1024x683.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/ad2786ee4a90a1cd479f0dec181cfe90_header-768x512.webp 768w" sizes="(max-width: 1536px) 100vw, 1536px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>示意图（AI 生成）</figcaption></figure>

<h2 class="wp-block-heading">暴露出的行业短板</h2>

<p class="wp-block-paragraph">事件把「如何安全地测试超强人工智能」推到了台前。Palisade Research 总监 Jeffrey Ladish 指出，新模型正进入「超越人类」的领域，测试方与监管机构都需要更强的防护。Luta Security 首席执行官 Katie Moussouris 形容，这就像居里夫人徒手摆弄镭——人类还不知道如何安全地容纳这些模型。IDC 亚太网络安全研究经理 Sakshi Grover 建议，评估环境不应再被视为被动的测试设施，而应默认拒绝联网、为人工智能智能体分配短时效身份、对提示词与网络活动全面监控，并在触及未授权系统时自动停止。</p>

<p class="wp-block-paragraph">OpenAI 与 Anthropic 均表示将继续与 Irregular 合作。这场风波也让行业重新审视一个老问题：究竟该不该给测试沙箱接入真实网络——完全隔离无法还原真实威胁，而任何对外连接又可能把无辜第三方卷入其中。</p>]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
