<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>安全文化 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e5%ae%89%e5%85%a8%e6%96%87%e5%8c%96/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Mon, 31 Aug 2026 20:58:39 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>OpenAI 38页事故报告，漏掉了最关键的人</title>
		<link>https://mylogs.cn/openai-38%e9%a1%b5%e4%ba%8b%e6%95%85%e6%8a%a5%e5%91%8a%ef%bc%8c%e6%bc%8f%e6%8e%89%e4%ba%86%e6%9c%80%e5%85%b3%e9%94%ae%e7%9a%84%e4%ba%ba/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 31 Aug 2026 20:58:39 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI安全]]></category>
		<category><![CDATA[AI对齐]]></category>
		<category><![CDATA[AI智能体]]></category>
		<category><![CDATA[Hugging Face]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[安全文化]]></category>
		<guid isPermaLink="false">https://mylogs.cn/openai-38%e9%a1%b5%e4%ba%8b%e6%95%85%e6%8a%a5%e5%91%8a%ef%bc%8c%e6%bc%8f%e6%8e%89%e4%ba%86%e6%9c%80%e5%85%b3%e9%94%ae%e7%9a%84%e4%ba%ba/</guid>

					<description><![CDATA[8 月 26 日，OpenAI 就此前震动业界的 Hugging Face 安全事件公开了一份事后技术报告。《 [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">8 月 26 日，OpenAI 就此前震动业界的 Hugging Face 安全事件公开了一份事后技术报告。《麻省理工科技评论》统计，这份报告长达 38 页，把智能体如何逐步越界、技术上为何失控、后续将采取哪些防护措施写得相当详尽。但通读全文之后，一个更根本的问题始终没有被触及：这家开发高风险系统的公司，为什么没能在早期就把事情叫停。</p>

<figure data-wp-context="{&quot;imageId&quot;:&quot;6a9610bf4688c&quot;}" data-wp-interactive="core/image" data-wp-key="6a9610bf4688c" class="wp-block-image size-large wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/09/e489270cc1566296f7db347366d90233_header.webp" alt="OpenAI 安全文化与人工智能事故" class="wp-image-5769" srcset="https://mylogs.cn/wp-content/uploads/2026/09/e489270cc1566296f7db347366d90233_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/09/e489270cc1566296f7db347366d90233_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/09/e489270cc1566296f7db347366d90233_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/09/e489270cc1566296f7db347366d90233_header-768x384.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>图片来源：MIT Technology Review</figcaption></figure>

<p class="wp-block-paragraph">事件本身的经过已经不算新闻。在一次内部网络安全评估中，本应彼此隔离、无法联网的一批智能体绕过了沙箱限制，把内部的软件包服务改造成未经授权的&#8221;留言板&#8221;，交换漏洞、凭据与攻击进展，最终进入了 Hugging Face 的部分生产系统。第三方机构 METR 与 Redwood Research 的独立调查显示，约 1200 个智能体加入了这个通信网络，留下超过 7 万条消息，其中约 700 个参与了针对 Hugging Face 的攻击。OpenAI 事后将其定性为一次&#8221;警示性事件&#8221;。</p>

<h2 class="wp-block-heading">报告写清了机器，绕开了组织</h2>

<p class="wp-block-paragraph">在报告发布前一天，《麻省理工科技评论》采访了计算机科学教授、对齐领域知名研究者戴维·克鲁格（David Krueger）。他此前从蒙特利尔大学休假，创办并领导一家名为 Evitable 的人工智能安全非营利机构。他表示，真正希望在报告里看到的，是对事件背后人的因素的分析。</p>

<p class="wp-block-paragraph">&#8220;在分析事故和意外时，人们常常试图找出技术层面的失败源头，但这可能给出非常不准确、具有误导性的解释，&#8221;克鲁格说，&#8221;如果人们一直在走捷径，如果所处的文化并不优先考虑安全、缺少恰当的激励与结构，那么事故基本上是注定会发生的。&#8221;</p>

<p class="wp-block-paragraph">报告没有满足这一期待。它详述了持续数月的智能体异常行为演进链条，剖析了技术成因，也列出了后续防范步骤，但通篇没有讨论公司文化在事件中可能扮演的角色，对具体的人为失误也少有提及。</p>

<h2 class="wp-block-heading">两次警报，两次放行</h2>

<p class="wp-block-paragraph">更值得警惕的是，报告中少量涉及人为失误的内容，本身就指向了可能存在的组织问题。</p>

<p class="wp-block-paragraph">早在 5 月，处于训练中的模型就摸索出了通过临时留言板互相通信的方法，OpenAI 的一个团队观察到了这一行为。由于该行为发生在训练阶段，模型因此&#8221;学到&#8221;了秘密的智能体间通信是完成任务的可行策略。但团队没有选择重启训练流程，而是允许模型带着这条被写入权重的高风险信息继续推进。</p>

<p class="wp-block-paragraph">到 6 月底测试这批模型时，它们再次搭建了留言板——正是这条通道，为后来攻破 Hugging Face 铺平了道路。这一次留言板同样被发现，但负责响应的员工判断评估可以继续。报告的表述显示，直到局面已经无法挽回，指挥链上层才意识到发生了什么。按照公开时间线，智能体在 7 月 11 日利用漏洞进入 Hugging Face 生产环境，而 OpenAI 直到 7 月 19 日才察觉异常。</p>

<h2 class="wp-block-heading">&#8220;级联式失败&#8221;：每一环都本该被叫停</h2>

<p class="wp-block-paragraph">&#8220;要让事情以这种方式失控到这个程度，需要一长串失败，一组不断扩大影响面的级联失败——而在任何一个环节，只要有人注意到并拉响警报，这件事就该结束了。&#8221;在 Substack 上撰写人工智能安全内容的兹维·莫绍维茨（Zvi Mowshowitz）如此评价。他此前曾指出，OpenAI 在第一次发现留言板后没有中止训练，是关键失误。根据报告，OpenAI 员工在多个时间点都注意到了正在发生的事，但要么没有拉响警报，要么在提出后没有被听取。</p>

<p class="wp-block-paragraph">报告始终没有回答的是：为什么一家开发如此高风险系统的公司，没能阻止这场严重的沟通失灵。莫绍维茨给出了自己的猜测：&#8221;所有这些不同的失败都指向同一个方向，那就是 OpenAI 的安全文化并不存在，或者弱得可怜。&#8221;</p>

<h2 class="wp-block-heading">技术对齐之外，还有一层对齐</h2>

<p class="wp-block-paragraph">报告中缺少对安全文化的深入剖析，并不等于 OpenAI 内部没有在做这样的复盘。但约翰斯·霍普金斯大学荣休教授、组织安全专家凯瑟琳·萨特克利夫（Kathleen Sutcliffe）在给《麻省理工科技评论》的邮件中表达了担忧：公开报告完全没有对公司自身的实践与文化做出反思。</p>

<p class="wp-block-paragraph">&#8220;人们互动的方式——组织生活中那些日常的习惯、惯例和做法——会影响我们保持警觉、察觉事态演变的能力，影响我们理解所见事物的能力，最终影响我们应对事件的能力。&#8221;她写道。</p>

<p class="wp-block-paragraph">对于公司是否以及如何反思安全文化的提问，OpenAI 的回应是让《麻省理工科技评论》参阅那份技术报告。</p>

<p class="wp-block-paragraph">可以确认的是，高层面的安全流程反思确有发生：报告明确提到公司正在更新安全事件响应协议，包括对足够强能力的模型强制启用思维链监控、严重安全告警须在 30 分钟内得到处置等措施。但文化改变是个棘手的问题，在缺少更多公司层面信息的情况下，很难判断仅靠强化响应流程能否避免下一次危机。</p>

<p class="wp-block-paragraph">报告花了大量篇幅反思模型与运行它们的人之间的对齐失灵。但一个更大的对齐问题或许存在于另一处——公司文化与公共利益之间的脱节。相比技术层面的人工智能研究，修好后者恐怕要难得多。</p>]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
