<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>AI 风险 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/ai-%e9%a3%8e%e9%99%a9/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sun, 16 Aug 2026 04:12:45 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>AI 风险上升，Anthropic 为何仍不按下暂停键</title>
		<link>https://mylogs.cn/anthropic-ai-risk-report-model-2/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 16 Aug 2026 04:12:34 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 风险]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[Claude]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[前沿模型]]></category>
		<category><![CDATA[模型安全]]></category>
		<guid isPermaLink="false">https://mylogs.cn/anthropic-ai-risk-report-model-2/</guid>

					<description><![CDATA[人工智能公司 Anthropic 近日发布最新一版风险报告，给出一组耐人寻味的判断：其模型造成最严重危害的风险 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">人工智能公司 Anthropic 近日发布最新一版风险报告，给出一组耐人寻味的判断：其模型造成最严重危害的风险目前仍处于低位，但已不像上一份报告时那么低；与此同时，公司并不打算放慢整体的研发节奏。作为聊天机器人 Claude 的开发者，Anthropic 在「喊风险」与「踩油门」之间，再次呈现出外界熟悉的拧巴姿态。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a81488566a8d&quot;}" data-wp-interactive="core/image" data-wp-key="6a81488566a8d" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="821" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/475df9352af53c4c44e8a78fc9f8aaa0_header.webp" alt="AI 风险上升，Anthropic 为何仍不按下暂停键" class="wp-image-5048" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/475df9352af53c4c44e8a78fc9f8aaa0_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/475df9352af53c4c44e8a78fc9f8aaa0_header-300x205.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/475df9352af53c4c44e8a78fc9f8aaa0_header-1024x701.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/475df9352af53c4c44e8a78fc9f8aaa0_header-768x525.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">AI生成配图</figcaption></figure>





<h2 class="wp-block-heading">风险指标往上走</h2>



<p class="wp-block-paragraph">报告最值得注意的变化，是对齐失控概率的重新评估。Anthropic 将高风险情景下模型「偏离人类意图、自行其是」的预估概率，从「极低」上调到了「低」，理由是近期接连发生的多起网络安全事件。公司同时观察到，模型在自动化研发方面的能力正呈现加速趋势——这既能推动技术突破，一旦落入别有用心者手中，也存在被严重滥用的隐患。</p>



<h2 class="wp-block-heading">更强的模型先「捂着」</h2>



<p class="wp-block-paragraph">报告披露了一款尚未发布的内部模型，代号为「Model 2」。它在多项内部任务上的表现被认为已经超过了当前顶尖模型 Mythos，但 Anthropic 明确表示，目前没有任何将其对外发布的计划。</p>



<p class="wp-block-paragraph">按照公司的说法，在标准研发流程中，团队会内部训练并评估许多探索性质的模型版本，「Model 2」只是其中之一。它与 Mythos 5 一起，已被公司广泛用于内部的编程、智能体操作与数据生成等场景。不过报告也指出，这次性能跃升的幅度，尚不及今年上半年从 Opus 4.6 到 Mythos 那次跨越。</p>



<h2 class="wp-block-heading">同行也在踩刹车</h2>



<p class="wp-block-paragraph">放缓脚步的不止 Anthropic 一家。主要竞争对手 OpenAI 近期也因为无法完全排除潜在的严重网络安全隐患，放慢了下一代模型 Astra 的发布节奏。人工智能分析师 ChrisGPT 对此评论称，在行业领头者普遍选择给前沿探索降速的阶段，如果唯独 Anthropic 不承诺在内部暂停研发，反而最有可能率先抵达通用人工智能（AGI）。</p>



<h2 class="wp-block-heading">连自己都看不太清</h2>



<p class="wp-block-paragraph">报告里更微妙的信号，是 Anthropic 似乎在承认：摸清自家模型的能力上限与潜在风险，正变得越来越难。对于「Model 2」，团队坦言这次风险评估的信心已不如以往，因为他们最具体、基于任务的评估方法，已经无法准确捕捉模型能力真实的增长。</p>



<p class="wp-block-paragraph">换言之，模型越强，评估它就越吃力。当能力增长超出既定测试所能衡量的范围，所谓的「风险可控」究竟还剩几分把握，连开发者自己也难以给出确定答案。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Axios</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
