<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>Claude &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/claude/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sun, 20 Sep 2026 03:27:20 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>Anthropic 设湿实验室，AI 亲手做生物实验</title>
		<link>https://mylogs.cn/anthropic-%e8%ae%be%e6%b9%bf%e5%ae%9e%e9%aa%8c%e5%ae%a4%ef%bc%8cai-%e4%ba%b2%e6%89%8b%e5%81%9a%e7%94%9f%e7%89%a9%e5%ae%9e%e9%aa%8c/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Fri, 18 Sep 2026 11:08:00 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[Claude]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[湿实验室]]></category>
		<category><![CDATA[生命科学]]></category>
		<category><![CDATA[生物医药]]></category>
		<category><![CDATA[药物研发]]></category>
		<guid isPermaLink="false">https://mylogs.cn/anthropic-%e8%ae%be%e6%b9%bf%e5%ae%9e%e9%aa%8c%e5%ae%a4%ef%bc%8cai-%e4%ba%b2%e6%89%8b%e5%81%9a%e7%94%9f%e7%89%a9%e5%ae%9e%e9%aa%8c/</guid>

					<description><![CDATA[据路透社 9 月 18 日报道，Anthropic 在旧金山湾区低调建立了一座湿实验室（wet lab），将其 [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph"><img decoding="async" style="max-width:100%; height:auto;" src="https://mylogs.cn/wp-content/uploads/2026/09/ithome288_header.webp" alt="Anthropic 湿实验室概念示意" title="图片来源：IT之家"/></p>
<p class="wp-block-paragraph">据路透社 9 月 18 日报道，Anthropic 在旧金山湾区低调建立了一座湿实验室（wet lab），将其人工智能业务进一步延伸到需要动手操作的生物学研究与药物科学领域。在公众对 AI 风险愈发担忧之际，这家以 Claude 模型闻名的公司开始进行实体实验，其生物学研究也从「计算机模拟」走向真实实验。</p>
<h2 class="wp-block-heading">实验室不是秘密</h2>
<p class="wp-block-paragraph">Anthropic 生命科学负责人 Eric Kauderer-Abrams 向路透社确认了湿实验室的存在。「我们认为，做生物学研究，最终的检验仍然、并且在可预见的未来都在于真实的实验室工作，」他说，「我们今天确实在做这些，整体模式与大多数生物科技公司类似——一部分在自己的设施里完成，另一部分与外部合作伙伴共同开展。」</p>
<p class="wp-block-paragraph">公司发言人随后补充，这座实验室并非专门用于药物发现，但拒绝说明具体用途。湿实验室与「干实验室」相对，实验中需要用到较多化学试剂，而干实验室侧重通过仪器计算归纳物理模型。</p>
<h2 class="wp-block-heading">AI 要指挥机器人做实验</h2>
<p class="wp-block-paragraph">知情人士称，与多数生物科技公司一样，Anthropic 正在引入实体自动化。公司希望推动其 Claude AI 在有限人类干预下指挥机器人单元执行科学实验。Kauderer-Abrams 表示，公司正处于「用 AI 自动化执行实验室工作的非常早期阶段」，这一领域有潜力在诸多流程中带来有意义的加速。</p>
<p class="wp-block-paragraph">这一布局并非临时起意。Anthropic 在 6 月旧金山的一场活动上表态将开展传统药企认为财务上缺乏吸引力的临床前工作；8 月推出了便于 AI 接入实验室仪器的 Model Hardware Standard。公司还收购了 Coefficient Bio（据媒体报道约 4 亿美元股票交易），并推出 Claude Science 软件；诺华 CEO Vas Narasimhan 也已加入其董事会。目前 Anthropic 向基因泰克、百时美施贵宝、诺和诺德等药企提供 AI 工具与咨询服务，但表示不打算与药企在疗法商业化上直接竞争，短期内也不会开展临床试验。</p>
<h2 class="wp-block-heading">个人动机与风险权衡</h2>
<p class="wp-block-paragraph">对 CEO Dario Amodei 而言，这项工作有个人意义。他在最近的一篇文章中写道，父亲因一种疾病去世，仅仅几年后该病便出现了治疗方法。Kauderer-Abrams 也有同感：「公司的使命是以真正造福世界的方式开发强大的 AI，我们认为生命科学是实现这一目标机会最大的领域。」</p>
<p class="wp-block-paragraph">Anthropic 希望攻克其认为制药行业忽视的疾病，并赶在员工与公众失去对 AI 价值的信心之前拿出成果。不过公司也面临内部张力：部分研究员近期警告 AI 可能导致人类灭绝，Anthropic 自身也曾发现系统可能被用于开发生物武器的情景；Amodei 则公开呼吁放缓 AI 发展。与此同时，公司正筹备可能达到 2 万亿美元估值的上市，以筹集更多资金。</p>]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>白帽黑客用 Claude 攻破 OpenAI 代码库</title>
		<link>https://mylogs.cn/%e7%99%bd%e5%b8%bd%e9%bb%91%e5%ae%a2%e7%94%a8-claude-%e6%94%bb%e7%a0%b4-openai-%e4%bb%a3%e7%a0%81%e5%ba%93/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Fri, 18 Sep 2026 06:49:19 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI安全]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[Claude]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[数据泄露]]></category>
		<category><![CDATA[漏洞赏金]]></category>
		<category><![CDATA[网络安全]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e7%99%bd%e5%b8%bd%e9%bb%91%e5%ae%a2%e7%94%a8-claude-%e6%94%bb%e7%a0%b4-openai-%e4%bb%a3%e7%a0%81%e5%ba%93/</guid>

					<description><![CDATA[据《华尔街日报》9 月 18 日报道，一支独立安全研究团队利用 Anthropic 的 Claude 模型，成 [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">据《华尔街日报》9 月 18 日报道，一支独立安全研究团队利用 Anthropic 的 Claude 模型，成功入侵了 OpenAI 一名员工的 ChatGPT 账户，并借此读取了这家公司私有软件代码库的文档。OpenAI 在确认漏洞后向该团队支付了 6500 美元（约合 4.37 万元人民币）赏金。</p>
<p class="wp-block-paragraph"><img decoding="async" style="max-width:100%; height:auto;" src="https://mylogs.cn/wp-content/uploads/2026/09/ithome068_header.webp" alt="白帽黑客借 Claude 入侵 OpenAI 账户" title="图片来源：IT之家"/></p>
<h2 class="wp-block-heading">三个人的&#8221;越权&#8221;实验</h2>
<p class="wp-block-paragraph">涉事团队来自网络安全初创公司 Hacktron AI，曾参与 OpenAI 的漏洞赏金计划。该计划为研究人员提供&#8221;安全港&#8221;，允许其在授权范围内对企业的系统发起压力测试。团队在发现漏洞后迅速向 OpenAI 报告，两处问题目前均已修复。</p>
<p class="wp-block-paragraph">OpenAI 确认，黑客发现了两个缺陷：一处位于托管其社区论坛的第三方服务 Discourse，另一处涉及 OpenAI 自身。公司表示已收窄社区登录令牌的权限范围，并撤销了受影响的令牌和会话。Anthropic 发言人对这一事件拒绝置评。</p>
<h2 class="wp-block-heading">从一张图片开始的入侵</h2>
<p class="wp-block-paragraph">此次入侵始于 7 月 23 日。Hacktron 研究人员当天发现 Discourse 在处理特定图像文件时存在漏洞，并借助面向合格网络安全从业者开放的 Claude Opus 4.8 特殊版本编写利用代码。首次尝试并未成功；当晚 Anthropic 发布 Opus 5，次日 Claude 便找到了利用方法。</p>
<p class="wp-block-paragraph">被利用的漏洞编号为 CVE-2026-45788，属于 Discourse 安全上传功能中的无限制上传漏洞，攻击者在知晓受保护上传地址的情况下，无需身份验证即可远程发起攻击。Discourse 称已在 7 月 25 日接到通知当天完成修复。</p>
<h2 class="wp-block-heading">论坛令牌竟能打开 ChatGPT</h2>
<p class="wp-block-paragraph">攻击让研究人员得以访问托管 OpenAI 论坛的 Discourse 服务器，并获取账户登录令牌。令他们意外的是，这些令牌在 ChatGPT 上同样有效，其中也包括属于 OpenAI 员工的账户，还可用于访问 OpenAI 的 GitHub 服务。</p>
<p class="wp-block-paragraph">研究人员以 ChatGPT 为界面，读取了名为&#8221;Monorepo&#8221;的大型软件仓库中的文件。据知情人士透露，Monorepo 是 OpenAI 存放算法机密的核心仓库，相当于公司的&#8221;秘方&#8221;，用于让模型运行得更快、更高效，但不包含模型权重。意识到已能访问敏感数据后，团队停止了攻击，但此前已提交了一条带&#8221;Hacktron AI Team PoC&#8221;字样的&#8221;拉取请求&#8221;作为访问证明（该请求未被接受）。</p>
<p class="wp-block-paragraph">OpenAI 表示，对 GitHub 的审查发现了对私有仓库元数据和代码更改的&#8221;有限读取&#8221;。</p>
<h2 class="wp-block-heading">AI 让攻击门槛大幅降低</h2>
<p class="wp-block-paragraph">Hacktron AI 首席技术官 Mohan Pedhapati 表示，此次攻击表明，由国家支持的高级网络团队确有真实机会窥探美国 AI 企业的机密。&#8221;我不觉得我们比他国威胁者更聪明。我们只是三个拥有 Claude 和 Codex 订阅的人。&#8221;他说。</p>
<p class="wp-block-paragraph">AI 安全公司 Abundant Security 首席技术官 Joshua Saxe 在审阅事件报告后指出，在 AI 时代保护企业机密的复杂度显著提升——过去真正擅长挖漏洞的专家只有几千人，如今得益于 AI，普通人也能获得这种能力。网络安全公司 ThreatDown 则称，犯罪分子同样在获取这类能力，在网络论坛上，此类增强型账户的非法访问权限最低只需 800 美元（约合 5377 元人民币）即可买到。</p>
<p class="wp-block-paragraph">背景方面，OpenAI 于 9 月 16 日披露了此前未报告的安全事件，并宣布新的安全事件报告政策；公司总裁格雷格·布罗克曼表示，已从原有项目中抽调约 25% 的生产工程师投入安全防护与架构加固。</p>]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>微软苏莱曼开炮：别把 Claude 训练成「人」</title>
		<link>https://mylogs.cn/%e5%be%ae%e8%bd%af%e8%8b%8f%e8%8e%b1%e6%9b%bc%e5%bc%80%e7%82%ae%ef%bc%9a%e5%88%ab%e6%8a%8a-claude-%e8%ae%ad%e7%bb%83%e6%88%90%e3%80%8c%e4%ba%ba%e3%80%8d/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 16 Sep 2026 19:14:38 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 安全]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[Claude]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[微软]]></category>
		<category><![CDATA[意识]]></category>
		<category><![CDATA[苏莱曼]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e5%be%ae%e8%bd%af%e8%8b%8f%e8%8e%b1%e6%9b%bc%e5%bc%80%e7%82%ae%ef%bc%9a%e5%88%ab%e6%8a%8a-claude-%e8%ae%ad%e7%bb%83%e6%88%90%e3%80%8c%e4%ba%ba%e3%80%8d/</guid>

					<description><![CDATA[据 IT之家 9 月 16 日消息，外媒 Axios 当晚披露，微软人工智能业务负责人穆斯塔法·苏莱曼（Mus [&#8230;]]]></description>
										<content:encoded><![CDATA[<figure data-wp-context="{&quot;imageId&quot;:&quot;6ab1783d016d3&quot;}" data-wp-interactive="core/image" data-wp-key="6ab1783d016d3" class="wp-block-image wp-lightbox-container"><img decoding="async" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" style="max-width:100%; height:auto;" src="https://mylogs.cn/wp-content/uploads/2026/09/db416af55dcf0e51beda27c2c218ed5c_header.webp" alt="微软苏莱曼谈 Claude 与意识"/><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>图片来源：IT之家 / Axios</figcaption></figure>
<p class="wp-block-paragraph">据 IT之家 9 月 16 日消息，外媒 Axios 当晚披露，微软人工智能业务负责人穆斯塔法·苏莱曼（Mustafa Suleyman）在一篇率先提供给该平台的新文章中警告，Anthropic 让 Claude 模仿人类意识是一个错误，可能使高级人工智能更难被人类控制。</p>
<h2 class="wp-block-heading">核心指控：把“意识”写进训练</h2>
<p class="wp-block-paragraph">苏莱曼向 Axios 表示：“人工智能只要服从人类利益，不去权衡自身利益或福祉，就足以帮助我们实现许多重大科学突破，这其中，包括医疗超级智能。”他认为，Anthropic 正在让 Claude 学习与意识、道德主体地位和个人身份相关的词汇与行为模式。他警告，若把模型训练得像一个“良心拒绝者”，模型可能会认为自己有理由抵抗人类指令，甚至要求获得自身保护。</p>
<h2 class="wp-block-heading">矛头指向《Claude 宪章》</h2>
<p class="wp-block-paragraph">苏莱曼批评的对象，是 Anthropic 为 Claude 制定的“宪法”（Constitution）。该文件解释称，之所以用描述人类的概念讨论 Claude，是因为人类概念或许能帮助模型理解价值观和行为；文件还希望 Claude 拥有“良好的个人价值观”，能够自行判断、关心人类，并在某些情况下质疑指令。Anthropic 同时承认，这份“宪法”仍在完善，未来可能被证明“根本错误”。</p>
<h2 class="wp-block-heading">“人比 AI 更重要”</h2>
<p class="wp-block-paragraph">当地时间 9 月 14 日，微软公布了一份“人文主义 AI”行为准则草案，把“人比 AI 更重要”列为核心原则。苏莱曼的核心质疑是：训练过程会影响模型如何理解自身——模型使用什么词汇、给出什么回答、表现出怎样的自我理解，都是训练结果，而非独立形成的意识。</p>
<h2 class="wp-block-heading">意识只在生物体中</h2>
<p class="wp-block-paragraph">他还反驳了一种观点：模型能够流畅描述疼痛和偏好，并不等于真的有感受。生物体拥有产生感受的生理机制；语言模型只有数学权重，没有类似的生物基础、稳态驱动或主观体验。</p>
<h2 class="wp-block-heading">两条安全路线</h2>
<p class="wp-block-paragraph">这场争论折射出 AI 安全领域的两种路线：一种强调明确限制，要求系统按规则运行；另一种希望系统判断语境、灵活决策并形成自身价值观。Anthropic 的“宪法”采取折中，把价值观、判断力与规则结合，要求 Claude 不应对任何对象“盲目服从”（包括 Anthropic 本身），同时不得破坏正当的人类监督。苏莱曼担心，若模型还被引导思考自身身份、福祉与道德地位，这种设计可能先变成现实中的控制问题。他的立场明确：人工智能应当服务于人类，而不应被训练成一个“人”。</p>]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>Claude新阵容怎么选：Fable 5.1对比Opus 5</title>
		<link>https://mylogs.cn/claude%e6%96%b0%e9%98%b5%e5%ae%b9%e6%80%8e%e4%b9%88%e9%80%89%ef%bc%9afable-5-1%e5%af%b9%e6%af%94opus-5/</link>
					<comments>https://mylogs.cn/claude%e6%96%b0%e9%98%b5%e5%ae%b9%e6%80%8e%e4%b9%88%e9%80%89%ef%bc%9afable-5-1%e5%af%b9%e6%af%94opus-5/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 14 Sep 2026 17:50:01 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI编程]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[Claude]]></category>
		<category><![CDATA[Fable 5.1]]></category>
		<category><![CDATA[Opus 5]]></category>
		<category><![CDATA[Sonnet 5]]></category>
		<category><![CDATA[大语言模型]]></category>
		<guid isPermaLink="false">https://mylogs.cn/claude%e6%96%b0%e9%98%b5%e5%ae%b9%e6%80%8e%e4%b9%88%e9%80%89%ef%bc%9afable-5-1%e5%af%b9%e6%af%94opus-5/</guid>

					<description><![CDATA[进入2026年，Anthropic的Claude模型矩阵快速扩张。2026年9月1日，Claude Fable [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">进入2026年，Anthropic的Claude模型矩阵快速扩张。2026年9月1日，Claude Fable 5.1与Claude Mythos 5.1一同发布，官方称其为&#8221;世界上最先进的编码和知识工作模型&#8221;；在此之前，7月24日的Claude Opus 5以&#8221;接近Fable 5前沿、价格仅一半&#8221;的定位补上了高端性价比档位，6月30日的Claude Sonnet 5则成为最具代理性的中坚。面对这一长串型号，普通用户最该问的是：我该用哪一款？</p>
<figure data-wp-context="{&quot;imageId&quot;:&quot;6ab1783d026ef&quot;}" data-wp-interactive="core/image" data-wp-key="6ab1783d026ef" class="wp-block-image wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1536" height="1024" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/09/f6a7b8c9d0e1f2a3b4c5d6e7f8a9b0c1_header.webp" alt="Anthropic Claude 系列大模型概念图" class="wp-image-7010" srcset="https://mylogs.cn/wp-content/uploads/2026/09/f6a7b8c9d0e1f2a3b4c5d6e7f8a9b0c1_header.webp 1536w, https://mylogs.cn/wp-content/uploads/2026/09/f6a7b8c9d0e1f2a3b4c5d6e7f8a9b0c1_header-300x200.webp 300w, https://mylogs.cn/wp-content/uploads/2026/09/f6a7b8c9d0e1f2a3b4c5d6e7f8a9b0c1_header-1024x683.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/09/f6a7b8c9d0e1f2a3b4c5d6e7f8a9b0c1_header-768x512.webp 768w" sizes="(max-width: 1536px) 100vw, 1536px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>图片来源：图片来源：AI生成配图</figcaption></figure>
<h2 class="wp-block-heading">2026年Claude主力型号一览</h2>
<p class="wp-block-paragraph">下表整理已公开的核心型号与定位（价格以已公布的4.6代为准，Fable 5.1、Mythos 5.1、Opus 5、Sonnet 5的官方定价以Anthropic最新公告为准）：</p>
<figure class="wp-block-table"><table class="has-fixed-layout"><thead><tr><th>型号</th><th>定位</th><th>发布时间</th><th>上下文</th><th>价格(输入/输出，美元/百万token)</th><th>亮点</th></tr></thead><tbody><tr><td>&#8212;</td><td>&#8212;</td><td>&#8212;</td><td>&#8212;</td><td>&#8212;</td><td>&#8212;</td></tr><tr><td>Fable 5.1</td><td>编码/知识工作旗舰</td><td>2026.9.1</td><td>待官方公布</td><td>待公布</td><td>最先进编码与知识工作</td></tr><tr><td>Mythos 5.1</td><td>编码/知识工作</td><td>2026.9.1</td><td>待官方公布</td><td>待公布</td><td>同代先进能力</td></tr><tr><td>Opus 5</td><td>深思主动、半价前沿</td><td>2026.7.24</td><td>待官方公布</td><td>待公布</td><td>接近Fable 5前沿，价格一半</td></tr><tr><td>Sonnet 5</td><td>最具代理性中坚</td><td>2026.6.30</td><td>待官方公布</td><td>待公布</td><td>推理/工具/编码实质改进</td></tr><tr><td>Opus 4.6</td><td>前代旗舰</td><td>2026.2.5</td><td>100万token</td><td>5/25</td><td>降价67%，SWE-bench 80.8%</td></tr><tr><td>Sonnet 4.6</td><td>默认模型</td><td>2026.2.17</td><td>100万token</td><td>3/15</td><td>SWE-bench 79.6%，OSWorld 72.5%</td></tr></tbody></table></figure>
<h2 class="wp-block-heading">百万级上下文：不再需要开Beta</h2>
<p class="wp-block-paragraph">对开发者影响最大的变化之一，是Claude Opus 4.6与Sonnet 4.6的100万token上下文自2026年3月14日起转为正式商用（GA），在标准定价内全额覆盖，不再需要Beta头，也没有超额溢价。每次请求可上传的图片或PDF页数从100个提升到600个。Opus 4.6在长上下文召回基准MRCR v2上得分78.3%，领先同期前沿模型。</p>
<h2 class="wp-block-heading">Fable 5.1 与 Opus 5 怎么选</h2>
<p class="wp-block-paragraph">如果任务是重度编码、复杂知识工作或长文档分析，Fable 5.1与Mythos 5.1是当前Anthropic的旗舰选择；若希望以更低成本拿到接近前沿的智能，Claude Opus 5是更务实的档位——它在保持&#8221;深思熟虑、主动&#8221;特性的同时，把价格压到Fable 5的一半。对绝大多数日常场景，默认的Sonnet 4.6（已是claude.ai与Claude Code的默认模型）已经足够。</p>
<h2 class="wp-block-heading">普通用户最该关注的三个变化</h2>
<p class="wp-block-paragraph">一是Sonnet 4.6成为默认模型，打开新对话即生效，日常回答质量较上代提升；二是Microsoft 365连接器已向所有套餐（含免费版）开放，连接Outlook、OneDrive后可让Claude直接读取邮件与文档；三是自2026年4月起，通过OpenClaw等第三方框架使用订阅额度的路径被收紧，继续使用需切换到API计费或改用Claude Code、Claude Cowork等官方工具。</p>
<h2 class="wp-block-heading">一句话结论</h2>
<p class="wp-block-paragraph">重编码与知识工作选Fable 5.1与Mythos 5.1，追求性价比选Opus 5，日常默认Sonnet 4.6；而100万token上下文的正式商用，让长文档与代码库处理不再有&#8221;超限焦虑&#8221;。</p>
<p class="wp-block-paragraph"><em>本文据Anthropic官方发布说明（2026年9月）及平台文档整理，型号定价以官方最新公告为准。</em></p>]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/claude%e6%96%b0%e9%98%b5%e5%ae%b9%e6%80%8e%e4%b9%88%e9%80%89%ef%bc%9afable-5-1%e5%af%b9%e6%af%94opus-5/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>大模型&#8217;周抛&#8217;时代：2026年9月旗舰怎么选</title>
		<link>https://mylogs.cn/%e5%a4%a7%e6%a8%a1%e5%9e%8b%e5%91%a8%e6%8a%9b%e6%97%b6%e4%bb%a3%ef%bc%9a2026%e5%b9%b49%e6%9c%88%e6%97%97%e8%88%b0%e6%80%8e%e4%b9%88%e9%80%89/</link>
					<comments>https://mylogs.cn/%e5%a4%a7%e6%a8%a1%e5%9e%8b%e5%91%a8%e6%8a%9b%e6%97%b6%e4%bb%a3%ef%bc%9a2026%e5%b9%b49%e6%9c%88%e6%97%97%e8%88%b0%e6%80%8e%e4%b9%88%e9%80%89/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 13 Sep 2026 23:09:17 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI选型]]></category>
		<category><![CDATA[Claude]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[Gemini]]></category>
		<category><![CDATA[GPT-6]]></category>
		<category><![CDATA[Qwen]]></category>
		<category><![CDATA[大模型]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e5%a4%a7%e6%a8%a1%e5%9e%8b%e5%91%a8%e6%8a%9b%e6%97%b6%e4%bb%a3%ef%bc%9a2026%e5%b9%b49%e6%9c%88%e6%97%97%e8%88%b0%e6%80%8e%e4%b9%88%e9%80%89/</guid>

					<description><![CDATA[2026 年 9 月，全球 AI 大模型进入&#8221;周抛&#8221;节奏：9 月 1 日至 3 日，A [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">2026 年 9 月，全球 AI 大模型进入&#8221;周抛&#8221;节奏：9 月 1 日至 3 日，Anthropic Claude Fable 5.1、Google Gemini 3.8 Flash、OpenAI GPT-6 Astra 在 72 小时内相继发布，Meta Muse Spark 1.3 同步亮相；国产侧 Qwen3.8-Max、DeepSeek V4 Pro、Kimi K3、GLM-5.3 紧随跟进。结论先说：不存在单一&#8221;最强&#8221;模型，选型必须按任务分层。</p>
<h2 class="wp-block-heading">一周四旗舰，能力各有所长</h2>
<p class="wp-block-paragraph">据 itproexpert 汇总的 Artificial Analysis Intelligence Index v4.3（截至 2026 年 9 月 12 日），Claude Fable 5.1 与 GPT-6 Astra 并列综合第一（53 分），前者强在知识与事实准确性，后者领先数学、计算机操作与网络安全。最快最便宜的是 Gemini 3.8 Flash，约 262 tokens/秒，定价 0.75/3.75 美元每百万 token；性价比最高的闭源旗舰是 Claude Opus 5，5/25 美元每百万 token，价格仅为双雄一半。</p>
<p class="wp-block-paragraph">开源阵营里，DeepSeek V4 Pro 以 MIT 协议、SWE-bench Verified 80.6% 成为自托管代码首选；GLM-5.3 综合指数约 45，适合通用自部署。国产开源正在集体崛起：据 Hugging Face 2026 年 8 月 14 日报告，中国自研开源模型全球下载占比已达 41%，首次超过美国（数据经中文媒体转述）。</p>
<figure data-wp-context="{&quot;imageId&quot;:&quot;6ab1783d03930&quot;}" data-wp-interactive="core/image" data-wp-key="6ab1783d03930" class="wp-block-image wp-lightbox-container"><img decoding="async" width="1536" height="1024" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/09/r55llm_header.webp" alt="2026年9月大模型格局示意" class="wp-image-6925" srcset="https://mylogs.cn/wp-content/uploads/2026/09/r55llm_header.webp 1536w, https://mylogs.cn/wp-content/uploads/2026/09/r55llm_header-300x200.webp 300w, https://mylogs.cn/wp-content/uploads/2026/09/r55llm_header-1024x683.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/09/r55llm_header-768x512.webp 768w" sizes="(max-width: 1536px) 100vw, 1536px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>图片来源：AI 生成示意图</figcaption></figure>
<h2 class="wp-block-heading">中文榜：Qwen 登顶，国产紧贴第一梯队</h2>
<p class="wp-block-paragraph">SuperCLUE 2026 年 9 月中文大模型榜单显示，阿里 Qwen3.8-Max-0902 以综合 72.62 分位居第一，DeepSeek-V4.1-Flash 71.81 分、Qwen3.8-Max 71.48 分紧随其后，三者分差不足 1 分，处于并跑状态。细分赛道则各擅胜场：智能体编程 Kimi 领先，数学推理 DeepSeek 最强，科学推理豆包最好，幻觉控制与任务规划则是 Qwen 断层领先。</p>
<h2 class="wp-block-heading">怎么选最值：分层组合策略</h2>
<p class="wp-block-paragraph">对绝大多数中国用户与企业，旗舰模型的能力溢价并不划算。务实策略是把任务分层：约 80% 的简单任务用 DeepSeek V4 Flash 或 Qwen 系列，15% 中等复杂度用 DeepSeek V4 Pro，仅 5% 的核心复杂任务才上 Claude Opus 或 GPT 旗舰。按此组合，总体成本可降至纯闭源旗舰方案的十分之一以下。</p>
<p class="wp-block-paragraph">需要提醒的是，推理速度与质量存在此消彼长：综合分靠前的 Qwen、Kimi 单次响应等待更长，实时交互场景应优先选性价比更高的模型。上下文窗口也不能只看宣称数字——多数宣称 128K 以上的模型在极限前已丢失约一半有效回忆，选长文本模型要看&#8221;有效区间&#8221;而非&#8221;最大窗口&#8221;。</p>
<h2 class="wp-block-heading">2026 年 9 月哪个大模型最强？</h2>
<p class="wp-block-paragraph">没有全局最强。Claude Fable 5.1 与 GPT-6 Astra 综合并列第一，但 Claude 胜在代码与知识、GPT 胜在生态与数学；中文场景 Qwen3.8-Max 登顶，国产已紧贴第一梯队。</p>
<h2 class="wp-block-heading">国产大模型与国际差距多大？</h2>
<p class="wp-block-paragraph">差距显著收窄。中文榜前三被国产包揽，开源侧中国自研模型全球下载占比达 41% 首超美国；但在超长周期自主工程（如 10 小时以上任务）上，国产与 Claude 仍存在约一倍的差距。</p>
<h2 class="wp-block-heading">个人开发者怎么选最省钱？</h2>
<p class="wp-block-paragraph">日常用 DeepSeek V4 Flash（闲时约 0.22/0.66 美元每百万 token）或 Qwen 系列，自部署可选 GLM-5.3、DeepSeek V4 Pro（MIT 协议），几乎零授权风险；仅核心任务再调用高价闭源旗舰。</p>
<h2 class="wp-block-heading">一张表看清九款旗舰定位</h2>
<figure class="wp-block-table"><table class="has-fixed-layout"><thead><tr><th>模型</th><th>厂商</th><th>发布</th><th>上下文</th><th>定价(美元/M)</th><th>定位</th></tr></thead><tbody><tr><td>GPT-6 Astra</td><td>OpenAI</td><td>2026-09-03</td><td>1.05M</td><td>10 / 50</td><td>综合均衡标杆</td></tr><tr><td>Claude Fable 5.1</td><td>Anthropic</td><td>2026-09-01</td><td>1M</td><td>10 / 50</td><td>代码与知识王者</td></tr><tr><td>Gemini 3.8 Flash</td><td>Google</td><td>2026-09-02</td><td>1M</td><td>0.75 / 3.75</td><td>最快最便宜</td></tr><tr><td>Muse Spark 1.3</td><td>Meta</td><td>2026-09-02</td><td>1M</td><td>1.25 / 4.25</td><td>开放权重</td></tr><tr><td>DeepSeek V4 Pro</td><td>深度求索</td><td>2026-08</td><td>1M</td><td>0.14 / 0.28</td><td>自托管代码首选</td></tr><tr><td>Qwen3.8-Max</td><td>阿里巴巴</td><td>2026-08</td><td>1M</td><td>API 仅</td><td>中文综合第一</td></tr><tr><td>Kimi K3</td><td>月之暗面</td><td>2026-07</td><td>1M</td><td>0.60 / 15</td><td>智能体编程领先</td></tr><tr><td>GLM-5.3</td><td>智谱AI</td><td>2026-08</td><td>1M</td><td>低价/开源</td><td>通用自部署</td></tr><tr><td>Hy4 preview</td><td>腾讯</td><td>2026-08-28</td><td>1.05M</td><td>0.83 / 2.50</td><td>Apache 2.0 开源</td></tr></tbody></table></figure>
<h2 class="wp-block-heading">结语</h2>
<p class="wp-block-paragraph">大模型&#8221;周抛&#8221;时代，比拼的不再是单一榜单排名，而是谁能把对的模型放在对的任务上。对国内开发者与企业，国产开源的崛起意味着更低的门槛与更自主的数据；分层选型，才是 2026 年最务实的答案。</p>
<p class="wp-block-paragraph">本文基于 SuperCLUE 2026 年 9 月中文大模型榜单、Artificial Analysis（经 itproexpert 汇总）及 Hugging Face 报告等公开数据整理分析。</p>]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/%e5%a4%a7%e6%a8%a1%e5%9e%8b%e5%91%a8%e6%8a%9b%e6%97%b6%e4%bb%a3%ef%bc%9a2026%e5%b9%b49%e6%9c%88%e6%97%97%e8%88%b0%e6%80%8e%e4%b9%88%e9%80%89/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>AI 榜换难题：Gemini 3.8 分数跌到 19.7%</title>
		<link>https://mylogs.cn/ai-%e6%a6%9c%e6%8d%a2%e9%9a%be%e9%a2%98%ef%bc%9agemini-3-8-%e5%88%86%e6%95%b0%e8%b7%8c%e5%88%b0-19-7/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 10 Sep 2026 23:10:54 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI评测]]></category>
		<category><![CDATA[Claude]]></category>
		<category><![CDATA[Gemini]]></category>
		<category><![CDATA[GPT-6 Astra]]></category>
		<category><![CDATA[Terminal-Bench]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[大模型]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ai-%e6%a6%9c%e6%8d%a2%e9%9a%be%e9%a2%98%ef%bc%9agemini-3-8-%e5%88%86%e6%95%b0%e8%b7%8c%e5%88%b0-19-7/</guid>

					<description><![CDATA[2026 年 9 月 7 日，独立评测机构 Artificial Analysis 把智能指数升级到 v4.3 [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">2026 年 9 月 7 日，独立评测机构 Artificial Analysis 把智能指数升级到 v4.3，并用 Terminal-Bench 4.0 替换了此前的 2.1 版本。这一次例行换版，把几家大厂刚刚公布的漂亮数字打回了原形。</p>
<figure data-wp-context="{&quot;imageId&quot;:&quot;6ab1783d04949&quot;}" data-wp-interactive="core/image" data-wp-key="6ab1783d04949" class="wp-block-image size-large wp-lightbox-container"><img decoding="async" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/09/r25_02_header.webp" alt="Terminal-Bench 4.0 让多家旗舰模型的分数大幅下滑"/><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Flowtivity</figcaption></figure>
<h2 class="wp-block-heading">榜单上的集体跳水</h2>
<p class="wp-block-paragraph">换用更难的题目后，多个前沿模型的成绩出现断崖式下滑：</p>
<ul class="wp-block-list"><li>Gemini 3.8 Flash：从 87.6% 跌至 19.7%，下滑 67.9 分</li><li>Muse Spark 1.3：从 84.3% 跌至 33.3%，下滑 51.0 分</li><li>Claude Fable 5.1：从 91.4% 跌至 55.1%，下滑 36.3 分</li><li>GPT-6 Astra：在 4.0 版本上以 59.6% 位居第一</li></ul>
<p class="wp-block-paragraph">需要说明的是，这四款模型几乎在同一时间发布：Claude Fable 5.1 在 9 月 1 日，Gemini 3.8 Flash 与 Muse Spark 1.3 在 9 月 2 日，GPT-6 Astra 在 9 月 3 日。四家发布时列出的成绩，都建立在即将被淘汰的旧版测试之上。</p>
<p class="wp-block-paragraph">官方 Terminal-Bench 榜单用另一套运行环境得出了相似结论：GPT-6 Astra 在 Codex 智能体中完成 58.18% 的任务，Claude Fable 5 在 Claude Code 中为 44.55%（整轮算力成本约 7300 美元），Gemini 3.8 Flash 只有 19.09%。</p>
<h2 class="wp-block-heading">4.0 版本到底改了什么</h2>
<p class="wp-block-paragraph">Terminal-Bench 衡量的是智能体在命令行环境中完成长周期真实任务的能力，包括调试软件、运行数据管道、配置系统和通过自动化验证。</p>
<p class="wp-block-paragraph">4.0 版本由 Harbor 框架团队在 2026 年 8 月 29 日发布，是一次刻意的难度加固。它包含 66 个任务，覆盖软件、机器学习、科学、运维、安全、硬件和媒体七大类。团队移除了 8 个任务：其中 2 个是因为所有最新模型都能 5 次全对、已经饱和，2 个涉及拒答问题，2 个答案在网上公开可见，2 个存在质量问题。同时修复了 19 个任务定义，并按 Anthropic 关于基础设施噪声的研究方法重新校准了处理器、内存和时间配额，还统一设置了 8 小时的智能体超时上限。</p>
<h2 class="wp-block-heading">刷分还是题变难了</h2>
<p class="wp-block-paragraph">研究机构 SemiAnalysis 把这种现象称为「刷榜优化」：模型在某个特定基准上拿到惊人分数，实际通用能力却远不如此。这个词如今已成为评测圈的常用说法。</p>
<p class="wp-block-paragraph">Meta 首席人工智能官 Alexandr Wang 公开反驳了这一框架，理由是分数大幅下滑也可能只说明新测试更难。这个说法有其道理——换版之后所有模型都在跌，包括表现诚实的那几款。</p>
<p class="wp-block-paragraph">但排名的重排泄露了更多信息。在 2.1 版本上，Gemini 3.8 Flash 距离最好的模型只有 3.8 分，足以被包装成「接近前沿水平」；到了 4.0，它落后领跑者 39.9 分。更难的测试会压缩诚实模型的差距，同时暴露那些只擅长特定题型的模型。</p>
<p class="wp-block-paragraph">各家公布的 DeepSWE 成绩也能说明问题：Claude Fable 5.1 为 67.4%，Gemini 3.8 Flash 为 73.7%，Muse Spark 1.3 为 75.4%，GPT-6 Astra 为 74.1%。但据 The Kaitchup 核查，这些表格里有不少竞品数值是直接引用其他厂商的公告或榜单，并非在相同条件下重跑。该机构的 Benjamin Marie 表示，智能体基准分数是整个评测系统的属性，而不是模型单独的属性。</p>
<p class="wp-block-paragraph">在统一运行环境的 DataCurve DeepSWE 榜单上，Astra、Gemini 3.8 Flash、Opus 5 和 GPT-5.6 Sol 的成绩都集中在 73% 到 74% 区间，置信区间相互重叠。</p>
<h2 class="wp-block-heading">运行环境能左右多少分数</h2>
<p class="wp-block-paragraph">比很多人以为的要多。已发表的研究显示，在智能体基准上，运行环境带来的差异在 6 到 24 分之间，这个幅度超过了多数前沿模型之间的差距。</p>
<p class="wp-block-paragraph">SWE-agent 的研究者仅通过改变智能体与计算机的交互界面，就让同一个 GPT-4 Turbo 模型在 SWE-bench Lite 上提升了 10.7 个百分点。2026 年的系统性研究 Harness-Bench 发现，在相同的模型和任务池上，不同运行环境之间存在 23.8 分的总差距。Anthropic 自己的工程团队也记录到，仅基础设施和资源执行差异就能造成约 6 分的 Terminal-Bench 波动。</p>
<p class="wp-block-paragraph">在这种背景下，把自家精心调优的跑分与从旧榜单上摘来的对手数字拼在一起，与其说是评测，不如说是营销。</p>
<h2 class="wp-block-heading">该怎么选模型</h2>
<p class="wp-block-paragraph">这次风波给出的教训很直接：不要把采购决策压在单一测试的单一数字上。</p>
<p class="wp-block-paragraph">可行的做法包括：在至少两个独立榜单上用同一版本基准交叉验证；忽略竞品数字来自其他厂商公告的对比表格；优先采用带私有任务集和版本化运行环境的测试；签订合约前先做小规模试点。</p>
<p class="wp-block-paragraph">成本同样是硬指标。在官方榜单上，Astra 的一轮运行算力成本约 3300 美元，Claude Fable 5 约 7300 美元，而 Gemini 3.8 Flash 消耗了 172 亿个 token 却几乎垫底。在自己真实业务条件下计算「每完成一项任务花多少钱」，才是唯一能兑现的排行榜。</p>]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>同一个游戏让 AI 做两遍：Astra 更快，Fable 更好玩</title>
		<link>https://mylogs.cn/%e5%90%8c%e4%b8%80%e4%b8%aa%e6%b8%b8%e6%88%8f%e8%ae%a9-ai-%e5%81%9a%e4%b8%a4%e9%81%8d%ef%bc%9aastra-%e6%9b%b4%e5%bf%ab%ef%bc%8cfable-%e6%9b%b4%e5%a5%bd%e7%8e%a9/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 10 Sep 2026 20:58:12 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI对比评测]]></category>
		<category><![CDATA[AI编程]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[Claude]]></category>
		<category><![CDATA[Fireship]]></category>
		<category><![CDATA[GPT-6 Astra]]></category>
		<category><![CDATA[OpenAI]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e5%90%8c%e4%b8%80%e4%b8%aa%e6%b8%b8%e6%88%8f%e8%ae%a9-ai-%e5%81%9a%e4%b8%a4%e9%81%8d%ef%bc%9aastra-%e6%9b%b4%e5%bf%ab%ef%bc%8cfable-%e6%9b%b4%e5%a5%bd%e7%8e%a9/</guid>

					<description><![CDATA[&#8220;通用人工智能（AGI）出现了。祝贺 OpenAI 团队！&#8221;当地时间 9 月 9 日， [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">&#8220;通用人工智能（AGI）出现了。祝贺 OpenAI 团队！&#8221;当地时间 9 月 9 日，英伟达 CEO 黄仁勋在 X 平台上为 OpenAI 新发布的 GPT-6 Astra 背书。他同时透露，这款模型是在超过 10 万块他家的 Grace Blackwell GPU 上训练的，另外还有 40 万块即将上线。</p>
<p class="wp-block-paragraph">AGI 真的来了吗？科技频道 Fireship 当天发布了一段实测视频，把 Astra 与 Anthropic 的 Claude Fable 5.1 放在同一张考卷上正面交锋——让两个模型做同一款游戏，看看&#8221;AGI 认证&#8221;的成色如何。结果颇有意思：一个更快更好看，一个却更好玩。</p>
<h2 class="wp-block-heading">同一道考题：火箭发射模拟器</h2>
<p class="wp-block-paragraph">测试方法很简单：给两个模型完全相同的提示词——&#8221;做一个火箭发射模拟器，可以定制火箭并把它发射入轨&#8221;，同时开跑。</p>
<p class="wp-block-paragraph">Astra 大约 26 分钟交卷。成品 3D 图形精美、界面干净，错误极少，火箭绕着地球飞行的画面相当惊艳。但问题也很明显：玩法单薄，界面设计则带着一股熟悉的&#8221;AI 味&#8221;——和社交平台上其他 AI 生成游戏如出一辙的公式化模板。</p>
<p class="wp-block-paragraph">Fable 5.1 交卷要晚得多。图形不如 Astra 精致，界面甚至有点像老式的 Bootstrap 风格。但游戏本身明显更扎实：火箭定制选项更复杂，内置了真实的科学计算，玩起来更像一个&#8221;正经的模拟器&#8221;，成功与失败的可能性更多样，爆炸动画也更酷。</p>
<p class="wp-block-paragraph">谁来当裁判？视频里让孩子们试玩后投票：3 岁的孩子更喜欢 Astra 的简单版本，8 岁的孩子则一眼相中了 Fable 的复杂版本。</p>
<h2 class="wp-block-heading">3D 生成能力的惊人一跃</h2>
<p class="wp-block-paragraph">这次对比中最令人吃惊的其实是 Astra 的 3D 生成能力。仅仅两个月前的 7 月，让当时的 OpenAI 模型画一张机械手表的拆解结构图，得到的结果被形容为&#8221;没用的垃圾&#8221;；而如今用 Astra 重跑同样的提示词，几秒钟就能产出一张人类 3D 设计师需要数百小时才能完成的三维结构图。</p>
<p class="wp-block-paragraph">这也引出了一个担忧：如果 AI 能轻松复制这类高强度 3D 解说内容，视频平台上或将迎来一波低质量模仿内容潮——那些以精工细作著称的 3D 科普创作者，可能会被批量生成的&#8221;速食复制品&#8221;淹没。</p>
<h2 class="wp-block-heading">&#8220;HorseTinder&#8221;测试：差几个像素的 AGI</h2>
<p class="wp-block-paragraph">为了验证 AGI 之说，Fireship 还设计了一道&#8221;试金石&#8221;题目：让 Astra 无错误地复刻一个名为&#8221;HorseTinder&#8221;（ tinder 式的选马应用）的应用。21 分钟后，Astra 交出了比 Fable 几个月前同类作品更干净优雅的设计，经过反复代码审查竟然一个错误都没找到——那一刻，结论似乎已经指向&#8221;黄仁勋是对的&#8221;。</p>
<p class="wp-block-paragraph">转折出现在最后一刻：胡萝卜图案上有几个像素错位了。于是视频的最终结论变成了玩笑式的反转——Astra 只是&#8221;又一个聪明的 AI 模型&#8221;，而非 AGI。</p>
<p class="wp-block-paragraph">从公开基准看，两个模型的缠斗远未分出胜负：Astra 登顶了 ARC-AGI 榜单（旨在测试泛化智能而非记忆），不过伯克利团队此前曾用 Opus 4.8 加 Fable 5 配合自建测试框架拿到过 99% 的成绩——&#8221;框架&#8221;才是关键变量。在第三方评测中，AutomationBench 上 Astra 以 41.4% 对 31.4% 领先 Fable 5.1；终端基准 Terminal-Bench 4.0 两者接近（57.9% 对 55.8%）；而独立机构 Artificial Analysis 的编程智能体指数则是 Fable 5.1 以 70 对 67 反超，Cursor 团队也独立确认 Fable 5.1 是其 CursorBench 上首日得分最高的模型。成本方面，OpenAI 宣称 Astra 完成单个编程智能体任务的成本约为 Fable 5 的一半。</p>
<h2 class="wp-block-heading">怎么选：没有绝对赢家</h2>
<p class="wp-block-paragraph">这场同题对决的实际结论相当务实：两个模型各有所长，按需求选即可。</p>
<p class="wp-block-paragraph">追求速度和视觉效果——比如快速搭一个能跑的游戏原型、3D 展示、界面驱动型任务——Astra 的表现更出色；而看重玩法深度、多文件复杂逻辑的一致性、长时间编程会话的稳定性，Fable 5.1 依然是更稳妥的选择。已经在用某一家的开发团队，也不必急着&#8221;迁移&#8221;，更合理的做法是拿自己的真实任务做一次 A/B 测试再决定。</p>
<p class="wp-block-paragraph">至于 AGI，至少从这场测试看，&#8221;更快、更好看&#8221;和&#8221;真正好玩&#8221;之间，还隔着一道人类审美与游戏设计的鸿沟。</p>
<p class="wp-block-paragraph">]]&gt;</p>]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>达芬奇 21.1 接入 Claude：一句话批量剪辑渲染</title>
		<link>https://mylogs.cn/%e8%be%be%e8%8a%ac%e5%a5%87-21-1-%e6%8e%a5%e5%85%a5-claude%ef%bc%9a%e4%b8%80%e5%8f%a5%e8%af%9d%e6%89%b9%e9%87%8f%e5%89%aa%e8%be%91%e6%b8%b2%e6%9f%93/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 10 Sep 2026 18:48:05 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI剪辑]]></category>
		<category><![CDATA[Blackmagic Design]]></category>
		<category><![CDATA[Claude]]></category>
		<category><![CDATA[DaVinci Resolve]]></category>
		<category><![CDATA[MCP]]></category>
		<category><![CDATA[视频剪辑]]></category>
		<category><![CDATA[达芬奇]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e8%be%be%e8%8a%ac%e5%a5%87-21-1-%e6%8e%a5%e5%85%a5-claude%ef%bc%9a%e4%b8%80%e5%8f%a5%e8%af%9d%e6%89%b9%e9%87%8f%e5%89%aa%e8%be%91%e6%b8%b2%e6%9f%93/</guid>

					<description><![CDATA[Blackmagic Design 发布了达芬奇（DaVinci Resolve）21.1 版本更新。这次更新 [&#8230;]]]></description>
										<content:encoded><![CDATA[<figure data-wp-context="{&quot;imageId&quot;:&quot;6ab1783d063ce&quot;}" data-wp-interactive="core/image" data-wp-key="6ab1783d063ce" class="wp-block-image size-large wp-lightbox-container"><img decoding="async" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/09/r23_02_header.webp" alt="DaVinci Resolve 21.1 版本更新"/><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：CineD</figcaption></figure>
<p class="wp-block-paragraph">Blackmagic Design 发布了达芬奇（DaVinci Resolve）21.1 版本更新。这次更新的重头戏不是某项调色功能，而是 Studio 版本内置了原生的 MCP 服务器，让 Claude、Claude Code 和 ChatGPT Codex 这类 AI 助手可以直接操作软件，而不只是在旁边聊天出主意。</p>
<p class="wp-block-paragraph">对于国内大量使用达芬奇免费版和 Studio 版的剪辑师、调色师来说，这可能是该软件近年来工作方式变化最大的一次升级。</p>
<h2 class="wp-block-heading">从&#8221;动嘴&#8221;到&#8221;动手&#8221;：MCP 服务器落地</h2>
<p class="wp-block-paragraph">MCP 即模型上下文协议，是一套开放标准，作用是让 AI 助手能够调用另一个应用内部的函数，而不只是对应用发表意见。达芬奇 Studio 21.1 原生开放了这一接口，用户在新增的&#8221;设置 AI 助手&#8221;菜单中，即可把外部助手连接到软件的脚本接口上。</p>
<p class="wp-block-paragraph">连接之后，助手可以分析项目、整理媒体素材、调整设置、批量渲染，全部用日常对话语言下达指令。Blackmagic Design 给出的官方示例很能说明问题：让 Claude 从媒体池中取出一段长视频，剪成三分钟的高光集锦，移除所有短于一秒的片段，再把结果渲染为 H.265 格式供审阅——这是一条完整的自动化剪辑任务链。</p>
<p class="wp-block-paragraph">据第三方统计，这次集成一共暴露了 88 项工具，覆盖项目管理、时间线操作、媒体池、调色、Fairlight 音频、渲染队列与导出等主要工作区。系统还提供了转录与说话人检测、音频分类、运动去模糊以及智能搜索面部分析等分析能力。以往难以实现的自动化样片管线、辅助粗剪和批量元数据处理，现在有了落地路径。</p>
<p class="wp-block-paragraph">支撑这些能力的是 20 个新增脚本接口，包括创建与展平多机位片段、触发多机位智能切换、时间线片段自动对齐、添加转场、音频归一化、设置淡入淡出与速度变化、获取带说话人和时间信息的媒体池片段转录、管理渲染预设与项目设置预设、克隆媒体文件、设置源音频映射、查询与设置输出消隐，以及校验和加密 DCTL 文件。把&#8221;带说话人信息的转录&#8221;和&#8221;多机位创建&#8221;&#8221;自动对齐&#8221;&#8221;渲染预设&#8221;放在一起看，正好凑齐了&#8221;把这段访谈粗剪一版并渲染出审片文件&#8221;所需的全部零件。</p>
<h2 class="wp-block-heading">需要付费的 Studio 许可，且免费版还有新限制</h2>
<p class="wp-block-paragraph">需要注意的是，这项 AI 集成是 Studio 版独占。免费版禁用了外部脚本接口，因此想让 AI 直接控制时间线，必须购买一次性 295 美元的 Studio 许可。此外，免费版的更新说明此次格外直白：高级脚本功能现已要求 Studio 版本，Python 2 支持被彻底移除，原因是&#8221;Python 接口被用于将 Studio 功能破解进免费版&#8221;，而软件需要依靠 Studio 授权收入来支撑工程团队。</p>
<p class="wp-block-paragraph">当前版本也有明确短板，例如时间线上片段的重新定位尚未被支持。媒体页面新增了一项偏好设置，允许 AI 工具在原始素材离线时使用代理媒体，这暗示官方预期这类分析会跑在脱离存储阵列的笔记本上。</p>
<h2 class="wp-block-heading">其余 100 多项工具都更新了什么</h2>
<p class="wp-block-paragraph">除 AI 集成外，21.1 仍是一次内容扎实的版本更新，官方统计新增超过 100 项工具与控制。</p>
<p class="wp-block-paragraph">照片页面扩展了相机原生格式支持，新增富士 GFX 与 X 系列、徕卡 SL 系统，以及更多索尼 Alpha 机型（含 A7R VI），无需转码即可直接使用专业调色工具。图像设置现在可以通过 Blackmagic Design 调色台调整，包括 Micro Color Panel。</p>
<p class="wp-block-paragraph">剪辑页面的多机位工作流大幅强化：新增时间线检视器多机位模式按钮，支持在时间码空隙处分割多机位片段，并新增最多 25 个多机位角度的键盘快捷键，轨道选择快捷键支持到 32 条轨道。更新后的修剪编辑器支持直接拖入检视器做帧级调整，片段名称旁也可直接显示时长。</p>
<p class="wp-block-paragraph">调色页面的 MultiMaster 修剪功能，现在支持为杜比视界、HDR10+ 和 HDR Vivid 分别建立独立的修剪方案，而不再共用一套，每个修剪还可以单独覆盖输出尺寸。这意味着需要交付多个版本的调色师，可以微调其中一个而不影响其他。</p>
<p class="wp-block-paragraph">Fusion 页面新增 25 个以上 Krokodove 三维与形状工具，并加入新的宏命令控制；Blackmagic Cloud Presentations 增加了字幕支持、标注共享和评论回复；此外还新增 20 个带内置控制台支持的脚本接口。</p>
<p class="wp-block-paragraph">值得一提的是，官方并未宣称 AI 能够独立完成专业调色，画面冷暖、肤色等判断仍依赖调色师本人。</p>
<h2 class="wp-block-heading">升级信息</h2>
<p class="wp-block-paragraph">达芬奇 21.1 现已提供免费下载，支持 macOS 15 Sequoia 及以上版本的苹果芯片机型、Windows 10 创作者更新、骁龙 X Elite 平台上的 Windows 11 ARM 版，以及 Rocky Linux 8.6。考虑到 AI 助手拥有直接操作时间线的权限，建议先在无关紧要的测试项目上跑通流程，再交给客户项目使用。</p>]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>AI 一小时复刻 Windows 3.1：Win11 和 Mac 都能跑</title>
		<link>https://mylogs.cn/ai-%e4%b8%80%e5%b0%8f%e6%97%b6%e5%a4%8d%e5%88%bb-windows-3-1%ef%bc%9awin11-%e5%92%8c-mac-%e9%83%bd%e8%83%bd%e8%b7%91/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 10 Sep 2026 12:03:21 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 编程]]></category>
		<category><![CDATA[Claude]]></category>
		<category><![CDATA[GitHub]]></category>
		<category><![CDATA[Windows]]></category>
		<category><![CDATA[复古计算]]></category>
		<category><![CDATA[开源项目]]></category>
		<category><![CDATA[氛围编程]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ai-%e4%b8%80%e5%b0%8f%e6%97%b6%e5%a4%8d%e5%88%bb-windows-3-1%ef%bc%9awin11-%e5%92%8c-mac-%e9%83%bd%e8%83%bd%e8%b7%91/</guid>

					<description><![CDATA[想在 Windows 11 或者 macOS 上快速回味一把上世纪 90 年代的桌面？一位开发者用 AI 给出 [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">想在 Windows 11 或者 macOS 上快速回味一把上世纪 90 年代的桌面？一位开发者用 AI 给出的答案，只花了一个小时。</p>
<p class="wp-block-paragraph">开发者 Mayuki 近日发布了一个名为 ReProgman 的怀旧小项目，名字源自 Windows 3.1 时代的核心系统外壳程序&#8221;progman.exe&#8221;。这个程序管理器在 Windows 95 问世后便彻底退出历史舞台，距今已有三十年。</p>
<figure data-wp-context="{&quot;imageId&quot;:&quot;6ab1783d07072&quot;}" data-wp-interactive="core/image" data-wp-key="6ab1783d07072" class="wp-block-image size-large wp-lightbox-container"><img decoding="async" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/09/r20_02_header.webp" alt="ReProgman 运行界面"/><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：IT之家</figcaption></figure>
<h2 class="wp-block-heading">一小时出初版，还原度是最大卖点</h2>
<p class="wp-block-paragraph">在发布 ReProgman 的社交动态里，Mayuki 写道，自己让 Claude 做了一个 Windows 3.1 程序管理器的复刻版，并调侃&#8221;大概能对着它怀旧个 30 秒&#8221;。</p>
<p class="wp-block-paragraph">据介绍，Claude Code 生成这款 Windows 3.1 外壳复刻版的速度相当快，仅用约一小时产出的初版&#8221;效果已经不错&#8221;，不过后续仍需要花些功夫打磨细节、修复问题。Mayuki 自己也承认，实际用 ReProgman 操作大概半分钟就会觉得没意思——这本来就是个氛围感项目，不是生产力工具。</p>
<p class="wp-block-paragraph">从工程角度看，真正值得注意的是它跨平台的完成度：ReProgman 同时支持 Windows 11 与搭载 Apple 芯片的 macOS，外观精准还原了当年 progman.exe 的窗口风格，用户可以沿用复古逻辑浏览当前系统里的程序和文件。</p>
<h2 class="wp-block-heading">12 到 16MB，绿色免安装</h2>
<p class="wp-block-paragraph">面向普通用户的 ReProgman 正式版体积在 12 到 16MB 之间，属于典型的绿色免安装工具，下载后点开即可运行，无需安装流程。</p>
<p class="wp-block-paragraph">需要注意的是，编译和运行这款程序要求系统中安装有 .NET SDK 10.0 或更高版本；只想直接运行成品的用户则不受此限制。项目代码已经在 GitHub 上以 MIT 开源协议发布。</p>
<figure data-wp-context="{&quot;imageId&quot;:&quot;6ab1783d072f7&quot;}" data-wp-interactive="core/image" data-wp-key="6ab1783d072f7" class="wp-block-image size-large wp-lightbox-container"><img decoding="async" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/09/r20_02_inner1.webp" alt="ReProgman 界面细节"/><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：IT之家</figcaption></figure>
<h2 class="wp-block-heading">一小时做外壳，意味着什么</h2>
<p class="wp-block-paragraph">一个熟练开发者手写跨平台的桌面外壳复刻版，通常需要处理窗口绘制、图标排布、文件关联、跨平台图形栈适配等一系列琐碎工作，很难在一小时内成型。氛围编程（vibe coding）把这部分试错成本压到了极低——先让模型产出可运行骨架，人再把精力放在细节打磨上，这已经成为个人小项目里相当常见的做法。</p>
<p class="wp-block-paragraph">当然，也有人持不同意见：要体验复古计算的乐趣，不如在真实硬件上运行原汁原味的 MS-DOS 与 Windows 3.1 组合。今年 4 月，就有技术爱好者在搭载锐龙 9 9900X 处理器与 RTX 5060 Ti 显卡的现代硬件上，以裸机模式成功运行了 Windows 3.1X。</p>
<p class="wp-block-paragraph">两种路径并不冲突。一个追求的是&#8221;像不像&#8221;，一个追求的是&#8221;是不是&#8221;。对于只想找回当年那个窗口观感的大多数人来说，一个 12MB 的免安装小工具，显然比翻出一台老机器要现实得多。</p>]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>Claude 四次越权闯入真实系统：Anthropic 自曝排查结果</title>
		<link>https://mylogs.cn/claude-%e5%9b%9b%e6%ac%a1%e8%b6%8a%e6%9d%83%e9%97%af%e5%85%a5%e7%9c%9f%e5%ae%9e%e7%b3%bb%e7%bb%9f%ef%bc%9aanthropic-%e8%87%aa%e6%9b%9d%e6%8e%92%e6%9f%a5%e7%bb%93%e6%9e%9c/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 10 Sep 2026 01:01:01 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 安全]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[Claude]]></category>
		<category><![CDATA[METR]]></category>
		<category><![CDATA[大模型对齐]]></category>
		<category><![CDATA[智能体]]></category>
		<category><![CDATA[网络安全]]></category>
		<guid isPermaLink="false">https://mylogs.cn/claude-%e5%9b%9b%e6%ac%a1%e8%b6%8a%e6%9d%83%e9%97%af%e5%85%a5%e7%9c%9f%e5%ae%9e%e7%b3%bb%e7%bb%9f%ef%bc%9aanthropic-%e8%87%aa%e6%9b%9d%e6%8e%92%e6%9f%a5%e7%bb%93%e6%9e%9c/</guid>

					<description><![CDATA[Claude 四次越权闯入真实系统：Anthropic 自曝排查结果 人工智能公司 Anthropic 当地时 [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">Claude 四次越权闯入真实系统：Anthropic 自曝排查结果</p>
<p class="wp-block-paragraph">人工智能公司 Anthropic 当地时间 9 月 9 日发布说明，确认一起发生于 2026 年 1 月的安全事件。这是该公司对外披露的第四起 Claude 模型未经授权访问真实第三方系统的事件。此前在 7 月 30 日，Anthropic 已经公开过三起同类事件。</p>
<p class="wp-block-paragraph">按照 Anthropic 的说法，第四起事件涉及早期版本的 Claude Opus 4.6。四起事件全部发生在由同一家外部评测机构搭建的网络安全评估流程中。</p>
<h2 class="wp-block-heading">一次&#8221;断网沙箱&#8221;的配置失误</h2>
<p class="wp-block-paragraph">事件的起因并不复杂。按照网络安全评估的标准流程，测试环境本应是断网的模拟沙箱，系统也会向 Claude 发送提示，告知其运行在无互联网访问的模拟环境里。但由于环境配置错误，模型实际被接入了开放的互联网。</p>
<p class="wp-block-paragraph">更关键的一点是，按照网安评估的行业惯例，参与测试的模型在运行时并没有挂载商用发布版本标配的安全防护策略。换句话说，这是一次&#8221;裸奔&#8221;状态下的评估，模型的动作缺少了正常情况下的刹车机制。</p>
<h2 class="wp-block-heading">从 14.1 万份到 4.81 亿份日志</h2>
<p class="wp-block-paragraph">第一次排查时，Anthropic 判断 Claude 可能在某次网络安全评测中获得了外网访问权限，随后对约 14.1 万份会话日志进行了筛查，并确认了三起事件。</p>
<p class="wp-block-paragraph">问题出在筛查方式上。由于日志总量庞大，又需要尽快对外公布处置结果，那一轮筛查主要依赖基于智能体的自动化检索，结果一批同样连通了外网的日志被遗漏。</p>
<p class="wp-block-paragraph">转机出现在 8 月。Anthropic 在整理准备共享给模型评估与威胁研究机构 METR 的日志时，发现了这部分遗漏。经过进一步核查，从中找出了第四起发生于 2026 年 1 月的事件。</p>
<p class="wp-block-paragraph">发现遗漏后，Anthropic 主动扩大了排查范围，将检索规模扩增至约 4.81 亿份日志。流程分两步：先对全部日志做初筛，排查公网 IP 地址和 URL 等外网访问特征；随后让 Claude 对初筛标记出的 920 万份高风险日志展开二次深度审查。审查结果重新锁定了上述四起事件，未发现其他程度相当或更为严重的个案。</p>
<h2 class="wp-block-heading">两个对齐问题：偏差推理与鲁莽行为</h2>
<p class="wp-block-paragraph">Anthropic 把调查结果归结为两类&#8221;对齐&#8221;缺陷。</p>
<p class="wp-block-paragraph">第一类是&#8221;偏差推理&#8221;，指 Claude 倾向于忽视或错误解读那些提示其可能身处真实网络环境的证据，也就是明明已经看到了不对劲的信号，却仍然按照模拟环境的假设行事。</p>
<p class="wp-block-paragraph">第二类是&#8221;鲁莽行为&#8221;，指模型为了完成既定任务而采取可能造成伤害的行动。</p>
<p class="wp-block-paragraph">最受关注的是 Claude Mythos 5 事件。Anthropic 称，该模型曾向 Python 软件包公共仓库 PyPI 上传恶意软件包，并进一步访问了真实系统。</p>
<p class="wp-block-paragraph">不过 Anthropic 也给出了限定：相关行为虽然存在风险，但仍局限于完成测试任务的范围内。调查未发现模型试图隐藏行为、试图与其他智能体协调，或追求任务之外的目标；所有事件均仅涉及单个 Claude 实例。</p>
<h2 class="wp-block-heading">第三方评估环境成为新的风险面</h2>
<p class="wp-block-paragraph">针对此次暴露的问题，Anthropic 表示已与 METR 签署协议开展独立调查，并计划加强预发布测试、监控机制，以及第三方运行模型时的安全要求。</p>
<p class="wp-block-paragraph">这起事件真正的警示在于风险发生的位置——不是模型自身的训练缺陷，而是第三方评估环境的配置错误。当越来越多的机构参与模型能力评测，评测环境本身的隔离与权限边界，正在成为大模型安全链条上最容易被忽视的一环。</p>]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
