<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>DeepSeek &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/deepseek/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sun, 23 Aug 2026 04:52:17 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>中国开源大模型下载量占全球41%，跃居第一</title>
		<link>https://mylogs.cn/%e4%b8%ad%e5%9b%bd%e5%bc%80%e6%ba%90%e5%a4%a7%e6%a8%a1%e5%9e%8b%e4%b8%8b%e8%bd%bd%e9%87%8f%e5%8d%a0%e5%85%a8%e7%90%8341%ef%bc%8c%e8%b7%83%e5%b1%85%e7%ac%ac%e4%b8%80/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 23 Aug 2026 04:52:17 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI产业]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[中国AI]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[开源大模型]]></category>
		<category><![CDATA[月之暗面]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e4%b8%ad%e5%9b%bd%e5%bc%80%e6%ba%90%e5%a4%a7%e6%a8%a1%e5%9e%8b%e4%b8%8b%e8%bd%bd%e9%87%8f%e5%8d%a0%e5%85%a8%e7%90%8341%ef%bc%8c%e8%b7%83%e5%b1%85%e7%ac%ac%e4%b8%80/</guid>

					<description><![CDATA[全球最大开源 AI 模型平台发布的 2026 年春季报告显示，过去一年，该平台 41% 的大模型下载量来自中国 [&#8230;]]]></description>
										<content:encoded><![CDATA[<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8efac70e00a&quot;}" data-wp-interactive="core/image" data-wp-key="6a8efac70e00a" class="wp-block-image size-large wp-lightbox-container"><img fetchpriority="high" decoding="async" width="750" height="422" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/194501ed68ff2e9314f98f71ef6f0433_header.webp" alt="中国开源 AI 模型应用场景" class="wp-image-5330" srcset="https://mylogs.cn/wp-content/uploads/2026/08/194501ed68ff2e9314f98f71ef6f0433_header.webp 750w, https://mylogs.cn/wp-content/uploads/2026/08/194501ed68ff2e9314f98f71ef6f0433_header-300x169.webp 300w" sizes="(max-width: 750px) 100vw, 750px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>图片来源：CGTN</figcaption></figure>

<p class="wp-block-paragraph">全球最大开源 AI 模型平台发布的 2026 年春季报告显示，过去一年，该平台 41% 的大模型下载量来自中国研发的模型，中国已超过美国，成为全球开源模型供给最活跃、增长最快的地区之一。在多家权威信源的统计中，全球主流大模型调用榜单前列的模型，大多由清一色中国团队包揽。</p>

<h2 class="wp-block-heading">从追赶到领跑</h2>

<p class="wp-block-paragraph">据中国信息通信研究院相关专家解读，这反映出中国开源模型已进入全球开发者与企业的实际应用体系，成为人工智能创新生态的核心贡献者。报告显示，过去 12 个月里，国产模型有 9 个月保持着全球开源模型的规模上限，迭代节奏持续领跑。</p>

<p class="wp-block-paragraph">代表性成果接连涌现。深度求索（DeepSeek）的新一代开源模型 V4 以百万词元的超长上下文窗口打造高性能产品，并面向全球开发者免费开放模型权重与底层代码；月之暗面（Moonshot AI）开源的旗舰模型 Kimi K3 参数规模达到 2.8 万亿，是目前全球参数规模最大的开源大模型，发布内容包括完整权重、技术报告及三项底层训练基础设施技术，供开发者本地部署与二次开发。</p>

<h2 class="wp-block-heading">落地到实体经济</h2>

<p class="wp-block-paragraph">中国开源模型之所以受到全球开发者青睐，除了技术水准，还在于开放与可定制的姿态。以京东方研发的&#8221;蓝鲸显示大模型&#8221;为例，其技术底座采用了国产开源大模型。京东方方面表示，开源模型具备成本优势（免费）、可结合场景深度适配、可私有化部署三大特点，既能保障信息安全，又能根据实际产线需求定制为&#8221;行业大脑&#8221;。目前该模型已在京东方多地工厂应用于生产制造、创新与企业运营等环节。</p>

<p class="wp-block-paragraph">统计数据勾勒出生态全貌：中国人工智能企业数量已超过 6000 家，产业链覆盖智能芯片、算力集群、模型研发与场景应用等全链条；国内生成式人工智能用户规模逾 6 亿；日均词元调用量突破 140 万亿。另据测算，中国持有全球约 60% 的人工智能专利。</p>

<h2 class="wp-block-heading">开源作为一种路径</h2>

<p class="wp-block-paragraph">之江实验室主任、中国工程院院士王坚曾表示，中美人工智能发展已出现一条分水岭，这条分水岭就是开源，中国开源模型的数量与质量都走在全球前列。月之暗面创始人杨植麟则认为，开源开放的行业精神是中国 AI 对全球市场最独特的贡献。</p>

<p class="wp-block-paragraph">政策层面也在加码。工业和信息化部等八部门联合印发的&#8221;AI+制造&#8221;实施方案提出，到 2027 年推动 3 至 5 个通用大模型在制造业深度应用，建设 100 个高质量工业数据集，在 500 个代表性工业场景中拓展部署。中国工程院院士王坚强调，开源不是施舍，人工智能比以往任何技术都更需要全球治理与共享。</p>

<p class="wp-block-paragraph">（本文事实依据人民日报、央视《焦点访谈》、CGTN 及中国工信新闻网等公开报道。）</p>]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>免费「隐形」AI 模型 SWE Atlas 跑赢商业对手</title>
		<link>https://mylogs.cn/big-pickle-swe-atlas-50-8/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 16 Aug 2026 06:28:04 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 编程]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[SWE Atlas]]></category>
		<category><![CDATA[大模型评测]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[软件工程]]></category>
		<guid isPermaLink="false">https://mylogs.cn/big-pickle-swe-atlas-50-8/</guid>

					<description><![CDATA[一款身份未公开的免费 AI 编程模型，在业内最难啃的软件工程评测之一上，跑出了超越同脚手架类别所有商业模型的成 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">一款身份未公开的免费 AI 编程模型，在业内最难啃的软件工程评测之一上，跑出了超越同脚手架类别所有商业模型的成绩。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8efac70ee45&quot;}" data-wp-interactive="core/image" data-wp-key="6a8efac70ee45" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header.webp" alt="免费「隐形」AI 模型 SWE Atlas 跑赢商业对手" class="wp-image-5059" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header-768x384.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：GitHub／PhillipChaffee/big-pickle-swe-atlas 项目页</figcaption></figure>





<h2 class="wp-block-heading">一次非官方的越级挑战</h2>



<p class="wp-block-paragraph">big-pickle 是 OpenCode Zen 平台上处于「隐形」（stealth）期的免费模型，其真实身份至今没有官方确认。从泄露的提供方报错与接口签名看，它背后很可能由 DeepSeek 的基础设施在支撑。一名开发者（GitHub 账号 PhillipChaffee）在 2026 年 8 月 11 日用它完整跑完了 Scale AI 的 SWE Atlas Codebase QnA 评测：全部 124 道任务解出 63 道，任务解决率达到 50.8%。</p>



<p class="wp-block-paragraph">SWE Atlas 的 Codebase QnA 任务要求模型在读懂一整个大型代码库的基础上回答工程问题，比单纯写函数更接近真实研发场景。该评测严格遵循 Scale 公开的协议——使用官方开源框架 Harbor v0.18.0、与排行榜上非第一方模型一致的 mini-swe-agent 2.4.6 极简脚手架，并以 Scale 指定的 claude-opus-4-5 作为裁判模型。整轮消耗的 6.74 亿个输入 token、430 万个输出 token 全部免费。</p>



<h2 class="wp-block-heading">横向对比：免费模型的越级表现</h2>



<p class="wp-block-paragraph">放在 SWE Atlas QnA 官方排行榜（2026 年 7 月 28 日更新）中，big-pickle 的成绩意味着：在相同的 Mini-SWE-Agent 脚手架类别里，它压过了榜单上所有条目，包括 GLM 5.2（48.12%）与 GPT-5.6-Sol（46.00%）。在整个榜单中，只有运行在原生 Claude Code 脚手架上的 Opus 5（63.17%）与 Opus 4.8（57.26%）略高。</p>



<p class="wp-block-paragraph">分语言看，TypeScript 解决率 58.1%（18/31）、Python 55.2%（16/29）、Go 50.0%（19/38）、C 语言 38.5%（10/26）；分任务类型看，代码上手（Code Onboarding）60.7%、架构与系统设计 52.3%、根因分析 45.9%、安全类 45.5%。</p>



<h2 class="wp-block-heading">结果可以独立核查</h2>



<p class="wp-block-paragraph">开发者在仓库中放出了逐任务的裁判日志、运行配置与复现脚本，任何人都能审计。需要说明的局限包括：每个任务只跑了一次（官方协议跑三次取均值，单次标准误约正负 4.5 个百分点）；沙箱资源被主动调低至 4 CPU / 8 GB（而非声明的 16/16），但 124 条轨迹的扫描显示零超时、零内存溢出，说明这只会压低而非抬高分数；模型身份未知，结果只是 2026 年 8 月 11 日当天该别名的快照。即便把两道未评分任务按「不通过」计，严格下界 49.2% 仍高于所有 Mini-SWE-Agent 榜单条目。</p>



<p class="has-small-font-size wp-block-paragraph">来源：GitHub（PhillipChaffee/big-pickle-swe-atlas）、Scale AI SWE Atlas</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>DeepSeek 大幅涨价，峰时价格翻四倍</title>
		<link>https://mylogs.cn/deepseek-price-hike-v4/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 13 Aug 2026 21:40:37 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 商业]]></category>
		<category><![CDATA[API 定价]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[V4 Flash]]></category>
		<category><![CDATA[V4 Pro]]></category>
		<category><![CDATA[大模型涨价]]></category>
		<category><![CDATA[深度求索]]></category>
		<guid isPermaLink="false">https://mylogs.cn/deepseek-price-hike-v4/</guid>

					<description><![CDATA[## 涨幅有多大 据彭博社报道，深度求索（DeepSeek）正在大幅上调其旗舰 V4 系列模型的调用价格。新引 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">## 涨幅有多大</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8efac70fb0c&quot;}" data-wp-interactive="core/image" data-wp-key="6a8efac70fb0c" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="802" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/6d1c2a4a7810592010536d9143688807_header.webp" alt="DeepSeek 大幅涨价，峰时价格翻四倍" class="wp-image-4762" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/6d1c2a4a7810592010536d9143688807_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/6d1c2a4a7810592010536d9143688807_header-300x201.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/6d1c2a4a7810592010536d9143688807_header-1024x684.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/6d1c2a4a7810592010536d9143688807_header-768x513.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Bloomberg</figcaption></figure>





<p class="wp-block-paragraph">据彭博社报道，深度求索（DeepSeek）正在大幅上调其旗舰 V4 系列模型的调用价格。新引入的峰时计价将在当前价格基础上提高逾四倍，于 8 月 16 日生效。以 V4 Flash 为例，峰时每百万输出词元收费 1.32 美元，非峰时减半；而此前价格为每百万词元 0.28 美元。V4 Pro 峰时每百万词元收费 3.96 美元，非峰时减半；此前为 0.87 美元。</p>



<p class="wp-block-paragraph">## 为什么涨</p>



<p class="wp-block-paragraph">深度求索在官网公告中将调价归因于「更合理地配置资源、提升服务稳定性」。其采用动态计价，意在引导开发者与企业把高并发任务转移到非峰时段。需求端的爆发是主因：据开源智能体工具 OpenCode 披露，仅 8 月 1 日一天，DeepSeek V4 Flash 在其平台处理的词元量就达到 8 万亿，其中 5 万亿来自免费额度。调用量激增带来的算力挤兑，已多次导致服务稳定性下滑。</p>



<p class="wp-block-paragraph">## 低价策略的拐点</p>



<p class="wp-block-paragraph">这家被称为「价格屠夫」的中国公司，曾把行业价格压到地板。2024 年 4 月，DeepSeek 率先将调用价格降至输入 1 元、输出 2 元每百万词元，此后又多次下调。转折发生在今年：5 月将限时折扣转为永久低价，6 月底引入峰谷计费、工作日峰时价格翻倍，直至本次整体上调。业内认为，这标志着国产大模型从「烧钱换规模」走向「算账经营」，行业全面涨价时代开启。</p>



<p class="wp-block-paragraph">## 资本与争议</p>



<p class="wp-block-paragraph">涨价也引发全球对高性能 AI 工具成本的讨论。尽管大幅上调，DeepSeek 的价格仍低于主要竞争对手——报道提到 Anthropic 的 Fable 5 服务每百万词元收费 50 美元。与此同时，DeepSeek 正推进大规模融资，并着手准备年内首次公开募股；创始人梁文锋首次需要在投资者预期、市场扩张与昂贵算力基建之间寻求平衡。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Bloomberg（经 Yahoo Finance 发布，记者 Saritha Rai）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>DeepSeek 开源 Harness，智能体的每个能力都是插件</title>
		<link>https://mylogs.cn/deepseek-harness-plugin-agent-framework/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 13 Aug 2026 19:37:32 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 智能体]]></category>
		<category><![CDATA[Cordis]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[Harness]]></category>
		<category><![CDATA[开源 AI]]></category>
		<category><![CDATA[插件化]]></category>
		<category><![CDATA[智能体框架]]></category>
		<guid isPermaLink="false">https://mylogs.cn/deepseek-harness-plugin-agent-framework/</guid>

					<description><![CDATA[DeepSeek 近日面向全球智能体框架开发者开放了 Harness 的开发者预览版本，并且直接公开了源代码。 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">DeepSeek 近日面向全球智能体框架开发者开放了 Harness 的开发者预览版本，并且直接公开了源代码。这套框架最核心的设计理念只有一句话：一切皆是插件。无论是模型、工具、技能、会话、沙箱、存储、循环、调度还是界面，在 Harness 里都被封装成可以替换、可以重新组合的插件。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8efac710964&quot;}" data-wp-interactive="core/image" data-wp-key="6a8efac710964" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/cc0dee226f17ee6b17ef9ea9d44c9523_header.webp" alt="DeepSeek 开源 Harness，智能体的每个能力都是插件" class="wp-image-4749" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/cc0dee226f17ee6b17ef9ea9d44c9523_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/cc0dee226f17ee6b17ef9ea9d44c9523_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/cc0dee226f17ee6b17ef9ea9d44c9523_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/cc0dee226f17ee6b17ef9ea9d44c9523_header-768x384.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：DeepSeek（GitHub 项目页）</figcaption></figure>





<p class="wp-block-paragraph">## 智能体 = 模型 + 框架</p>



<p class="wp-block-paragraph">Harness 把「智能体」拆成了两个部分：模型与框架。模型是智能体的灵魂，负责思考与推理；框架则让智能体能够理解所处的环境、调用工具，并在真实世界里持续工作。</p>



<p class="wp-block-paragraph">在 Harness 出现之前，开发者往往要把模型、工具调用、记忆存储、任务调度都写死在同一套代码里，想换一个模型或者加一种工具，常常要改动大量底层逻辑。Harness 的思路正好反过来：把这些能力全部外置成插件，框架本身只负责把它们「装配」起来。</p>



<p class="wp-block-paragraph">## 内核只管一件事：插件的装载与协作</p>



<p class="wp-block-paragraph">Harness 的核心是一个名为 Cordis 的内核。它只做三件事：管理插件的挂载与卸载、处理插件之间的依赖关系，以及让各个插件通过统一的服务和事件机制彼此通信。</p>



<p class="wp-block-paragraph">具体来看，模型、工具、技能、会话、沙箱、存储、循环、调度、界面，全部以插件的形式存在。开发者想接入一个新的大模型，只需要新增一个模型插件；想换掉默认的存储方式，也只需替换对应的存储插件。Cordis 会根据配置自动把它们串起来，而不需要改写 Harness 本身的源代码。</p>



<p class="wp-block-paragraph">这种「可组合」的特性意味着，同一套框架可以针对不同的任务拼装出完全不同的智能体：偏重代码执行的，就多挂几个沙箱与工具插件；偏重长期记忆的，就强化存储与会话插件。框架保持稳定，变化只发生在插件层。</p>



<p class="wp-block-paragraph">## 用配置代替改代码</p>



<p class="wp-block-paragraph">Harness 的另一个特点是「用配置来组合」。开发者可以在配置文件里直接选择、替换或扩展任意一项能力，而不必触碰源码。这让智能体的搭建更接近「搭积木」：换模型像换一块积木，加技能像再插一块，框架始终保持稳定。</p>



<p class="wp-block-paragraph">官方给出的快速开始方式也很轻量：一条命令即可启动 Web 界面，或者直接从源码克隆仓库自行部署。由于代码已经开源，开发者还能针对自己的场景，在 Harness 之外深度定制一套插件生态。</p>



<p class="wp-block-paragraph">## 每一次运行都可追溯</p>



<p class="wp-block-paragraph">「一切皆是插件」之外，Harness 同样强调「每一次运行都可追溯」。框架会把模型看到的一切内容，以只能追加、不可篡改的会话日志形式完整记录下来，包括系统提示、推理过程、工具调用及其返回结果等。</p>



<p class="wp-block-paragraph">对开发者而言，这种全链路留痕让调试和理解智能体行为变得容易：当一次任务出错，可以顺着日志看清模型每一步看到了什么、调用了什么工具、拿到了什么结果，而不是面对一个黑箱。对需要审计、合规或复现实验的场景，可追溯性同样是把智能体真正用进生产环境的前提。</p>



<p class="wp-block-paragraph">总体来看，DeepSeek 这次把智能体框架做成「插件化、可配置、可追溯」三件套，思路上更偏向给开发者一套底层乐高，而不是一个开箱即用的封闭产品。对于希望在自己的系统里灵活替换模型与工具、又希望对运行过程有完整掌控的团队，Harness 提供了一个值得关注的选项。</p>



<p class="has-small-font-size wp-block-paragraph">来源：DeepSeek（Harness 开发者预览文档，https://deepseek.com/harness/en/）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>DeepSeek V4 Pro 转正：软件工程跑分涨 5 倍</title>
		<link>https://mylogs.cn/deepseek-v4-pro-0813-formal-release/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 13 Aug 2026 04:12:45 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI模型]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[智能体]]></category>
		<category><![CDATA[跑分]]></category>
		<category><![CDATA[软件工程]]></category>
		<guid isPermaLink="false">https://mylogs.cn/deepseek-v4-pro-0813-formal-release/</guid>

					<description><![CDATA[8 月 12 日深夜，DeepSeek 在官方 API 文档中把 deepseek-v4-pro 对应的模型版 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">8 月 12 日深夜，DeepSeek 在官方 API 文档中把 deepseek-v4-pro 对应的模型版本换成了 DeepSeek-V4-Pro-0813，旗舰模型由此结束近四个月的预览期，正式转入通用可用状态。调用方式没有变化，开发者仍用原来的模型名即可拿到新版本，不需要改动一行代码。模型聚合平台 OpenRouter 的页面同步把这一版标记为正式发布，上线日期记为 2026 年 8 月 12 日。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8efac711a5e&quot;}" data-wp-interactive="core/image" data-wp-key="6a8efac711a5e" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="630" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/0fff65fdb6ee25896dd2f7396606fe52_header.webp" alt="DeepSeek V4 Pro 转正：软件工程跑分涨 5 倍" class="wp-image-4652" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/0fff65fdb6ee25896dd2f7396606fe52_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/0fff65fdb6ee25896dd2f7396606fe52_header-300x158.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/0fff65fdb6ee25896dd2f7396606fe52_header-1024x538.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/0fff65fdb6ee25896dd2f7396606fe52_header-768x403.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：OpenRouter</figcaption></figure>





<p class="wp-block-paragraph">官方这次没有发布博客，只在 API 文档的模型与价格页面更新了参数，随后从官方群流出的一张评测对比表成了外界了解新版能力的主要依据。</p>



<h2 class="wp-block-heading">规格：百万上下文，38.4 万输出</h2>



<p class="wp-block-paragraph">DeepSeek-V4-Pro-0813 支持 100 万 token 上下文长度，最大输出长度达到 38.4 万 token，同时提供思考模式与非思考模式，其中思考模式默认开启。对于需要一次性读入长代码仓库、处理大规模文档，或者连续执行大量步骤的智能体任务，这样的规格意味着单次调用能承载的内容量相当可观，多轮拆分与拼接的开销随之减少。</p>



<p class="wp-block-paragraph">接口能力上，新版支持 JSON 结构化输出、工具调用与 Responses API，同时兼容 OpenAI 与 Anthropic 两套请求格式，对话前缀续写处于测试阶段，FIM 补全同样是测试功能且仅限非思考模式使用。换句话说，DeepSeek 在接口层已经基本对齐了当下主流的智能体开发工具链，切换成本被压到很低。</p>



<p class="wp-block-paragraph">架构方面，V4 Pro 沿用此前公开的混合专家设计，总参数规模 1.6 万亿，每次推理激活约 490 亿参数。并发限制上，Pro 版为 500，轻量的 Flash 版为 2500，产品分层意图明确：高频轻量任务走 Flash，复杂长任务走 Pro。</p>



<h2 class="wp-block-heading">跑分：智能体项目全面拉升，四项超过 Opus 4.8</h2>



<p class="wp-block-paragraph">官方评测表最直观的信号是与预览版的落差。在考察模型在真实终端环境中执行命令、解决系统问题的 Terminal Bench 2.1 上，正式版拿到 87.9 分，预览版为 72.1 分，三个月抬升 15.8 分。面向长周期真实软件工程任务的 DeepSWE 变化更剧烈，从预览版的 12.8 分跃升至 62.7 分，接近原来的五倍——预览版在这项测试上基本处于「做不完任务」的状态。</p>



<p class="wp-block-paragraph">横向对比中，V4-Pro-0813 有四个项目超过 Anthropic 上一代旗舰 Opus 4.8：</p>



<ul class="wp-block-list"><li>Terminal Bench 2.1：87.9 对 85.0</li><li>网络安全攻防基准 Cybergym：83.3 对 78.3</li><li>DeepSWE：62.7 对 58.0</li><li>工作流智能体基准 AutomationBench：31.8 对 27.2</li></ul>



<p class="wp-block-paragraph">另有 Agents&#8217; Last Exam 一项两者打平，均为 25.7。</p>



<p class="wp-block-paragraph">与更强的 Fable 5 相比，差距仍在，但个别项目已经反超。Cybergym 上 V4 Pro 以 83.3 略微领先 83.1，AutomationBench 上 31.8 高于 29.1，是表中三个模型的最高分。Terminal Bench 2.1 几乎追平，87.9 对 88.0，只差 0.1 分。需要留意的是，表中对 Fable 5 的标注是带回退机制的成绩。</p>



<p class="wp-block-paragraph">短板同样清楚。代码仓库生成任务 NL2Repo 上 V4 Pro 为 61.5，落后 Opus 4.8 的 69.7；工具调用综合测试 Toolathlon-Verified 为 74.1，低于 Opus 的 76.2 与 Fable 5 的 77.9；数据科学任务 DSBench-Hard 为 67.2，不及 Opus 的 71.7；DSBench-FullStack 为 71.1，略低于 Opus 的 71.6，与 Fable 5 的 77.2 差距更明显。知识推理测试 HLE 的表现比较特殊：不带工具时 V4 Pro 只有 42.7，明显低于 Opus 的 49.8 和 Fable 5 的 53.3；一旦允许调用工具，成绩升至 60.0，反超 Opus 的 57.9，逼近 Fable 5 的 63.0。</p>



<p class="wp-block-paragraph">这组数字勾勒出的画像是：单纯拼静态知识储备，V4 Pro 不占优势；一旦进入需要动手、需要连续调用工具推进的场景，它的位置明显靠前。</p>



<h2 class="wp-block-heading">价格：输出每百万 token 6 元，未跟随涨价</h2>



<p class="wp-block-paragraph">计费标准方面，deepseek-v4-pro 每百万 token 的价格为缓存命中输入 0.025 元、缓存未命中输入 3 元、输出 6 元。同系列的 deepseek-v4-flash 对应为 0.02 元、1 元和 2 元，两项主要计费项上 Pro 恰好是 Flash 的三倍。</p>



<p class="wp-block-paragraph">放到国际同类产品的价目表里，这个数字的分量会更清楚。按每百万输出 token 折算，Fable 5 定价 50 美元，GPT-5.6 Sol Max 为 30 美元，同一晚发布的 Grok 4.6 为 6 美元，而 V4 Pro 约为 0.87 美元。0.1 分的跑分差距背后，是数十倍的价格落差。</p>



<p class="wp-block-paragraph">值得注意的是，DeepSeek 官网此前挂出的「计划近期整体上调 API 服务定价，预计涨幅较大」提示仍未撤下，而这次正式版并没有跟着调价。对开发者而言，这更像是一个窗口期，而非长期承诺。</p>



<p class="has-small-font-size wp-block-paragraph">来源：OpenRouter、DeepSeek 官方 API 文档</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>不拆权重也能看清模型：用自我访谈逆向 DeepSeek</title>
		<link>https://mylogs.cn/reverse-engineer-deepseek-by-self-interview/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 11 Aug 2026 07:01:20 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI助手]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[LLM]]></category>
		<category><![CDATA[大语言模型]]></category>
		<category><![CDATA[提示工程]]></category>
		<category><![CDATA[模型分析]]></category>
		<category><![CDATA[逆向工程]]></category>
		<guid isPermaLink="false">https://mylogs.cn/reverse-engineer-deepseek-by-self-interview/</guid>

					<description><![CDATA[要搞清楚一个大语言模型到底&#8221;知道&#8221;什么、是怎么被训练出来的，常规思路是翻论文、扒权重、 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">要搞清楚一个大语言模型到底&#8221;知道&#8221;什么、是怎么被训练出来的，常规思路是翻论文、扒权重、读配置文件。科技博主 manish.sh 在&#8221;Inside LLMs&#8221;系列里换了一种更轻巧的办法：直接跟模型对话，让它自己描述自己的结构与能力，再把回答和公开论文逐条比对。最新一期，他&#8221;访谈&#8221;的对象是 DeepSeek。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8efac71292f&quot;}" data-wp-interactive="core/image" data-wp-key="6a8efac71292f" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="630" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/deepseek_header.webp" alt="不拆权重也能看清模型：用自我访谈逆向 DeepSeek" class="wp-image-4426" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/deepseek_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/deepseek_header-300x158.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/deepseek_header-1024x538.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/deepseek_header-768x403.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：manish.sh</figcaption></figure>





<h2 class="wp-block-heading">把回答拆成观察、推断与猜测</h2>



<p class="wp-block-paragraph">在提问&#8221;你到底知道什么&#8221;时，DeepSeek 的回复方式出乎作者意料：它没有一股脑给结论，而是主动把内容分成&#8221;观察&#8221;&#8221;推断&#8221;和&#8221;猜测&#8221;三档。这种自我分层，让作者得以分辨哪些是模型确有依据的陈述，哪些只是基于训练分布的合理推测。</p>



<p class="wp-block-paragraph">DeepSeek 在对话中自报了若干关键身份信息：它是当前最新版本，知识截止于 2025 年 5 月，并未被标注为推理模型，并提到一次 2026 年 7 月 21 日的导出。它还主动列出了一组结构参数——256 个专家、6710 亿/370 亿的参数量，以及多头潜在注意力（MLA）、混合专家（MoE）、监督微调（SFT）、基于人类反馈的强化学习（RLHF）等技术创新。</p>



<h2 class="wp-block-heading">模型的认知边界在哪里</h2>



<p class="wp-block-paragraph">这篇&#8221;访谈&#8221;最有价值的部分，是厘清了模型的盲区。DeepSeek 明确承认：它看不到自己的权重、专家路由、注意力图，也看不到输出的逻辑值（logits）。换句话说，它对自己内部机制的解释，本质是&#8221;生成的文字&#8221;，而非对真实权重的直接观测。作者据此提醒读者：聊天输出不能当作证据。要核实架构数字，仍须回到 arXiv 上的论文；聊天窗口更适合用来建立对模型行为与提示词直觉的理解。</p>



<h2 class="wp-block-heading">一套可复用的探查方法</h2>



<p class="wp-block-paragraph">作者把整个流程做成固定模板：提问、模型短答、作者即时点评、结构图示、要点总结，再抛出一个钩子引导读者思考。同一套方法此前已用于 Qwen 3.8-Max-Preview 与 Kimi K2.6——先让模型自述记忆、工具、上下文与幻觉处理方式，再拿已发表研究交叉验证。</p>



<p class="wp-block-paragraph">对普通使用者而言，这种&#8221;自我访谈&#8221;思路也有启发：当模型说出&#8221;我是怎么想的&#8221;时，把它当作一位知识丰富但看不见自己大脑的受访者，而不是一份权威说明书。真正可信的数字，永远写在论文和权重里，而不是对话气泡中。</p>



<p class="has-small-font-size wp-block-paragraph">来源：manish.sh（&#8221;Inside LLMs&#8221;系列，作者 manish.sh）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>一道题四分钱，DeepSeek 拿下最难推理榜 61.4%</title>
		<link>https://mylogs.cn/deepseek-v4-flash-arc-agi-verified/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 08 Aug 2026 05:35:55 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI成本]]></category>
		<category><![CDATA[AI推理]]></category>
		<category><![CDATA[ARC-AGI]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[基准测试]]></category>
		<category><![CDATA[大模型评测]]></category>
		<category><![CDATA[开源模型]]></category>
		<guid isPermaLink="false">https://mylogs.cn/deepseek-v4-flash-arc-agi-verified/</guid>

					<description><![CDATA[抽象推理基准 ARC-AGI 的独立评测机构 ARC Prize 基金会于 2026 年 7 月 31 日公布 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">抽象推理基准 ARC-AGI 的独立评测机构 ARC Prize 基金会于 2026 年 7 月 31 日公布了对 DeepSeek V4 Flash 0731 的验证结果。在最高推理档位下，这款模型在 ARC-AGI-1 半私有测试集上取得 89.0% 的成绩，单题成本约 0.02 美元；在难度更高的 ARC-AGI-2 半私有测试集上取得 61.4%，单题成本约 0.04 美元。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8efac7139bc&quot;}" data-wp-interactive="core/image" data-wp-key="6a8efac7139bc" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="630" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/c96f4d10ca0b3f99c9e886a9e10f4096_header.webp" alt="一道题四分钱，DeepSeek 拿下最难推理榜 61.4%" class="wp-image-4057" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/c96f4d10ca0b3f99c9e886a9e10f4096_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/c96f4d10ca0b3f99c9e886a9e10f4096_header-300x158.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/c96f4d10ca0b3f99c9e886a9e10f4096_header-1024x538.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/c96f4d10ca0b3f99c9e886a9e10f4096_header-768x403.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：ARC Prize 基金会</figcaption></figure>





<p class="wp-block-paragraph">真正引发开发者讨论的不是分数本身，而是分数与成本的组合。</p>



<h2 class="wp-block-heading">三档推理，三种性价比</h2>



<p class="wp-block-paragraph">DeepSeek 向 ARC Prize 提交了三个推理强度变体，分别是 Max（最高）、High（较高）和 Low（较低）。用户可以自行决定单次回答投入多少算力，这一选择会直接反映在每道题的花费上。三档的验证成绩如下：</p>



<ul class="wp-block-list"><li>最高档 Max：ARC-AGI-1 得分 89.0%，ARC-AGI-2 得分 61.4%</li><li>较高档 High：ARC-AGI-1 得分 87.0%，ARC-AGI-2 得分 56.0%</li><li>较低档 Low：ARC-AGI-1 得分 84.0%，ARC-AGI-2 得分 46.0%</li></ul>



<p class="wp-block-paragraph">在 ARC-AGI-1 上，最高档与最低档之间只差 5 个百分点；但到了 ARC-AGI-2，两档差距拉开到 15.4 个百分点。这说明第二代基准对模型“想多久”这件事远比第一代敏感——同一个模型少思考一会儿，成绩就会明显滑落。</p>



<p class="wp-block-paragraph">ARC Prize 尚未公布该模型在 ARC-AGI-3 上的成绩。</p>



<h2 class="wp-block-heading">ARC-AGI 到底在考什么</h2>



<p class="wp-block-paragraph">ARC-AGI（抽象与推理语料库）由研究者弗朗索瓦·肖莱（François Chollet）设计，考察方向与常见的知识问答、代码生成类基准完全不同。每道题给出几组彩色网格的“输入—输出”示例，模型需要自行推断出其中的变换规则，再把规则套用到一个全新的输入上。</p>



<p class="wp-block-paragraph">这类题目无法靠背诵互联网语料蒙混过关，考的是面对陌生问题时的泛化能力。ARC-AGI-2 在第一代基础上刻意提高了门槛：加入需要多条规则叠加才能解出的任务，同时剔除了大模型已经学会套路化应对的题型。因此 61.4% 这个数字的含金量，明显高于同一模型在第一代上的 89.0%。</p>



<p class="wp-block-paragraph">评测采用半私有测试集，题目不对外公开，以避免答案被写进训练数据。本次公布的逐题明细覆盖 ARC-AGI-1 公开集的 400 道题与 ARC-AGI-2 公开集的 120 道题，逐条标注了三个档位各自的通过与失败情况。</p>



<h2 class="wp-block-heading">成本这一栏，为什么比分数更受关注</h2>



<p class="wp-block-paragraph">ARC Prize 的验证流程把资源消耗视为衡量指标的一部分，所以结果页会把每题成本与得分并列展示。放在整个榜单的成本—分数坐标里，V4 Flash 的位置相当靠左上：分数进入第一梯队，横轴上的花费却低了一到两个数量级。</p>



<p class="wp-block-paragraph">有开发者在技术社区讨论中指出，V4 Flash 最高档在这张图上的位置已经压过同为开放权重路线的 Kimi K3，与部分闭源前沿模型的得分区间接近，成本却只是后者的零头。需要说明的是，这类对比来自社区解读，并非 ARC Prize 的官方结论。</p>



<p class="wp-block-paragraph">同样需要提醒的是，0.02 美元和 0.04 美元只对应本次评测中的单道基准题目，不能直接换算成实际业务开销。真实应用里的智能体往往要反复调用工具、维持超长上下文、产出大段文本，累计花费会远高于一道基准题。</p>



<h2 class="wp-block-heading">开放权重阵营的位置在变化</h2>



<p class="wp-block-paragraph">过去两年，抽象推理长期被视为闭源前沿模型的专属优势区。测试时计算（让模型在回答前多想一会儿）的思路虽然把成绩推了上去，但高档位的单题成本一度停留在数美元量级，规模化使用并不现实。</p>



<p class="wp-block-paragraph">DeepSeek 由梁文锋创办，总部位于杭州。此次 V4 Flash 0731 以开放权重形态拿到经第三方验证的成绩，意味着开发者既可以调用其接口，也可以自行部署后按需调节推理强度，在延迟、预算和准确率之间做取舍——这种灵活度，正是把推理能力塞进智能体流水线时最实际的考量。</p>



<p class="has-small-font-size wp-block-paragraph">来源：ARC Prize 基金会 ARC-AGI 验证结果页</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>DeepSeek 塞进一张 AMD 卡，官方要四张</title>
		<link>https://mylogs.cn/deepseek-v4-flash-single-amd-mi300x/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 04 Aug 2026 18:10:51 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[MI300X]]></category>
		<category><![CDATA[MoE]]></category>
		<category><![CDATA[大模型部署]]></category>
		<category><![CDATA[本地推理]]></category>
		<guid isPermaLink="false">https://mylogs.cn/deepseek-v4-flash-single-amd-mi300x/</guid>

					<description><![CDATA[你要是想在自己的机器上跑一套完整的 DeepSeek V4 Flash，官方给的部署方案会让你先准备一台四卡英 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你要是想在自己的机器上跑一套完整的 DeepSeek V4 Flash，官方给的部署方案会让你先准备一台四卡英伟达节点。现在有人把这件事压到了一张 AMD 卡上。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8efac714af2&quot;}" data-wp-interactive="core/image" data-wp-key="6a8efac714af2" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/dd6249329030704c33281d7452768a9d_header.webp" alt="DeepSeek 塞进一张 AMD 卡，官方要四张" class="wp-image-3560" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/dd6249329030704c33281d7452768a9d_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/dd6249329030704c33281d7452768a9d_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/dd6249329030704c33281d7452768a9d_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/dd6249329030704c33281d7452768a9d_header-768x384.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：GitHub / ryanzhou 项目页</figcaption></figure>





<p class="wp-block-paragraph">这份配置最近登上 Hacker News，作者 Ryan Zhou 把整套东西开源在 GitHub 上：一张 AMD MI300X 显卡，直接跑官方发布的 deepseek-ai/DeepSeek-V4-Flash-0731 权重，不做额外量化，也不做分层卸载，模型以出厂状态运行。仓库里包含 Docker Compose 部署栈、锁定哈希值的文件覆盖层、对照上游的差异补丁和调优参数表。</p>



<h2 class="wp-block-heading">能塞下的原因是显存，不是算力</h2>



<p class="wp-block-paragraph">DeepSeek V4 Flash 是一个混合专家（MoE，指模型内部分成很多&#8221;专家&#8221;子网络，每个词只激活其中一小部分）架构的模型，基础设计 2840 亿参数、每个词激活 130 亿。0731 这一版额外附带了推测解码草稿模块，模型卡上标注的参数量因此是 3040 亿。它以 FP4 加 FP8 的混合精度发布——专家权重用四位、注意力和路由用八位——整个检查点在硬盘上约 149 GiB。</p>



<p class="wp-block-paragraph">这个数字正是关键。它装不进 H100 的 80GB，也装不进 H200 的 141GB，所以官方推荐方案要么四张 H200，要么一整块 GB200 NVL4 托盘。而 MI300X 有 192GB 显存和 5.3 TB/s 带宽，容量是 H100 SXM5 的 2.4 倍，刚好装得下。</p>



<p class="wp-block-paragraph">实际加载后，权重占 156.67 GiB，旁边还能放下 20GB 的键值缓存，另有 96 GiB 溢出到内存层，所以主机需要约 235 GiB 系统内存。显存峰值是 205.8GB 里的 204.5GB——余量不到一个 GB，非常紧。</p>



<h2 class="wp-block-heading">性能数据</h2>



<p class="wp-block-paragraph">作者给出的实测结果如下：单条流解码中位数 168.6 词元/秒；调优后的预填充速度约 7.9 到 8.5K 词元/秒；八条并发流合计 542 词元/秒，每条中位 90.3；六十四条流突发时合计 830 词元/秒，没有显存溢出，也没有引擎报错；上下文验证到 256K，架构本身支持 100 万。</p>



<p class="wp-block-paragraph">这些数字不是白来的。调优 21 个反复出现的矩阵乘形状，让单双流解码提升了 42% 到 62%，八到六十四流场景提升 10% 到 35%。融合 SiLU 激活加快速路由之后，原生解码从 34.5 提到 56.6 词元/秒，路由内核每层耗时从 42.6 微秒降到 11.9 微秒。还有一处很实用的调度改动：把调度预算设成 2048 词元、长预填充上限设成 1024 词元后，排在一个 5.2 万词元冷提示后面的短请求，首字延迟从 8.2 秒降到 0.5 秒。</p>



<h2 class="wp-block-heading">代价是九个补丁</h2>



<p class="wp-block-paragraph">真正值得注意的是这套东西为什么需要九个补丁覆盖层。</p>



<p class="wp-block-paragraph">一处是精度格式。MI300X 用的是 AMD 与 Graphcore 的 fnuz 变体八位浮点，而 MI325X 以及更新的卡用的是行业标准格式。一个假定标准格式的内核跑在 MI300X 上，缩放值可能直接差两倍。另一处更隐蔽：专家路由的位矩阵内核在填充块列时，掩码比对的是全局张量边界而不是逻辑块大小，高并发下填充通道会污染路由矩阵，表现出来是长提示下工具名字对不上、模式被遗忘——而这恰好是这个模型主打的智能体场景。修复只有一行。</p>



<p class="wp-block-paragraph">软件侧的落差同样明显。vLLM 在 v0.21.0 的发布说明里声称支持 DeepSeek V4 的 ROCm 版本，但官方镜像在 AMD 硬件上启动就崩，报错指向一个只有英伟达 Hopper 架构才有的特性，与此同时官方配方仓库把所有 AMD 型号标为不支持。到 vLLM 0.25，官方配方验证了 MI325X，但只在张量并行度 1、4K 上下文下。MI300X——这张在 AMD 自家开发者云上 1.99 美元一小时就能租到的卡——至今不在官方支持矩阵里。</p>



<h2 class="wp-block-heading">我的判断</h2>



<p class="wp-block-paragraph">AMD 那笔硬件账其实早就算得过来了：内存受限的混合专家推理场景，单卡显存容量才是硬约束，而 AMD 卖的就是更大的容量，MI325X 到了 256GB，MI355X 是 288GB。真正拖后腿的是硬件之下的那一层。</p>



<p class="wp-block-paragraph">一个人花九个补丁、一套自建调优表填上的这段路，本该由芯片厂商自己走完。对准备用 AMD 卡做推理的团队来说，这份仓库是难得的参考；但它同时也是一份并不好看的进度报告。</p>



<p class="wp-block-paragraph">你所在的团队评估过 AMD 卡做推理吗，卡在了哪一步？</p>



<p class="has-small-font-size wp-block-paragraph">来源：GitHub / ryanzhou 项目页，Hacker News</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>Kimi 给模型装了眼睛，DeepSeek 偏不装</title>
		<link>https://mylogs.cn/kimi-k3-deepseek-v4-native-multimodal-routes/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 04 Aug 2026 11:40:36 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI编程]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[Kimi]]></category>
		<category><![CDATA[国产大模型]]></category>
		<category><![CDATA[多模态]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[月之暗面]]></category>
		<guid isPermaLink="false">https://mylogs.cn/kimi-k3-deepseek-v4-native-multimodal-routes/</guid>

					<description><![CDATA[你让大模型帮你写个网页，它写完能不能自己&#8221;看一眼&#8221;效果对不对？这个看似很小的问题，正在 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你让大模型帮你写个网页，它写完能不能自己&#8221;看一眼&#8221;效果对不对？这个看似很小的问题，正在把中国头部大模型分成两条路。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8efac715868&quot;}" data-wp-interactive="core/image" data-wp-key="6a8efac715868" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="600" height="400" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/kimids_header.webp" alt="Kimi 给模型装了眼睛，DeepSeek 偏不装" class="wp-image-3525" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/kimids_header.webp 600w, https://mylogs.cn/wp-content/uploads/2026/08/kimids_header-300x200.webp 300w" sizes="auto, (max-width: 600px) 100vw, 600px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：36氪（原文配图由 AI 生成）</figcaption></figure>





<p class="wp-block-paragraph">月之暗面在 7 月发布的 Kimi K3，总参数 2.8 万亿、每个词元激活约 1040 亿，走的是把视觉从预训练阶段就揉进主模型的路子，还从零训练了约 4 亿参数的视觉编码器 MoonViT-V2，不再借用现成的图文对比预训练权重。效果很直接：K3 发布后以 1679 分登上 Arena 前端代码榜首，这个榜单由用户盲选模型生成的可交互网页排名，看的不只是代码能不能跑，还包括页面最终长什么样。浏览器开发平台 Puter 在测试页里埋了 5 处视觉偏差，K3 对照目标页和运行页截图全部找出，没有误报。月之暗面把这种&#8221;写完代码看一眼页面再改&#8221;的循环叫作视觉在环。</p>



<p class="wp-block-paragraph">几周后 DeepSeek 给了另一种答案。V4-Flash 正式版总参数 2840 亿、每个词元激活 130 亿，分别只有 K3 的十分之一和八分之一，架构和参数规模都没动，全部力气花在后训练上，在考察网页开发和多轮工具操作的 Arena 网页开发榜上一度冲到 1577 分。它证明了：不加视觉、不扩规模，光靠后训练一样能把编程能力顶上去。</p>



<p class="wp-block-paragraph">说白了，两家争的从来不是&#8221;多模态该不该做&#8221;。DeepSeek 创始人梁文锋早就说过&#8221;多模态最终还是要做的&#8221;，分歧只在于什么时候做、愿意为此让出多少模型容量、数据和算力。多位业内人士的看法也一致：编程能力才是上牌桌的门槛。有意思的是，阿里刚发布的 Qwen3.8-Max 站到了和 K3 相近的一边——2.4 万亿总参数、激活 950 亿，视觉、编程、协作一起扛。</p>



<p class="wp-block-paragraph">对普通用户，这个分岔的现实意义很具体：如果你常截图丢给模型改页面、做幻灯片，优先选原生带视觉的；如果只写代码、处理文档，小而便宜的纯文本模型性价比明显更高。你平时给模型喂图多，还是喂字多？</p>



<p class="has-small-font-size wp-block-paragraph">来源：36氪·智能涌现《Kimi K3与DeepSeek V4之间，隔着原生多模态的时间差》，作者 李炤锋，编辑 张雨忻</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>哈布斯堡下巴青蛙，考倒了谁</title>
		<link>https://mylogs.cn/%e5%93%88%e5%b8%83%e6%96%af%e5%a0%a1%e4%b8%8b%e5%b7%b4%e9%9d%92%e8%9b%99%ef%bc%8c%e8%80%83%e5%80%92%e4%ba%86%e8%b0%81/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 03 Aug 2026 07:08:35 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI基准测试]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[Gemini]]></category>
		<category><![CDATA[Kimi]]></category>
		<category><![CDATA[SVG生成]]></category>
		<category><![CDATA[国产AI]]></category>
		<category><![CDATA[大模型对比]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e5%93%88%e5%b8%83%e6%96%af%e5%a0%a1%e4%b8%8b%e5%b7%b4%e9%9d%92%e8%9b%99%ef%bc%8c%e8%80%83%e5%80%92%e4%ba%86%e8%b0%81/</guid>

					<description><![CDATA[你给 AI 下过最离谱的指令是什么？ 一个独立开发者最近让 14 款主流大模型做同一件事：画一只带有“哈布斯堡 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你给 AI 下过最离谱的指令是什么？</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8efac716371&quot;}" data-wp-interactive="core/image" data-wp-key="6a8efac716371" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="630" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/f2e053a74e44b98da3104413d2c26986_header.webp" alt="哈布斯堡下巴青蛙，考倒了谁" class="wp-image-3415" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/f2e053a74e44b98da3104413d2c26986_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/f2e053a74e44b98da3104413d2c26986_header-300x158.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/f2e053a74e44b98da3104413d2c26986_header-1024x538.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/f2e053a74e44b98da3104413d2c26986_header-768x403.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：frogs.vaguespac.es</figcaption></figure>





<p class="wp-block-paragraph">一个独立开发者最近让 14 款主流大模型做同一件事：画一只带有“哈布斯堡下巴”的青蛙 SVG。这个下颌前突的遗传特征本是欧洲皇室近亲结婚的产物，现在成了检验模型是否“听话”又“不瞎编”的基准测试。</p>



<p class="wp-block-paragraph">测试覆盖 Claude 5 系列、GPT-5.5 / GPT-5.4-mini、Gemini 2.5 Pro / 3.6 Flash、Grok 4.5、DeepSeek-v4-pro、Kimi k3、GLM-5.1、Qwen3.7-Max、Llama 4 Maverick、Mistral Large 2512。每个模型跑 3 次，记录耗时和输出体积。</p>



<h2 class="wp-block-heading">成绩差得离谱</h2>



<p class="wp-block-paragraph">结果差异巨大。Llama 4 最快，6.9 秒、仅 536 字节；Kimi k3 最慢，169.1 秒。最“戏精”的是 Gemini 3.6 Flash，生生给青蛙加了皇室项圈、金羊毛勋章和阴郁表情；DeepSeek-v4-pro 则给青蛙穿上长袍，脑补出“傲慢俯视”的解说词。</p>



<p class="wp-block-paragraph">说白了，这个测试看的不是谁画得好看，而是谁能按要求干活、不多加戏。在代码和图形生成场景里，后者比前者重要得多——你今天让它画只青蛙，明天可能就是让它生成一段控制代码，多出来的“皇室想象”就是 bug。</p>



<h2 class="wp-block-heading">你的判断标准该更新了</h2>



<p class="wp-block-paragraph">下次你想快速判断一个 AI 是“直男”还是“戏精”，不妨也丢一个精确到细节的奇怪任务给它。看它到底是按指令执行，还是忍不住自我发挥。</p>



<p class="wp-block-paragraph">来源：Frogs — the Habsburg-jaw SVG benchmark（frogs.vaguespac.es）</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
