<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>SWE Atlas &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/swe-atlas/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sun, 16 Aug 2026 06:28:19 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>免费「隐形」AI 模型 SWE Atlas 跑赢商业对手</title>
		<link>https://mylogs.cn/big-pickle-swe-atlas-50-8/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 16 Aug 2026 06:28:04 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 编程]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[SWE Atlas]]></category>
		<category><![CDATA[大模型评测]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[软件工程]]></category>
		<guid isPermaLink="false">https://mylogs.cn/big-pickle-swe-atlas-50-8/</guid>

					<description><![CDATA[一款身份未公开的免费 AI 编程模型，在业内最难啃的软件工程评测之一上，跑出了超越同脚手架类别所有商业模型的成 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">一款身份未公开的免费 AI 编程模型，在业内最难啃的软件工程评测之一上，跑出了超越同脚手架类别所有商业模型的成绩。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8187db2efbf&quot;}" data-wp-interactive="core/image" data-wp-key="6a8187db2efbf" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header.webp" alt="免费「隐形」AI 模型 SWE Atlas 跑赢商业对手" class="wp-image-5059" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header-768x384.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：GitHub／PhillipChaffee/big-pickle-swe-atlas 项目页</figcaption></figure>





<h2 class="wp-block-heading">一次非官方的越级挑战</h2>



<p class="wp-block-paragraph">big-pickle 是 OpenCode Zen 平台上处于「隐形」（stealth）期的免费模型，其真实身份至今没有官方确认。从泄露的提供方报错与接口签名看，它背后很可能由 DeepSeek 的基础设施在支撑。一名开发者（GitHub 账号 PhillipChaffee）在 2026 年 8 月 11 日用它完整跑完了 Scale AI 的 SWE Atlas Codebase QnA 评测：全部 124 道任务解出 63 道，任务解决率达到 50.8%。</p>



<p class="wp-block-paragraph">SWE Atlas 的 Codebase QnA 任务要求模型在读懂一整个大型代码库的基础上回答工程问题，比单纯写函数更接近真实研发场景。该评测严格遵循 Scale 公开的协议——使用官方开源框架 Harbor v0.18.0、与排行榜上非第一方模型一致的 mini-swe-agent 2.4.6 极简脚手架，并以 Scale 指定的 claude-opus-4-5 作为裁判模型。整轮消耗的 6.74 亿个输入 token、430 万个输出 token 全部免费。</p>



<h2 class="wp-block-heading">横向对比：免费模型的越级表现</h2>



<p class="wp-block-paragraph">放在 SWE Atlas QnA 官方排行榜（2026 年 7 月 28 日更新）中，big-pickle 的成绩意味着：在相同的 Mini-SWE-Agent 脚手架类别里，它压过了榜单上所有条目，包括 GLM 5.2（48.12%）与 GPT-5.6-Sol（46.00%）。在整个榜单中，只有运行在原生 Claude Code 脚手架上的 Opus 5（63.17%）与 Opus 4.8（57.26%）略高。</p>



<p class="wp-block-paragraph">分语言看，TypeScript 解决率 58.1%（18/31）、Python 55.2%（16/29）、Go 50.0%（19/38）、C 语言 38.5%（10/26）；分任务类型看，代码上手（Code Onboarding）60.7%、架构与系统设计 52.3%、根因分析 45.9%、安全类 45.5%。</p>



<h2 class="wp-block-heading">结果可以独立核查</h2>



<p class="wp-block-paragraph">开发者在仓库中放出了逐任务的裁判日志、运行配置与复现脚本，任何人都能审计。需要说明的局限包括：每个任务只跑了一次（官方协议跑三次取均值，单次标准误约正负 4.5 个百分点）；沙箱资源被主动调低至 4 CPU / 8 GB（而非声明的 16/16），但 124 条轨迹的扫描显示零超时、零内存溢出，说明这只会压低而非抬高分数；模型身份未知，结果只是 2026 年 8 月 11 日当天该别名的快照。即便把两道未评分任务按「不通过」计，严格下界 49.2% 仍高于所有 Mini-SWE-Agent 榜单条目。</p>



<p class="has-small-font-size wp-block-paragraph">来源：GitHub（PhillipChaffee/big-pickle-swe-atlas）、Scale AI SWE Atlas</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
