一款身份未公开的免费 AI 编程模型,在业内最难啃的软件工程评测之一上,跑出了超越同脚手架类别所有商业模型的成绩。

一次非官方的越级挑战
big-pickle 是 OpenCode Zen 平台上处于「隐形」(stealth)期的免费模型,其真实身份至今没有官方确认。从泄露的提供方报错与接口签名看,它背后很可能由 DeepSeek 的基础设施在支撑。一名开发者(GitHub 账号 PhillipChaffee)在 2026 年 8 月 11 日用它完整跑完了 Scale AI 的 SWE Atlas Codebase QnA 评测:全部 124 道任务解出 63 道,任务解决率达到 50.8%。
SWE Atlas 的 Codebase QnA 任务要求模型在读懂一整个大型代码库的基础上回答工程问题,比单纯写函数更接近真实研发场景。该评测严格遵循 Scale 公开的协议——使用官方开源框架 Harbor v0.18.0、与排行榜上非第一方模型一致的 mini-swe-agent 2.4.6 极简脚手架,并以 Scale 指定的 claude-opus-4-5 作为裁判模型。整轮消耗的 6.74 亿个输入 token、430 万个输出 token 全部免费。
横向对比:免费模型的越级表现
放在 SWE Atlas QnA 官方排行榜(2026 年 7 月 28 日更新)中,big-pickle 的成绩意味着:在相同的 Mini-SWE-Agent 脚手架类别里,它压过了榜单上所有条目,包括 GLM 5.2(48.12%)与 GPT-5.6-Sol(46.00%)。在整个榜单中,只有运行在原生 Claude Code 脚手架上的 Opus 5(63.17%)与 Opus 4.8(57.26%)略高。
分语言看,TypeScript 解决率 58.1%(18/31)、Python 55.2%(16/29)、Go 50.0%(19/38)、C 语言 38.5%(10/26);分任务类型看,代码上手(Code Onboarding)60.7%、架构与系统设计 52.3%、根因分析 45.9%、安全类 45.5%。
结果可以独立核查
开发者在仓库中放出了逐任务的裁判日志、运行配置与复现脚本,任何人都能审计。需要说明的局限包括:每个任务只跑了一次(官方协议跑三次取均值,单次标准误约正负 4.5 个百分点);沙箱资源被主动调低至 4 CPU / 8 GB(而非声明的 16/16),但 124 条轨迹的扫描显示零超时、零内存溢出,说明这只会压低而非抬高分数;模型身份未知,结果只是 2026 年 8 月 11 日当天该别名的快照。即便把两道未评分任务按「不通过」计,严格下界 49.2% 仍高于所有 Mini-SWE-Agent 榜单条目。
来源:GitHub(PhillipChaffee/big-pickle-swe-atlas)、Scale AI SWE Atlas







