同一句话喂 11 个 AI,结果差出 200 倍

同一句话喂 11 个 AI,结果差出 200 倍

同一个问题,交给不同的大模型,得到的答案可能天差地别。Netlify 产品经理 Elad Rosenheim 做了一组有趣的实验:把同一段建站提示词,分别丢给 11 个主流大模型,每个模型跑三次,记录它们消耗的积分和产出的差异。结论很直观——选对模型,成本和效果能差出两百倍。

实验怎么做的

实验场景设定为「社区咖啡馆单页网站」:要求包含营业时间、地址、简短菜单和一张照片,并且「除非我自己修改,否则内容不应变动」。这段文字没有给任何真实素材,只用一个「社区」来暗示方向。

参与测试的 11 个模型分别是:Claude Opus 5、Claude Sonnet 5、GPT 5.6 Sol、Gemini 3.6 Flash、Kimi K3、Gemini 3.1 Pro、GPT 5.6 Terra、DeepSeek V4 Pro、GLM 5.2、Kimi K2.7 Code,以及 DeepSeek V4 Flash(0731 最新版)。每个模型都独立运行三次。

成本差距触目惊心

按每次运行的平均积分消耗排序,差距相当惊人:

  • Claude Opus 5:平均 519(其中一次飙到 1055)
  • Claude Sonnet 5:平均 143
  • GPT 5.6 Sol:平均 141
  • Gemini 3.6 Flash:平均 103
  • Kimi K3:平均 102
  • Gemini 3.1 Pro:平均 53
  • GPT 5.6 Terra:平均 39
  • DeepSeek V4 Pro:平均 37
  • GLM 5.2:平均 27
  • Kimi K2.7 Code:平均 19
  • DeepSeek V4 Flash(0731):平均仅 2.4

最贵的 Claude Opus 5 与最便宜的 DeepSeek V4 Flash,平均成本相差超过两百倍。值得注意的是,Opus 5 那次 1055 积分的运行「细节满满、令人惊喜」,自带可动画的印章式文字、自定义地图和开箱即用的深色模式;而两次 253、249 积分的运行「也不差」,但矢量图形仍显露出大模型能力的边界。

贵的未必更好,便宜的也未必差

成本高低并不直接等于质量高低。文章观察到几个有意思的现象:

GPT 5.6 Sol 虽然是「低强度」档位,却在基础设计直觉上胜过了 Anthropic 的中端模型,内容更丰富,只是配图偏通用。DeepSeek V4 Flash 虽然最便宜,某次运行却「最像中端闭源模型」,且消耗的积分最少。

反过来,被寄予厚望的 Kimi K3 在本轮设计任务里「并不出彩」——它本是为长程智能体任务打造的前沿模型,需要换一种提示方式才能公平评判。GLM 5.2 三次运行风格差异大到「像来自几个不同的模型」,且当前版本是纯文本模型,无法接收图片输入。

启示:先想清楚要什么

作者给出的阶段性结论是:当任务超出「做个简单网站」,真正的问题变成——模型是否懂得调用平台能力(数据库、AI、鉴权),是否能严格自检并做前端校验(图片输入是关键)。在仅做设计与文案的测试里,Opus 5 最巧妙,却并非必需;预算有限时,选用开箱即用或迭代式简单模型更划算。

Netlify 与 OpenRouter 合作,通过 AI Gateway 和 Agent Runners 提供多种模型接入。Agent Runners 内置完整的编码智能体,支持 Claude Agent、OpenAI Codex、Gemini CLI,并新增 OpenCode 以接入 Kimi K3、GLM 5.2、DeepSeek V4 等开源模型。

来源:Netlify 博客(作者 Elad Rosenheim,Principal Product Manager),原文发布于 2026 年 8 月 12 日。