你给 AI 下过最离谱的指令是什么?

一个独立开发者最近让 14 款主流大模型做同一件事:画一只带有“哈布斯堡下巴”的青蛙 SVG。这个下颌前突的遗传特征本是欧洲皇室近亲结婚的产物,现在成了检验模型是否“听话”又“不瞎编”的基准测试。
测试覆盖 Claude 5 系列、GPT-5.5 / GPT-5.4-mini、Gemini 2.5 Pro / 3.6 Flash、Grok 4.5、DeepSeek-v4-pro、Kimi k3、GLM-5.1、Qwen3.7-Max、Llama 4 Maverick、Mistral Large 2512。每个模型跑 3 次,记录耗时和输出体积。
成绩差得离谱
结果差异巨大。Llama 4 最快,6.9 秒、仅 536 字节;Kimi k3 最慢,169.1 秒。最“戏精”的是 Gemini 3.6 Flash,生生给青蛙加了皇室项圈、金羊毛勋章和阴郁表情;DeepSeek-v4-pro 则给青蛙穿上长袍,脑补出“傲慢俯视”的解说词。
说白了,这个测试看的不是谁画得好看,而是谁能按要求干活、不多加戏。在代码和图形生成场景里,后者比前者重要得多——你今天让它画只青蛙,明天可能就是让它生成一段控制代码,多出来的“皇室想象”就是 bug。
你的判断标准该更新了
下次你想快速判断一个 AI 是“直男”还是“戏精”,不妨也丢一个精确到细节的奇怪任务给它。看它到底是按指令执行,还是忍不住自我发挥。
来源:Frogs — the Habsburg-jaw SVG benchmark(frogs.vaguespac.es)
