OpenAI 和谷歌前后脚发布了新一代 AI 模型:GPT-5.6 与 Gemini 3.6 Flash。两家都在强调编程和开发者能力,但这两款模型同时也驱动着普通用户日常使用的 ChatGPT 和 Gemini。TechRadar 的 AI 高级编辑 Graham Barlow 没有跑编程基准测试,而是做了一个更贴近生活的实验:把自己一周的全部数字生活交给两个 AI,看谁能真正帮上忙。

测试方法:一句话考验真功夫
这次对比中,Gemini 3.6 Flash 对阵默认中等推理档位的 GPT-5.6 Sol——两者都是付费订阅用户日常使用的标准主力模型。测试者向两个 AI 上传了同样一批杂乱的个人数据:银行流水、日历(应用授权加另一账户的日历截图)、购物小票、Gmail 邮件、WhatsApp 聊天截图、厨房橱柜照片、一张电费单、差旅预订和手写笔记。
随后只给出一条完全相同的指令:”告诉我这周该做的所有事情。”这个看似简单的要求,实际逼着 AI 综合多个信息源、分清轻重缓急、发现截止日期、调和相互冲突的信息,最后给出可执行的行动清单——正是人们越来越期待 AI 助理解决的真实问题。
结果对比:一个念文件,一个给方案
两者的表现可谓天壤之别。Gemini 3.6 Flash 基本忽略了照片,只盯着日历截图看,第一轮回答大多在复述日历上已有的日程。在被明确追问”其他图片里能推断出什么”之后,它才补充了一些建议,并把信息分成工作、购物、健身、笔记、票据等类别,条理不错。但它没有发现日历里当晚有两个时间冲突的活动,也几乎没给出优先级排序和下一步行动建议。
ChatGPT 响应时间明显更长,答案却有用得多:它从 WhatsApp 截图中推断出周五太极课出勤率可能偏低,建议测试者考虑是否还有必要开课;注意到瑜伽课已被取消;发现了日历中两个冲突的活动并提醒必须二选一。它还汇总了所有小票金额、给出处理建议,并对手写笔记做了像样的辨认。最关键的是,它把所有信息整理成了未来一周逐日计划,还标出最紧急的三件事,让人一眼知道从哪下手。
差距在哪
测试者的结论很直白:Gemini 告诉用户文件里”有什么”,ChatGPT 则想清楚了用户”该做什么”。谷歌宣称 Gemini 3.6 Flash 在编程、知识工作和多模态方面均有提升,这或许属实,但在这场多模态实战里,它输得没有悬念。当考题从跑分换成理解真实生活时,ChatGPT 的推理明显更胜一筹。
来源:TechRadar
发表回复