谷歌于 10 月 7 日正式发布 Nano Banana 2.1,这是其 AI 图像生成与编辑模型的升级版本。新版在视觉设计、基于蒙版的局部编辑以及主体一致性三个方面进行了重点强化,并已在 Gemini 应用、Google 搜索 AI 模式、AI Studio 等平台逐步上线。

三重能力升级
谷歌将本次更新的核心落在三个方向。其一是视觉设计:Nano Banana 2.1 能够生成构图更合理、完成度更高的视觉素材,更适合直接用于海报、封面等设计场景。其二是蒙版编辑:用户可以更精准地选中并修改现有图像的局部区域,无需为调整一处细节而重新生成整张画面。其三是主体一致性:在执行编辑或批量生成多张关联图片时,模型能更好地保留画面中人物或物体的样貌与特征,保证同一个主体在多次生成结果中保持统一。
对 Gemini 用户而言,改进后的主体一致性尤为实用——在制作同一角色的系列插画、或需要保持产品外观不变的电商素材时,不必再反复修正前后不一致的问题。
定位与部署范围
今年早些时候,谷歌推出了 Nano Banana 2(也称 Gemini 3.1 Flash Image)。该版本在保留 Flash 系列高速特性的同时,达到了与 Nano Banana Pro 同级别出图质量,并把现实世界知识库、文字渲染优化、角色与物体一致性等多项原本属于 Pro 版本的能力下放到了定位更低的模型上。
Nano Banana 2.1 现已逐步部署,覆盖 Gemini 应用、谷歌搜索的 AI 模式、Google AI Studio、Google Flow、Stitch、谷歌广告以及 Gemini 企业平台。面向开发者,该模型已正式开放,对应模型 ID 为 gemini-nano-banana-2.1;它支持文本、图片、音频与视频输入,并可输出 1K、2K 与 4K 分辨率的图像。
与同行的横向对比
在图像生成编辑领域,竞争依旧激烈。目前 OpenAI 的 ChatGPT Images 2.5 仍被视为全球领先的图像生成编辑模型——在用户持续微调一张图片时,它更擅长保留上一轮的修改成果,不会改动未编辑区域,也不会因反复迭代而让原图画质变差。紧随其后的是微软 AI 的 MAI-Image-2.6 模型,该模型于今年 8 月发布。
谷歌此次将 Nano Banana 2.1 的能力进一步下放到更普惠的模型中,意味着普通用户与开发者都能以更低门槛获得接近专业级的图像编辑体验。对于依赖批量出图、品牌素材一致性的设计与营销工作流,主体一致性与蒙版编辑的增强,的实际价值最为突出。







