Google发布Nano Banana 2.1:图像编辑能力大幅提升 人物和物体一致性进一步增强
Google正式推出新一代图像生成与编辑模型Nano Banana 2.1。作为Nano Banana 2的升级版本,新模型重点强化了图像编辑、视觉设计、文字渲染以及主体一致性等能力,并已经开始陆续进入Gemini以及Google面向消费者和企业用户的多项AI产品。

Nano Banana 2.1本质上是一个高效率的图像生成和编辑模型,底层基于Gemini 3.6 Flash。Google表示,新模型在保持较高生成速度和成本效率的同时,进一步提升了图像质量、提示词遵循能力以及多轮编辑中的主体一致性。
其中最明显的改进之一是人物和主体的一致性。在过去的AI图像编辑中,用户连续修改同一张图片时,人物的脸部特征、发型、服装以及身体比例可能逐渐发生变化,甚至同一个人物在不同图片中看起来像不同的人。Nano Banana 2.1针对这一问题进行了进一步优化。
新版模型支持最多14张参考图片进行融合,可以同时利用多张图片中的人物、物体和场景信息。其中最多可以保持4个人物角色的一致性,同时最多支持10个物体的特征保持。
这意味着用户可以把多张人物照片、产品照片或场景照片同时交给模型,让AI根据这些参考图生成新的组合画面,同时尽可能保留原始主体的外观特征。
在实际图像编辑方面,Nano Banana 2.1还强化了局部修改能力。用户可以指定图片中的某一个区域进行修改,而尽可能保持其他部分不发生变化。例如可以更换人物服装、调整背景、修改物体颜色或者改变场景中的某一个元素,而不需要重新生成整张图片。
Google还特别改进了基于遮罩和涂鸦的编辑功能。用户可以直接在图片上圈出希望修改的区域,然后通过文字描述告诉AI需要进行什么改变。相比过去必须精确描述图片整体内容,这种方式更加接近传统图像处理软件中的局部编辑工作流程。
对于设计师和内容创作者而言,文字渲染也是此次更新的重要部分。Nano Banana 2.1进一步提高了海报、信息图表和其他包含大量文字的图片生成能力,并增强了复杂布局的准确性。
Google官方测试显示,新模型在信息图表设计和文字事实准确性方面都有明显提升。不过,Google也承认,小字号文字、较长段落以及复杂页面中的文字仍然可能出现模糊、错误或者布局异常,因此它并没有完全解决AI生成图片中的文字问题。
Nano Banana 2.1还加入了Google Search和Google Image Search的内容关联能力。模型可以结合Google搜索获得的信息生成图片,这对于需要现实世界知识、准确产品信息或者特定场景资料的图像创作尤其有用。
例如,在制作涉及历史人物、地理环境、产品信息或者复杂信息图表的图片时,模型可以利用搜索信息减少完全依靠模型内部知识生成内容所产生的错误。
Google同时提供了不同级别的“Thinking”模式,包括minimal、medium和high。用户或者开发者可以根据任务复杂程度选择不同的推理强度,在生成速度、成本和最终效果之间进行取舍。
在输出方面,Nano Banana 2.1支持1K、2K和4K分辨率,其中1K是默认输出规格。对于宽幅和全景图片,Google还修复了此前可能出现的拼接纹理异常问题,目前支持包括1:4、4:1、1:8和8:1在内的超宽比例。
Google公布的内部测试结果显示,Nano Banana 2.1在多个图像生成和编辑项目上都超过了上一代模型。在总体图像生成偏好度测试中,启用Thinking的Nano Banana 2.1得分为1050,而Nano Banana 2为990,Nano Banana Pro则为935。
在图像编辑方面,新模型的优势更加明显。在多人物一致性测试中,Nano Banana 2.1的得分达到1106,而Nano Banana 2为978;在多参考图编辑测试中,新模型得分达到1066,同样明显领先于上一代产品。
不过,Google也没有将Nano Banana 2.1描述为一个已经解决所有问题的图像模型。官方模型卡显示,新模型仍然可能出现幻觉,人物与输入图片之间的特征一致性也不是100%可靠。在某些编辑任务中,模型还可能错误保留原始人物的姿势,或者混淆图片中的左右空间关系。
此外,复杂的三维空间理解、世界知识以及事实准确性仍然存在改进空间。
Nano Banana 2.1已经开始进入Google旗下多个AI产品和开发平台,包括Gemini应用、AI Mode、Flow、Google AI Studio以及Google Stitch等。这意味着开发者和普通用户都将能够在不同场景中直接使用这一新模型,而不需要等待第三方应用完成适配。
对于普通用户而言,Nano Banana 2.1最大的变化并不是简单地“生成更漂亮的图片”,而是让AI图像编辑越来越接近真正的创作工具。用户可以先生成一张图片,然后继续通过自然语言不断修改其中的服装、人物、背景、物体和文字,而模型需要在每一次修改过程中尽可能保持原有内容不变。
这种多轮编辑能力也是当前AI图像生成模型竞争的重点之一。过去的AI绘图往往是“一次生成、重新抽卡”,而现在模型开始逐渐向“生成—局部修改—再次修改—保持主体一致”的连续创作模式转变。
随着Nano Banana 2.1的推出,Google显然希望进一步巩固自己在AI图像生成和编辑领域的优势。相比单纯追求单张图片的视觉质量,新模型更加重视连续编辑、参考图融合、主体一致性以及复杂设计任务,这也使AI图像生成开始从“生成器”进一步向完整的AI视觉设计工具发展。
