IT之家10月7日消息,谷歌于今日正式发布了Nano Banana2.1,这是该公司AI图像生成与编辑模型的升级版本。谷歌强调,新版Nano Banana2.1实现了全方位提升,在视觉设计、基于蒙版的图像编辑以及主体一致性这几方面的进步尤为突出。
今年早些时候,谷歌推出了Nano Banana2,也被称作Gemini3.1Flash Image。Nano Banana2在拥有谷歌Flash系列模型高速特性的同时,实现了与Nano Banana Pro同级别的出图质量。谷歌还把多项原本属于Pro版本的功能下放至这款定位更低的模型,包括现实世界知识库、文字渲染效果优化,还有角色与物体的一致性表现提升。
IT之家注意到,Nano Banana2.1在原有能力的基础之上,主要在三大方向做出改进:
视觉设计:Nano Banana2.1可以生成构图效果更佳、完成度更高的视觉素材。
蒙版编辑:用户能够更加精准地选中并修改现有图像的局部区域,无需重新生成整张画面。
主体一致性:在执行编辑操作或者批量生成多张关联图片的时候,模型可以更好地保留画面主体的样貌与特征。
改进后的主体一致性对于Gemini用户而言实用性很强,可以保证同一个人物或者物体在多次生成结果当中保持样貌统一。谷歌Nano Banana2.1现已逐步部署上线,覆盖Gemini应用、谷歌搜索的AI模式、Google AI Studio、Google Flow、Stitch、谷歌广告以及Gemini企业平台。
面向开发者,Nano Banana2.1已经正式开放,对应的模型ID为gemini nano banana 2.1;该模型支持文本、图片、音频以及视频输入,同时可以输出1K、2K以及4K分辨率的图像。
目前,OpenAI的ChatGPT Images2.5依旧是全球领先的图像生成编辑模型。在用户持续微调一张图片时,它更擅长保留上一轮的修改成果,不会改动没有编辑的区域,也不会随着反复迭代让原图画质变差。紧随OpenAI这款产品之后的是微软(MSFT)AI的MAI Image 2.6模型,该模型于今年8月发布。
