Google图像模型“Nano Banana 2”。图片来源:Google博客

Google AI图像生成模型“Nano Banana 2”近日陷入生成质量争议,围绕其“效果不如以往”的讨论正在用户社区持续发酵。

据TechRadar当地时间5日的报道,Reddit近期出现多条相关讨论,不少用户质疑“Nano Banana 2”生成图像的质量已不及发布初期。有人表示,最近生成的图片“大多显得平淡”,即便进一步细化提示词,效果也未见明显改善。

事实上,这类质疑并非近期才出现。Reddit上早在5月就已有帖子提到“Nano Banana 2”表现退步。虽然这些反馈不足以直接证明模型性能确实下降,但至少反映出部分用户已持续感受到生成效果的变化。

7月初,Google发布了新图像模型“Nano Banana 2 Lite”。此后,Google又将“Nano Banana 2”接入Google Earth,但在出现滥用问题后,相关功能一度被临时停用。不过,目前并没有迹象显示,这些产品层面的调整直接导致原有图像模型本身发生变化。

TechRadar提到,另一种可能性在于,负责解析提示词的文本模型出现了变化。即便底层图像生成模型保持不变,只要前端模型对指令的理解和解析方式不同,最终生成结果也可能出现明显差异。报道指出,Gemini近期的变化更多集中在模型选择和组合层面,而非图像模型本体,这与上述推测存在一定吻合。

为验证用户所感受到的“性能退步”,TechRadar选取了三组场景,对ChatGPT与Gemini进行了对比测试。

在第一组“仰望天空、头顶有龙飞过”的场景中,TechRadar认为,ChatGPT生成的画面更接近真实照片,整体更自然,也更具说服力;相比之下,Gemini的结果更容易让人一眼看出是AI生成。

第二组测试为“咖啡馆内一对50多岁男女边喝咖啡边交谈”。报道指出,Gemini在人物刻画和反光处理上显得较为生硬,面部呈现也带有更明显的“恐怖谷”感;而ChatGPT虽然在细节上相对简化,但整体违和感更少。

第三组测试则是英式早餐。两款模型在食物质感和画面构图上都达到较为合格的水准,但Gemini生成的菜单文字不像真实单词。尽管这一组的差距不如前两组明显,TechRadar仍认为,ChatGPT的整体表现略胜一筹。

TechRadar更倾向于认为,与其说“Nano Banana 2”本身出现性能下滑,不如说ChatGPT的图像生成能力正在持续提升。报道指出,过去几个月,OpenAI已明显改进图像生成效果;如果“Nano Banana 2”仍停留在原有水平,用户自然更容易产生其“相对落后”的感受。不过,在生成速度方面,Gemini依然快于ChatGPT。

随着争议升温,外界讨论的焦点也正从“Google图像模型是否退步”,逐步转向Gemini的提示词理解机制,以及竞品迭代速度对用户感知的影响。换言之,用户所感受到的画质差异,不仅取决于图像模型本身,也可能与由哪种文本模型来理解指令、以及结果如何组合输出有关。

报道认为,这场争议不仅关乎“Nano Banana 2”是否真的出现质量下滑,也再次说明,AI图像生成的评价很大程度上是一种相对比较:竞品进步越快,用户预期越高,模型即使维持原有水平,也可能被认为“退步”。后续Google是否会进一步调整图像生成模型或提示词解析体系,能否缩小用户感知中的质量差距,将成为市场关注的重点。

关键词

#Google #Nano Banana 2 #Gemini #ChatGPT #AI图像生成 #提示词理解 #Reddit #TechRadar #Google Earth
版权所有 © DigitalToday。未经授权禁止转载或传播。