计算机行业:谷歌图像模型Nano Banana火爆上线,关注多模态AI应用发展250909
这篇研报讲什么?
摘要原文摘录本报告导读:谷歌 Gemini-2.5-flash-image-preview——代号Nano-Banana模型正式上线,引领多模态 AI 模型与应用发展新方向。
机构观点归属海通国际,研报雷达仅作摘要整理与机构观点聚合。以下为研报摘要原文摘录,内容以原始报告为准。
研报摘要
本报告导读:谷歌 Gemini-2.5-flash-image-preview——代号Nano-Banana模型正式上线,引领多模态 AI 模型与应用发展新方向。
投资要点
投资建议。我们认为,谷歌 Gemini-2.5-flash-image-preview——代号Nano-Banana 模型在多模态 AI 领域另辟蹊径,其 SOTA 图像生成和编辑能力、强角色一致性和闪电的速度,便于用户高效处理已有的图片素材,无论是在生产力场景还是创意场景,已展现出超强的实用性与惊人的图像效果,建议关注多模态模型与应用迭代带来的发展机会。建议关注标的:万兴科技、虹软科技、金山办公、合合信息、福昕软件、迈富时;受益标的:当虹科技。谷歌上线图像新模型,具有 SOTA 的图像生成和编辑能力。近日,AI社区一款名叫 Nano-Banana 的图像生成与编辑模型备受关注,起初它在 LMArena 平台的 Battle 模式中被发现,随后谷歌正式宣布上线该模型,正式名字为 Gemini-2.5-flash-image-preview,其具备 SOTA 的图像生成和编辑能力、强大的角色一致性以及闪电般的速度。在Artificial Analysis 文生图与图像编辑两个排行榜上,该模型均已经跃升至第一位,领先于字节即梦 3.0、GPT-4o、快手可灵 2.1、QwenImage-Edit 等模型。此外,Gemini-2.5-flash-image-preview 在 LMArena文生图与图像编辑两个排行榜上同样位居第一名。生产力与创意场景广泛应用,实现方便快捷的 PS。Gemini-2.5-flashimage-preview 的特性包括:1)充分保持角色的一致性:它可以将同一个角色置于不同的环境中,或者从多个角度展示同一款产品,高度还原角色的面部特征、表情和姿态等。2)基于提示的图片编辑:允许用户通过简单的自然语言指令,对图片进行精准的局部修改,包括背景替换、风格转换、动作或手势迁移等。3)融合 Gemini 的现实世界知识:可借助 Gemini 强大的世界知识库,让图像生成变得更加智能。4)多图像融合:可以将一张图片中的物体放进另一张图片的场景里或者多个图片的拼接融合。5)成本低廉:生成每张图像的成本大约为 0.039 美元(约 0.28 元),远低于 OpenAI 的图像生成成本(0.19 美元)。我们认为,该模型实现了对图片的精准掌控,可延伸出丰富的玩法,也可以满足生产力需求。原生图像生成与多模态理解方面实现了紧密结合。Gemini-2.5-flashimage-preview 在原生图像生成与多模态理解方面实现了紧密结合:图像理解为生成提供信息,生成又反过来强化理解,两者相辅相成,背后是谷歌 Gemini 团队与 Imagen 团队的强强联合。Gemini 团队是模型的大脑,他们赋予模型世界知识、强大的逻辑推理和指令遵循能力,Gemini 的终极目标是整合所有模态,向 AGI 方向迈进;Imagen团队专注文本到图像任务,则像是模型的艺术总监,拥有被磨练出的、极其敏锐的审美品味。未来模型能力有望朝着进一步的智能性、事实性与功能性演进。
风险提示。AI 技术迭代不及预期;商业化进展不及预期;市场竞争加剧。
同公司研报
继续比较不同机构对同一公司的判断。
同行业近期研报
从单家公司继续回到行业研究。