海外科技行业:GPT4o更新,图像生成能力大幅度提升-周报250330
这篇研报讲什么?
摘要原文摘录GPT4o 模型更新,付费用户已可使用。OpenAI 于 2024 年 5 月 13 日正式发布了 GPT-4o,这是一款支持多模态输入输出的模型,涵盖文本、语音、图片和视频,并以免费开放的形式向所有用户推出。2025 年 3 月 26 日,OpenAI 对GPT-4o 进行了功能更新,重点提升了图像生成功能,使其生成的图片质量媲美人类摄影,同时优化了多指…
机构观点归属华创证券,研报雷达仅作摘要整理与机构观点聚合。以下为研报摘要原文摘录,内容以原始报告为准。
研报摘要
GPT4o 模型更新,付费用户已可使用。OpenAI 于 2024 年 5 月 13 日正式发布了 GPT-4o,这是一款支持多模态输入输出的模型,涵盖文本、语音、图片和视频,并以免费开放的形式向所有用户推出。2025 年 3 月 26 日,OpenAI 对GPT-4o 进行了功能更新,重点提升了图像生成功能,使其生成的图片质量媲美人类摄影,同时优化了多指令解析、技术问题处理、逻辑推理和创造力表现。2025 年 3 月 28 日,升级版 GPT-4o 已面向所有付费用户开放,而免费用户仍需等待数周才能使用。此次更新进一步巩固了 GPT-4o 在生成式人工智能领域的领先地位,尤其是在图像生成和多模态交互方面取得了显著突破。
GPT4o 模型多功能升级,图像领域尤为明显。GPT4o 模型此次功能更新,主要集中于以下几个方面:1)图像生成功能:GPT-4o 的图像生成功能得到了显著提升,能够精准理解文本描述并生成高质量的图像。该功能支持生成包含多达 15 到 20 个对象的复杂图像,同时保持对象属性和上下文的一致性。此外,GPT-4o 能够准确呈现文本内容,例如在生成的图像中完全还原白板上的文字。2)多指令解析优化:GPT-4o 在处理复杂指令方面的能力大幅提升,能够更好地理解包含多重需求的指令,从而提高用户交互体验。3)技术问题处理增强:在解决复杂技术和编程问题方面,GPT-4o 的表现更加出色,能够提供更精准的解析和解决方案。4)逻辑推理与创造力提升:GPT-4o 在跨领域知识整合和创新性思维方面取得了显著进步,能够为用户提供更启发性的建议和解决方案。5)交互界面优化:减少了表情符号的使用频率,优化了专业场景下的对话体验,使 AI 在正式场合的沟通更加高效。
GPT-4o 自发布以来迅速爆火,其图像生成功能尤为引人注目。图像生成功能不仅能够精准呈现复杂文字内容与排版需求,还能生成高质量、实用性强的图像,如菜单、路牌等,极大地提升了用户体验。用户只需简单描述,模型便能准确呈现文本细节,甚至捕捉到摄影细节的真实感。其创新的自回归框架使得用户能够通过简单的文本指令生成高质量的图像,尤其是吉卜力风格的图像,这一功能在社交媒体上迅速走红。用户们纷纷上传自己的照片,并将其转换为宫崎骏风格的艺术作品,形成了“吉卜力风潮”,甚至连 OpenAI 首席执行官萨姆·奥尔特曼也换上了吉卜力风格的头像。
模型不断迭代,多模态功能快速更新,我们认为相关应用侧有望快速发展并快速渗透,建议关注以下标的:1)办公:MSFT;2)金融:AFRM、UPST、SOFI、LMND;3)工业:CDNS、SNPS;4)医疗:TEM、RXRX、DOCS、HIMS、VEEV;5)创意:ADOBE;6)教育:DUOL;7)电商:SHOP、SEA;8)企业服务软件:SAP、CRM、NOW、TEAM、ORCL、WDAY、HUBS、FRSH、CXM;9)安全:PANW、CRWD、NET、FTNT;10)数据基建:ESTC、SNOW、MDB;11)云服务提供商:AMZN、META、MSFT、GOOG、ORCL;12)广告:APP、U、ZETA 等。
同公司研报
继续比较不同机构对同一公司的判断。
同行业近期研报
从单家公司继续回到行业研究。