行业研报汽车零部件有原文

汽车行业深度报告:AI系列深度18期:生成智能如何引入Transformer?

查看原始报告

这篇研报讲什么?

摘要原文摘录

生成式视觉的本质,是学习图像数据背后的分布规律,并在文本条件下生成新内容。本轮生成式视觉的核心范式迁移发生在GAN与Diffusion之间;扩散以更稳定的加噪—去噪学习确立生成主干,其潜空间建模与交叉注意力机制,也为Transformer的介入预留了接口。不同于语言领域中Transformer对RNN的快速替代,其在视觉生成任务中沿序列生成、条件编码、骨干…

研究对象汽车零部件
发布机构东吴证券
分析师黄细里
发布日期2026-08-07
原始报告提供原始报告入口

机构观点归属东吴证券,研报雷达仅作摘要整理与机构观点聚合。以下为研报摘要原文摘录,内容以原始报告为准。

研究对象汽车零部件
股票代码不适用
公司共识评级样本不足近 180 天暂无有效评级
一致目标价样本不足近 180 天暂无有效目标价

研报摘要

摘要原文以原始报告为准

投资要点

生成式视觉的本质,是学习图像数据背后的分布规律,并在文本条件下生成新内容。本轮生成式视觉的核心范式迁移发生在GAN与Diffusion之间;扩散以更稳定的加噪—去噪学习确立生成主干,其潜空间建模与交叉注意力机制,也为Transformer的介入预留了接口。不同于语言领域中Transformer对RNN的快速替代,其在视觉生成任务中沿序列生成、条件编码、骨干替换与多模态扩展四个环节渐进渗透,

以代表论文为锚,我们将2013年以来生成式视觉的发展划分为五个阶段:VAE与GAN奠基(2013—2015年)、GAN主导高真实感生成(2016

2019年)、扩散复兴与理论统一(2020—2021年)、文生图爆发(2022年)、DiT与视频/多模态扩展(2023年至今)。

Transformer进入生成式视觉领域,经历了由局部模块引入到核心架构替换的渐进式演进。早期阶段,Transformer主要作为自回归生成器,将文本与图像表示统一为离散token序列,实现视觉内容的序列化建模:2021年DALL·E将文本token与图像token联合建模,证明图像可被token化、并以类似语言模型的方式生成。随后,随着CLIP等视觉语言模型的发展,Transformer进一步承担文本语义编码与条件信息注入功能,通过跨模态对齐提升对文本指令的理解能力;Imagen与StableDiffusion则推动大语言模型编码器与扩散模型相结合。

随着视觉数据token化与大规模训练范式的发展,Transformer开始进入生成模型的核心模块。2023年DiT以Transformer替代传统扩散模型中的U-Net骨干网络,在潜空间图像patch上建模,验证了视觉生成同样具备规模化扩展潜力;不过其改变的是网络骨干,而非扩散去噪范式本身。进一步来看,Transformer正逐步成为视频与多模态生成系统的统一建模框架,推动生成模型由单图创作向连续时空与多模态交互演进。整体而言,相比语言领域对RNN架构的全面替代,Transformer在视觉生成领域更多体现为渐进式渗透:从生成器、条件编码器到核心骨干网络逐步深化。

我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。

风险提示

技术迭代与产品化落地不及预期的风险;视频与多模态生成的时间一致性与可控性不及预期的风险;大模型厂商ARR增速放缓、云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。

同公司研报

继续比较不同机构对同一公司的判断。

进入公司页

同行业近期研报

从单家公司继续回到行业研究。

进入行业专题