行业研报汽车零部件有原文

汽车行业点评报告:AI系列深度05期:模型如何学习表征并实现对齐?

查看原始报告

这篇研报讲什么?

摘要原文摘录

表征如何组织、如何学习、如何跨模态共享?嵌入、自监督学习和CLIP分别对应三层机制:嵌入是表征的工程形态,自监督是表征的规模化学习机制,CLIP和多模态对齐则让图像与文字进入同一语义空间。本篇位于“表征是什么”与CNN/ViT、Transformer等具体架构之间,是理解后续技术路线的基础环节。

研究对象汽车零部件
发布机构东吴证券
分析师黄细里
发布日期2026-07-29
原始报告提供原始报告入口

机构观点归属东吴证券,研报雷达仅作摘要整理与机构观点聚合。以下为研报摘要原文摘录,内容以原始报告为准。

研究对象汽车零部件
股票代码不适用
公司共识评级样本不足近 180 天暂无有效评级
一致目标价样本不足近 180 天暂无有效目标价

研报摘要

摘要原文以原始报告为准

投资要点

表征如何组织、如何学习、如何跨模态共享?嵌入、自监督学习和CLIP分别对应三层机制:嵌入是表征的工程形态,自监督是表征的规模化学习机制,CLIP和多模态对齐则让图像与文字进入同一语义空间。本篇位于“表征是什么”与CNN/ViT、Transformer等具体架构之间,是理解后续技术路线的基础环节。

嵌入的本质,是把文本、图像、商品、用户等对象映射为数字向量,并使语义相近的对象在向量空间中距离更近。由此,搜索、推荐、以图搜图、向量数据库和RAG等应用,都可被理解为在高维向量空间中进行近邻检索。嵌入是抽象表征最可操作、最工程化的呈现方式。

自监督学习是通用表征规模化形成的关键机制。该方法不依赖人工逐条标注,而是利用数据自身构造训练信号,通过掩码预测、对比学习、下一个token预测等任务学习上下文、语义和结构关系。BERT、MAE、GPT等路线任务形式不同,但均通过大规模自监督训练形成可迁移表征,这是预训练获得通用能力的重要基础。

CLIP的意义在于把图像和文字对齐到同一表征空间。通过海量图文配对和对比学习,模型将正确配对的图文向量拉近、错误配对推远,使文字概念与对应图像在向量空间中自然接近。该机制成为图文检索、开放词表识别、文生图、视觉语言模型和多模态大模型的重要基础。

从表征体系看,本篇补齐三类关键问题:嵌入回答表征如何被工程化表达,自监督回答表征如何在无标注或弱标注数据中形成,CLIP回答不同模态表征如何进入同一空间。

我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。

风险提示

技术迭代不及预期的风险,大模型厂商ARR增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险。

同公司研报

继续比较不同机构对同一公司的判断。

进入公司页

同行业近期研报

从单家公司继续回到行业研究。

进入行业专题