行业研报汽车零部件有原文

汽车行业深度报告:AI系列深度26期:云端基座模型如何在毫秒级车端跑起来

查看原始报告

这篇研报讲什么?

摘要原文摘录

学术缩放定律与车端工程约束对应不同的优化目标。Kaplan、Chinchilla等缩放定律讨论的是给定训练算力下参数量、数据量与损失之间的最优关系,其“最优”指向训练算力前沿,并未把推理成本和毫秒级实时时延纳入目标函数。将推理成本显式纳入后,部署最优点会向更小模型、更多训练数据偏移;智能驾驶则进一步强化了这一部署约束。

研究对象汽车零部件
发布机构东吴证券
分析师黄细里,童明祺
发布日期2026-08-07
原始报告提供原始报告入口

机构观点归属东吴证券,研报雷达仅作摘要整理与机构观点聚合。以下为研报摘要原文摘录,内容以原始报告为准。

研究对象汽车零部件
股票代码不适用
公司共识评级样本不足近 180 天暂无有效评级
一致目标价样本不足近 180 天暂无有效目标价

研报摘要

摘要原文以原始报告为准

投资要点

学术缩放定律与车端工程约束对应不同的优化目标。Kaplan、Chinchilla等缩放定律讨论的是给定训练算力下参数量、数据量与损失之间的最优关系,其“最优”指向训练算力前沿,并未把推理成本和毫秒级实时时延纳入目标函数。将推理成本显式纳入后,部署最优点会向更小模型、更多训练数据偏移;智能驾驶则进一步强化了这一部署约束。

车端实时性构成大模型上车的核心约束。自动驾驶模型必须在固定车规算力上满足帧率、端到端时延和功能安全要求,大型视觉Transformer叠加大语言模型难以在现有车规算力下持续满足高频推理要求。理想披露VLA推理帧率约10Hz,NVIDIA Alpamayo-R1论文披露端到端推理时延99ms,小鹏称第二代VLA指令输出时延压缩至80ms以内。

云端基座模型的效率优化主要可归纳为两类路径:一是通用模型稀疏化和注意力/KV缓存压缩,如MoE、MLA、MTP、FP8、线性注意力等;二是面向驾驶的视觉Token剪枝、动态/隐式Token和思维链压缩,用更少Token承载关键场景信息。其目标是在云端继续探索能力上限,同时降低长序列和多模态推理成本。

车端时延压缩更强调可部署性,主流范式是“云端大模型蒸馏上车+快慢双系统”。Waymo通过教师—学生蒸馏把大模型能力迁移到实时学生模型,并采用Think Fast/Think Slow架构;理想由云端基座蒸馏出车端VLA,并用扩散流匹配减少去噪步数;小鹏则以基座蒸馏和视觉思维链效率提升,降低车端推理时延。

我们归纳,未来云车分工或趋于“云端探上限、车端保实时”。云端模型负责更大规模、更复杂推理和世界模型训练,车端模型则围绕低时延、稳定性和安全冗余做压缩部署。该判断仍受蒸馏能力上限、统一评测缺失、芯片供给、量产时间表和功能安全验证约束,因此,训练侧的规模扩张逻辑不能直接外推至车端部署。

我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。

风险提示

技术迭代不及预期的风险;大模型厂商ARR增速放缓的风险;云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。

同公司研报

继续比较不同机构对同一公司的判断。

进入公司页

同行业近期研报

从单家公司继续回到行业研究。

进入行业专题