行业研报计算机有原文

计算机行业:AI智道(1),DEEPSEEK R1潮涌AI INFRA领航250207

查看原始报告

这篇研报讲什么?

摘要原文摘录

1月20日,深度求索旗下DeepSeek-R1模型(DeepSeek以下简称为“DS”)正式发布。我们观察到,其创新架构带来的高效性能优化与极致算力使用率、128K上下文长度和每百万输出词仅2.19美金的成本压控,以及对开源创新精神的坚持在全球科技界引起热烈讨论。在开源背景下,我们预期将有更多企业兼容接入DS系列模型,一方面,在推理侧基于DS等模型的Al应…

研究对象计算机
发布机构中金公司
分析师于钟海
发布日期2025-02-07
原始报告提供原始报告入口

机构观点归属中金公司,研报雷达仅作摘要整理与机构观点聚合。以下为研报摘要原文摘录,内容以原始报告为准。

研究对象计算机
股票代码不适用
公司共识评级样本不足近 180 天暂无有效评级
一致目标价样本不足近 180 天暂无有效目标价

研报摘要

摘要原文以原始报告为准

1月20日,深度求索旗下DeepSeek-R1模型(DeepSeek以下简称为“DS”)正式发布。我们观察到,其创新架构带来的高效性能优化与极致算力使用率、128K上下文长度和每百万输出词仅2.19美金的成本压控,以及对开源创新精神的坚持在全球科技界引起热烈讨论。在开源背景下,我们预期将有更多企业兼容接入DS系列模型,一方面,在推理侧基于DS等模型的Al应用蓬勃发展将拉动Al Infra的需求;另一方面,Al Infra的落地也将提升对存储、算力等基础资源的使用率。在Al产业飞轮螺旋向上进发的同时,我们认为Al Infra将受益于“掘金卖铲”逻辑。

评论

DeepSeek R1进行了哪些Infra层的创新?我们在《人工智能十年展望(十二)》详细拆解了Al产业的基础软件堆栈并梳理了AI工作流,相应地,1)数据准备:引入冷启动数据并利用多阶段的训练数据。DS团队通过收集数千个长思维链(CoT)数据微调V3-Base模型作为多阶段强化学习的起点。2)模型训练:推理导向的多阶段强化学习(RL)训练与创新的奖励机制。DS团队基于V3-Base应用组相对策略优化(GRPO)强化学习框架训练R1-Zero模型,降低训练成本;然后引入冷启动数据,并针对R1-Zero存在的可读性、语言混乱等问题引入语言一致性奖励。3)模型部署和推理:独立优化预填充、解码阶段的资源分配。通过拆分工作流、使用多种并行策略提升效率、引入负载均衡策略平衡GPU工作量等措施,提高了模型的推理效率与资源利用率,增强了系统稳定性。

同公司研报

继续比较不同机构对同一公司的判断。

进入公司页

同行业近期研报

从单家公司继续回到行业研究。

进入行业专题