计算机行业:AI智道(1),DEEPSEEK R1潮涌AI INFRA领航250207
这篇研报讲什么?
摘要原文摘录1月20日,深度求索旗下DeepSeek-R1模型(DeepSeek以下简称为“DS”)正式发布。我们观察到,其创新架构带来的高效性能优化与极致算力使用率、128K上下文长度和每百万输出词仅2.19美金的成本压控,以及对开源创新精神的坚持在全球科技界引起热烈讨论。在开源背景下,我们预期将有更多企业兼容接入DS系列模型,一方面,在推理侧基于DS等模型的Al应…
机构观点归属中金公司,研报雷达仅作摘要整理与机构观点聚合。以下为研报摘要原文摘录,内容以原始报告为准。
研报摘要
1月20日,深度求索旗下DeepSeek-R1模型(DeepSeek以下简称为“DS”)正式发布。我们观察到,其创新架构带来的高效性能优化与极致算力使用率、128K上下文长度和每百万输出词仅2.19美金的成本压控,以及对开源创新精神的坚持在全球科技界引起热烈讨论。在开源背景下,我们预期将有更多企业兼容接入DS系列模型,一方面,在推理侧基于DS等模型的Al应用蓬勃发展将拉动Al Infra的需求;另一方面,Al Infra的落地也将提升对存储、算力等基础资源的使用率。在Al产业飞轮螺旋向上进发的同时,我们认为Al Infra将受益于“掘金卖铲”逻辑。
评论
DeepSeek R1进行了哪些Infra层的创新?我们在《人工智能十年展望(十二)》详细拆解了Al产业的基础软件堆栈并梳理了AI工作流,相应地,1)数据准备:引入冷启动数据并利用多阶段的训练数据。DS团队通过收集数千个长思维链(CoT)数据微调V3-Base模型作为多阶段强化学习的起点。2)模型训练:推理导向的多阶段强化学习(RL)训练与创新的奖励机制。DS团队基于V3-Base应用组相对策略优化(GRPO)强化学习框架训练R1-Zero模型,降低训练成本;然后引入冷启动数据,并针对R1-Zero存在的可读性、语言混乱等问题引入语言一致性奖励。3)模型部署和推理:独立优化预填充、解码阶段的资源分配。通过拆分工作流、使用多种并行策略提升效率、引入负载均衡策略平衡GPU工作量等措施,提高了模型的推理效率与资源利用率,增强了系统稳定性。
同公司研报
继续比较不同机构对同一公司的判断。
同行业近期研报
从单家公司继续回到行业研究。