行业研报计算机有原文

中信建投证券-DeepSeek R1深度解析及算力影响几何-20250203

查看原始报告

这篇研报讲什么?

摘要原文摘录

Deepsek发布深度推理能力模型。R1-Zero采用纯粹的强化学习训练,证明了大语言模型仅通过强化学习也可以有强大的推理能力,DeepSeekRI经历微调和强化学习取得了与OpenAL-o1-1217相媲美甚至超越的成绩。DeepSeek Rl训练和推理算力需求较低,主要原因是DeepSek RI实现算法、框架和硬件的优化协同。过去的预训练侧的scali…

研究对象计算机
发布机构中信建投
分析师于芳博,庞佳军,辛侠平
发布日期2025-02-03
原始报告提供原始报告入口

机构观点归属中信建投,研报雷达仅作摘要整理与机构观点聚合。以下为研报摘要原文摘录,内容以原始报告为准。

研究对象计算机
股票代码不适用
公司共识评级样本不足近 180 天暂无有效评级
一致目标价样本不足近 180 天暂无有效目标价

研报摘要

摘要原文以原始报告为准

核心观点

Deepsek发布深度推理能力模型。R1-Zero采用纯粹的强化学习训练,证明了大语言模型仅通过强化学习也可以有强大的推理能力,DeepSeekRI经历微调和强化学习取得了与OpenAL-o1-1217相媲美甚至超越的成绩。DeepSeek Rl训练和推理算力需求较低,主要原因是DeepSek RI实现算法、框架和硬件的优化协同。过去的预训练侧的scaling Law正逐步迈向更广阔的空间,在深度推理的阶段,模型的未来算力需求依然会呈现爆发式上涨,充足的算力需求对于人工智能模型的性能进步依然至关重要。Deepsek发布深度推理能力模型,性能和成本方面表现出色。Deepseek发布两款具备深度推理能力的大模型R1-Zero和DeepSeek-Rl。RI-Zero采用纯粹的强化学习训练,模型效果逼近OpenAI o1模型,证明了大语言模型仅通过RL,无SFT,大模型也可以有强大的推理能力。但是R1-Zero也存在可读性差和语言混合的问题,在进一步的优化过程中,DeepSeek-V3-Base经历两次微调和两次强化学习得到Rl模型,主要包括冷启动阶段、面向推理的强化学习、拒绝采样与监督微调、面向全场景的强化学习四个阶段,RI在推理任务上表现出色,特别是在AIME2024、MATH-500和Codeforces等任务上,取得了与OpenAL-o1-1217相媲美甚至超越的成绩。国产模型迈向深度推理,策略创新百花齐放。在Deepsek R1-Zero模型中,采用的强化学习策略是GRPO策略,取消价值网络,采用分组相对奖励,专门优化数学推理任务,减少计算资源消耗;KIMl1.5采用Partialrollout的强化学习策略,同时采用模型合并、最短拒绝采样、DPO和long2short RL策略实现短链推理;Qwen2.5扩大监督微调数据范围以及两阶段强化学习,增强模型处理能力。DeepSeek R1通过较少算力实现高性能模型表现,主要原因是DeepSeek R1实现算法、框架和硬件的优化协同。DeepSeek R1在诸多维度上进行了大量优化,算法层面引入专家混合模型、多头隐式注意力、多token预测,框架层面实现FP8混合精度训练,硬件层面采用优化的流水线并行策略,同时高效配置专家分发与跨节点通信,实现最优效率配置。当前阶段大模型行业正处于从传统的生成式模型向深度推理模型过渡阶段,算力的整体需求也从预训练阶段逐步过渡向后训练和推理侧,通过大量协同优化,DeepSek R1在特定发展阶段通过较少算力实现高性能模型表现,算力行业的长期增长逻辑并未受到挑战。过去的预训练侧的scaling law正逐步迈向更广阔的空间,在深度推理的阶段,模型的未来算力需求依然会呈现爆发式上涨,充足的算力需求对于人工智能模型的性能进步依然至关重要。

同公司研报

继续比较不同机构对同一公司的判断。

进入公司页

同行业近期研报

从单家公司继续回到行业研究。

进入行业专题