软件与服务行业:QWEN-NEXT即将发布,有望树立AI大模型效率与性能新标杆-AI产业跟踪250914
这篇研报讲什么?
摘要原文摘录根据 Hugging Face transformers 库,阿里 Qwen 团队开源模型家族引入一位新成员——Qwen3-Next,预计即将发布并开源 Qwen3-Next-80B-A3B,总参数量 800 亿。
机构观点归属长江证券,研报雷达仅作摘要整理与机构观点聚合。以下为研报摘要原文摘录,内容以原始报告为准。
研报摘要
事件描述
根据 Hugging Face transformers 库,阿里 Qwen 团队开源模型家族引入一位新成员——Qwen3-Next,预计即将发布并开源 Qwen3-Next-80B-A3B,总参数量 800 亿。
事件评论
Qwen3-Next 系列定位专为极长上下文和大规模参数效率而优化的下一代基础模型,大模型降本与效能提升有望取得突破。Qwen3-Next 并非简单的模型迭代,而是一个全新的、旨在攻克长上下文和计算效率难题的架构体系,我们认为, Qwen3-Next 有望树立大模型新的性能与效率标杆。
Qwen3-Next 引入一系列架构创新,旨在“最大化性能、最小化计算成本”:(1)混合注意力(Hybrid Attention)重构,实现性能和效率的精妙平衡:用门控 DeltaNet 与门控注意力 Gated Attention 结合机制替代标准注意力机制,前者是一种基于状态空间模型(SSM)的结构,融合了传统注意力的局部信息捕捉能力和 SSM 架构在线性计算复杂度下处理长程依赖的能力,使得模型既能精准捕捉关键信息,又能更高效地大规模扩展上下文处理能力,实现高效上下文建模;(2)1:50 高稀疏度 MoE(High-Sparsity MoE):相较常见的 1:4 ~1:32 的 MoE 激活比例,Qwen3-Next 在 MoE 层中实现极低的激活比例(1:50),在 512 个专家中,每次推理为每个 token 选择 10 个专家。我们认为,这种“多选”策略相比“单选”能提供更丰富的特征组合和更平滑的路由,得以在保持模型容量的同时,大幅减少每个 token 所需 FLOPs,由此实现高性能。(3)多 Token 预测(MultiToken Prediction, MTP)提升预训练性能、加快推理速度。不同于传统语言模型一次预测下一个词元,效率较低且容易出现逻辑偏差,MTP 允许模型在预训练时并行预测未来多个词元,通过学习到更好的语言规划能力能提升训练效率和生成文本连贯性,该技术或是下一代大模型预训练的关键。(4)其他优化:包括零中心+权重衰减的 LayerNorm、Gated Attention 以及其他增强训练稳定性的技术。
模型从“更大”转向“更高效”,有望开启“性能-效率新范式”竞赛。得益于上述架构创新,仅激活 30 亿参数,Qwen3-Next 在下游任务依然超越 Qwen3-32B(320 亿参数稠密模型),而训练成本不到后者 1/10。此外,在处理超过 32K tokens 的长上下文时,其推理吞吐量也比 Qwen3-32B 高出 10 倍以上。Qwen3-Next-80B-A3B 或代表了大模型产业商业化落地曲线的一个重要拐点,AI Agent 商业化落地有望进一步加速。
持续关注 Qwen3-Next 后续发布及其架构演进。当前国内模型加速迭代不断与海外拉平,Agent 投资核心逻辑强化,随着 AI 货币化开启,预计 Q4 国内模型与应用侧都将迎来核心拐点,模型能效持续提升、成本下探有望实现突破,强烈看好国内 AI 应用货币化开启,垂直场景的 Agent 落地周期有望提前,看好 Agent 投资机遇。建议关注:1)AI Agent 相关厂商;2)中国推理算力产业链;3)CSP 厂商关注推理需求推动;4)IDC:与阿里等大厂合作的 IDC。
风险提示1、AI 技术发展不及预期;2、下游应用需求不及预期。
同公司研报
继续比较不同机构对同一公司的判断。
同行业近期研报
从单家公司继续回到行业研究。