软件与服务行业AI产业速递:Claude加4系列模型大幅提升自主编码能力,Agent走向下一程250526
这篇研报讲什么?
摘要原文摘录事件描述美国时间 5 月 23 日,Anthropic 正式发布 Claude 4 系列模型,包括 Claude Opus 4 和 Claude Sonnet 4 两款混合模型。其中,Claude Opus 4 是其发布的最高性能的编码模型,在复杂、长时间运行的任务和代理工作流上具有持续的性能。Claude Sonnet 4 是 Claude Sonnet…
机构观点归属长江证券,研报雷达仅作摘要整理与机构观点聚合。以下为研报摘要原文摘录,内容以原始报告为准。
研报摘要
事件描述美国时间 5 月 23 日,Anthropic 正式发布 Claude 4 系列模型,包括 Claude Opus 4 和 Claude Sonnet 4 两款混合模型。其中,Claude Opus 4 是其发布的最高性能的编码模型,在复杂、长时间运行的任务和代理工作流上具有持续的性能。Claude Sonnet 4 是 Claude Sonnet 3.7 的重大升级,提供卓越的编码和推理,并且增强了可控性,从来更好地实施控制,提供功能和实用性的优质组合。该系列模型显著提升了 AI 的工具能力,核心提升了模型对工具使用、并行工具执行和进行扩展思考的能力,并且减少了模型使用快捷方式或漏洞完成任务的行为。
事件评论
新一代模型专为编码和代理任务设计,可自主编码长达 7h。公司模型类别一般可以分为Haiku(速度最快)、Sonnet(智能和速度取得平衡)和 Opus(最智能),上一代公司最智能的 Opus 模型 Claude Opus 3 在美国时间 2024 年 3 月 4 日发布,已经长达一年未更新。本次重磅发布 Claude Opus 4,该模型专为编码和代理任务设计,可自主编码完成人类需要长达 6-7 个小时才能完成的任务。在 SWE-bench(软件工程任务的性能基准)其得分为 72.5%,超越了 OpenAI Codex-1 的 72.1%、OpenAI o3 的 69.1%和 Gemini 2.5 Pro 的 63.2%;在 Terminal-bench(代理任务)其得分为 43.2%,明显高过 OpenAI o3 的 30.2%和 Gemini 2.5 Pro 的 25.3%。Claude Opus 4 模型在编码、推理、多模态功能和代理任务方面均有明显的性能提升,推动模型工具能力进一步跃升。Claude Sonnet 4 模型在 Sonnet 3.7 业界领先的功能基础上进行了显著提升,解决了 Sonnet 3.7 的过度积极的问题,并且在 SWE-bench 上达到了 72.7%的最高代码准确率。Opus 4 突破了编码、研究、写作和科学发现的界限,而 Sonnet 4 为日常用例带来了前沿性能。定价与之前模型保持一致,Opus 4 为 $15/$75 每百万 Tokens(input/output),Sonnet 4 为$3/$15。
发布并全面开放 Claude Code,Agent 进入自主阶段。Claude 3.7 可以自主工作约 45min不失去连贯性,Claude 4 可以突破数小时。Anthropiic 认为人工智能代理应该擅长三种能力,并以此为依据指定发展规划:(1)情景智能:理解你和你组织的独特背景,并不断从经验中学习,获取情景记忆和组织记忆;(2)长期执行能力:无需持续管理的情况下可处理复杂、耗时数小时的任务;(3)真正的协作:智能自主,与明确的检查点相平衡。Claude系列模型的升级给代理任务提升了更多探索的可能性。
多合作伙伴认可,Agent 迈入新阶段。Cursor 称其为最先进的编码技术,是复杂代码库理解的飞跃。Cognition 称 Opus 4 擅长解决其他模型无法解决的复杂挑战,成功处理了以前模型错过的关键行动。GitHub 宣布 Claude Sonnet 4 将作为支持 GitHub Copilot 中新编码代理的模型。Manus 也强调了它在遵循复杂指令、清晰推理等方面的提升。伴随模型能力提升,Agent 的适用场景有望不断扩张快速渗透,推荐关注 AI coding 板块的持续机遇,以及垂类场景下具有产品壁垒和数据壁垒的产品型厂商。
风险提示1、AI 技术发展不及预期;2、下游应用需求不及预期。
同公司研报
继续比较不同机构对同一公司的判断。
同行业近期研报
从单家公司继续回到行业研究。