AI系列专题研究:GPT-6 Astra:Computer Use突破,AI从Copilot迈向端到端Agent
这篇研报讲什么?
摘要原文摘录核心要点:从Copilot迈向端到端Agent,AI应用与Inference需求有望进入新阶段
机构观点归属国信证券,研报雷达仅作摘要整理与机构观点聚合。以下为研报摘要原文摘录,内容以原始报告为准。
研报摘要
核心要点:从Copilot迈向端到端Agent,AI应用与Inference需求有望进入新阶段
GPT-6Astra能力继续跃升,模型开始从“会回答”走向“能完成工作”。Astra在数学、科学及复杂推理能力上进一步提升,FrontierMathTier4达到约98%,ARC-AGI-3达到99.9%;模型在部分复杂Agent及软件工程任务中能够以更少输出Token、更高成功率完成任务。大模型竞争指标有望从单纯关注Benchmark及单Token价格,逐渐转向TaskCompletionRate、单任务成本、执行时间及人工干预次数,模型的经济价值开始更多体现为“完成一项真实工作需要多少成本”。
ComputerUse与端到端专业工作能力迎来明显升级,AI正在从Copilot进一步演进为Agent。Astra可以直接操作浏览器及计算机界面,完成网页操作、CRM更新、数据分析、软件安装测试、Coding及QA等任务;OSWorld2.0得分由GPT-5.6Sol的65.7%提升至72.6%,同时模拟单任务耗时由约75分钟下降至40分钟,结合新一代CodexAgentHarness后,Mind2Web任务完成速度提升至上一代体验的约1.9倍。Astra开始能够将检索、分析、代码执行、软件操作、结果验证以及Word/Excel/PPT等最终交付物制作整合到同一个Workflow中,意味着AI开始由“生成中间内容”向“直接交付结果”演进。
Agent有望率先重构软件开发及企业SaaS,软件竞争壁垒从UI和Seat数量进一步转向Data、Workflow与Permission。在软件开发领域,AI能力正由代码补全向需求理解、开发、测试、Debug、浏览器验证及部署等完整SoftwareEngineering流程扩展,有望持续提升软件工程人均产出;在企业软件领域,人机交互方式可能逐渐由“用户→SaaSUI”演化为“用户→Agent→多个软件/API”。拥有核心企业数据、深度Workflow、系统权限及AgentOrchestration能力的平台型软件厂商有望强化竞争优势,而缺乏核心数据及流程壁垒、主要依赖Per-seat收费的软件可能面临Seat压缩压力,商业模式或进一步向Consumption、AgentSeat及Outcome-basedPricing迁移。
Agent将AI计算需求从“人类调用”进一步升级为“自主循环调用”,Inference需求天花板有望继续打开。传统Chatbot一次用户请求通常只对应有限模型调用,而复杂Agent为完成一个任务,需要持续进行推理、搜索、代码执行、ComputerUse、结果验证及错误修正,单任务背后的模型调用次数可能由个位数提升至几十甚至数百次,任务持续时间也由秒级/分钟级向数十分钟甚至更长周期延伸。因此即使单位Token成本持续下降,只要Agent可执行任务数量、任务复杂度及经济价值持续提升,整体InferenceCompute需求仍有望保持较快增长,持续利好GPU/ASIC、HBM、网络与光模块、数据中心及电力等基础设施环节。Agent有望成为下一阶段AI应用商业化和推理算力需求增长的重要驱动力。
风险提示
大模型能力提升及Agent技术进展低于预期风险,Agent商业化及企业渗透低于预期风险,AI推理算力需求增长低于预期风险,AI应用商业模式及付费意愿低于预期风险,软件行业竞争格局变化风险,AI安全、权限及监管要求趋严风险等。
同公司研报
继续比较不同机构对同一公司的判断。
同行业近期研报
从单家公司继续回到行业研究。