Introducing Claude Opus 5 Product Jul 24, 2026 Opus 5 is a step change improvement for...

摘要
这条新闻已抓取入库,中文摘要暂未生成成功。你可以先打开原文查看完整内容。
原文译文
以下为抓取到的原文内容译文,已统一为站内阅读格式。
介绍 Claude Opus 5
Claude Opus 5 今日正式发布。这是一款深思熟虑且积极主动的模型,其智能水平接近 Claude Fable 5,但价格仅为后者的一半。
在Frontier-Bench和GDPval-AA等编程与知识工作评估中,Opus 5 达到了新的最优水平,但在网络安全任务上仍落后于 Mythos 5。
Opus 5 专为日常使用而设计:它比其他模型工作更高效。它是 Claude Max 上的新默认模型,也是 Claude Pro 上最强的模型。
性能与成本效益
Claude Opus 5 在与其前代 Opus 4.8 相同成本下提供了大幅提升的性能。本节图表展示了性能如何随模型的努力程度设置而变化,客户可利用这些设置来优化智能水平或节省 token 以获得更快、更便宜的结果。
Opus 5 在重要的软件工程任务上表现出色。例如,在 Frontier-Bench v0.1 上,Opus 5 超越了所有其他模型,并且每任务成本更低,性能是 Opus 4.8 的两倍以上。在 CursorBench 3.2 上,在最大努力程度下,该模型的性能与 Fable 5 的最高分相差不到 0.5%,但每任务成本减半;此外,在高、极高和最大努力程度下,它在给定成本下实现了比其他所有模型更高的性能。
我们在知识工作和问题解决任务上也看到了类似的结果。例如:
- 在 ARC-AGI 3 上,这是一项要求模型解决新颖问题的评估,Opus 5 的得分是次优模型的三倍。
- 在 Zapier AutomationBench 上,该评估衡量模型能否从头到尾完成商业任务,Opus 5 的通过率约为次优模型的 1.5 倍,且每任务成本相同。即使在其最低努力程度设置下,Opus 5 通过的测试也多于任何其他模型。
- 在 OSWorld 2.0 上,这是一项计算机使用基准测试,Opus 5 在任意给定成本下均优于所有其他模型,以略高于三分之一的成本超越了 Fable 5 的最佳结果。
它也是我们在多项相关评估中最好且最具成本效益的模型:
Opus 5 在科学研究方面相比 Opus 4.8 有显著改进。在我们所有的生命科学评估中,Opus 5 的表现均优于 Opus 4.8,这些评估涵盖结构生物学、有机化学和生物信息学等主题。其改进在有机化学任务上最为显著,例如从光谱数据推断分子结构(在我们的内部基准测试中,其得分比 Opus 4.8 高 10.2 个百分点),以及与蛋白质相关的任务,如预测蛋白质序列变异如何影响其功能(在此项上,其得分高 7.7 个百分点)。
最后,Opus 5 能够生成更强大的视觉输出:
Opus 5 可视化了空气在空气动力学(和非空气动力学)物体上的流动。在此处尝试风洞中的不同设置。
Opus 5 构建了一个简化的、交互式的细胞示意图。在此处探索其元素。
使用 Claude Opus 5
Claude Opus 5 在验证自身工作并仔细迭代直至成功方面要强大得多。在评估和早期访问测试中,我们和用户发现了许多体现 Opus 5 主动性和彻底性的例子:
- 在一个 Frontier-Bench 任务中,Opus 5 被给予一张机器零件的图纸,并被要求编写代码将其重建为 3D FreeCAD 模型。然而,在这个任务中,模型被故意设置为无法直接查看图纸。Opus 5 通过编写自己的计算机视觉流水线从原始像素中提取几何形状,然后重建了整个机器零件。它多次成功完成;没有其他竞争模型在相同设置下能在五次尝试后解决该问题。
- 面对一个流行开源包管理器中的真实 bug,Opus 5 找到了根本原因,并修复了社区补丁遗漏的一个边缘情况。一个竞争模型只修复了表面症状(而非根本原因),然后报告 bug 已解决。
- 一家交易公司的工程师使用 Opus 5 在单次会话中构建了一个新交易所的市场数据源。之前的模型即使有工程师提供的详细计划也无法完成此任务。由于没有实时数据源可供验证,Opus 5 甚至构建了自己的测试工具来检查其代码是否正确解析了交易所的数据。
以下是我们的早期访问客户关于使用 Opus 5 体验的进一步报告:
在 FrontierCode 1.1 上,Claude Opus 5 以一半的成本达到了接近 Fable 级别的性能。在 Devin 内部,它在困难的调试和根本原因分析任务上也表现出特别强的能力。Scott Wu
CEO
Claude Opus 5 以 Opus 的速度和成本提供了接近 Fable 5 的智能。在 CursorBench 上,它略低于 Fable 5,但具有许多相同的行为。我们很高兴看到开发者如何在 Cursor 中使用它。Sualeh Asif
联合创始人
Claude Opus 5 在未比之前的 Claude 模型消耗更多 token 的情况下登顶了 Zapier 的 AutomationBench 排行榜。它获取了一个原始的账户健康工作簿,并端到端地运行了完整的流失预防序列:标记有风险的账户、提醒正确的负责人、并为留存运营总结。之前的模型未能通过;Opus 5 达到了 100%。Wade Foster
CEO
在我们的基因组学分析工作中,Claude Opus 5 的行为比我们运行过的任何模型都更像一位严谨的科学家。它会采用正确的统计检验来排除混杂因素,通过独立方法交叉检查自己的结果,并在漫长的多步骤分析中保持专注。Alfredo Andere
CEO
Claude Opus 5 在我们的内部评估中领先于其系列中的所有模型。它不仅在我们最难的智能体编程任务上表现更好(比 Opus 4.7 提升 22%),而且更稳定,运行间的方差小得多。对于 Lovable 上的数百万构建者来说,这种一致性就是一切。可靠的结果,一次接一次。Fabian Hedin
联合创始人
Claude Opus 5 是 Opus 系列自 4.5 以来最大的飞跃。在相同的全栈应用构建中,前端首先展示了这一点:我们见过 Opus 模型最好的动画、游戏和 3D 作品。Madhav Jha
联合创始人兼 CTO
我们非常喜欢 Claude Opus 5。对于我们的智能体处理的开放式分析工作,它是对 Opus 4.8 的严格升级,而且收益最大的正是最需要的地方:更困难、更模糊的任务。响应更清晰、更简洁,我们还在更高的努力水平上看到了效率的提升。Izzy Miller
AI 研究负责人
Claude Opus 5 对于我们的分析师每天运行的金融研究工作流程来说,是对 Opus 4.8 的显著改进。它在数值推理、表格工作以及需要精确度的更敏锐的批判性思维方面表现出色。Shirley Zhang
高级 AI 工程师,应用 AI
Claude Opus 5 提供了专业企业内容分析所必需的行业智能和准确性。Box 发现 Opus 5 比 Opus 4.8 提升了 8%,并在数据分析(提升 11%)和尽职调查(提升 17%)工作流程中带来了显著的性能提升,这些工作流程是技术、医疗保健和公共部门组织日常依赖的。Ben Kus
CTO
Claude Opus 5 是 Opus 4.8 的明显代际升级。在一个周末里,我让它担任我开发环境的参谋长角色:它构建了自己的监控器,驱动每台机器,只在需要判断时才找我。Cristian Rivera
高级软件工程师
Claude Opus 5 在我们的基础研究助手代码库中进行了大规模更改,在整个智能体工作流程中根据反馈进行调整,并且比我们使用过的任何模型都更清晰地解释其推理过程。它处理了我们通常会分解成更小部分的工作。Conor Kiernan
CTO
在我们一些最难的金融建模任务上,Claude Opus 5 在准确性和效率方面都比 Opus 4.8 有明显的提升。其性能下限显著提高,尤其是在深度金融领域逻辑方面。在不同努力水平下,其平均准确率提高了 9 个百分点,而轮次和工具调用减少了三分之一,时间减少了 60%。Richard Pham
评估与产品负责人
Claude Opus 5 像真正的前端开发者一样检查自己的工作。在我们的基准测试中,它在桌面和手机宽度下打开浏览器中的页面,发现了隐藏在移动折叠下方的产品和屏幕外的结账按钮,并在交回工作前修复了这两个问题。AJ Orbach
联合创始人兼 CEO
Claude Opus 5 在法律代理工作上的性能相比之前的 Opus 模型有明显提升,我们在公司治理和仲裁等实践领域看到了最大的进步。我们还对 Opus 5 在较低推理水平下保持质量的能力印象深刻,与 Opus 4.8 在最大推理时相比,它平均生成的 token 减少了 26%,同时实现了类似的性能。
Niko Grupen 应用研究主管
Claude Opus 5 对我们来说最大的进步在于更长周期的工作:构建完整的演示文稿,然后进行修订。工件质量是决定我们使用哪个模型的关键,这是我们见过的最明显的进步——更好的视觉理解、更清晰的格式、更少的幻灯片问题。
Alex Wang 应用人工智能
Claude Opus 5 的判断力非常突出。在移交 PR 时,它不会急于发布:它会验证分支、检查模板,并思考测试的影响,从而确保移交干净利落。旧模型往往急于推进,并在我们的检查中被卡住。
Zimu Li 技术员工
在一次重新架构会议中,Claude Opus 5 对我提出的设计提出了异议,当我坚持时它并没有退缩。相反,它准确解释了我的想法中有价值的部分,将反对意见缩小到一个设计问题,并提出了一个折衷方案,保留了好的部分同时修复了缺陷。这种判断力让我们能够减少监督地信任它。
Marquis Wang 首席人工智能工程师
在首次轮次的红线标注中,Claude Opus 5 在我们测试的所有模型中得分最高,几乎是 Opus 4.8 的两倍。评论功能也更好:在 NDA 上,它用更少的时间和更少的轮次达到红线,且准确性保持不变或更好。
Ryan Tanenholz 技术员工
Claude Opus 5 编写干净、紧凑的差异,没有死代码,并且在细微的、特定于代码库的问题上是更强的风险发现者。我们正在将其用于生产工作负载。
Neeraj Deshmukh 工程总监
我们肯定会将统一代理平台 Cosmos 中的许多用例迁移过来。我们期待越来越多地使用 Claude Opus 5 进行代码审查,并且我确信地说,我们更希望人们使用 Opus 5 而不是 Opus 4.8。
Igor Ostrovsky 联合创始人兼首席技术官
Claude Opus 5 的突出之处在于判断力。它在编写一行代码之前会进行更深入的思考,在规划阶段而不是事后发现自己的逻辑错误,并推理答案为什么正确,而不仅仅是它是否有效。这是我们见过的从一代 Claude 模型到下一代最明显的问题解决能力提升,我们期待它在 JetBrains IDE 中得到采用。
Denis Shiryaev IDE 人工智能主管
Claude Opus 5 是我们测试过的交易基准测试中最强大的 Opus 模型,而且它使用的推理 token 大约是 Opus 4.8 的七分之一,延迟不到一半。更好的答案,计算量却更少。
Matt Nassr 全球数据工程与人工智能转型主管
对齐。 在部署前测试中,我们的自动化行为审计发现 Opus 5 是迄今为止最对齐的模型(如下图所示)。它比 Opus 4.8、Sonnet 5 或 Fable 5 更遵守Claude 的宪法;表现出最低的欺骗行为率;并且最不容易被诱骗而滥用。它也是我们迄今为止最安全的模型,能够避免可能产生难以逆转副作用的鲁莽行为。
在我们的自动化行为审计中,Opus 5 在整体不当行为上的得分为 2.3,是我们近期模型中最低的。
安全性。 Opus 5 并未推进高风险、双重用途能力的前沿。在与私营部门和政府合作伙伴共同进行的严格评估中,我们发现它在生物学研究和进攻性网络安全方面仍落后于 Mythos 5。有关这些评估的更多信息,请参阅我们的系统卡。
与其前身 Opus 4.8 一样,我们有意避免在 Opus 5 上训练网络任务。然而,由于模型整体能力的提升,它在这类任务上仍然取得了显著进步,并且在发现网络安全漏洞方面接近 Mythos 5。然而,在利用这些漏洞方面——即将漏洞转化为实质性网络威胁——它仍然远远落后于 Mythos 5。
这一点通过 Opus 5 在 OSS-Fuzz 上的表现得以说明,这是我们开发的一项评估,用于衡量模型在无需大量人工指导的情况下发现并利用漏洞的能力。尽管 Mythos 5 和 Opus 5 在识别漏洞方面成功率相似,但 Opus 5 在漏洞利用开发方面的得分远低于 Mythos 5。
在 OSS-Fuzz(我们的网络安全评估之一)上,Opus 5 在识别软件漏洞方面接近 Mythos 5(左图),但在开发漏洞利用方面则逊色得多(右图)。
Claude Opus 5 的安全措施旨在允许模型在网络安全和生物学领域的有益用途。它们与我们应用于 Opus 4.8 的措施类似,只是在少数网络任务上增加了更强的防护栏。
网络安全。 Opus 5 的网络分类器在比例上比 Fable 5 的限制更少。它们允许 Opus 5 发现源代码中的漏洞,但阻止“基于二进制”的漏洞扫描(一种更可能与恶意行为者相关的方法)、渗透测试和漏洞利用生成。
根据我们的测试,我们预计这些分类器的干预频率将比 Fable 5 低约 85%。在Claude.ai、Claude Code 和 Claude Cowork 中,任何被标记的请求将默认回退到 Opus 4.8。API 上也可以启用回退到 Opus 4.8。
我们的网络验证计划(CVP) 促进了原本可能因模型安全措施而受阻的网络安全工作。已经加入 CVP 的企业和研究人员可以立即访问一个安全限制较少的 Opus 5 版本。
生物学。 由于 Opus 5 具有与 Opus 4.8 类似的安全措施,它现在是我们用于科学研究的最强大的通用模型。尽管如此,该模型在长期、自主的研究任务上仍然显示出重要的局限性,而这正是我们预计 AI 模型会带来最重大生物学相关风险的领域。(Mythos 5 仍然是这类生物学工作的更强模型。)作为此次发布的一部分,之前在 Fable 5 上被阻止的生物学相关请求现在将路由到 Opus 5 而不是 Opus 4.8。
Claude Opus 5 即日起在所有平台上可用,定价为每百万输入 token 5 美元,每百万输出 token 25 美元(与 Opus 4.8 相同)。开发者可以通过 Claude API 使用 claude-opus-5 开始使用。
它还提供快速模式,运行速度约为默认速度的 2.5 倍。与 Opus 4.8 一样,快速模式在 Claude 平台上的价格为 Opus 5 基础价格的两倍,并可通过 Claude Code 中的使用积分获得。
与 Opus 5 一同,我们还发布了两个测试版更新:
- 对话中工具变更在 Claude 平台上。在对话中,开发者现在可以更改 Claude 可以使用的工具,而不会使提示缓存失效。
- 自动回退在 API 上。用户现在可以选择将 Opus 5(或 Fable 5)上被安全分类器标记的请求自动路由到另一个模型。启用自动回退后,API 请求默认始终路由到最佳可用模型,而不是被阻止。
与之前的 Opus 模型一致,Opus 5 对于一般访问没有数据保留要求。
有关如何充分利用 Opus 5 的更多指导,请参阅我们的提示指南。
来源地区
United States
热度分
89
分类
公司动态
语言
en
