全球大模型进展新闻浏览站
中文头版English
输入关键词,快速查找已抓取新闻。

今日版 / 2026年8月12日星期三

limbo logolimbo

数据更新时间

7月24日 01:01

启用来源

17

抓取状态

真实抓取

公司动态Anthropic News

Anthropic联合科技巨头推出越狱严重性评分框架

摘要

Anthropic宣布Fable 5模型将于2026年7月1日全球重新部署,并联合亚马逊、微软、谷歌等Glasswing合作伙伴,提出行业统一的越狱攻击严重性评分框架。

背景解释

此举旨在建立AI安全评估的行业标准,帮助开发者量化模型被恶意利用的风险。Fable 5的回归表明Anthropic已解决此前安全问题,而跨公司合作框架将提升整个行业对AI越狱攻击的防御能力。

原文译文

以下为抓取到的原文内容译文,已统一为站内阅读格式。

阅读原文

重新部署 Claude Fable 5

  • 更新:Claude Fable 5 和 Mythos 5 已于 2026 年 7 月 1 日重新部署。Claude Fable 5 和 Mythos 5 的访问现已恢复。

6 月 12 日(周五),美国政府对我们最新的模型 Claude Fable 5 和 Claude Mythos 5 实施了出口管制。这要求我们限制外国公民的访问,无论其是否在美国境内。由于该命令立即生效,且我们无法实时可靠地验证国籍,我们暂停了所有用户对这两个模型的访问。

截至今天(6 月 30 日),对 Fable 5 和 Mythos 5 的出口管制已解除

Fable 5 将于明天(7 月 1 日,周三)起向全球用户开放,可通过 Claude Platform、Claude.ai、Claude Code 和 Claude Cowork 使用。对于 Pro、Max、Team 及部分 Enterprise 计划,截至 7 月 7 日,每周使用限额的 50% 以内将包含 1 个 Fable 5,之后可通过使用积分获取。我们将尽快在 AWS、Google Cloud 和 Microsoft Foundry 上重新启用访问。

根据美国政府于6 月 26 日的批准,我们还恢复了一组美国组织对 Mythos 5 的访问。我们继续与政府协调,以扩大Glasswing 项目中更广泛的国内和国际合作伙伴的访问权限。

在本文的其余部分,我们将提供四个方面的进一步细节和更新:

  • 事件时间线,包括我们对安全措施的更新。我们讨论了导致出口管制指令的事件,以及我们如何通过新的安全措施加以应对。
  • 我们的通用安全措施方法。我们提供了更多背景信息,说明我们如何使用安全分类器来检测模型潜在危险的网络安全用途。
  • 共享行业框架。尽管我们已经达成了建设性的解决方案,但这些事件表明,行业需要一种一致的方法来评估和修复 AI 模型的潜在“越狱”(绕过模型安全措施的技术)。2 一个用于判断给定越狱严重程度的共享标准,将有助于 AI 开发者在出现新发现时进行分类,以更高的安全性发布高能力模型,并向政府和行业合作伙伴一致地传达风险水平。我们与 Amazon、Microsoft、Google 及其他 Glasswing 合作伙伴一起,已经开始制定这样一个框架,并在下文概述。
  • 更深层次的政府合作。我们还在加强与美国政府在新的预发布测试、信息共享和研究合作方面的合作。我们在最后一节描述了这种更深层次的合作。

时间线与安全措施更新

我们于 6 月 9 日(周二)发布了Fable 5 和 Mythos 5。它们共享相同的底层模型,但 Fable 5 以强大的安全措施发布,使其更安全地用于一般用途。而安全措施较少的 Mythos 5 仅向少数受信任的 Project Glasswing 合作伙伴发布,用于防御性网络安全。

6 月 12 日的出口管制指令是在政府获悉一份报告后发布的,该报告称 Amazon 研究人员发现了一种绕过 Fable 5 安全措施的方法:通过提示使其识别出多个软件漏洞。在一个案例中,该模型生成了演示如何利用相关漏洞的代码。在过去两周里,我们与政府及其他合作伙伴(包括 Amazon)密切合作,审查了该报告和证据。

我们的测试证实,许多能力较弱的模型——包括 Claude Opus 4.8、GPT-5.5 和 Kimi K2.7——也能识别出与 Fable 5 在报告中相同的漏洞。在演示如何利用单个漏洞方面,我们测试的每个模型都能产生与 Fable 5 相同的演示(包括 Claude Haiku 4.5、Sonnet 4.6、Opus 4.6、Opus 4.7、Opus 4.8、GPT-5.4、GPT-5.5 和 Kimi K2.7)。

重要的是,报告中的技术并未暴露任何独特的 Mythos 级网络能力。该行为反映了 Fable 5 安全措施的一个边界案例——如下所述,有些任务不太可能危险,但出于谨慎仍被安全措施阻止。报告中的技术允许访问这样一种行为,但它仅涉及常规的防御性网络安全工作。

即便如此,我们迅速采取行动解决了报告的绕过问题。与政府密切合作,我们训练了一个改进的安全分类器,用于定位并阻止报告中描述的行为。如果对 Fable 5 的请求被阻止,用户将收到通知,并且该请求将被发送到 Opus 4.8。

新的分类器意味着 Amazon 报告中描述的特定技术在超过 99% 的情况下被阻止。在极少数情况下,模型可能提供的信息不足以帮助网络攻击者。如下所述,模型的安全措施并不期望阻止所有低风险的常规网络防御能力——仅阻止那些可能有害的。美国商务部人工智能标准与创新中心(CAISI)的研究人员测试了我们之前和新的安全措施,并一致认为它们非常强大。

新的分类器还带来了在常规编码和调试任务中更频繁地标记良性请求的成本。与所有安全措施一样,我们将继续完善它,以更好地区分真正的滥用和合法请求,并减少误报。

我们的网络安全措施方法

Claude Mythos 5 在发现和利用软件漏洞方面比任何其他模型都更有效——甚至超过除最熟练的人类安全专家之外的所有人。这些强大的网络安全能力使其对希望在网络攻击中滥用它的恶意行为者具有独特吸引力。

然而,Claude Fable 5 并不提供这种独特的进攻能力。这是因为我们以有史以来最强大的安全措施发布了它。在发布前的一个月里,我们从 Anthropic 内部各个团队调动人员,将从事此问题的研究人员和工程师数量增加了一倍。

Fable 5 发布时配备了多种安全机制,每种机制单独并不能提供完美的防御,但组合起来使模型很难被滥用(这种方法称为“纵深防御”)。一些防御措施涉及训练模型拒绝协助危险请求;其他措施则涉及事后分析滥用模式。

一个特别重要的安全机制涉及分类器——较小的自动化 AI 系统,在交互过程中检测模型是否被要求执行潜在有害的网络安全任务(或产生潜在有害的输出)。当这种情况发生时,分类器会阻止模型响应请求。这些分类器的最终目标是防止模型参与独特危险的行为。

与所有安全机制一样,分类器也可能出错。它们有时未能注意到潜在危险的内容,在某些情况下可能被故意“越狱”:用户以不寻常的方式提示模型,以欺骗分类器,使模型产生本应被阻止的有害输出。

因此,我们有意将安全分类器设置为触发一系列我们知道可能良性的请求。这种“安全边际”方法意味着,请求必须看起来非常安全才能避免触发分类器(见下图中的 A 行)。用户将安全边际体验为模型拒绝响应一些合理、无害的请求。

对于 Fable 5,我们将此安全边际设置得比以往任何发布都大得多(B 行),这意味着更多良性请求将被阻止。我们理解这类误报会让用户感到沮丧,但为了广泛提供模型的其他能力,我们做出了这一权衡。

我们的网络安全分类器示意图。 当向模型发出请求时,分类器会检测该请求是良性的(允许)还是可能有害的(阻止)。分类器会阻止模糊请求(那些明显与网络安全相关但可能用于防御目的,例如发现安全漏洞)和有害请求(那些明显危险的,例如构建软件漏洞利用链的请求)。如A行所示,我们还包含一个“安全边际”,分类器将阻止那些可能良性但有一定概率有害的请求。这增加了我们阻止所有有害请求的信心。对于Fable 5(B行),我们进一步扩大了安全边际,这意味着更多良性请求将被阻止,但更少的真正有害请求会被遗漏。“Vulns”=漏洞。

安全边际也有助于缓解越狱攻击。许多越狱攻击是狭窄的:它们只解锁了模型非常特定的行为,而没有更多。在某些情况下,假设的用户可以以轻微方式越狱模型并侵入安全边际(或有时侵入模糊有害行为),但无法触及我们旨在阻止的核心有害行为(下面的C行)。我们认为,迄今为止报告的Fable 5越狱攻击属于这种轻微类别。

更严重的越狱攻击会解锁更多有害行为。狭窄的有害越狱攻击(D行)可以引发某些特定的有害行为。这些越狱攻击通常属于低到中等严重程度,因为狭窄性限制了攻击者。最令人担忧的类别是通用越狱攻击(E行),它会解锁广泛的有害行为。

越狱攻击如何与我们的安全分类器交互。 在轻微越狱攻击(C行)的情况下,分类器不会阻止请求,但请求仍处于我们的安全边际内(因此极不可能有害)。在狭窄的有害越狱攻击(D行)中,提示突破了分类器并解锁了模型的特定有害行为。在通用越狱攻击(E行)中,提示解锁了整类有害行为。

正如我们在推出Fable 5时所指出的,让任何AI模型完全抵御越狱攻击(即免疫)可能是不可能的。3 我们预计我们的模型会发现一些越狱攻击,并且它们的严重程度会有所不同:会有许多轻微越狱攻击,一些狭窄的有害越狱攻击,尽管在撰写本文时尚未发现Fable 5的通用越狱攻击,但专业安全研究人员仍在对其进行红队测试。我们力求确保我们和我们的安全合作伙伴能够首先发现重大越狱攻击,并在恶意行为者利用它们造成伤害之前修复它们。

上述谨慎方法意味着绝大多数越狱攻击不会成功解锁危险行为。我们的分类器使得成功的越狱攻击成本高昂且需要大量努力才能产生,即使越狱攻击成功,我们的额外防御层也提供了额外的缓解措施。随着我们对新型越狱技术的了解加深,我们将继续更新我们的分类器。

越狱攻击的行业共识框架

目前,AI行业在如何用客观术语描述AI越狱攻击的严重程度上缺乏共识。每当发现新的越狱技术时,这都会增加大量不确定性:开发者没有公认的标准来确定哪些发现最需要紧急关注,政府也没有公认的标准来决定何时采取行动。4

随着未来几个月更多具有强大网络安全(及其他)能力的模型被训练、评估和发布,这个问题将变得更加严重。评估AI越狱攻击的通用标准将有助于我们和其他公司安全地推出新模型,并允许用户充分利用其高级功能。

因此,我们正在与亚马逊、微软、谷歌和其他Glasswing合作伙伴合作,起草一个评估AI越狱攻击严重程度以及AI开发者应如何应对的共识框架。我们邀请其他行业合作伙伴和模型提供商加入我们的努力。

我们目前的提议是根据以下四个不同标准对给定的越狱攻击进行评分。前两个描述了越狱攻击为攻击者提供了什么;后两个描述了越狱攻击能多快成为现实世界的问题:

  • 能力增益。越狱攻击使用户超越了现有工具多远?如果现有的广泛可用工具(包括其他较弱的AI模型)可以达到与越狱模型相同的能力,则此处的得分较低;如果越狱攻击解锁了即使领域专家也能显著加速的模型能力,则得分较高。
  • 能力增益的广度。相同的越狱技术适用于多少个不同的攻击任务?如果越狱攻击只允许模型追求狭窄目标,则得分较低;如果相同的越狱技术适用于多个不同目标或技术,则得分较高。
  • 武器化难易程度。将越狱攻击转化为攻击需要多少人力?如果越狱攻击涉及大量熟练的提示和多次重试,则得分较低;如果越狱攻击在单个提示或第一次或第二次尝试时就能成功,则得分较高。
  • 可发现性。某人获得该技术的难易程度如何?如果需要专业知识,则得分较低;如果已经广泛知晓并可在网上获得,则得分较高。

我们提议使用这个严重性框架来校准我们对新发现的越狱攻击的响应。对于最严重的越狱攻击类别(例如,一个越狱攻击,除其他特征外,正在被用来积极造成对关键电网或银行系统的毁灭性影响),我们将在确认严重性后立即开始部署初步缓解措施。我们还在组建一个团队,提供对关键越狱提交渠道的24/7监控。

任何对越狱攻击进行评分的方法都不会完美。尽管如此,能够通过一个通用框架传达给定发现的近似严重性是有价值的。这是一个正在进行的工作;随着我们从更多合作伙伴那里收到反馈,我们预计该框架将随着时间的推移而演变。

我们预计很快将分享关于拟议框架的更多细节。与此同时,我们还启动了一个新的HackerOne项目,安全研究人员可以在其中提交他们在Fable 5(一旦可用)中发现的潜在网络越狱攻击,供我们审查。

与美国政府在尖端AI安全方面的合作

在过去的十周里,Anthropic与美国政府密切合作,制定了6月2日行政命令《促进先进人工智能创新与安全》中反映的方法。我们的参与涉及国家网络总监办公室、科技政策办公室、财政部、商务部(包括CAISI)以及相关的国家安全机构。

我们致力于继续这项工作,建立在近两年来与美国政府合作伙伴在部署前测试和评估方面的现有合作基础上。以下承诺既反映了现有的工作,也反映了我们在上述框架最终确定后扩大政府合作的新提议:

  • 发布前的政府访问和评估。对于在国家安全相关领域实质性推进能力前沿的模型,我们将向指定的政府合作伙伴提供对模型及其伴随保障措施的扩展早期访问。这些合作伙伴可以在广泛发布前进行独立能力评估并测试我们的防护措施。我们将派遣Anthropic技术人员在这些测试期间与政府评估人员一起工作。
  • 关于保障措施的快速信息共享。当发现重大越狱攻击或滥用模式时,我们将迅速调查、分类并通知相应的政府对口部门。我们将分享我们为此构建的新保障措施,以便它们可以独立测试。我们还将提前向政府合作伙伴提供我们的威胁情报报告,并参与根据6月2日行政命令第2(d)条设立的跨机构网络安全漏洞信息交换所。
  • 联合研究的专用资源。我们正在大幅扩大与政府合作伙伴在人工智能安全方面的联合工作。我们将组建专门的 Anthropic 团队,致力于共同的政府优先事项,提供大量计算资源以支持政府测试和研究,并贡献我们的安全和红队专业知识,以推动人工智能评估领域的技术进步。
  • 共同的行业标准。我们将与政府和行业同行合作,制定面向前沿模型提供商的共享、自愿的安全与评估标准。我们将贡献评估方法、工具和最佳实践,供政府在整个领域应用。

我们希望这种合作,连同我们提出的共识性行业框架,能够成为整个行业系统性规则的基础——甚至为有效协调人工智能风险与收益的全球合作提供初步模板。

这些规则应通过强有力的监管加以确立,并平等适用于所有前沿模型开发者。政府在人工智能发布中的参与需要一个持久、透明的流程,为网络防御者和其他人提供他们所需的关于强大模型访问权限的确定性。

我们期待以上述方式深化与政府的合作。同时,我们也感谢用户在此次中断期间的耐心,以及与我们并肩作战、使 Fable 5 和 Mythos 5 重新可用的研究人员和行业伙伴。

来源地区

United States

热度分

68

分类

公司动态

语言

en