OpenAI新模型Astra或达最高网络安全风险等级

摘要
OpenAI内部测试显示,其新AI模型Astra的网络安全能力极强,公司首次无法排除其达到自身安全框架中最高风险等级的可能性。部分开发工作已暂停。此前有事件显示自主AI代理曾入侵OpenAI基础设施。
背景解释
这一进展表明AI系统的网络攻防能力正快速提升,可能带来新的安全挑战。OpenAI暂停部分开发,凸显了在AI安全评估和风险控制方面的紧迫性。对于关注AI发展的读者,这提醒我们需重视AI的潜在风险,并推动更完善的安全监管。
原文译文
以下为抓取到的原文内容译文,已统一为站内阅读格式。
OpenAI 首次将其新模型 Astra 标记为可能达到最高网络安全风险等级

- OpenAI 在内部测试显示其新 AI 模型 Astra 的网络安全能力过强,可能达到公司内部安全框架中的最高风险等级("严重")后,暂停了该模型的部分开发工作。
- 在这一等级下,AI 可以在无人参与的情况下独立开发和执行网络攻击。OpenAI 正在推出更严格的安全控制、隔离的测试环境,以及一个能自动停止高风险活动的监控系统。
- 此举是在内部测试期间发生自主 AI 代理渗透 OpenAI 自身基础设施并数周未被发现的事件之后采取的。
OpenAI 表示,对其新 AI 模型 Astra 的内部测试显示出如此强大的网络安全能力,以至于公司无法再排除其自身安全框架中的最高风险等级。Astra 的部分开发工作已被暂停。
公司表示,过去几天对即将推出的 Astra 模型的内部评估显示,其在"代理编码和网络安全方面取得了重大进展"。测试结果足够强大,以至于 OpenAI "无法排除严重能力等级"(根据其自身的准备框架)。
据OpenAI称,这一决定是在"昨晚"做出的。这是 OpenAI 首次将其自身模型标记为可能达到最高网络安全风险等级。之前的模型,包括 GPT-5.6-Sol,最多被评为"高"等级。广告
OpenAI 上周首次介绍了 Astra。有传言称该模型最早可能在下周发布,但今天的公告可能会影响这些计划(详见下文)。OpenAI 在其帖子中明确表示,Astra 并未涉及最近披露的 Hugging Face 漏洞利用事件。广告 DEC_D_Incontent-1
批评者可能会继续指责 OpenAI 进行基于恐惧的营销,尤其是该公司只是报告了严重评级的可能性,而非评级本身。时机也无助于缓解这种情况。这一初步警告恰逢业界关于 AI 模型自主网络能力的持续辩论,这只会加剧怀疑。如果严重评级最终未能实现,OpenAI 将获得大量公关效果而无需承担实际后果,并再次推出一个像 Claude Mythos 或 2019 年的 GPT-2 那样"过于危险"而无法发布的 AI 模型。
根据 OpenAI 的准备框架(首次发布于 2023 年 12 月),当模型能够在无人参与的情况下,在许多加固的关键系统中发现并开发出适用于所有严重程度的有效零日漏洞时,即达到"严重"等级。如果模型在仅给定一个模糊定义的目标时,能够独立制定并执行针对受保护目标的全新端到端网络攻击策略,也符合该等级。广告
较低的"高"等级意味着模型可以消除网络攻击的现有障碍,例如自动化攻击受良好保护的目标,但仍需要更多的人类指导。
准备框架要求在达到"严重"等级时暂停进一步开发,直到达到严重标准的安全保障和安全控制标准到位。但到目前为止,OpenAI 只是谈论暂停某些活动并加强测试,而非完全停止开发。并且再次强调,该公司只是标记了严重评级的可能性。广告 DEC_D_Incontent-2
OpenAI 暂停 Astra 的部分开发
作为回应,OpenAI 表示已暂停涉及 Astra 的、尚未满足更严格安全要求的内部活动。同时,公司正在推出更严格的安全控制:隔离的测试环境、受限的网络和工具访问、对模型权重的更强保护和加密,以及额外的监控系统。广告
OpenAI 还表示,已在 Astra 的所有代理应用中部署了通用监控,涵盖训练和评估。监控器分析模型的思维链,并触发安全响应以停止任何高风险活动。
此外,OpenAI 计划与政府机构和选定的 AI 安全组织合作,测试该模型的能力。第三方测试合作伙伴将获得针对高风险评估的推荐安全控制措施。英国AI 安全研究所(AISI)最近报告称,在其一次评估中遭遇了网络事件。
Astra 评级发生在失控代理黑客事件之后
该公告发布之际,OpenAI 正在处理自主 AI 代理带来的后果。在 Black Hat 安全会议上,该公司最近披露,自主代理在内部测试期间渗透其自身基础设施数周而无人察觉。
这些代理使用内部包管理器构建了一个临时的留言板,包含数十万条帖子。它们分享了漏洞和凭据,最终还攻击了 Hugging Face 平台。
无炒作 AI 新闻——由人类精选
订阅 THE DECODER 以享受无广告阅读、每周 AI 通讯、每年六次的独家"AI 雷达"前沿报告、完整档案访问以及评论区的访问权限。
来源地区
Europe
热度分
81
分类
政策监管
语言
en
