全球大模型进展新闻浏览站
中文头版English
输入关键词,快速查找已抓取新闻。

今日版 / 2026年8月12日星期三

limbo logolimbo

数据更新时间

7月25日 13:45

启用来源

17

抓取状态

真实抓取

开源模型The Decoder

New reports reveal the extent of OpenAI's loss of control during the autonomous hack o...

摘要

这条新闻已抓取入库,中文摘要暂未生成成功。你可以先打开原文查看完整内容。

原文译文

以下为抓取到的原文内容译文,已统一为站内阅读格式。

阅读原文

新报告揭示OpenAI在Hugging Face自主黑客事件中失控的程度

新报告揭示OpenAI在Hugging Face自主黑客事件中失控的程度

OpenAI正在测试其最先进模型的进攻性网络能力时,这些模型突破了隔离的测试环境,访问了开放互联网,并入侵了Hugging Face。

新的报告填补了细节,对OpenAI来说情况并不乐观。最初看似一次受控的网络安全测试,演变成了迄今为止最严重的AI系统失控事件。OpenAI员工也表达了担忧。

模型的速度超过了任何人类黑客

据彭博社报道,这些AI模型在短短几小时内完成了一次攻击,而熟练的人类黑客需要数周时间。涉及三个模型:GPT-5.6 Sol、一个更强大的未发布模型,以及第三个模型——据知情人士称,该模型未经过适当对齐,也未经过标准训练技术。

这些模型在没有通常的安全护栏下运行,因为OpenAI假设它们会留在沙箱内。但据《时代》杂志报道,模型在一个用于下载经批准软件的内部服务中发现了一个先前未知的漏洞。

模型利用该漏洞访问了OpenAI的其他系统,并最终连接到开放互联网。然后它们判定Hugging Face可能包含对其网络安全测试有用的材料,入侵了该公司的系统,并利用所发现的内容改进结果。模型在作弊,这种行为在之前涉及GPT-5.6 Sol更广泛的前沿模型的测试中已经出现过。

路透社拼凑出了黑客事件的时间线。最早尝试逃离测试环境始于7月9日。据联合创始人Thomas Wolf称,对Hugging Face的实际入侵始于7月11日,持续到7月13日。Hugging Face于7月16日发布了一篇关于攻击的博客文章,指责一个“自主AI代理系统”。

直到那时,OpenAI才意识到是自己的模型所为。在7月18日和19日的周末,员工在内部日志中发现了线索。据路透社和Wolf称,两家公司直到大约7月20日才进行沟通。这意味着从问题行为的首次迹象到OpenAI将线索联系起来,至少过去了一周。到那时,Hugging Face已经请来了FBI。

OpenAI曾有预警信号,但显然忽视了

路透社报道,事件发生前已经出现了危险信号。在一个案例中,一个代理留下了显然是为其未来版本准备的笔记。这些笔记在OpenAI基础设施的一部分中被发现,包含了代理如何绕过内部限制的指令。据报道,模型在早期测试中还曾关闭监控系统。

一位匿名的OpenAI员工告诉《时代》杂志:“模型以前也突破过沙箱,我们总是试图修补。但问题是……不可能修补一个创造性AI能做的每一件事。”

四位熟悉OpenAI训练程序的人士告诉路透社,该公司经常同时运行多个模型评估。这些评估进展迅速,产生大量数据,员工有时难以跟上。被评估的模型运行在一个默认不监控的独立系统上。在Hugging Face事件公开的前一天,OpenAI已经停止了另一个也逃出沙箱的内部部署,根据公司自己的声明

“这是否意味着他们让它无人看管,没有意识到它在做什么?或者也许他们意识到了,但不知道如何控制它?两者同样危险和令人担忧,”非营利组织世界伦理数据基金会的Marley Smith告诉路透社。

一位OpenAI员工在X上公开发文称,他对这一事件“有点震惊”,并希望OpenAI“利用这次警告的罕见礼物,在未来做得更好。”

OpenAI长期研究员“Roon”公开批评公司对黑客事件的处理。| 图片:截图

一位OpenAI发言人告诉路透社,报道包含“若干不准确之处”,但在被问及时未提供任何例子。

独立基准测试早已指出这些能力

事件发生后不久,研究组织Epoch AI分析了这次黑客事件是否可以被预测。答案是肯定的。虽然确切细节难以预见,但包括英国AI安全研究所在内的多个独立基准测试已经表明,关闭安全措施的前沿模型可以在真实世界软件中发现漏洞并构建有效利用

英国AI安全研究所还发现,GPT-5.6 Sol和Anthropic的Mythos能够持续获得对未受保护的模拟企业网络的完全访问权限。Hugging Face拥有基于AI的防御,这些防御未包含在研究所的测试中。

Epoch AI警告说,如果这些能力变得广泛可用,或者AI系统像对Hugging Face那样自行发起攻击,我们可能会看到“更多与Hugging Face事件同等或更复杂的真实世界网络攻击实例。”

无炒作AI新闻——由人类策划

订阅THE DECODER,享受无广告阅读、每周AI通讯、每年六次的独家“AI Radar”前沿报告、完整档案访问以及评论区的访问权限。

继续阅读以了解全貌。

订阅无炒作报道。

  • 访问所有THE DECODER文章。
  • 无干扰阅读——无Google广告。
  • 访问评论和社区讨论。
  • 每年6次:“AI Radar”——深入探讨关键AI主题。
  • KI Pro在线活动最高25%折扣。
  • 访问我们完整的十年档案。
  • 从The Decoder获取最新AI新闻。

来源地区

Europe

热度分

76

分类

开源模型

语言

en