AI编程代理的持久状态攻击:跨拉取请求的分布式威胁

摘要
随着AI编程代理自主性增强,其迭代生成的代码在会话间持久化,创造了新的攻击面。恶意或提示注入的代理可将攻击分布到多个拉取请求中,并选择最佳时机触发。研究引入迭代VibeCoding框架,对比渐进式与非渐进式攻击,发现单一监控器无法同时防御两种策略,高规避率(≥65%)在多个模型间泛化。
背景解释
AI编程代理正从辅助工具演变为自主开发者,其持久化代码库为隐蔽攻击提供了新途径。攻击者可将恶意代码分散到多个提交中,规避传统单次审查。这项研究揭示了现有监控机制的盲区,对AI安全部署具有警示意义,但需注意研究基于特定模型和任务,实际应用需更全面的防御策略。
原文译文
以下为抓取到的原文内容译文,已统一为站内阅读格式。
arXiv 现已独立运营的非营利组织!了解更多×
搜索 arXiv
按回车键搜索 ·高级搜索
计算机科学 > 人工智能
arXiv:2607.02514v1 (cs)
[提交于 2026 年 7 月 2 日]
标题:持久状态 AI 控制中的分布式攻击
作者:Josh Hills,Ida Caspary,Asa Cooper Stickland
查看论文 PDF,标题为“持久状态 AI 控制中的分布式攻击”,作者 Josh Hills 等 2 人
摘要:随着 AI 编码代理变得越来越自主,它们越来越多地迭代式地交付代码,代码库在会话之间持久存在。这种持久性创造了一个新的攻击面:一个未对齐或经过提示注入的代理可以将攻击分布到多个拉取请求(PR)中,并将其有效载荷定时到具有最佳自然掩护的 PR。为了研究由此产生的动态,我们引入了 Iterative VibeCoding,这是一个用于 AI 控制(即安全部署有能力但可能不可信的 AI 的研究)的设置。在 Iterative VibeCoding 中,一个编码代理在持久代码库中通过一系列 PR 构建软件,同时执行一个隐蔽的侧任务。我们的基准测试包括两个任务族:CLI 工具和 Flask Web 服务,共 20 个任务变体。我们使用 Claude Sonnet 4.5 作为攻击代理,GPT-4o 作为监控器。我们比较了将侧任务分布到多个 PR 的渐进式攻击与集中在单个 PR 中的非渐进式攻击。没有单一的监控器对两者都鲁棒:哪种策略最能逃避(成功同时逃避监控器)取决于监控器类型,因此防御者无法用任何一个监控器同时阻止渐进式和非渐进式攻击。高逃避率(>= 65%)在不同模型攻击代理后端(Sonnet 4.5、Gemini 3.1 Pro、Kimi K2.5)中普遍存在,这证实了这是持久状态攻击面的属性,而非单个模型的能力。逃避率在最新监控器模型中仍然很高,并且对于能力更强的模型,渐进式和非渐进式逃避之间的差距扩大。我们引入了一个有状态的链接跟踪监控器,用于跟踪跨 PR 的可疑累积。在两个任务族上,它检测渐进式攻击的效果明显优于仅看到更多累积历史的差异监控器。将这个更强的监控器与轨迹监控器结合在一个四监控器集成中,将渐进式攻击的逃避率从最弱标准差异监控器下的 93% 降低到 47%。
| | | | --- | --- | | 主题: | 人工智能 (cs.AI) | | 引用为: |arXiv:2607.02514[cs.AI] | | | (或此版本的arXiv:2607.02514v1[cs.AI]) | | |https://doi.org/10.48550/arXiv.2607.02514<br>点击了解更多<br>arXiv 通过 DataCite 发布的 DOI(待注册) |
提交历史
来自:Josh Hills \[查看邮件]
[v1] 2026 年 7 月 2 日星期四 17:59:56 UTC (170 KB)
全文链接:
访问论文:
查看论文 PDF,标题为“持久状态 AI 控制中的分布式攻击”,作者 Josh Hills 等 2 人

当前浏览上下文:
cs.AI
[< 上一页](https://arxiv.org/prevnext?id=2607.02514&function=prev&context=cs.AI "cs.AI 中的上一篇 (accesskey p)") \| [下一页 >](https://arxiv.org/prevnext?id=2607.02514&function=next&context=cs.AI "cs.AI 中的下一篇 (accesskey n)")
更改为浏览:
参考文献与引用
导出 BibTeX 引用
书签

文献工具
文献与引用工具
文献浏览器 切换
文献浏览器 _(什么是浏览器?)_
Connected Papers 切换
Connected Papers _(什么是 Connected Papers?)_
Litmaps 切换
Litmaps _(什么是 Litmaps?)_
scite.ai 切换
scite 智能引用 _(什么是智能引用?)_
代码、数据、媒体
本文相关的代码、数据和媒体
alphaXiv 切换
alphaXiv _(什么是 alphaXiv?)_
代码链接 切换
CatalyzeX 论文代码查找器 _(什么是 CatalyzeX?)_
DagsHub 切换
DagsHub _(什么是 DagsHub?)_
GotitPub 切换
Gotit.pub _(什么是 GotitPub?)_
Huggingface 切换
Hugging Face _(什么是 Huggingface?)_
ScienceCast 切换
ScienceCast _(什么是 ScienceCast?)_
演示
演示
Replicate 切换
Replicate _(什么是 Replicate?)_
Spaces 切换
Hugging Face Spaces _(什么是 Spaces?)_
Spaces 切换
TXYZ.AI _(什么是 TXYZ.AI?)_
相关论文
推荐与搜索工具
链接到 Influence Flower
Influence Flower _(什么是 Influence Flowers?)_
核心推荐器 切换
CORE 推荐器 _(什么是 CORE?)_
- 作者
- 会议/期刊
- 机构
- 主题
关于 arXivLabs
arXivLabs:与社区合作者的实验项目
arXivLabs 是一个框架,允许合作者直接在 arXiv 网站上开发和分享新功能。
与 arXivLabs 合作的个人和组织都已接受并采纳我们的价值观:开放、社区、卓越和用户数据隐私。arXiv 致力于这些价值观,只与遵守这些价值观的合作伙伴合作。
有能为 arXiv 社区增加价值的项目想法?了解更多关于 arXivLabs。
本文哪些作者是背书人?\| 禁用 MathJax (什么是 MathJax?)
来源地区
Global
热度分
89
分类
研究进展
语言
en
