LACUNA:评估大模型遗忘精准度的新测试平台

摘要
LACUNA是首个提供参数级定位基准的遗忘测试平台,通过向OLMo模型注入合成个人身份信息,评估现有遗忘方法是否真正擦除知识。研究发现,当前方法虽在输出层面表现良好,但定位不精准,易受重新浮现攻击。
背景解释
大语言模型会记忆训练数据中的敏感信息,如个人身份信息,引发隐私担忧。遗忘技术旨在删除这些信息,但现有评估仅关注输出,无法确认是否真正擦除。LACUNA通过精确注入知识到特定参数,为评估遗忘精准度提供基准,推动更可靠的隐私保护方法。
原文译文
以下为抓取到的原文内容译文,已统一为站内阅读格式。
arXiv 现已独立为非营利组织!了解更多×
搜索 arXiv
按回车搜索 ·高级搜索
计算机科学 > 计算与语言
arXiv:2607.02513v1 (cs)
[提交于 2026 年 7 月 2 日]
标题:LACUNA:评估大语言模型遗忘定位精度的测试平台
作者:Matteo Boglioni,Thibault Rousset,Siva Reddy,Marius Mosbach,Verna Dankers
查看论文 PDF,标题为 LACUNA: A Testbed for Evaluating Localization Precision for LLM Unlearning,作者 Matteo Boglioni 等 4 人
摘要:大语言模型会记忆敏感的训练数据,包括个人身份信息(PII),因此迫切需要可靠的训练后移除方法。遗忘学习已成为一种有前景的解决方案,最先进(SOTA)方法通常遵循“先定位、后遗忘”的范式,针对特定模型参数。然而,现有基准仅在输出层面评估遗忘效果,未能回答遗忘是否真正从模型参数中擦除了知识,还是仅仅掩盖了知识——这一担忧因重浮现攻击的成功而加剧。为弥补这一差距,我们提出了 LACUNA:首个具有真实参数级定位的遗忘测试平台。LACUNA 通过掩码持续预训练,将合成个体的 PII 注入到基于 OLMo 的 1B 和 7B 模型的预定义参数中,从而能够直接评估遗忘是否针对负责知识存储的权重。我们使用 LACUNA 对当前 SOTA 遗忘方法进行基准测试,发现尽管在输出层面表现强劲,但现有方法精度极低且易受重浮现攻击。我们进一步表明,当定位成功时,即使是简单的基于梯度的遗忘方法也能实现强大的擦除效果和对重浮现攻击的鲁棒性,这凸显了精确遗忘的重要性。我们发布 LACUNA,以补充行为评估并推动基于定位的鲁棒遗忘方法的进一步发展。
| | | | --- | --- | | 学科: | 计算与语言 (cs.CL);人工智能 (cs.AI);机器学习 (cs.LG) | | 引用为: |arXiv:2607.02513[cs.CL] | | | (或arXiv:2607.02513v1[cs.CL] 为此版本) | | |https://doi.org/10.48550/arXiv.2607.02513<br>聚焦了解更多<br>arXiv 通过 DataCite 发布的 DOI(注册中) |
提交历史
来自:Matteo Boglioni \[查看邮件]
[v1] 2026 年 7 月 2 日,星期四 17:59:52 UTC (857 KB)
全文链接:
访问论文:
查看论文 PDF,标题为 LACUNA: A Testbed for Evaluating Localization Precision for LLM Unlearning,作者 Matteo Boglioni 等 4 人

当前浏览上下文:
cs.CL
[< 上一页](https://arxiv.org/prevnext?id=2607.02513&function=prev&context=cs.CL "cs.CL 中的上一篇 (accesskey p)") \| [下一页 >](https://arxiv.org/prevnext?id=2607.02513&function=next&context=cs.CL "cs.CL 中的下一篇 (accesskey n)")
更改浏览至:
参考文献与引用
导出 BibTeX 引用
书签

文献工具
文献与引用工具
文献浏览器 切换
文献浏览器 _(什么是文献浏览器?)_
Connected Papers 切换
Connected Papers _(什么是 Connected Papers?)_
Litmaps 切换
Litmaps _(什么是 Litmaps?)_
scite.ai 切换
scite 智能引用 _(什么是智能引用?)_
代码、数据、媒体
本文相关的代码、数据和媒体
alphaXiv 切换
alphaXiv _(什么是 alphaXiv?)_
代码链接 切换
CatalyzeX 论文代码查找器 _(什么是 CatalyzeX?)_
DagsHub 切换
DagsHub _(什么是 DagsHub?)_
GotitPub 切换
Gotit.pub _(什么是 GotitPub?)_
Huggingface 切换
Hugging Face _(什么是 Huggingface?)_
ScienceCast 切换
ScienceCast _(什么是 ScienceCast?)_
演示
演示
Replicate 切换
Replicate _(什么是 Replicate?)_
Spaces 切换
Hugging Face Spaces _(什么是 Spaces?)_
Spaces 切换
TXYZ.AI _(什么是 TXYZ.AI?)_
相关论文
推荐与搜索工具
链接到 Influence Flower
Influence Flower _(什么是 Influence Flowers?)_
核心推荐器 切换
CORE 推荐器 _(什么是 CORE?)_
- 作者
- 会议/期刊
- 机构
- 主题
关于 arXivLabs
arXivLabs:与社区合作者的实验项目
arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和分享新的 arXiv 功能。
与 arXivLabs 合作的个人和组织都已接受并认同我们开放、社区、卓越和用户数据隐私的价值观。arXiv 致力于这些价值观,并仅与遵守这些价值观的合作伙伴合作。
有项目想法能为 arXiv 社区增加价值?了解更多关于 arXivLabs。
本文作者中哪些是背书人?\| 禁用 MathJax (什么是 MathJax?)
来源地区
Global
热度分
81
分类
研究进展
语言
en
