AI编码代理可升级科研软件但无法判断科学正确性

摘要
OpenAI与学术伙伴的实地报告显示,编码代理能现代化被忽视的研究软件,速度提升高达60倍。但参与者称,系统“雄辩、有说服力,且以易被忽视的方式自信地犯错”。工作重心从写代码转向验证科学正确性。
背景解释
科研软件常因维护不足而落后,AI编码代理可自动更新代码,大幅提升效率。然而,AI无法判断科学逻辑是否正确,可能产生看似合理实则错误的代码。这提醒科研人员,AI是工具,最终的科学验证仍需人类专家把关。
原文译文
以下为抓取到的原文内容译文,已统一为站内阅读格式。
AI 编程代理可以现代化研究软件,但无法判断科学结果是否正确
AI 编程代理可以现代化研究软件,但无法判断科学结果是否正确

OpenAI 与学术合作伙伴的一份实地报告显示,编程代理可以更新和加速老化的研究软件。然而,大部分工作从编写代码转向了验证结果。
许多广泛使用的研究工具最初只是单篇论文的配套代码。小型学术团队在编写这些代码时,往往没有足够的时间和资源进行适当的测试、维护或优化。结果是,这些软件虽然脆弱,却对整个领域至关重要,需要不断修补。OpenAI 与学术合作伙伴的一份实地报告表明,AI 编程代理可能有助于弥补这一差距。
该报告记录了八个案例研究,主要集中在生物学领域,研究团队使用了 Codex 和 Claude Code 等编程代理。项目范围从基本维护和针对性优化,到用现代编程语言完全重写。

这八个项目从简单的构建现代化到完整的 GPU 原生重写。| 图片来源:OpenAI
编程代理实现了超过 60 倍的加速
其中一个较简单的项目涉及现代化 cyvcf2,这是一个用于读取遗传数据的 Python 库。GPT-5.5 用现代构建和安装流程取代了其过时的流程。
MHCflurry 的迁移则复杂得多。MHCflurry 是一个免疫学模型,用于预测免疫细胞将识别哪些靶标。Claude Code 和 Codex 在将约 10,000 行代码从 TensorFlow 移植到 PyTorch 时,交替扮演开发者和审查者的角色。
rustar-aligner 项目更为雄心勃勃。它用 Rust 从头重写了 STAR。STAR 将细胞中的测序读段映射到基因组中的相应位置。原始代码包含超过 20,000 行 C 和 C++,尽管它仍是许多研究流程的一部分,但已不再积极维护。
为了检查重写版本是否与原版行为一致,团队在来自酵母细胞的 10,000 个短测序读段上测试了这两个工具。对于单端读段,rustar-aligner 在 99.815% 的情况下产生了与 STAR 相同的结果。对于双端读段,一致率为 99.883%。
比较不仅涵盖基因组中的映射位置,还包括两个程序为每个读段生成的其他几个关键字段。两个工具都没有映射出对方未能映射的读段。
RustQC 通过将 15 个独立的质控工具合并到一个程序中,实现了最大的加速。在一个大型数据集上,运行时间从 15 小时 34 分钟降至 14 分钟 54 秒,加速超过 60 倍。
另一个项目 HelixForge 用可在 GPU 上运行的版本取代了用于生成合成基因组数据的工具。在使用来自一个供体、包含一千万碱基对基因组片段的测试中,HelixForge 完成整个流程的速度比 BamSurgeon 快 59.6 倍。仅主要计算步骤就快了 98.6 倍。

GPU 原生重写版本在各项测量指标上都优于现有的 CPU 工具,而不仅仅是速度。| 图片来源:OpenAI
快速代码仍可能产生糟糕的科学结果
在这些案例研究中,代理能快速完成定义明确的任务,但无法可靠地判断其工作是否科学正确。即使代码包含错误,系统也常常以十足的信心呈现结果。
cyvcf2 开发者 Brent Pedersen 写道:“使用编程代理,快速前进很容易;但要在科学上走得更远,目前仍需要专家指导、理解、品味和细心。”
领导 RustQC 的 Philip Ewels 将代理描述为“雄辩、有说服力,并且以容易忽视的方式自信地犯错”。他从不允许模型评判自己工作的准确性,而是构建了一个独立的测试框架。

加速来自一系列小的代码更改,而不是单一的优化。| 图片来源:OpenAI
bayesm 案例研究展示了这些错误可能有多难发现。其 Rust 重写版本运行速度比原版快 2 到 20 倍,但两种高级方法的初始版本包含的错误很难仅从输出中察觉。
在一种方法中,代理反转了一个关键控制参数,导致程序使用了预期值的倒数。另一个 bug 影响了计算本身。研究人员在针对数千个已知结果的合成数据集进行详细校准测试后,才发现该问题。

统计校准发现了早期一致性测试遗漏的 bug。| 图片来源:OpenAI
另一种名为 HART 的方法整体上产生了看似合理的结果,但仍包含几个缺陷。这些缺陷包括不必要的昂贵计算和错误缩放的校正因子。仅凭看似合理的测试结果无法证明代码是正确的。
早期将 MHCflurry 移植到 PyTorch 的尝试在 2025 年初失败了。开发者 Sergey Feldman 现在将失败归因于当时可用的模型,而不是编码工具本身。在他看来,只有更新的模型世代才变得足够可靠,能够独立处理大部分此类工作。
人类定义测试,代理编写代码
这些项目遵循一致的分工。人类定义目标、成功标准和验证方法,而代理负责实现。
hifiasm 项目展示了这一点在实践中的运作方式。Hifiasm 从许多短片段组装出完整的基因组。在要求 GPT-5.5 优化之前,研究人员构建了一个包含独立训练和验证数据集的测试环境。随后,模型发现了将真实人类基因组数据上的运行时间缩短近 15% 的更改。
HI.SIM 是一个用于模拟遗传数据的库,所需的人工参与更少。GPT-5.2 在一次遍历中找到了优化程序各个部分的方法。使用更新模型的第二次遍历发现了更多改进。这些更改共同将运行时间减少了约 31%,且未改变输出。
廉价重写带来维护问题
作者还提供了潜在节省的粗略估计。如果代理能解决影响研究软件的四分之一到一半的安装问题,那么 100 个软件包节省的研究时间价值在 60 万美元到近 500 万美元之间。仅 NumPy 一项,报告估计代理每年可节省约 650 小时的维护工作。
长期维护与验证和科学准确性一样,仍然是一个主要的开放问题。低成本重写可能会分裂用户社区,并使经验丰富的维护者本已有限的时间更加分散。
各团队对所有权和维护采取了不同的方法。一些更改直接进入了原始项目。由于 STAR 不再维护,rustar-aligner 转移到了 scverse 研究联盟。FastQC 的作者拒绝用其 Rust 重写版本取代原始工具。团队反而将发现的改进添加到了原始 Java 版本中,实现了相同的三倍加速。
这份实地报告回顾了已完成的项目,并依赖于相关人员的叙述。作者强调,这些发现并非来自代表性研究。他们仍然认为主要瓶颈正在从编码本身转向验证、科学审查以及维护和未来发展的明确责任。
同样的模式也出现在研究之外的软件开发中。METR 的一项研究发现,实际的项目维护者会拒绝大约一半的、被广泛使用的 SWE-bench Verified 基准评为通过的 AI 编写的解决方案。
一项关于开发者对AI生成代码不满的研究发现了类似的权衡。生成代码节省的时间可能反而花在审查代码上。curl项目在AI生成的漏洞报告消耗了维护者时间却没有产生有用结果后,关闭了其漏洞赏金计划。
这份现场报告是OpenAI更广泛进军科学领域的一部分。该公司成立了一个专门的科学团队,由Kevin Weil领导,他预计2026年之于科学将如同2025年之于软件工程。4月,OpenAI推出了GPT-Rosalind,一个用于生命科学研究的模型,并发布了Codex的免费生命科学插件,该插件将模型连接到50多个公共数据库和生物学工具。
无炒作AI新闻——人工精选
订阅THE DECODER,享受无广告阅读、每周AI通讯、每年六次的独家“AI雷达”前沿报告、完整档案访问以及评论区的访问权限。
阅读全文,了解全貌。
订阅以获取无炒作报道。
- 访问THE DECODER所有文章。
- 无干扰阅读——无Google广告。
- 访问评论和社区讨论。
- 每年6次:“AI雷达”——深入探讨关键AI主题。
- KI Pro在线活动最高25%折扣。
- 访问我们完整的十年档案。
- 获取来自The Decoder的最新AI新闻。
来源地区
Europe
热度分
73
分类
研究进展
语言
en
