全球大模型进展新闻浏览站
中文头版English
输入关键词,快速查找已抓取新闻。

今日版 / 2026年8月12日星期三

limbo logolimbo

数据更新时间

7月17日 17:49

启用来源

17

抓取状态

真实抓取

政策监管arXiv AI / CL

Muon优化器在智能体强化学习中的潜力初探

摘要

一项新研究探索了Muon优化器在稀疏奖励智能体强化学习中的效果。在ALFWorld任务上,使用Qwen2.5-0.5B-Instruct模型和GiGPO算法,仅对隐藏权重矩阵应用Muon,最终窗口验证成功率从0.290提升至0.546,提升88%。效果依赖于优势估计器和学习率。

背景解释

Muon优化器在大规模预训练中与AdamW竞争,但其在强化学习后训练中的价值尚不明确。这项研究通过单种子对比实验,初步表明Muon能显著提升智能体强化学习性能,但需联合研究策略优化器、优势估计器和学习率。多种子和跨任务验证仍有待进行。

原文译文

以下为抓取到的原文内容译文,已统一为站内阅读格式。

阅读原文
这条新闻暂未保存可复现的原文正文,可以点击原文链接阅读。

来源地区

Global

热度分

81

分类

政策监管

语言

en