政策监管arXiv AI / CL
Muon优化器在智能体强化学习中的潜力初探

摘要
一项新研究探索了Muon优化器在稀疏奖励智能体强化学习中的效果。在ALFWorld任务上,使用Qwen2.5-0.5B-Instruct模型和GiGPO算法,仅对隐藏权重矩阵应用Muon,最终窗口验证成功率从0.290提升至0.546,提升88%。效果依赖于优势估计器和学习率。
背景解释
Muon优化器在大规模预训练中与AdamW竞争,但其在强化学习后训练中的价值尚不明确。这项研究通过单种子对比实验,初步表明Muon能显著提升智能体强化学习性能,但需联合研究策略优化器、优势估计器和学习率。多种子和跨任务验证仍有待进行。
原文译文
以下为抓取到的原文内容译文,已统一为站内阅读格式。
这条新闻暂未保存可复现的原文正文,可以点击原文链接阅读。
来源地区
Global
热度分
81
分类
政策监管
语言
en
