研究进展arXiv AI / CL
UniClawBench:首个面向真实世界任务的主动智能体基准

摘要
UniClawBench 是首个基于能力驱动的基准测试,用于评估在动态真实环境中运行的主动智能体。它围绕技能使用、探索、长上下文推理、多模态理解和跨平台协调五种基础能力,设计了400个双语真实世界任务,并通过实时Docker容器和细粒度检查点进行评估。
背景解释
现有基准多依赖沙盒环境和单轮评估,难以反映智能体在真实世界中的表现。UniClawBench 通过能力驱动的任务分类和闭环评估策略,能更准确地诊断智能体失败的根本原因,推动主动智能体在工具操作和用户辅助等实际场景中的应用。
原文译文
以下为抓取到的原文内容译文,已统一为站内阅读格式。
这条新闻暂未保存可复现的原文正文,可以点击原文链接阅读。
来源地区
Global
热度分
81
分类
研究进展
语言
en
