全球大模型进展新闻浏览站
中文头版English
输入关键词,快速查找已抓取新闻。

今日版 / 2026年8月12日星期三

limbo logolimbo

数据更新时间

7月9日 17:59

启用来源

17

抓取状态

真实抓取

研究进展arXiv AI / CL

UniClawBench:首个面向真实世界任务的主动智能体基准

摘要

UniClawBench 是首个基于能力驱动的基准测试,用于评估在动态真实环境中运行的主动智能体。它围绕技能使用、探索、长上下文推理、多模态理解和跨平台协调五种基础能力,设计了400个双语真实世界任务,并通过实时Docker容器和细粒度检查点进行评估。

背景解释

现有基准多依赖沙盒环境和单轮评估,难以反映智能体在真实世界中的表现。UniClawBench 通过能力驱动的任务分类和闭环评估策略,能更准确地诊断智能体失败的根本原因,推动主动智能体在工具操作和用户辅助等实际场景中的应用。

原文译文

以下为抓取到的原文内容译文,已统一为站内阅读格式。

阅读原文
这条新闻暂未保存可复现的原文正文,可以点击原文链接阅读。

来源地区

Global

热度分

81

分类

研究进展

语言

en