每次尝试使用干净、隔离的 MCP 会话;确定性检查比较最终状态与预期效果,允许不同执行路径。507题中477题只依靠状态检查,30题另加有限的回答语义评分。

文章分别报告 pass@1、20次至少成功一次的 pass@20,以及实际20次全部成功的任务比例。作者在12模型、121680次有效试验的消融分析中报告,失败尝试中67.24%仍正常结束、调用过状态修改工具且没有最终工具报错。

开放的 OpenEnv 适配器用于评估,完成一个episode返回二元通过/失败结果;运行说明要求Linux或WSL、Python3.11+、uv、Docker及固定数据版本,Typesense、MCP会话代理和模型端点需要另行准备。

运行故障写入独立错误记录,不能混作模型成功结果;官方示例以固定框架提交、数据版本和bundle hash约束结果可追溯性。

影响与意义

适合评估客服、出行和其他会修改业务记录的Agent。关键是把成功标准落到可执行状态断言,同时测重复成功率;文章提出的缩减工具面、可恢复错误重试等改进建议尚未在该基准中测量收益。

可用性与限制

框架、基准数据和OpenEnv环境已有公开入口;代码MIT、数据CDLA-Permissive-2.0、OpenEnv环境BSD-3-Clause。训练组件仍标注coming soon,不能说已开放强化学习训练。

官方来源