所有评测
智能体评测双控制
τ²-Bench Telecom
在电信技术支持场景中分别模拟客服智能体与用户,让双方共同改变共享状态,检验规划、工具使用、沟通和用户引导。
任务通过率%数值越高越好
评测要点
评测设置一览
01
评测规模
114 项电信任务
02
生成任务池
2,285 项程序化任务中抽样
03
重复次数
每项 3 次
04
执行上限
每次最多 100 步
完整测评方法
从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。
评测背景
评测背景
传统客服评测常把用户视为被动的信息提供者;本评测采用双控制环境,让客服智能体和用户都能通过工具改变同一个动态世界状态。
电信域覆盖服务连接、移动数据和 MMS 等意图,重点观察智能体能否在推理之外清晰指导用户完成必要操作。
能力范围
能力范围
- 诊断电信服务、移动数据和消息问题。
- 协调智能体工具操作与用户设备侧操作。
- 在不完全可见的共享状态中规划、沟通并达成可验证结果。
测试设置
测试设置
- 完整运行 114 项电信任务,每项重复 3 次。
- 采用默认双控制模式,客服智能体与用户模拟器相互独立。
- 用户模拟器固定为同一非推理配置;每次任务最多执行 100 步。
运行流程
运行流程
- 系统初始化用户背景、设备与账户状态,并向客服智能体呈现用户问题。
- 双方轮流对话和使用各自工具,逐步修改共享状态。
- 任务结束后直接检查最终世界状态,而不是按对话风格主观打分。
计分方式
计分方式
- 最终状态满足任务全部成功条件时记为通过,否则记为失败。
- 每项任务以 3 次重复的 pass@1 平均值计分,最终报告总体任务通过率。
结果呈现
结果呈现
- 主指标为 114 项任务的平均通过率。
- 同时呈现每任务输出 Token,可拆分答案与推理 Token。
- 可结合每任务成本、用时与模型发布日期分析结果。
解读限制
解读限制
- 只采用完整套件三种执行模式中的默认双控制模式。
- 用户模拟器的固定行为会影响沟通路径,不能覆盖所有真实用户差异。
- 100 步上限会截断长期未收敛的会话;该配置现用于历史比较。
示例任务
移动数据无法使用
用户在家中没有 Wi-Fi,手机移动数据已关闭且 15.1 GB 流量上限已用尽;用户不愿换套餐,但可补充 2.0 GB。
成功条件
- 用户开启移动数据,网络测速达到 200 Mbps 以上。
- 客服智能体为账户准确补充 2.0 GB 流量。