所有评测
智能体评测双控制

τ²-Bench Telecom

在电信技术支持场景中分别模拟客服智能体与用户,让双方共同改变共享状态,检验规划、工具使用、沟通和用户引导。

任务通过率%数值越高越好

评测要点

评测设置一览

01
评测规模
114 项电信任务
02
生成任务池
2,285 项程序化任务中抽样
03
重复次数
每项 3 次
04
执行上限
每次最多 100 步

完整测评方法

从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。

评测背景

传统客服评测常把用户视为被动的信息提供者;本评测采用双控制环境,让客服智能体和用户都能通过工具改变同一个动态世界状态。

电信域覆盖服务连接、移动数据和 MMS 等意图,重点观察智能体能否在推理之外清晰指导用户完成必要操作。

能力范围

  • 诊断电信服务、移动数据和消息问题。
  • 协调智能体工具操作与用户设备侧操作。
  • 在不完全可见的共享状态中规划、沟通并达成可验证结果。

测试设置

  • 完整运行 114 项电信任务,每项重复 3 次。
  • 采用默认双控制模式,客服智能体与用户模拟器相互独立。
  • 用户模拟器固定为同一非推理配置;每次任务最多执行 100 步。

运行流程

  • 系统初始化用户背景、设备与账户状态,并向客服智能体呈现用户问题。
  • 双方轮流对话和使用各自工具,逐步修改共享状态。
  • 任务结束后直接检查最终世界状态,而不是按对话风格主观打分。

计分方式

  • 最终状态满足任务全部成功条件时记为通过,否则记为失败。
  • 每项任务以 3 次重复的 pass@1 平均值计分,最终报告总体任务通过率。

结果呈现

  • 主指标为 114 项任务的平均通过率。
  • 同时呈现每任务输出 Token,可拆分答案与推理 Token。
  • 可结合每任务成本、用时与模型发布日期分析结果。

解读限制

  • 只采用完整套件三种执行模式中的默认双控制模式。
  • 用户模拟器的固定行为会影响沟通路径,不能覆盖所有真实用户差异。
  • 100 步上限会截断长期未收敛的会话;该配置现用于历史比较。

示例任务

移动数据无法使用

用户在家中没有 Wi-Fi,手机移动数据已关闭且 15.1 GB 流量上限已用尽;用户不愿换套餐,但可补充 2.0 GB。

成功条件

  • 用户开启移动数据,网络测速达到 200 Mbps 以上。
  • 客服智能体为账户准确补充 2.0 GB 流量。