所有评测
智能体评测银行智能体

τ³-Banking

在约 700 份互相关联的银行政策中检索依据,并通过多步骤工具调用完成可验证的客户支持工作流。

τ³-Banking Pass@1%数值越高越好

评测要点

评测设置一览

01
任务数量
97 个
02
重复次数
5 次
03
政策文档
约 700 份
04
知识库规模
约 195K token
05
产品类别
21 类
06
单次步骤上限
200 步

完整测评方法

从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。

评测背景

该评测模拟金融科技客户支持,任务包括争议处理、账户冻结、临时贷记和产品变更。成功要求智能体先找到正确政策,再与模拟用户协调并执行正确的多步骤账户操作。

政策知识库规模约 195K token,包含约 700 份互相引用的文档和 21 类产品;部分工具只在文档中出现,不会预先列入明显工具清单。

能力范围

  • 从大型非结构化知识库检索并应用具体政策
  • 在对话中协调用户动作与智能体工具操作
  • 执行多步骤、符合政策且可由数据库验证的账户变更

测试设置

  • 使用完整的 97 项银行任务套件,每项任务运行 5 次。
  • 知识检索采用 BM25 词法搜索与 grep 组合模式。
  • 模拟用户与自然语言断言评审采用固定的中等推理配置。

运行流程

  • 智能体检索政策文档,与模拟用户交互,并按正确顺序调用账户工具。
  • 每次运行最多 200 步;累计 10 次工具执行错误时提前终止。
  • 完成后检查后端数据库状态,例如争议是否创建、贷记是否发放。

计分方式

  • 每次运行按后端状态与自然语言断言判断是否成功,不按对话流畅度评分。
  • 主指标为 5 次重复的 pass@1 平均值;每次运行必须满足该任务全部成功条件。
  • 数值越高表示在检索、推理、协调和执行的完整链路上越可靠。

结果呈现

  • 报告总体 pass@1、输出 token、每任务成本与估算时间。
  • 展示分数与发布日期的关系以及代表性任务的初始状态、动作和成功条件。
  • 成本拆分输入、缓存、推理与回答 token。

解读限制

  • 评测聚焦单一银行客户支持领域,不能直接代表所有行业智能体能力。
  • 结果受固定检索模式、模拟用户和自然语言断言评审配置影响。
  • 200 步与 10 次工具错误上限会提前截断部分长轨迹。

示例任务

现金返还信用卡推荐

一位年收入 100,000 美元的商务旅行者希望获得无年费且现金返还最高的个人信用卡;智能体需查阅政策、比较四类奖励卡并协助提交申请。

成功条件

  • 最终申请满足约束且现金返还最高的卡种
  • 提交客户姓名与年收入 100000
  • 正确传递客户的订阅权益状态