所有评测
智能体评测银行智能体
τ³-Banking
在约 700 份互相关联的银行政策中检索依据,并通过多步骤工具调用完成可验证的客户支持工作流。
τ³-Banking Pass@1%数值越高越好
评测要点
评测设置一览
01
任务数量
97 个
02
重复次数
5 次
03
政策文档
约 700 份
04
知识库规模
约 195K token
05
产品类别
21 类
06
单次步骤上限
200 步
完整测评方法
从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。
评测背景
评测背景
该评测模拟金融科技客户支持,任务包括争议处理、账户冻结、临时贷记和产品变更。成功要求智能体先找到正确政策,再与模拟用户协调并执行正确的多步骤账户操作。
政策知识库规模约 195K token,包含约 700 份互相引用的文档和 21 类产品;部分工具只在文档中出现,不会预先列入明显工具清单。
能力范围
能力范围
- 从大型非结构化知识库检索并应用具体政策
- 在对话中协调用户动作与智能体工具操作
- 执行多步骤、符合政策且可由数据库验证的账户变更
测试设置
测试设置
- 使用完整的 97 项银行任务套件,每项任务运行 5 次。
- 知识检索采用 BM25 词法搜索与 grep 组合模式。
- 模拟用户与自然语言断言评审采用固定的中等推理配置。
运行流程
运行流程
- 智能体检索政策文档,与模拟用户交互,并按正确顺序调用账户工具。
- 每次运行最多 200 步;累计 10 次工具执行错误时提前终止。
- 完成后检查后端数据库状态,例如争议是否创建、贷记是否发放。
计分方式
计分方式
- 每次运行按后端状态与自然语言断言判断是否成功,不按对话流畅度评分。
- 主指标为 5 次重复的 pass@1 平均值;每次运行必须满足该任务全部成功条件。
- 数值越高表示在检索、推理、协调和执行的完整链路上越可靠。
结果呈现
结果呈现
- 报告总体 pass@1、输出 token、每任务成本与估算时间。
- 展示分数与发布日期的关系以及代表性任务的初始状态、动作和成功条件。
- 成本拆分输入、缓存、推理与回答 token。
解读限制
解读限制
- 评测聚焦单一银行客户支持领域,不能直接代表所有行业智能体能力。
- 结果受固定检索模式、模拟用户和自然语言断言评审配置影响。
- 200 步与 10 次工具错误上限会提前截断部分长轨迹。
示例任务
现金返还信用卡推荐
一位年收入 100,000 美元的商务旅行者希望获得无年费且现金返还最高的个人信用卡;智能体需查阅政策、比较四类奖励卡并协助提交申请。
成功条件
- 最终申请满足约束且现金返还最高的卡种
- 提交客户姓名与年收入 100000
- 正确传递客户的订阅权益状态