所有评测
智能体评测IT 运维

ITBench

在离线 Kubernetes 事故快照中定位导致故障的实体,评估智能体的站点可靠性工程根因分析能力。

完整召回下平均精确率%数值越高越好

评测要点

评测设置一览

01
事故任务
59 项
02
重复次数
每项任务 3 次
03
输入
告警、事件、轨迹、指标和应用拓扑的离线快照
04
输出
结构化 JSON 根因诊断
05
回合上限
100 回合/任务

完整测评方法

从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。

评测背景

任务聚焦 Kubernetes 事故根因分析;智能体必须区分真正的致因实体与仅表现出症状的下游部署、服务、Pod、命名空间或网络策略。

每个事故以离线快照提供,既保留真实运维信号,又让不同模型在同一环境资料上进行比较。

能力范围

  • 读取并关联告警、事件、轨迹、指标与拓扑。
  • 通过终端检查离线事故快照。
  • 从症状链中识别全部根因实体并控制误报。

测试设置

  • 把每项 Kubernetes 事故快照挂载到隔离代码执行环境。
  • 向智能体提供 shell 权限和结构化 JSON 输出要求。
  • 每项任务运行 3 次,单次最多 100 个智能体回合。

运行流程

  • 智能体检查工作区内的告警、事件、轨迹、指标和拓扑。
  • 定位导致事故的部署、服务、Pod、命名空间、配置或网络策略。
  • 把最终根因实体写入 JSON 文件,并与标准答案比较。

计分方式

  • 只有在没有漏掉任何标准根因实体,即假阴性为 0 时,任务才获得非零分。
  • 满足完整召回时,单任务得分为 TP /(TP + FP);否则得 0。
  • 主成绩是全部任务在完整召回条件下的平均精确率。

结果呈现

  • 报告完整召回下平均精确率和平均智能体回合数。
  • 定义每任务输出 Token、成本及其与主分的关系。
  • 定义每任务加权平均解码时间;时间不含首 Token 等待与额外开销。

解读限制

  • 当前范围只覆盖 Kubernetes 站点可靠性事故,不覆盖全部 IT 自动化任务。
  • 离线快照不能完全模拟实时集群中持续变化的状态。
  • 完整召回门槛严格:漏掉一个根因实体就会使该任务得 0。

示例任务

功能开关导致广告服务过载

示例应用的 ad 服务出现 CPU 与延迟升高,负载功能开关 adHighCpu 已在配置映射中开启;需要从快照中找到真正致因实体。

成功条件

  • 识别保存该功能开关的 flagd-config 配置映射。
  • 把对应命名空间中的配置映射列为致因实体。
  • 不把只是响应配置变化的下游 ad Deployment 误报为根因。