所有评测
智能体评测IT 运维
ITBench
在离线 Kubernetes 事故快照中定位导致故障的实体,评估智能体的站点可靠性工程根因分析能力。
完整召回下平均精确率%数值越高越好
评测要点
评测设置一览
01
事故任务
59 项
02
重复次数
每项任务 3 次
03
输入
告警、事件、轨迹、指标和应用拓扑的离线快照
04
输出
结构化 JSON 根因诊断
05
回合上限
100 回合/任务
完整测评方法
从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。
评测背景
评测背景
任务聚焦 Kubernetes 事故根因分析;智能体必须区分真正的致因实体与仅表现出症状的下游部署、服务、Pod、命名空间或网络策略。
每个事故以离线快照提供,既保留真实运维信号,又让不同模型在同一环境资料上进行比较。
能力范围
能力范围
- 读取并关联告警、事件、轨迹、指标与拓扑。
- 通过终端检查离线事故快照。
- 从症状链中识别全部根因实体并控制误报。
测试设置
测试设置
- 把每项 Kubernetes 事故快照挂载到隔离代码执行环境。
- 向智能体提供 shell 权限和结构化 JSON 输出要求。
- 每项任务运行 3 次,单次最多 100 个智能体回合。
运行流程
运行流程
- 智能体检查工作区内的告警、事件、轨迹、指标和拓扑。
- 定位导致事故的部署、服务、Pod、命名空间、配置或网络策略。
- 把最终根因实体写入 JSON 文件,并与标准答案比较。
计分方式
计分方式
- 只有在没有漏掉任何标准根因实体,即假阴性为 0 时,任务才获得非零分。
- 满足完整召回时,单任务得分为 TP /(TP + FP);否则得 0。
- 主成绩是全部任务在完整召回条件下的平均精确率。
结果呈现
结果呈现
- 报告完整召回下平均精确率和平均智能体回合数。
- 定义每任务输出 Token、成本及其与主分的关系。
- 定义每任务加权平均解码时间;时间不含首 Token 等待与额外开销。
解读限制
解读限制
- 当前范围只覆盖 Kubernetes 站点可靠性事故,不覆盖全部 IT 自动化任务。
- 离线快照不能完全模拟实时集群中持续变化的状态。
- 完整召回门槛严格:漏掉一个根因实体就会使该任务得 0。
示例任务
功能开关导致广告服务过载
示例应用的 ad 服务出现 CPU 与延迟升高,负载功能开关 adHighCpu 已在配置映射中开启;需要从快照中找到真正致因实体。
成功条件
- 识别保存该功能开关的 flagd-config 配置映射。
- 把对应命名空间中的配置映射列为致因实体。
- 不把只是响应配置变化的下游 ad Deployment 误报为根因。