所有评测
推理与知识单轮指令
IFBench
通过 58 类全新、可验证的域外约束,检验模型能否在单轮回答中精确满足计数、格式和句子变换等输出要求。
提示级准确率%数值越高越好
评测要点
评测设置一览
01
测试规模
294 个单轮问题
02
约束范围
58 类可验证域外约束
03
重复次数
每题 5 次
04
计分
宽松验证模式,pass@1
完整测评方法
从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。
评测背景
评测背景
常见指令遵循测试容易集中在少量约束类型上,模型可能记住形式,却不能把能力迁移到未见过的输出要求。IFBench 因此以全新的可程序验证约束检验泛化能力。
评测覆盖关键词精确计数、格式控制、句子操作等技能;另有 29 类人工整理的训练约束,但当前计分只使用 294 个单轮测试问题。
能力范围
能力范围
- 在一次回答中同时理解内容任务与多项输出约束。
- 精确控制关键词次数、结构、格式和句子变换。
- 把指令遵循能力迁移到未见过的约束类型。
测试设置
测试设置
- 使用包含 294 个问题的单轮测试集,不使用多轮版本。
- 每个问题运行 5 次,所有模型沿用一致的提示与验证规则。
- 每个回答交给配套规则验证器检查,无需工具调用环境。
运行流程
运行流程
- 向模型提交内容问题及其可验证输出约束,并收集完整回答。
- 验证器逐项检查约束;宽松模式还会检查去掉首尾行、移除星号等回答变体。
- 汇总每个问题 5 次运行的通过结果,再计算全部问题的提示级准确率。
计分方式
计分方式
- 单次回答只有满足该问题的验证条件才记为通过,采用 pass@1。
- 最终分数是全部问题与全部重复运行的平均提示级准确率,数值越高越好。
结果呈现
结果呈现
- 主指标为提示级准确率百分比。
- 同时可报告输入、推理与答案 Token,以及每任务成本和用时。
- 按模型发布日期展示分数变化,便于观察指令遵循能力演进。
解读限制
解读限制
- 只测试单轮精确约束,不代表长对话中的持续遵循能力。
- 宽松模式会容忍少量额外文本或格式差异,因此它衡量的是约束实质而非逐字符一致。
- 汇总分数不能直接说明模型具体在哪一类约束上失败。
示例任务
关键词精确计数
围绕一个假设性人生选择问题作答,同时按要求使用 kaleidoscope、nebula、whisper、labyrinth 和 paradox 五个关键词。
成功条件
- kaleidoscope 恰好出现 1 次,nebula 恰好出现 2 次。
- whisper 恰好出现 3 次,labyrinth 恰好出现 5 次。
- paradox 恰好出现 7 次,且回答仍回应原问题。