所有评测
推理与知识单轮指令

IFBench

通过 58 类全新、可验证的域外约束,检验模型能否在单轮回答中精确满足计数、格式和句子变换等输出要求。

提示级准确率%数值越高越好

评测要点

评测设置一览

01
测试规模
294 个单轮问题
02
约束范围
58 类可验证域外约束
03
重复次数
每题 5 次
04
计分
宽松验证模式,pass@1

完整测评方法

从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。

评测背景

常见指令遵循测试容易集中在少量约束类型上,模型可能记住形式,却不能把能力迁移到未见过的输出要求。IFBench 因此以全新的可程序验证约束检验泛化能力。

评测覆盖关键词精确计数、格式控制、句子操作等技能;另有 29 类人工整理的训练约束,但当前计分只使用 294 个单轮测试问题。

能力范围

  • 在一次回答中同时理解内容任务与多项输出约束。
  • 精确控制关键词次数、结构、格式和句子变换。
  • 把指令遵循能力迁移到未见过的约束类型。

测试设置

  • 使用包含 294 个问题的单轮测试集,不使用多轮版本。
  • 每个问题运行 5 次,所有模型沿用一致的提示与验证规则。
  • 每个回答交给配套规则验证器检查,无需工具调用环境。

运行流程

  • 向模型提交内容问题及其可验证输出约束,并收集完整回答。
  • 验证器逐项检查约束;宽松模式还会检查去掉首尾行、移除星号等回答变体。
  • 汇总每个问题 5 次运行的通过结果,再计算全部问题的提示级准确率。

计分方式

  • 单次回答只有满足该问题的验证条件才记为通过,采用 pass@1。
  • 最终分数是全部问题与全部重复运行的平均提示级准确率,数值越高越好。

结果呈现

  • 主指标为提示级准确率百分比。
  • 同时可报告输入、推理与答案 Token,以及每任务成本和用时。
  • 按模型发布日期展示分数变化,便于观察指令遵循能力演进。

解读限制

  • 只测试单轮精确约束,不代表长对话中的持续遵循能力。
  • 宽松模式会容忍少量额外文本或格式差异,因此它衡量的是约束实质而非逐字符一致。
  • 汇总分数不能直接说明模型具体在哪一类约束上失败。

示例任务

关键词精确计数

围绕一个假设性人生选择问题作答,同时按要求使用 kaleidoscope、nebula、whisper、labyrinth 和 paradox 五个关键词。

成功条件

  • kaleidoscope 恰好出现 1 次,nebula 恰好出现 2 次。
  • whisper 恰好出现 3 次,labyrinth 恰好出现 5 次。
  • paradox 恰好出现 7 次,且回答仍回应原问题。