所有评测
推理与知识研究级物理

CritPt

用未公开的研究级物理问题检验完整科研推理,并以抗猜测、机器可验证的答案格式评分。

完整挑战正确率%数值越高越好

评测要点

评测设置一览

01
复合挑战
71 个:70 个测试题 + 1 个示例
02
检查点
190 个
03
物理子领域
11 个
04
命题规模
50+ 位研究人员、30 个机构
05
审阅投入
平均每题 40+ 小时
06
重复次数
每个测试挑战 5 次

完整测评方法

从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。

评测背景

挑战覆盖凝聚态、量子、原子分子与光学、天体、高能、数学物理、统计物理、核物理、非线性动力学、流体与生物物理。

每个复合挑战模拟入门级完整研究项目,并拆成更细的检查点;答案采用浮点数组、符号表达式或 Python 函数等抗猜测格式。

能力范围

  • 在研究级物理问题中完成长链路推导。
  • 把理论结果表达为严格的符号、数值或函数输出。
  • 同时解决完整挑战并通过中间检查点。

测试设置

  • 使用 70 个测试挑战,另保留 1 个公开示例。
  • 每题提供明确的答案解析模板,约束最终输出类型。
  • 自动评分流水线针对高级物理输出格式进行专门适配。
  • 每个测试挑战独立运行 5 次。

运行流程

  • 模型阅读复合研究问题并完成所需物理建模与推导。
  • 按模板提交浮点数组、符号表达式或 Python 函数。
  • 评分流水线验证最终答案,并利用 190 个检查点观察细粒度进展。

计分方式

  • 完整挑战的答案必须通过对应机器验证才记为正确。
  • 主成绩按 70 个测试挑战、每个挑战 5 次运行的平均正确率报告。
  • 检查点用于提供细粒度分析,不替代完整挑战主分。

结果呈现

  • 报告完整挑战正确率及随发布日期的变化。
  • 报告每任务输出 Token、每任务成本及其组成。
  • 报告每任务加权平均解码时间,不包含首 Token 等待与额外开销。

解读限制

  • 范围限定在 11 个物理子领域,不能外推为一般科研能力。
  • 70 个测试挑战规模较小,单题对总分影响较大。
  • 机器评分依赖针对特定高级物理输出格式定制的验证规则。

示例任务

量子错误检测挑战

给定使用辅助量子位制备 [[4,2,2]] 编码逻辑双量子位状态的门电路,推导在筛除可检测错误且辅助位测得 0 后,逻辑态保真度关于双量子位门错误率 p 的符号表达式。

成功条件

  • 通过提供的 answer(p) 模板返回符号表达式。
  • 不增加模板之外的依赖,也不在最终模板中加入额外推导。
  • 表达式通过针对逻辑态保真度的机器验证。