所有评测
推理与知识研究级物理
CritPt
用未公开的研究级物理问题检验完整科研推理,并以抗猜测、机器可验证的答案格式评分。
完整挑战正确率%数值越高越好
评测要点
评测设置一览
01
复合挑战
71 个:70 个测试题 + 1 个示例
02
检查点
190 个
03
物理子领域
11 个
04
命题规模
50+ 位研究人员、30 个机构
05
审阅投入
平均每题 40+ 小时
06
重复次数
每个测试挑战 5 次
完整测评方法
从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。
评测背景
评测背景
挑战覆盖凝聚态、量子、原子分子与光学、天体、高能、数学物理、统计物理、核物理、非线性动力学、流体与生物物理。
每个复合挑战模拟入门级完整研究项目,并拆成更细的检查点;答案采用浮点数组、符号表达式或 Python 函数等抗猜测格式。
能力范围
能力范围
- 在研究级物理问题中完成长链路推导。
- 把理论结果表达为严格的符号、数值或函数输出。
- 同时解决完整挑战并通过中间检查点。
测试设置
测试设置
- 使用 70 个测试挑战,另保留 1 个公开示例。
- 每题提供明确的答案解析模板,约束最终输出类型。
- 自动评分流水线针对高级物理输出格式进行专门适配。
- 每个测试挑战独立运行 5 次。
运行流程
运行流程
- 模型阅读复合研究问题并完成所需物理建模与推导。
- 按模板提交浮点数组、符号表达式或 Python 函数。
- 评分流水线验证最终答案,并利用 190 个检查点观察细粒度进展。
计分方式
计分方式
- 完整挑战的答案必须通过对应机器验证才记为正确。
- 主成绩按 70 个测试挑战、每个挑战 5 次运行的平均正确率报告。
- 检查点用于提供细粒度分析,不替代完整挑战主分。
结果呈现
结果呈现
- 报告完整挑战正确率及随发布日期的变化。
- 报告每任务输出 Token、每任务成本及其组成。
- 报告每任务加权平均解码时间,不包含首 Token 等待与额外开销。
解读限制
解读限制
- 范围限定在 11 个物理子领域,不能外推为一般科研能力。
- 70 个测试挑战规模较小,单题对总分影响较大。
- 机器评分依赖针对特定高级物理输出格式定制的验证规则。
示例任务
量子错误检测挑战
给定使用辅助量子位制备 [[4,2,2]] 编码逻辑双量子位状态的门电路,推导在筛除可检测错误且辅助位测得 0 后,逻辑态保真度关于双量子位门错误率 p 的符号表达式。
成功条件
- 通过提供的 answer(p) 模板返回符号表达式。
- 不增加模板之外的依赖,也不在最终模板中加入额外推导。
- 表达式通过针对逻辑态保真度的机器验证。