所有评测
编程评测代码执行
LiveCodeBench
持续使用三个主流编程竞赛平台的新题,检验 Python 代码生成及在隐藏测试下解决算法问题的能力。
代码通过率%数值越高越好
评测要点
评测设置一览
01
当前题量
315 道代码题
02
重复次数
每题 3 次
03
输出形式
可执行 Python 代码
04
运行环境
Ubuntu 22.04 LTS、Python 3.12
完整测评方法
从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。
评测背景
评测背景
静态代码基准可能被训练数据覆盖,LiveCodeBench 持续收集新发布的竞赛编程问题,以降低题目污染并保持难度更新。
完整框架覆盖代码生成、自我修复、代码执行和测试输出预测;当前配置使用 315 道代码生成题进行统一比较。
能力范围
能力范围
- 理解算法题、约束、输入输出和已有函数签名。
- 生成可执行 Python 解法并处理隐藏边界条件。
- 将推理落实为能通过全部单元测试的程序。
测试设置
测试设置
- 运行 315 道 Python 代码生成题,每题重复 3 次。
- 代码在 Ubuntu 22.04 LTS、Python 3.12 环境中执行。
- 沿用题目提示格式,但不应用额外的通用或模型定制系统提示。
运行流程
运行流程
- 有起始代码时,模型按指定函数头补全解法;无起始代码时,从标准输入读取并写入标准输出。
- 只从 python 代码围栏中提取程序,然后在隔离环境执行隐藏单元测试。
- 每题重复 3 次并记录每次首次生成代码是否通过全部测试。
计分方式
计分方式
- 一次生成只有通过该题全部单元测试才计为成功,采用 pass@1。
- 最终分数为 315 道题、每题 3 次运行的平均通过率。
结果呈现
结果呈现
- 主指标为代码执行 pass@1 百分比。
- 同时报告输入、推理、答案 Token,评测成本与每任务用时。
- 结合模型发布日期呈现分数,以观察新题上的能力变化。
解读限制
解读限制
- 当前配置只运行 Python 代码生成子集,不能代表完整软件工程能力。
- 全部测试必须通过的二元评分不区分接近正确与完全错误。
- 持续加入新题可降低已知污染风险,但不能证明训练数据绝对未覆盖。
示例任务
判断矩形角点是否可达
给定矩形右上角坐标和若干圆形障碍,判断能否从左下角走到右上角,路径不得接触或进入圆,也不得接触矩形的其他边界。
成功条件
- 样例 xCorner=3、yCorner=4、circles=[[2,1,1]] 返回 true。
- 程序处理最多 1,000 个圆及坐标上限 10^9,并通过全部隐藏测试。