所有评测
编程评测代码执行

LiveCodeBench

持续使用三个主流编程竞赛平台的新题,检验 Python 代码生成及在隐藏测试下解决算法问题的能力。

代码通过率%数值越高越好

评测要点

评测设置一览

01
当前题量
315 道代码题
02
重复次数
每题 3 次
03
输出形式
可执行 Python 代码
04
运行环境
Ubuntu 22.04 LTS、Python 3.12

完整测评方法

从测试对象到评分与结果解释,逐步说明这一指标是如何形成的。

评测背景

静态代码基准可能被训练数据覆盖,LiveCodeBench 持续收集新发布的竞赛编程问题,以降低题目污染并保持难度更新。

完整框架覆盖代码生成、自我修复、代码执行和测试输出预测;当前配置使用 315 道代码生成题进行统一比较。

能力范围

  • 理解算法题、约束、输入输出和已有函数签名。
  • 生成可执行 Python 解法并处理隐藏边界条件。
  • 将推理落实为能通过全部单元测试的程序。

测试设置

  • 运行 315 道 Python 代码生成题,每题重复 3 次。
  • 代码在 Ubuntu 22.04 LTS、Python 3.12 环境中执行。
  • 沿用题目提示格式,但不应用额外的通用或模型定制系统提示。

运行流程

  • 有起始代码时,模型按指定函数头补全解法;无起始代码时,从标准输入读取并写入标准输出。
  • 只从 python 代码围栏中提取程序,然后在隔离环境执行隐藏单元测试。
  • 每题重复 3 次并记录每次首次生成代码是否通过全部测试。

计分方式

  • 一次生成只有通过该题全部单元测试才计为成功,采用 pass@1。
  • 最终分数为 315 道题、每题 3 次运行的平均通过率。

结果呈现

  • 主指标为代码执行 pass@1 百分比。
  • 同时报告输入、推理、答案 Token,评测成本与每任务用时。
  • 结合模型发布日期呈现分数,以观察新题上的能力变化。

解读限制

  • 当前配置只运行 Python 代码生成子集,不能代表完整软件工程能力。
  • 全部测试必须通过的二元评分不区分接近正确与完全错误。
  • 持续加入新题可降低已知污染风险,但不能证明训练数据绝对未覆盖。

示例任务

判断矩形角点是否可达

给定矩形右上角坐标和若干圆形障碍,判断能否从左下角走到右上角,路径不得接触或进入圆,也不得接触矩形的其他边界。

成功条件

  • 样例 xCorner=3、yCorner=4、circles=[[2,1,1]] 返回 true。
  • 程序处理最多 1,000 个圆及坐标上限 10^9,并通过全部隐藏测试。