LiveCodeBench是一个面向大语言模型的编程能力综合评测基准,持续从LeetCode、AtCoder、CodeForces等主流编程竞赛平台收集题目,以避免模型对静态测试集的过拟合。该基准不仅评估代码生成能力,还涵盖代码修复、测试用例生成等多维度编程任务,旨在提供更动态、全面的模型编程能力评估方案。
Live Code Bench使用最新竞赛题目进行实时更新的编程能力评估,以防止数据污染