[控场AI]
基准LiveCodeBench

Live Code Bench

LiveCodeBench是一个面向大语言模型的编程能力评测基准,通过持续收集编程竞赛平台(如LeetCode、Codeforces等)的题目并动态更新题库,以减少训练数据污染对评测结果的干扰。该基准覆盖代码生成、调试、执行推理等多个维度,旨在更客观地反映模型在真实编程任务中的能力表现。

时间轴 (近 90 天)

9月6日

Qwen3.8 Flash Next 在 Android World 基准测试中得分为84.5,在 Live Code Bench 上得分为91.9/95.7(均为官方数据)

待验证50%
9月3日

在Live Code Bench上,Qwen3.8-27B得分90.3,Claude Opus 4.6得分88.8

待验证50%

全部知识事实 (2)

来源文章