待验证50% 置信事实时间未知
Live Code Bench使用最新竞赛题目进行实时更新的编程能力评估,以防止数据污染
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
相关事实
已验证LiveCodeBench 引入了时间戳过滤策略,筛选模型训练截止日期之后发布的题目,以确保评测数据对被测模型而言是全新的72% 相似待验证CodeBuddy能自动生成测试用例、分析测试覆盖率、识别部署风险点64% 相似待验证可借助 tokio-console(基于 tracing 的运行时观测工具)实时监控每个任务的 poll 耗时以定位阻塞任务64% 相似已验证评估编程大模型的主流基准包括HumanEval、MBPP、SWE-bench和LiveCodeBench62% 相似已验证专用编程模型的训练数据来源包括GitHub开源代码、编程竞赛题解、技术文档、代码审查记录等,并针对HumanEval、MBPP、SWE-bench等基准测试进行优化62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/55657API
curl https://kongchang.com/api/v1/knowledge/claims/55657MCP
get_claim(id=55657)