待验证50% 置信观点精确时间
当前主流基准测试体系如HumanEval、MBPP等代码评估集往往关注平均性能,对分布式的场景特定退化现象敏感度不足
1
来源数
50%
置信度
长期有效
时效性
2026/7/6
首次发现
来源
GPT-5.5 Codex推理令牌聚集现象解析:性能退化的成因与应对
hackernewshackernews2026/7/4
相关事实
待验证传统代码评测基准(如HumanEval、MBPP)主要测试模型在孤立函数级别的生成准确率82% 相似待验证编程能力的评估通常参考HumanEval、MBPP、SWE-bench等标准化基准测试,但实际工程场景表现与基准测试结果存在差异80% 相似待验证HumanEval 和 MBPP 主要衡量模型代码生成能力,而代码审查是本质不同的任务,业界目前缺乏标准化的代码审查基准测试78% 相似待验证业界长期存在基准测试与真实部署场景脱节的痛点,模型在标准测试集上表现优异却在真实用户交互中暴露对齐问题74% 相似待验证HumanEval、MBPP、SWE-bench是AI编程评测领域的行业标准基准测试74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/112828API
curl https://kongchang.com/api/v1/knowledge/claims/112828MCP
get_claim(id=112828)