待验证50% 置信事实精确时间
当前顶尖AI模型在CTF基准上的得分仍远低于人类专家水平,尤其是涉及动态调试和二进制分析的题目类别
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/11
首次发现
有效期至:2026/10/9
来源
OpenAI发布GPT-5.6:网络安全能力成核心卖点
rss2026/7/9
相关事实
待验证当前顶级AI模型在SWE-bench上的解决率仍远低于竞赛成绩所暗示的水平77% 相似待验证评估Agent规划能力的主流基准测试包括ALFWorld、WebArena和GAIA,当前最先进模型得分仍远低于人类水平73% 相似待验证在事实性评估任务上模型评判者准确率仍显著低于人类专家,但在风格、连贯性等主观维度已接近人类评审员间一致性水平72% 相似待验证业界对AI编码基准测试的信任度处于历史低点,排行榜冠军频繁更替,基准分数与实际工作表现相关性低69% 相似待验证2023年多项独立研究表明部分顶级模型在标准数学推理测试中分数极高,但在等价的重新表述版本上成绩大幅下滑,表明模型学习的是测试模式而非真正的推理能力68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/478309API
curl https://kongchang.com/api/v1/knowledge/claims/478309MCP
get_claim(id=478309)