已过期50% 置信基准精确时间
2023年多项研究(包括牛津大学的实验)发现,配备检索增强生成(RAG)技术的LLM在结构化预测竞赛中的Brier评分已接近人类超级预测者水平
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/7
首次发现
有效期至:2026/10/5(已过期)
来源
AI超级预测者:机器能否超越人类专家的预测能力?
hackernewshackernews2026/7/6
相关事实
待验证2023年加州大学伯克利分校发布的MT-Bench基准测试发现,顶级大模型作为评判者与人类专家判断一致性可达80%以上63% 相似待验证斯坦福HAI研究所2023年报告显示,最新LLM在HumanEval等代码基准测试中正确率已超过85%,远超2021年的不足50%61% 相似待验证Forrest & Simmons (2002)研究发现博彩公司发布的赔率经庄家精算调整后,对比赛结果的预测准确率在统计上显著优于随机猜测61% 相似待验证GLM5.1等国产模型在HumanEval、MBPP等标准编程基准测试上的得分已接近甚至超越部分国际竞品61% 相似待验证研究表明博彩赔率对赛事结果的预测准确率长期来看优于大多数个人专家预测61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/180108API
curl https://kongchang.com/api/v1/knowledge/claims/180108MCP
get_claim(id=180108)