基准ForecastBench基准
ForecastBench
专为评估AI预测能力设计的基准测试框架,核心任务是让模型对真实世界事件给出校准良好的概率估计,使用Brier分数衡量预测概率与实际结果间的均方误差
时间轴 (近 90 天)
9月25日
一篇发表于arXiv的研究(论文编号arXiv:2609.28475v1)提出更多的推理并不总是带来更好的预测
待验证50%
9月25日
该研究在ForecastBench风格的二元预测任务上展开实验,将检索证据、推理、参考市场先验、调用历史类比作为可观察的行为来研究
待验证50%
9月25日
ForecastBench是一个专为评估AI预测能力设计的基准测试框架,核心任务是让模型对真实世界事件给出校准良好的概率估计
待验证50%