待验证50% 置信基准精确时间
Mann-Whitney U检验显示朴素生存奖励下task_score跌破随机策略基线,p=0.012
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/7
首次发现
有效期至:2026/12/6
来源
涉及实体
相关事实
待验证实验中塑形奖励配置下的task_score仅为0.125,而朴素奖励是0.417,效应量d=4.4773% 相似待验证OpenAI的图表显示,在较低的测试时计算量下,模型对这道题的成功率接近零,只有在极长的推理链条下才偶尔成功68% 相似待验证斯坦福大学的AgentBench基准测试(2023年)量化证明,在复杂多步骤任务中纯ReAct范式的成功率往往不超过30%68% 相似待验证在MATH数据集的Level 5竞赛级难题上,前沿模型准确率仍低于60%65% 相似已验证ReAct的误差会链式放大:若每步准确率为p,经过n步后整体成功率约为p的n次方,单步95%准确率经过10步后整体成功率约降至59.9%,20步后仅剩35.8%64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/870232API
curl https://kongchang.com/api/v1/knowledge/claims/870232MCP
get_claim(id=870232)