待验证50% 置信事实精确时间
一篇编号为 arXiv:2609.10728 的研究提出用 Program-Solve 方法解决临床计算器场景中大模型的算术不可靠问题
1
来源数
50%
置信度
长期有效
时效性
2026/9/12
首次发现
来源
涉及实体
相关事实
待验证蒙特卡洛估计的标准误差与模拟次数N的关系为标准误差正比于1/√N59% 相似待验证一篇发表在arXiv上的研究(arXiv:2609.02899)提出,基准污染的担忧应区分为是否抬高绝对分数与是否改变模型排名顺序两个不同问题58% 相似待验证在演示中,DeepSeek TUI 训练 CIFAR 数据集到第77轮时,模型准确率已达到 73%57% 相似待验证皮尤的ATP设计效应通常在1.5到2.5之间,使得名义样本量1000的调查有效样本量可能只有400-66757% 相似待验证基准过拟合是当前大模型评估的核心问题,部分模型在HumanEval上达到90%以上通过率但在真实代码库中表现远不如预期57% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/916364API
curl https://kongchang.com/api/v1/knowledge/claims/916364MCP
get_claim(id=916364)