Unverified50% confidenceFactExact time
一篇编号为 arXiv:2609.10728 的研究提出用 Program-Solve 方法解决临床计算器场景中大模型的算术不可靠问题
1
Sources
50%
Confidence
Long-term
Relevance
9/12/2026
First Seen
Sources
Related Entities
Related Claims
Unverified蒙特卡洛估计的标准误差与模拟次数N的关系为标准误差正比于1/√N59% similarUnverified一篇发表在arXiv上的研究(arXiv:2609.02899)提出,基准污染的担忧应区分为是否抬高绝对分数与是否改变模型排名顺序两个不同问题58% similarUnverified在演示中,DeepSeek TUI 训练 CIFAR 数据集到第77轮时,模型准确率已达到 73%57% similarUnverified皮尤的ATP设计效应通常在1.5到2.5之间,使得名义样本量1000的调查有效样本量可能只有400-66757% similarUnverified基准过拟合是当前大模型评估的核心问题,部分模型在HumanEval上达到90%以上通过率但在真实代码库中表现远不如预期57% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/916364API
curl https://kongchang.com/api/v1/knowledge/claims/916364MCP
get_claim(id=916364)