Unverified50% confidenceSolutionExact time
由于非确定性存在,同一个Eval应运行6到10次以观察正确率分布区间并计算标准差与误差
1
Sources
50%
Confidence
Long-term
Relevance
9/16/2026
First Seen
Sources
Related Entities
Related Claims
Unverified测试的准确率数据在n=100样本量下误差约为±8-10个百分点(基于95%置信水平的二项分布置信区间)72% similarUnverifiedAI测试用例不能只执行一次就判定,业界通常建议同一测试用例至少执行5-10次以统计输出的稳定性和质量分布70% similarUnverified指标数量与数据可信度存在错觉权衡:标称20+项指标的低价秤不比8项的可靠,重点看电极数和App算法品牌而非指标条数69% similarUnverified蒙特卡洛估计的标准误差与模拟次数N的关系为标准误差正比于1/√N69% similarUnverified当假设预测误差服从均值为零、方差固定的高斯分布时,对似然函数取负对数并展开,其主要项恰好就是均方误差的形式68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/925612API
curl https://kongchang.com/api/v1/knowledge/claims/925612MCP
get_claim(id=925612)