Unverified50% confidenceDecision RuleExact time
运行10次测试置信区间宽度约±31%,100次收窄至±10%,400次进一步收窄至±5%,推荐关键测试用例至少运行20-50次
1
Sources
50%
Confidence
Long-term
Relevance
7/16/2026
First Seen
Sources
Related Claims
Unverified测试LLM引用行为时应对同一提示至少运行20—50次,理想情况下扩大至100次以上73% similarUnverified该测试样本规模相对有限(5个模型、13个代码库),结论有待更大规模验证73% similarUnverified实验采用8:2比例划分数据,20%作为内部测试集,训练集内部使用5折交叉验证,并移除重复记录以避免数据泄漏72% similarUnverified测试的准确率数据在n=100样本量下误差约为±8-10个百分点(基于95%置信水平的二项分布置信区间)72% similarUnverified检测灵敏度越高(阈值越低如10 mIU/ml)越容易在早期显示弱阳,但也更易造成'一直弱阳'的困惑;普通25阈值试纸对多数人峰值判定更明确71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/530938API
curl https://kongchang.com/api/v1/knowledge/claims/530938MCP
get_claim(id=530938)