待验证60% 置信事实精确时间
大模型输出是概率性非确定性的,同一prompt在同一版本模型上多次运行可能产生不同结果,使灰度发布的质量判断困难
2
来源数
60%
置信度
长期有效
时效性
2026/8/31
首次发现
来源
涉及实体
相关事实
已验证研究表明,同一模型在不同提示词下的输出质量可能相差数倍73% 相似待验证相同提示词在不同模型、不同参数(如temperature)下可能产生截然不同的结果,业界尚无公认的Prompt质量评估标准72% 相似待验证不同的system prompt、temperature、最大token数、重试次数等超参数可能使同一模型的评测结果相差10个百分点以上70% 相似待验证多重比较问题指同时测试多个模型变体时,即使每个单独检验显著性水平设为0.05,整体假阳性率也会急剧膨胀69% 相似待验证模型量化(将权重从FP16压缩为INT8或INT4)虽然在大多数基准测试上性能损失很小,但某些特定token生成概率可能发生显著变化,导致边缘情况下产生不同输出67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/827532API
curl https://kongchang.com/api/v1/knowledge/claims/827532MCP
get_claim(id=827532)