Unverified50% confidenceOpinionTime unknown
单次任务的评测结果存在偶然性,同一模型在不同prompt、不同随机种子下可能给出差异明显的答案
1
Sources
50%
Confidence
Long-term
Relevance
9/12/2026
First Seen
Sources
三大AI编程模型对决:Opus 4.7、GPT-5与DeepSeek V4-Pro实测
githubnikicat
Related Claims
Unverified大模型输出即使输入完全相同,不同的随机种子或采样参数都可能导致截然不同的输出78% similarUnverified即便固定所有随机种子,在不同硬件或并行度下,训练结果仍可能出现被大模型放大为显著能力差异的细微偏差77% similarUnverified在某些任务上,仅因随机种子不同导致的性能波动幅度可能超过某些论文声称的方法创新带来的提升73% similarUnverified随机抽样检查一致性会因大部分样本简单而得到虚高的一致率,掩盖真正有问题的区域73% similarUnverified少样本提示中仅改变示例顺序就可能导致准确率从接近随机到接近最优的巨大波动72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/917840API
curl https://kongchang.com/api/v1/knowledge/claims/917840MCP
get_claim(id=917840)