Unverified50% confidenceFactExact time
早期研究发现同一问题用不同表述方式提问,模型性能差异可高达数十个百分点
1
Sources
50%
Confidence
Long-term
Relevance
7/14/2026
First Seen
Sources
Related Claims
Partially Verified研究表明,同一模型在不同提示词下的输出质量可能相差数倍83% similarUnverified学术研究已证明,同样的问题以不同方式表达,模型的回答准确率可能相差20%以上82% similarUnverified不同模型在基准测试上的性能差异往往远小于同一模型在不同任务类型、不同输入格式下的行为差异76% similarUnverified该研究发现同一模型不同部署时间点在代码生成和逻辑推理任务上通过率可能出现10%至20%的显著波动,且方向不总是单向改善75% similarUnverified研究表明即便是同一模型,不同提示设计之间的性能差距可以超过10个百分点72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/509945API
curl https://kongchang.com/api/v1/knowledge/claims/509945MCP
get_claim(id=509945)