Unverified50% confidenceBenchmarkExact time
该研究发现同一模型不同部署时间点在代码生成和逻辑推理任务上通过率可能出现10%至20%的显著波动,且方向不总是单向改善
1
Sources
50%
Confidence
Long-term
Relevance
7/23/2026
First Seen
Sources
Related Claims
Unverified早期研究发现同一问题用不同表述方式提问,模型性能差异可高达数十个百分点75% similarUnverified斯坦福大学2023年发表研究《How Is ChatGPT's Behavior Changing over Time?》,以实验证明同一模型不同部署版本在代码生成、逻辑推理等任务上通过率可能出现10%至20%的显著波动74% similarUnverified研究表明即便是同一模型,不同提示设计之间的性能差距可以超过10个百分点73% similarUnverified研究表明高质量提示词相比随意撰写的提示词在同等模型条件下可带来20%-40%的任务完成率提升73% similarPartially Verified研究表明,同一模型在不同提示词下的输出质量可能相差数倍73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/596168API
curl https://kongchang.com/api/v1/knowledge/claims/596168MCP
get_claim(id=596168)