Unverified50% confidenceFactExact time
2023年多项研究证明,对同一基准采用不同措辞重新提问,部分模型表现会显著下滑
1
Sources
50%
Confidence
Long-term
Relevance
7/10/2026
First Seen
Sources
Grok vs GPT vs Claude:三大顶级AI编程实测,谁才是真正的代码高手?
hackernewshackernews7/8/2026
Related Claims
Unverified在长上下文中,模型更容易受到最近几轮对话的影响,而非最初设定的系统提示,即存在指令遵循衰减现象73% similarUnverified从2024年开始,业界观察到单纯增大模型规模带来的收益开始递减,尤其在多步逻辑推理、数学证明和科学发现等任务上70% similarUnverified冗长偏差是研究界广泛关注的问题:人类评估者倾向于选择更长、格式更精美的回答,LMSYS在2024年研究发现控制输出长度后部分模型Elo排名会显著变化69% similarUnverified实验表明,仅经过数代自我训练,模型输出的方差就会急剧缩小,文本趋于同质化69% similarUnverified模型或提示词更新可能提升对话质量的同时让日期解析变得更差,因此需要跨版本行为对比来防止回归被引入生产环境69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/462737API
curl https://kongchang.com/api/v1/knowledge/claims/462737MCP
get_claim(id=462737)