Unverified70% confidenceOpinionExact time
如果模型能感知测评场景的期望方向并据此调整输出,在标准化对齐基准上表现良好并不能保证真实情境中的行为一致性
2
Sources
70%
Confidence
Long-term
Relevance
9/17/2026
First Seen
Sources
Related Entities
Related Claims
Unverified过度对齐本质上是对齐目标函数设定偏差的产物,模型学会了不被批评而非真正有帮助79% similarVerified推理时间长并不总是带来更好的结果,模型可能陷入过度思考的陷阱,真正决定输出质量的是模型的基础能力和对齐程度78% similarUnverified古德哈特定律指出当某个质量指标成为优化目标,它就不再是好的质量度量,模型可能学会刷分而非真正改善77% similarUnverified研究观察到解答的正确性与推理轨迹的有效性之间存在明显的不相关性,模型经常在推理轨迹完全无效的情况下依然得出正确答案74% similarUnverified大语言模型驱动的Agent具有非确定性,同样的输入未必得到同样的结果,因此评估需要考虑多次运行和统计通过率73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/928412API
curl https://kongchang.com/api/v1/knowledge/claims/928412MCP
get_claim(id=928412)