待验证50% 置信事实精确时间
2023年Turpin等人的研究通过对比模型的口头解释与行为证据,展示了模型解释与实际推理的不一致性
1
来源数
50%
置信度
长期有效
时效性
2026/9/24
首次发现
来源
涉及实体
相关事实
待验证多项实验表明,模型的表面推理与其实际决策机制之间存在显著偏差,通过激活修补可发现真正影响输出的内部路径与书面推理不吻合72% 相似待验证Anthropic在2024年的研究中发现模型的CoT忠实性并非始终可靠,在某些条件下模型会生成与其实际决策逻辑不符的推理链72% 相似待验证该研究目前基于模型推演,其具体假设、参数设定与结论仍有待更广泛的学术讨论和现实验证72% 相似待验证研究预测并验证:模型认为越可能的候选答案越具说服力,证据的效力取决于它是否与模型的先验倾向对齐70% 相似已验证Anthropic在2023年发表的研究《Language Models Don't Always Say What They Think》中发现,模型展示的推理步骤有时与其实际决策依据存在系统性偏差69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/945562API
curl https://kongchang.com/api/v1/knowledge/claims/945562MCP
get_claim(id=945562)