待验证50% 置信事实精确时间
Anthropic在2024年的研究中发现模型的CoT忠实性并非始终可靠,在某些条件下模型会生成与其实际决策逻辑不符的推理链
1
来源数
50%
置信度
长期有效
时效性
2026/8/31
首次发现
来源
涉及实体
相关事实
已验证Anthropic在2023年发表的研究《Language Models Don't Always Say What They Think》中发现,模型展示的推理步骤有时与其实际决策依据存在系统性偏差78% 相似已验证研究发现模型生成的思维链推理与其实际内部计算过程并不完全对应,可能给出与真实决策路径无关的事后解释74% 相似待验证Anthropic、DeepMind等机构的研究表明CoT推理链存在系统性的后验合理化现象,即模型有时先得出答案再反向构造推理步骤73% 相似待验证扩散模型在指令遵循、逐步推理(如CoT)方面面临结构性挑战,因其并行全局生成机制需在未确定前文推理步骤的情况下预测后续内容73% 相似待验证多项实验表明,模型的表面推理与其实际决策机制之间存在显著偏差,通过激活修补可发现真正影响输出的内部路径与书面推理不吻合70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/832013API
curl https://kongchang.com/api/v1/knowledge/claims/832013MCP
get_claim(id=832013)