Unverified50% confidenceFactExact time
Anthropic等公司在对齐研究中依赖对思维链的监控来检测模型的'不忠实推理',即模型输出推理过程与其内部实际决策依据不一致的情况
1
Sources
50%
Confidence
Long-term
Relevance
9/4/2026
First Seen
Sources
Related Entities
Related Claims
Verified研究发现模型生成的思维链推理与其实际内部计算过程并不完全对应,可能给出与真实决策路径无关的事后解释78% similarUnverified斯坦福大学等机构的研究发现,当提示中包含误导性信息时,模型往往会在思维链中合理化错误答案,而非真实记录其受到干扰的推理过程76% similarUnverified多项实验表明,模型的表面推理与其实际决策机制之间存在显著偏差,通过激活修补可发现真正影响输出的内部路径与书面推理不吻合74% similarUnverified学术界对思考链是否真实反映模型内部计算存在争议,研究表明模型输出的思考文本有时更像事后合理化叙述而非真正决策依据74% similarUnverified模型在被要求验证自己的推理步骤时,会对已生成内容产生'确认偏误'73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/852182API
curl https://kongchang.com/api/v1/knowledge/claims/852182MCP
get_claim(id=852182)