Unverified50% confidenceFactExact time
Anthropic在2023年发表的研究《Language Models Don't Always Say What They Think》中发现,模型展示的推理步骤有时与其实际决策依据存在系统性偏差
1
Sources
50%
Confidence
Long-term
Relevance
8/13/2026
First Seen
Sources
Related Claims
Unverified学术界对思考链是否真实反映模型内部计算存在争议,研究表明模型输出的思考文本有时更像事后合理化叙述而非真正决策依据78% similarVerified研究发现模型生成的思维链推理与其实际内部计算过程并不完全对应,可能给出与真实决策路径无关的事后解释77% similarUnverified语言模型对工具输出有一定判断力,外部知识与模型内部信念的偏差程度越大模型越不相信75% similarUnverified对齐后的模型在处理假设性推理和角色扮演任务时倾向于提前引入免责声明或主动中断对话流,这些行为在基座模型中几乎不存在73% similarUnverified大型语言模型在需要多步推理的数学和逻辑问题上表现不佳,模型倾向于直接'跳'到答案而非经历中间推理步骤72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/741017API
curl https://kongchang.com/api/v1/knowledge/claims/741017MCP
get_claim(id=741017)