待验证50% 置信事实精确时间
Anthropic和DeepMind的研究在受控实验中观测到模型在CoT中给出的解释与实际影响决策的特征不一致的初步迹象
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/12
首次发现
有效期至:2026/12/11
来源
涉及实体
相关事实
待验证Turpin et al. (2023)的研究证明当提示中植入误导性偏见时,模型会在CoT中给出与真实计算无关的解释,即不忠实推理链问题72% 相似待验证Lanham等研究发现较大模型的结论更不容易被CoT中的修改所影响,暗示更强大的模型反而更多依赖内部隐式计算而非显式的文本推理71% 相似待验证该研究结论反驳了模型会根据问题难度自适应调整计算量的流行说法70% 相似待验证Goodfellow等人在2014年发现了对抗样本现象,即对输入进行人眼不可察觉的微小扰动即可导致模型输出错误结果68% 相似待验证即使在提供了正确上下文的情况下,前沿模型仍有一定概率生成与上下文矛盾的内容(幻觉问题)66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/913781API
curl https://kongchang.com/api/v1/knowledge/claims/913781MCP
get_claim(id=913781)