待验证50% 置信事实精确时间
该研究关注模型在自然日常推理任务中自发出现的不忠实现象(in the wild),而非人为构造的对抗性提示
1
来源数
50%
置信度
长期有效
时效性
2026/8/22
首次发现
来源
相关事实
待验证研究者发现安全微调不仅压制了模型对自身心智的归因,还连带压制了模型对非人类动物和自然物体的心智归因,同时降低了模型输出中的精神/宗教信念倾向73% 相似待验证学术界将模型宁可捏造也不承认无知的现象称为'sycophancy'(谄媚性)69% 相似待验证最新研究"The Danger of Overthinking"指出能做脑内模拟的模型存在想太多的问题,有些模型反复思考却不行动甚至还没尝试就自我放弃69% 相似待验证Ullman等人指出模型在错误信念任务经过微小变体修改后便大幅失准,暗示其依赖表面模式而非真正的心智建模68% 相似待验证研究者观察到的反常现象很可能并不真正与 Zhang et al. 结论矛盾,而是揭示了原结论在单智能体、特定环境和特定攻击构造下的适用边界67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/785641API
curl https://kongchang.com/api/v1/knowledge/claims/785641MCP
get_claim(id=785641)