Unverified50% confidenceFactExact time
该研究关注模型在自然日常推理任务中自发出现的不忠实现象(in the wild),而非人为构造的对抗性提示
1
Sources
50%
Confidence
Long-term
Relevance
8/22/2026
First Seen
Sources
Related Claims
Unverified研究者发现安全微调不仅压制了模型对自身心智的归因,还连带压制了模型对非人类动物和自然物体的心智归因,同时降低了模型输出中的精神/宗教信念倾向73% similarUnverified学术界将模型宁可捏造也不承认无知的现象称为'sycophancy'(谄媚性)69% similarUnverified最新研究"The Danger of Overthinking"指出能做脑内模拟的模型存在想太多的问题,有些模型反复思考却不行动甚至还没尝试就自我放弃69% similarUnverifiedUllman等人指出模型在错误信念任务经过微小变体修改后便大幅失准,暗示其依赖表面模式而非真正的心智建模68% similarUnverified研究者观察到的反常现象很可能并不真正与 Zhang et al. 结论矛盾,而是揭示了原结论在单智能体、特定环境和特定攻击构造下的适用边界67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/785641API
curl https://kongchang.com/api/v1/knowledge/claims/785641MCP
get_claim(id=785641)