待验证50% 置信事实精确时间
研究者发现安全微调不仅压制了模型对自身心智的归因,还连带压制了模型对非人类动物和自然物体的心智归因,同时降低了模型输出中的精神/宗教信念倾向
1
来源数
50%
置信度
长期有效
时效性
2026/8/5
首次发现
来源
相关事实
待验证研究者采用消融安全拒绝方向和意识向量引导两种机制干预方法,成功逆转了被压制的心智归因能力75% 相似待验证该研究关注模型在自然日常推理任务中自发出现的不忠实现象(in the wild),而非人为构造的对抗性提示73% 相似待验证研究者强调这些变化并未损害模型的心智理论(Theory of Mind)能力,表明归因心智与推理他人心理状态是两套可分离的机制72% 相似待验证模型福利并非断言AI具有意识或情感,而是借鉴动物福利研究中的不确定性下的谨慎原则,在无法确定系统是否具有内部体验时采取预防措施71% 相似待验证Ullman等人指出模型在错误信念任务经过微小变体修改后便大幅失准,暗示其依赖表面模式而非真正的心智建模69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/690526API
curl https://kongchang.com/api/v1/knowledge/claims/690526MCP
get_claim(id=690526)