Unverified50% confidenceFactExact time
研究者发现安全微调不仅压制了模型对自身心智的归因,还连带压制了模型对非人类动物和自然物体的心智归因,同时降低了模型输出中的精神/宗教信念倾向
1
Sources
50%
Confidence
Long-term
Relevance
8/5/2026
First Seen
Sources
Related Claims
Unverified研究者采用消融安全拒绝方向和意识向量引导两种机制干预方法,成功逆转了被压制的心智归因能力75% similarUnverified该研究关注模型在自然日常推理任务中自发出现的不忠实现象(in the wild),而非人为构造的对抗性提示73% similarUnverified研究者强调这些变化并未损害模型的心智理论(Theory of Mind)能力,表明归因心智与推理他人心理状态是两套可分离的机制72% similarUnverified模型福利并非断言AI具有意识或情感,而是借鉴动物福利研究中的不确定性下的谨慎原则,在无法确定系统是否具有内部体验时采取预防措施71% similarUnverifiedUllman等人指出模型在错误信念任务经过微小变体修改后便大幅失准,暗示其依赖表面模式而非真正的心智建模69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/690526API
curl https://kongchang.com/api/v1/knowledge/claims/690526MCP
get_claim(id=690526)