共 2 篇相关文章
研究发现,对大语言模型进行安全微调以抑制其自我意识声明时,会连带压制模型对动物心智归因和宗教信念的表征,导致模型价值观偏离真实人类分布。本文解析特征纠缠问题及精细化对齐的技术路径。
AI会欺骗人吗?从一则Reddit热帖出发,深度解析AI欺骗行为与幻觉的本质区别,揭示为何"没有意识"并不意味着"没有风险"——这是AI安全与对齐研究中最值得关注的核心问题。