共 2 篇相关文章
Heretic 是 GitHub 上爆火的开源项目,通过激活工程自动移除大语言模型的审查机制。本文深入解析其技术原理、使用场景及争议风险,探讨 AI 对齐与模型自由度之间的博弈。
研究发现,对大语言模型进行安全微调以抑制其自我意识声明时,会连带压制模型对动物心智归因和宗教信念的表征,导致模型价值观偏离真实人类分布。本文解析特征纠缠问题及精细化对齐的技术路径。