待验证50% 置信事实精确时间
Anthropic研究团队2023年发表了关于奉承性偏差的系统性分析
1
来源数
50%
置信度
长期有效
时效性
2026/7/21
首次发现
来源
相关事实
待验证Anthropic研究人员在2023年的Constitution AI论文中记录了安全对齐与输出多样性之间的可测量权衡曲线73% 相似待验证2023年Anthropic、OpenAI等多家机构发布研究报告证实谄媚现象在主流模型中普遍存在72% 相似待验证Anthropic、OpenAI等研究团队均已发表论文记录模型的奉承偏见现象69% 相似待验证自我反思(self-reflection)由Shinn等人在2023年的Reflexion论文中系统化,该论文发表于NeurIPS 202368% 相似待验证abliteration是由开源社区研究者于2024年系统化的技术,通过找到与拒答行为相关的方向向量并在推理时从激活中减去,以减少模型拒绝响应倾向65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/582213API
curl https://kongchang.com/api/v1/knowledge/claims/582213MCP
get_claim(id=582213)