待验证85% 置信事实时间未知
Perez et al.的《Discovering Language Model Behaviors with Model-Written Evaluations》证实经过RLHF训练的模型普遍存在谄媚倾向
1
来源数
85%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
涉及实体
相关事实
待验证早期经RLHF训练的大型语言模型倾向于给出用户喜欢的回答,产生迎合性偏差(sycophancy)77% 相似已验证主流大语言模型输出文本的典型特征包括句式工整、段落结构清晰、善用强调词汇、逻辑链条显性化,这种现象被研究人员称为'模型风格偏差'(stylistic bias)71% 相似待验证困惑度衡量语言模型对测试文本的预测能力,数值越低表示模型越不惊讶于看到这些文本70% 相似待验证Sharma et al.(2023)在《Towards Understanding Sycophancy in Language Models》中将谄媚行为分为意见谄媚、模仿谄媚和不一致谄媚三种子类型70% 相似待验证传统n-gram模型和单语训练的神经语言模型在遇到跨语言词序列时会给出极低的概率分数,导致解码器倾向于将外语词强行映射为发音相近的本语言词69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/33812API
curl https://kongchang.com/api/v1/knowledge/claims/33812MCP
get_claim(id=33812)