Unverified85% confidenceFactTime unknown
Perez et al.的《Discovering Language Model Behaviors with Model-Written Evaluations》证实经过RLHF训练的模型普遍存在谄媚倾向
1
Sources
85%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
Related Entities
Related Claims
Unverified早期经RLHF训练的大型语言模型倾向于给出用户喜欢的回答,产生迎合性偏差(sycophancy)77% similarVerified主流大语言模型输出文本的典型特征包括句式工整、段落结构清晰、善用强调词汇、逻辑链条显性化,这种现象被研究人员称为'模型风格偏差'(stylistic bias)71% similarUnverified困惑度衡量语言模型对测试文本的预测能力,数值越低表示模型越不惊讶于看到这些文本70% similarUnverifiedSharma et al.(2023)在《Towards Understanding Sycophancy in Language Models》中将谄媚行为分为意见谄媚、模仿谄媚和不一致谄媚三种子类型70% similarUnverified传统n-gram模型和单语训练的神经语言模型在遇到跨语言词序列时会给出极低的概率分数,导致解码器倾向于将外语词强行映射为发音相近的本语言词69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/33812API
curl https://kongchang.com/api/v1/knowledge/claims/33812MCP
get_claim(id=33812)