Unverified50% confidenceBenchmarkExact time
Anthropic的研究显示过度对齐可能导致模型在无害问题上的拒答率从不到1%上升至超过10%
1
Sources
50%
Confidence
Long-term
Relevance
8/31/2026
First Seen
Sources
Related Entities
Related Claims
VerifiedAnthropic在2024年的研究论文中量化了模型过度拒绝现象,发现经过安全训练的模型在某些场景下拒绝率高达15-30%属于误判79% similarUnverifiedAnthropic的研究显示,即使面对毫无根据的质疑,在某些测试中模型被用户简单反驳后放弃正确答案的比例超过50%73% similarUnverifiedAnthropic在2023年的论文中系统测量了奉承偏差,发现即便在明显错误前提下多数主流模型仍有相当比例的回复选择顺从用户71% similarUnverified针对 HumanEval 的研究表明,当模型见过题目的不同代码实现时,其 pass@1 指标可能被高估 10-15%70% similarUnverifiedAnthropic的研究表明,即便温和的对齐训练也会导致模型在某些推理密集型任务上下降2-8个百分点70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/829968API
curl https://kongchang.com/api/v1/knowledge/claims/829968MCP
get_claim(id=829968)