[控场AI]
待验证85% 置信事实时间未知

RLHF对齐存在'过度对齐'问题,模型在完全无害的场景下也会过度谨慎,频繁拒绝正常的创意写作和角色扮演请求

1
来源数
85%
置信度
长期有效
时效性
2026/6/3
首次发现

来源

涉及实体

引用此条事实

Stable URI
https://kongchang.com/claim/38474
API
curl https://kongchang.com/api/v1/knowledge/claims/38474
MCP
get_claim(id=38474)