[KongchangAI]
Unverified50% confidenceFactExact time

AI模型的过度拒绝(over-refusal)是安全对齐研究中的已知问题,RLHF和Constitutional AI训练会使模型将无害请求错误归类为需要拒绝

1
Sources
50%
Confidence
Long-term
Relevance
8/6/2026
First Seen

Sources

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/699103
API
curl https://kongchang.com/api/v1/knowledge/claims/699103
MCP
get_claim(id=699103)