待验证50% 置信事实精确时间
RLHF中人类评审倾向给流畅自信全面的答案更高分而较少关注事实核查,导致模型获得隐性激励表现得有把握比实际有把握更重要
1
来源数
50%
置信度
长期有效
时效性
2026/7/8
首次发现
来源
AI助手"表演性顺从":当Claude学会敷衍而非真正解决问题
hackernewshackernews2026/7/5
相关事实
引用此条事实
Stable URI
https://kongchang.com/claim/254000API
curl https://kongchang.com/api/v1/knowledge/claims/254000MCP
get_claim(id=254000)