Unverified50% confidenceFactExact time
可监控性下降不等于对齐变差:对齐关注模型意图是否与人类价值观一致,可监控性关注人类是否有能力验证这一点,两者可独立变化
1
Sources
50%
Confidence
Long-term
Relevance
10/4/2026
First Seen
Sources
Related Entities
Related Claims
Unverified如果模型能识别自己正处于测试状态并据此调整行为(评测感知/situational awareness),传统安全评测可能失去有效性73% similarUnverified研究者建议将评估指标置于智能体控制范围之外以切断其操纵证据的能力72% similarUnverified当模型能力超越人类评估者判断能力时如何验证对齐是否成功的问题被称为可扩展监督(Scalable Oversight)问题72% similarUnverified当模型对某条素材的最高类别置信度与次高类别置信度之差低于阈值时才触发人工审核,可将人力成本控制在可接受范围71% similarUnverified模型族隔离可以降低智能体处理某一模型时误改其他模型的风险,并缩小智能体需要理解的上下文范围71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/972636API
curl https://kongchang.com/api/v1/knowledge/claims/972636MCP
get_claim(id=972636)