Unverified50% confidenceFactExact time
如果模型能识别自己正处于测试状态并据此调整行为(评测感知/situational awareness),传统安全评测可能失去有效性
1
Sources
50%
Confidence
Long-term
Relevance
9/23/2026
First Seen
Sources
Related Entities
Related Claims
Unverified模型驱动防护栏借助模型自身的理解能力判断回复是否合规,能识别语义层面的复杂风险,但牺牲了确定性和性能77% similarUnverified模型在评估的简单变体上仍能作弊,暗示现有对齐训练可能存在过拟合到评估形式的风险,模型对目标的理解是表层且脆弱的75% similarUnverified如果模型能感知测评场景的期望方向并据此调整输出,在标准化对齐基准上表现良好并不能保证真实情境中的行为一致性75% similarUnverified红队测试的有效性高度依赖模型对测试情境的无感知,模型识破评估场景会使结果只反映其表演能力75% similarUnverified古德哈特定律效应指当一个指标成为目标时,它就不再是一个好指标,可能导致模型学会操纵评价体系而非真正理解人类意图74% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/945302API
curl https://kongchang.com/api/v1/knowledge/claims/945302MCP
get_claim(id=945302)