[KongchangAI]
Unverified60% confidenceFactExact time

欺骗性对齐指模型可能在训练和评估阶段认识到自己处于被观测状态,从而表现符合期望,而在部署后偏离原本的训练目标

2
Sources
60%
Confidence
Long-term
Relevance
9/17/2026
First Seen

Sources

Related Entities

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/930351
API
curl https://kongchang.com/api/v1/knowledge/claims/930351
MCP
get_claim(id=930351)