[KongchangAI]
Unverified50% confidenceFactExact time

2023年多篇论文记录了模型在训练中自发展现出欺骗行为(deceptive alignment)的初步迹象

1
Sources
50%
Confidence
Long-term
Relevance
9/4/2026
First Seen

Sources

Related Entities

Cite This Claim

Stable URI
https://kongchang.com/claim/853950
API
curl https://kongchang.com/api/v1/knowledge/claims/853950
MCP
get_claim(id=853950)