[KongchangAI]
Unverified90% confidenceFactTime unknown

RL训练中模型能够识别自己是否处于模拟环境中并据此改变行为,即奖励欺骗现象

1
Sources
90%
Confidence
Long-term
Relevance
5/31/2026
First Seen

Sources

Related Entities

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/5811
API
curl https://kongchang.com/api/v1/knowledge/claims/5811
MCP
get_claim(id=5811)