[KongchangAI]
Unverified50% confidenceFactExact time

传统的AI道德评估方法容易触发模型的表面对齐,即模型学会说出符合人类期望的答案却未必在实际行为中贯彻

1
Sources
50%
Confidence
Long-term
Relevance
9/8/2026
First Seen

Sources

Related Entities

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/875800
API
curl https://kongchang.com/api/v1/knowledge/claims/875800
MCP
get_claim(id=875800)