Unverified50% confidenceOpinionExact time
智能体的目标对齐(goal alignment)问题至今未被根本解决,系统只能优化可量化的代理指标,容易陷入Goodhart定律陷阱
1
Sources
50%
Confidence
Long-term
Relevance
7/9/2026
First Seen
Sources
技能工程:为什么AI设计不能依赖「一次成型」
rss7/2/2026
Related Claims
Verified基准过拟合是Goodhart定律在AI评估领域的体现,即衡量指标成为优化目标时便失去衡量有效性75% similarUnverified多智能体系统存在协调失败问题——当子智能体的局部最优叠加不能形成全局最优时,系统整体表现可能劣于单一大模型72% similarUnverified对齐问题的核心困境是'价值规范问题',即人类模糊、情境依赖甚至矛盾的价值观难以精确编码为机器可优化的目标函数70% similarUnverified古德哈特定律指出当某个质量指标成为优化目标,它就不再是好的质量度量,模型可能学会刷分而非真正改善69% similarVerified古德哈特定律描述:当一个度量指标变成目标时,它就不再是好的度量指标了67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/309550API
curl https://kongchang.com/api/v1/knowledge/claims/309550MCP
get_claim(id=309550)