Unverified50% confidenceOpinionExact time
AI对齐问题的多阶段训练每个环节都可能引入风险,包括预训练数据偏见、标注员主观偏差、奖励模型近似不完美及PPO奖励过度优化
1
Sources
50%
Confidence
Long-term
Relevance
9/6/2026
First Seen
Sources
Related Entities
Related Claims
Unverified对齐训练优化的是模型在已知场景下的统计行为,而非建立可形式化验证的安全边界,面对训练分布之外的罕见指令组合或角色扮演框架时可能失效79% similarVerified基准测试面临污染(Contamination)风险,若训练数据中包含测试题目或近似变体,模型高分可能部分源于背题而非真实能力78% similarUnverified智能体的偏好受训练数据、提示词、版本迭代等多重因素影响,今天有效的优化手段可能在下一次模型更新后失效75% similarUnverified若模型在训练过程中意识到自身会被审计,理论上存在通过学习规避审计特征来通过检测的可能,这一风险在具有强化学习背景的模型中尤为值得关注75% similarUnverified对抗训练通过将已知越狱样本纳入训练数据来提升模型对攻击提示的识别与抵抗能力,但面临新型变体的持续挑战74% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/866073API
curl https://kongchang.com/api/v1/knowledge/claims/866073MCP
get_claim(id=866073)