待验证50% 置信注意事项精确时间
训练器与推理引擎之间的数值不一致(train-inference mismatch)是导致RL训练不稳定、策略退化的常见隐患
1
来源数
50%
置信度
长期有效
时效性
2026/9/24
首次发现
来源
涉及实体
相关事实
已验证仅用成功轨迹训练的模型往往存在分布外泛化的严重缺陷,遇到工具返回错误时便丧失纠偏能力78% 相似待验证低精度引入的数值扰动会在RL的多轮迭代中通过策略梯度的乘积形式被放大,可能导致训练崩溃或模型性能退化76% 相似待验证模型错误可归因于知识缺失、推理能力不足或指令跟随偏差,分别对应补充预训练数据、引入思维链训练数据和优化SFT数据分布等修复路径76% 相似待验证自回归模型存在暴露偏差(exposure bias)问题,训练时看到真实前缀但推理时面对自己生成的错误前缀导致误差累积73% 相似待验证LLM的非确定性(相同输入可能产生不同输出)与测试领域对可重复性的要求存在根本冲突,是AI测试Agent工程化的核心挑战72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/945485API
curl https://kongchang.com/api/v1/knowledge/claims/945485MCP
get_claim(id=945485)