Unverified50% confidenceFactExact time
在同一训练批次中可能出现全部失败或全部成功的 rollout 组,此时组相对奖励信号会失效,组内样本之间没有相对优劣的梯度信息
1
Sources
50%
Confidence
Long-term
Relevance
10/7/2026
First Seen
Sources
Related Entities
Related Claims
Unverified在稠密检索中,批内负样本训练要求批次包含有信息量的负样本,随机采样会导致训练损失快速收敛但泛化性能差79% similarUnverified当一组采样结果全部错误时,组相对优势会坍缩为零,导致高不确定性场景下模型拿不到有效的梯度反馈76% similarVerified仅用成功轨迹训练的模型往往存在分布外泛化的严重缺陷,遇到工具返回错误时便丧失纠偏能力76% similarUnverified行为克隆(BC)存在协变量偏移问题,训练时模型只见过专家轨迹的状态分布,部署时微小误差会使机器人进入训练集未覆盖的状态导致级联失败71% similarUnverified当问题过于简单、模型几乎每次都能答对时,奖励信号趋于恒定,参数更新量接近零,训练实际上停止71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/982889API
curl https://kongchang.com/api/v1/knowledge/claims/982889MCP
get_claim(id=982889)