待验证50% 置信事实精确时间
REINFORCE估计器的方差极高,因为一条轨迹中的每个动作都乘以整条轨迹的总回报
1
来源数
50%
置信度
长期有效
时效性
2026/8/5
首次发现
来源
相关事实
待验证上下文回贯机制缺失导致模型每轮接收到的上下文完全一致,从而机械重复相同决策形成无限循环62% 相似待验证Trajectory Eval(轨迹评估)用于分析Agent在不同路径下的行为差异,例如当Agent走路径B时信号下降,根本原因可能是组件调用顺序错误62% 相似已验证Adam 优化器结合了 Momentum 和 RMSProp 的优点,维护梯度的一阶矩估计和二阶矩估计的指数移动平均61% 相似待验证在长链路任务中,纯ReAct范式会因每步微小偏差被放大形成'幻觉漂移',逐渐偏离原始意图60% 相似待验证重复定位精度指机械臂多次回到同一目标点时实际到达位置之间的离散程度,衡量的是一致性60% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/690910API
curl https://kongchang.com/api/v1/knowledge/claims/690910MCP
get_claim(id=690910)