Unverified50% confidenceFactExact time
REINFORCE估计器的方差极高,因为一条轨迹中的每个动作都乘以整条轨迹的总回报
1
Sources
50%
Confidence
Long-term
Relevance
8/5/2026
First Seen
Sources
Related Claims
Unverified上下文回贯机制缺失导致模型每轮接收到的上下文完全一致,从而机械重复相同决策形成无限循环62% similarUnverifiedTrajectory Eval(轨迹评估)用于分析Agent在不同路径下的行为差异,例如当Agent走路径B时信号下降,根本原因可能是组件调用顺序错误62% similarVerifiedAdam 优化器结合了 Momentum 和 RMSProp 的优点,维护梯度的一阶矩估计和二阶矩估计的指数移动平均61% similarUnverified在长链路任务中,纯ReAct范式会因每步微小偏差被放大形成'幻觉漂移',逐渐偏离原始意图60% similarUnverified重复定位精度指机械臂多次回到同一目标点时实际到达位置之间的离散程度,衡量的是一致性60% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/690910API
curl https://kongchang.com/api/v1/knowledge/claims/690910MCP
get_claim(id=690910)