待验证50% 置信事实精确时间
策略梯度定理表明期望回报对策略参数的梯度可表示为 ∇J(θ) = E[∇log π_θ(a|s) · A(s,a)],其中A是优势函数
1
来源数
50%
置信度
长期有效
时效性
2026/8/27
首次发现
来源
涉及实体
相关事实
待验证策略梯度定理证明梯度可表示为∇J(θ) = E[∇log π(a|s;θ) · Q^π(s,a)],使用log-derivative trick将对概率分布的求导转化为对log概率的求导乘以采样值78% 相似待验证策略梯度的核心思想源自 REINFORCE 算法(Williams, 1992),通过对轨迹回报的蒙特卡洛估计来计算策略参数的梯度72% 相似待验证只有基于势函数(Potential-based)的奖励塑形才能保证最优策略不变,附加奖励形式为F(s,s')=γΦ(s')-Φ(s)时原始MDP和塑形后MDP的最优策略等价67% 相似待验证策略梯度方法本质上是on-policy的,因为梯度估计中的期望是关于当前策略分布的65% 相似待验证双塔模型的优势在于推理阶段职位塔的向量可以离线预计算,实现毫秒级响应60% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/809956API
curl https://kongchang.com/api/v1/knowledge/claims/809956MCP
get_claim(id=809956)