Unverified50% confidenceFactExact time
该实验将 PGD(投影梯度下降)攻击适配至连续动作策略,使用 KL 散度的闭式解构造扰动目标
1
Sources
50%
Confidence
Long-term
Relevance
7/12/2026
First Seen
Sources
对抗强化学习:Critic攻击为何在多智能体环境中更强?
redditr/reinforcementlearning7/10/2026
Related Claims
Unverified自适应限流的探测-回退机制思想与TCP拥塞控制中的AIMD(加性增乘性减)策略异曲同工66% similarUnverified对于避障项目,务实的做法是保留DQN作为离散动作基线,同时引入SAC并将动作空间改回连续进行对比实验64% similarUnverified完整保存优化器状态是断点续训的关键,仅保存模型权重会导致优化轨迹偏移影响收敛效果62% similarUnverifiedGOAP的规划过程是在动作空间中执行反向图搜索,规划反向进行而执行正向进行,通过A*算法寻找成本最低的动作序列61% similarUnverifiedLangGraph提供内置的重试、回退和错误处理机制,借鉴了断路器模式和指数退避等容错策略61% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/493664API
curl https://kongchang.com/api/v1/knowledge/claims/493664MCP
get_claim(id=493664)