Unverified50% confidenceFactExact time
FreeLB在每个训练步骤内对嵌入空间执行多步PGD攻击,并累积所有扰动步骤的梯度进行一次参数更新
1
Sources
50%
Confidence
Long-term
Relevance
8/31/2026
First Seen
Sources
Related Entities
Related Claims
Unverified该实验将 PGD(投影梯度下降)攻击适配至连续动作策略,使用 KL 散度的闭式解构造扰动目标68% similarUnverified对于避障项目,务实的做法是保留DQN作为离散动作基线,同时引入SAC并将动作空间改回连续进行对比实验61% similarUnverifiedtokio异步运行时底层采用多线程工作窃取调度器,将大量轻量级异步任务高效分配到有限的操作系统线程上执行61% similarUnverifiedUnsloth采用了智能的梯度检查点(Gradient Checkpointing)策略,通过在前向传播时丢弃部分中间激活值并在反向传播时重新计算来节省显存61% similarUnverified单一LLM在处理复杂多步骤任务时容易出现上下文窗口限制和推理漂移问题61% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/829857API
curl https://kongchang.com/api/v1/knowledge/claims/829857MCP
get_claim(id=829857)