[KongchangAI]
Unverified50% confidenceFactExact time

DRaFT利用扩散模型去噪过程的可微性,将奖励函数梯度直接回传至模型参数,无需强化学习的策略梯度估计器,规避高方差问题

1
Sources
50%
Confidence
Long-term
Relevance
7/12/2026
First Seen

Sources

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/490039
API
curl https://kongchang.com/api/v1/knowledge/claims/490039
MCP
get_claim(id=490039)