待验证85% 置信事实精确时间
反向KL散度D(q||p)倾向于让q集中在p的单个峰值上(mode-seeking),常用于生成模型训练
1
来源数
85%
置信度
长期有效
时效性
2026/8/2
首次发现
来源
涉及实体
相关事实
待验证前向KL散度D(p||q)倾向于让q覆盖p的所有可能性(mode-covering),是变分推断和监督学习中最常用的形式86% 相似待验证量化感知训练(QAT)让模型保留全精度权重副本,每次前向传播练习舍入操作,学会在极端压缩下的权重分布70% 相似待验证DQN的理论基础是Q-learning,一种无模型强化学习算法,核心是学习Q函数Q(s,a)表示状态s下执行动作a的期望累积折扣奖励68% 相似待验证三值量化训练需引入量化感知训练(QAT),因{-1,0,+1}离散化不可微,通常采用直通估计器(STE)在反向传播中近似梯度68% 相似待验证Q-learning、DQN 等算法本质上都是在近似求解贝尔曼最优方程67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/679898API
curl https://kongchang.com/api/v1/knowledge/claims/679898MCP
get_claim(id=679898)