Unverified50% confidenceFactExact time
行为克隆(BC)将模仿学习简化为监督学习,直接拟合条件概率分布p(a|s),但存在复合误差与分布偏移问题
1
Sources
50%
Confidence
Long-term
Relevance
7/19/2026
First Seen
Sources
Related Claims
Unverified自回归生成系统训练采用Teacher Forcing策略,推理阶段切换为自回归模式后产生分布偏移导致误差累积放大70% similarUnverified行为克隆(Behavioral Cloning)作为最基础的模仿学习方法存在复合误差(Compounding Error)问题,模型在训练分布之外的状态上容易产生级联失败68% similarUnverified预训练的目标函数通常是因果语言建模中的交叉熵损失,即给定前文所有token最大化正确预测下一个token的概率66% similarVerified域随机化是指在仿真训练中刻意随机扰动物理参数,迫使策略学习到对参数变化具有泛化能力的行为64% similarUnverified知识蒸馏的中间层对齐策略(如PKD、TinyBERT)通过强制学生模型的隐藏表示模仿教师模型的分布间接约束嵌入几何结构64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/564084API
curl https://kongchang.com/api/v1/knowledge/claims/564084MCP
get_claim(id=564084)