待验证50% 置信事实精确时间
行为克隆(BC)将模仿学习简化为监督学习,直接拟合条件概率分布p(a|s),但存在复合误差与分布偏移问题
1
来源数
50%
置信度
长期有效
时效性
2026/7/19
首次发现
来源
相关事实
待验证自回归生成系统训练采用Teacher Forcing策略,推理阶段切换为自回归模式后产生分布偏移导致误差累积放大70% 相似待验证行为克隆(Behavioral Cloning)作为最基础的模仿学习方法存在复合误差(Compounding Error)问题,模型在训练分布之外的状态上容易产生级联失败68% 相似待验证预训练的目标函数通常是因果语言建模中的交叉熵损失,即给定前文所有token最大化正确预测下一个token的概率66% 相似已验证域随机化是指在仿真训练中刻意随机扰动物理参数,迫使策略学习到对参数变化具有泛化能力的行为64% 相似待验证知识蒸馏的中间层对齐策略(如PKD、TinyBERT)通过强制学生模型的隐藏表示模仿教师模型的分布间接约束嵌入几何结构64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/564084API
curl https://kongchang.com/api/v1/knowledge/claims/564084MCP
get_claim(id=564084)