Unverified50% confidenceDecision RuleExact time
KL散度约束衡量新策略与参考策略间的概率分布差异,通过惩罚过大偏移防止模型遗忘预训练阶段的语言能力
1
Sources
50%
Confidence
Long-term
Relevance
7/10/2026
First Seen
Sources
AI智能体强化学习:RLHF与Agentic RL核心技术解析
rss7/1/2026
Related Claims
UnverifiedK2.7 Code通过重新训练推理终止策略、减少冗余验证、优化长上下文注意力稀疏化,将推理Token消耗降低了30%73% similarUnverified行为克隆将问题简化为监督学习,但存在分布偏移问题,导致训练时和执行时状态分布不同引发误差累积72% similarUnverified当训练数据存在过度自信的分布偏移时,修复应发生在推理时的中间件层而非等待下一轮模型训练72% similarUnverified小模型在分布内高性能的同时存在分布外脆弱性,一旦推理时的工具描述措辞、参数命名或用户查询风格偏离训练集,成功率可能显著下滑71% similarUnverified行为克隆(BC)存在复合误差与分布偏移问题,智能体偏离训练分布后预测误差会指数级累积71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/429052API
curl https://kongchang.com/api/v1/knowledge/claims/429052MCP
get_claim(id=429052)