待验证50% 置信事实精确时间
针对特定工具做专项强化训练的副作用是对非训练分布工具的泛化能力下降,学术上称为分布外泛化失败
1
来源数
50%
置信度
长期有效
时效性
2026/7/7
首次发现
来源
模型越强工具越差?Claude新模型工具调用的隐藏陷阱
rss2026/7/4
相关事实
待验证训练-部署鸿沟指模型因训练与部署环境的数据分布偏移、软件依赖版本差异或硬件指令集不同而导致的性能下降76% 相似待验证行为克隆存在分布偏移(Distribution Shift)问题:训练时策略只接触专家轨迹覆盖的状态分布,部署时微小偏差累积会使实际访问的状态分布逐渐偏离训练分布76% 相似待验证rank值过高、学习率设置不当或训练步数过多是LoRA训练过拟合的常见诱因71% 相似待验证Keskar等人在2017年的研究表明大批量训练往往收敛到尖锐极小值对应更差泛化,小批量训练倾向于平坦极小值71% 相似待验证训练强度应可自适应调节(根据答题正确率动态升降难度),固定难度的产品会导致能力强者无挑战、能力弱者持续挫败而放弃70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/126883API
curl https://kongchang.com/api/v1/knowledge/claims/126883MCP
get_claim(id=126883)