待验证50% 置信事实精确时间
后训练阶段的强化学习能在分布内和分布外任务上提升解答准确率,但并不能持续改善推理轨迹的有效性
1
来源数
50%
置信度
长期有效
时效性
2026/8/31
首次发现
来源
涉及实体
相关事实
引用此条事实
Stable URI
https://kongchang.com/claim/828105API
curl https://kongchang.com/api/v1/knowledge/claims/828105MCP
get_claim(id=828105)