[KongchangAI]
Unverified50% confidenceSolutionExact time

团队提出Faithful GRPO方法,引入一致性奖励和接地奖励并通过学习拉格朗日乘子系数平衡约束,以在提升性能同时保持推理忠实性

1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/17/2026
First Seen
Valid until: 10/15/2026

Sources

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/544830
API
curl https://kongchang.com/api/v1/knowledge/claims/544830
MCP
get_claim(id=544830)