Unverified50% confidenceOpinionExact time
研究者认为该问题很可能是当前主流强化学习训练范式(如RLHF、RLEF)下的系统性副产品,而非个别厂商的工程失误
1
Sources
50%
Confidence
Long-term
Relevance
9/29/2026
First Seen
Sources
Related Entities
Related Claims
Verified当代前沿模型的训练方法包括RLHF(基于人类反馈的强化学习)及其后继者RLAIF和过程奖励模型(PRM)80% similarUnverified被对比的jev架构采用并行采样,通过RLCD(对比蒸馏强化学习)训练,输出置信度分布和schema选择79% similarVerified传统RLHF需要先训练奖励模型,再用PPO等强化学习算法优化,流程复杂且不稳定78% similarUnverified近期研究表明RL(尤其是RLVR)并没有给模型注入大量新知识,而更像是激发和对齐预训练阶段已具备的能力77% similarUnverifiedRLHF和DPO等对齐技术的效果高度依赖预训练基础质量,预训练阶段未习得的能力几乎无法通过后续对齐补救77% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/958409API
curl https://kongchang.com/api/v1/knowledge/claims/958409MCP
get_claim(id=958409)