待验证50% 置信事实精确时间
PPLM和FUDGE等即插即用方法保持预训练语言模型参数不变,在解码阶段通过额外训练的轻量级分类器调整生成概率分布以引导输出满足特定属性
1
来源数
50%
置信度
长期有效
时效性
2026/9/2
首次发现
来源
涉及实体
相关事实
已验证微调是在通用预训练模型基础上用特定领域数据进行二次训练,使模型能将领域知识内化为参数,推理时无需额外检索步骤,延迟更低71% 相似待验证DPO通过数学推导将RLHF优化目标等价转化为仅依赖偏好数据的语言模型分类损失,绕开奖励模型训练与PPO循环,将三阶段流程压缩为单阶段微调70% 相似已验证RLHF流程包含三步:训练奖励模型预测人类偏好分数、用PPO强化学习算法调整语言模型参数、通过KL散度约束防止模型偏离原有语言能力69% 相似待验证大语言模型通过自监督预训练学习token序列的条件概率分布,本质上是统计压缩模型,无法通过统计特征区分正确与错误的数学证明69% 相似待验证主流代码大模型均采用「预训练+指令微调」的两阶段策略,第二阶段通过RLHF或DPO等对齐技术68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/843364API
curl https://kongchang.com/api/v1/knowledge/claims/843364MCP
get_claim(id=843364)