Unverified50% confidenceFactExact time
在强化学习流程中,模型需要不断生成候选输出(rollout),这些输出被评估打分后反馈回训练过程以更新策略
1
Sources
50%
Confidence
Long-term
Relevance
9/12/2026
First Seen
Sources
Related Entities
Related Claims
Unverified微调(Fine-tuning)通过反向传播算法在预训练权重基础上继续更新参数,使模型适应特定领域或任务风格77% similarUnverified反馈循环指模型预测影响用户行为、用户行为又成为下一轮训练数据形成闭环,处理不当会放大偏差并造成模型自我强化的恶性循环77% similarUnverified强化学习的本质是让模型不断优化以最大化某个奖励信号75% similarUnverified测试时计算范式的核心思想是将资源从训练阶段转移到生成答案过程,通过消耗更多推理算力换取更高质量输出75% similarUnverified监督微调训练模型模仿人类标注的正确答案,而强化学习微调让模型通过试错学习最优策略74% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/916485API
curl https://kongchang.com/api/v1/knowledge/claims/916485MCP
get_claim(id=916485)