Unverified50% confidenceFactExact time
EWC在新任务训练时增加惩罚项L_new + λ·Σ_i F_i·(θ_i - θ*_i)²,Fisher信息值越高的参数惩罚力度越大,越难被修改
1
Sources
50%
Confidence
Long-term
Relevance
7/13/2026
First Seen
Sources
Related Claims
Unverified过度依赖顶层E2E测试会导致反馈周期极长,越底层的测试失败越早被捕获,修复成本越低58% similarUnverified梯度累积通过在多个小批次上累积梯度后再执行一次参数更新,效果等同于使用大批次训练57% similarUnverified低精度引入的数值扰动会在RL的多轮迭代中通过策略梯度的乘积形式被放大,可能导致训练崩溃或模型性能退化57% similarUnverified单纯增加模型参数和训练数据的边际收益正在递减,即'Scaling Law放缓'现象57% similarUnverifiedRLHF微调阶段相比预训练在数据量级上通常小2-3个数量级,使安全行为编码为低秩覆写而非底层重塑56% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/502976API
curl https://kongchang.com/api/v1/knowledge/claims/502976MCP
get_claim(id=502976)