Unverified50% confidenceSolutionExact time
在BERT微调场景下,按旧新数据1:3至1:5的比例混合,能有效维持旧类别性能
1
Sources
50%
Confidence
Long-term
Relevance
7/13/2026
First Seen
Sources
Related Claims
Unverified14倍的提升由多因子叠加而来:批处理贡献3-4倍、内存优化贡献1.5-2倍、会话复用与线程调优再叠加若干64% similarUnverified在收敛型任务上,模型达到一定规模后存在明显的性能饱和现象,参数量或训练数据的继续增加对准确率的边际贡献快速衰减64% similarUnverified优质Prompt在大多数场景下比微调更高效,在数据量不足或需求模糊的阶段贸然做微调往往事倍功半63% similarUnverified数据增强、标签平滑、适度的权重衰减等技术可以有效压平插值阈值附近的误差尖峰62% similarUnverified投机解码通过小模型预测候选Token、大模型批量验证提升吞吐量;量化技术将权重从FP16压缩至INT8/INT4降低显存占用;MoE架构通过稀疏激活降低单次推理计算量62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/502638API
curl https://kongchang.com/api/v1/knowledge/claims/502638MCP
get_claim(id=502638)