待验证50% 置信事实精确时间
团队使用识别出的 token 构建损失函数运行 LoRA SFT,成功缩减推理长度但导致准确率下滑
1
来源数
50%
置信度
长期有效
时效性
2026/9/14
首次发现
来源
涉及实体
相关事实
待验证预测损失合理但下游控制精度为0%高度符合表征坍缩的特征,即编码器骗过自监督目标却未学到有用动态信息68% 相似待验证Swift-Qwen3.8-27B 通过后训练手段将思考 token 削减 58.3%、推理速度提升 1.95 倍,同时准确率损失控制在 1% 以内66% 相似待验证混合精度训练通常配合损失缩放(Loss Scaling)技术使用,以防止梯度在 FP16 表示范围内消失66% 相似待验证SFT微调有效但导致小模型通用知识下降,即灾难性遗忘现象,因小模型容量瓶颈突出65% 相似已验证几何变换后必须记录变换参数并对预测框进行逆变换对齐,忽略该步骤会导致一致性损失语义错位而损害训练效果65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/920995API
curl https://kongchang.com/api/v1/knowledge/claims/920995MCP
get_claim(id=920995)