Unverified50% confidenceFactExact time
团队使用识别出的 token 构建损失函数运行 LoRA SFT,成功缩减推理长度但导致准确率下滑
1
Sources
50%
Confidence
Long-term
Relevance
9/14/2026
First Seen
Sources
Related Entities
Related Claims
Unverified预测损失合理但下游控制精度为0%高度符合表征坍缩的特征,即编码器骗过自监督目标却未学到有用动态信息68% similarUnverifiedSwift-Qwen3.8-27B 通过后训练手段将思考 token 削减 58.3%、推理速度提升 1.95 倍,同时准确率损失控制在 1% 以内66% similarUnverified混合精度训练通常配合损失缩放(Loss Scaling)技术使用,以防止梯度在 FP16 表示范围内消失66% similarUnverifiedSFT微调有效但导致小模型通用知识下降,即灾难性遗忘现象,因小模型容量瓶颈突出65% similarVerified几何变换后必须记录变换参数并对预测框进行逆变换对齐,忽略该步骤会导致一致性损失语义错位而损害训练效果65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/920995API
curl https://kongchang.com/api/v1/knowledge/claims/920995MCP
get_claim(id=920995)