Unverified50% confidenceBenchmarkExact time
论文中的90亿参数模型在用强化学习训练前,比干净的摘要落后6分
1
Sources
50%
Confidence
Long-term
Relevance
10/5/2026
First Seen
Sources
Related Entities
Related Claims
Unverified知识蒸馏让学生网络学习教师网络输出的软概率分布,使学生模型在参数量缩减10倍以上的情况下保留核心推理能力72% similarVerified对于一个 70 亿参数的模型,LoRA 通常只需训练不到 1% 的参数量,显存需求可降低 60% 以上71% similarUnverified微软的Phi系列小模型通过精心设计的合成'教科书级'数据进行训练,以不到3B的参数量在多项基准测试中超越了10倍于其规模的模型70% similarUnverified在接近1000亿token的训练规模下,多项式版本与原生实现的最终平滑训练损失差异落在-0.107到+0.079之间70% similarUnverifiedAnthropic的研究表明,即便温和的对齐训练也会导致模型在某些推理密集型任务上下降2-8个百分点69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/979101API
curl https://kongchang.com/api/v1/knowledge/claims/979101MCP
get_claim(id=979101)