Unverified50% confidenceBenchmarkExact time
论文称ZGCM-1在16K上下文的预训练中相比基线实现约4.2倍的time-to-loss效率提升
1
Sources
50%
Confidence
Long-term
Relevance
9/15/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedZGCM-1公开了预训练、中期训练、后训练三个阶段的模型权重、中间检查点、完整训练代码、数据与数据配方及W&B训练日志72% similarVerified混合精度训练通常可将训练速度提升1.5-2倍并减少近一半的显存占用68% similarUnverified诊断训练瓶颈的核心效率差异来自于是否提前建立了性能基线(baseline),如已知模型健康状态下的MFU则可快速发现偏离67% similarUnverified混合精度训练在不显著损失模型精度的前提下,可将训练速度提升约2倍,显存占用降低近一半67% similarUnverifiedMTP的多步预测目标使训练内存开销约增加15-25%,且需仔细调整各预测头损失权重以避免主任务性能退化67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/921654API
curl https://kongchang.com/api/v1/knowledge/claims/921654MCP
get_claim(id=921654)