ZGCM-1
完全开源的70亿参数稠密基础模型,从零开始训练,采用交错式门控滑窗注意力与全注意力混合架构,结合工具调用与内部推理,支持256K超长上下文
Timeline (last 90 days)
ZGCM-1是一个完全开源的70亿参数稠密基础模型,从零开始训练
ZGCM-1-7B在数学推理和智能体搜索任务上与Qwen3-235B-A22B、GLM-5.1等大模型保持竞争力
ZGCM-1采用交错式门控滑窗注意力与全注意力的混合注意力机制
ZGCM-1支持256K超长上下文
ZGCM-1使用稳定的FP8 Muon优化器,将Muon优化器与FP8低精度训练结合并保持训练稳定
论文称ZGCM-1在16K上下文的预训练中相比基线实现约4.2倍的time-to-loss效率提升
ZGCM-1采用渐进式课程学习,将上下文长度按16K、64K、256K分阶段扩展
ZGCM-1在中期训练阶段将智能体与工具交互过程重新表述为马尔可夫决策过程(MDP)
ZGCM-1建立了AI原生研发工作流,用智能体集群自主管理集群运维、数据筛选和诊断评估
论文提炼了八条实证经验,覆盖架构扩展、SFT数据质量剪枝、长上下文泛化及智能体协同训练动态规律
3 more timeline events
All Facts (13)
ZGCM-1的竞争力主要体现在特定任务类型上,通用能力仍受限于模型规模
50%UnverifiedZGCM-1-7B在数学推理和智能体搜索任务上与Qwen3-235B-A22B、GLM-5.1等大模型保持竞争力
50%UnverifiedZGCM-1采用交错式门控滑窗注意力与全注意力的混合注意力机制
50%UnverifiedZGCM-1支持256K超长上下文
50%UnverifiedZGCM-1使用稳定的FP8 Muon优化器,将Muon优化器与FP8低精度训练结合并保持训练稳定
50%Unverified论文称ZGCM-1在16K上下文的预训练中相比基线实现约4.2倍的time-to-loss效率提升
50%UnverifiedZGCM-1采用渐进式课程学习,将上下文长度按16K、64K、256K分阶段扩展
50%UnverifiedZGCM-1在中期训练阶段将智能体与工具交互过程重新表述为马尔可夫决策过程(MDP)
50%UnverifiedZGCM-1建立了AI原生研发工作流,用智能体集群自主管理集群运维、数据筛选和诊断评估
50%Unverified论文提炼了八条实证经验,覆盖架构扩展、SFT数据质量剪枝、长上下文泛化及智能体协同训练动态规律
50%UnverifiedZGCM-1是一个完全开源的70亿参数稠密基础模型,从零开始训练
50%UnverifiedZGCM-1的核心命题是紧凑模型可通过耦合深思熟虑的内部思考与主动的外部工具调用来突破参数容量限制
50%UnverifiedZGCM-1公开了预训练、中期训练、后训练三个阶段的模型权重、中间检查点、完整训练代码、数据与数据配方及W&B训练日志
50%