[KongchangAI]
ModelZGCM-1-7B

ZGCM-1

完全开源的70亿参数稠密基础模型,从零开始训练,采用交错式门控滑窗注意力与全注意力混合架构,结合工具调用与内部推理,支持256K超长上下文

Timeline (last 90 days)

Sep 15

ZGCM-1是一个完全开源的70亿参数稠密基础模型,从零开始训练

Unverified50%
Sep 15

ZGCM-1-7B在数学推理和智能体搜索任务上与Qwen3-235B-A22B、GLM-5.1等大模型保持竞争力

Unverified50%
Sep 15

ZGCM-1采用交错式门控滑窗注意力与全注意力的混合注意力机制

Unverified50%
Sep 15

ZGCM-1支持256K超长上下文

Unverified50%
Sep 15

ZGCM-1使用稳定的FP8 Muon优化器,将Muon优化器与FP8低精度训练结合并保持训练稳定

Unverified50%
Sep 15

论文称ZGCM-1在16K上下文的预训练中相比基线实现约4.2倍的time-to-loss效率提升

Unverified50%
Sep 15

ZGCM-1采用渐进式课程学习,将上下文长度按16K、64K、256K分阶段扩展

Unverified50%
Sep 15

ZGCM-1在中期训练阶段将智能体与工具交互过程重新表述为马尔可夫决策过程(MDP)

Unverified50%
Sep 15

ZGCM-1建立了AI原生研发工作流,用智能体集群自主管理集群运维、数据筛选和诊断评估

Unverified50%
Sep 15

论文提炼了八条实证经验,覆盖架构扩展、SFT数据质量剪枝、长上下文泛化及智能体协同训练动态规律

Unverified50%

3 more timeline events

All Facts (13)

Unverified

ZGCM-1的竞争力主要体现在特定任务类型上,通用能力仍受限于模型规模

50%
Unverified

ZGCM-1-7B在数学推理和智能体搜索任务上与Qwen3-235B-A22B、GLM-5.1等大模型保持竞争力

50%
Unverified

ZGCM-1采用交错式门控滑窗注意力与全注意力的混合注意力机制

50%
Unverified

ZGCM-1支持256K超长上下文

50%
Unverified

ZGCM-1使用稳定的FP8 Muon优化器,将Muon优化器与FP8低精度训练结合并保持训练稳定

50%
Unverified

论文称ZGCM-1在16K上下文的预训练中相比基线实现约4.2倍的time-to-loss效率提升

50%
Unverified

ZGCM-1采用渐进式课程学习,将上下文长度按16K、64K、256K分阶段扩展

50%
Unverified

ZGCM-1在中期训练阶段将智能体与工具交互过程重新表述为马尔可夫决策过程(MDP)

50%
Unverified

ZGCM-1建立了AI原生研发工作流,用智能体集群自主管理集群运维、数据筛选和诊断评估

50%
Unverified

论文提炼了八条实证经验,覆盖架构扩展、SFT数据质量剪枝、长上下文泛化及智能体协同训练动态规律

50%
Unverified

ZGCM-1是一个完全开源的70亿参数稠密基础模型,从零开始训练

50%
Unverified

ZGCM-1的核心命题是紧凑模型可通过耦合深思熟虑的内部思考与主动的外部工具调用来突破参数容量限制

50%
Unverified

ZGCM-1公开了预训练、中期训练、后训练三个阶段的模型权重、中间检查点、完整训练代码、数据与数据配方及W&B训练日志

50%

Source Articles