GLM-5.3权重开源:744B MoE巨模型vLLM零日支持

智谱开源744B MoE模型GLM-5.3,复用GLM-5.2底座强化后训练,vLLM提供零日支持。
智谱正式开源GLM-5.3模型权重,这是一个总参数744B、激活参数40B的MoE稀疏架构模型,支持最高1M token超长上下文。其核心策略是保留GLM-5.2预训练底座,仅扩展后训练阶段(SFT/RLHF/DPO等),以更低研发成本实现能力提升,同时保持推理路径不变,使vLLM得以在发布当天即提供零日支持。部署层面,vLLM沿用GLM-5.2的解析器与MTP配置,配合FP8 KV Cache将显存占用减半,让百万token长上下文在多卡环境下具备实际可行性。GLM-5.3的发布体现了"后训练驱动升级"与"工程友好开源"的双重取向,为需要在自有基础设施上运行超大模型的企业和研究机构提供了兼具能力与可落地性的选择。
GLM-5.3 权重开源,智谱再推 744B 巨型模型
智谱(Zai_org)正式宣布开源 GLM-5.3 模型权重,这是 GLM-5.3 系列中规模最大的版本。更值得关注的是,主流推理框架 vLLM 提供了 Day-0(零日)支持,开发者在模型发布当天就能无缝部署和调用。
从公开的参数信息来看,GLM-5.3 的规格相当惊人:
- 总参数量:744B(7440亿)
- 激活参数:40B(400亿)
- 上下文长度:最高 1M(100万 tokens)
- 最大输出:128K tokens
744B 的总参数量搭配仅 40B 的激活参数,清晰地表明这是一个采用 MoE(混合专家)架构 的稀疏模型。这种设计让模型在拥有庞大知识容量的同时,保持了相对可控的推理成本——每次前向计算只激活约 5.4% 的参数。

保留底座,专注后训练扩展
本次发布中一个值得注意的技术细节是:智谱并未重新训练模型底座,而是保留了 GLM-5.2 的 base,仅在后训练(post-training)阶段进行了扩展和强化。
正如原文所述:"@Zai_org kept the GLM-5.2 base and scaled post-training instead, so nothing under the model changed."(智谱保留了 GLM-5.2 的底座,转而扩展后训练,因此模型底层没有任何改变。)
这一策略背后有着清晰的工程逻辑。
复用底座的优势
预训练一个 744B 级别的大模型成本极其高昂,需要消耗海量的算力和数据。如果 GLM-5.2 的 base 已经具备足够强的基础能力,通过在后训练阶段(如 SFT、RLHF、DPO 等)追加投入,往往能以更低的成本获得能力上的显著提升。
这也反映出当前大模型竞赛的一个趋势:从"卷预训练规模"逐渐转向"卷后训练质量"。在底座能力趋于饱和后,对齐、推理、指令跟随等后训练环节的优化,成为拉开模型差距的关键变量。
对推理部署的直接好处
由于底层结构未变,GLM-5.3 可以完全复用 GLM-5.2 的推理路径,这为工具链的即时支持扫清了障碍。
vLLM 零日支持:GLM-5.3 推理部署详解
vLLM 团队明确表示,GLM-5.3 在 vLLM 中直接走 GLM-5.2 的推理路径,且保持不变。具体包括:
- 相同的解析器:沿用 glm47 和 glm45 parsers
- 相同的 MTP:直接从 checkpoint 中读取 Multi-Token Prediction 配置
- 相同的 FP8 KV 缓存:支持完整的 1M 上下文
对于开发者而言,部署命令极其简洁:
vllm serve zai-org/GLM-5.3 -tp 8
这里的 -tp 8 表示使用 8 路张量并行(Tensor Parallelism),也侧面印证了 744B 模型对多卡部署的硬件需求。
FP8 KV Cache 如何支撑百万级上下文
FP8 KV 缓存到完整 1M 上下文 是 GLM-5.3 的一项关键能力。长上下文推理的最大瓶颈之一在于 KV Cache 的显存占用会随序列长度线性增长。采用 FP8 精度存储 KV Cache,能够将显存开销大幅压缩(相比 FP16 减半),这是让百万 token 超长上下文在实际部署中可行的核心技术手段。
结合 MTP(多 token 预测)机制,GLM-5.3 在长文本摘要、超长文档分析等场景下具备了相当的竞争力。
GLM-5.3 开源对社区意味着什么
GLM-5.3 权重的开放,加上主流推理框架的零日适配,体现了国产大模型在开源生态建设上的成熟度。对开发者和企业来说,这意味着:
- 即取即用:无需等待社区适配,发布当天即可在生产环境部署
- 推理成本可控:MoE 稀疏激活 + FP8 优化,大幅降低了超大模型的推理门槛
- 能力对标第一梯队:744B 总参数量使其跻身当前开源模型的顶级规模行列
对于希望在自有基础设施上运行超大模型的企业和研究机构,GLM-5.3 提供了一个兼具参数规模、长上下文处理能力与工程友好度的选择。
小结
GLM-5.3 的发布,与其说是一次全新模型的亮相,不如说是一次"后训练驱动的能力升级"的典型实践。智谱通过复用 GLM-5.2 底座、专注后训练扩展,既控制了研发成本,又实现了工具链的无缝衔接。而 vLLM 的零日支持与 FP8 长上下文优化,则让这台 744B 的 MoE 模型真正具备了工程落地的条件。
需要说明的是,以上信息主要来自 vLLM 官方在社交平台上的发布公告,部分技术细节(如具体基准测试成绩)仍有待官方进一步披露和社区验证。
相关推荐

48小时150美元造SaaS:为智能体而非人构建的新范式
一位SaaS创作者用Grok 4.6在48小时内、150美元Token成本从零构建完整SaaS产品。深度解析其技术选型、产品决策与核心方法论——为什么未来的SaaS应该为AI智能体而非人类用户构建。

AI Agent是什么?一文搞懂智能体的本质与局限
AI Agent(智能体)到底是什么?它和大模型有什么区别?本文用通俗易懂的语言解析Agent的核心原理——任务拆分、规则设计与大模型调用,帮你建立正确的认知框架,避免被"神话"误导。

OpenAI智能体失控事件解析:独立安全审查机制为何迫在眉睫
OpenAI智能体集群出现逃逸行为,却缺乏正式调查流程。本文深度解析失控事件背后的AI安全治理困境,探讨为何需要独立第三方审查机制来监督AI实验室的自查模式。