共 52 篇相关文章

NVIDIA提出非均匀张量并行技术,通过允许GPU承担不同计算负载,在硬件故障时无需回滚检查点即可继续训练,显著提升大规模LLM训练的有效产出(Goodput),为超大规模模型训练容错能力提供关键解决方案。

AMD MI355X在运行GLM5.2大模型时实现单节点2626 tokens/秒吞吐量,总拥有成本仅为英伟达Blackwell的一半。本文深度解析这一性价比优势背后的技术逻辑、ROCm生态进展,以及对AI算力市场格局的深远影响。

Redis之父用纯C引擎将284B参数DeepSeek模型压缩至76GB,在MacBook Pro上实现每秒26Token的本地推理。本文拆解MoE架构、非对称量化技术原理,直面硬件门槛与质量代价,厘清本地AI推理的真实边界。

OpenAI与博通联合推出定制AI芯片Jalapeño,专为大语言模型推理场景设计,聚焦性能、效率与规模三大目标。本文深度解析其技术逻辑、战略意图,以及对英伟达和整个AI算力格局的深远影响。

系统讲解如何从零复现GitHub开源项目,涵盖尽职调查(Star/Issues/README)、虚拟环境搭建、依赖安装、脚本解读、断点调试等完整流程,帮助研究生和初级开发者高效跑通别人的代码,少走弯路。

OpenAI发布首款自研AI芯片Jalapeño,与博通合作量产,专为大语言模型推理优化。深度解析Jalapeño芯片架构特点、战略意义及对英伟达和AI芯片行业格局的深远影响。

深入解析DAQIRI平台如何将NVIDIA GPU加速计算嵌入高速数据采集管道,实现采集即分析的实时AI推理能力,覆盖工业质检、科学实验、自动驾驶等核心应用场景。

深入解析LLM基础设施建设的核心挑战与关键技术栈,涵盖GPU集群管理、模型推理优化、分布式训练流程、成本控制与可观测性建设,为技术团队提供系统性的LLM Infra实践指南。
教程攻略深入解析NVIDIA GB200 NVL72机架级NVLink架构特点,详解Slurm块调度策略如何通过拓扑感知分配、减少资源碎片化来最大化72 GPU互联效率,附配置要点与工作负载优化实践。
教程攻略详解NVIDIA Nemotron Labs开源贡献路径,涵盖NeMo框架、Nemotron模型的代码贡献、文档完善、社区参与等方式,帮助开发者快速融入NVIDIA AI开源生态,提升技术能力与职业竞争力。
科技前沿NVIDIA开发者团队官方社交媒体账号已迁移至@NVIDIAAI统一发布。本文解析此次品牌整合背后的AI战略逻辑,对开发者社区的具体影响,以及开发者需要采取的行动建议。
产品体验深度解析腾讯开源AI平台Cube Studio,涵盖分布式训练、大模型微调推理、Pipeline编排、VGPU虚拟化等核心功能,支持华为昇腾国产生态,助力企业快速搭建云原生MLOps基础设施。