[控场AI]
· 3 分钟阅读· 1,991 字

高通发布两款AI手机芯片:旗舰型号可本地运行300亿参数MoE模型

高通发布两款AI手机芯片:旗舰型号可本地运行300亿参数MoE模型

高通发布两款AI手机芯片,旗舰型号可本地运行300亿参数MoE大模型。

高通推出两款以端侧AI为核心卖点的智能手机芯片,旗舰型号主打可在本地运行300亿参数的专家混合(MoE)模型。MoE架构通过路由机制在推理时只激活部分"专家"网络,使超大规模模型得以在内存和算力受限的移动设备上运行。端侧AI的核心优势在于隐私保护、低延迟和离线可用,正成为芯片厂商争夺下一代智能手机体验制高点的新战场。两款芯片采用分层定位策略,有望将端侧AI能力覆盖至中高端机型。然而,内存带宽、散热、续航等现实制约,以及厂商宣称能力与日常使用体验之间的落差,仍是评估这一技术突破时需要审慎看待的关键问题。

高通近日推出了两款全新的智能手机芯片,将端侧AI能力作为核心卖点。其中最引人注目的是,高通宣称其新款旗舰芯片能够在本地运行一个300亿参数(30B)的专家混合(Mixture-of-Experts, MoE)模型。这一数字如果属实,将标志着移动端AI推理能力的一次显著跃升。

Qualcomm launches two new smartphone chips with emphasis on AI

端侧运行300亿参数MoE模型意味着什么

在过去,运行数十亿参数级别的大模型通常需要依赖云端数据中心的强大算力。高通此次强调旗舰芯片可在本地跑通30B规模的MoE模型,核心意义在于将原本属于服务器的AI负载搬到了用户手中的设备上。

MoE(专家混合)架构本身是一种提升模型效率的关键技术。它并不会在每次推理时激活全部300亿参数,而是通过路由机制只调用其中一部分"专家"网络。这意味着虽然模型总参数量高达30B,但实际每次推理激活的参数量要小得多,从而在有限的移动端算力和内存条件下实现更高的运行效率。这也是为什么MoE模型近年来在端侧部署场景中受到越来越多关注的原因。

从参数规模的历史演进来看,主流端侧AI模型长期停留在7B以下。2023年前后,手机芯片普遍只能流畅运行1B至3B参数的模型;到2024年,部分旗舰芯片将上限推至7B至13B。30B参数级别此前基本是云端服务的专属领域——GPT-3.5的参数量大约在200B级别,而Meta的Llama 2 13B已被认为是端侧部署的较大极限。高通此次宣称的30B MoE本地运行,若在实际设备上得到验证,意味着移动端模型规模在两年内实现了数量级的跨越。这一跨越背后依赖的不仅是芯片算力的提升,还包括低比特量化(如INT4/INT8压缩)技术的成熟——量化可以将30B模型的实际存储需求压缩至原始大小的四分之一甚至更低,使其有可能装入手机有限的内存空间。

为什么高通押注端侧AI

将AI推理放在设备本地运行,带来的直接好处是隐私保护、低延迟和离线可用性。数据无需上传云端,用户的敏感信息可以留在设备上;同时本地推理避免了网络往返带来的延迟,能够支撑更流畅的实时交互体验。

从行业竞争角度看,端侧AI正在成为智能手机芯片厂商的新战场。随着生成式AI应用的普及,谁能在手机上更高效地运行更大的模型,谁就能在下一代智能设备的体验竞争中占据先机。高通此次将两款新芯片的宣传重点放在AI上,正是对这一趋势的回应。

两款新芯片的定位差异

高通此次一次性推出两款芯片,通常意味着面向不同的市场层级。旗舰型号承担了展示技术天花板的角色——本地运行30B MoE模型正是其能力上限的体现;而另一款芯片则更可能面向中高端市场,在AI能力与成本之间取得平衡。

这种分层策略有助于高通将端侧AI能力覆盖到更广泛的机型,而不仅限于最高端旗舰。对于设备厂商和开发者而言,这也意味着可以针对不同性能层级的芯片来设计和优化AI应用。

端侧大模型的现实挑战

尽管300亿参数的本地运行听起来令人振奋,但实际落地仍面临不少挑战。移动设备的内存容量、散热能力和电池续航都会对大模型的持续运行构成约束。MoE架构虽然降低了单次推理的激活参数量,但完整模型的存储仍需要占用可观的设备空间。

此外,本地运行大模型的实际体验——包括推理速度、响应质量以及对电池的消耗——还需要在真实设备上进行验证。厂商宣称的"可运行"与用户日常使用中的流畅体验之间,往往存在一定距离。这些都是未来评估这两款芯片AI能力时需要关注的重点。

内存带宽是端侧大模型推理中常被忽视但至关重要的瓶颈。大模型推理的性能上限往往不取决于芯片的峰值算力(FLOPS),而是取决于芯片能以多快的速度将模型权重从内存搬运到计算单元——这一指标被称为内存带宽。移动SoC的内存带宽通常在50至100 GB/s级别,远低于数据中心GPU的数百GB/s。即使通过量化将30B模型压缩至约15-20GB,每生成一个token都需要读取全部或大部分激活权重,这对带宽构成持续压力,直接影响生成速度。MoE架构在理论上能够缓解这一问题——每次推理只激活部分专家,意味着需要搬运的权重量减少——但专家路由本身也会引入额外的调度开销,实际收益需要在具体硬件上实测才能确认。

结语

高通此次发布的两款新芯片,清晰地传递出一个信号:端侧AI已经从概念走向了芯片厂商的核心产品策略。旗舰型号本地运行30B MoE模型的能力,代表了当前移动端AI推理的一个新标杆。随着更多搭载这类芯片的设备上市,我们将有机会看到端侧大模型在真实使用场景中的表现,以及它能否真正改变智能手机的AI体验。

分享:

相关推荐