X-CoSD框架详解:跨词表协作推测解码如何加速LLM推理

X-CoSD框架详解:跨词表协作推测解码如何加速LLM推理
大语言模型(LLM)的推理效率一直是工业界和学术界关注的焦点。X-CoSD框架通过创新的跨词表协作推测解码技术,在保证生成质量的同时显著降低了通信开销,为分布式LLM推理提供了切实可行的解决方案。

协作推测解码面临的通信瓶颈
协作推测解码(CoSD)是一种分布式LLM推理范式:设备端的小语言模型(SLM)负责快速生成候选token,服务器端的大模型负责验证这些候选token。这种架构能够有效平衡推理速度和质量,但现有方法存在两个关键限制。
要理解CoSD的价值,需要先了解其技术根基——推测解码(Speculative Decoding)。推测解码是近两年LLM推理加速领域最受关注的技术之一,其核心思想源自一个关键观察:大模型的自回归生成过程中,每次只生成一个token,但GPU并行验证多个token的成本与生成单个token几乎相同。因此,可以用一个轻量级的草稿模型(draft model)快速生成多个候选token序列,再由大模型一次性并行验证,接受或拒绝这些候选。这一技术最早由Google DeepMind在2023年正式提出,随后被广泛应用于vLLM、TensorRT-LLM等主流推理框架中。CoSD则将这一思想扩展到分布式场景,让设备端的小模型充当草稿模型、云端的大模型充当验证模型,天然适配端云协同的部署架构。
第一,词表共享假设难以成立。 传统CoSD假设SLM和LLM共享完全相同的词表,但在实际部署中,不同规模的模型往往采用不同的分词策略和词表设计,这一前提条件很难满足。具体来说,LLM的词表(Vocabulary)是模型能够识别和生成的最小语言单元的集合,不同模型系列采用的分词算法(如BPE、WordPiece、Unigram等)和训练语料存在显著差异。例如,LLaMA系列使用基于SentencePiece的BPE分词器,词表大小为32,000;而Qwen系列的词表超过150,000,对中文和代码有更细粒度的覆盖。即使同一系列的不同规模模型,也可能因训练阶段的优化而采用不同版本的词表。这种现实中的词表异构性,使得传统推测解码中"草稿模型和目标模型必须共享词表"的假设在跨架构协作时根本无法成立。
第二,通信负载过高。 残差重采样(residual resampling)过程需要在设备和服务器间频繁交换完整的token概率分布,在带宽受限的边缘计算场景中成为严重的性能瓶颈。残差重采样是推测解码中保证输出分布无偏的关键机制——当草稿模型生成的候选token被目标模型拒绝时,需要从一个"残差分布"中重新采样。残差分布的定义为:对于目标模型概率p(x)大于草稿模型概率q(x)的token,其残差概率正比于max(0, p(x) - q(x))。这一机制确保了最终采样结果的边际分布严格等于目标模型的原始分布,即推测解码是"无损"的,不会引入任何分布偏移。然而,计算和传输完整的残差分布需要交换整个词表上的概率向量,当词表规模达到数万甚至十几万时,通信开销将变得非常可观。
在边缘计算(Edge Computing)场景中,这一问题尤为突出。边缘计算是指在靠近数据源的网络边缘侧进行计算和数据处理,典型场景包括手机、IoT设备、车载终端等。这些场景的网络带宽通常远低于数据中心内部互联——4G网络的上行带宽一般仅为5-20 Mbps,5G在实际使用中也难以持续达到理论峰值。如果每次残差重采样都需要传输一个包含数万个浮点数的完整概率分布(以float16计算,一个100K词表的分布约为200KB),在多轮验证交互中累积的通信量将严重拖慢端到端延迟,甚至可能抵消推测解码本身带来的速度增益。
X-CoSD的核心创新:混合重采样机制
X-CoSD框架的核心是混合重采样(Hybrid Resampling, HR)机制,它将残差重采样过程拆分为两个区域分别处理:
- 共享词表区域: SLM和LLM都包含的token,重采样在设备端本地完成
- LLM独占区域: 仅存在于LLM词表中的token,重采样在服务器端处理
这种设计的关键优势在于,只有共享词表区域的概率分布需要在设备和服务器间传输,通信数据量大幅减少。论文通过严格的数学推导证明,这种混合策略能够完全保持服务器LLM的原始概率分布,实现无损推理。
混合重采样之所以能够实现无损推理,依赖于一个关键的数学性质:共享词表区域和LLM独占区域在概率空间上构成了一个完备的划分。对于任意token x,如果x同时存在于SLM和LLM的词表中,其残差重采样可以在设备端利用本地可获得的p(x)和q(x)完成;如果x仅存在于LLM词表中,则q(x)=0,残差概率直接等于归一化后的p(x),只需在服务器端采样即可。由于这两个区域互不重叠且覆盖完整词表,分别处理后的联合分布等价于在整个词表上执行标准残差重采样,从而严格保持了目标模型的输出分布。这种基于集合划分的分布保持证明,为混合重采样的正确性提供了坚实的理论保障。
X-CoSD-E增强版:更低通信开销的实现
在标准X-CoSD基础上,研究团队进一步提出了增强版本X-CoSD-E,采用"服务器重采样+设备验证"(SR-DV)策略。其工作流程如下:
- 服务器从LLM采样得到替换候选token
- 服务器只向设备发送候选token及其对应概率
- 设备端进行本地验证
相比标准X-CoSD,增强版不再需要传输完整的概率分布,而是直接提供最终的采样结果和验证所需的最小信息集。这种设计在保持理论正确性的同时,将通信效率提升到了新的高度。
从通信复杂度的角度分析,SR-DV策略将每轮验证的通信量从O(|V|)降低到O(1)级别(V为词表大小)。在传统方案中,服务器需要向设备发送整个残差分布以供本地采样,数据量与词表大小成正比。而在SR-DV策略中,服务器直接完成采样过程,只需向设备传回一个候选token ID及其对应的少量辅助信息(如接受概率),设备端据此做最终的接受/拒绝决策。这意味着无论词表多大,每轮验证的下行通信量都是常数级的。这种"计算换通信"的设计思想——在计算资源充裕的一端完成更多工作以减少网络传输——在分布式系统设计中具有普遍的指导价值。
实验效果:速度与质量的双重验证
实验结果表明,X-CoSD及其增强版本在多个基准测试中表现优异:
- 推理速度: token生成速度显著提升,通信开销大幅降低
- 生成质量: 输出文本质量与直接使用服务器LLM相当,验证了框架的无损特性
- 适用场景: 在带宽受限的边缘计算环境中优势尤为明显
技术意义与应用前景
X-CoSD框架的提出具有多方面的技术价值:
打破词表依赖。 不同架构、不同规模的模型可以更灵活地协作,不再受限于必须共享同一套词表。这意味着企业可以在设备端部署最适合本地硬件的小模型(如针对移动端优化的模型),在云端使用最强大的通用大模型,两者无需来自同一模型家族,极大拓展了模型选择的自由度。
降低部署成本。 通信效率的大幅提升使得边缘推理的成本更加可控,为LLM的大规模部署扫清了重要障碍。
保护用户隐私。 用户可以在本地设备上获得接近云端大模型的体验,同时减少敏感数据上传,降低端到端延迟。在传统的纯云端推理架构中,用户的所有输入(包括聊天记录、文档内容、代码片段等)都需要上传到服务器,这引发了严重的隐私和数据合规风险,特别是在医疗、金融、法律等敏感领域。GDPR、中国《个人信息保护法》等法规对数据跨境传输和云端处理都有严格限制。X-CoSD框架下,用户输入首先由本地SLM处理并生成候选token,只有在验证阶段才与服务器交互,且交互内容主要是token ID和概率值而非原始文本。这种架构天然地减少了敏感数据的暴露面,配合差分隐私等技术手段,可以构建更符合隐私保护要求的AI服务体系。
随着端侧AI应用的不断普及,跨词表协作机制有望在智能助手、实时翻译、代码补全等场景中得到广泛应用,成为分布式AI系统的重要基础组件。
核心要点
相关推荐

SWORD基准揭示大模型跨语言事实核查的隐藏漏洞
SWORD基准通过反向事实核查评估,揭示大语言模型在跨语言场景下的两大隐藏缺陷:依赖统计熟悉度而非真正事实验证,以及东亚语言性能最高下降49%。深入解读研究发现及其对AI部署的启示。

AutoFyn框架:冻结模型的专家迭代优化方法
AutoFyn是一种创新的智能体架构,通过持久化状态和验证奖励实现冻结模型的性能提升。已在数学竞赛、数据科学和网络安全领域验证有效,Spider 2.0排名第一,发现16个开源项目漏洞。

DeepSeek-V4.1-Flash深度解析:1M上下文仅需900MB显存的秘密
DeepSeek-V4.1-Flash模型KV缓存压缩取得突破,1M token上下文窗口仅占用约900MB显存。本文解析其552B主干+196B Engram架构、激活参数机制及对长上下文推理成本的颠覆性影响。