NCP-ArchPreview:潜空间语言模型如何超越Token预测

NCP-ArchPreview通过「下一个概念预测」在潜空间引入概念级目标,仅用一半训练数据就追平基线,并显著提升推理能力。
NCP-ArchPreview提出将「下一个概念预测」(NCP)与传统的Token级自回归预训练联合训练,让语言模型在连续隐状态构成的潜空间中学习跨Token的离散概念。模型通过乘积量化自动从隐状态生成概念词表,并借助专用概念模块形成概念与Token之间的双向反馈。在89亿参数、5.73万亿Token的规模验证中,NCP-ArchPreview仅消耗51.3%的训练Token便达到OLMo-3-7B的最终预训练损失,完整训练后在下游任务上高出2.45分,数学推理基准GSM8K提升5.99分。潜空间在下游还可用于轻量领域适配和投机解码加速,展示了超越训练阶段的实用价值。
从下一个Token到下一个概念
自回归预训练一直是大语言模型的核心范式,而其基础便是「下一个Token预测」(Next-Token Prediction, NTP)。这一目标简单有效,但也存在天然局限:模型每次只关注单个Token的局部预测,难以在更高的语义层次上进行规划。近期发布的技术报告《NCP-ArchPreview》提出了一种全新思路——通过「下一个概念预测」(Next Concept Prediction, NCP),让语言模型在潜空间(Latent Space)中建模跨越多个Token的离散概念。
这项工作的核心主张是:仅有Token级别的目标不足以让模型高效学习,引入一个更具挑战性的「概念级」目标,能够显著提升训练效率与下游表现。NCP-ArchPreview将NTP与NCP两个目标联合端到端训练,既保留了标准的Token级自回归生成能力,又赋予模型在概念层面的前瞻性规划能力。

潜空间与概念词表的构建方式
从隐状态中自动生成概念词表
NCP-ArchPreview的关键创新在于潜空间的构建方式。模型并非依赖外部标注或人工定义的概念,而是直接从自身的隐状态(Hidden States)中,通过乘积量化(Product Quantization, PQ)构造出一个离散的「概念词表」。概念表示在训练过程中自发涌现并固化下来,完全避免了额外的语义标注成本。
乘积量化是一种经典的向量压缩技术,它将高维向量空间分解为多个子空间,分别量化后再组合。在NCP架构中,它将连续的隐状态映射为离散的概念编码,从而形成一个可预测、可复用的概念空间。
乘积量化(Product Quantization)最早由Jégou等人于2011年提出,广泛应用于近似最近邻搜索(ANN)和向量数据库领域。其核心思想是将一个D维向量切分为M个子向量,每个子向量在各自的子码本(sub-codebook)中独立量化为一个离散编码,最终用M个整数索引的组合来近似表示原始向量。这种分而治之的策略使得码本规模从K^D压缩到M×K,在保留足够表达能力的同时大幅降低了存储与计算开销。在NCP架构中,PQ将Transformer每层输出的连续隐状态压缩为离散概念编码,使概念词表具备有限且可枚举的结构,进而支持类似Token预测的分类训练目标。这与VQ-VAE等向量量化生成模型的思路有异曲同工之处,但PQ无需单独的编码器-解码器训练,能更自然地嵌入端到端的语言模型预训练流程。
专用概念模块与双向反馈机制
拥有概念词表之后,模型通过一个专门的「概念模块」(Concept Module)来预测未来的概念。这些预测出的概念表示随后会被反馈到Token层级,用于引导后续的Token生成。
这种设计形成了一个双向的信息流:Token级生成为概念模块提供隐状态基础,而概念级预测又反过来为Token生成提供高层语义指导。两个目标在训练中相互促进、共同优化。
规模化验证与核心性能数据
迄今最大规模的潜空间语言模型
为验证架构的有效性,研究团队将NCP-ArchPreview扩展到了89亿参数,并在Dolma-3数据集的5.73万亿Token上进行训练。报告称这是迄今为止规模最大的潜空间语言模型演示,具有相当的说服力。
训练效率提升近一倍
最引人注目的结果是训练效率的飞跃。据报告,NCP-ArchPreview仅消耗51.3%的训练Token,就达到了OLMo-3-7B的最终预训练损失。这意味着在同等损失目标下,新架构可以节省近一半的训练数据——对于动辄消耗数万亿Token的大模型训练而言,这是极具吸引力的降本方向。
完整预训练之后,NCP-ArchPreview在下游任务的宏观平均分上比OLMo-3-7B高出2.45分,其中在数学推理基准GSM8K上取得了5.99分的显著提升。数学推理往往需要多步逻辑规划,这恰恰是概念级预测能够发挥优势的典型场景。
消融实验的清晰归因
研究团队通过受控实验分离出了性能提升的来源,证明潜空间架构和NCP目标各自都贡献了明确的性能增益。此外,仅使用85%标准计算量的情况下,NCP-ArchPreview的训练损失就接近了一个严格参数对齐的89亿基线模型。这种归因分析增强了结论的可信度。
潜空间在下游应用中的实用价值
预训练阶段学到的潜空间不仅服务于训练本身,在后续应用中同样展现出高价值:
- 轻量级领域适配:仅需更新1700万参数的VQ模块,就能获得一个全新的领域适配接口。相比全参数微调,成本极低,为模型的快速领域迁移提供了可行方案。
- 加速推理解码:将概念表示注入DFlash2的草稿模型(Drafter)中,能够将平均接受长度提升4.17%,额外开销几乎可以忽略。这对投机解码(Speculative Decoding)等推理加速技术具有直接价值。
总结与未来展望
NCP-ArchPreview代表了语言模型架构探索的一个重要方向:在保留成熟的Token级自回归范式的同时,引入更高层次的语义建模目标。它没有推翻现有范式,而是在其之上做加法,这种务实的思路降低了工程落地门槛。
从实验数据看,训练效率的大幅提升和GSM8K上的推理增益是两个最有分量的信号。前者直接关乎训练成本,后者指向模型推理能力的上限——这两点都是当前大模型竞争的核心战场。
当然,作为一份技术报告,其结论仍需更广泛的复现与验证。潜空间概念词表的可解释性、乘积量化在超大规模下的稳定性,以及概念反馈机制在更长上下文中的表现,都是值得深入研究的课题。但无论如何,NCP-ArchPreview为「超越Token预测」这一命题提供了一个规模化、可归因的实证案例,值得持续关注。
背景补充
投机解码(Speculative Decoding)是一种无损的LLM推理加速技术,由Leviathan等人于2023年正式提出。其基本思路是引入一个轻量级的「草稿模型」(Drafter)快速生成若干候选Token序列,再由大模型(Verifier)并行验证并决定接受或拒绝。由于验证步骤可批量并行处理,整体延迟显著低于大模型逐Token串行生成。加速效果的关键指标是「平均接受长度」(Mean Accepted Length),它衡量草稿模型每轮被大模型接受的Token平均数量。NCP-ArchPreview将概念表示注入草稿模型,相当于为Drafter提供了来自主模型潜空间的高层语义先验,使其生成的候选序列更贴近大模型的分布,从而提升接受率。4.17%的接受长度提升看似幅度不大,但在实际批量推理中可积累为可观的吞吐量增益,且几乎不引入额外的推理开销。
相关推荐

Treebar:Mac菜单栏管理Git工作树,一眼掌控所有AI编程Agent
Treebar是一款macOS菜单栏应用,专为AI编程多工作树场景设计。它将所有Git Worktree状态统一展示在MacBook刘海区域,让开发者实时监控Codex等AI Agent的工作进度,无需切换终端即可掌握全局。即将开源核心代码。

苹果确认Hide My Email域名永久保留,用户隐私获长期保障
苹果公司公开承诺iCloud+ Hide My Email功能使用的@icloud.com域名将永久保留,不会弃用或迁移。本文解析域名稳定性对邮箱转发隐私工具的关键意义,以及对用户账户安全的底层保障。

终端正在拖慢你:多任务时代的效率反思
终端是程序员的信仰工具,但在多任务并行的现代开发场景中,它的线性设计正在成为效率瓶颈。本文分析终端的心智负担模型为何在第六个任务时崩溃,以及开发者该如何重新评估工具选择。