分词边界的代价:压缩效率与预测质量的量化博弈

预分词边界规则使最优token数增加近三成,压缩与预测最优词典并不一致,放宽10%词表许可即可恢复绝大部分压缩收益。
这篇arXiv论文通过构建可认证的压缩上下界,首次将预分词边界规则的代价精确量化:在英文维基百科上,边界规则使最优token数增加了28.3%至36.8%,而BPE在给定边界内已接近最优,与无约束下界的10.9%差距几乎全部来自边界本身。研究进一步揭示压缩效率与预测质量之间存在张力——追求极致压缩的词典在12种语言的留出集预测中大多表现更差,说明两者偏爱不同的词典设计。为此,论文提出边界许可证机制,仅对10%的词表发放跨边界许可,即可恢复英文85.2%、中文100%的压缩收益,提供了一条务实的折中路径。
被忽视的分词边界成本
大语言模型的第一步——分词(tokenisation)看似只是文本预处理的技术细节,却潜藏着一个长期被忽视的问题:预分词(pre-tokenisation)规则会限制哪些文本片段可以成为预测单元,而这种限制带来的压缩成本,往往在同一边界规则下比较分词器时被掩盖了。
一篇最新的 arXiv 论文(arXiv:2609.35869)直面这一问题。研究者试图回答一个核心疑问:当我们用正则表达式规则给文本切分出边界时,究竟付出了多大的压缩代价?以往的评测因为总在相同边界下横向对比,从未真正暴露这笔账单。

**预分词(pre-tokenisation)**是现代分词流水线的第一步,在正式学习 token 切分之前,先用确定性规则把原始文本切割成不可跨越的片段。以 GPT 系列常用的 tiktoken 为例,其正则表达式规则会强制在空格、标点与字母数字之间设立边界,使得"don't"永远不会与前后单词合并成一个 token。这类规则通常出于语言直觉或工程便利而设计,例如保证数字单独成 token、避免跨单词的奇异合并。然而正因为这些边界在训练数据处理前就已固定,所有后续的 BPE 或 Unigram 学习算法都在这个受约束的搜索空间内运作,从未有机会发现跨边界的高效 token,由此产生的压缩损失也就自然被"藏进"了基线之中,难以被常规横向对比所察觉。
如何为分词代价上下界定价
论文的方法论核心在于双向界定最小 token 数量——分别在有边界规则和无边界规则两种情况下测量。
研究者采用了一个巧妙的优化框架:为 token 出现设定非负的"价格",通过最短路径与词表预算选择得到一个下界;对所有价格取最大值,则恢复出线性规划松弛(LP relaxation);最后用一个独立的整数检查器(integer checker)对报告的数值进行认证(certificate)。
这套"压缩证书"的设计确保了结论的可验证性——报告的最优 token 数不是估算,而是有严格上下界佐证的量化结果。这种严谨性在分词研究中较为少见。
边界让 token 数暴涨近三成
在英文维基百科语料上的实测结果颇具冲击力:边界规则使最优 token 数量增加了 28.3% 到 36.8%。
换句话说,仅仅因为引入了正则边界切分,模型需要处理的 token 数就多出了近三分之一。这直接意味着更长的序列、更高的计算开销和更大的上下文占用。
对于广泛使用的字节对编码(BPE),论文给出了精确的定位:BPE 比受约束下界高出 2.1%,但比无约束下界高出 10.9%。这说明 BPE 在既定边界内已相当接近最优,但边界本身才是压缩效率的主要损失来源。
**字节对编码(BPE,Byte Pair Encoding)**是目前最主流的子词分词算法,最初由 Sennrich 等人于 2016 年引入 NLP 领域。其基本思路是:从单字节(或单字符)词表出发,反复统计语料中相邻 token 对的出现频率,将最高频的相邻对合并为一个新 token,直到词表达到预设大小。这一贪心迭代过程简单高效,但本质上是局部最优——每次合并只考虑当前频率最高的对,并不保证最终词表在全局意义上能最小化 token 数量。正因如此,论文中"BPE 比受约束下界高出 2.1%"这一数字,实际上是在肯定 BPE 在给定边界约束内已非常接近理论最优;而剩余 10.9% 的差距则揭示了边界规则本身对压缩效率的结构性限制,这是 BPE 算法本身无法克服的。
压缩与预测偏爱不同的词典
论文最具启发性的发现,是揭示了压缩效率与预测质量之间的张力:两者青睐的并非同一套词典。
在 8500 万非嵌入参数、训练 token 预算匹配的实验设置下,研究者发现无约束拟合(unrestricted fitting)在共同的无约束解码器下,于配对研究的全部 12 种语言中都产生了更高的留出集平均每字节比特数(bits per byte);在独立调优与评估下,12 种语言中有 11 种呈现相同结果。
这里的关键含义是:追求极致压缩的词典,未必是预测建模的最优选择。 分词器设计不能只盯着压缩率这一个指标,否则可能损害模型的实际预测能力。这为业界普遍存在的"压缩率越高越好"的直觉敲响了警钟。
边界许可证:一种折中方案
为了探索介于"全边界"与"无边界"之间的中间策略,论文提出了**边界许可证(boundary licences)**机制——它限制允许跨越切分点的词表条目数量,同时依然能给出同样形式的压缩证书。
实验数据令人印象深刻:在独立的英文与中文拟合语料上,仅对 10% 的词表预算发放许可,就能恢复移除所有切分所带来 token 数缩减的 85.2%(英文)和 100.0%(中文)。
这意味着不必彻底放弃边界规则,只需有选择地放宽一小部分关键词表条目,就能收回绝大部分甚至全部的压缩收益。对于中文这类语言,10% 的许可甚至完全消除了边界带来的压缩损失,这一结果尤其值得中文 NLP 从业者关注。
**边界许可证(boundary licences)**机制的核心洞察在于:并非所有边界都同等昂贵。在一份词表中,只有少数高频跨边界片段(例如常见的前缀、后缀或词组搭配)对压缩率的贡献最为显著。通过为这部分条目发放"许可",允许它们跨越原本禁止的切分点,可以以极低的词表灵活性代价换取可观的压缩收益。10% 的许可比例意味着在一个大小为 50,000 的词表中,约 5,000 个条目被允许跨边界合并,其余 90% 的条目仍遵守原有边界规则。这种设计对于工程实践而言尤为友好:无需彻底重构分词流水线,只需在现有 BPE 框架上增加一个条目级别的"许可标志",便可向无边界的理想压缩效率大幅靠拢,同时保留边界规则在处理特殊字符、多语言混排等场景下的工程稳健性。
对分词器设计的启示
这项研究的价值在于,它把"分词边界的压缩成本"从模糊的直觉变成了可量化、可认证的数字,并将其与最终 token 单元的预测质量清晰地区分开来。
几个实践层面的启示浮出水面:
- 分词边界并非免费午餐,它可能让 token 数增加三成以上;
- 单纯优化压缩率的词典在预测任务上可能表现更差,评测需要兼顾两个维度;
- 边界许可证提供了一条务实的中间道路,用极小的灵活性换取大部分压缩收益。
在长上下文与推理成本日益成为瓶颈的当下,重新审视分词这一"起点"环节的效率,或许比继续堆叠模型参数更具性价比。
相关推荐

只想要一个自定义域名邮箱,为何如此艰难?
拥有一个自定义域名邮箱看似简单,实则涉及 SPF/DKIM/DMARC 配置、IP 信誉、托管服务成本等诸多难题。本文梳理自建与托管方案的权衡,并给出实用建议。

Claude意外帮用户发现燃气泄漏:AI助手的安全应用边界
一位Reddit用户借助AI助手Claude识别出家中燃气泄漏隐患,PG&E上门确认并修复。本文分析AI助手在家庭安全场景中的真实价值与使用边界,以及处理燃气泄漏的正确做法。

Gemini 4 Argon发布:谷歌重返前沿,但故事没那么简单
谷歌时隔半年发布前沿模型Gemini 4 Argon,跑分重返一线却暂不开放。本文解析其基准表现、与Sonnet 5.5的竞争,以及模型能力与产品体验之争。