LELP-S+实测:让AI每个Token都装满信息,最高节省44%成本

一个被忽视的优化维度:每Token的信息密度
在大模型应用中,我们习惯性地追求两个目标:更准确的答案和更短的回复。但开源项目 Sir Shortoken 的最新更新 LELP-S+(Less English, Less Prose)提出了一个更细致的第三维度——信息密度,即让每个消耗的 Token 都尽可能承载更多有效信息。
这看似是一个语言学游戏,实际上直击了大模型使用的核心痛点:Token 成本。Token是大语言模型处理文本的基本单位,通常一个英文单词会被分割为1-3个Token,中文则每个字约1.5-2个Token。以GPT-4o为例,输入价格为每百万Token 2.5美元,输出为10美元。对于日均百万次API调用的企业应用,即使节省30%的Token消耗,年化成本节约也可达数十万美元级别。此外,当前主流模型的上下文窗口虽已扩展到128K甚至更长,但有效注意力仍集中在有限范围内——研究表明,模型在处理长上下文时存在"中间遗忘"(Lost in the Middle)现象,即对上下文首尾部分的关注度高于中间部分。这一现象由斯坦福大学Nelson Liu等人在2023年的研究中系统性地揭示:当检索到的相关文档被放置在上下文中间位置时,模型的回答质量显著下降,而放在开头或结尾时表现最佳。这意味着简单地塞入更多信息并不等于模型能有效利用这些信息——信息密度的提升不仅让模型能在同等窗口内"看到"更多有效内容,更关键的是,它缩短了有效信息之间的Token距离,使得注意力机制能更高效地捕捉信息间的关联,从而减轻注意力稀释带来的性能下降。
无论是 API 调用费用、上下文窗口限制,还是响应延迟,Token 数量始终是绕不开的约束。而 LELP-S+ 给出的思路不是简单粗暴地"少说话",而是"说得更精炼"。

LELP-S+ 的核心设计原则
保留语法,删除冗余
Sir Shortoken 原本已经提供了多档输出模式:Quick(快速)、Balanced(平衡)、Deep(深度)、Bullets(要点)以及 Aggressive Bullets(激进要点)。作者发现,在 Bullets 模式和正常散文(Prose)之间存在一个空白地带——用户既想要完整的句子表达,又不希望被大量修饰性英语稀释信息。
LELP-S+ 正是填补这个空白的方案。它的设计原则可以概括为:
- 保留完整的语法句子,而不是零散的短语堆砌
- 尽可能删除冗余英语,但绝不删除信息本身
- 每个句子都应引入一个新事实,避免同义反复
- 善用简单符号(如 →)替代冗长的连接词,在不损失语义的前提下减少字数
这种方式的价值在于:它既不像 Bullets 那样牺牲逻辑连贯性,也不像普通散文那样浪费大量 Token 在"as we can see"、"it is important to note that"这类填充语上。语言学中将这类表达称为"话语标记"(discourse markers)或"元语言表达"(metalinguistic expressions)——它们在人际沟通中起到社交润滑和认知引导的作用,帮助听者跟踪话题转换、理解说话者的意图层级。语用学研究者Deborah Schiffrin和Bruce Fraser的经典工作表明,话语标记在口语交际中占比可高达10%-15%,在书面语中较低但仍然显著。然而在人机交互场景下,尤其是开发者阅读技术文档时,这些表达几乎不携带信息量——模型输出"It is worth noting that TCP uses a sliding window mechanism"与直接输出"TCP uses a sliding window mechanism"传达的技术信息完全相同,前者多出的6个Token纯属表达冗余,反而消耗了宝贵的Token预算和阅读注意力。大模型之所以倾向于生成这类填充语,很大程度上是因为训练语料中充斥着这类表达模式——互联网文本、教科书、博客文章都遵循人际沟通的写作惯例,模型在学习语言分布的过程中自然继承了这些习惯。
与激进要点模式的区别
相比 Aggressive Bullets 把内容压缩成碎片化条目,LELP-S+ 更接近一种"电报体"技术写作风格。它保留了句子的可读性和推理链条,特别适合需要解释因果关系的技术内容,比如网络协议或数据库原理的讲解。这种区别的重要性在于认知科学的发现:人类大脑在理解因果关系时依赖叙事性的连贯结构,纯粹的要点列表虽然信息密集,但读者需要额外的认知负荷来重建逻辑链条。认知负荷理论(Cognitive Load Theory)的创始人John Sweller指出,当学习材料要求读者自行整合分散的信息片段时,会产生"外在认知负荷"(extraneous cognitive load),这种负荷不仅降低理解效率,还会挤占用于深度理解的"内在认知负荷"空间。LELP-S+在信息密度和认知友好性之间找到了一个实用的平衡点——它削减的是不承载信息的语言冗余,而保留的是帮助读者构建心智模型的逻辑骨架。
跨模型实测结果:GPT 压缩能力最强
测试设计与方法
作者在五个技术主题上进行了对比测试,涵盖典型的计算机系统知识:
- TCP 拥塞控制:TCP拥塞控制是计算机网络中的经典算法族,包括慢启动、拥塞避免、快速重传和快速恢复四个阶段。从最早的Tahoe(1988年)、Reno到现代Google提出的BBR(Bottleneck Bandwidth and Round-trip propagation time)算法,这些机制决定了数据在网络中的传输速率如何动态调整,核心挑战在于平衡带宽利用率与网络公平性。这类知识的技术解释通常涉及窗口大小变化的因果链条——例如"当检测到三次重复ACK时,cwnd减半并进入快速恢复"——每一步都包含条件、动作和状态转换,正是LELP-S+所擅长的"保留因果关系的精简表达"的理想测试场景。
- 虚拟内存:虚拟内存是操作系统通过硬件MMU(内存管理单元)实现的地址空间抽象,它让每个进程"以为"自己拥有连续的完整内存空间。涉及页表、TLB(转译后备缓冲器)、页面置换算法(LRU、Clock等)和写时复制等多层机制的交互。解释虚拟内存需要在抽象层次间来回切换——从硬件地址翻译到操作系统策略再到应用程序感知——冗余的过渡性表达在此场景下尤其显眼。
- B 树:B树是一种自平衡的多路搜索树,广泛用于数据库索引和文件系统。与二叉搜索树不同,B树的每个节点可以有多个键和子节点,通过保持树的高度极低来最小化磁盘I/O次数。其插入和删除操作涉及节点分裂与合并的级联过程,技术描述中大量的步骤说明容易被修饰性语言膨胀。
- Raft 共识算法:Raft是2014年由Diego Ongaro和John Ousterhout在斯坦福大学提出的分布式共识算法,其设计初衷是成为Paxos的易于理解的替代方案——Paxos虽然在理论上被证明正确,但其描述方式之晦涩使得工程实现极其困难(Lamport自己也承认原始论文的表述不够友好)。Raft通过将共识问题分解为领导者选举(Leader Election)、日志复制(Log Replication)和安全性(Safety)三个相对独立的子问题,大幅降低了理解和实现难度。etcd(Kubernetes的底层存储)、CockroachDB、TiKV等知名分布式系统均采用Raft作为底层共识机制。解释Raft需要清晰的状态转换描述(Follower → Candidate → Leader)和角色交互说明,涉及任期(term)、心跳、投票等概念的精确定义,冗余表达会显著膨胀内容量。
- Redis 持久化:Redis提供RDB(快照)和AOF(追加日志)两种持久化机制,以及二者的混合模式。RDB通过fork子进程利用操作系统的写时复制(Copy-on-Write)机制创建内存快照,实现时间点备份;AOF则记录每条写命令到日志文件,通过fsync策略(always/everysec/no)在性能和数据安全性之间提供灵活配置。自Redis 4.0起引入的混合持久化方案在AOF重写时使用RDB格式存储基础数据、AOF格式存储增量命令,兼顾了恢复速度和数据完整性。两种机制在恢复速度、数据完整性和I/O开销之间存在不同的权衡,技术解释需要精确对比各方案的优劣势和适用场景。
测试对象覆盖四大主流模型:GPT、Claude、Gemini 和 DeepSeek。评估指标是相较于各模型正常散文输出的平均 Token 节省率。这种以各模型自身正常输出为基线的设计避免了因模型默认输出长度不同而导致的不公平比较——每个模型都是与自己的"未压缩版本"对比。值得注意的是,Token计数本身也存在模型间的差异:不同模型使用不同的分词器(tokenizer),如GPT系列使用tiktoken(基于BPE算法),Claude使用自有分词器,相同文本在不同分词器下的Token数量可能有5%-15%的差异。作者在此采用的是各模型自身分词器计算的Token数,这进一步保证了比较的公平性。
Token 节省率排名
实测结果呈现出明显的梯度差异:
| 排名 | 模型 | Token 节省率 |
|---|---|---|
| 🥇 | GPT | 44% |
| 🥈 | Gemini | 36% |
| 🥉 | Claude | 32% |
| 4️⃣ | DeepSeek | 30% |
GPT 以 44% 的压缩率遥遥领先,意味着在处理相同技术解释时,它能砍掉将近一半的冗余表达。这对于高频调用 API 的场景来说,是相当可观的成本节约。以一个具体场景估算:如果一个企业应用每天产生100万次技术问答调用,平均每次输出500 Token,GPT-4o的输出价格为每百万Token 10美元,那么44%的Token节省意味着每天节约2200美元,年化约80万美元——这已经足以覆盖一个工程团队的年薪。即使是排名最低的DeepSeek的30%节省率,在同样的调用规模下年化节约也超过50万美元,说明LELP-S+在所有主流模型上都能产生显著的经济价值。
压缩纪律:真正拉开差距的因素
四个模型都保持了事实正确
这个测试最有意思的发现是:准确性并不是区分器。在整个评估过程中,四个模型都保持了技术事实的正确性——没有一个模型因为压缩而牺牲了内容的可靠性。这说明 LELP-S+ 的指令设计足够健壮,不会诱导模型为了简短而胡编乱造。
这个发现本身具有重要意义。在信息论中,有损压缩(lossy compression)和无损压缩(lossless compression)的区分是核心概念——JPEG图像压缩是典型的有损压缩(丢弃人眼不敏感的高频信息),而ZIP文件压缩是无损压缩(解压后与原文件完全一致)。LELP-S+本质上实现的是一种"语义无损压缩"——删除的是冗余的语言形式(修饰词、过渡句、重复表述),而保留的是信息内容本身。这证明了自然语言中存在大量的"表达冗余",与信息论创始人香农(Claude Shannon)关于英语冗余度约为50%-75%的经典估计相吻合。香农在1951年的论文《Prediction and Entropy of Printed English》中通过让人类被试预测下一个字母的实验,估算英语的信息熵约为每字母1.0-1.5比特,远低于其理论最大值4.76比特(log₂26),这意味着英语文本中超过一半的字符是"可预测的",即理论上可以在不丢失信息的情况下被压缩。LELP-S+的实测结果(30%-44%的压缩率)恰好落在这个理论预测的范围内,为香农的经典估计提供了一个来自LLM时代的实证注脚。
模型间的"压缩纪律"差异
真正拉开差距的,是作者所说的"压缩纪律"(compression discipline)——即模型对指令的遵从度和自我约束能力。
指令遵循能力(Instruction Following)是大模型评估的核心维度之一。斯坦福的IFEval基准测试通过25种可验证的约束类型(如"回答必须少于N个词"、"必须包含关键词X"、"不要使用某个特定词"等)来量化评估模型的指令遵循精度;清华的FollowBench则从内容、情境、风格、格式和示例五个层面进行多粒度评估。研究表明,经过RLHF(基于人类反馈的强化学习)和DPO(直接偏好优化)训练的模型在指令遵循上表现更好,但不同厂商的对齐策略差异显著——OpenAI倾向于训练模型严格服从用户指令(体现为高度的"可操控性"steerability),这在其模型规格文档(Model Spec)中被明确列为设计原则;Anthropic的Claude则被设计为在安全性和帮助性之间寻求平衡,其"Constitutional AI"训练方法允许模型在某些情况下"礼貌地拒绝"或"适度偏离"用户指令;而部分模型则被调教为"主动提供更多帮助",即使用户未明确要求。这种训练策略的根本差异——本质上是各公司对"AI助手应该多大程度上像一个服从命令的工具vs一个有主见的顾问"这个哲学问题的不同回答——正是我们在LELP-S+测试中观察到的现象的根源。
GPT 之所以领先,是因为它能持续、稳定地删除散文冗余,同时完整保留技术解释的核心。这体现了它对系统提示词的高度服从性。
相比之下,DeepSeek 得分偏低的原因很有代表性:它倾向于添加用户未要求的额外章节,导致答案比实际需要的更长。这不是能力问题,而是"过度热情"——模型主动补充信息的习惯,在需要精简的场景下反而成了负担。这种行为在机器学习文献中被称为"过度生成"(over-generation),可能源于训练数据中"详细回答获得更高评分"的隐含偏好,也可能与RLHF阶段奖励模型的设计倾向有关——如果奖励模型倾向于给更长更"完整"的回答打高分,模型自然会学到"多说总比少说好"的策略。这个现象在学术界也有对应的研究:Anthropic在2023年的一篇研究中指出,RLHF训练容易导致"sycophancy"(谄媚性)——模型倾向于提供用户"想听的"冗长详尽回答,而非用户"需要的"精确回答。长度偏好(length bias)是奖励模型的已知缺陷之一,多项研究表明标注员在评估时会系统性地偏好更长的回答,这个偏差通过训练传递给了模型本身。
这个观察对提示工程有实际启发:模型的"服从边界"和"自主发挥"之间存在张力,而不同模型在这条边界上的表现差异巨大。
对开发者的实际意义
目标不是更短,而是信息密度更高
作者反复强调:LELP-S+ 的目标不是"更短的答案",而是"每 Token 承载更多信息"。这个定位区分了它和粗暴截断输出的做法。在长文档处理、RAG 上下文注入、多轮对话等场景中,信息密度的提升可以直接转化为:
- 更低的 API 调用成本
- 更充分利用有限的上下文窗口
- 更快的响应速度(Token生成数量直接影响延迟——以当前模型约50-100 Token/秒的生成速度计算,减少44%的输出Token意味着响应时间从10秒降至约5.6秒,这在交互式应用中的用户体验差异是巨大的。需要说明的是,这里的延迟优化主要体现在首次响应后的流式输出时间——对于使用流式传输的应用,用户感知的"等待时间"由首Token延迟TTFT决定,但"阅读等待时间"即完整答案呈现的总时长则与输出Token数成正比。在非流式调用场景,如批处理管道或Agent工具调用链中,总Token数对端到端延迟的影响更为直接。)
其中,RAG(Retrieval-Augmented Generation,检索增强生成)是当前企业级大模型应用的主流架构,被广泛应用于客服系统、内部知识库问答、法律文档分析等场景。它通过先从向量数据库(如Pinecone、Weaviate、Milvus)检索与用户查询语义相似的文档片段,再将这些片段作为上下文注入到模型的提示词中来增强回答质量。其核心工作流为:用户提问 → 查询向量化 → 从向量数据库中检索Top-K相似文档块 → 将检索结果与原始问题拼接为提示词 → 模型基于提供的上下文生成回答。在这种架构下,上下文窗口的每一个Token都极为珍贵——典型的RAG系统需要在有限的上下文中塞入系统提示词(约200-500 Token)、检索到的多个文档片段(通常3-10个片段,每个500-1000 Token)、对话历史(多轮对话可能累积数千Token)和用户当前问题,各部分竞争Token预算。注入的参考文档越精炼,就能塞入更多相关信息源,模型综合多方信息得出准确答案的概率就越高。LELP-S+的信息密度优化理念与RAG场景天然契合,因为它不仅优化了模型的输出端,其设计思路同样可以指导输入端的文档预处理策略——在文档被切片存入向量数据库之前,先用LELP-S+风格的压缩去除冗余,可以在相同的Token预算内注入更多有效知识。这种"双向优化"的思路在实际工程中已有应用先例:一些RAG系统在检索后、注入前会对文档片段进行摘要压缩(如使用LLMLingua等工具),LELP-S+的原则可以为这类预处理步骤提供更系统化的指导框架。
提示工程的反向约束思路
这个项目也提醒我们,提示工程不仅仅是"让模型做什么",还包括"让模型不做什么"。删除冗余、约束发散、强制信息增量——这些反向约束往往比正向指令更能提升实际使用体验。
从更广的视角来看,这种"反向约束"思路与软件工程中的"约束编程"(Constraint Programming)有异曲同工之妙:通过定义边界条件和不允许的行为,间接引导系统产出符合期望的结果。在提示工程的实践中,"不要添加未被要求的内容"、"不要使用过渡性短语"、"每个句子必须引入新信息"这类负面指令和约束条件,往往比"请简洁回答"这种模糊的正面指令更有效,因为它们提供了模型可以明确执行的具体约束。认知心理学的研究同样支持这一点:人类在执行指令时,具体的禁止性规则("不要做X")比抽象的目标描述("做得好一点")更容易准确执行,大语言模型在这方面表现出类似的特性。OpenAI的提示工程最佳实践文档也明确建议使用具体的负面约束而非模糊的正面期望来控制输出质量。从技术实现角度理解,这种差异可能与模型的解码机制有关——"请简洁回答"需要模型在每一步生成时都判断"当前是否足够简洁",这是一个模糊的、全局性的约束;而"不要使用however、moreover、additionally等过渡词"则提供了一个清晰的、逐Token可验证的约束,模型在生成每个词时都能即时判断是否违反规则。
LELP-S+ 现已并入 Sir Shortoken 开源项目(github.com/shouvik12/sir-shortoken),感兴趣的开发者可以直接尝试将其集成到自己的工作流中。
小结
LELP-S+ 是一个思路清晰的Token优化工具,它把"每Token信息密度"这个常被忽视的维度显性化,并通过跨模型实测揭示了各家大模型在"压缩纪律"上的真实差异。对于成本敏感的生产环境,这类优化累积起来可能带来实实在在的收益。从更宏观的角度看,随着大模型应用从实验走向规模化部署,Token效率优化正在成为与模型精度同等重要的工程考量——它不仅关乎成本,也关乎延迟、用户体验和系统的可扩展性。LELP-S+所代表的"信息密度优先"思维方式,很可能成为下一阶段提示工程实践的重要范式之一。
相关推荐

Qwen3 27B本地部署实测:16G显存跑出前沿模型级编程效果
海外博主系统实测Qwen3 27B量化版本地部署表现,覆盖256K长上下文记忆、HumanEval编程、MCP工具链等维度。RTX A2000仅16GB显存即可运行,代码生成质量超越同级所有本地模型。

Claude Code Hooks完全指南:自动化机制原理与实战配置
深入解析Claude Code Hooks的三层架构(Event、Matcher、Handler),涵盖10个核心Event分类、5种Handler类型,附带敏感资料检查与AI味检测两个实战案例,帮你建立确定性的自动化工作流程。

AI编程实战:先做MVP再写代码的正确开发姿势
AI编程高手把80%时间花在需求沟通和方案设计上。本文基于真实CAD图纸自动化项目,详解MVP优先策略、模型配比省钱技巧、双工具分工方法,帮你掌握AI时代大型项目的正确开发流程。