#模型压缩
共 6 篇相关文章

·5 分钟
潜空间蒸馏压缩流式神经音频编码器:苹果端侧语音的内存优化之道
苹果研究通过潜空间蒸馏压缩流式神经音频编码器,解决端侧听写中 tokenizer 与稀疏激活基础模型争夺 DRAM 内存的问题,在降低功耗与延迟的同时保持语音识别质量。
阅读全文 →

·5 分钟
AdaMem:让RAG按相关性智能分配记忆token的软压缩新方法
AdaMem 是一种相关性引导的 RAG 软压缩框架,通过查询相关的记忆token动态分配,让高相关段落获得更多记忆预算。在六个问答基准上超越均匀分配基线,64倍压缩下相对增益最高达19.7%,推理延迟降低4倍。
阅读全文 →

·4 分钟
Bonsai 2 27B:9倍压缩下的近无损模型探索
Bonsai 2 27B 声称在近无损前提下将 27B 大模型压缩至原体积的九分之一。本文解析其压缩技术路径、社区反应与实际部署价值,并给出验证建议。
阅读全文 →

·4 分钟
突破1.58比特极限:三元LLM如何逼近信息论边界
三元大模型(ternary LLM)的1.58-bit并非真正下限。本文解析为何利用权重稀疏分布与熵编码可以突破这一信息论壁垒,以及其对低比特量化与端侧部署的工程意义。
阅读全文 →

·5 分钟
用Fisher信息距离实现神经网络最优剪枝:一种几何视角
arXiv新论文提出基于Fisher信息测地线距离的神经网络最优剪枝方法,将剪枝视为模型空间中的几何位移。该方法在全连接网络与视觉Transformer上全面超越幅值剪枝和局部Fisher基线,兼顾精度与计算效率。
阅读全文 →
前沿研究·9 分钟
SVDQuant:4-bit量化让扩散模型在消费级GPU上高效运行
SVDQuant是ICLR 2025 Spotlight论文,通过低秩分解吸收异常值实现扩散模型4-bit量化,显存降低75%。开源项目Nunchaku获3800+ Stars,让FLUX等大型图像生成模型在RTX 4060等中端显卡上流畅推理。
阅读全文 →