[控场AI]

#模型压缩

共 6 篇相关文章

潜空间蒸馏压缩流式神经音频编码器:苹果端侧语音的内存优化之道
·5 分钟

潜空间蒸馏压缩流式神经音频编码器:苹果端侧语音的内存优化之道

苹果研究通过潜空间蒸馏压缩流式神经音频编码器,解决端侧听写中 tokenizer 与稀疏激活基础模型争夺 DRAM 内存的问题,在降低功耗与延迟的同时保持语音识别质量。

阅读全文 →
AdaMem:让RAG按相关性智能分配记忆token的软压缩新方法
·5 分钟

AdaMem:让RAG按相关性智能分配记忆token的软压缩新方法

AdaMem 是一种相关性引导的 RAG 软压缩框架,通过查询相关的记忆token动态分配,让高相关段落获得更多记忆预算。在六个问答基准上超越均匀分配基线,64倍压缩下相对增益最高达19.7%,推理延迟降低4倍。

阅读全文 →
Bonsai 2 27B:9倍压缩下的近无损模型探索
·4 分钟

Bonsai 2 27B:9倍压缩下的近无损模型探索

Bonsai 2 27B 声称在近无损前提下将 27B 大模型压缩至原体积的九分之一。本文解析其压缩技术路径、社区反应与实际部署价值,并给出验证建议。

阅读全文 →
突破1.58比特极限:三元LLM如何逼近信息论边界
·4 分钟

突破1.58比特极限:三元LLM如何逼近信息论边界

三元大模型(ternary LLM)的1.58-bit并非真正下限。本文解析为何利用权重稀疏分布与熵编码可以突破这一信息论壁垒,以及其对低比特量化与端侧部署的工程意义。

阅读全文 →
用Fisher信息距离实现神经网络最优剪枝:一种几何视角
·5 分钟

用Fisher信息距离实现神经网络最优剪枝:一种几何视角

arXiv新论文提出基于Fisher信息测地线距离的神经网络最优剪枝方法,将剪枝视为模型空间中的几何位移。该方法在全连接网络与视觉Transformer上全面超越幅值剪枝和局部Fisher基线,兼顾精度与计算效率。

阅读全文 →
SVDQuant:4-bit量化让扩散模型在消费级GPU上高效运行
前沿研究
·9 分钟

SVDQuant:4-bit量化让扩散模型在消费级GPU上高效运行

SVDQuant是ICLR 2025 Spotlight论文,通过低秩分解吸收异常值实现扩散模型4-bit量化,显存降低75%。开源项目Nunchaku获3800+ Stars,让FLUX等大型图像生成模型在RTX 4060等中端显卡上流畅推理。

阅读全文 →