[控场AI]

#显存优化

共 7 篇相关文章

百万级上下文窗口的工程挑战:VRAM碎片与动态KV缓存
·5 分钟

百万级上下文窗口的工程挑战:VRAM碎片与动态KV缓存

百万级上下文窗口对大模型推理提出严峻的显存挑战。本文解析VRAM碎片化与动态KV缓存两大工程难题,探讨分页式缓存、显存池、分层卸载等架构应对策略。

阅读全文 →
Kijai更新MiniMax-H3 VAE:显存占用更低,画质不打折
·5 分钟

Kijai更新MiniMax-H3 VAE:显存占用更低,画质不打折

Kijai更新了MiniMax-H3(MH3)的int8量化VAE,实测在RTX 3060 12GB上显存占用更低且画质不退化,可生成1MP/10秒和0.7MP/15秒视频。本文解读更新要点、实测数据与对消费级显卡用户的意义。

阅读全文 →
KV Cache为何撑爆显存?大模型推理优化全解析
·5 分钟

KV Cache为何撑爆显存?大模型推理优化全解析

长对话导致显存爆炸?本文深入解析KV Cache如何存储历史信息加速推理,为何会撑爆显存,以及PagedAttention、FlashAttention、KV量化等主流优化方案,附大模型面试满分回答模板。

阅读全文 →
双卡RTX4090跑通Qwen3-Next:8并发满血长上下文实测
·7 分钟

双卡RTX4090跑通Qwen3-Next:8并发满血长上下文实测

用两张48GB RTX 4090跑通Qwen3-Next的8并发长上下文推理,通过KV热缓存卸载省下约84%显存。实测涵盖显存账本、快路径吞吐、真实终端记录与多代理任务交付,附完整数据与免责说明。

阅读全文 →
大模型命名规则解析:参数量、量化格式与显存需求速查
教程攻略
·9 分钟

大模型命名规则解析:参数量、量化格式与显存需求速查

系统拆解大模型命名规则,解释32B参数量、AWQ/GGUF量化格式的含义,提供4-bit量化显存估算公式与速查表,涵盖MOE模型显存陷阱、IMatrix量化推荐及按显存档位的模型选择建议。

阅读全文 →
Unsloth:显存优化80%,本地微调大模型的最佳开源工具
产品体验
·7 分钟

Unsloth:显存优化80%,本地微调大模型的最佳开源工具

Unsloth是GitHub 63K+ Star的开源大模型训练工具,支持Gemma 4、Qwen 3、DeepSeek等主流模型。通过显存优化降低50%-80%显存占用,让RTX 4090也能微调7B模型,提供Web UI一键训练。

阅读全文 →