共 7 篇相关文章

基于413组配置的KV缓存量化基准测试,对比KVarN方差归一化与传统量化方案在Qwen和Gemma模型上的表现。kvarn6+精度尾部以更低显存超越q8_0,附完整推荐阶梯与实践建议。

AMD收购芯片初创公司Taalas,将AI模型直接固化到硅片电路中,实现极致推理能效。本文解析这一技术路线的原理、代价与行业影响,探讨AMD在AI推理赛道的差异化布局。

深入解析哈达玛变换如何通过仅使用加法和减法替代矩阵乘法,实现深度学习模型轻量化。涵盖快速哈达玛变换原理、边缘设备推理加速、大模型超低比特量化等应用场景与技术权衡。

SiliconLLM项目从零构建CPU原生LLM架构,融合选择性SSM、三值量化(1.58-bit)LUT MLP与细粒度MoE,围绕L3缓存带宽悬崖协同优化。实测三值内核较fp32加速4-5倍,探索消费级CPU本地推理的可行路径。

ComfyUI-INT4-Fast自定义节点正式支持INT4量化推理,RTX 3060(6GB显存)实测17秒生成1024×1024图像。逐层混合精度路由兼顾速度与画质,低显存用户也能运行Krea2 Turbo等Flux系模型。

本地大模型工具Ollama完成6500万美元B轮融资,累计融资8800万美元。900万开发者在用,85%财富500强企业内部已部署。本文深度解析企业青睐本地大模型的核心原因:数据合规、Agent降本、开源生态三大驱动力。