共 2 篇相关文章
llama.cpp 提交 PR #29887,为存放在主机内存中的 MoE 专家权重添加 GPU 缓存,有望为显存不足的用户带来显著推理提速。解析其技术思路与适用场景。
Naive-N0.5-Flash开源模型实测解析:309B MoE、100万上下文、2000 token/s,宣称由AI训练。实测发现其基于小米MiMo-V2.5二次训练,技术均为成熟开源方案,「AI造AI」更像营销噱头。