Anifer
由独立开发者用C++和CUDA编写的开源本地大模型推理引擎,专注于针对少数特定模型和硬件做极致性能优化,以极高推理速度为核心卖点
Timeline (last 90 days)
Anifer 是一个在 GitHub 上开源、由独立开发者用 C++ 和 CUDA 编写的推理引擎,专注于为少数模型和显卡榨出极致性能
Anifer 官方项目最初只支持单张 RTX 5090,且注册的官方模型只有五个,聚焦于 Qwen3.8 27B、Qwen3.6 27B 以及 Qwen3.6 35B 的 MoE 模型
CUDA Kernel 的性能极度依赖对齐,矩阵维度、线程块大小、内存访问模式稍有不匹配吞吐量就会大幅下滑,Anifer 因只服务固定模型形状和显卡架构可将每个 Kernel 写成恰好最优形态
Anifer 的并发上限是 8
官方跑分显示 Qwen3.6 27B 稠密模型采用 NVFP4 量化时,单并发可达 202 token/s,双并发 400 token/s,8 并发冲到 1147 token/s
官方跑分显示 Qwen3.6 35B MoE 模型在 8 并发时可达 1.38k token/s
Anifer 支持 MTP(多 Token 预测)投机解码,接收率在 46%~49% 之间,另支持 D Flash 投机解码但显存占用更高
Anifer 使用名为 .enifer 的单文件格式,把模型权重、chat template 及多模态内容打包成一个文件,无法直接加载普通 GGUF 文件
Anifer 官方项目仅支持 RTX 5090 及 Linux 或 WSL/Docker 系统,但社区分支已支持 4090、RTX 2080Ti 等 20 系显卡并有 Windows 原生版本
Anifer 的核心取舍是牺牲通用性换取极致速度,对手握 5090 只想快速跑主流 Qwen 模型的用户是近乎完美的解决方案
All Facts (10)
Anifer 是一个在 GitHub 上开源、由独立开发者用 C++ 和 CUDA 编写的推理引擎,专注于为少数模型和显卡榨出极致性能
50%UnverifiedAnifer 官方项目最初只支持单张 RTX 5090,且注册的官方模型只有五个,聚焦于 Qwen3.8 27B、Qwen3.6 27B 以及 Qwen3.6 35B 的 MoE 模型
50%UnverifiedCUDA Kernel 的性能极度依赖对齐,矩阵维度、线程块大小、内存访问模式稍有不匹配吞吐量就会大幅下滑,Anifer 因只服务固定模型形状和显卡架构可将每个 Kernel 写成恰好最优形态
50%UnverifiedAnifer 的并发上限是 8
50%Unverified官方跑分显示 Qwen3.6 27B 稠密模型采用 NVFP4 量化时,单并发可达 202 token/s,双并发 400 token/s,8 并发冲到 1147 token/s
50%Unverified官方跑分显示 Qwen3.6 35B MoE 模型在 8 并发时可达 1.38k token/s
50%UnverifiedAnifer 支持 MTP(多 Token 预测)投机解码,接收率在 46%~49% 之间,另支持 D Flash 投机解码但显存占用更高
50%UnverifiedAnifer 使用名为 .enifer 的单文件格式,把模型权重、chat template 及多模态内容打包成一个文件,无法直接加载普通 GGUF 文件
50%UnverifiedAnifer 官方项目仅支持 RTX 5090 及 Linux 或 WSL/Docker 系统,但社区分支已支持 4090、RTX 2080Ti 等 20 系显卡并有 Windows 原生版本
50%UnverifiedAnifer 的核心取舍是牺牲通用性换取极致速度,对手握 5090 只想快速跑主流 Qwen 模型的用户是近乎完美的解决方案
50%