[KongchangAI]
Product疾风之狼

Anifer

由独立开发者用C++和CUDA编写的开源本地大模型推理引擎,专注于针对少数特定模型和硬件做极致性能优化,以极高推理速度为核心卖点

Timeline (last 90 days)

Sep 16

Anifer 是一个在 GitHub 上开源、由独立开发者用 C++ 和 CUDA 编写的推理引擎,专注于为少数模型和显卡榨出极致性能

Unverified50%
Sep 16

Anifer 官方项目最初只支持单张 RTX 5090,且注册的官方模型只有五个,聚焦于 Qwen3.8 27B、Qwen3.6 27B 以及 Qwen3.6 35B 的 MoE 模型

Unverified50%
Sep 16

CUDA Kernel 的性能极度依赖对齐,矩阵维度、线程块大小、内存访问模式稍有不匹配吞吐量就会大幅下滑,Anifer 因只服务固定模型形状和显卡架构可将每个 Kernel 写成恰好最优形态

Unverified50%
Sep 16

Anifer 的并发上限是 8

Unverified50%
Sep 16

官方跑分显示 Qwen3.6 27B 稠密模型采用 NVFP4 量化时,单并发可达 202 token/s,双并发 400 token/s,8 并发冲到 1147 token/s

Unverified50%
Sep 16

官方跑分显示 Qwen3.6 35B MoE 模型在 8 并发时可达 1.38k token/s

Unverified50%
Sep 16

Anifer 支持 MTP(多 Token 预测)投机解码,接收率在 46%~49% 之间,另支持 D Flash 投机解码但显存占用更高

Unverified50%
Sep 16

Anifer 使用名为 .enifer 的单文件格式,把模型权重、chat template 及多模态内容打包成一个文件,无法直接加载普通 GGUF 文件

Unverified50%
Sep 16

Anifer 官方项目仅支持 RTX 5090 及 Linux 或 WSL/Docker 系统,但社区分支已支持 4090、RTX 2080Ti 等 20 系显卡并有 Windows 原生版本

Unverified50%
Sep 16

Anifer 的核心取舍是牺牲通用性换取极致速度,对手握 5090 只想快速跑主流 Qwen 模型的用户是近乎完美的解决方案

Unverified50%

All Facts (10)

Unverified

Anifer 是一个在 GitHub 上开源、由独立开发者用 C++ 和 CUDA 编写的推理引擎,专注于为少数模型和显卡榨出极致性能

50%
Unverified

Anifer 官方项目最初只支持单张 RTX 5090,且注册的官方模型只有五个,聚焦于 Qwen3.8 27B、Qwen3.6 27B 以及 Qwen3.6 35B 的 MoE 模型

50%
Unverified

CUDA Kernel 的性能极度依赖对齐,矩阵维度、线程块大小、内存访问模式稍有不匹配吞吐量就会大幅下滑,Anifer 因只服务固定模型形状和显卡架构可将每个 Kernel 写成恰好最优形态

50%
Unverified

Anifer 的并发上限是 8

50%
Unverified

官方跑分显示 Qwen3.6 27B 稠密模型采用 NVFP4 量化时,单并发可达 202 token/s,双并发 400 token/s,8 并发冲到 1147 token/s

50%
Unverified

官方跑分显示 Qwen3.6 35B MoE 模型在 8 并发时可达 1.38k token/s

50%
Unverified

Anifer 支持 MTP(多 Token 预测)投机解码,接收率在 46%~49% 之间,另支持 D Flash 投机解码但显存占用更高

50%
Unverified

Anifer 使用名为 .enifer 的单文件格式,把模型权重、chat template 及多模态内容打包成一个文件,无法直接加载普通 GGUF 文件

50%
Unverified

Anifer 官方项目仅支持 RTX 5090 及 Linux 或 WSL/Docker 系统,但社区分支已支持 4090、RTX 2080Ti 等 20 系显卡并有 Windows 原生版本

50%
Unverified

Anifer 的核心取舍是牺牲通用性换取极致速度,对手握 5090 只想快速跑主流 Qwen 模型的用户是近乎完美的解决方案

50%

Source Articles