Unverified50% confidenceBenchmarkExact time
在 Qwen3 27B 的 llama.cpp 环境下,R9700 跑出 27.1 tokens/s(达带宽上限约65%),B70 跑出 21.4 tokens/s(约50%出头)
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
10/5/2026
First Seen
Valid until: 1/3/2027
Sources
Related Entities
Related Claims
Unverified官方跑分显示 Qwen3.6 27B 稠密模型采用 NVFP4 量化时,单并发可达 202 token/s,双并发 400 token/s,8 并发冲到 1147 token/s79% similarUnverifiedQwen3 27B拥有64层网络、5120隐藏维度,原生上下文长度达262144 tokens78% similarUnverified据 FreeToken 技术论文,在 RTX 5090 系统上 Qwen3-235B-A3B 可达 77-83 tokens/s,DeepSeek 相关模型在 agent 轨迹上可达 22-25 tokens/s73% similarUnverified在显存充足、模型完整驻留GPU时,RTX 4090跑Q4量化的27B模型通常可达15~30 tokens/s;触发CPU卸载后速度可能骤降至1~2 tokens/s甚至更低73% similarUnverifiedclaude-code-local 宣称支持 Qwen 3.5 122B(约 65 tokens/秒)、Llama 3.3 70B 和 Gemma 4 31B 等模型72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/977977API
curl https://kongchang.com/api/v1/knowledge/claims/977977MCP
get_claim(id=977977)