Unverified50% confidenceBenchmarkExact time
在4bit量化版本(完全放入32GB显存)测试中,Ollama达240 tokens/s,FreeToken为225 tokens/s,Ollama反而更快
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/11/2026
First Seen
Valid until: 12/10/2026
Sources
Related Entities
Related Claims
Unverified在配备96GB显存的M2 Max上以1-bit精度运行时,简单任务生成速度稳定在约28-30 tokens/秒69% similarUnverified在显存充足、模型完整驻留GPU时,RTX 4090跑Q4量化的27B模型通常可达15~30 tokens/s;触发CPU卸载后速度可能骤降至1~2 tokens/s甚至更低68% similarUnverified测试者用双4090(48GB显存)工作站运行20.7B稠密模型,每秒生成27.6个Token,仅比矮星略快,但参数量小10倍以上67% similarUnverified在单张 32GB 显卡、q4_0 量化场景下,上下文长度从更新前的 82,432 token 增至更新后的 199,680 token67% similarUnverified社区横向对比数据:M2 Ultra约20 token/秒,M3 Ultra 512GB为39.8 token/秒,单张B200为119.7 token/秒,8张RTX Pro 6000约204 token/秒,改装48GB显存RTX 4090定制后端367 token/秒,双H200约375 token/秒67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/897263API
curl https://kongchang.com/api/v1/knowledge/claims/897263MCP
get_claim(id=897263)