待验证50% 置信基准精确时间
据 FreeToken 技术论文,在 RTX 5090 系统上 Qwen3-235B-A3B 可达 77-83 tokens/s,DeepSeek 相关模型在 agent 轨迹上可达 22-25 tokens/s
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/11
首次发现
有效期至:2026/12/10
来源
涉及实体
相关事实
待验证在显存充足、模型完整驻留GPU时,RTX 4090跑Q4量化的27B模型通常可达15~30 tokens/s;触发CPU卸载后速度可能骤降至1~2 tokens/s甚至更低76% 相似待验证该模型在单张RTX 5090上使用NVFP4方案可达约206 tokens/秒71% 相似待验证Qwen3 27B拥有64层网络、5120隐藏维度,原生上下文长度达262144 tokens70% 相似待验证Qwen3 在训练时支持长达 128K tokens 的上下文68% 相似待验证主流开源多模态模型上下文长度通常在4K到32K之间,LLaVA-1.5为4096 token,Qwen-VL为8192 token,InternVL2扩展到32K68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/898238API
curl https://kongchang.com/api/v1/knowledge/claims/898238MCP
get_claim(id=898238)