待验证50% 置信基准精确时间
官方跑分显示 Qwen3.6 27B 稠密模型采用 NVFP4 量化时,单并发可达 202 token/s,双并发 400 token/s,8 并发冲到 1147 token/s
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/16
首次发现
有效期至:2026/12/15
来源
涉及实体
相关事实
待验证claude-code-local 宣称支持 Qwen 3.5 122B(约 65 tokens/秒)、Llama 3.3 70B 和 Gemma 4 31B 等模型75% 相似待验证主流开源多模态模型上下文长度通常在4K到32K之间,LLaVA-1.5为4096 token,Qwen-VL为8192 token,InternVL2扩展到32K75% 相似待验证典型7B模型(32层、32头、128维度)在FP16精度下处理2048 token序列、批大小8时,KV Cache约消耗4GB显存75% 相似待验证据 FreeToken 技术论文,在 RTX 5090 系统上 Qwen3-235B-A3B 可达 77-83 tokens/s,DeepSeek 相关模型在 agent 轨迹上可达 22-25 tokens/s73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/924349API
curl https://kongchang.com/api/v1/knowledge/claims/924349MCP
get_claim(id=924349)