待验证50% 置信基准精确时间
260 亿参数的 Gemma(MoE)实测速度接近 31 Token/秒,比 GPT-OSS 20B 快约三分之一
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/19
首次发现
有效期至:2026/12/18
来源
涉及实体
相关事实
已验证Gemma 4的26B MOE模型采用混合专家架构,拥有260亿总参数但任意时刻仅约40亿参数处于激活状态65% 相似待验证Muse Glimmer 30B在RTX 5090上报告可达每秒74.9个token,评测者在RTX 3090上运行全精度版本观察到约60-65 token/秒65% 相似已验证M4芯片的Neural Engine峰值算力达到38 TOPS(每秒38万亿次运算)63% 相似待验证经过精心量化的4-bit模型与FP16原始模型之间的性能差距通常在1-3个百分点以内63% 相似待验证Gemma 4 26B MOE版本总参数量为25.2B,但推理时仅激活约3.8B参数63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/933721API
curl https://kongchang.com/api/v1/knowledge/claims/933721MCP
get_claim(id=933721)