待验证50% 置信事实精确时间
35B-A3B混合专家模型总参数35B,每次推理实际激活约30亿参数,适合16GB显存的卡运行
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/15
首次发现
有效期至:2026/10/13
来源
相关事实
已验证一个原本需要60GB显存的30B参数模型,经过量化后能在16GB甚至8GB显存的消费级显卡上运行77% 相似待验证35B模型在FP16精度下需要约70GB显存,远超RTX 5090的32GB容量,因此单卡部署需量化74% 相似待验证INT4 量化模型有望在 8GB 乃至更低显存的显卡上完成原本需要 16GB 或 24GB 显存的模型推理73% 相似待验证LLM推理/训练选卡看显存优先于算力:7B模型微调至少需24GB显存(RTX 4090/A5000),13B需A100 40GB,70B全参数训练需A100 80GB×4或H100集群73% 相似已验证阿里巴巴推出Qwen 3.6 35B A3B,拥有350亿参数的混合专家模型,同一时间只有30亿参数处于激活状态,权重约72GB已在Hugging Face开源70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/518291API
curl https://kongchang.com/api/v1/knowledge/claims/518291MCP
get_claim(id=518291)