待验证50% 置信基准精确时间
Pythia前5层加RWKV剩余27层的组合将Transformer的KV缓存减少了84.4%,准确率与单独使用RWKV相比没有显著差异
1
来源数
50%
置信度
长期有效
时效性
2026/10/1
首次发现
来源
涉及实体
相关事实
待验证将FP32权重降至INT8后,典型Transformer模型基准测试分数下降通常不超过1%,推理速度提升2至4倍,内存占用减少75%75% 相似待验证批大小为1的Transformer推理算术强度往往低于10 FLOP/Byte,意味着GPU算力利用率不足理论峰值的5%67% 相似待验证Conformer在LibriSpeech基准上相较于纯Transformer架构实现了约15%的相对错误率降低64% 相似待验证MLA将GLM每token的KV缓存从32768个数压缩到576个数,降幅约98%64% 相似待验证基于Transformer架构的现代审核模型相比传统关键词过滤,误报率(False Positive Rate)可降低60%以上64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/964130API
curl https://kongchang.com/api/v1/knowledge/claims/964130MCP
get_claim(id=964130)