待验证50% 置信基准精确时间
IndexShare 技术让每四个稀疏注意力层复用同一个索引器,在 1M 上下文长度下将每 token 的 FLOPs 降低 2.9 倍
1
来源数
50%
置信度
长期有效
时效性
2026/8/26
首次发现
来源
涉及实体
相关事实
待验证FST相比传统HashMap或TreeMap存储词典,内存占用通常可减少10-50倍60% 相似待验证After Gemma 4 QAT optimization, the minimum memory footprint can be reduced to 1GB59% 相似待验证IQ4_XS与Q4_K_M速度几乎一致,但IQ4_XS体积更小可节省约2GB空间用于扩展上下文,因此性价比更高58% 相似待验证占用率(occupancy)衡量实际活跃warp数与SM支持的最大warp数之比,受每个线程使用的寄存器数量、每个线程块的共享内存大小和线程块配置方式影响58% 相似待验证随着模型上下文窗口从4K到128K再到未来可能的数百万token持续扩大,记忆管理和状态管理的实际效果差距会逐渐缩小57% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/805112API
curl https://kongchang.com/api/v1/knowledge/claims/805112MCP
get_claim(id=805112)