Unverified50% confidenceBenchmarkExact time
IndexShare 技术让每四个稀疏注意力层复用同一个索引器,在 1M 上下文长度下将每 token 的 FLOPs 降低 2.9 倍
1
Sources
50%
Confidence
Long-term
Relevance
8/26/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedFST相比传统HashMap或TreeMap存储词典,内存占用通常可减少10-50倍60% similarUnverifiedAfter Gemma 4 QAT optimization, the minimum memory footprint can be reduced to 1GB59% similarUnverifiedIQ4_XS与Q4_K_M速度几乎一致,但IQ4_XS体积更小可节省约2GB空间用于扩展上下文,因此性价比更高58% similarUnverified占用率(occupancy)衡量实际活跃warp数与SM支持的最大warp数之比,受每个线程使用的寄存器数量、每个线程块的共享内存大小和线程块配置方式影响58% similarUnverified随着模型上下文窗口从4K到128K再到未来可能的数百万token持续扩大,记忆管理和状态管理的实际效果差距会逐渐缩小57% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/805112API
curl https://kongchang.com/api/v1/knowledge/claims/805112MCP
get_claim(id=805112)