待验证50% 置信事实精确时间
GLM-5.3使用FP8 KV缓存支持完整的1M上下文
1
来源数
50%
置信度
长期有效
时效性
2026/9/12
首次发现
来源
涉及实体
相关事实
待验证GLM-5.3的MLX微调结果支持导出为GGUF格式70% 相似待验证GLM-OCR经INT8量化后可在单张消费级GPU(如RTX 3060/4060,12GB显存)乃至部分移动端NPU上运行推理67% 相似待验证GGUF is the default quantization format used by Ollama, optimized specifically for CPU and hybrid inference scenarios.66% 相似待验证KV Cache是vLLM、TensorRT-LLM、SGLang等主流推理引擎的标配优化65% 相似已验证llama.cpp项目将GGUF量化格式推向主流,支持从Q2_K到Q8_0等多种精度等级64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/912425API
curl https://kongchang.com/api/v1/knowledge/claims/912425MCP
get_claim(id=912425)