待验证50% 置信基准精确时间
本地推理的首 token 延迟通常在 100-500ms,而云端 API 在网络良好时需要 500-2000ms 的首 token 延迟
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/8/13
首次发现
有效期至:2026/11/11
来源
相关事实
待验证Agora的SD-RTN覆盖全球200+数据中心,端到端延迟通常控制在400ms以内69% 相似已验证当前主流AI编程工具存在上下文窗口限制,通常为8K到200K tokens不等66% 相似待验证在4×RTX 3090 SXM4配置下,GLM-5.2量化版本的Token生成速度约为6.3-6.8 tokens/秒,提示评估速度约为10.6 tokens/秒64% 相似待验证本地运行的开源LLM模型通常只有4K到32K tokens的上下文容量,受硬件内存限制62% 相似待验证传统数据库即使是内存数据库,通常也需要微秒级别的查询时间,Redis等方案仍需经过网络栈(约50-200微秒)61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/742231API
curl https://kongchang.com/api/v1/knowledge/claims/742231MCP
get_claim(id=742231)