Unverified50% confidenceFactExact time
语音Agent典型端到端延迟预算约为STT finalization 100-300ms + LLM TTFT 200-500ms + TTS TTFA 150-250ms + 网络开销50-100ms,总计500-1150ms
1
Sources
50%
Confidence
Long-term
Relevance
8/12/2026
First Seen
Sources
Related Claims
UnverifiedGPT-4级别模型的首Token延迟(TTFT)可达500-2000ms,而Llama 3.1 8B等小模型TTFT可低至100-300ms74% similarUnverifiedGPT-OSS 20B在RTX 3090上可达约40 Token/s的生成速度,在RTX 5090上能达到200 Token/s67% similarUnverified原生 PCIe 版本的 16G V100 TDP 约为 250W,而 SXM 版本的 TDP 为 300W65% similarUnverifiedWiFi6面板AP实际单频吞吐通常500-800Mbps,标称的1800M/3000M是双频理论叠加值,单设备连接享受不到叠加速率65% similarUnverifiedRTX 4090的功耗约为300W65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/735048API
curl https://kongchang.com/api/v1/knowledge/claims/735048MCP
get_claim(id=735048)