待验证50% 置信基准精确时间
在6张RTX 5090上Colibri实测速度达9.0-9.2 token/s,在25GB开发机上从NVMe流式读取速度为0.05-0.1 token/s
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/24
首次发现
有效期至:2026/12/23
来源
涉及实体
相关事实
待验证采用RTL9210B主控,实测持续读写速率上限约1000MB/s,对于追求NVMe全速(如2000MB/s以上)传输的用户来说瓶颈明显,双协议的通用性是以牺牲NVMe极限速度为代价的73% 相似待验证在配备96GB显存的M2 Max上以1-bit精度运行时,简单任务生成速度稳定在约28-30 tokens/秒73% 相似待验证Ling 3.0 Tiny在M4 Pro的MacBook上推理速度约为每秒86-90 tokens,在8K上下文下峰值内存约8.34 GiB72% 相似待验证4-5 token/秒的速度对于8GB显卡的实际使用而言太慢,16GB显卡可提升到12-14 token/秒进入实际可用范围72% 相似待验证Gemma量化模型在高性能笔记本电脑上Token生成速度可达每秒20-50个,纯CPU推理约5-15 tokens/秒,INT4量化下NVIDIA RTX 4060/4070可将推理速度提升3-5倍72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/947497API
curl https://kongchang.com/api/v1/knowledge/claims/947497MCP
get_claim(id=947497)