[控场AI]
产品RTX 3090 Ti

RTX 3090

NVIDIA消费级旗舰显卡,搭载24GB GDDR6X显存,适用于AI训练和推理任务

核心事实

时间轴 (近 90 天)

10月5日

在RTX 3090(24GB显存)加24GB内存的配置上运行125B参数的Flash Next模型,生成速度稳定在每秒9到10个token,短文峰值可达18

待验证50%
10月5日

长文首字延迟是24GB内存容量不足导致的硬伤,加大内存往往比升级显卡更能缓解长文首字延迟

待验证50%
10月5日

UP主建议日常使用控制在6.4万token左右,官方标称26万token不代表一张24GB显卡能舒服跑满

待验证50%
10月5日

长上下文测试中普通模式最终完成到11.4万token,MTP2完成到8.1万token,到9.8万token时未能完成

待验证50%
10月5日

在2944 token输入、1024 token输出条件下,普通模式达到每秒29.9 token,开启MTP2后提升到48.4 token/s

待验证50%
10月5日

官方估计24GB显卡约能跑100~140 tokens/秒

待验证60%
10月5日

旧款RTX 3090因24GB显存能容纳更多专家,预估运行Strata性能反而达100到140 Token/秒,说明此工作负载下显存容量胜过纯浮点算力

待验证50%
10月5日

课程演示的硬件是一台配备4张3090显卡的Linux服务器

待验证50%
10月5日

两张二手RTX 3090可凑出48GB显存,NVIDIA显卡拥有大多数AI工具优先适配的CUDA生态

待验证50%
10月4日

16块3090在推理时的功耗高达约6kW,与电烤箱同时运行会导致家庭电路保险丝跳闸

待验证50%

还有 23 条时间轴事件

全部知识事实 (20)

已验证

QLoRA引入4-bit量化技术,使得在单张24GB显存的RTX 3090/4090上微调650亿参数级别的模型成为可能

90%
已验证

NVLink 4.0的双向带宽高达900GB/s,而传统PCIe总线带宽约为64GB/s

65%
已验证

该工作流在RTX 3060 6GB显存加16GB内存配置下即可运行

65%
已验证

RTX 4090拥有24GB显存,在加载27B Q4模型后通常还有足够空间支持3-4万Token的上下文

65%
已验证

32B参数规模的模型在量化后通常可以压缩到约16-20GB显存占用,一张NVIDIA RTX 4090(24GB显存)就能运行

65%
待验证

硬盘容量估算公式:单路码流(Mbps)÷8×3600×24÷1024÷1024(GB/天)×路数×存储天数。8路400万像素录30天约需6TB,选购时按此计算所需容量并预留20%余量

88%
待验证

Unsloth通常需要配合NVIDIA GPU使用,推荐RTX 3090/4090或更高

80%
待验证

MiniMind-V可以在普通消费级GPU(如RTX 3090)上完成全流程训练

80%
待验证

GPT-OSS 20B在RTX 3090上可达约40 Token/s的生成速度,在RTX 5090上能达到200 Token/s

75%
待验证

官方估计24GB显卡约能跑100~140 tokens/秒

60%
待验证

长文首字延迟是24GB内存容量不足导致的硬伤,加大内存往往比升级显卡更能缓解长文首字延迟

50%
待验证

在RTX 3090(24GB显存)加24GB内存的配置上运行125B参数的Flash Next模型,生成速度稳定在每秒9到10个token,短文峰值可达18

50%
待验证

在2944 token输入、1024 token输出条件下,普通模式达到每秒29.9 token,开启MTP2后提升到48.4 token/s

50%
待验证

UP主建议日常使用控制在6.4万token左右,官方标称26万token不代表一张24GB显卡能舒服跑满

50%
待验证

长上下文测试中普通模式最终完成到11.4万token,MTP2完成到8.1万token,到9.8万token时未能完成

50%
待验证

旧款RTX 3090因24GB显存能容纳更多专家,预估运行Strata性能反而达100到140 Token/秒,说明此工作负载下显存容量胜过纯浮点算力

50%
待验证

课程演示的硬件是一台配备4张3090显卡的Linux服务器

50%
待验证

两张二手RTX 3090可凑出48GB显存,NVIDIA显卡拥有大多数AI工具优先适配的CUDA生态

50%
待验证

16块3090在推理时的功耗高达约6kW,与电烤箱同时运行会导致家庭电路保险丝跳闸

50%
待验证

用户使用16块3090分布在基于联想P620的多个节点上,通过100Gbit网络互联,能运行MiniMax M2、Qwen 235B和Qwen 397B

50%

来源文章