[KongchangAI]
ProductRTX 3090 Ti

RTX 3090

NVIDIA消费级旗舰显卡,搭载24GB GDDR6X显存,适用于AI训练和推理任务

Core Facts

Timeline (last 90 days)

Oct 7

2B参数级别的模型可运行于单张消费级GPU(如RTX 3090/4090,显存24GB)甚至部分CPU推理场景

Unverified50%
Oct 5

长文首字延迟是24GB内存容量不足导致的硬伤,加大内存往往比升级显卡更能缓解长文首字延迟

Unverified50%
Oct 5

在RTX 3090(24GB显存)加24GB内存的配置上运行125B参数的Flash Next模型,生成速度稳定在每秒9到10个token,短文峰值可达18

Unverified50%
Oct 5

在2944 token输入、1024 token输出条件下,普通模式达到每秒29.9 token,开启MTP2后提升到48.4 token/s

Unverified50%
Oct 5

UP主建议日常使用控制在6.4万token左右,官方标称26万token不代表一张24GB显卡能舒服跑满

Unverified50%
Oct 5

长上下文测试中普通模式最终完成到11.4万token,MTP2完成到8.1万token,到9.8万token时未能完成

Unverified50%
Oct 5

官方估计24GB显卡约能跑100~140 tokens/秒

Unverified60%
Oct 5

旧款RTX 3090因24GB显存能容纳更多专家,预估运行Strata性能反而达100到140 Token/秒,说明此工作负载下显存容量胜过纯浮点算力

Unverified50%
Oct 5

课程演示的硬件是一台配备4张3090显卡的Linux服务器

Unverified50%
Oct 5

两张二手RTX 3090可凑出48GB显存,NVIDIA显卡拥有大多数AI工具优先适配的CUDA生态

Unverified50%

23 more timeline events

All Facts (20)

Verified

QLoRA引入4-bit量化技术,使得在单张24GB显存的RTX 3090/4090上微调650亿参数级别的模型成为可能

90%
Verified

NVLink 4.0的双向带宽高达900GB/s,而传统PCIe总线带宽约为64GB/s

65%
Verified

该工作流在RTX 3060 6GB显存加16GB内存配置下即可运行

65%
Verified

RTX 4090拥有24GB显存,在加载27B Q4模型后通常还有足够空间支持3-4万Token的上下文

65%
Verified

32B参数规模的模型在量化后通常可以压缩到约16-20GB显存占用,一张NVIDIA RTX 4090(24GB显存)就能运行

65%
Unverified

硬盘容量估算公式:单路码流(Mbps)÷8×3600×24÷1024÷1024(GB/天)×路数×存储天数。8路400万像素录30天约需6TB,选购时按此计算所需容量并预留20%余量

88%
Unverified

Unsloth通常需要配合NVIDIA GPU使用,推荐RTX 3090/4090或更高

80%
Unverified

MiniMind-V可以在普通消费级GPU(如RTX 3090)上完成全流程训练

80%
Unverified

GPT-OSS 20B在RTX 3090上可达约40 Token/s的生成速度,在RTX 5090上能达到200 Token/s

75%
Unverified

官方估计24GB显卡约能跑100~140 tokens/秒

60%
Unverified

2B参数级别的模型可运行于单张消费级GPU(如RTX 3090/4090,显存24GB)甚至部分CPU推理场景

50%
Unverified

长文首字延迟是24GB内存容量不足导致的硬伤,加大内存往往比升级显卡更能缓解长文首字延迟

50%
Unverified

在RTX 3090(24GB显存)加24GB内存的配置上运行125B参数的Flash Next模型,生成速度稳定在每秒9到10个token,短文峰值可达18

50%
Unverified

在2944 token输入、1024 token输出条件下,普通模式达到每秒29.9 token,开启MTP2后提升到48.4 token/s

50%
Unverified

UP主建议日常使用控制在6.4万token左右,官方标称26万token不代表一张24GB显卡能舒服跑满

50%
Unverified

长上下文测试中普通模式最终完成到11.4万token,MTP2完成到8.1万token,到9.8万token时未能完成

50%
Unverified

旧款RTX 3090因24GB显存能容纳更多专家,预估运行Strata性能反而达100到140 Token/秒,说明此工作负载下显存容量胜过纯浮点算力

50%
Unverified

课程演示的硬件是一台配备4张3090显卡的Linux服务器

50%
Unverified

两张二手RTX 3090可凑出48GB显存,NVIDIA显卡拥有大多数AI工具优先适配的CUDA生态

50%
Unverified

16块3090在推理时的功耗高达约6kW,与电烤箱同时运行会导致家庭电路保险丝跳闸

50%

Source Articles