RTX 3090
NVIDIA消费级旗舰显卡,搭载24GB GDDR6X显存,适用于AI训练和推理任务
Core Facts
Timeline (last 90 days)
2B参数级别的模型可运行于单张消费级GPU(如RTX 3090/4090,显存24GB)甚至部分CPU推理场景
长文首字延迟是24GB内存容量不足导致的硬伤,加大内存往往比升级显卡更能缓解长文首字延迟
在RTX 3090(24GB显存)加24GB内存的配置上运行125B参数的Flash Next模型,生成速度稳定在每秒9到10个token,短文峰值可达18
在2944 token输入、1024 token输出条件下,普通模式达到每秒29.9 token,开启MTP2后提升到48.4 token/s
UP主建议日常使用控制在6.4万token左右,官方标称26万token不代表一张24GB显卡能舒服跑满
长上下文测试中普通模式最终完成到11.4万token,MTP2完成到8.1万token,到9.8万token时未能完成
官方估计24GB显卡约能跑100~140 tokens/秒
旧款RTX 3090因24GB显存能容纳更多专家,预估运行Strata性能反而达100到140 Token/秒,说明此工作负载下显存容量胜过纯浮点算力
课程演示的硬件是一台配备4张3090显卡的Linux服务器
两张二手RTX 3090可凑出48GB显存,NVIDIA显卡拥有大多数AI工具优先适配的CUDA生态
23 more timeline events
All Facts (20)
QLoRA引入4-bit量化技术,使得在单张24GB显存的RTX 3090/4090上微调650亿参数级别的模型成为可能
90%VerifiedNVLink 4.0的双向带宽高达900GB/s,而传统PCIe总线带宽约为64GB/s
65%Verified该工作流在RTX 3060 6GB显存加16GB内存配置下即可运行
65%VerifiedRTX 4090拥有24GB显存,在加载27B Q4模型后通常还有足够空间支持3-4万Token的上下文
65%Verified32B参数规模的模型在量化后通常可以压缩到约16-20GB显存占用,一张NVIDIA RTX 4090(24GB显存)就能运行
65%Unverified硬盘容量估算公式:单路码流(Mbps)÷8×3600×24÷1024÷1024(GB/天)×路数×存储天数。8路400万像素录30天约需6TB,选购时按此计算所需容量并预留20%余量
88%UnverifiedUnsloth通常需要配合NVIDIA GPU使用,推荐RTX 3090/4090或更高
80%UnverifiedMiniMind-V可以在普通消费级GPU(如RTX 3090)上完成全流程训练
80%UnverifiedGPT-OSS 20B在RTX 3090上可达约40 Token/s的生成速度,在RTX 5090上能达到200 Token/s
75%Unverified官方估计24GB显卡约能跑100~140 tokens/秒
60%Unverified2B参数级别的模型可运行于单张消费级GPU(如RTX 3090/4090,显存24GB)甚至部分CPU推理场景
50%Unverified长文首字延迟是24GB内存容量不足导致的硬伤,加大内存往往比升级显卡更能缓解长文首字延迟
50%Unverified在RTX 3090(24GB显存)加24GB内存的配置上运行125B参数的Flash Next模型,生成速度稳定在每秒9到10个token,短文峰值可达18
50%Unverified在2944 token输入、1024 token输出条件下,普通模式达到每秒29.9 token,开启MTP2后提升到48.4 token/s
50%UnverifiedUP主建议日常使用控制在6.4万token左右,官方标称26万token不代表一张24GB显卡能舒服跑满
50%Unverified长上下文测试中普通模式最终完成到11.4万token,MTP2完成到8.1万token,到9.8万token时未能完成
50%Unverified旧款RTX 3090因24GB显存能容纳更多专家,预估运行Strata性能反而达100到140 Token/秒,说明此工作负载下显存容量胜过纯浮点算力
50%Unverified课程演示的硬件是一台配备4张3090显卡的Linux服务器
50%Unverified两张二手RTX 3090可凑出48GB显存,NVIDIA显卡拥有大多数AI工具优先适配的CUDA生态
50%Unverified16块3090在推理时的功耗高达约6kW,与电烤箱同时运行会导致家庭电路保险丝跳闸
50%