RTX 3090
NVIDIA消费级旗舰显卡,搭载24GB GDDR6X显存,适用于AI训练和推理任务
核心事实
时间轴 (近 90 天)
在RTX 3090(24GB显存)加24GB内存的配置上运行125B参数的Flash Next模型,生成速度稳定在每秒9到10个token,短文峰值可达18
长文首字延迟是24GB内存容量不足导致的硬伤,加大内存往往比升级显卡更能缓解长文首字延迟
UP主建议日常使用控制在6.4万token左右,官方标称26万token不代表一张24GB显卡能舒服跑满
长上下文测试中普通模式最终完成到11.4万token,MTP2完成到8.1万token,到9.8万token时未能完成
在2944 token输入、1024 token输出条件下,普通模式达到每秒29.9 token,开启MTP2后提升到48.4 token/s
官方估计24GB显卡约能跑100~140 tokens/秒
旧款RTX 3090因24GB显存能容纳更多专家,预估运行Strata性能反而达100到140 Token/秒,说明此工作负载下显存容量胜过纯浮点算力
课程演示的硬件是一台配备4张3090显卡的Linux服务器
两张二手RTX 3090可凑出48GB显存,NVIDIA显卡拥有大多数AI工具优先适配的CUDA生态
16块3090在推理时的功耗高达约6kW,与电烤箱同时运行会导致家庭电路保险丝跳闸
还有 23 条时间轴事件
全部知识事实 (20)
QLoRA引入4-bit量化技术,使得在单张24GB显存的RTX 3090/4090上微调650亿参数级别的模型成为可能
90%已验证NVLink 4.0的双向带宽高达900GB/s,而传统PCIe总线带宽约为64GB/s
65%已验证该工作流在RTX 3060 6GB显存加16GB内存配置下即可运行
65%已验证RTX 4090拥有24GB显存,在加载27B Q4模型后通常还有足够空间支持3-4万Token的上下文
65%已验证32B参数规模的模型在量化后通常可以压缩到约16-20GB显存占用,一张NVIDIA RTX 4090(24GB显存)就能运行
65%待验证硬盘容量估算公式:单路码流(Mbps)÷8×3600×24÷1024÷1024(GB/天)×路数×存储天数。8路400万像素录30天约需6TB,选购时按此计算所需容量并预留20%余量
88%待验证Unsloth通常需要配合NVIDIA GPU使用,推荐RTX 3090/4090或更高
80%待验证MiniMind-V可以在普通消费级GPU(如RTX 3090)上完成全流程训练
80%待验证GPT-OSS 20B在RTX 3090上可达约40 Token/s的生成速度,在RTX 5090上能达到200 Token/s
75%待验证官方估计24GB显卡约能跑100~140 tokens/秒
60%待验证长文首字延迟是24GB内存容量不足导致的硬伤,加大内存往往比升级显卡更能缓解长文首字延迟
50%待验证在RTX 3090(24GB显存)加24GB内存的配置上运行125B参数的Flash Next模型,生成速度稳定在每秒9到10个token,短文峰值可达18
50%待验证在2944 token输入、1024 token输出条件下,普通模式达到每秒29.9 token,开启MTP2后提升到48.4 token/s
50%待验证UP主建议日常使用控制在6.4万token左右,官方标称26万token不代表一张24GB显卡能舒服跑满
50%待验证长上下文测试中普通模式最终完成到11.4万token,MTP2完成到8.1万token,到9.8万token时未能完成
50%待验证旧款RTX 3090因24GB显存能容纳更多专家,预估运行Strata性能反而达100到140 Token/秒,说明此工作负载下显存容量胜过纯浮点算力
50%待验证课程演示的硬件是一台配备4张3090显卡的Linux服务器
50%待验证两张二手RTX 3090可凑出48GB显存,NVIDIA显卡拥有大多数AI工具优先适配的CUDA生态
50%待验证16块3090在推理时的功耗高达约6kW,与电烤箱同时运行会导致家庭电路保险丝跳闸
50%待验证用户使用16块3090分布在基于联想P620的多个节点上,通过100Gbit网络互联,能运行MiniMax M2、Qwen 235B和Qwen 397B
50%