Jalapeño
OpenAI自研定制AI芯片项目,代号Jalapeño,被认为是面向AI工作负载的专用加速器(ASIC),设计过程中深度使用LLM辅助RTL代码生成与验证
Timeline (last 90 days)
在InferenceX公共基准测试中,Jalapeño峰值吞吐下每瓦任务量达到NVIDIA对比系统的1.5至1.9倍,端到端延迟降低1.7至3.6倍
OpenAI公布首款自研AI推理芯片Jalapeño,额定功耗700W,实测持续功耗550W或以下
OpenAI计划在今年年底前将Jalapeño部署到自有基础设施中,但将继续部署NVIDIA等加速器
OpenAI借助自身模型辅助,团队在9个月内完成从设计到流片的全过程,并用2个月完成3款开源模型的适配
Richard Ho称Jalapeño在同一颗芯片上同时实现了高吞吐和低延迟,这在行业内尚属首次
OpenAI使用名为InferenceX的开源基准测试工具来测试Jalapeño的性能
Jalapeño是一款推理(inference)芯片,而非训练芯片
Jalapeño的每瓦性能(performance per watt)比现有芯片高出1.8到4倍
Jalapeño正式投入生产后,面向客户的token价格有望下调
OpenAI尚未披露Jalapeño的代工厂商、制程节点及量产时间表
38 more timeline events
All Facts (20)
在 gpt-oss 120B 测试中,Jalapeño 峰值每瓦吞吐约 85,448,对标 GB200 的 44,960,约 1.9 倍;端到端延迟从 1.80 秒压到 1.03 秒;最低 TBT 从 1.87 毫秒降到 0.69 毫秒
60%Unverified在 DeepSeek R1 670B(MXFP4 精度)测试中,Jalapeño 每瓦吞吐约 1.7 倍(19,641 对 GB300 的 11,781),端到端延迟从 5.99 秒降到 1.65 秒
60%Unverified「Jalapeño」很可能是面向AI工作负载的专用加速器(ASIC),而非通用计算芯片
60%UnverifiedOpenAI借助自身模型辅助,团队在9个月内完成从设计到流片的全过程,并用2个月完成3款开源模型的适配
50%Unverified在InferenceX公共基准测试中,Jalapeño峰值吞吐下每瓦任务量达到NVIDIA对比系统的1.5至1.9倍,端到端延迟降低1.7至3.6倍
50%UnverifiedJalapeño不会取代现有供应商,而是作为OpenAI芯片舰队的一部分,与英伟达、Cerebras等厂商芯片共同承担不同工作负载
50%UnverifiedOpenAI使用名为InferenceX的开源基准测试工具来测试Jalapeño的性能
50%UnverifiedRichard Ho称Jalapeño在同一颗芯片上同时实现了高吞吐和低延迟,这在行业内尚属首次
50%UnverifiedJalapeño是一款推理(inference)芯片,而非训练芯片
50%UnverifiedJalapeño的每瓦性能(performance per watt)比现有芯片高出1.8到4倍
50%UnverifiedJalapeño是OpenAI专攻推理的自研芯片,不负责训练下一代GPT模型
50%UnverifiedOpenAI表示Jalapeño从初始设计到流片只用了9个月,AI模型参与了芯片开发和算术电路优化
50%Unverified在峰值吞吐状态下,Jalapeño每瓦完成的AI工作量达到对比系统的1.5到1.9倍
50%UnverifiedJalapeño额定功耗700W,实测持续功耗未超过550W;对照GB200额定1200W,GB300额定1400W
50%UnverifiedJalapeño从设计之初就把芯片、内存、网络、软件和机架统筹设计,KVCache等模型状态可被明确放置并尽量保留
50%UnverifiedJalapeño 芯片合作分工为:OpenAI 负责架构定义,Broadcom 做芯片实现和网络连接,Celestica 负责板卡和系统集成
50%UnverifiedJalapeño 的核心设计解法是将 KV Cache 等状态尽量锁定在本地,以更大的本地存储换取更低的搬运延迟,是一种以空间换时间的系统级权衡
50%UnverifiedJalapeño 的测试使用 Semi Analysis 的 InferenceMAX 框架,数据由 OpenAI 提供,未跑完整套件,也未公开原始日志,测试场景限制在 8K 输入、1K 输出,未开推测解码
50%UnverifiedOpenAI 宣称从初始设计到 Tape Out(流片)只用了 9 个月,而 Semi Analysis 算上团队组建时间认为大概是 16 个月
50%UnverifiedJalapeño 将网络直接揉进芯片架构,尽量让请求留在一个互联域里跑完
50%