AI资讯 / 产业

产业 / 媒体

OpenAI自研芯片「Jalapeño」推理性能超越英伟达Blackwell与Rubin

The Decoder

OpenAI在Hot Chips芯片大会上首次公开展示了其自研推理芯片「Jalapeño」的基准测试成绩。根据半导体分析机构SemiAnalysis使用InferenceX公开基准进行的测试,该芯片在每瓦吞吐量和端到端延迟两项关键指标上,均超越英伟达的Blackwell和更新一代的Vera Rubin平台。OpenAI官方数据显示,Jalapeño在峰值吞吐量下每瓦可完成的AI计算量是当前最佳商用系统的1.5至1.9倍,端到端延迟降低1.7至3.6倍;在交互式负载场景下,性能优势进一步扩大至2.1至4.1倍。值得注意的是,Jalapeño在测试中未启用多令牌预测或推测解码等优化技术,而部分对比系统已采用这些手段,这意味着该芯片仍有较大提升空间。SemiAnalysis首席执行官Dylan Patel评价称,第一代自研芯片通常难以与成熟产品竞争,但OpenAI此次直接超越了英伟达的旗舰产品,实属罕见。

Jalapeño是一款专为推理场景设计的通用大语言模型加速芯片,并不用于模型训练,也未针对OpenAI自有模型进行专项调优。测试所用模型涵盖GPT-OSS 120B、DeepSeek R1 670B以及Kimi K2.5 1T三款主流开源大模型。在GPT-OSS测试中,Jalapeño单用户每秒可生成约1400个令牌;在DeepSeek R1单并发请求下,每秒令牌数超过700。在匹配解码速度的条件下,该芯片每千瓦的令牌吞吐量是当前最佳加速器的54至104倍,具体倍数因模型而异。

SemiAnalysis指出,与Jalapeño更具可比性的对手并非Blackwell,而是同样采用HBM4内存的英伟达Vera Rubin平台。即便如此,Jalapeño在每兆瓦输出令牌数上仍略胜Vera Rubin一筹,尽管后者已启用多令牌预测优化而前者尚未采用。在每令牌总拥有成本方面,两款芯片基本持平。不过,英伟达和AMD已发布了DeepSeek V4 Pro、Kimi K3等更大规模模型的测试结果,而这些模型尚未在Jalapeño上完成评测,比较仍不够全面。

从研发周期来看,Jalapeño的诞生速度同样令业界瞩目。OpenAI与Broadcom合作开发该芯片,设计工作于2024年中期启动,最终设计方案于2025年11月送交台积电流片,全流程约16个月。OpenAI强调,从首个芯片设计方案到完整蓝图交付工厂,核心设计阶段仅历时九个月。在开发过程中,OpenAI还将自有AI模型引入芯片设计流程,旧一代模型辅助硬件设计,新一代模型则加速编程与优化工作。

SemiAnalysis认为,Jalapeño的快速落地对英伟达长期以来构筑的「CUDA护城河」构成实质性挑战。该机构在报告中写道:「鉴于OpenAI能够如此迅速地在自研硅片上部署新模型,CUDA护城河或许已名存实亡。」OpenAI首席财务官Sarah Friar则将Jalapeño定位为公司整体计算战略的组成部分,强调数据中心、芯片、模型、开发者平台、产品与终端设备将作为一套整合系统协同运作,而非各自为政。

尽管成绩亮眼,Jalapeño目前仍处于工程样片阶段,尚未向客户批量出货,而Vera Rubin系统已开始向客户交付。OpenAI表示,Jalapeño的推出旨在补充而非取代其与英伟达、AMD、AWS、Cerebras、CoreWeave等合作伙伴的现有关系。值得关注的是,英伟达、AMD和AWS均是OpenAI的投资方或算力合作伙伴,各方同时也在自研AI芯片,合作与竞争关系并存的格局将随Jalapeño的量产而进一步复杂化。

要点

  • OpenAI自研推理芯片Jalapeño在每瓦吞吐量和端到端延迟上超越英伟达Blackwell与Vera Rubin,且尚未启用多令牌预测等优化技术,仍有提升空间。
  • Jalapeño核心设计仅历时九个月,OpenAI在开发中引入自有AI模型辅助芯片设计与优化,大幅压缩研发周期。
  • SemiAnalysis认为此次结果表明英伟达的CUDA软件生态护城河正在被侵蚀,AI公司自研芯片的可行性得到验证。
  • Jalapeño目前仍处于工程样片阶段,尚未量产出货,且缺乏对DeepSeek V4 Pro等更大规模模型的测试数据,与成熟商用产品的全面比较仍需时日。
  • OpenAI与英伟达、AMD、AWS等芯片厂商既是合作伙伴又存在竞争关系,自研芯片战略将使这一复杂格局进一步演变。
查看原始来源

原始标题:OpenAI's first custom chip "Jalapeño" reportedly beats Nvidia's Blackwell and Rubin in inference benchmarks

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。