深度丨OpenAI第一代自研芯片亮线,超预期背后的算力新打法

IP归属:广东

文章AI导读

一键萃取文章精髓,核心观点即刻呈现

前言

一颗名叫Jalapeño的芯片,把OpenAI推到了另一张牌桌上。首代自研AI芯片刚拿出实测成绩,单位功耗吞吐和延迟表现便跑进第一梯队。

耐人寻味的是,OpenAI连衡量算力的尺子也换了:少谈一颗芯片能跑多少峰值算力,多问一兆瓦电,究竟能换回多少有用的智能。

作者 | 方文三

图片来源 | 网络

第一代就跑到前排,OpenAI换了一把尺子

近日,OpenAI公布了首款自研推理芯片Jalapeño的第一批实测数据。

在三个公开模型上,Jalapeño的峰值单位功耗性能约为对比系统的1.5至1.9倍,端到端延迟降低约1.7至3.6倍;高交互负载下,性能优势达到2.1至4.1倍。Jalapeño额定功耗700W,OpenAI称测试负载下持续功耗不高于550W。

目前测试主要针对固定长度的推理场景,OpenAI官方附录使用的是8k输入、1k输出等配置。SemiAnalysis同时提醒,Jalapeño与GB200、GB300的比较并不能覆盖全部竞争现实,因为英伟达 Vera Rubin已经进入新一代产品周期;更复杂的长上下文、多轮Agent工作负载,也尚未通过AgentX完整检验。

因此,Jalapeño目前能够支持的结论相当明确:它已经证明OpenAI具备做出一颗具有竞争力的推理ASIC的能力。 

真正超预期的地方,其实藏在芯片内部那套设计哲学里。LLM推理并不是持续做同一种计算。Prompt预填充偏计算密集,逐Token生成更吃内存带宽,跨芯片通信又会制造等待。

OpenAI围绕这些真实工作负载重新组织计算、内存、KV Cache和网络,尽量减少数据搬运,让模型状态停留在更接近计算的位置。芯片、内存、网络、调度软件与机柜因此被当成一台机器来设计。

推理先动刀,因为每个Token都连着成本

OpenAI选择把第一颗芯片押在推理侧,很能说明问题。训练前沿模型仍然需要极强的通用计算能力、成熟软件生态和大规模集群,这块市场里,GPU尤其是英伟达的优势依旧深厚。

OpenAI也明确表示,未来会继续大规模使用英伟达及其他合作伙伴的加速器承担训练和推理工作。

推理的经济账却完全不同。模型训练完成以后,每一次ChatGPT回答、每一次API调用、每一个Codex任务、每一个Agent连续执行几十步甚至几百步操作,都在产生新的计算消耗。 

进入Agent时代,延迟开始具有「复利效应」。一步慢一点,几十个串行步骤累计下来,用户看到的可能就是一段漫长的沉默。

OpenAI因此把测试重点放在单位功耗吞吐、每用户Token速度和端到端延迟上,而非只展示芯片理论算力。

当模型公司用户规模扩大之后,推理逐渐从技术后台变成利润表里的长期变量。每瓦电力可以多生成一些Token,每台服务器可以承载更多用户,每个请求少消耗一点资源,积累到千万乃至亿级调用量,都会改变服务成本。

OpenAI CFO Sarah Friar在谈算力战略时已经把这种思路说得很清楚:根据工作负载选择不同硬件,在能力最重要的地方使用高端系统,在规模与成本更敏感的地方追求效率,并把最终指标落到「每美元产生多少有用智能」。

因此,Jalapeño并非单纯的半导体项目,它更像一台针对OpenAI商业模式定制的「毛利率机器」。

自研芯片没有结束采购,算力正变成「投资组合」

看到OpenAI造芯片,很容易顺着一条熟悉的故事线走下去:减少英伟达依赖。这句话只说中了半边。OpenAI正在自研ASIC,同时也在疯狂扩大外部采购。 

2025年9月,OpenAI与英伟达宣布计划部署至少10GW 英伟达系统,首批1GW规划采用Vera Rubin平台;同年10月,OpenAI又与AMD达成6GW GPU合作,首批1GW MI450系列计划从2026年下半年开始部署。 

与此同时,OpenAI和博通在2025年公布了10GW自研加速器合作计划,目标从2026年下半年开始部署,并持续到2029年。到今年9月,博通披露的2028年前可见项目中,OpenAI相关已承诺容量超过5GW。

这些数字不能机械相加,不同协议在时间、数据中心、供应方式和负载类型上可能存在交叉。但它们拼出了一张非常清楚的地图。OpenAI正在放弃「寻找唯一最佳芯片」的思维。

训练前沿模型,可以使用最强通用GPU;高频、大规模推理,可以逐步导向自己的ASIC;追求极低延迟的部分负载,可以接入Cerebras;不同云平台继续提供弹性容量;数据中心与能源则通过Stargate等基础设施计划提前锁定。

过去,缺少替代方案时,芯片供应商的价格几乎就是算力成本的起跑线。拥有一条真正能工作的自研路线以后,OpenAI即使继续大量采购英伟达,也多了一张可以摆上谈判桌的牌。

所以Jalapeño的战略价值,不必建立在「取代英伟达」这个宏大前提之上,它只需要变成一个可信选择,就已经改变了采购关系。

九个月流片背后,AI开始改造芯片研发

Jalapeño还有一处容易被性能数字遮住的变化:AI已经参与到了制造下一代AI芯片的过程里。

OpenAI称,Jalapeño从初始设计到制造流片的联合开发周期约为9个月,模型被用于探索不同实现方案、缩短设计和验证循环,并优化部分算术电路。芯片进入软件开发阶段后,AI又参与kernel优化、任务映射和调度。

OpenAI称,在选定的GPT-OSS attention和MoE模块上,AI生成实现的运行速度达到原有人类专家代码的1.5至1.8倍。 

这个数字只针对选定模块,不能外推成整套模型性能,但它暴露出一个很有想象力的新循环:模型帮助设计芯片,芯片让下一代模型跑得更快,新模型再参与下一代芯片优化。 

OpenAI试图压缩的,恰好是这段时差。Jalapeño还没有证明这种九个月节奏能够长期复制,但OpenAI已经透露第二代产品进入深度开发,第三代也开始成形。

一旦这种研发闭环成立,自研ASIC的竞争优势就会出现新的来源:比谁更早知道下一代模型需要什么。 

OpenAI已经确认Gen 2处于深度开发阶段,Gen 3也已经启动。这意味着真正值得英伟达关注的并非Jalapeño A0这一代跑出了多少Token,而是OpenAI能否让这个闭环每隔一代都转得更快。

自研不等于自产,产业链利润重排座次

Jalapeño也提醒市场,「自研芯片」四个字经常被说得过于浪漫。

OpenAI负责核心架构设计,博通承担芯片实现、网络与连接技术,Celestica负责板卡和机架系统工业化,芯片则交由台积电制造。

OpenAI取得了更强的芯片控制权,却没有变成一家晶圆制造公司,依赖只是重新切割了。 

过去主要集中在GPU厂商,如今逐渐分散到ASIC设计服务、先进制程、HBM、先进封装、网络、服务器制造和数据中心电力之中。最直接吃到这轮变化红利的公司之一,正是博通。

截至8月2日的2026财年第三季度,博通 AI半导体收入达到167亿美元,同比增长221%;公司预计第四季度这一数字进一步增至217亿美元。 

这组数据透露出一个比「谁挑战英伟达」更大的产业变化,AI算力市场正在分层。

通用GPU仍守着前沿训练、生态和高度灵活的工作负载;拥有超大规模稳定需求的模型厂商,则越来越有动力把一部分计算固化进自己的ASIC。 

博通、Marvell这类能够提供定制芯片、互联和系统能力的公司,因此站到了新的流量入口。

对英伟达而言,这还谈不上城墙倒塌。OpenAI一边开发Jalapeño,一边仍在规划巨量英伟达基础设施,本身已经说明问题。真正发生松动的是「一种芯片包揽所有AI计算」的时代想象。

结尾:

Jalapeño没有给AI芯片战争写下结局,它只是把规则往前推了一格。OpenAI开始同时握住模型与硬件两端,让算法需求直接进入芯片设计,让每一瓦电参与商业竞争。

未来模型公司的差距,也会藏在那些越来越贴身、越来越专用的硅片中。

OpenAI:《Jalapeño 的首批测试结果展现出行业领先的AI推理速度与效率》,OpenAI:《OpenAI与英伟达宣布达成战略合作伙伴关系,计划使用英伟达系统部署10吉瓦AI数据中心》,Reuters:《OpenAI builds first chip with 博通 and TSMC, scales back foundry ambition》

陀螺科技现已开放专栏入驻,详情请见入驻指南: https://www.tuoluo.cn/article/detail-27547.html

AI芯天下专栏: https://www.tuoluo.cn/columns/author1911711/

本文网址: https://www.tuoluo.cn/article/detail-10130995.html

免责声明:
1、本文版权归原作者所有,仅代表作者本人观点,不代表陀螺科技观点或立场。
2、如发现文章、图片等侵权行为,侵权责任将由作者本人承担。

相关文章