OpenAI自研推理芯片Jalapeño超越Blackwell?先搞懂推理性能评估再下结论

发布时间:2026/8/28 15:42:22
OpenAI自研推理芯片Jalapeño超越Blackwell?先搞懂推理性能评估再下结论 OpenAI 自研推理芯片 Jalapeño 在推理基准测试中超越 Nvidia Blackwell 和 Rubin这类说法最近在技术圈传得很快。看到消息时我第一反应不是“OpenAI 又要改写算力格局”而是先确认几个没说清楚的细节测的是什么模型跑的是什么精度batch 多大输入输出多长并发多少功耗多少用的是什么软件栈。如果这些条件没有一项一项列出来“超越”就只能算一个宣传口径不能直接当采购依据。这个主题之所以值得认真聊是因为它同时牵动三类人正在规划推理算力的团队想了解自研芯片真实价值的开发者以及只通过 API 使用 OpenAI 服务的普通用户。对前两类人来说重点不是急着改成 Jalapeño 或者继续加购 NVIDIA而是先搞懂一个问题推理芯片的“性能”到底该怎么判断。这篇文章先拆概念再聊跑分口径然后分析自研芯片的真实动机和落地距离最后给出普通团队的应对思路。1. 先把“推理芯片”和“训练芯片”分开再谈超越1.1 推理芯片正在成为成本瓶颈大模型从开发到上线基本分成两个阶段训练和推理。训练阶段让模型在海量数据里学习参数推理阶段让模型拿学习到的能力去回答用户问题。过去几年大家更关注训练芯片因为训练要消耗的算力大得惊人。但落到真实业务里真正每天都烧钱的是推理。用户每调用一次模型服务端就要做一次前向计算生成一段文本、一张图片或一段代码。这个过程中的每个 Token 都需要矩阵运算和显存读取。用户量一大推理芯片的吞吐能力、显存带宽和单位算力成本就直接决定服务的毛利。OpenAI 的 API 规模已经非常大推理成本再低一个量级都会影响定价策略和服务容量。这就是 Jalapeño 这类自研推理芯片受到关注的原因。它不是去抢训练芯片的市场而是想在大模型服务最烧钱的地方做优化。推理任务的特点是模型权重相对固定输入输出变化多对延迟和并发有明确要求。相比训练任务推理更容易通过专用芯片来加速因为不需要那么灵活的并行调度和超大显存互联。1.2 Blackwell 和 Rubin 不是同一个时间维度的对手Nvidia Blackwell 是目前数据中心里的主力架构很多大模型推理服务都是基于它来部署。Rubin 是 Nvidia 后续路线图里的新一代平台代表的是未来一到两年的性能预期。拿一颗刚曝光传闻的自研芯片去和 Blackwell、Rubin 比本身就有时间错位的问题。Blackwell 的强项是通用性和生态成熟度。它不只为某一个模型设计而是能适配不同规模、不同精度的模型。Rubin 还没全面铺开它的价值要等实际产品、驱动、框架都跟上之后才能体现。Jalapeño 如果是一颗专用推理芯片针对 OpenAI 自家模型优化那在特定模型和特定部署条件下跑赢 Blackwell 是有可能的但这和“全面超越”是两码事。自媒体传播里容易把“某一项测试领先”简化成“整体吊打”。真正做技术选型时不能只看这种结论。一颗芯片好不好要看它在你自己的模型、自己的流量、自己的并发曲线下表现如何而不是看别人用一个特定场景测出来的数字。1.3 传闻中 3nm 与 9 个月速度不等于可用性网络讨论里经常出现“OpenAI 用 9 个月造出 3nm 自研芯片”的说法。这个听上去很提气但要注意这属于待证实信息。芯片行业里“设计出来”“流片成功”“量产可用”“规模部署”是四个完全不同的阶段。9 个月完成设计说明团队执行效率高或者设计目标非常聚焦。但一颗芯片要真正进入数据中心还要解决代工良率、封装散热、供电、内存子系统、驱动、编译器、运行时调度、故障运维等问题。任何一个环节跟不上芯片就只能停留在演示阶段。我自己见过不少项目Demo 里跑得很惊艳真到了 7×24 小时服务时才发现稳定性不行。推理芯片尤其如此用户请求是随机到达的峰值流量可能突然冲到几倍芯片不仅要快还要在持续高压下不降频、不报错、不出现内存错误。流片成功只是夺回了起跑线后面还有一整条供应链和服务体系要补。2. 推理基准测试的“超越”要看全这组参数2.1 比快之前先确定指标口径推理性能不像“跑分软件”那么简单它至少有四个常见指标首 Token 延迟TTFT、生成长度、吞吐量、端到端延迟。TTFT 影响用户感知到的响应速度吞吐量影响单位时间服务多少人端到端延迟则直接决定在线服务的体验。如果一个基准测试只说“超越 Blackwell”没有说明测的是哪一项这个结论就没有操作意义。比如某颗芯片可能 TTFT 很快但连续输出时吞吐不高也可能离线高并发很强但在线单请求延迟很差。论文和发布会里通常挑最好看的指标讲这个习惯在芯片领域也一样。我一般会先看吞吐量和功耗的比值也就是每瓦每秒能生成多少个 Token。因为推理服务的核心成本不是单次请求快不快而是单位电力下能处理多少请求。如果一颗芯片峰值很高但功耗吓人数据中心散热和电费会直接把成本优势吃掉。2.2 同一颗芯片在不同任务里可能判若两人推理芯片的性能极度依赖任务类型。跑 7B 小模型、跑 70B 大模型、跑 MoE 模型对显存、带宽和计算单元的需求完全不同。小模型更吃内存带宽大模型更吃显存容量和计算吞吐MoE 模型则对路由调度和稀疏计算有额外要求。另一个关键变量是 batch size。在线聊天场景通常是 batch 很小单条延迟敏感离线批量生成场景可以开大 batch芯片利用率和吞吐会显著提升。同一颗芯片小 batch 下可能输大 batch 下可能赢。如果测试方为了拿到好看数据把 batch size 设成实际业务很少用的数值那结果再高也参考价值有限。精度也要留心。FP8、INT8、FP4 这些精度在推理里很常见量化后速度会快很多但模型质量会有少量损失。芯片在低精度下跑分高不代表它在用户实际需要的精度下同样高。严谨的对比必须把模型、精度、上下文长度、batch size、并发数都写清楚。2.3 没有官方数据前怎么判断可信度目前关于 Jalapeño 的细节非常少没有架构图没有官方白皮书没有可下载的测试工具甚至没有明确说测试用的模型和软件版本。这种情况下我建议把“超越 Blackwell 和 Rubin”当作传闻而不是结论。判断传闻可信度可以看几个信号有没有独立的第三方复现有没有说明测试环境和参数有没有给出完整实验配置OpenAI 官方是否确认。只要这些信号缺失消息就处于“待验证”状态。芯片领域有个常见现象早期测试结果很好优化到量产阶段发现各种限制最终性能和最初预期差一截。所以对早期跑分保留一点耐心反而是负责任的态度。2.4 一张表核对“跑分超越”是否可参考信息项为什么重要缺失时怎么判断测试模型7B 和 70B 的芯片适配方式完全不同不能推测是否适合你的模型精度FP8、FP4、INT8 直接影响速度和效果只看速度可能失真batch size小 batch 偏延迟大 batch 偏吞吐要对比自己业务的 batch 区间输入输出长度长上下文对显存和带宽要求更高短上下文快不代表长文本快并发数并发高时考验调度和内存管理单请求快不表示系统吞吐高软件栈不同推理框架优化差异很大结果可能来自特定框架深度适配硬件环境散热、供电、互联拓扑会影响结果纸面数字无法直接迁移功耗决定数据中心运营成本不讲功耗的性能对比没有闭环可信度第三方复现、公开配置、官方确认缺失时只能算单方面数据不管最后是不是真的超越上面这张表都值得保留。以后再看任何推理芯片跑分都先把这些列出来能对上再花时间评估。3. OpenAI 为什么要自研推理芯片成本、供给和软件控制权3.1 API 规模越大推理成本越不容忽视OpenAI 的 API 服务要支撑大量开发者调用从对话补全到代码生成背后全是 GPU 集群在跑。只要用户量在涨推理资源就得跟着扩。直接用 Nvidia 的卡当然省事但对一家算力消耗如此大的公司来说长期成本不可控。自研推理芯片如果能做到同等质量下单位成本更低OpenAI 可以直接把成本优势反映到 API 价格里或者保持价格不变同时提高利润。这个逻辑对开发者也是利好API 价格更稳服务扩容能力更强使用体验更可能保持稳定。但成本优势不是只看芯片价格。自研芯片要摊薄芯片设计费、流片费、软件研发费、生态适配费前期投入比直接买卡高得多。只有部署量足够大才能把固定成本摊薄。所以自研芯片对公司规模和业务体量有很高要求不是随便一家都能抄的作业。3.2 自研芯片的动机不完全是因为跑分如果只看跑分OpenAI 完全可以继续采购 Nvidia 的下一代产品没必要自己造芯片。自研的价值更在于供应链控制权和产品定义权。采购外部 GPU 时能买多少、什么时候到货、用什么架构都受供应商节奏影响。自研芯片可以把算力规划和产品路线绑定针对自家模型做深度定制。这种“软硬一体”的思路和很多云厂商自研芯片的动机一致不为在每一个指标上赢而是为了在关键场景里掌握主动。另外大模型架构变化很快。推理芯片如果设计得太专用可能只对某一代模型有效模型一变芯片就失去优势。因此自研芯片要平衡专用加速和通用可编程能力这也是最难的地方。跑分只能体现当前某几个模型的效率体现不了未来三年架构迭代的适应能力。3.3 比芯片更难的是编译器、算子库和服务框架AI 芯片行业有句老话芯片只是硬件的一半另一半是软件。Nvidia 的护城河不只有 GPU 本身还有 CUDA、TensorRT、cuDNN 和庞大的开发者生态。开发者已经习惯了用 CUDA 写算子、用 TensorRT-LLM 部署模型、用 Nvidia 工具排查性能问题。自研芯片要真正被用起来要先有一套编译器能把 PyTorch 等框架里的算子编译到自己的硬件上还要有算子库把常用操作优化到足够快的程度还要有推理服务框架支持动态 batch、分页注意力、模型并行等高级功能。这些工作的工作量不会比设计芯片小。OpenAI 在软件上有积累也有强烈的自研动机。它不需要像普通芯片厂商那样取悦所有开发者只要先服务好自己内部和 API 场景就够了。这种垂直整合路线比通用芯片更容易落地但也意味着它对生态的覆盖范围会窄一些。4. 从流片到大规模部署中间隔着一整条供应链4.1 流片成功不等于量产可用看到“芯片测试通过”的新闻时很多人会默认芯片马上可以大量使用。实际上一颗芯片从流片成功到量产还要过良率、封装、测试、可靠性验证等多道关。即便是成熟设计良率爬坡也需要几个月时间。数据中心芯片还要做长时间老化测试确保在高温高负载下不会频繁出错。更现实的问题是新架构需要重新设计服务器硬件。芯片接口、供电、内存拓扑、散热方案都要搭配。如果只做了芯片本身服务器主板、整机厂商、机柜部署策略都得跟上。整个链条会明显拉长。所以我更愿意把传闻里的时间点理解成“设计验证完成”而不是“马上能大规模服务”。OpenAI 就算真有芯片在手也不会立刻把所有 API 流量迁过去。更可能的路径是先在内部小范围试跑再逐步扩大。4.2 单卡性能高不等于服务稳定推理服务要稳定不是单卡够快就行。大规模部署时需要把模型切到多卡上处理显存不足问题需要在服务崩溃时自动重启需要面对网络通信瓶颈还需要一个持续监控系统跟踪每张卡的利用率、温度、显存错误率。一颗芯片在基准测试里跑得快只说明它在受控环境里算得快。如果它在长时间运行时出现显存错误率偏高或者高并发下调度器不稳定那再高的峰值性能也无法用于生产。Nvidia 的卡经过很多年打磨运维工具和排错经验已经非常成熟。新芯片再强稳定性数据也要靠时间攒出来。我自己做部署时最怕的不是慢而是不稳定。慢还可以通过加机器解决不稳定却会让整个服务的错误率、超时率一起上升。推理芯片的可靠性不是跑一两个基准就能证明的一定要看连续运行几天的表现。4.3 软件生态迁移成本可能比性能差距更关键假设 Jalapeño 真的在一项测试里超过了 Blackwell接下来一个很现实的问题是迁移成本。团队用 Nvidia 的卡可能已经写好了一套基于 CUDA 的图像处理流程或者用 TensorRT-LLM 做了量化优化又或者用 Nvidia Triton 管理推理服务。搬家到新芯片算子要重新编译推理框架要重新适配监控告警要重新开发。如果新芯片只能兼容 OpenAI 自家模型那外部开发者迁移的意愿会更低。很多团队不可能为了推理性能提升就放弃整套成熟的 Nvidia 工具链。这个生态惯性是客观存在的不会因为一颗芯片的跑分而改变。这也是为什么很多自研芯片厂商都在强调“兼容已有生态”而不是让用户另起炉灶。OpenAI 更可能的做法是继续通过 API 对外提供服务把芯片能力包装成服务让开发者无感。这样既能发挥芯片优势又不用强迫用户迁移。4.4 时间表背后的现实约束芯片行业里“路线图宣布”和“规模量产”之间经常隔着两三年。网络热词里提到的“9 个月造出 3nm 自研芯片”如果指的是从立项到流片那确实说明团队速度很快。但从流片到量产再到规模部署通常不是几个月能完成的事。这里还涉及代工产能、先进封装、HBM 内存供货等因素。一颗高性能推理芯片不只要逻辑设计强还要有足够带宽的存储系统。HBM 的产能和成本直接决定芯片能不能大规模出货。这些供应链问题不是 OpenAI 单独能解决的。对普通开发者来说更稳妥的时间预期是即便消息全部属实Jalapeño 真正能通过 API 大规模影响用户体验也可能需要按年而不是按月来算。短期内Nvidia 仍然是推理部署的主流选项。5. 对普通开发者和技术团队来说短期该关注什么5.1 如果你只是调用 API底层芯片变化对你是透明的大量开发者现在是以 API 方式使用 OpenAI比如处理文本、生成代码、做语义搜索。这种情况下你不需要关心背后跑的是 Nvidia 还是自研芯片。OpenAI 只要保证接口不变、价格稳定、响应速度符合预期底层硬件换不换和你没有直接关系。但有一个点可以关注接口稳定性。如果 OpenAI 为了发挥自研芯片优势修改了某些模型行为、上下文窗口策略或计费逻辑那开发者才会真正受到影响。芯片本身不是你需要关心的层API 的输入输出、价格和限流策略才是。5.2 如果你在做本地推理部署NVIDIA 工具链仍是基本盘很多团队跑的是本地部署比如用开源模型做私有化服务。这时候 Nvidia 的驱动、CUDA、container runtime 仍然是日常操作的一部分。热词里大量出现 Ubuntu 安装 Nvidia 驱动、nvidia container toolkit 配置、CUDA 版本问题说明这套工具链依然是本地推理的事实标准。你可以关注自研芯片的未来但短期选型不能押在一个传闻上。该装驱动还是装驱动该调 CUDA 还是调 CUDA该做量化还是做量化。推理服务的优化点很多芯片只是其中一个环节模型、框架、数据格式、服务配置都会影响最终效果。如果是在 Jetson 这类边缘设备上做推理更不用因为桌面端芯片新闻改变计划。边缘场景对功耗、体积、工具链成熟度的要求更苛刻短时间不会有谁能动摇 Nvidia 在边缘部署里的地位。5.3 OpenAI 近期更值得关注的是软件工具链相比芯片传闻OpenAI 近期在工程工具上的动作更实际。比如 Codex 相关工具的下载和更新API Key 的获取使用以及开发者社区里讨论度很高的 Codex harness 开源进展。这些是能直接改变开发效率的东西。芯片离普通开发者很远但这些工具离得很近。我建议把注意力放在OpenAI 的 API 格式有没有变化Codex 能不能接入自己的工程流程函数调用、结构化输出、批量处理这些能力是否更稳定。这些因素对实际项目的帮助比一个未经验证的芯片跑分更直接。5.4 给技术选型的三个判断标准如果团队正在做推理算力选型可以按下面三个标准来判断不管面对的是 Nvidia、自研芯片还是其他方案。第一看可验证性。选型必须有可复现的压测数据不能只有厂商宣传。用自己业务里的真实模型和请求数据跑一轮延迟、吞吐、错误率测试。第二看迁移成本。新方案能不能兼容现有代码算子重写量有多大监控和部署流程要不要重做。很多看起来性能更好的方案在迁移成本面前并不划算。第三看供应链和长期投入。芯片能不能稳定供货软件迭代是否活跃社区和文档是否完整。长期依赖一个没有生态的技术栈风险很高。6. 我的结论别急着站队先把验证框架搭起来6.1 传闻期最忌讳直接下结论一个尚未被官方确认的推理芯片在某个基准测试里跑赢 Blackwell 和 Rubin这个消息适合当行业动态看不适合当行动指南。芯片行业的宣传口径从来都是挑最有利的场景讲真实性能要等更多独立验证才能看清楚。我更建议用这段时间把自家推理性能的基线测出来。跑一批固定模型记录延迟、吞吐、错误率和硬件利用率。这样等新芯片真正开放测试时可以直接用同一套方法对比而不是被别人的测试结论牵着走。6.2 等官方披露哪些信息才值得判断以后如果消息进一步公开我会重点看几个信息。首先是芯片的架构细节包括计算单元、显存带宽、互联方式和功耗。其次看基准测试的完整配置包括模型、精度、batch、输入输出长度、软件栈。再然后看量产计划和部署时间表。如果这些信息都不公布那就继续观望。真正优秀的推理芯片产品最终会通过公开测试、开发者体验和实际服务数据来证明自己而不是只靠一句“超越某某芯片”来争关注。6.3 团队可以提前做哪套可复现验证团队现在就可以准备一套推理压测脚本。固定模型版本固定测试数据集固定并发模式记录三类数据平均 TTFT、平均 Token 生成速度、错误率和超时率。同时记录硬件信息包括 GPU 型号、显存占用、功耗和温度。将来无论切换芯片还是改配置都能拿着同一套脚本做横向对比。这套验证框架的价值会超过某一条新闻。6.4 长期看这场“超越”真正的价值是什么我更愿意把 Jalapeño 的传闻当成一个行业信号自研推理芯片的竞争正在加速。OpenAI 敢花资源做芯片说明推理成本在大模型服务里的权重越来越重。无论最终这颗芯片表现如何它都会推动市场出现更多选择。算力市场的竞争越充分普通开发者的选择空间就越大。有人会觉得“OpenAI 如果不再依赖 NvidiaAPI 可能更稳”也有人会担心“如果芯片是专有的会不会绑定更深”。这些担心都有道理但现在下结论都太早。现阶段最稳的姿势是继续保持对 Nvidia 工具链的熟悉同时把自家推理任务的性能和成本基线记录下来。芯片新闻看完之后回到自己的模型、数据和压测脚本里用可复现的数据做判断。传闻会越来越多但真正能指导决策的只有你自己跑出来的结果。