一颗 700W 的定制芯片,每瓦吞吐量是 NVIDIA GB300 的 1.7 倍,端到端延迟仅对手的 29%——OpenAI 用 9 个月造出了自己的推理芯片,第一个被真正威胁的不是 GPU 的性能,而是 GPU 的定价权。
关键词:Jalapeño、推理芯片、ASIC、TCO、云基础设施成本、InferenceX
一、先看数据:一张表引爆行业
2026 年 8 月 25 日,OpenAI 在 Hot Chips 2026 大会上发布了 Jalapeño 的首批实测数据。这不是 PPT,是跑在工程样品上的公开基准测试结果。
测试使用 SemiAnalysis 的 InferenceX 基准,覆盖三个开源模型,对比对象是 NVIDIA 当前最强的推理系统:
| 模型 | 对比对象 | 每瓦吞吐量提升 | 端到端延迟降低 | 最小 token 间隔改善 |
|---|---|---|---|---|
| GPT-OSS 120B | GB200(1200W) | 1.9× | 1.80s → 1.03s | 1.87ms → 0.69ms |
| DeepSeek R1 670B | GB300(1400W) | 1.7× | 5.99s → 1.65s | 5.90ms → 1.43ms |
| Kimi K2.5 1T | GB300(1400W) | 1.5× | 5.31s → 1.56s | 5.48ms → 1.44ms |
更惊人的数字藏在极端工作点:在匹配 GB300 最低延迟的工作点上,Jalapeño 的每瓦吞吐量分别是 GB300 的 53.7 倍(GPT-OSS)、104.3 倍(DeepSeek R1)、56.1 倍(Kimi K2.5)。
但请注意:这个”104倍”是 GB300 在极低并发下的基线——它几乎不做任何吞吐优化,只为维持最低延迟。更公平的对比是峰值吞吐量的 1.7 倍,这个数字依然令人印象深刻。
一颗 700W 的芯片,在推理效率上击败了 1400W 的 NVIDIA 旗舰。 这不是性能碾压,是经济学碾压。
二、Jalapeño 是什么:一颗为推理而生的芯片
2.1 基本规格
| 参数 | Jalapeño | NVIDIA GB300 |
|---|---|---|
| 制程 | TSMC 3nm | TSMC 4nm |
| Die 面积 | ~840mm²(光罩极限) | ~814mm²(Blackwell Ultra) |
| 内存 | 8 堆 HBM4 | 12 堆 HBM3E(288GB) |
| TDP | 700W(实测 ≤550W) | 1400W |
| 架构 | Systolic Array(脉动阵列) | SIMD(通用并行) |
| 互联 | Broadcom Ethernet | NVIDIA NVLink |
| 目标负载 | 仅推理 | 训练 + 推理 |
2.2 架构设计:为 LLM 推理量身定制
Jalapeño 的核心设计理念可以用一句话概括:推理过程中最大的瓶颈不是计算,而是数据搬运。
LLM 推理分两个阶段:
- Prefill(预填充):处理用户输入,计算密集
- Decode(解码):逐 token 生成输出,内存带宽密集
在 Decode 阶段,芯片需要不断从 HBM 加载模型权重——数据从内存到计算单元的搬运速度,决定了 token 生成速度。GPU 的通用 SIMD 架构在这个场景下有大量不必要的控制开销和分支预测浪费。
Jalapeño 的 Systolic Array 架构则完全不同:
- 数据在处理单元之间按固定流水线传递,没有分支预测开销
- 每个核心有独立的 HBM 切片视图,减少内存访问延迟
- KV Cache 可以显式放置并保持本地,避免跨芯片数据搬运
- 乱序执行核心 + L1 缓存,而非 GPU 常见的软件管理 scratchpad
用白话说:GPU 是一把瑞士军刀,什么都能干但什么都不极致;Jalapeño 是一把手术刀,只干推理这一件事,但把这件事做到了芯片架构级别。
2.3 9 个月流片:AI 设计芯片的新范式
从初始设计到 TSMC 流片,Jalapeño 只用了 9 个月——这是高性能 ASIC 领域公开报道的最快纪录。传统周期是 18-24 个月。
OpenAI 硬件负责人 Richard Ho(前 Google TPU 团队成员)透露了关键方法:
“我们不是让 AI 自主生成芯片设计。而是同时运行数百个 AI Agent,让它们并行处理验证、时序收敛、面积优化——每个 Agent 在夜里跑完整个优化循环,早上人类工程师检查结果、调整参数。”
具体来说,AI 在以下环节发挥了作用:
- SIMD 面积缩减 8%,矩阵引擎面积缩减 10%
- 时序和功耗优于初始人工设计块
- Gluon 编程语言(基于 Triton 构建)让 AI 可以直接编写推理内核
- 三个非原生模型(GPT-OSS、DeepSeek R1、Kimi K2.5)在硅片回实验室后 2 个月内 跑出高性能
- AI 生成的特定注意力/MoE 内核块,比人类专家手写版本 快 1.5-1.8 倍
这不是 AI 设计芯片的噱头,而是 AI 作为”超大规模并行验证工具”的工程实践。 它压缩的不是设计创意,而是设计周期中最耗时的人工瓶颈。
三、对云基础设施成本结构的冲击
这才是这篇文章的核心。Jalapeño 的技术参数对运维和基础设施团队意味着什么?
3.1 电力成本重构
数据中心最刚性的成本是电力。一个标准机柜的功率上限通常在 30-50kW,液冷机柜可以到 100kW+。
Jalapeño 的机柜设计:
| 组件 | 功率 |
|---|---|
| 16 个 Katsu 主机托盘(AMD EPYC) | ~31kW(生产负载) |
| 16 个 Vindaloo ASIC 托盘(128 颗 Jalapeño) | ~130kW |
| 总计 | ~160kW |
这基本等于一个双宽 GB300 机柜的功率。但关键区别是:
- GB300 机柜:72 颗 GPU,1400W/颗,总计 ~100kW
- Jalapeño 机柜:128 颗 ASIC,700W/颗(实测 ≤550W),总计 ~130kW
同样 160kW 的电力预算,Jalapeño 能塞进 128 颗推理芯片,每颗功耗只有 GB300 的一半。 这意味着:
- 每瓦产出的 token 数量翻倍
- 电费账单不增长的情况下,推理吞吐量翻倍
- 或者:推理吞吐量不变,电费砍半
以美国数据中心平均电价 $0.07/kWh 计算:
| 方案 | 年电费(160kW 机柜) | 年推理吞吐量(估算) | 每 token 电力成本 |
|---|---|---|---|
| GB300 × 72 | $98,496 | 基准 1× | 1× |
| Jalapeño × 128 | $98,496 | ~1.7-1.9× | ~0.53-0.59× |
同样的电费,产出多 70-90% 的 token。 这对运维团队来说不是”优化建议”,而是”预算重构”。
3.2 TCO 模型的根本变化
传统 AI 基础设施的 TCO 公式是:
Jalapeño 带来的变化是:推理工作负载的 TCO 不再由 GPU 价格决定,而是由”每 token 成本”决定。
SemiAnalysis 的分析指出:
“在 TCO 每 token 维度上,Jalapeño 和 Vera Rubin 几乎打平。但 Jalapeño 的结果是单 token 预测模式下取得的,而 Vera Rubin 使用了多 token 预测(speculative decoding)。当 Jalapeño 实现 speculative decoding 后,成本优势将进一步扩大。”
更关键的是 Nvidia 的利润结构。H200 SXM5 的估算制造成本约 (2,175 + 封装 ~逻辑),约14,200。NVIDIA 的数据中心 GPU 毛利率在 70-80% 之间——你每花 1 美元买 GPU,有 70-80 美分是 NVIDIA 的利润。
自研 ASIC 消除了这个”vendor margin tax”。你付给 TSMC 晶圆费,付给 Broadcom 设计费,但不再在每颗芯片上支付 NVIDIA 的溢价。对于 OpenAI 这样每年推理消耗数十亿美元算力的公司,这个差额是天文数字。
3.3 推理成本曲线:过去几年降了 99%
OpenAI CFO Sarah Friar 在同期发布的文章《The Full Stack Behind Abundant Intelligence》中给出了一个惊人数字:
“过去几年,AI 推理的成本下降了大约 99%。”
这个数字的构成是复合效应:
- 训练效率提升 20% × 芯片利用率提升 20% × 数据中心开销降低 20% = 总成本降低 73%(不是 60%,是复合增长)
- 多代芯片迭代(H100 → H200 → GB200 → Jalapeño)持续压缩每 token 成本
- 模型架构优化(MoE、线性注意力等)降低单次推理的计算量
但问题是:这些成本下降有多少传递给了用户?
一个值得深思的数据:2026 年 4 月,OpenAI 发布 GPT-5.5 时,API 定价翻倍(输入 5.00,输出 30),但同期 GB200 NVL72 的部署让 OpenAI 的每 token 服务成本下降了约 35 倍。
OpenAI 的成本降了 35 倍,你的账单涨了 2 倍。 中间的差额全部变成了 OpenAI 的利润。
Jalapeño 的逻辑是一样的:自研芯片让 OpenAI 进一步压缩推理成本,但这些节省不会自动传递给 API 用户——它们会变成 OpenAI 的定价弹药,用于在企业市场攻城略地。
3.4 对运维团队的直接冲击
容量规划模型要重写
传统的 AI 基础设施容量规划基于”GPU 数量 × 单卡利用率”。Jalapeño 的出现意味着:
- 同等电力预算下,推理容量可能翻倍
- 但 Jalapeño 是 OpenAI 的自用芯片,不会出现在云服务商的 SKU 里
- 你感受到的变化是:OpenAI 的 API 定价可能进一步下降,或者在同等价格下提供更好的延迟和吞吐
Auto-scaling 策略要调整
Agent 工作负载的 token 消耗是普通聊天的 15 倍(OpenRouter 数据)。当推理芯片效率提升,Agent 的经济可行性也随之提升:
- 过去:一个 Agent 任务消耗 15 倍 token → 成本太高,只用于高价值场景
- 现在:每 token 成本下降 → Agent 可以用于更多中等价值的自动化任务
- 运维影响:AI 驱动的运维自动化(AIOps)的 ROI 拐点提前到来
成本监控维度要升级
| 旧指标 | 新指标 |
|---|---|
| GPU 利用率 | 每 token 成本 |
| GPU 小时数 | 每百万 token 吞吐量 |
| 显存占用 | KV Cache 效率 |
| 网络带宽 | 端到端延迟(P50/P99) |
四、芯片不是孤岛:Jalapeño 的系统架构
一颗芯片再强,脱离系统谈性能都是耍流氓。Jalapeño 的机柜级设计才是真正的工程亮点。
4.1 机柜拓扑
4.2 去 NVIDIA 化的战略意义
Jalapeño 的网络栈完全基于 Broadcom Tomahawk 6,而非 NVIDIA NVLink。这不是技术选择,是战略声明:
- NVIDIA NVLink 提供高带宽节点内互联,但把你锁在 NVIDIA 生态里
- Broadcom Ethernet 让 Jalapeño 可以跨机柜扩展,完全不需要任何 NVIDIA 组件
OpenAI 每年在 GPU 基础设施上的支出超过 100 亿美元。当你的最大供应商同时也是你的竞争对手时,供应链独立性的价值无法估量。
对运维团队的启示:未来 2-3 年,你管理的基础设施可能会同时包含 NVIDIA GPU 集群和非 NVIDIA 的推理集群。 网络架构、监控工具、运维流程都需要为异构环境做准备。
五、对运维团队的实际建议
5.1 短期(2026 年底 – 2027 年初)
Jalapeño 初期部署量”极小”(Richard Ho 原话),2027 年才会显著放量。但信号已经明确:
- 关注 OpenAI API 定价变化:GPT-5.6 Sol 已经在促销降价(20 vs 原价 30),自研芯片量产后可能有更大空间
- 评估你的推理工作负载:哪些任务对延迟敏感(Agent 实时交互),哪些可以容忍批处理(数据处理、报告生成)
- 开始记录 token 消耗基线:为未来的成本对比做数据储备
5.2 中期(2027 – 2028 年)
混合架构将成为主流:
| 工作负载类型 | 推荐硬件 | 理由 |
|---|---|---|
| 模型训练/微调 | NVIDIA GPU | 灵活性、CUDA 生态、不规则计算模式 |
| 实时推理(低延迟) | 自研 ASIC / TPU | 每瓦吞吐量优势 |
| 批处理推理 | 自研 ASIC / TPU | 成本优先 |
| 实验/原型验证 | NVIDIA GPU | 快速迭代、生态支持 |
运维新技能要求:
- 理解 token 经济学:不再只看”GPU 利用率”,而是”每 token 成本”
- 硬件感知调度:根据工作负载特征选择最优后端
- 异构监控:同时管理 GPU 集群和 ASIC 集群的指标、告警、日志
5.3 长期架构建议
- 成本监控升级:从”GPU 小时数”转向”每百万 token 成本”作为核心 KPI
- 推理路由层:构建智能路由,将延迟敏感请求导向高性能后端,批处理任务导向高吞吐后端
- 供应商多元化:不要把所有推理负载押注在单一硬件供应商上
- 关注竞品动态:
- NVIDIA Vera Rubin NVL72(2026下半年出货,每瓦吞吐比 GB300 提升 5.4×)
- Google TPU v6e(4.7× 性价比优势 vs H100)
- AWS Trainium 3(比 Blackwell 低 50% TCO)
- 电力预算前置:如果你在规划新的数据中心或扩容,按”每 kW 推理吞吐量”而非”每机柜 GPU 数量”来评估方案
六、结语:从”管服务器”到”管 token 经济”
OpenAI 造芯片不是为了卖芯片。Jalapeño 永远不会出现在任何云服务商的 SKU 里——它是 OpenAI 的自用武器。
但它改变的是整个行业的成本结构和竞争格局:
- NVIDIA 的护城河正在从”唯一选择”变成”最佳选择之一”
- 推理正在取代训练,成为 AI 基础设施的主要成本中心
- 自研芯片从 Google、AWS 的专属能力,扩展到了 OpenAI 这样的模型公司
- 运维团队的核心能力正在从”管服务器”升级到”管 token 经济”
当推理成本以每年 2-3 倍的速度下降,而你的 AI 工作负载以每年 10 倍的速度增长时,基础设施的经济学比基础设施的物理形态重要得多。
Jalapeño 的真正意义不是”OpenAI 造了一颗快芯片”,而是推理经济学的范式转移已经从纸面论证进入了硅片实测。
对于运维团队来说,现在是时候学习”token 经济学”了——这不再是算法工程师的专利,而是基础设施团队的必修课。