OpenAIの「Jalapeño」が推論性能で既存チップを凌駕

OpenAIは米スタンフォード大学で開催された半導体開発カンファレンス「Hot Chips」で、同社が独自開発したAIアクセラレータ「Jalapeño」の全貌を明らかにしました。これはBroadcomとの協力体制のもとで開発され、AIがAIのために設計した、一連のカスタムシリコンの第一弾と位置付けられています。 (出典)

Jalapeñoは、特に 推論(Inference) に特化して設計されており、NVIDIAの既存GPUシステムと比較して、高いスループットと低いレイテンシを実現するとOpenAIは主張しています。これはかなり衝撃的なニュースです。これまでOpenAIはNVIDIAなどのハードウェアパートナーに依存してきましたが、自社開発チップがこれほどの性能を発揮するとは、正直、ここまで来たかという感じがしますね。

「Jalapeñoは、既存の最先端技術を大きく上回る性能向上を達成している。ワットあたりのAI処理量が増え、応答時間も速くなっている。」(Richard Ho, OpenAI ハードウェア責任者) (出典)

ベンチマークで明らかになった「Jalapeño」の驚異的な性能

SemiAnalysisの「InferenceX」ベンチマークスイート(非公式テストとされています)での初期テスト結果は、Jalapeñoが推論に特化した「ビースト」であることを示しています。GPT-OSS-120B、DeepSeek R1、Kimi K2.5といったモデルでのテストでは、競合チップと比較して、以下の性能向上が見られました。

項目 競合チップ Jalapeño
ピークスループット(AIワーク量) 1.0x 1.5x〜1.9x
エンドツーエンド・レイテンシ 1.0x 1.7x〜3.6x 低減
超低レイテンシ推論速度 1.0x 2.1x〜4.1x 高速

これらの数値は、OpenAIが特に力を入れている超低レイテンシ推論の分野で、Jalapeñoが圧倒的な優位性を持つことを示唆しています。私の個人プロダクトでも、LLMの応答速度はユーザー体験に直結するため、この性能向上は非常に魅力的です。Pythonバインディングが提供されれば、すぐにでも試してみたいところです。

また、システムレベルでは、Jalapeñoシステムは128個のアクセラレータを搭載し、合計で1.7エクサFLOPS(4ビット計算)、27.5TBのHBM4メモリ、そして約2PB/sのメモリ帯域幅を実現しています。特にメモリ帯域幅は、推論性能において極めて重要であるため、競合システムと比較しても非常に高い水準にあると言えるでしょう。

なぜOpenAIは自社チップを開発するのか?

OpenAIがJalapeñoを開発する最大の理由は、LLMの「推論」にかかるコストと効率を最適化するためです。現在のLLMは巨大化の一途を辿っており、その推論を効率的に行うためのハードウェアは、サービスの提供コストとユーザーエクスペリエンスに直結します。

  • コスト最適化: 汎用GPUではなく、推論に特化したカスタムシリコンを用いることで、ワットあたりの性能を向上させ、長期的な運用コストを削減します。
  • 性能向上: 特定のタスクに最適化された設計により、既存の汎用GPUでは達成できないレベルのスループットと低レイテンシを実現します。
  • 供給安定化: 半導体サプライチェーンへの依存度を下げ、自社サービスの成長に合わせたチップ供給の安定化を図ります。

Jalapeñoはあくまで推論に特化したチップであり、OpenAIがこれまで利用してきたNVIDIAやAMDのGPUが担う「トレーニング」の役割を代替するものではない点には注意が必要です。トレーニングには高度なプログラマビリティが必要なため、引き続き汎用GPUが主軸となるでしょう。しかし、推論チップの開発は、OpenAIがAIインフラ全体のエンドツーエンドの最適化を目指していることの表れだと感じます。

競合システムとの比較と課題

OpenAIはJalapeñoの比較対象として、NVIDIAのGB200 NVL72およびGB300 NVL72ラックシステムを挙げています。これらのNVIDIAシステムは2024年と2025年にリリースされたものです。

項目 NVIDIA最新ラックシステム(例: Helios) OpenAI Jalapeñoラックシステム
演算性能(Compute) 1.46x〜2x 高速 ベースライン
メモリ容量 最大12% 多い ベースライン
メモリ帯域幅 85% 100%(ベースライン)
消費電力 1.0x 40%〜60% 低減(推定)

Jalapeñoシステムは演算性能やメモリ容量ではNVIDIAの最新システムに劣るものの、メモリ帯域幅で優位性を示し、さらに消費電力では40%〜60%の低減が見込まれています。ただし、OpenAIはシステムレベルの消費電力の詳細をまだ公開していません。これらの主張は、投機的デコーディングなどの性能向上技術を比較から除外しているため、純粋なハードウェア性能の比較である点も考慮する必要があります。

この手のベンチマークは常に眉唾物ではありますが、OpenAIが自社チップでここまで踏み込んできたのは、今後のAIハードウェア競争の激化を予感させますね。為替レートの変動も激しい中で、自社でハードウェアをコントロールできるメリットは計り知れないのではないでしょうか。