NVIDIAが直面するAIデータセンターのボトルネック

NVIDIAはAIブームに乗って莫大な利益を上げていますが、その成功の裏で、新たな課題が浮上しています。それは、高性能AI GPUを運用するためのデータセンターの物理的な制約です。

特に、電力供給と高度な冷却システムが不足している現状が、次世代GPUの普及を阻むボトルネックとなっています。(出典)

NVIDIAは、自社のGPUを販売するためには、それらを設置できるデータセンターが十分に存在する必要があると認識しています。そして、データセンターは、適切な電力を供給できる場所にしか構築できません。この問題は、AIワークロードの需要が指数関数的に増加するにつれて、より深刻化しています。

NVIDIAは、自社のGPUを販売できるデータセンターの数と、それらをサポートするための十分な電力供給が、その成長の鍵であると考えています。

液体冷却が必須となる次世代GPU

この課題をさらに複雑にしているのが、NVIDIAのGPU進化です。2024年までは、NVIDIAのほとんどのシステムは空冷式で、既存のデータセンターにも比較的容易に導入できました。

しかし、Blackwell世代のGPUが登場し、特に強力なNVL72システムでは、すべての施設が対応できるわけではない液体冷却が必要となりました。(出典)

液体冷却対応施設は、従来の空冷施設よりも建設が困難です。計算密度が高く、重量も増え、より多くの電力と、冷却液を循環させるための冷却分配ユニット(CDU)が必要となります。来年からは、約250kWから600kWへとラックの消費電力が増加するため、この問題はさらに深刻化すると見られています。

特にRubin世代のGPUでは、AIトレーニングや推論に広く使われるHGXおよびNVLスタイルのフォームファクターにおいては、空冷GPUは過去のものとなる可能性が高いとのことです。これは、GPUを自宅の自作PCで動かす私にとっても、今後の消費電力や冷却方法の進化には非常に興味がありますね。企業レベルでのインフラは想像を絶する規模になっていると感じます。

項目 旧来の空冷システム Blackwell/Rubin世代(液体冷却)
冷却方式 空冷が主流 液体冷却が必須(特に高性能システム)
設置の容易さ 比較的容易 施設の改修や専用設備が必要
計算密度 低〜中 高
重量 軽〜中 重
電力消費 低〜中 高(ラックあたり250kWから600kWへ増加予定)
必要設備 標準的なデータセンター設備 大容量UPS、PDU、冷却分配ユニット(CDU)

Cloverleafへの投資が意味するもの

NVIDIAは、こうした状況に対応するため、以前からデータセンターの準備が整った顧客を優先してきました。また、OpenAI、CoreWeave、Nebiusといったモデル開発企業やニュークラウドパートナー企業への融資や直接投資も行ってきました。(出典)

今回のCloverleafへの少数株主としての投資は、この戦略の最新の例です。2024年に設立されたCloverleafは、データセンターを構築するための土地と電力インフラを専門としています。

彼らは、電力会社とデータセンターの間に入り、サイト開発に必要な主要インフラを提供することで、中立的な立場からインフラの基盤を築いています。(出典)

NVIDIAは、昨年秋にDSXプラットフォームを導入し、今春に正式ローンチしました。これは、特定の計算量に対応するために必要な電力、冷却インフラ、スペースの設計図を提供するものです。

しかし、設計図があるだけでは、それを実現する土地と電力インフラがなければ意味がありません。今回のCloverleafへの投資は、この物理的なボトルネックを解消し、NVIDIAのGPUを求める顧客が、適切なデータセンター容量を確保できるよう支援するためのものと言えるでしょう。

私個人の意見としては、これはNVIDIAがAIエコシステム全体を垂直統合しようとしている明確な兆候だと感じます。GPUの販売だけでなく、そのGPUを動かすためのインフラ全体にまで影響力を及ぼそうとしているのではないでしょうか。

GCPを主軸に使っている身としては、クラウドプロバイダーがどのようにこれに対応していくのか、あるいはNVIDIAとの新たな協業の形が生まれるのか、非常に興味深いです。NVIDIAが自社の技術だけでなく、データセンターの「場所」と「電力」という最も基本的な課題にここまで踏み込むのは、AIの未来を本気で加速させようという意思の表れでしょう。