AI時代のネットワーク主役交代—NVSwitchとInfiniBandの歴史

かつてPCやサーバーのI/Oスキームを巡って競合が存在しましたが、最終的にInfiniBandが高速I/Oバスとして合意されました。しかし、ドットコムバブル崩壊後、業界はより汎用性の高いEthernetへとシフトし、InfiniBandは高性能・低遅延インターコネクトとして、VoltaireやMellanox TechnologiesによってHPC(高性能計算)分野で再興を遂げました。MellanoxはInfiniBandスイッチのASICとNICを提供し、Voltaireを2010年11月に2億1800万ドルで買収し、その地位を確固たるものにしています。

InfiniBandは20年以上にわたり低遅延インターコネクトの王者であり続けましたが、AI時代の到来により新たな競合と選択肢が生まれています。NVIDIAのNVSwitchは、特にAIワークロードにおいてGPU間のメモリを単一の共有メモリ空間として結合するための画期的な技術として登場しました。NVIDIAは過去12ヶ月の会計年度で257億4000万ドルの収益を上げており、これはEthernetとNVSwitchインターコネクトの合計売上高256億7000万ドルとほぼ同額であると推測されています(出典)。

InfiniBandは長らく低遅延インターコネクトの王者でしたが、NVIDIA NVSwitchはAIワークロードにおけるGPU間の超高速接続でその地位を脅かしています。

Ultra Ethernetの台頭とAIクラスタへの影響

2023年7月に設立されたUltra Ethernet Consortiumは、InfiniBandの低遅延・高帯域幅の特性と、Ethernetの高いスケーラビリティ、マルチテナンシー、QoS(Quality of Service)機能を融合させることを目指しています。これにより、Ultra EthernetはInfiniBandを凌駕するスケールアウトネットワークを実現し、100万エンドポイントをサポートするAIクラスタ構築を目指しています(出典)。

EthernetはNVIDIAのNVSwitchインターコネクトが担う「スケールアップ」領域にも進出し始めており、72アクセラレータのGPUメモリを結合し、遅延を許容すれば576デバイスまで拡張可能なネットワークにも対応しています。 Broadcom、Cisco Systems、そしてNVIDIA自身のようなEthernet ASICベンダーは、ポートホップ遅延とエンドツーエンド遅延を削減することで、Ethernetファブリックの性能を向上させています。特に大規模なハイパースケーラー、クラウドビルダー、AIモデル開発者の多くがUltra Ethernet技術への標準化に移行していると見られており、InfiniBandにとっては転換点となるかもしれません。

個人的には、InfiniBandもNVSwitchも素晴らしい技術だと感じています。特にNVSwitchが提供するGPU間のダイレクトな接続性は、大規模なLLM学習や推論において非常に強力なアドバンテージになると考えています。ただ、Ethernetが持つ汎用性とスケーラビリティが、今後どこまでInfiniBandの領域を侵食していくのかは非常に興味深いところです。

光回路スイッチング技術によるAIネットワークの進化

次世代のAIデータセンターでは、1ラックあたり数百、あるいは数千ものアクセラレータが搭載されるようになるでしょう。これには、昔ながらの電話交換機を思わせるような、大量の光学技術と回路スイッチング技術が必要不可欠になります。NVIDIAは、光回路スイッチング(OCS: Optical Circuit Switching)技術の発展を支援するために、Coherent、Lumentum、Marvellといった企業に総額60億ドルを投資し、さらにiPronicsの第2世代OCS技術開発を支援するために1億2500万ドルを追加投資しています(出典)。

パケットをスイッチングする代わりに、光をスイッチングするという発想は、まさに物理層からネットワークのボトルネックを解消しようとする動きで、これはかなり衝撃的なニュースです。OCSは、Broadcom TomahawkやMarvell Teralynx ASIのような従来のパケットスイッチとは異なり、文字通り光信号を直接切り替えることで、極めて低い遅延と高いスループットを実現します。

また、NVIDIAはMediaTekに35億ドルを投資し、MediaTekがカスタムAIアクセラレータにNVLink Fusionを採用することを発表しています(出典)。これは、NVIDIAのインターコネクト技術が、幅広いエコシステムに浸透していくことを示唆していると感じます。

項目 InfiniBand(従来) NVSwitch(AIスケールアップ) Ultra Ethernet(次世代)
主な用途 HPC、低遅延クラスタ GPU間接続、AI学習・推論 スケールアウト、AIクラスタ
特徴 超低遅延、高帯域幅 GPUメモリ統一アドレス空間 InfiniBand+Ethernetの融合
スケーラビリティ 比較的小規模なクラスタ 72〜576デバイス(現状) 100万エンドポイント(目標)
汎用性 限定的 NVIDIA GPUエコシステム内 高い(Ethernetベース)

AIネットワークの未来と選択肢

現在、InfiniBandはNVIDIAが主要なサプライヤーとなっており、しばらくはその地位を維持すると考えられます。しかし、Ethernetが持つスケールメリットと幅広い互換性により、InfiniBandは特定のニッチな分野に限定されていく可能性があります。AIの進化は目覚ましく、より大規模で複雑なモデルを効率的に学習・推論するためには、ネットワーク技術の革新が不可欠です。

NVSwitchが提供するGPU間の超高速接続は、大規模なLLM(大規模言語モデル)の学習において、まさに「喉から手が出るほど欲しい」機能ではないでしょうか。自分の個人プロダクトでもLLMのローカル実行を試していますが、GPUメモリのやりくりには常に悩まされます。NVSwitchのような技術は、将来的にローカルLLM環境の性能を劇的に向上させる可能性を秘めていると感じます。

Ultra EthernetがEthernetの強みを生かしつつ、InfiniBandの性能にどこまで肉薄できるかが、今後のAIネットワークの勢力図を大きく左右するでしょう。どの技術が主導権を握るかはまだ断定できませんが、開発者としてはそれぞれの特徴を理解し、最適な選択をしていく必要がありそうです。