GPU に頼らない AI 計算の可能性が論文で提唱される

米テネシー大学・オークリッジ国立研究所の Jack Dongarra 氏、スイス ETH チューリッヒの Torsten Hoefler 氏、日本の理化学研究所・東京工業大学の松岡聡氏という、HPC 分野の第一人者3名が、新論文『Do We Still Need GPUs? Rethinking AI and Scientific Computing on Matrix-Enhanced CPUs』(「GPU はまだ必要か?行列強化 CPU による AI・科学計算の再考」)を発表します。

GPU がなくても AI 学習や科学計算ができるのではないか——従来の常識に異議を唱える論文が、HPC の権威から発表される時代が来ました。

このような問いが注目される背景は、CPU のアーキテクチャが大きく変わったことにあります。従来の CPU は単純な演算が主でしたが、現在では以下のような GPU の特徴を備え始めています。

  • ベクトル・行列演算専用のエンジン
  • 混合精度(mixed precision)対応
  • HBM(高帯域メモリ)やメモリスタッキング技術
  • 統合インターコネクト

正直なところ、この動きは注目に値します。従来「GPU がないと AI 学習は遅くて使い物にならない」というのが業界の定説でしたから、CPU だけで実用的なパフォーマンスを出せるようになったというのは、かなり衝撃的な進展だと感じます。

オールCPU スーパーコンピュータ「LineShine」が世界最速を達成

今回の論文は、中国製 ARM サーバー CPU「LX2」を搭載したオールCPU スーパーコンピュータ「LineShine」の登場によって現実味を帯びてきました。2026年6月の最新 Top500 ランキングで、LineShine は世界最速の AI/HPC スーパーコンピュータとして認定されています(出典)。

3氏の論文では、以下の2つのオールCPU 設計マシンを比較・対比しています。

マシン名 Fugaku(富岳) LineShine 稼働開始時期
プロセッサ A64FX(ARM) LX2(ARM) 2021年3月 / 2025年秋頃
メモリ・インターコネクト Tofu D(6D トーラス) LX2 統合インターコネクト —
用途 AI/HPC ハイブリッド AI/HPC ハイブリッド —

興味深いのは、LineShine は GPU を一切搭載していないにもかかわらず、兆パラメータ規模の生成 AI モデルの学習と従来的な科学計算シミュレーション両方をサポートしているという点です。これまでなら GPU なしにこのレベルの性能を出すのは考えられませんでした。

なぜ CPU は当初 GPU に取って代わられたのか

GPU が計算エンジンとして台頭した根本的な理由は、CPU が複数精度での十分な FLOPS と、メモリ帯域幅を提供できなかったからです。

2010年代、NVIDIA の CUDA アーキテクチャが AI 計算の標準になったのは単なる商業的成功ではなく、技術的な必然性がありました。当時の CPU は、深層学習に必要な行列演算を高速かつ効率的に実行できる設計になっていなかったのです。

しかし、ここ数年の CPU 進化は目覚ましい。ARM ベースのサーバー CPU や次世代 x86-64 アーキテクチャは、以下のような GPU 的な機能を組み込み始めました。

  • 高度な SIMD(Single Instruction Multiple Data)ベクトル処理ユニット
  • 低精度計算(FP8・BF16)の効率的なサポート
  • 広いメモリ帯域幅(従来型 DRAM の大容量化と HBM 統合)
  • GPU のような高性能なオンチップキャッシュ

この方向性は自分たちの開発でも実感があります。ローカル LLM を自作 PC で動かすときも、最新の CPU の機能拡張によって、メモリアクセスのボトルネックが以前より緩和されるようになってきました。

現実的な課題:CUDA エコシステムの壁

一方で、GPU(特に NVIDIA)の優位性がすぐに失われるわけではありません。参考記事の「ZLUDA」プロジェクトからその課題が見えます。ZLUDA は、NVIDIA の CUDA で書かれたプログラムを AMD GPU などの非 NVIDIA GPU で実行できるツールですが、バージョン6で専任開発者による資金提供が終了し、個人プロジェクト化してしまいました(出典)。

これは象徴的な出来事です。どれだけ性能の良い代替 GPU やCPU が登場しても、CUDA で書かれた数百万行のコードとエコシステムを乗り換えるのは極めて困難だということです。AI エンジニアの方にとって、CUDA は単なる言語ではなく、既存資産そのものになっています。

GPU は技術的には置き換え可能になりつつあっても、実務的には CUDA エコシステムの圧倒的な優位性が存在します。

NVIDIA の設計複雑化も CPU 優位の追い風に

さらに興味深いのは、NVIDIA 自体の足踏みです。参考記事によると、NVIDIA は複雑な4ダイ設計の「Rubin Ultra」をキャンセルし、シンプルなデュアル GPU 設計に方向転換したと報じられています(出典)。

製造の複雑さが設計の障害になるという状況は、相対的に「シンプルな CPU 設計」に利がある状況を生み出しています。CPU メーカーは、既存の ARM や x86 アーキテクチャにベクトル演算ユニットを追加するだけで済みますが、NVIDIA は毎世代ごとに GPU アーキテクチャを一から設計し直さねばならないのです。

今後の展望:ハイブリッド時代か、CPU 一本化か

この論文の発表は、HPC と AI コミュニティに新たな議論をもたらしそうです。LineShine の成功により、オールCPU 設計でも実用的な AI 学習が可能だという前提が現実化しました。ただし、これが即座に業界標準になることはないでしょう。

向こう数年は、以下のような段階的な変化が予想されます。

  • 科学計算やシミュレーションなど、CPU で十分な分野は GPU 離脱が加速
  • 大規模言語モデル(LLM)の学習には、まだ GPU(または GPU 相当の演算性能)が選択肢として残る
  • CUDA 互換層(ZLUDA など)の技術が進展し、CUDA コード流用のハードルが下がる可能性
  • インターコネクト(OCI MSA など)の進化により、CPU 間の高速通信が実現し、スケーラビリティが向上

いずれにせよ、「GPU が唯一の選択肢」という状況は確実に終焉を迎えつつあります。エンジニアの方は、単に「最新の GPU を手に入れること」ではなく、「自分たちの用途に最適な計算プラットフォーム(CPU・GPU・カスタムチップの混合)を選び分ける能力」を磨く時代に入ったと言えます。