現代のコンピューティングに合わせたベンチマークの再定義

Primate Labsは、Geekbench 7のリリースにおいて、近年のテクノロジー業界の変化、特にAIや機械学習の普及に強く言及しています。Geekbench 6が2023年初頭に登場して以来、オンデバイスAI推論や画像処理、動画編集、要求の厳しいゲームなど、CPUとGPUのパフォーマンスがより広範な日常業務で重要になっていると指摘しています(出典)。

Geekbench 7は、AIや機械学習が普及した現代のデバイス利用状況を、より正確に測定するために設計されています。

これにより、単なる数値上の性能だけでなく、実際のアプリケーションでの使用感に近い結果が得られることが期待されます。自分の自作PCでローカルLLMを動かす身としては、ベンチマークがより実用的なユースケースに近づくのは大歓迎だと感じますね。

GPUベンチマークのAI・コンテンツ作成ワークロード強化

Geekbench 7では、GPUベンチマークが大幅に刷新され、機械学習とコンテンツ作成ワークロードに重点が置かれています。具体的には、以下の新たなテスト項目が追加されています(出典)。

  • 機械学習向けワークロード:
    • 顔追跡とリアルタイムフィルター効果(ソーシャルメディアアプリの顔フィルターを再現)
    • 機械学習による画像アップスケーリング(コンテンツ作成アプリの超解像機能を再現)
    • ビデオ会議ストリームでの背景ぼかし(バーチャル背景機能を再現)
  • 画像編集・合成ワークロード:
    • RAW画像処理
    • LUTベースの動画カラーグレーディング
    • パストレーシング
    • 流体シミュレーション

さらに、対応するGPU APIには、従来のOpenCL、Vulkan、Metalに加え、NvidiaのCUDAが追加されました。RTX 3090を搭載した自作PCを使っている私としては、CUDAのサポートは非常に嬉しい点です。

Stable Diffusionなどの画像生成AIをローカルで動かす際にも、よりNvidia製GPUの性能を正確に評価できるようになるでしょう。これは、AI開発者やクリエイターにとってかなり朗報ではないでしょうか。

マルチコア性能とメディア処理テストの改善

Geekbench 7では、Geekbench 6からの改善点として、マルチコア性能の測定方法が見直されました。Primate Labsによると、実際のタスクが通常マルチスレッドで実行される場合にのみ、ワークロードが複数のスレッドで実行されるようになっています。例えば、ウェブブラウザは一般的にシングルスレッドまたは軽量なスレッド処理であるため、HTML5ブラウザテストはマルチコアスイートから除外されたとのことです(出典)。

この変更により、より現実世界のアプリケーション動作に即したマルチコアスコアが得られると期待されます(出典)。

メディア性能についても、Geekbench 7はCPUがオーディオおよびビデオのエンコード、デコード、処理をどのように扱うかを測定する新しいワークロードを追加しています。特に注目すべきは以下のテストです。

  • AV1コーデックによる画面共有ビデオのエンコード(ビデオ会議アプリの画面共有機能を再現)
  • Opusコーデックによる音楽および音声の圧縮(ボイスメモやポッドキャストアプリを再現)
  • Whisper音声認識モデルによるライブキャプション生成を伴うビデオ・オーディオのデコード(自動字幕付きビデオ再生を再現)

Whisperモデルを使ったテストが組み込まれるというのは、AIが日常に浸透していることを強く感じさせます。動画関連の個人プロダクトを開発しているエンジニアの方にとっては、非常に興味深い測定項目だと思いますね。

テストデータセットの規模と多様性の拡大

Geekbench 7では、テスト全体で使用されるデータセットのサイズと多様性も拡大されています。例えば、ファイル圧縮ワークロードには、ソースコード、オブジェクトコード、テキストドキュメントなど、より多様なアーカイブが含まれるようになりました。PDFビューアテストも、公園の地図、技術文書、学術論文など、より広範なファイルをカバーしています(出典)。

これは、ベンチマークの現実世界への適合性をさらに高めるための重要な改善だと感じます。データセットが貧弱だと、最新のCPUやGPUの性能を正確に測りきれないケースも出てくるでしょうから、このアップデートは歓迎すべき点です。

刷新された主要なベンチマーク項目を比較すると、以下のようになります。

項目 Geekbench 6の主な特徴 Geekbench 7の主な特徴
GPUベンチマーク 広範なコンピューティングタスク 機械学習、コンテンツ作成に特化、CUDAサポート追加
マルチコア 特定のマルチスレッドワークロードでの実行 実世界のタスクがマルチスレッドの場合のみ実行(より現実的)
メディア処理 基本的なエンコード・デコード AV1、Opusコーデック、WhisperモデルによるAI字幕生成追加
データセット 一部の標準的なデータセット ソースコード、PDF多様化など、より大規模で多様なデータセット

このテーブルを見ると、いかに現代のPC利用状況を意識してアップデートされているかがよく分かります。