GLM-5.3の衝撃的な性能向上と背景

Z.aiが発表したGLM-5.3は、既存のGLM-5.2と同じ743Bの基盤モデルを使用しながらも、驚くべき性能向上を遂げています。この性能向上は、基盤モデルの再トレーニングではなく、より多くのタスク環境、多様な環境タイプ、そして長期間にわたる後処理訓練によって実現されたものです(出典)。

GLM-5.3は、基盤モデルを再トレーニングすることなく、後処理訓練のみで驚異的な性能向上を達成しました。

MarkTechPostのレポートによると、特にコーディングベンチマークであるTerminal-Bench 3.0では、GLM-5.2の4.6からGLM-5.3では28.3へと大幅なジャンプを見せています。また、サイバーセキュリティのCyberGymでは84.5%のスコアを達成し、Z.aiの予想を上回る結果となったようです(出典)。

主要なLLMとのベンチマーク比較を以下の表にまとめました。

モデル名 MMLU GSM8K HumanEval AGIEval
GLM-5.3 高い 高い 非常に高い 高い
Moonshot AI Kimi K3 中 中 中 中
Claude Fable 5 高い 高い 高い 高い
GPT-5.6-Sol 非常に高い 非常に高い 非常に高い 非常に高い

具体的なスコアの数値は主記事に記載されていませんが、多くのベンチマークでMoonshot AIのKimi K3を上回り、一部ではClaude Fable 5やGPT-5.6-Solをも凌駕していると報告されています。この事実には正直、ここまで来たかという驚きを感じます。

特にコーディング分野での性能向上は、私の普段の業務や個人プロダクト開発において非常に興味深いポイントです。Claude Codeを使っている身としては、こういった競合モデルの動向は要注目だと感じます。

中国におけるAI開発の加速と国際競争

今回のGLM-5.3の発表は、中国のAI研究機関が世界のAIフロンティアにしっかりと追随していることを明確に示しています。Z.aiは中国の清華大学からスピンアウトした企業であり、GLMシリーズはオープンソースのTransformerベースモデルとして知られています。中国は近年、大規模なデータセットと計算リソースを背景に、AI分野での急速な発展を遂げています。

中国のAI研究は、大規模なデータと計算リソースを背景に、世界のフロンティアに追いつきつつあります。

特に、中国のデータ産業が持つ規模と多様性は、AIモデルの訓練において大きな優位性をもたらしている可能性が高いです。膨大な中国語データはもちろんのこと、英語圏のデータも豊富に収集されていると考えられます。これにより、GLM-5.3のような高性能モデルが、基盤モデルの再訓練なしに高度な後処理訓練で進化できる基盤が築かれているのではないでしょうか。

このような高性能モデルが中国から登場することは、AI開発における国際的な競争がさらに激化していることを示唆しています。各国の企業や研究機関がしのぎを削る中で、コスト効率の良い開発手法(基盤モデルの再訓練なしでの性能向上)は、今後ますます重要になっていくと感じます。

APIとオープンウェイトでの提供計画

GLM-5.3は現在、Z.aiのコーディングプランでのみ利用可能ですが、近日中にAPIを通じて提供される予定です。さらに、発表から約2週間後にはHugging Faceでオープンウェイトとして公開されるとのことです(出典)。

GLM-5.3はAPIでの提供に加え、約2週間後にはHugging Faceでオープンウェイトとして公開される予定です。

オープンウェイトでの公開は、開発者にとって非常に大きな意味を持ちます。ローカル環境での試用や、自作PCでのチューニングが可能になるため、個人の研究やプロダクトへの組み込みが容易になります。

Pythonバインディングがあれば、自分のスクリプトに使えそうな予感がしますし、RTX 3090を搭載した自作PCでStable DiffusionやローカルLLMを動かしている私にとっては、これはかなり嬉しいニュースです。ドキュメントが充実していることを期待したいところです。

特にコーディング性能が高いとされているため、個人プロダクトのコード生成やデバッグ支援に活用できるかもしれません。GCPのCloud Runなどのサーバーレス環境でAPIを呼び出す際にも、その応答速度や精度が重要になってきますので、公開され次第、実際に試してみたいと思います。