AI

AMD、GPU72基を統合したAIラック「Helios」を生産開始

この記事のポイント

  1. 実現したこと

    AIラックのGPU「MI455X」は、PyTorch、vLLMなどを利用するためのソフトウェア対応が完了したとAMDはしている。

  2. 実現の仕組み

    HeliosはGPU72基とCPU18基を、用途別のネットワークとAIソフトウェア基盤ROCmで組み合わせる。

  3. 得られた結果

    Metaは、大規模導入に向けてHelios上でワークロードの試験・検証を開始した。

  4. 従来との違い

    AMDのAI計算基盤に初のラック規模製品Heliosが加わり、生産段階に入った。

明るいデータセンターの通路に立つ、計算モジュール、サーバー、ネットワーク機器をまとめたAIラックの編集イラスト。内部の機器は束ねたケーブルで接続されている。
AI生成画像

GPU72基とCPU18基を通信・ソフトウェアまで組み合わせたAIラック「Helios」が生産段階に入った。AMD初のラック規模AI計算基盤として、ハードウェアの製品化と、利用するAIソフトウェアの対応が進んでいる。

GPU72基とCPU18基をラック単位で組み合わせる

AMDは、AI計算基盤Heliosを発売し、生産段階に入ったとしている。構成の中心は、AI計算用GPUのAMD Instinct MI455Xを72基と、サーバー用CPUの第6世代AMD EPYC「Venice」を18基組み合わせたラックだ。

これらの接続には、ネットワーク製品群AMD Pensandoのフロントエンド、スケールアップ、スケールアウト用ネットワークを使用する。GPUとCPUだけでなく、接続を担う通信部分もラックの構成に含めている。

ROCmを実行基盤に、MI455Xのソフトウェア対応が進む

ラックのソフトウェア基盤には、AMDハードウェア上でAIを開発・展開するためのROCmを使用する。AMDは、AI開発・実行に使うPyTorch、Hugging Face、vLLM、SGLangがMI455Xに対応済みとしている。

Metaが実際のワークロードの検証を開始

このラック上で、Metaは大規模導入の準備となるワークロードの試験・検証を開始した。ラックの生産と並行して、利用側でも実際に動かす処理の検証が始まっている。

GPT系の処理を最適化し、年内の稼働を予定

OpenAIとAMDは、GPUプログラミング用のTritonとROCmを利用し、MI455XとHelios上でGPT系ワークロードを最適化している。最適化の対象は、GPUからラック、ソフトウェアまでに及ぶ。

OpenAIは、Heliosの稼働を2026年第4四半期に開始する見込みとしている。導入は2027年を通じて加速する予定だ。