AI推論用アクセラレーターのGroq 3 LPXは、演算とデータ移動の時刻を事前に決め、その予定を電力制御にも使う。NVIDIAのシステム内試験では、急な電流需要に伴う電圧低下が60%超減った。
急な電流需要がチップの電圧を下げる
NVIDIAがVera Rubinプラットフォームに加える低遅延のAI推論用アクセラレーター、Groq 3 LPXは、推論中の電圧低下を抑えるために実行予定を電力制御へ利用する。行列演算などで電流需要が急増すると、チップの近くにあるデカップリングコンデンサーが電流を供給し、その放電によってチップの電圧が下がる。
基板上の電圧レギュレーターは供給電圧を保つが、インダクタンスのため需要の急増に瞬時には追従できない。チップは正常動作に必要な最低電圧を下回らないよう、供給電圧に余裕を持たせるガードバンドを使う。
256個のLPUの実行時刻から電流需要を予測
Groq 3 LPXのコンパイラーは、ラック内の256個のLPUについて、データをどこへ動かし、どの演算をいつ実行するかを、処理開始前にクロック単位で割り当てる。この実行スケジュールから、各クロック周期に必要となる電流も予測できる。
電流需要が増える時刻を事前に把握できるため、電圧低下を抑える制御を需要の変化に合わせて組み込める。演算とデータ移動の予定が、電力供給を準備するための入力になる。
供給側の準備と需要の変化を組み合わせて制御
Preemptive Power(PEP)は、予測した電流需要の変化が起こる前に電力供給系を準備する。一方、Clock Period Synthesis(CPS)は、需要の増減が急激にならないよう調整する。
二つの制御は、実行スケジュールから得た予測を異なる側面に使う。PEPが供給側を先回りさせ、CPSが需要の変化の鋭さを抑えることで、電圧低下への対処につなげる。
システム内試験で電圧低下が60%超減少
NVIDIAのGroq 3 LPXシステム内試験では、PEPとCPSを用いた方式によって電圧低下が60%超減った。これはチップの電圧変動についての試験結果であり、推論処理全体の消費電力が同じ割合で減ったという測定値ではない。
電圧低下を小さくできれば、最低電圧を守るために常時確保するガードバンドを縮める余地が生まれる。実行時刻の事前計画が、推論処理だけでなく電力供給の余裕の設計にも結び付く。