Semiconductor

ルネサスの組み込みAI半導体、計算の省略率に応じて処理周期を短縮

この記事のポイント

  1. 実現したこと

    試作した組み込みAI半導体で、ファンやヒートシンクを使わずにAI処理を実行できた。

  2. 実現の仕組み

    AIアクセラレーターが、モデル内の局所的な計算の省略率に合わせて処理サイクル数を動的に変える。

  3. 得られた結果

    ルネサスの試作評価では、AIアクセラレーターの電力効率が電源電圧0.8Vで最大23.9TOPS/Wに達した。

  4. 従来との違い

    CPUとAIアクセラレーターに、複雑な処理を担う回路再構成型プロセッサーを加え、処理を分担・並列化した。

カメラと小型移動ロボットにつながる組み込みAI評価基板の横に、計算を省いたタイルと並列処理の流れを概念的に描いた編集イラスト。
AI生成画像

組み込みAI半導体で、モデル内の計算の省略率に合わせて処理サイクル数を短くする技術が実装された。ルネサスの試作評価では、省略に対応しないモデル比でサイクル数が最少16分の1になった。CPUなどとの協調動作も組み込み、画像認識とロボット制御の処理を高速化する。

不規則に省かれた計算を並列処理へ変換する

認識精度への影響が小さい計算を省くpruningは、AIモデルの処理を軽くする手法だ。ただし、省く計算がモデル内で不規則に分布すると、ハードウェアが並列に計算する構造と合わず、処理効率が下がる。

半導体メーカーのルネサス エレクトロニクスは、この不整合に対応するため、画像認識用CNNでpruningのパターンや手法と認識精度の関係を分析した。その結果をAIアクセラレーターのDRP-AIの回路設計へ反映し、モデルを軽量化するソフトウェアも開発した。このソフトウェアが、不規則なpruningを含むモデル構成を効率的な並列計算へ変換する。

局所的な省略率に合わせて処理サイクル数を変える

並列計算へ変換したモデルを処理する際には、モデル内の場所によって計算を省く割合が変わる。今回のpruning対応技術であるflexible N:M pruning technologyは、その局所的な割合に応じて処理サイクル数を動的に変更する。消費電力、動作速度、認識精度の要求に合わせて、pruning率を細かく制御することができる。

ルネサスによると、この技術でAIモデルの処理サイクル数は、pruningに対応しないモデルの最少16分の1になった。消費電力も8分の1未満に抑えたとしている。サイクル数の削減と消費電力の削減は、それぞれ別の指標として示されている。

CPUとAI処理に回路再構成型プロセッサーを組み合わせる

新しい組み込みプロセッサーの構成は、CPUとAIアクセラレーターに、複雑な処理を担う動的再構成プロセッサーのDRPを加えた。DRPは処理内容に合わせて演算器間の回路接続を動作クロックごとに変え、必要な演算回路だけを動作させる。この構成で処理を分担し、並列に進める。

ルネサスは、自己位置推定と地図作成を行うSLAMで、DRPの瞬時のプログラム切り替えと、AIアクセラレーター・CPUの並列動作を実証した。組み込みCPUだけで動かす場合と比べ、動作速度は約17倍、動作時の電力効率は約12倍になったという。この比較は、AIモデルのpruningによるサイクル数削減とは別に、SLAMの協調処理で得られた結果である。

試作チップで冷却部品なしのAI処理を確認

ルネサスは、pruning対応アクセラレーターと異種プロセッサー協調技術を組み込んだAI-MPUを試作し、動作を確認した。試作評価では、AIアクセラレーターの電力効率が電源電圧0.8Vで最大23.9TOPS/Wに達し、主要なAIモデルでは10TOPS/Wの動作時電力効率を得た。TOPS/Wは、消費電力1W当たりに毎秒何兆回の演算を処理できるかを表す。

試作チップでは、ファンやヒートシンクを使わずにAI処理が可能なことも確認したという。ルネサスは、これらの技術を画像認識AI向けMPUのRZ/Vシリーズへ適用する予定だ。