AI

エージェント型AI推論の入力処理と出力生成をGPUと専用演算器に分ける設計

この記事のポイント

  1. 実現したこと

    エージェント型AI推論の工程を異なる演算器に割り当てる共同設計が示された。

  2. 実現の仕組み

    GPUがprefill、SambaNovaのRDUがdecode、Xeon 6がホストとアクション処理を担う設計だ。

  3. 得られた結果

    両社は、Xeon 6を使う構成でx86系ソフトウェアとの互換性を保つとしている。

  4. 従来との違い

    IntelとSambaNovaは共同設計の契約を締結し、2026年後半の提供を見込む段階へ進んだ。

GPUのprefill、SambaNova RDUのdecode、Xeon 6のホスト処理をつなぐ推論構成の編集イラスト
AI生成画像

エージェント型AI推論の工程を、GPU、SambaNovaのRDU、Intel Xeon 6に分けて処理する設計が示された。入力を処理するprefill、出力を生成するdecode、ホストとアクション処理に、それぞれ役割を割り当てる。

推論の工程ごとに演算器を割り当てる

IntelとSambaNovaは、GPU、SambaNovaのRDU、Intel Xeon 6を組み合わせるエージェント型AI推論の共同設計を示した。両社は、この共同設計に関する契約を締結している。

GPUがprefill、RDUがdecodeを担う

推論の前段に当たるprefillはGPUが担当する。後段のdecodeにはSambaNovaのRDUを割り当て、高スループットで処理する設計とした。

Xeon 6をホストとアクション処理に配置

Xeon 6はホストCPUとアクションCPUを担う。IntelとSambaNovaは、このCPUを含む構成によって、データセンターで使われるx86系ソフトウェアとの互換性を保つとしている。

企業とクラウド向けに2026年後半の提供を見込む

共同設計する製品は、企業、クラウドプラットフォーム、主権AI向けに2026年後半の提供が見込まれている。今回示されたのは、各工程に演算器を割り当てる設計と提供予定である。