AI

AI推論をCPU・GPU・専用チップに分け、クラウド上で実演

この記事のポイント

  1. 実現したこと

    企業向け推論クラウドで、商用顧客Together.aiのワークロードが稼働している。

  2. 実現の仕組み

    Xeon 6が制御と実行、Blackwell GPUがprefill、SN40 RDUがdecodeを担当する。

  3. 得られた結果

    分離型推論システムの実動作が、ロサンゼルスのデータセンターからComputex会場に披露された。

  4. 従来との違い

    prefillとdecodeを別の演算器へ割り当てた構成が、実演できる段階に達した。

CPUが推論を制御し、GPUが入力を処理し、RDUが出力を生成するクラウド計算基盤
AI生成画像

AI推論の処理をCPU、GPU、専用チップへ分けたシステムが、企業向けクラウド上で実動作した。入力を処理するprefillと出力を生成するdecodeを別の演算器に割り当て、データセンターから実演した。

企業向けクラウドに組み込まれた分離型推論

Vista Equity PartnersとCambium Capitalが設立した企業向け推論クラウドのVector Core Computeは、推論の処理を異なる演算器へ分ける構成を公開した。推論要求の制御、prefill、decodeをそれぞれ担当する演算器を定めている。

CPUが制御し、GPUがprefillを処理

実演した構成では、Intel Xeon 6プロセッサーが推論処理の制御と実行を担当した。入力を先に処理するprefillは、NVIDIA Blackwell GPUに割り当てられている。

SN40 RDUによるdecodeとデータセンターからの実演

出力を順次生成するdecodeは、SambaNova SN40 RDUが担当した。Intel、SambaNova、Vista Equity Partners、Cambium Capitalは、この構成の実動作をComputexの会場で披露した。

実演されたシステムは会場内だけで動いていたわけではない。米ロサンゼルスにあるVector Core Computeのデータセンターから稼働していた。

商用顧客のワークロードも稼働

AI開発基盤を提供するTogether.aiは、このエージェント向けクラウドの最初の商用顧客となった。Together.aiのワークロードは、Vector Core Computeのクラウドで稼働している。