医療分野を想定したAIエージェントのタスク処理量で、CPU「Xeon 6」搭載環境が第5世代AMD EPYC搭載環境の1.66倍となった。Intelは処理履歴を記録・再生し、コード、入力、実行経路を揃えた24並列・60分間の比較でこの差を測定した。
計画から検証まで、複数段階を通るエージェント処理
AIエージェントは、計画を立て、ツールを選んで実行し、結果を検証して処理を繰り返す。半導体メーカーのIntelは、この一連の処理を対象にCPU搭載環境を比較した。
複数の段階を進む間、エージェントは会話履歴や実行コンテキスト、取得した知識を保持する。中間出力とワークフローの状態も引き継ぐため、評価対象にはモデルの応答生成に加えて、その前後で続く処理が含まれる。
処理履歴を再生して実行経路を揃える
比較用の負荷は、代表的なエージェントのワークフローを実行する段階で記録した。記録対象はワークフローの構成と実行特性であり、それを各基盤で再生する方式を採った。
再生時には各基盤が同じ処理履歴を受け取る。評価ごとにエージェントへ経路を選び直させる代わりに、比較する処理を固定し、基盤による実行の差を測る。
3種類のCPU環境を24並列で比較
Intelは、エージェントのタスク評価用ワークロードであるTerminal-Benchを使い、同じ決定的な負荷を3種類の実行環境へ与えた。対象はサーバー向けCPUのXeon 6、第5世代AMD EPYC、Arm v9.2Aをそれぞれ基盤とする環境だ。
コードと入力に加え、エージェントが辿る実行経路も全環境で統一した。タスクは24並列で実行し、60分間を評価区間とした。
診療情報の分析から暗号化・復元検証までを含める
医療分野の負荷には、診療記録の作成、診断を支える情報の検索、診断分析、不正検出、リスク評価を含めた。分子研究、ゲノム分析、検査診断も代表的なワークフローとして評価対象に入る。
分析以外のタスクとして、監査ログの圧縮・暗号化や、データ交換時の暗号化・検証・転送も実行する。バックアップの完全性と復元可能性を確かめる処理まで含め、医療分野のエージェントが担う異なる種類のタスクを組み合わせた。
医療タスクの処理量に1.66倍と4.5倍の差
Intelの測定では、60分間の医療分野評価でXeon 6搭載環境が最も高い正規化タスク処理量を示した。第5世代AMD EPYC搭載環境を基準にすると、その値は1.66倍だった。
Arm v9.2Aベースの環境との比較では、Xeon 6搭載環境の値は4.5倍となった。いずれも、同じ医療分野のワークロードを24並列で再生した条件における、エージェントタスクの処理量の比較である。