エッジ端末で会話履歴を引き継ぐAIエージェントの推論時間が短縮された。NVIDIAのTensorRT Edge-LLMは、Jetson AGX Thor上で1007ターンの評価課題を24分36秒で完了した。
1007ターンで測るエージェントの連続処理
MLPerf Inference v6.1のEdge Agentic性能評価は、20件の会話に含まれる1007ターンを再生する。モデルが関数を呼び出し、その結果を受け取って会話を続けるため、ターンが進むにつれて処理する履歴が長くなる。
NVIDIAのエッジ向け推論ソフトウェアTensorRT Edge-LLMは、Jetson AGX Thor開発キット1台で言語モデルQwen3.6-27Bを動かし、この課題を24分36秒で完了した。同じ端末とモデルを使うllama.cppの参照実行は2時間37分を要した。ただし、両者は量子化方式も異なり、この6.4倍という完了時間の差を単一の最適化だけの効果とはみなせない。
NVFP4量子化でモデルのデータ量を抑える
提出構成は、モデルの重みと計算途中の活性値に4ビット浮動小数点形式のNVFP4を使い、過去のトークンを参照するためのKVキャッシュにはFP8を使う。重みと活性値の表現を小さくすることで、メモリーから読み出すデータ量を抑える構成だ。
この構成では、量子化したモデルをTensorRT Edge-LLMがJetson AGX Thor上で実行する。長くなる会話履歴の処理には、量子化とは別に、すでに計算した内容を次のターンへ引き継ぐ仕組みが使われる。
会話履歴の共通部分をキャッシュから復元
エージェントの次の要求には、それまでの会話の大部分が再び含まれる。TensorRT Edge-LLMはその共通部分を見つけ、KVキャッシュに加えてモデルの再帰状態と部分的なKVページの状態を復元する。事前計算するのは、新しく加わった会話部分だけになる。
NVIDIAによると、今回の課題では入力トークンの約96%を保持済みのキャッシュから処理した。全1350万超の入力トークンのうち、新たに事前計算したのは約50万トークンだった。
木構造の候補をまとめて検証し、生成を進める
履歴を読み込んだ後の出力生成には、木構造の複数トークン予測を使う。候補となる続き方を複数の枝に分け、対象モデルが一度の処理で検証し、一致した経路を採用する。複数の候補トークンが採用されれば、生成を一度に数トークン進められる。
NVIDIAによると、この課題では3段階の線形予測方式と比べ、木構造の方式で生成処理の性能をさらに約40%高め得た。履歴の再計算を減らすキャッシュ再利用と、出力生成の手順を減らす複数トークン予測は、異なる処理段階に作用する。
出力速度と関数呼び出しの正確率
NVIDIAの提出結果では、出力速度は毎秒52.33トークンだった。関数を適切に選んで呼び出せるかを調べるBFCL v4の正確率は87.94%となった。
この正確率は単一ターンの関数呼び出しを評価した値である。一方、1007ターンの完了時間は、関数の結果を会話に戻しながら進む別の性能評価で測られた。二つの指標は、それぞれ出力の正しさと連続処理に要する時間を示している。