AI

JetsonのAIエージェント推論、参照実装の6.4倍速で1007ターンを完了

この記事のポイント

  1. 実現したこと

    Jetson AGX Thor開発キット1台で、AIエージェントの連続する1007ターンを処理した。

  2. 実現の仕組み

    重みと活性値のNVFP4量子化に、会話履歴のキャッシュ再利用と木構造の複数トークン予測を組み合わせた。

  3. 得られた結果

    NVIDIAの測定では、課題を24分36秒で完了し、出力速度は毎秒52.33トークンだった。

  4. 従来との違い

    同じ端末とモデルによるllama.cppの参照実行では2時間37分かかった課題を、24分36秒で完了した。

会話履歴のキャッシュを再利用し、候補経路から出力を選ぶエッジAI推論の概念図。
AI生成画像

エッジ端末で会話履歴を引き継ぐAIエージェントの推論時間が短縮された。NVIDIAのTensorRT Edge-LLMは、Jetson AGX Thor上で1007ターンの評価課題を24分36秒で完了した。

1007ターンで測るエージェントの連続処理

MLPerf Inference v6.1のEdge Agentic性能評価は、20件の会話に含まれる1007ターンを再生する。モデルが関数を呼び出し、その結果を受け取って会話を続けるため、ターンが進むにつれて処理する履歴が長くなる。

NVIDIAのエッジ向け推論ソフトウェアTensorRT Edge-LLMは、Jetson AGX Thor開発キット1台で言語モデルQwen3.6-27Bを動かし、この課題を24分36秒で完了した。同じ端末とモデルを使うllama.cppの参照実行は2時間37分を要した。ただし、両者は量子化方式も異なり、この6.4倍という完了時間の差を単一の最適化だけの効果とはみなせない。

NVFP4量子化でモデルのデータ量を抑える

提出構成は、モデルの重みと計算途中の活性値に4ビット浮動小数点形式のNVFP4を使い、過去のトークンを参照するためのKVキャッシュにはFP8を使う。重みと活性値の表現を小さくすることで、メモリーから読み出すデータ量を抑える構成だ。

この構成では、量子化したモデルをTensorRT Edge-LLMがJetson AGX Thor上で実行する。長くなる会話履歴の処理には、量子化とは別に、すでに計算した内容を次のターンへ引き継ぐ仕組みが使われる。

会話履歴の共通部分をキャッシュから復元

エージェントの次の要求には、それまでの会話の大部分が再び含まれる。TensorRT Edge-LLMはその共通部分を見つけ、KVキャッシュに加えてモデルの再帰状態と部分的なKVページの状態を復元する。事前計算するのは、新しく加わった会話部分だけになる。

NVIDIAによると、今回の課題では入力トークンの約96%を保持済みのキャッシュから処理した。全1350万超の入力トークンのうち、新たに事前計算したのは約50万トークンだった。

木構造の候補をまとめて検証し、生成を進める

履歴を読み込んだ後の出力生成には、木構造の複数トークン予測を使う。候補となる続き方を複数の枝に分け、対象モデルが一度の処理で検証し、一致した経路を採用する。複数の候補トークンが採用されれば、生成を一度に数トークン進められる。

NVIDIAによると、この課題では3段階の線形予測方式と比べ、木構造の方式で生成処理の性能をさらに約40%高め得た。履歴の再計算を減らすキャッシュ再利用と、出力生成の手順を減らす複数トークン予測は、異なる処理段階に作用する。

出力速度と関数呼び出しの正確率

NVIDIAの提出結果では、出力速度は毎秒52.33トークンだった。関数を適切に選んで呼び出せるかを調べるBFCL v4の正確率は87.94%となった。

この正確率は単一ターンの関数呼び出しを評価した値である。一方、1007ターンの完了時間は、関数の結果を会話に戻しながら進む別の性能評価で測られた。二つの指標は、それぞれ出力の正しさと連続処理に要する時間を示している。