Jetson上の推論モデルにNVFP4量子化と投機的デコーディングを重ね、処理負荷と検証回数を同時に減らす構成が示された。NVIDIAの測定では、BF16比で最大6.28倍のデコードスループットを得た。
推論ループをJetson上でローカル実行
コンパクトなオープンモデルが備える推論機能とエージェント機能を、エッジAIプラットフォームのJetson上でローカル実行できるようになった。NVIDIAによると、2026年に登場したモデルには、以前は大規模なデータセンターシステムを必要とした機能をJetsonで実行できるものがあるという。
モデルのローカル展開には、推論フレームワークのvLLMやllama.cppを利用できる。推論ループをデータセンターへ全面的に依存させず、処理対象のセンサーやシステムに近い機器で動かせる構成となる。
DenseとMoEで異なるトークン当たりの計算範囲
ローカル推論の処理量は、モデルの総パラメータ数だけでは決まらない。DenseモデルのQwen3.8-27Bは、トークンを生成するたびに全270億パラメータを有効化する。
Mixture of Experts(MoE)モデルのNemotron 3.5 Lightningは、総パラメータ数が300億である一方、トークンごとに有効化するのは30億パラメータである。全パラメータを使うDense構造と一部だけを使うMoE構造では、モデル規模が近くてもトークン当たりの計算範囲が異なる。
NVFP4量子化でモデル実行ごとの負荷を削減
通常のデコードでは、応答を1トークンずつ生成する。次のトークンへ進むたびにモデルを再実行するため、生成を速めるには各実行の負荷を軽くする方法と、1回の実行で進む生成量を増やす方法がある。
NVFP4量子化は前者に当たり、低精度の値を使って、各実行でGPUが移動、処理するデータ量を減らす。NVIDIAは、この低精度化によって生成速度を高め、メモリ使用量を減らせるとしている。
候補トークンの一括検証で生成を複数段進行
投機的デコーディングは、1回の検証で進められるトークン数を増やす。小さなドラフトモデルが複数の候補トークンを提案し、出力の最終判断を担うメインモデルが候補をまとめて検証する。
メインモデルが複数の候補を受理すれば、生成は1回の検証で複数トークン分進む。NVIDIAのJetson測定では、この仕組みをNVFP4と組み合わせ、各モデルで最速だった構成を使うことで、BF16比のデコードスループットが最大6.28倍になった。
対象モデルと処理条件に合わせて構成を選定
Jetsonで動作する投機的デコーディング手法には、MTP、DFlash、DSparkがある。候補の生成方法や評価方法が異なるため、最速となる手法とドラフトチェックポイントは対象モデルによって変わる。
デコードスループットはワークロードの種類によっても変化する。NVIDIAは、対象用途を代表するプロンプトを使い、必要な判断、ツール利用、応答パターンに沿ってモデルと構成を検証するよう求めている。