履歴を固定サイズへ圧縮し、必要な領域だけをブロック単位で参照する長文AIモデルが登場した。100万トークン条件の公開ベンチマークでは、Attentionカーネルのプリフィルがfull attention比で最大7.6倍高速になった。
圧縮層と検索層を3対1で配置
NVIDIAが技術検証した長文AIモデルのQwen3.8-Flash-Nextは、Gated DeltaNetとQwen Sparse Attentionを組み合わせたマルチモーダルMixture of Experts(MoE)モデルである。4層のうち3層をGated DeltaNet、残る1層をQwen Sparse Attentionとし、履歴の保持と元の系列からの検索を分担させる。
モデル本体は1250億パラメータで、これに510億パラメータのN-gram embeddingsを加え、トークンごとに60億パラメータを有効化する。ネイティブなコンテキストウィンドウは26万2144トークンで、YaRNを使うと100万トークンまで拡張できる。
Gated DeltaNetが履歴を固定サイズへ圧縮
長いコンテキストの推論では、Attentionの計算量に加え、過去のキーとバリューを保持するKVキャッシュのメモリ使用量が増える。Gated DeltaNetは入力を順番に処理しながら、過去のコンテキストを固定サイズの再帰状態へ継続的に圧縮する。
再帰状態は、それまでの履歴を後続トークンの処理へ引き渡す。状態の大きさが系列長に応じて増えないため、Gated DeltaNet層では系列が長くなってもKVキャッシュが増大しない。
マイクロブロック単位で参照領域を選択
固定サイズの状態による履歴保持を補うQwen Sparse Attentionは、入力系列をマイクロブロックへ集約する。各ブロックの重要度を推定し、関連性の高い領域だけをAttention計算の対象に選ぶ。
従来の疎なAttentionで使われるトークン単位のインデクサーは、コンテキストが長くなるほど計算負荷が増える。Qwen Sparse Attentionは選択単位をブロックへ移すことで、Attention計算とインデックス作成の負荷を削減する。
100万トークン条件で二つの性能比較
NVIDIAが紹介したAlibabaの公開ベンチマークでは、100万トークンの処理において、Qwen Sparse AttentionのAttentionカーネルがfull attentionに対し、プリフィルを最大7.6倍、デコードを最大4.9倍高速化した。この倍率はモデル全体ではなく、Attentionカーネルを比較した値である。
別のオンラインサービング試験では、100万トークンのコンテキストと90%のプレフィックスキャッシュヒット率を条件とした。この条件でQwen3.8-Flash-Nextは、Qwen3.7-Plusの8.6倍のプリフィルスループットを達成した。
72基のGPUを結ぶ基盤で推論性能を測定
ラックスケールの推論基盤NVIDIA GB300 NVL72は、72基のNVIDIA Blackwell Ultra GPUを一つのプラットフォームへ統合する。72基のGPUからなるNVIDIA NVLinkドメインは毎秒130TBのall-to-all通信に対応し、MoEのExpert間で発生するデータ移動をラック内で処理する。
NVIDIAの測定では、この基盤上のQwen3.8-Flash-Nextが、GPU当たり毎秒1万6000トークン超、ユーザー当たり毎秒200トークン超を記録した。この値はGB300 NVL72上の推論性能であり、前節のAttentionカーネル比較やキャッシュ条件付きサービング試験とは測定対象が異なる。
ローカル実行から微調整と推論展開まで対応
Qwen3.8-Flash-Nextは、NVIDIA DGX Station、NVIDIA DGX Sparkクラスター、4基のNVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition GPUを搭載したワークステーションでも動作する。ラックスケール基盤に限らず、これらのローカルなNVIDIAハードウェアでもモデルを試せる構成となっている。
PyTorchベースの微調整ライブラリNVIDIA NeMo AutoModelは、既存のHugging Faceチェックポイントを変換せずに読み込み、full SFTとLoRAによる微調整に対応する。NVIDIA NeMo RLは強化学習レシピを提供し、推論側ではSGLang、vLLM、TokenSpeedがNVIDIAアクセラレーテッドプラットフォーム向けのオープンソースレシピを提供する。