AI

30BのAIモデルを単一GPUでローカル実行、NVIDIAが推論構成を示す

この記事のポイント

  1. 実現したこと

    AIエージェント向けの30B規模モデル「Muse Glimmer」を、単一のNVIDIA GPUでローカル推論できる。

  2. 実現の仕組み

    Metaは言語モデル部分を約4ビットに量子化し、20GB未満に圧縮している。

  3. 得られた結果

    NVIDIAはBlackwell Ultra上で、GPU当たり毎秒2万トークン超のスループットを示した。

  4. 従来との違い

    推論構成からモデル分割、CPUへの退避、外部エンドポイントを外し、モデルを単一GPUのVRAMに収めた。

単一GPUのVRAM内に収まるモデル層へ、文章と画像の入力が集まる推論構成のイラスト
AI生成画像

30B規模のAIエージェント向けモデル「Muse Glimmer」を、単一GPUでローカル実行する構成が示された。dense構成と量子化によってモデルをGPUのメモリーに収め、NVIDIAはBlackwell Ultra上の推論スループットも示している。

各トークンで全パラメーターを動かすdense構成

MetaのAIエージェント向けオープンウェイトモデル「Muse Glimmer」は、30B規模のdense構成を採る。NVIDIAによると、各トークンで全パラメーターを動かすため、Mixture of Experts(MoE)のようなExpertの選択やルーティングを処理経路に含めない。

モデルのコンテキストウィンドウは120Kトークン超とされる。長い入力を保持しながら処理を続ける設計が、複数段階の作業を進めるAIエージェントの基盤となる。

画像入力を扱うモデルを量子化してメモリーに収める

Muse Glimmerは専用の画像認識用エンコーダーを備え、テキストと画像を交互に含む入力を受け取ってテキストを出力する。この構成により、エージェントは文章に加えて画面や図を入力として扱える。

Metaは言語モデル部分の重みを約4ビットに量子化し、その容量を20GB未満に抑えている。設計上は、画像認識用エンコーダーや過去の計算結果を保持するKVキャッシュなども含め、24GBまたは32GBのメモリー枠に収める。

単一GPUへの配置とBlackwell Ultraの処理性能

NVIDIAは、Muse Glimmerを単一のNVIDIA GPUのVRAMに収め、モデル分割やCPUへの退避、外部エンドポイントを使わずに推論できるとしている。Blackwell Ultraではモデル全体をVRAMに保持しても、大きなKVキャッシュ用の空き領域を確保できるという。

NVIDIAが示したBlackwell Ultra上のスループットは、BF16/NVFP4精度の条件でGPU当たり毎秒2万トークン超だった。この数値はGPUが処理するトークンの総量を表し、単一の対話で応答を生成する速度とは区別される。

推論と追加学習の実行経路

開発者向けの推論経路には、SGLangとvLLMを使う手順が用意されている。NVIDIAは、実行設定を自動選択するダウンロード可能なNIMコンテナーも提供し、ローカル環境でモデルを配信する方法を示した。

用途に合わせてモデルを追加学習する場合は、NVIDIAの学習ライブラリーNeMo AutoModelがHugging Face形式のチェックポイントを変換せずに扱う。全パラメーターの教師ありファインチューニングとLoRAの両方に対応する。