AIが推論サーバーに加えた修正は、ほかの試験を通っても、モデルを動かす実サーバーでは失敗し得る。評価基盤SWE-Serveで同じ627件の修正を判定すると、実サーバー試験の追加により合格率は69.4%から45.9%に下がった。
統合済みの変更から推論サーバーの修正課題を作る
NVIDIAがSGLangチームの協力を得て開発したAIコーディングエージェント向け評価基盤SWE-Serveは、言語モデルの推論サーバーSGLangに統合された83件のプルリクエストを基に53課題を構成する。課題はモデル対応、デコーディング、キャッシュ、スケジューリング、サービングAPIなど、六つの推論エンジニアリング分野に分かれる。
各課題でエージェントに渡されるのは、対象の変更が加わる前のSGLangを収めたコンテナだ。エージェントが加えた修正は非公開の検証テストで判定され、参照実装との一致では評価されない。
モデルを読み込んだ実サーバーまで検証経路を延ばす
53課題のうち19課題では、修正したプログラムで必要なモデルを読み込み、実サーバーを起動する。検証は提供インターフェースを通じて行われるため、サーバーの起動後に要求を処理できるかまで判定対象になる。
この19課題には実サーバー試験が276件あり、242件はSGLangのテストに由来するか、それを改変したものだ。Gemma 4のMixture of Experts(MoE)モデルを扱う課題では、33件の修正のうち16件がほかの試験をすべて通過しながら、モデルの読み込みや応答などを調べる実サーバー試験に失敗した。
同じ627件の修正で合格率に23.5ポイントの差
NVIDIAの評価では、実サーバー試験を含む19課題について、同じ627件の修正を二通りで判定した。実サーバー試験を除くと合格率は69.4%だったが、試験を含む完全な検証では45.9%になった。
判定が変わった修正は147件に上る。これらは実サーバー試験を除けば合格する一方、試験を含めると不合格になるため、ほかの検証だけでは捉えられない動作上の失敗が合格率の差に表れている。
複数の実行領域にまたがる課題で低い合格率
要求の受け付けから出力までを、要求処理、スケジューリング、モデル実行、KVキャッシュなどの実行領域に分けて見ると、課題の範囲によっても成績が異なる。各モデルの最良設定で集計した合格率は、単一領域に収まる26課題で69.0%、複数領域にまたがる27課題で47.7%だった。評価したすべてのモデル設定で、複数領域の課題のほうが低かった。
この合格率が表すのは、SWE-Serveの検証テストを通過した割合だ。修正が本番環境へ配備できるか、SGLangへ統合する準備が整っているかまでは判定しない。