AI

AI開発エージェント製の内視鏡画像分割アプリ、描画処理量が50.5%向上

この記事のポイント

  1. 実現したこと

    既存の分割モデルを使い、内視鏡映像の器具マスクと測定値を重ねて表示するアプリを構築した。

  2. 実現の仕組み

    開発者が段階ごとに目標を定め、AI開発エージェントが共通のCLIで実装と実行を進めた。

  3. 得られた結果

    NVIDIAの最適化前後の比較では、描画処理量が50.5%向上し、平均アプリケーション経路遅延が33.6%低下した。

  4. 従来との違い

    映像を確認する段階から、300フレームを画面外で処理して測定を繰り返す構成へ進んだ。

内視鏡映像から器具を分割するアプリを、AI開発エージェントが既存モデルを再利用して構築した。NVIDIAは、段階的な測定と最適化により、描画処理量が50.5%向上したと報告している。

既存の器具分割モデルを開発の出発点に

MONAIの内視鏡器具分割モデルは、映像フレームを器具とそれ以外の2種類に分ける。NVIDIAのアプリ集HoloHubには、このモデルと内視鏡サンプル映像を使う既存のアプリがあり、新しいアプリを作る際の動作確認にも利用された。

開発者の確認を挟む反復工程

NVIDIAの開発例では、エンジニアが各段階の目標と制約を決め、AI開発エージェントが実装したコード、出力、テストを確認してから次の目標を設定した。エージェントが使うHoloscan CLIは「./HoloHub」から呼び出せるため、エンジニアも同じ手段で実行結果を確認できた。

映像から分割マスクまで処理を接続

新しいアプリは、MONAIの既存モデル、サンプル映像、前処理、推論処理を再利用し、モデルの重みを変更せずに構築された。映像の再生から前処理、TensorRTによる推論、分割結果の後処理、実行時の測定、HoloVizによる表示までを接続している。

再生した各フレームで推論と分割マスクの後処理を実行し、フレームから得た測定値を映像に重ねて表示した。この表示結果を開発者が確認し、次の段階で測定機能を加える対象を定めた。

300フレームの測定を経て描画処理量を改善

アプリには、測定を繰り返すためのbenchmarkモードが追加された。このモードは300フレームを画面外で処理し、表示を見て判断する工程に測定結果を加える。

NVIDIAが報告した最適化前後の比較では、描画処理量が50.5%向上し、平均アプリケーション経路遅延が33.6%低下した。これらは器具分割モデル自体の精度ではなく、構築したアプリの処理性能を示す結果だ。

開発手段を組み合わせた条件の処理量

CLI、開発スキル、文書を組み合わせた条件では、最初のアプリ構築に要したエージェントの処理時間は約40分で、トークン使用量は1100万だった。この値は内視鏡映像の処理速度とは別に、アプリを作る工程で記録されたものだ。