AI

マルチモーダルAIが100万トークンの履歴を保持、ツール操作を並列化

この記事のポイント

  1. 実現したこと

    100万トークンの作業履歴を管理し、複数のアプリにまたがる外部ツール利用とコンピューター操作を継続する。

  2. 実現の仕組み

    メインエージェントが文脈から計画を作り、実行を並列のサブエージェントへ委任して、必要な判断を回収する。

  3. 得られた結果

    OpenCode上の実演では、Webアプリの画面から不具合を特定し、関連コードの修正と変更後の検証まで実行した。

  4. 従来との違い

    クリック単位の逐次処理から、処理に応じてスクリプトと直接操作を選び、複数のアクションをまとめて生成する方式へ変わった。

長い作業履歴を保持する中央AIと、並列に分岐するサブエージェントの抽象イラスト
AI生成画像

100万トークンの文脈管理と並列サブエージェントを組み合わせ、長時間の作業を外部ツールや画面操作へつなぐマルチモーダルAIが利用可能になった。Muse Spark 1.1は開発者向けAPIの公開プレビューでも提供される。

エージェント型モデルを開発者向けAPIで提供

エージェント型タスク向けのマルチモーダル推論モデルMuse Spark 1.1は、計画や推論の出力を外部ツールとコンピューター上の操作へ接続する。開発元のMetaは、ツール利用、コンピューター操作、コーディング、マルチモーダル理解を強化したモデルとして公開した。

開発者向けには、Muse Spark 1.1へ接続できるMeta Model APIの公開プレビューが始まった。モデルを外部のアプリや開発環境へ組み込むための提供経路が、モデルの公開と同時に用意された。

新しいツールを計画へ組み込み並列に委任

利用対象には、ネイティブツール、MCPサーバー、カスタムスキルが含まれる。Metaによると、Muse Spark 1.1は事前の例を与えられていない新しいツールにもゼロショットで対応し、作業へ組み込むという。

実行時には、メインエージェントが必要な文脈を集めて計画を作り、処理を並列のサブエージェントへ委任する。各サブエージェントは割り当てられた役割と利用可能なツールに沿って処理し、上位の判断が必要になればメインエージェントへ戻す。

100万トークンから後続作業に必要な情報を保持

長時間の作業を支えるのが、100万トークンのコンテキストウィンドウである。Metaによると、Muse Spark 1.1はこの領域を能動的に管理し、以前の作業から必要な情報を取り出す。

情報量が増えた場合は、後続の作業に必要な重要手順を残すよう文脈を圧縮する。この管理は複数のアプリにまたがる操作にも使われ、長いセッション中に情報や要件が変化しても文脈を維持し、更新された条件へ適応するとMetaは説明している。

スクリプトと直接操作を処理ごとに選択

コンピューターを動かす際、Muse Spark 1.1はすべての手順を一回ずつ画面上で処理する設計ではない。自動化が速い処理ではスクリプトを作り、直接操作が簡単な処理ではインターフェースを使うよう訓練されている。

選んだ操作方法では、各段階に必要な複数のアクションをまとめて生成する。Metaが示した夕食会手配の実演では、モデルが注文中に生じた状況変化を検出し、利用者の介入なしに注文内容を更新した。

画面上の不具合をコード修正と検証へ接続

コーディングでは、複雑なコードを対象に、不具合の診断と修正、新機能の実装、大規模なコード移行に対応するとMetaは説明している。画面から取得した状態を、コードの調査や編集に引き渡せることが、この作業の前提となる。

MetaがOpenCode上で示した実演では、Muse Spark 1.1がWebアプリを構築し、画面を自動撮影して利用者から見える不具合を特定した。さらに、問題に関係するコードを追跡して修正し、変更後の状態を検証するまでを連続して実行した。

動画の視覚情報をブラウザー操作へ引き渡す

マルチモーダル処理は、操作対象となる視覚情報と音声を調べ、その詳細を作業の後段まで保持する。Metaによると、Muse Spark 1.1は保持した情報を、利用者に代わってコンピューターを操作する際の入力として使う。

Metaが示したFacebook Marketplaceへの出品実演では、スマートフォンで撮影した動画から利用可能な商品写真を抽出し、映っている商品について推論した。その出力をブラウザー操作へ引き渡し、利用者に代わって出品を作成した。