音声と環境音を取り出す複数の処理が、一つのAIモデルに統合された。三菱電機が開発した音源分離技術TUSSは、対象音源の種類と数をプロンプトで指定する。目的の音に合わせて別々のモデルを開発する必要をなくしたという。
音源の種類と数をプロンプトで指定する
三菱電機は、米国の研究拠点Mitsubishi Electric Research Laboratories, Inc.と共同で、音源分離技術Task-Aware Unified Source Separation(TUSS)を開発した。分離・抽出する音源の種類と数をプロンプトで指定する仕組みで、複雑に混ざった音から目的の音を単一のAIモデルで取り出すことができるという。
音声分離から環境音抽出までモデルを共通化
このモデルが担う処理には、音声分離、音声強調、環境音抽出が含まれる。三菱電機は、これらを単一モデルへ統合したことで、対象音や用途ごとに別々の音源分離モデルを開発する必要をなくしたとしている。処理対象をプロンプトで指定する仕組みとモデルの共通化を組み合わせ、音響環境や運用要件の違いに対応する。
抽出した音を異常検知や音声認識へ渡す
取り出した音の接続先には、異常検知、音声認識、音声による機器操作、作業記録などのAI処理がある。三菱電機は、目的の音を抽出してこれらの処理へ渡すことで、複雑な状況をより正確に理解できるとしている。
会場の機械音と複数話者の音声を使って実演
三菱電機は、10月13〜16日に幕張メッセで開催される技術展示会CEATEC 2026で、この音源分離技術を展示する予定だ。実演では、会場で収録する機械音、楽器音、複数話者の音声を含む混合音を処理する。プロンプトで指定した個別音源を分離・抽出し、その出力を音声認識と異常音診断に利用する予定である。