タンパク質の配列照合から複合体の構造予測までを、AIエージェントが専門サービスを呼び出して進めた。NVIDIAとAnthropicが連携した実行例では、2種類の予測モデルでSeh1の単独構造と複合体構造を比較している。
エージェントが3つの計算サービスを呼び出す
NVIDIAとAnthropicは、生命科学向けのBioNeMo Agent Toolkitを科学研究用AI環境のClaude Scienceに統合した。エージェントはこのツールキットを通じて、BioNeMo NIMマイクロサービスを見つけ、起動し、呼び出す。
実行例では、配列照合用のMSA Searchと、構造予測用のOpenFold3、Boltz-2という3つの計算サービスを起動する。対象はタンパク質Seh1で、単独の予測構造を候補となる相手タンパク質C1HCX1との複合体の予測構造と比較する。
同じ種の配列を対応付けて予測の入力を作る
エージェントはタンパク質配列データベースのUniProtから、Seh1とC1HCX1の配列を取得する。各タンパク質について、関連する配列を集めた非ペアの多重配列アラインメント(MSA)を作成する。
さらに、同じ種に由来する両タンパク質の関連配列を対応付け、複合体予測用のペアMSAを作る。この実行での検索結果は各タンパク質について202配列で、単独鎖と2鎖複合体を予測する入力となった。
同じ入力条件で単独鎖と複合体を予測する
この実行では、取得した配列を短縮せず、構造テンプレート、リガンド、その他の制約も与えなかった。MSAを用意したうえで、OpenFold3が単独鎖と2鎖複合体の構造を予測する。
Boltz-2も単独鎖と2鎖複合体を予測し、各モデルの出力をそれぞれ評価する。こうして、Seh1だけを入力した場合と、C1HCX1を加えた場合の構造をモデルごとに比較できる。
配列照合の有無で界面信頼度が分かれる
NVIDIAが示した比較では、MSAを入力した複合体予測の界面信頼度指標iPTMは、OpenFold3で0.85、Boltz-2で0.82だった。MSAを入力しない場合は、それぞれ0.14と0.19になった。この数値は、今回の2タンパク質の予測におけるモデルの評価値である。
予測構造を重ね合わせると、両モデルはC1HCX1の同じβストランドをSeh1のWD40構造の閉鎖位置に配置した。NVIDIAは、相手タンパク質を含む予測でSeh1の折り畳みが作り直されるのではなく、未完成の部分が補われると解釈している。