2800を超えるウイルスについて、タンパク質複合体の予測立体構造が公開された。複数のタンパク質がどう組み合わさるかを調べるためのデータで、追加される相互作用には既存の構造データベースに記録のない形状も含まれる。
2800超のウイルスで複合体の形を調べる
NVIDIAとGoogle DeepMind、欧州分子生物学研究所の欧州バイオインフォマティクス研究所(EMBL-EBI)などが参加する共同研究組織は、2800を超えるウイルスの予測立体構造をAlphaFold Databaseで公開した。対象は個々のタンパク質だけでなく、複数のタンパク質が相互作用する複合体にも及ぶ。
共同研究では、ヒトへの感染が知られるウイルス群のタンパク質構造を系統的に扱った。複合体の予測構造から、ウイルス内のタンパク質がどのような形で組み合わさり得るかを調べられる。
配列の検索から複合体の構造予測まで
公開データの構造予測には、タンパク質の立体構造を予測するAIモデルAlphaFold2が使われた。NVIDIAはBioNeMo Inference Runtimeによる最適化を組み合わせ、多数のウイルスを対象に推論した。
公開されたワークフローでは、まずGPUで配列データベースを検索し、構造予測の入力となる多重配列アラインメントを作成する。続いて単一タンパク質や複数鎖の複合体の構造を予測し、後処理で複合体の接触面を評価する。
既存の構造記録にない相互作用形状
NVIDIAによると、今回データベースへ追加されるタンパク質間相互作用の約30%は、実験で決定された構造を収録するProtein Data Bankに記録のない相互作用形状を示す。これは予測結果についての比較であり、その形状を実験で確認したという意味ではない。
公開データの予測結果には信頼度が付されている。研究者はその情報も見ながら、複合体の形や構成タンパク質の相互作用を検討できる。
構造予測の生成工程も公開
NVIDIAは、データセットの生成に用いたGPU対応ワークフロー「BioNeMo Structure Prediction Pipeline」も公開した。ウイルスの構造データに加え、配列から予測立体構造へ進む処理を研究者が利用できる。
このワークフローは、研究者自身が選んだ標的タンパク質の配列にも適用できる。公開データに収録された対象を調べるだけでなく、独自の標的について構造予測を実行する手段となる。