ProTrekは、タンパク質の配列、構造、および機能に関する自然言語記述を、三者共有の埋め込み空間にエンコードするトライモーダル言語モデルである。この統合により、ProTrekでは多様な情報がシームレスに統合され、あらゆるモダリティ間の包括的な検索を可能にし、機能推論と類似性検出の範囲が大きく広がり、研究者はテキスト記述を使用して構造データベースを照会したり、配列の類似性だけでは検出を逃れる可能性のある機能的に関連するタンパク質を特定することが可能になる。
ProTrekのトレーニングは、3つの異なるモダリティを表す埋め込みをアラインメントするために設計された対照学習(Contrastive Learning)戦略をベースにしている。配列、構造、機能にわたって一致するエンティティ間の対応を最大化し、無関係なタンパク質との類似性を最小化することで、モデルはタンパク質生物学の多面的な性質を正確に反映する統合表現を学習する。
ベンチマークテストの結果、ProTrekは、機能的に関連するタンパク質を特定する際の速度と精度の両方において、FoldseekやMMseqs2などの最先端のアラインメントツールを凌駕した。従来の手法は配列アラインメントに大きく依存することが多く、特に遠縁のタンパク質や、配列や構造が異なるにもかかわらず機能特性を共有するタンパク質に対しては、感度が制限されいた。対照的に、ProTrekはマルチモーダルな埋め込みにより、配列モチーフ、構造フォールド、機能記述子間の微妙なクロストークを検出し、タンパク質空間内でこれまで隠されていた関係性を明らかにすることを可能にした。
研究チームは、大規模な計算実験と厳密なウェットラボアッセイを組み合わせることで、ProTrekの性能を検証した。計算解析では、このモデルが膨大なデータベースから機能的に関連するタンパク質を前例のない効率で取得できることが確認され、生化学的検証実験では、その予測の生物学的妥当性が実証された。すなわち、ProTrekは、タンパク質科学と創薬に具体的な影響を与える実用的なツールであることが示された。
さらに、ProTrekには、50億種類以上のタンパク質について、事前計算済みの埋め込みデータが用意されており、これは、既知および予測されるプロテオームの広大な範囲を網羅している。
ProTrekはWebサイト(www.search-protrek.com)から公開されており、利用者は、配列、構造、または機能テキスト記述の形式でクエリを送信することで、数分以内に包括的な類似性マッチングと機能予測を取得できる。このProTrekの高速性は、モデルの学習と推論中に実装された最適化技術に由来する。タンパク質をコンパクトで情報量の多い埋め込みにエンコードすることで、システムは計算負荷の高い配列アライメントや構造の重ね合わせを回避している。その結果、大規模なタンパク質リポジトリへのリアルタイムでの迅速なクエリが可能になった。これは、実験手法と計算予測の進歩によりタンパク質データの量が爆発的に増加し続ける中で、ProTrekの大きな特徴である。
[出典]
- 論文 "A trimodal protein language model enables advanced protein searches" Su J [..] Chang X, Lu H, Yuan F. Nat Biotechnology. 2025-10-02. https://doi.org/10.1038/s41587-025-02836-0 [所属] Westlake University (CN), The Hong Kong University of Science and Technolog, Independent Scientist (Igor Tolstoy, US)
- ニュース "Trimodal Protein Language Model Powers Advanced Searches" Bioengineer. 2025-10-02. https://bioengineer.org/trimodal-protein-language-model-powers-advanced-searches/
コメント