蛋白質的生物功能,許多都依賴於在微秒至毫秒(µs-ms)時間尺度上發生的多種構象之間的相互轉化。標準化的大規模實驗數據的缺乏,阻礙了對這些運動獲得更具預測性的理解。

在整理了超過一百個核磁共振(NMR)弛豫數據集後,我們意識到 µs-ms 動力學的一個可觀測指標可能就隱藏在眼前。毫秒級的動力學可能導致 NMR 訊號展寬到無法偵測,使得在儲存在生物磁共振數據庫(BMRB)的約一萬個蛋白質的化學位移數據集中,有些殘基無法被指派。

我們做了一個大膽的假設,即缺失指派的殘基是由 µs-ms 運動引起的交換展寬,並訓練了各種深度學習模型來預測缺失的指派。令人驚訝的是,這些模型也能預測透過 NMR 弛豫實驗測得的交換,這表明了 µs-ms 動力學的存在。

我們將表現最佳的模型命名為 Dyna-1,它利用了多模態語言模型 ESM-3 的中間層。值得注意的是,Dyna-1 特別能準確預測與生物功能直接相關的動力學,包括酵素催化和配體結合,這與我們發現經歷 µs-ms 交換的殘基更為保守的結果相呼應。

我們預期這裡呈現的數據集和模型將在解鎖動力學和功能的通用語言方面具有變革性。