化學合成仍然是功能性小分子發現和製造的關鍵瓶頸1−3。儘管近年來人工智慧輔助合成規劃已蓬勃發展,但對其失敗模式的詳細理解尚未實現,模型在預測較少見但具戰略重要性的反應,以及產生與化學家預期不符的幻覺式、錯誤預測方面仍面臨困難4−12。在本研究中,我們分析了現有AI模型的失敗模式,並提出RetroChimera:一個前沿的逆合成分析模型,建立在兩個新開發的、具備互補歸納偏置的組件之上,並透過新穎的、基於學習的集成策略進行整合。透過跨越數個數量級的數據規模的實驗,我們證明RetroChimera的表現優於領先的基準模型,展現了在訓練數據以外的穩健性,以及從每個反應類別極少量範例中學習的能力。使用成對和單點設定,我們發現有機化學家偏好RetroChimera的預測結果,勝過已發表的參考反應和其他AI模型。最後,我們展示了在兩家主要製藥公司的內部數據集上的零樣本遷移和微調能力,顯示在分布轉移下的穩健泛化能力。我們的研究證明了深度學習在日益嚴峻的挑戰下,實現精確合成預測的可行性。
科學 85
化學家導向的逆合成分析:整合具備不同歸納偏置模型的組合方法
化學合成是發現和製造功能性小分子的關鍵瓶頸。儘管人工智慧輔助合成規劃近年來蓬勃發展,但對其失敗模式的深入理解仍不足,模型在預測較少見但具戰略重要性的反應,以及生成與化學家預期不符的錯誤預測方面仍面臨挑戰。本研究分析了現有AI模型的失敗模式,並提出RetroChimera,一個結合兩種新開發、具互補歸納偏置的組件,並透過新穎的學習式集成策略整合。實驗結果顯示RetroChimera在多種數據規模下均優於領先基準,展現出訓練數據以外的穩健性,並能從極少量的範例中學習。有機化學家偏好RetroChimera的預測結果,甚至優於已發表的參考反應和其他AI模型。此外,該模型在兩家主要製藥公司的內部數據集上展現了零樣本遷移和微調能力,在分布轉移下表現出穩健的泛化能力。這項工作證明了深度學習在日益嚴峻的挑戰下,實現精確合成預測的可行性。
值得注意該研究提出具備化學家偏好度的AI逆合成分析模型,解決了現有AI在化學合成預測的關鍵瓶頸與挑戰,影響深遠。
原文來源: Nature