專門的聊天機器人或許能為醫療資源有限的民眾帶來改變。但若缺乏更多測試,我們無從得知它們究竟會帶來幫助還是傷害。
本月初,微軟推出了 Copilot Health,這是其 Copilot 應用程式中的一個新空間,用戶將能連接他們的病歷並就健康問題提出具體疑問。幾天前,亞馬遜宣布其先前僅限 One Medical 服務會員使用的、基於大型語言模型(LLM)的 Health AI 工具,將開放給大眾使用。這些產品加入了 OpenAI 在一月發布的 ChatGPT Health,以及 Anthropic 的 Claude(若獲授權,可存取用戶健康紀錄)。AI 輔助醫療已正式成為一種趨勢。
鑑於許多人難以透過現有醫療系統取得健康諮詢,因此對提供健康建議的聊天機器人有明顯的需求。部分研究顯示,目前的 LLM 能夠做出安全且有用的建議。但研究人員表示,這些工具應由獨立專家進行更嚴謹的評估,最好是在廣泛發布之前。
在健康照護這個高風險領域,信任公司自行評估自家產品可能不明智,特別是當這些評估未公開供外部專家審查時。即使公司正在進行高品質、嚴謹的研究(有些公司,包括 OpenAI,似乎確實如此),它們仍可能存在更廣泛的研究社群可以協助填補的盲點。
「考量到你總是需要更多醫療照護,我認為我們絕對應該追尋所有可行的途徑,」牛津網路學院博士候選人 Andrew Bean 表示。「我認為這些模型已經達到可以實際推出的階段,這完全是可能的。」
「但是,」他補充說,「證據基礎真的需要到位。」
開發者表示,這些健康產品之所以現在推出,是因為大型語言模型確實已經發展到能夠有效提供醫療建議的階段。微軟 AI 健康部門副總裁、前外科醫生 Dominic King 引用 AI 的進步作為公司健康團隊成立以及 Copilot Health 存在的關鍵原因。「我們已經看到生成式 AI 在回答健康問題和提供良好回應方面的能力取得了巨大的進步,」他說。
但 King 表示,這只是一半的故事。另一關鍵因素是需求。在 Copilot Health 推出前不久,微軟發布了一份報告和一篇配套的部落格文章,詳細說明了人們如何使用 Copilot 尋求健康建議。該公司表示,每天收到 5000 萬個健康問題,而健康是 Copilot 手機應用程式中最受歡迎的討論話題。
其他 AI 公司也注意到了這個趨勢並做出了回應。「即使在我們的健康產品推出之前,我們就已經看到人們使用 ChatGPT 處理健康相關問題的比例急劇、快速地增加,」負責 OpenAI 健康 AI 團隊的 Karan Singhal 表示。(OpenAI 和微軟有長期的合作夥伴關係,Copilot 由 OpenAI 的模型驅動。)
人們可能只是偏好向一個全天候待命、不帶評判的聊天機器人傾訴健康問題。但許多專家將這種模式與當前醫療系統的現狀聯繫起來。「這些工具之所以存在,並且在整體格局中有其位置,是有原因的,」西奈山健康系統首席 AI 官 Girish Nadkarni 表示。「這是因為取得醫療照護很困難,對於某些族群來說尤其困難。」
消費者級 LLM 健康聊天機器人的理想願景,取決於它們能夠在改善用戶健康同時減輕醫療系統壓力的可能性。這可能包括協助用戶決定是否需要醫療關注,這項任務稱為分診。如果聊天機器人分診有效,那麼需要緊急護理的患者可能會比以往更早尋求幫助,而症狀較輕的患者可能會覺得在家中遵從聊天機器人的建議來管理症狀更自在,而不是不必要地佔用急診室和診所的資源。
然而,Nadkarni 和西奈山其他研究人員最近一項廣泛討論的研究發現,ChatGPT Health 有時會對輕症建議過度治療,並且未能識別緊急情況。儘管 Singhal 和一些其他專家認為其研究方法可能無法全面反映 ChatGPT Health 的能力,但該研究引發了對這些工具在向公眾發布前,外部評估不足的擔憂。
本文採訪的大多數學術專家都同意,鑑於一些人獲得醫療照護的機會很少,LLM 健康聊天機器人可能具有實際的優勢。但他們都表達了對這些工具在未經獨立研究人員測試以評估其安全性之前就已發布的擔憂。雖然這些工具的一些廣告用途,例如推薦運動計畫或建議用戶可以向醫生提出的問題,相對無害,但其他用途則存在明顯風險。分診是一個;另一個是要求聊天機器人提供診斷或治療計畫。
ChatGPT Health 介面包含一個顯眼的免責聲明,說明它不適用於診斷或治療,而 Copilot Health 和亞馬遜 Health AI 的公告也包含類似警告。但這些警告很容易被忽略。「我們都知道人們會用它來進行診斷和管理,」Beth Israel Deaconess 醫療中心內科醫生兼研究員、Google 訪問研究員 Adam Rodman 表示。
公司表示,他們正在測試聊天機器人,以確保它們在絕大多數情況下都能提供安全的反應。OpenAI 設計並發布了 HealthBench,這是一個評估 LLM 在真實健康相關對話中表現的基準測試,儘管對話本身是由 LLM 生成的。當去年發布為 ChatGPT Health 和 Copilot Health 提供動力的 GPT-5 時,OpenAI 報告了該模型的 HealthBench 分數:相較於之前的 OpenAI 模型,其表現顯著提升,但整體表現仍遠非完美。
然而,像 HealthBench 這樣的評估存在局限性。在一個上個月發表的研究中,Bean(牛津博士候選人)和他的同事發現,即使 LLM 能夠獨立準確地從虛構的書面情境中識別出醫療狀況,一個沒有醫學專業知識的用戶,在給予情境並要求在 LLM 協助下確定狀況時,可能只有三分之一的時間能成功。如果他們缺乏醫學專業知識,用戶可能不知道情境中的哪些部分——或他們現實生活中的經驗——對提示很重要,或者他們可能會誤解 LLM 提供給他們的信息。
Bean 認為,這種表現差距對 OpenAI 的模型來說可能很重要。在最初的 HealthBench 研究中,該公司報告說,在需要從用戶那裡獲取更多信息的對話中,其模型的表現相對較差。如果是這樣,那麼那些缺乏足夠醫學知識來從一開始就向健康聊天機器人提供所需信息的用戶,可能會得到無益或不準確的建議。
OpenAI 健康部門負責人 Singhal 指出,該公司目前的 GPT-5 系列模型(在最初的 HealthBench 研究進行時尚未發布)在徵求額外信息方面比其前代產品做得更好。然而,OpenAI 報告說,目前的旗艦產品 GPT-5.4 在尋求上下文方面比早期版本 GPT-5.2 表現更差。
理想情況下,Bean 說,健康聊天機器人在向公眾發布之前,應該接受像他的研究那樣,與人類用戶進行的受控測試。這可能是一項艱鉅的任務,特別是考慮到 AI 領域的快速發展以及人體研究可能耗費的時間。Bean 自己的研究使用了近一年前發布且現已過時的 GPT-4o。
本月初,Google 發布了一項符合 Bean 標準的研究。在這項研究中,患者在與該公司的 Articulate Medical Intelligence Explorer (AMIE) 進行醫學討論後,才與人類醫生見面。AMIE 是一款尚未向公眾開放的醫療 LLM 聊天機器人。總體而言,AMIE 的診斷與醫生一樣準確,並且沒有任何對研究人員造成重大安全疑慮的對話。
儘管結果令人鼓舞,Google 暫時沒有計劃發布 AMIE。「儘管研究已取得進展,但在將診斷和治療系統轉化為實際應用之前,仍有許多重大限制必須解決,包括對公平性、公正性和安全測試的進一步研究,」Google DeepMind 的研究科學家 Alan Karthikesalingam 在一封電子郵件中寫道。Google 最近確實透露,它與 CVS 合作建立的健康平台 Health100 將包含一個由其旗艦 Gemini 模型驅動的 AI 助理,儘管該工具可能不適用於診斷或治療。
Rodman,AMIE 研究的聯合領導者,認為像 ChatGPT Health 和 Copilot Health 這樣的聊天機器人並不一定需要進行如此廣泛、多年的研究。「臨床試驗模式並不總是適用於生成式 AI,這有很多原因,」他說。「這就是基準測試對話的意義所在。是否有來自受信任的第三方、我們可以同意其有意義的基準測試,讓實驗室可以自我約束?」
關鍵在於「第三方」。無論公司如何廣泛地評估自家產品,完全信任其結論都很困難。第三方評估不僅帶來公正性,而且如果涉及多個第三方,還有助於防止盲點。
OpenAI 的 Singhal 表示,他強烈支持外部評估。「我們盡力支持社群,」他說。「我們發布 HealthBench 的部分原因,實際上是為了給社群和其他模型開發者一個非常好的評估範例。」
他表示,鑑於生產高品質評估的成本高昂,他懷疑任何單一學術實驗室能否生產出他所謂的「萬能評估」。但他高度讚揚學術團體為將現有和新穎的評估匯總成全面的評估套件所做的努力,例如史丹佛大學的 MedHELM 框架,該框架測試模型在各種醫學任務上的表現。目前,OpenAI 的 GPT-5 在 MedHELM 上得分最高。
史丹佛大學醫學教授、MedHELM 專案負責人 Nigam Shah 表示,該專案存在局限性。特別是,它只評估單一的聊天機器人回應,但尋求醫療建議的用戶可能會與其進行多輪、來回的對話。他說,他和一些合作者正準備建立一個能夠評分這些複雜對話的評估,但這需要時間和金錢。「你我無法阻止這些公司發布(健康相關產品),所以他們會隨心所欲,」他說。「我們這樣的人唯一能做的,就是找到資助基準測試的方法。」
本文採訪的沒有人認為,健康 LLM 在發布前需要在第三方評估中表現完美。醫生自己也會犯錯——對於那些只有偶爾機會看醫生的人來說,一個始終可用的 LLM,即使有時會出錯,只要其錯誤不太嚴重,仍然可能比現狀有巨大改善。
然而,根據目前的證據,我們無法確定目前可用的工具是否確實構成了改善,或者其風險是否大於益處。
Subquadratic 已分享了其新模型的更多細節。但有些人仍然持懷疑態度。
一項新技術讓該公司能夠比以往更深入地探究 LLM 的奇特運作方式。
該公司正在將 AI 應用於科學領域。
AI 時代需要更快的晶片。ASML 在生產這些晶片所需的昂貴設備方面擁有壟斷地位。有人能追趕上嗎?
發現特別優惠、熱門故事、即將舉行的活動等。
感謝您提交您的電子郵件!