感謝您瀏覽 nature.com。您使用的瀏覽器對 CSS 的支援有限。為了獲得最佳體驗,我們建議您使用更新的瀏覽器(或在 Internet Explorer 中關閉相容性模式)。同時,為了確保持續支援,我們將在沒有樣式和 JavaScript 的情況下顯示網站。
Nature 第 655 卷,頁碼 728–736(2026)引用本文
靜止心率(RHR)是心血管健康和死亡率的關鍵生物標記物 1、2、3,但縱向被動追蹤通常需要穿戴式裝置,限制了其可用性。在此,我們提出被動心率監測(PHRM),這是一個深度學習系統,利用基於臉部影片的光體積脈搏描繪圖(photoplethysmography)技術,在日常智慧型手機互動期間被動測量心率(HR)和靜止心率(RHR)。我們的系統使用來自 485 名參與者的 192,353 個影片進行開發,並在 211 名參與者的 162,546 個影片中進行驗證,涵蓋實驗室和自由生活條件,據我們所知,這是同類研究中規模最大的驗證研究。PHRM 在我們的基準測試中表現優於最先進的方法。與參考心電圖相比,PHRM 在淺色、中色和深色三種膚色群體中,HR 測量的平均絕對百分比誤差(MAPE)均低於 10%,達到了產業準確度標準;各膚色群體的 MAPE 與其他群體相比均無劣勢。PHRM 測得的每日 RHR 與穿戴式 HR 追蹤器相比,平均絕對誤差小於每分鐘五次心跳,並且與已知的心血管疾病風險因子相關。這些結果突顯了智慧型手機在實現被動且公平的心臟健康監測方面的潛力。為了進一步研究,我們公開發布了一個大型、標註的智慧型手機影片數據集以及一個預訓練的 HR 模型。
心率(HR)是一個重要且動態的生命徵象,受多種因素影響 4,而靜止心率(RHR)被認為是整體死亡率的生物標記物和預後因子 1、2、3。RHR 的縱向增加與較高的死亡率和不良心血管事件相關 5、6、7。RHR 的測量傳統上需要一段持續的休息時間,這限制了評估長期趨勢的實用性。然而,HR 對各種因素的敏感性表明,透過每日多次測量比短暫、標準化的診間測量更能評估心血管系統 8、9、10。每日平均 HR 已被證明是全因死亡率的強獨立預測因子 11,甚至比診間測量的 RHR 更強,而消費級穿戴式裝置通常透過被動地匯總一天中休息時的 HR 測量值來獲得每日 RHR 12。每日 RHR 監測可以深入了解心血管健康狀況,並偵測與健身水平或疾病相關的生理變化 13、14、15。儘管如此,消費級穿戴裝置的普及率雖然在增長,但仍然有限,特別是在最可能從這些健康監測技術中受益的人群中 16。考慮到智慧型手機已經普及——90% 的美國成年人和全球 69% 的人擁有智慧型手機 17,平均每天使用 144 次 18——它們為在日常手機使用過程中進行機會性的 HR 測量提供了有吸引力的替代方案。透過一種稱為遠端光體積脈搏描繪圖(rPPG)的技術,可以遠距離測量血容量脈搏 19、20,該技術可以透過智慧型手機相機測量 HR 21、22、23、24 並篩檢不規則心律,例如心房顫動 25。然而,現有的 rPPG 研究樣本量小,僅限於受控環境,並且在真實世界條件下面臨泛化問題。至關重要的是,目前 rPPG 方法的準確性眾所周知,對於較深的膚色會顯著下降,這是由於黑色素濃度增加 26。類似的擔憂也適用於其他基於 PPG 的裝置,例如脈搏血氧儀,這已引起美國食品藥物管理局(FDA)和英國國家醫療服務體系(NHS)等衛生監管機構的審查和對驗證研究多樣性的呼籲 27、28。此外,由於先前 rPPG 研究主要涉及在特定條件下的主動 HR 測量,因此仍有必要解決在不受限制的、自由生活條件下日常手機使用期間的被動 HR 測量問題。
在本研究中,我們提出了一種基於智慧型手機的深度學習系統,該系統可在日常手機使用期間在背景中被動測量 HR 和每日 RHR(統稱為被動心率監測;PHRM)。與先前的工作相比,我們的系統提供了幾項進展。首先,我們在一個前瞻性研究中,使用大量且多樣化的影片(超過 162,000 個)驗證了其性能,這些影片是在實驗室條件以及在自由生活、真實世界條件下使用參與者個人手機收集的。其次,我們的系統符合產業準確度標準,並達到了所有膚色人群的預設非劣勢目標,證明了其在公平 HR 監測方面的潛力。PHRM 在我們的基準測試中表現優於最先進的方法。第三,我們證明了 PHRM 導出的每日 RHR 也達到了預設的準確度水平,並與公認的心血管健康指標和風險因子相關。最後,我們公開發布了一個預訓練的 HR 模型和一個大型且多樣化的智慧型手機影片數據集,其中包含所有膚色群體以及參考 HR 標籤,以促進進一步的研究。
我們設計並開發了 PHRM 系統,包含兩個主要組件(圖 1)。首先,我們構建了一個端對端的 HR 估計模組,該模組以使用者臉部的短(八秒)影片片段為輸入,進行影片穩定和預處理(透過臉部裁剪、縮放、插值和計算影格差異),並使用計算效率高的時間偏移卷積神經網路(TSCNNs)的集成 29 來預測 HR 和一個置信度度量。我們引入了一種深度學習架構,將 HR 估計重新構建為一個離散化範圍內的生物學上合理的 HR(40–180 次/分鐘;bpm)的多類分類問題。這種分佈式輸出允許模型表達不確定性。如果模型對 HR 估計的高度不確定(例如,由於極端運動),則機率分佈會變平,而迴歸模型則被迫輸出一個單一的、可能錯誤的點估計。接下來,我們設計了一個演算法,透過使用預測的置信度和卡爾曼濾波器來匯總一天中的 HR 預測值,從而得出每日 RHR。PHRM 被設計為在背景中被動運行,並在螢幕解鎖事件時透過前置攝影機自動啟動影片擷取。
a,在我們徵得同意的研究參與者研究中,在螢幕解鎖事件後,PHRM 使用深度神經網路(DNN)被動擷取、處理和分析 8 秒臉部影片片段,以估計 HR 和相關預測置信度,從而確定測量是否有效。為了計算每日 RHR,PHRM 匯總單日中來自間歇性 8 秒影片片段的有效 HR 測量值,並應用卡爾曼濾波器來改進估計值。b,用於開發和驗證 PHRM 系統的研究工作流程圖。我們使用了來自五項獨立的前瞻性實驗室研究和一項前瞻性自由生活研究的數據。
為了開發和驗證 PHRM,我們進行了一系列研究來獲取包含臉部影片和 HR 基準數據的數據集(表 1)。在我們所有的研究中,我們招募了不同年齡、性別和膚色群體的參與者。我們使用心電圖(ECG)作為實驗室和自由生活驗證研究的參考 HR 基準。總共,我們收集了 192,353 個來自 485 名參與者的影片用於 PHRM 開發,以及 162,546 個來自 211 名參與者的影片用於 PHRM 驗證。
首先,我們從四項在受控實驗室環境中進行的研究中獲得了用於訓練和調整 PHRM 的數據(n = 26,423 個影片,來自 357 名參與者)。這些數據涵蓋了各種照明條件和生理狀態,包括休息、各種運動期間和運動後(延伸數據表 1)。為了提供一個外部測試集用於模型驗證,我們進行了一項第五項前瞻性實驗室研究,招募了 104 名參與者(n = 1,731 個影片),並在 5 種不同的照明條件下,以及在休息和運動後生理狀態下拍攝了影片。此外部測試集的平均年齡為 51.3 ± 14.8 歲;71 名(68.3%)參與者為女性。我們將參與者分為三種膚色群體(Fitzpatrick I–III、Fitzpatrick IV–V 和 Fitzpatrick VI),透過將他們使用分光光度計在臉頰和額頭上測量的客觀個人拓撲角度(ITA)轉換為 Fitzpatrick 膚色類型 30。我們指定這些膚色群體是為了故意過度代表深色膚色參與者,並確保開發出能準確針對該群體表現的模型,這一決定與 FDA 隨後提出的三個膚色群體一致 27。ITA 值範圍從 -73.48° 到 88.81°,其中 44 名(42.3%)、25 名(24.0%)和 35 名(33.7%)參與者分別屬於膚色群體 1(最淺)、2(中等)和 3(最深)。
接下來,我們進行了一項前瞻性自由生活研究,旨在記錄日常生活中正常個人手機使用期間的臉部影片,為期八天。詳細的影片記錄協議在補充資訊中提供。我們根據年齡、性別、身體質量指數(BMI)和 Monk Skin Tone(MST)量表進行分層抽樣,以在參與者層級劃分自由生活數據:50% 參與者(n = 165,930 個影片,來自 128 名參與者)的數據被保留用於模型開發(30% 用於訓練,20% 用於調整),剩餘 50% 參與者(n = 160,815 個影片,來自 107 名參與者)的數據被保留作為驗證的測試集。我們在 MST 中切換使用 MST,因為它旨在更廣泛地包含我們社會中看到的膚色範圍(實驗室研究在引入 MST 之前進行,並使用當時的行業標準 Fitzpatrick 量表)。自由生活研究測試集中的平均年齡為 37.9 ± 11.4 歲;57 名(53.3%)參與者為女性。根據 FDA 的建議,基於自我報告的 MST,所有膚色範圍的參與者至少有一名代表每個 MST 值 1-10。我們將參與者分為三個 MST 群體,分別為 MST 1–4、MST 5–7 和 MST 8–10 群體,分別有 39 名(36.4%)、29 名(27.1%)和 39 名(36.4%)參與者。此分佈也符合 FDA 的建議,即每個性別至少佔 40%,每個 MST 群體至少佔 25%。測試集中有六名個體未能達到最低依從性標準(即,至少 3 天每天有超過 40 個影片片段;補充圖 2),因此最終分析自由生活表現的參與者為 101 名(n = 158,471 個影片)。
參與者每天上傳 230.7 ± 172.2 個臉部影片。每位參與者的影片上傳率分佈呈強烈左偏(延伸數據圖 2);大多數參與者上傳了大部分影片(眾數 = 95%,中位數 = 84.4%,四分位距(IQR)= 22.9%)。這些影片是在螢幕解鎖事件後,在正常個人手機使用期間被動拍攝的。正如預期的那樣,自由生活使用和被動記錄的非約束性性質產生了具有多樣化環境、照明條件、相機角度和臉部遮擋的影片(圖 2a)。這些影片涵蓋了一天中的所有小時,以及由智慧型手機環境光感測器和加速度計測量的廣泛的勒克斯和智慧型手機運動水平(圖 2c)。環境光感測器捕捉到的照度測量值涵蓋了日常生活中的完整動態範圍(補充表 7)。雖然大多數記錄發生在典型的室內照明條件下,分為昏暗(45.6%)或明亮(32.4%),但相當大的子集捕捉到了極端的挑戰性條件,包括黑暗條件(14.2%)和戶外環境(7.8%)。我們隨機從參與者臉頰的影片裁剪中抽取膚色斑塊,以在各種照明條件下,跨 MST 範圍可視化膚色分佈(圖 2b)。同時,智慧型手機感測器表徵了廣泛的使用者行為(補充表 8)。Android 活動識別將大多數影片歸類為使用者靜止時拍攝(79.7%),其次是步行(16.0%)、在車輛中(4.1%)和跑步(0.3%)。為了評估生態代表性,我們將這些分佈與一個大型(n = 10,155)的美國成年人獨立數據集進行了基準測試,該數據集顯示了典型的智慧型手機使用模式 31。儘管需要主動螢幕互動,這自然會改變特定比例,導致車內使用率較低(4.1% 對比 10.5%)和活動性較高(16.0% 對比 7.3%),但與獨立數據集相似的各種運動狀態的持續存在證實了我們的數據集捕捉到了真實的日常生活橫截面,經過自然手機使用模式的過濾。基於加速度計的計步器揭示了這些狀態下更精細的運動動態(補充表 9);使用者很少完全靜止(無運動:5.0%),大多數影片捕捉到偶然的步數(52.7%)和零星的運動(15.1%)。明顯的運動模式也得到了很好的體現,從有目的的步行(9.6%)到以不同速度步行(17.1%)。
a,在自由生活條件下拍攝的影片,展示了各種環境、照明條件、前置攝影機角度和臉部遮擋的示意性範例。b,從參與者臉頰的影片影格中隨機抽取的臉部膚色斑塊範例,涵蓋了完整的 MST 值範圍。影片按欄中的平均亮度以及列中的 MST 排序。c,從左到右:按一天時間劃分的 8 秒影片片段數量的直方圖;智慧型手機環境光感測器測量的照度;以及影片期間智慧型手機的平均線性加速度幅度。
我們首先在受控條件下研究了智慧型手機測量 HR 的準確性,將 PHRM 預測與參考 ECG 測量的 HR 進行了比較。在前瞻性實驗室研究中,包含 104 名參與者,我們在 1,750 個臉部影片中有 1,360 個(77.7%)成功獲得了有效的 HR 測量值(透過篩選與 PHRM 預測相關的置信度分數;方法詳見)。我們未獲得任何有效 HR 測量值的參與者距離攝影機較遠,導致檢測影片穩定所需的臉部標記點的失敗率較高(62.5%)。與參考 ECG HR 相比,在總體研究人群中,PHRM 在參與者層級達到了 4.09(95% 信賴區間(CI):3.03,5.33)的平均絕對誤差(MAE)和 5.65%(95% CI:4.25,7.29)的平均絕對百分比誤差(MAPE)(延伸數據表 1)。所有五種照明條件以及休息和運動後條件下的 MAPE 值均顯著低於美國國家標準協會(ANSI)和消費技術協會(CTA)ANSI/CTA-2065 標準 32 設定的 10% 的預設研究目標(P < 0.001),表明在照明和生理條件下的穩健性。運動後條件下的 MAPE(2.74%)低於休息條件下的 MAPE(6.01%),這似乎違反直覺,因為運動後狀態預計會更具挑戰性,由於運動、呼吸急促和 HR 的快速變化;這一結果可能歸因於在這種嘈雜條件下使用測量篩選來消除錯誤估計的有效性。事實上,參與者休息時的 PHRM 測量成功率為 78.4%(95% CI:76.3,82.5),高於運動後的成功率 62.1%(95% CI:56.6,67.6)(延伸數據表 2)。
Bland–Altman 圖顯示,在參與者層級的最小偏差(-0.7)和 95% 的一致性限制(調整後,考慮到每位參與者的多次測量)之間,範圍為 -12.9 至 11.5 bpm(延伸數據圖 1)。按膚色群體劃分的參與者層級 MAPE 分別為群體 1 的 3.81%(95% CI:2.43,5.94)、群體 2 的 4.43%(95% CI:3.12,6.06)和群體 3 的 8.93%(95% CI:5.60,12.60);所有 MAPE 值均顯著低於 10%(P < 0.025)。在白熾燈下,群體 3 的 MAPE 最高。
作為比較,我們在該外部測試集上評估了 2019 年至 2025 年的 15 種 rPPG 模型,這些模型代表了 rPPG 的現狀。這些模型包括一種基於色調通道的信號處理演算法(Savur 33)和基於深度學習的架構,包括 PhysNet 34、TS-CAN 24、EfficientPhys 35、PhysFormer 36、PhysMamba 37、RhythmMamba 38 和 ME-rPPG 39。對於這些深度學習架構中的每一種,我們都評估了兩種可用版本:一種在 Pulse Rate Detection (PURE) 數據集 40 上訓練,另一種在 Remote Learning Affect and Physiology (RLAP) 數據集 41 上訓練。PHRM 模型是唯一在所有膚色群體中 MAPE 低於 10% 的模型,在所有膚色群體中均顯著優於先前的方法(圖 3a)。
a,b,在多樣化的實驗室(a;淺色、中色和深色膚色群體分別有 44、25 和 35 名參與者)和自由生活(b;淺色、中色和深色膚色群體分別有 39、29 和 39 名參與者)條件下,PHRM 和 15 個基準的參與者層級 MAPE 值。深度學習基準模型在 PURE(結尾為 -P)和 RLAP(結尾為 -R)數據集上進行了訓練。實心條表示在篩選 PHRM 預測相關的置信度分數後的有效 HR 測量值的 MAPE;空心條表示未經任何篩選的所有影片的 MAPE。紅色虛線表示根據 ANSI/CTA-2065 標準設定的 MAPE <10% 的預設準確度目標。誤差條表示上 95% CI。
接下來,我們評估了在真實世界條件下,智慧型手機使用期間被動 HR 測量的準確性。我們在自由生活測試集中的 101 名參與者中,成功獲得了 100% 的有效 HR 測量值。這些影片使用了 26 種智慧型手機型號拍攝。我們觀察到影片級 HR 測量成功率為 43.1%(158,471 個臉部影片中有 68,307 個有效測量值),低於實驗室研究中觀察到的成功率,這符合預期,因為測量是在不受控制的條件下進行的,參與者並未被告知在每次測量期間保持靜止。影片級測量成功率按膚色群體下降:群體 1 為 58%,群體 2 為 45%,群體 3 為 25%。與參考 ECG HR 相比,PHRM 在影片級達到了 3.59(95% CI:3.33,3.88)的 MAE 和 4.83%(95% CI:4.39,5.28)的 MAPE;在參與者層級,MAE 為 4.58(95% CI:4.14,5.06),MAPE 為 6.09%(95% CI:5.35,6.87)。影片級和參與者級的 MAPE 均顯著低於 10%(P < 0.001),表明 PHRM 提供了準確的被動 HR 測量(表 2)。
按膚色群體劃分的參與者層級 MAPE 分別為群體 1 的 5.04%(95% CI:4.36,5.89)、群體 2 的 5.12%(95% CI:4.51,5.80)和群體 3 的 7.84%(95% CI:6.25,9.71);所有 MAPE 值在影片和參與者層級均顯著低於 10%(所有比較均 P < 0.001),表明 PHRM 為所有膚色群體提供了準確的被動 HR 測量(圖 4b)。PHRM 相較於現有 rPPG 模型在準確性上的優勢更加明顯,因為現有 rPPG 模型在所有膚色群體中都產生了顯著更高的誤差(圖 3b)。PHRM 參與者層級 MAPE 在群體 1 與其他群體、群體 2 與其他群體以及群體 3 與其他群體之間的差異分別為 -1.64 個百分點(95% CI:-2.96,-0.37)、-1.31 個百分點(95% CI:-2.51,-0.17)和 2.75 個百分點(95% CI:1.04,4.70)。這達到了預設的非劣勢目標,即差異小於五個百分點,表明 PHRM 為所有膚色群體提供了公平的 HR 測量。Bland–Altman 圖顯示,在參與者層級的最小偏差(0.64)和 95% 的一致性限制(調整後,考慮到每位參與者的多次測量)之間,範圍為 -11.3 至 10.3 bpm(圖 4a)。值得注意的是,誤差較低的影片往往具有較高的置信度分數,這說明了基於置信度的篩選演算法的有效性。總體而言,我們的結果表明 PHRM 對於多樣化的照明、生理和真實世界條件具有穩健性,並且為所有膚色群體提供了準確且公平的 HR 測量。
a,Bland–Altman 圖顯示 PHRM 估計的 HR 值與參考 ECG 測量值之間的一致性。顏色表示 PHRM 預測的置信度級別。虛線顯示偏差、下限和上限一致性限制(已針對具有不等數量重複測量的重複測量進行調整)。b,箱形圖顯示參與者 MAPE 值的分佈,按膚色分組。n = 淺色、中色和深色膚色群體分別有 39、29 和 39 名參與者。箱體表示 IQR,中線表示中位數,鬍鬚延伸至箱體外最多 1.5 倍 IQR。紅色虛線表示 MAPE <10% 的預設準確度目標。c,Bland–Altman 圖顯示 PHRM 估計的每日 RHR 值與參考穿戴式 HR 追蹤器測量值之間的一致性。顏色表示 RHR 預測開始後的日期編號。虛線顯示偏差、下限和上限一致性限制(已針對具有不等數量重複測量的重複測量進行調整)。d,PHRM 估計的 RHR 的 MAE,作為從 RHR 預測開始的日期編號的函數,按膚色分組。陰影區域表示 95% CI。紅色虛線表示 MAE <5 bpm 的預設準確度目標。
由於我們的研究結果表明智慧型手機可以在自由生活條件下被動測量 HR,因此我們測試了我們的假設,即可以透過將 PHRM 預測與參考穿戴式 HR 追蹤器測量的每日 RHR 進行比較來估計每日 RHR。在 101 名參與者中,90 名(89.1%)至少有一天獲得了至少 20 次有效的 HR 測量,這是計算有效每日 RHR 所需的最低測量次數(補充圖 2)。在這些參與者中,在 685 個參與者日中有 504 個(73.6%)獲得了有效的每日 RHR 測量值。與參考穿戴式 HR 追蹤器相比,在總體研究人群中,PHRM 在每日和參與者層級的 RHR 測量 MAE 分別為 3.62 bpm(95% CI:3.18,4.09)和 4.39(95% CI:3.67,5.17)bpm。這兩個 MAE 值均顯著低於 5 bpm 的預設研究目標(P < 0.001),表明 PHRM 在普通手機使用期間被動地提供了準確的每日 RHR 測量。Bland–Altman 圖顯示,在參與者層級的最小偏差(0.1)和 95% 的一致性限制(調整後)之間,範圍為 -9.1 至 9.2 bpm(圖 4c)。
PHRM 導出的每日 RHR 與穿戴式 HR 追蹤器的每日 RHR 高度相關(r = 0.87,P < 0.001);與使用 ECG 在仰臥位(r = 0.73,P < 0.001)和坐姿(r = 0.74,P < 0.001)測量的傳統 RHR 方法的相關性也很高(延伸數據圖 3)。仰臥位和坐姿的個人內標準差(s.d.)分別為 5.08 bpm(95% CI:4.44,5.78)和 4.52 bpm(95% CI:3.95,5.11)。仰臥位和坐姿的 RHR 的變異係數(CV)分別為 7.85%(95% CI:6.84,9.01)和 6.68%(95% CI:5.81,7.64)。我們觀察到 PHRM 導出的 RHR 的再現性高於傳統方法,個人內 s.d. 為 1.20 bpm(95% CI:1.06,1.35),CV 為 1.77%(95% CI:1.56,1.99),均顯著較低。
在每日層級,群體 1 的每日 RHR 測量 MAE 為 3.44(95% CI:2.75,4.62),群體 2 為 3.47(95% CI:2.77,4.25),群體 3 為 4.06(95% CI:3.23,5.13);所有 MAE 值均顯著低於 5 bpm(P < 0.001)。在參與者層級,群體 1 的 MAE 為 3.72(95% CI:2.94,4.57),群體 2 為 3.56(95% CI:2.60,4.77),群體 3 為 5.86(95% CI:4.18,7.70);群體 1(P < 0.005)和群體 2(P < 0.001)的 MAE 顯著低於 5 bpm,但群體 3 未達到顯著性(P = 0.32)。然而,我們發現隨著卡爾曼濾波器收斂,所有膚色群體的 MAE 隨時間推移而下降。從第三天開始,群體 3 的 MAE 顯著低於 5 bpm(圖 4d)。從視覺上看,我們觀察到 PHRM 導出的 RHR 能夠捕捉到與穿戴式 HR 追蹤器獲得的趨勢相似的趨勢(延伸數據圖 4)。
最後,我們檢驗了從智慧型手機使用中估計的每日 RHR 是否與公認的心血管疾病風險因子相關,以此來確認我們方法的有效性。我們發現,在調整了年齡、性別和測量日期後,PHRM 導出的 RHR 較高的參與者更有可能表現出較差的健康指標;即肥胖和心血管健康狀況不佳(表 3)。在 PHRM 導出的每日 RHR 的廣義最小二乘(GLS)模型中,較高的 BMI 和較低的心血管健康狀況均為獨立預測因子(每增加 1 個標準差的 BMI 和最大攝氧量(VO 2 max),β 分別為 1.92 ± 0.57 bpm 和 -1.90 ± 0.27 bpm,P < 0.001)。總之,這些結果表明 PHRM 系統能夠產生準確的每日 RHR 估計值,並且與健康狀況指標相關。
據我們所知,這是首次證明智慧型手機可以在真實世界中,在正常個人手機使用期間,被動地監測 HR 和每日 RHR。這也是一個大規模且多樣化的前瞻性驗證研究,針對基於智慧型手機的 rPPG 系統。值得注意的是,我們提出的系統能夠在所有膚色群體中提供符合 ANSI 和 CTA 標準 32 的消費級 HR 監測器準確 HR 測量值(MAPE ≤ 10%),並且在我們的基準測試中優於最先進的 rPPG 方法。我們證明了基於智慧型手機的 rPPG 在所有膚色群體之間的性能非劣勢達到了預設目標,這對於公平測量至關重要。我們還發現智慧型手機能夠提供準確的每日 RHR 估計值;智慧型手機導出的 RHR 與已知的心血管疾病風險因子相關。
我們的研究將 rPPG 從概念可行性從靜止裝置提升到使用個人智慧型手機在自由生活環境中的大規模驗證。我們解決了先前研究中的主要差距,例如樣本量小和膚色多樣性有限,透過在 211 名參與者的 162,546 個影片上驗證我們的系統,並遵守 FDA 對所有膚色代表性的指導方針。透過刻意確保我們研究中深色膚色參與者的充分代表性,並引入一種將 HR 估計重新構建為多類分類問題的深度學習架構,我們實現了所有群體的公平性能。有關我們比較基準和建模技術的更詳細資訊,請參閱補充討論。此外,我們證明了這些被動、機會性的 HR 測量可以匯總成長期生物標記物,例如每日 RHR。值得注意的是,我們發現基於 PHRM 的每日 RHR 比傳統方法獲得的個人內 s.d. 和 CV 更低,表明其一致且可重複。推測原因在於,一天中許多 HR 的觀察值比單次仰臥位或坐姿測量值更能捕捉到一致的 RHR 值 10、42。基於智慧型手機的 RHR 與影響診間 RHR 的已知心血管疾病風險因子顯著相關,包括肥胖 43、44、45 和低 VO 2 max 46、44、。被動估計的 RHR 重現了這些已知的、基本的與肥胖和心血管健康指標相關的關係,這讓我們對我們提取的信號確實是生理性 RHR 充滿信心。我們的系統在此研究人群中的結果證明了其潛在的臨床意義,並暗示了透過 RHR 指標來自動監測健康狀況元素的可能性。這為自動收集數週、數月、數季和數年的縱向 RHR 數據打開了可能性,這些數據可以提供寶貴的健康資訊。
我們的研究存在一些局限性。在這項工作中,我們將測量公平性定義為兩個預設的公平性標準;即,所有三個膚色群體個別達到 MAPE 低於 10% 的 ANSI/CTA 標準,以及群體之間的準確性非劣勢。然而,這並不能否定膚色群體之間存在的任何差異。例如,在自動置信度篩選後,最深膚色群體的影片級測量成功率較低。這可能與影片中捕捉到的脈搏信號的信噪比(SNR)有關,據報導,該信噪比隨深色膚色而降低 47、48。較低的 SNR 被歸因於深色膚色中黑色素含量的增加,這限制了進入具有搏動性血管的皮膚深層的光量,並吸收了攜帶搏動性信息的擴散反射的一部分,而鏡面反射沒有減少 47、48。此外,我們無法排除可能在膚色群體之間存在的其他因素,例如參與者的身體活動水平、手機設備硬體以及環境或照明條件。我們的目標不是在每次手機互動時都產生 HR 測量值,因為某些情況根本不適合此類測量(例如,非常短暫的手機拿起、劇烈運動或非常差的照明條件),而是提供機會性的準確 HR 測量。對完整和篩選數據集的比較顯示,保留的有效影片保留了我們在自由生活研究中捕捉到的廣泛的日常生活條件,代表了真實、不受限制的使用者行為的橫截面。值得注意的是,儘管最深膚色群體的成功率較低,但該系統仍然捕捉到了足夠數量的有效測量值,為這些參與者計算出準確的每日 RHR,證明了這種方法在所有膚色群體中的可行性。潛在的更廣泛的緩解措施是,在遇到低 SNR 時增加測量嘗試次數。同樣,在受控條件下,我們也觀察到在白熾燈下,最深膚色群體的 MAPE 最高。這可能是因為白熾燈在綠色波長下的光譜功率較低 49,而綠色波長對血液吸收最為理想,因此脈搏信號的 SNR 較高。一種方法是研究優化相機曝光設置以提高 SNR,這可能會改善在這種照明條件下的成功率和測量準確性。在全球範圍內,白熾燈的使用越來越少,因為許多國家正在努力逐步淘汰白熾燈泡以提高能源效率 50。有幾名參與者的 MAPE 較高且異常。從這些參與者的影片中進行目視檢查,我們觀察到頻繁的頭部運動和說話。儘管我們的影片穩定方法在提高整體 HR 準確性方面是有效的,但我們觀察到它在某些影片中引入了明顯的偽影。考慮其他運動穩定技術可能為進一步改進提供機會。
在這項研究中,我們沒有考慮電池消耗的限制,而是收集了更多數據,因此在參與者手機解鎖的任何時間點都機會性地收集了影片。為了最大限度地降低智慧型手機的功耗並提高測量成功率,未來的努力應側重於識別最佳的感測條件,例如足夠的環境亮度和低運動,然後再啟動相機。對 RHR 演算法的進一步改進可以包括根據測量時間考慮晝夜節律,並使用加速度計數據來驗證足夠的休息時間。此外,由於智慧型手機的使用涉及固有的手部和手指運動,因此需要進一步開發以準確區分這些互動與整體身體活動水平。最後,我們的研究重點是普通人群中 HR 和每日 RHR 測量的有效性、可靠性和公平性;未來的研究可以探討該技術在臨床應用中的用途,例如監測心房顫動或心力衰竭患者。
需要考慮一些關鍵的隱私問題,以便尊重地使用這項技術。在啟用被動的基於影片的 HR 測量之前,應要求智慧型手機使用者給予明確的知情同意。為了確保參與者的隱私,影片被本地保存在設備上,並由參與者手動審查和上傳以供研究使用。參與者被特別指示排除敏感內容或除自己以外的任何面孔。儘管這種手動審查過程會引入潛在的人工審查差異,但它作為一種道德必需,以保護隱私並透過確認影片正確匹配參考 HR 數據來確保數據質量。由於每位參與者批准的上傳量很高,數據偏差的風險被認為很小。PHRM 系統的設計使其能夠在智慧型手機的處理器上本地運行,從而能夠在設備上處理影片。為了平衡測量準確性與覆蓋範圍和設備功耗,選擇了最短影片時長為八秒。因此,對於非常短暫的手機互動,沒有記錄影片。儘管有這些限制,驗證數據集有效地捕捉了廣泛的 HR 範圍,並包含了多樣化的真實世界挑戰,例如運動、低光照和尷尬的角度。此類系統可以實現在受保護的設備環境中,與未經授權的訪問隔離,例如可信執行環境,以確保影片圖像在執行期間保持安全。此外,實施此類系統可以使 HR 測量取決於成功的臉部身份驗證,從而減少對其他人的測量和錯誤的 HR 數據歸屬。
總之,我們開發並驗證了一個在普通手機使用期間被動測量 HR 和每日 RHR 的系統,該系統在所有膚色群體中均能準確運行。這項在 rPPG 技術領域的進展,為擴大所有智慧型手機用戶的心臟健康追蹤益處,提供了一種有前景的方法。
在 2020 年 10 月至 2024 年 3 月期間,我們進行了五項獨立的前瞻性實驗室研究和一項前瞻性自由生活研究,以獲取用於開發和驗證 PHRM 的數據集。所有研究方案均獲得了機構審查委員會(Quorum,現稱 Advarra,以及 WCG)的批准。我們獲得了所有參與者的知情同意,並根據赫爾辛基宣言的原則開展了這項研究。
在實驗室驗證研究中,我們使用分光光度計(Pantone RM200QC)對參與者臉頰和額頭的皮膚進行成像,客觀測量了每個參與者的膚色。對於自由生活研究,由於其完全是遠程進行且沒有面對面接觸,我們向參與者提供了 MST 的視覺表示,讓他們自行評估膚色 51。
為了在實驗室環境中驗證 PHRM 的 HR 測量,我們使用 BIOPAC MP160 系統記錄的心電圖作為參考基準。我們使用客製化的 LabVIEW(National Instruments)應用程式,記錄了放置在參與者上胸部(或上臂)和下腹部的電極上的三導聯心電圖信號。
為了在真實世界的自由生活條件下驗證 PHRM 的 HR 測量,我們使用了 Polar H10 ECG 胸帶。Polar H10 已被驗證可在運動期間提供準確的 HR 測量 52、53。參與者被指示每天早上佩戴胸帶至少七小時,淋浴或睡覺時除外。
由於匯總多個手錶 HR 測量值比仰臥位或坐姿的單次測量值更能提供一致的 RHR 值 10,因此我們選擇使用 Fitbit Charge 6(Google)的每日 RHR 作為我們主要的 RHR 參考。Fitbit 裝置產生的每日 RHR 是透過結合裝置加速度計確定使用者處於休息狀態且近期沒有移動的「休息」期間的多個 HR 測量值來計算的。如果可用,還會使用睡眠 HR 來改進每日 RHR 估計值。Fitbit 每日 RHR 已被證明最接近人們剛醒來時躺著時的 RHR 測量值 12。此外,參與者被指示在早上醒來後,在進食、飲水、運動或淋浴之前,進行兩次傳統的 RHR 測量。戴上 ECG 胸帶後,他們會仰臥 6 分鐘。接下來,他們靜坐 6 分鐘。仰臥和坐姿 RHR 測量值計算為 ECG 記錄中的最低 HR,並作為次要參考。研究發現 HR 在大多數個體在靜止四分鐘後會穩定下來 54。
為了同步自由生活研究期間所有研究設備的時鐘,參與者進行了由一系列三次跳躍組成的日常活動。我們指示參與者站立不動,雙手放在胸前。他們用慣用手拿著研究中註冊的智慧型手機;穿戴式 HR 追蹤器放在非慣用手上。為了進行跳躍系列,我們要求參與者啟動計時器,並完成以下序列:站立不動一分鐘,間隔 10 秒進行三次跳躍,然後再站立不動 10 秒。我們透過最大化各自加速度計信號在重新採樣到 60 Hz 後的互相關性來對齊智慧型手機和 ECG 胸帶的時間戳。
PHRM-HR 模組是我們演算法中預測 HR 測量的組件。PHRM-HR 模組處理 8 秒影片輸入以預測 HR。在本節中,我們將描述應用於原始影片的預處理流程、用於 HR 提取的深度神經網路以及置信度篩選演算法。
為了評估和優化 PHRM-HR 模組的每個子組件,我們使用了調整數據集,並在排除置信度分數最低的 20% 影片後計算了均方根誤差(RMSE)。我們注意到,這種排除僅在開發階段用於調整數據集上的超參數優化,而在測試階段則不進行。選擇 20% 是基於經驗結果,以減少由異常值引起的變異性,這些異常值使得區分超參數選擇變得困難。
為了準備用於 HR 提取的影片數據,我們實施了一個五步預處理流程。首先,使用基於臉部標記點質心的仿射變換來穩定影格 55,以提高對運動偽影的魯棒性。其次,我們使用具有 20% 邊距的最小邊界框進行臉部裁剪,以隔離臉部並減少背景噪聲。第三,使用抗鋸齒重採樣將影格縮放到 32 × 32 像素,以確保在行動裝置上的計算效率,同時保留信號質量。最後,我們在連續影格之間應用影格差異,以突出與生理信號相關的像素變化。每個預處理步驟的詳細描述可在補充資訊中找到。
為了從預處理的影片數據中提取 HR,我們使用了一個基於 TSCNN 架構 24 的深度學習模型。選擇此骨幹是因為它在建模時間依賴性方面效率高,有助於在智慧型手機上進行設備內處理。該網路處理 8 秒影片片段(以 15 Hz 運行,總共 120 個影格),以產生偽 PPG 信號,該信號透過快速傅立葉變換層轉換為頻域。這些頻率被分組到 1 bpm 的區間中,並應用 softmax 函數生成 HR 概率,最終 HR 計算為加權總和。該模型透過將 HR 迴歸重新構建為分類任務,使用應用於分組的真實值的 focal loss 56 進行訓練。我們使用基於高斯過程的工具 57 進行了廣泛的超參數搜索,並透過集成前五個模型來生成最終預測。有關具體網路層、優化計劃、數據增強技術、超參數和消融結果的更多詳細資訊可在補充資訊中找到。
由於真實世界環境中正常手機使用的非約束性,因此有必要應用篩選標準來丟棄對於可靠 HR 估計來說過於嘈雜的臉部影片,例如沒有臉部、臉部被遮擋或運動過度的影片。我們發現深度學習模型的 HR 預測置信度是此目的的有效指標,並使用調整數據集導出了一個最佳閾值。具體來說,我們使用 PHRM-HR 模組生成的 HR 概率的負熵,其中較高的負熵表示較高的置信度。在補充資訊中,我們比較了兩種替代方案,包括偽 PPG SNR 和最大 HR 概率,並發現負熵在確定有效 HR 測量方面最有效。
篩選的另一個關鍵方面是確定截止值,該截止值定義了過濾影片的閾值。為了確保此截止值在所有膚色群體之間準確且公平,我們在自由生活調整數據集中搜尋截止值時應用了兩條規則。首先,每個膚色群體的總體 MAPE 必須低於 8%。其次,任何兩個膚色群體之間的 MAPE 差距必須小於 3%。搜尋過程在補充資訊中有詳細說明。
對於每日 RHR 演算法,我們保持了簡單性以增強其泛化能力。首先,我們透過計算第十分位數值並應用偏差校正因子(對所有參與者都是恆定的)來匯總一天中的有效 HR 測量值。我們使用調整數據集對最佳百分位數和偏差校正值進行了網格搜索。接下來,我們應用卡爾曼濾波器來精煉來自嘈雜估計的 RHR 預測。我們還使用調整數據集確定了提供有效 RHR 估計所需的每日有效 HR 測量值的最低數量。我們方法的關鍵在於統計學:透過在一天中被動地捕捉大量 HR 測量值,我們創建了使用者每日 HR 的密集分佈。這種統計方法對身體或情緒激動期間的零星測量具有穩健性,因為這些較高的 HR 值會被過濾掉作為上尾異常值。卡爾曼濾波器的動機基於最佳狀態估計理論。我們的系統產生一系列每日 RHR 估計值,每個估計值都帶有一定的測量誤差。卡爾曼濾波器系統地結合了前一天狀態的預測與新的、嘈雜的測量值。