SensorFM – 谷歌推出面向可穿戴健康數據的通用基礎模型

AI工具12小時前發佈新公告 AI管理員
0 0

SensorFM是什麼

SensorFM 是 Google Research 推出的面向可穿戴健康數據的大型傳感器基礎模型,基於 500 萬參與者、超 1 萬億分鐘無標籤多模態傳感器數據預訓練,學習通用生理表徵,可遷移至心血管、代謝、睡眠、心理健康等 35 個健康預測任務,支持數據填充、標籤高效適應,作爲個人健康代理的 grounding 工具。

SensorFM – 谷歌推出面向可穿戴健康數據的通用基礎模型

SensorFM的主要功能

  • 通用生理表徵學習:從 PPG、加速度計、EDA、皮膚溫度、高度計五種傳感器模態中,提取 34 個一分鐘級聚合特徵,學習跨個體、跨設備的通用生理表示。
  • 多域健康預測:覆蓋心血管、代謝、睡眠、心理健康、生活方式、人口統計六大類共 35 個下游判別任務。
  • 缺失數據填充:用生成式預訓練能力,對傳感器數據中的缺失片段進行時間插值與外推,如 60 分鐘數據缺失時仍可保持 99.7% 的日步數預測精度。
  • 標籤高效適應:僅需少量標註樣本即可快速適配新任務,在數據稀缺場景下超越全監督基線。
  • Agentic 預測頭設計:部署多 LLM Agent 協作競爭,自動搜索並生成最優下游預測頭代碼,探索超 3 萬個候選方案。
  • 個人健康代理集成:將下游預測器作爲工具嵌入個人健康代理,提升 LLM 健康回答的上下文感知、個性化與安全性。

SensorFM的技術原理

  • 自監督重建預訓練:SensorFM 採用基於 LSM-2 的掩碼自編碼器框架,通過最小化掩碼區域的重建均方誤差,從萬億分鐘無標籤數據中學習生理信號的內在結構,無需依賴昂貴的健康標註。
  • Adaptive and Inherited Masking(AIM):將真實設備缺失與人工掩碼視爲等價,直接從不完整記錄中學習,使模型天生具備缺失感知能力,避免傳統插補帶來的偏差或數據丟棄造成的浪費。
  • 數據與模型聯合擴展:系統驗證從 100K 到 100M 參數、從 200 萬到 20 億傳感器小時的擴展規律,發現兩者同步擴展時,預訓練損失與下游性能呈近線性提升且未出現飽和,最大模型 SensorFM-B 在 33/35 任務上取得最優。
  • 線性探測評估:凍結 SensorFM 編碼器,僅在其上訓練輕量級線性頭,直接探測嵌入質量。結果顯示在 34/35 任務上超越人工特徵工程的全監督基線,且隨着模型規模增大,對人口統計特徵的依賴逐漸降低,說明大模型已隱式學到生理相關特質。
  • LLM Agent 自動優化:構建”課堂”式多智能體系統,讓多個 LLM Agent 迭代生成、測試、優化預測頭代碼,最終方案在 16/20 個分類任務和 12/15 個迴歸任務上超越簡單線性探測,且 Agent 能力越強,搜索到的方案越優。

如何使用SensorFM

SensorFM 目前處於技術預覽階段,可作爲學術研究參考,尚無法直接體驗或部署。

SensorFM的核心優勢

  • 規模領先:基於 500 萬人、1 萬億分鐘數據預訓練,是目前最大最多樣的可穿戴數據集。
  • 通用性強:單一表徵同時覆蓋六大健康領域 35 個任務,無需爲每個終點單獨構建流水線。
  • 缺失感知:AIM 機制將數據缺失轉化爲學習信號,非噪聲或負擔。
  • 標籤高效:少量標註即可超越全監督基線,解決醫療領域標註稀缺痛點。
  • 自動化適配:LLM Agent 自動設計預測頭,降低下游任務開發門檻。
  • 臨牀驗證:通過 1860 名臨牀醫生的評分驗證,集成到個人健康代理後的回答在相關性、安全性上顯著提升。

SensorFM的項目地址

  • 項目官網:https://research.google/blog/sensorfm-towards-a-general-intelligence-and-interface-for-wearable-health-data/
  • arXiv技術論文:https://arxiv.org/pdf/2605.22759

SensorFM的應用場景

  • 心血管健康監測:基於 PPG 和心率變異性特徵,持續評估心律異常、血壓趨勢等心血管風險,實現早期預警。
  • 代謝風險篩查:通過睡眠、活動量、皮膚溫度等信號組合,推斷糖尿病、肥胖等代謝相關風險指標。
  • 睡眠障礙分析:利用多模態傳感器融合,精準識別睡眠階段、呼吸中斷模式,輔助睡眠呼吸暫停等障礙篩查。
  • 心理健康追蹤:從心率變異性、皮膚電活動、活動模式中提取抑鬱、焦慮等心理狀態的微弱信號,支持長期情緒監測。
© 版權聲明

相關文章

暫無評論

暫無評論...