Google Research 发布 SensorFM,挑战单一任务的可穿戴健康模型
- Ethan Carter

- 3小时前
- 讀畢需時 15 分鐘
Google Research 发布了 SensorFM。该模型使用来自 500 万名知情同意参与者、总计超过一万亿分钟的可穿戴设备数据进行训练,旨在解决数字健康领域一个代价高昂的短板:大多数可穿戴设备算法仍然只针对单一结果、单一数据集和单一设备配置而构建。
SensorFM 研究提出了另一条路径。Google 表示,一套可复用的生理表征已成功迁移至 35 项预测任务,覆盖心血管、代谢、睡眠、心理健康、人口统计和生活方式等方面。
Google Research 将 SensorFM 定位为研究系统,而非临床产品。这一区别十分重要,因为其结果来自受控研究和回顾性评估,尚不足以证明该模型能够在医院、消费者健康指导应用或人群筛查项目中安全运行。
Apple 是这一领域的重要对标对象。Apple 的研究人员同样基于 Apple Watch 数据训练了基础模型,其中包括从大规模知情同意人群中收集的行为信号。如今,两家公司都开始将可穿戴设备数据视为训练通用模型的原料,而不再局限于彼此孤立的特征处理管线。
因此,眼下的竞争并非 Fitbit 与 Apple Watch 之间的硬件之争,而是通用生理建模与传统开发模式之间的较量——后者需要为每一个健康终点分别开发独立的监督学习模型。
Google Research 以人群级规模推出 SensorFM
SensorFM 将开发的基本单位从单项健康预测转变为可复用的人体生理表征。
Google Research 于 2026 年 7 月 9 日发布 SensorFM。高级研究科学家 Xin Liu 和研究科学家 Daniel McDuff 通过 Google Research 博客介绍了这项工作。
该模型使用 2024 年 9 月至 2025 年 9 月期间收集的去标识化数据进行预训练。共有 500 万名参与者同意将自己的数据用于健康与福祉研究。
数据集覆盖 100 多个国家、美国全部 50 个州,以及 20 多款 Fitbit 和 Pixel Watch 设备。Google 从每位参与者的数据中抽取了数周的样本。
最终形成的数据集包含超过 20 亿小时、即超过一万亿分钟的分钟级传感器信息。这一官方数字也纠正了部分摘要中所谓“100 万亿分钟”的错误说法。
SensorFM 会处理每个 24 小时时间窗口内、每分钟对应的 34 项聚合特征。这些特征来自五类传感器:光电容积脉搏波、加速度计、皮电活动、皮肤温度和高度计。
光电容积脉搏波通常简称 PPG,它利用光线测量皮肤附近的血容量变化。可穿戴设备会根据这些变化推导心率、血氧估值等信号。
加速度计用于捕捉运动;皮电活动用于测量皮肤电导的变化;高度计则用于估算海拔变化。这些输入共同描述睡眠、活动、体温、心血管活动及相关的日常规律。
这种多模态设计非常重要,因为健康信号很少孤立出现。静息心率升高可能有不同含义,具体取决于睡眠、活动、体温以及个人既有基线等因素。
Google 使用三项经机构审查委员会批准的前瞻性研究,对所学表征进行了 35 项任务评估。这些研究共纳入 13,985 名参与者。
相关任务涵盖六大类别,包括心血管健康、代谢风险、心理健康、睡眠、人口统计特征和生活方式特征。
在一项关键评估中,研究人员冻结了 SensorFM 的主编码器,随后基于其嵌入表征训练轻量级线性预测器。这些嵌入是对每个人传感器模式进行压缩后得到的数学表示。
Google 表示,这些线性预测器在 35 项任务中的 34 项上优于使用人工设计特征构建的监督学习基线。SensorFM 的最大版本则在 33 项任务中取得了最佳结果。
这些结果并不意味着一个模型可以诊断 35 种疾病。它们表明,同一套表征能够在众多研究目标之间保留有用信息,而无需为每个目标分别构建专用编码器。
这正是其核心变化所在。开发者可以从共享的生理表征出发,再使用规模较小、针对特定任务的预测层进行适配。
为何一个模型支持 35 项任务如此重要
SensorFM 给仍在针对每个健康终点和每项研究重复构建可穿戴健康管线的团队带来了压力。
传统可穿戴设备模型高度依赖带标签样本。研究人员首先定义结果,收集经过验证的标签,设计特征,然后针对该特定问题训练监督学习模型。
这种工作流程在范围明确的任务上可能表现良好。然而,诊断结果、实验室检测结果和经过验证的问卷数据收集成本高昂,而且研究结束后很难重新构建。
可穿戴设备数据存在一种特殊的不平衡:设备会持续产生测量数据流,但研究人员能够获得的可信标签却相对有限,难以解释这些数据流在临床上的实际含义。
SensorFM 使用自监督学习来缩小这一差距。该方法会隐藏部分输入,并训练模型重建这些内容,而无需为每条记录提供诊断标签。
因此,模型能够直接从传感器数据本身的结构中学习。之后,研究人员可以使用规模较小的带标签数据集,检验这种结构能否支持特定预测任务。
Google 报告称,即使只使用一小部分可用标签,SensorFM 的表现也比基于人口统计信息和人工设计特征的基线模型更具竞争力。不过,该公司并未将这一结果描述为临床验证的替代方案。
即便如此,更高的标签利用效率仍会改变早期研究的成本结构。团队无需先搭建一套完全独立的大规模建模管线,即可探索新的健康终点。
SensorFM 的规模也使其有别于 Google 此前的可穿戴设备研究。它的前代模型 LSM-2 使用了来自 6 万多名参与者的 4,000 万小时数据进行训练。
早期的 LSM-2 框架建立了一套从不完整传感器数据流中学习的方法。SensorFM 则将这一方法扩展至更多参与者、设备、地区和下游任务。
Google 测试了参数规模从 10 万到 1 亿不等的模型,并将预训练数据量调整至跨越约四个数量级的范围,从 200 万传感器小时增加到 20 亿传感器小时。
与最小版本相比,最大版本将重建损失降低了 31%。Google 还报告称,其分类指标平均提升 9%,回归指标平均提升 21%。
这些百分比描述的是研究团队报告的相对性能提升,并不代表临床准确率、疾病风险降幅或患者治疗效果的改善程度。
更重要的是,Google 表示,当数据量与模型容量同步增长时,模型性能也会随之提升。其公布的扩展曲线尚未出现明显的平台期。
这一结果给规模较小的研究项目带来了压力。如果通用生理表征能够随着人群级数据规模的扩大而稳定改进,那么拥有大型可穿戴设备平台的机构将获得结构性优势。
设备制造商已经掌握了这种方法所需的连续数据,同时还运营着收集数据所必需的用户同意系统、硬件设备群和长期服务。
医院拥有更丰富的临床标签,但其可穿戴设备数据往往分散在不同供应商和病历系统中。初创企业或许拥有针对性更强的数据集,但很少有企业能够达到平台级的长期数据收集规模。
因此,SensorFM 将竞争重点转向数据获取、用户同意、数据质量和适配基础设施。模型架构依然重要,但训练语料已成为核心战略资产。
真正的关键机制是从缺失数据中学习
SensorFM 最具影响力的特征并非参数规模,而是能够从现实可穿戴设备使用中普遍存在的数据缺口里学习。
可穿戴设备产生的数据流很少是完整的。人们会给设备充电、将表带调松、关闭传感器、启用省电设置,也会把手表留在床头柜上。
硬件配置同样存在差异。有些设备可以记录皮肤温度或皮电活动,另一些设备则只能提供运动和光学心率信号。
传统自监督系统通常假定输入数据是完整的。因此,研究人员必须先用估算值填补缺口,或在训练前删除不完整样本。
这两种做法都会带来问题。插补可能引入人为模式,而筛选则可能排除那些产生最混乱数据的用户和情境。
SensorFM 建立在 Adaptive and Inherited Masking 方法之上,该方法简称 AIM。它将数据中自然存在的缺失部分与训练时人为隐藏的数据视为重建目标中相互关联的组成部分。
“Inherited”掩码表示记录中原本就存在的缺口。“Adaptive”掩码则让模型能够在训练过程中处理数量和位置不断变化的数据缺口。
这种设计使模型学到的表征能够感知数据缺失情况,无需每个传感器在全天范围内持续提供不间断的信号。
这一机制最早源于 LSM-2。Google 报告称,在该项目检查的 160 万个全天时间窗口中,没有任何一个包含完全不间断的数据。
这一观察意味着,缺失数据并非边缘情况,而是正常运行状态。实用的可穿戴设备模型必须在人们以普通用户、而非研究仪器使用者的方式行动时仍能正常工作。
SensorFM 还能学习填补特定缺失指标。具体而言,它可以依据周边信号以及不同模态之间的关系,估算传感器数据流中的部分内容。
这项能力可用于多种研究场景,包括支持存在记录缺失的回顾性研究、统一不同设备型号的输入,或恢复下游分析所需的每日指标。
不过,重建后的数值仍然只是模型估算结果,不应被表述为设备实际采集到的测量值。
这一区别在健康应用中尤为重要。估算出的睡眠阶段或生理模式可以为分析提供支持,但不应在未作说明的情况下作为实际观测结果写入医疗记录。
Google 的核心主张更为审慎,也更具可信度:相比自动填补或丢弃每个不完整时间窗口的管线,能够感知数据缺失情况的预训练方法可以保留更多有用信息。
该模型还采用完整的 24 小时时间窗口,使其能够在同一套表征中关联日间活动、夜间睡眠、静息模式以及其他日常信号。
这种方法不同于围绕短时事件训练的模型,例如针对单次心跳或短暂活动片段的模型。不同的时间粒度适用于不同的问题。
SensorFM 的全天窗口更适合捕捉广泛的生理和行为模式,但对需要秒级或毫秒级分辨率的急性事件检测,其适用性并不明显。
这一局限并不会削弱基础模型这一概念,而是界定了 SensorFM 所处的应用层级:它面向纵向数据解读,而非涵盖所有形式的实时感知。
SensorFM 与 Apple 可穿戴模型战略对比
Google 和 Apple 正在可复用的可穿戴模型方向上逐渐趋同,但两家公司强调的表征方式与平台优势各不相同。
Apple 研究人员于 2025 年介绍了 Wearable Behavior Model。他们使用来自 16.2 万名参与者、总计超过 25 亿小时的数据训练基础模型。
这项 Apple 可穿戴设备研究评估了 57 项健康相关任务,重点关注运动、睡眠、锻炼和行动能力模式等行为摘要。
SensorFM 覆盖的参与者更多,并以分钟级多模态信号为核心。Apple 已发表的行为研究则涵盖了更多报告时长,因为它从研究队列中提取了长期行为历史。
这些数字并不能构成简单的模型排行榜。两家公司采用的数据定义、研究队列、任务、架构和评估规程均不相同。
Apple 的模型探索行为数据能否比单纯的底层传感器信号更有效地预测健康状态。Google 的 SensorFM 则专注于从多种传感器模态中学习广泛的生理表征。
这两条路线既相互竞争,也彼此补充。行为摘要能够捕捉较长时间尺度上具有意义的活动,而底层信号则保留了可能被摘要掩盖的生理变化。
Apple 此前还为 PPG 和心电图信号开发过基础模型。该研究将不同类型的生物信号分别视为大规模预训练领域。
Google 如今主张构建一个横跨五种模态和多种设备配置的统一层。其优势来自整个生态系统中可获得的 Fitbit 和 Pixel Watch 数据。
Apple 的战略优势同样清晰。Apple Watch、HealthKit 和长期开展的研究项目,为从传感器数据采集到消费级软件提供了一条整合路径。
目前,两家公司都尚未证明通用可穿戴模型能够安全地支持常规临床决策。现有成果描述的是研究评估,而非受监管的诊断产品。
不过,这场竞争依然重要,因为两家公司都能将模型研究与设备、操作系统及消费者健康界面连接起来。成功的基础层可以降低未来新增健康功能的成本。
它还可能影响开发者接口。平台未来或许不再只提供原始指标,而是能够提供基于用户长期模式的嵌入、预测结果或智能体工具。
这种可能性形成了第二条竞争边界:可穿戴平台可能会围绕谁能掌控原始传感器数据与最终用户建议之间的生理表征层展开竞争。
开放研究则提供了另一条路径。2026 年推出的 OpenMHC 涵盖超过 6000 万小时的可穿戴设备数据,并提供了一个基于 MyHeart Counts 研究的开放框架。
开放模型能够提高研究的可复现性,并为独立团队提供统一基准。不过,它们仍然面临规模、用户同意、硬件多样性和临床标签等限制。
SensorFM 的论文和博客文章并未宣布公开模型权重、通用开发者 API 或即将上线的 Fitbit 功能。这意味着 Google 当前的优势仍停留在研究领域,尚未扩展到更广泛的开发者市场。
因此,真正重要的比较并非消费级功能清单,而是哪家机构能够将通用表征转化为经过验证、易于访问且治理完善的健康工具。
SensorFM 的研究结果尚不能证明什么
SensorFM 的规模使其备受关注,但规模本身无法解决代表性、隐私、临床有效性或部署风险问题。
预训练语料库包含来自 100 多个国家、已同意参与研究的用户。地域覆盖广泛并不自动意味着样本在人口统计或临床层面具有代表性。
可穿戴设备用户与普通人群在收入、技术可及性、年龄分布、健康参与度和设备使用方式等方面存在差异。这些差异可能影响模型学习到的模式。
Google 表示,随着模型规模扩大,人口统计特征带来的增量收益有所减小。研究人员将其解读为证据,认为更大的模型能够隐式捕捉相关生理特征。
这一发现需要谨慎看待。从传感器模式中推断人口统计或健康相关特征可能提高预测能力,但也会带来隐私和公平性问题。
即使经过去标识化处理,传感器数据流仍可能包含独特的行为和生理模式。研究人员已警告称,去标识化未必能够消除可穿戴数据集中的所有重新识别风险。
用户同意的适用范围也需要精确定义。参与者同意将数据用于研究,但未来的商业或临床应用仍需单独的治理、产品审查和法律分析。
SensorFM 报告的下游研究共涉及 13,985 人。作为研究评估,这一规模相当可观,但与 500 万人的预训练语料库相比仍小得多。
这些评估采用的也是经过筛选的任务和研究队列。独立复现还需要测试不同人群、设备品牌、数据缺失模式和医疗环境。
心理健康预测尤其需要谨慎对待。Google 表示,在抑郁和焦虑任务中,传感器信号往往微弱且个体差异很大,而扩大模型规模带来了显著收益。
性能更强的研究分类器并不能直接形成诊断。情绪、睡眠、用药、工作安排、残障状况和社会环境都可能产生相互重叠的可穿戴设备模式。
假阳性可能引发焦虑或不必要的医疗干预。假阴性则可能让需要专业评估的人获得错误的安心感。
心血管和代谢预测同样需要保持谨慎。模型输出可以识别统计相关性,却未必能够解释其成因或为治疗决策提供依据。
一篇 2026 年的医疗健康模型综述指出,隐私、人口统计偏差、可解释性和反复临床验证是此类模型面临的常见风险。这些问题同样直接适用于可穿戴基础模型。
设备测量误差又增加了一层不确定性。光学心率传感器、皮肤温度读数和运动估算结果会随佩戴贴合度、运动状态、环境、皮肤特征及硬件代际而变化。
SensorFM 覆盖了 20 多款 Fitbit 和 Pixel Watch 型号,有助于测试 Google 生态系统内部的设备多样性。但这并不能证明模型在 Apple、Garmin、Samsung、Oura 或临床设备上具有同等表现。
模型的智能体实验也需要同样谨慎解读。Google 将 SensorFM 集成到研究性质的 Personal Health Agent 中,并使用 31 份参与者档案评估其生成的摘要。
临床医生围绕情境、相关性、可论证性、个性化和潜在伤害等五个维度,共进行了 1,860 次盲评。Google 表示,与仅使用每日指标的基线方案相比,以 SensorFM 为依据后,所有维度均有所改善。
该团队还报告称,以 SensorFM 预测为依据生成的摘要,与使用真实测量值生成的摘要之间不存在统计显著差异。
这一结果很有意思,但样本仅包含 31 份档案。未发现统计显著差异,并不能证明两者在更大规模人群、不同疾病或更长时间的互动中具有等效表现。
Google 此前也将其健康智能体原型描述为研究框架。该公司明确表示,这并非对现有产品或功能的说明。
模型之外的工作流程障碍也依然存在。医生需要经过验证的输出、明确的责任归属、易用的界面,以及与电子健康记录的集成。
2026 年一项覆盖 2,222 名医生的调查发现,医生对可穿戴设备数据仍有兴趣,但集成方面存在重大障碍。临床验证、工作流程支持、费用报销和责任归属仍是尚未解决的问题。
SensorFM 解决的是数据解读层的问题,而非这些制度性约束。更好的嵌入无法独立建立报销政策、医疗责任机制或可互操作的健康记录。
三个信号将表明 SensorFM 是否真正重要
只有在研究成果之后出现独立验证、更广泛的开放访问和负责任的产品部署,SensorFM 才会产生实质性影响。
第一个信号是独立评估。Google 之外的研究人员需要获得足够的技术细节、代码、权重或标准化输出,才能复现报告中的性能提升。
最有力的测试,是在未见过的机构、人群和可穿戴设备品牌中,将 SensorFM 与监督学习基线及其他基础模型进行比较。结果不仅应包括平均排名,还应涵盖不同子群体的性能和校准情况。
校准用于衡量预测概率与实际观察结果是否一致。健康模型可能能够准确地对人群进行风险排序,却仍给出不适合用于决策的风险估计。
如果这种表征能够跨硬件和研究队列迁移,独立测试将强化 Google 关于泛化能力的主张。如果某些子群体表现不佳,则该主张的适用范围将被限定在特定研究人群内。
第二个信号是开发者访问。Google 已介绍了论文和研究方法,但尚未宣布通用的 SensorFM API 或可下载的模型权重。
访问条款将揭示 SensorFM 会成为共享基础设施,还是继续作为内部研究资产存在。相关文档应明确支持的设备、预期用途、数据要求和禁止的应用场景。
实用的接口还应区分实测数据、重建数值和推断出的健康属性。开发者不应被迫通过逆向分析来判断哪些输出是观测结果、哪些是估计值。
开放程度也将影响其与 Apple 及开放项目之间的竞争。封闭的平台模型可以与设备深度集成,而开放模型则允许更广泛的审计与适配。
第三个信号是经过审查的产品部署。Fitbit 或 Pixel 的健康功能将展示 Google 如何把这种表征转化为用户语言、安全保障、同意控制和升级处置路径。
关键问题并不在于 AI 教练听起来是否足够个性化,而在于用户能否检查依据、理解不确定性、纠正错误,并在必要时获得专业医疗服务。
个人健康工具还需要持久的上下文。用户可能会将可穿戴设备趋势与实验室检查结果、临床医生指示、用药变化和自身观察结合起来。
通用的个人知识系统展示了跨时间连接信息的价值。然而,普通知识工具不应取代受监管的医疗记录或专业建议。
Google 的智能体“课堂”是此类部署中另一个值得关注的信号。多个语言模型智能体利用 SensorFM 嵌入生成并改进预测头。
该系统探索了超过 30,000 个候选方案。其生成的预测头在 20 项分类任务中的 16 项,以及 15 项回归任务中的 12 项上,表现优于简单的线性探针。
这种工作流程可以减少人工实验,但也扩大了验证负担。自动生成的代码需要接受可复现性验证、数据泄漏检查、安全审查和专家监督。
据 Google 称,能力更强的 Gemini 版本生成了更好的候选方案。智能体之间的协作也帮助能力较弱的模型缩小了部分性能差距。
这种组合连接了两个基础模型层。SensorFM 表征人体的传感器历史,而语言模型智能体则通过搜索代码,将这些表征适配到具体问题上。
由此形成的是一套自动化程度更高的研究技术栈,而不是自动化的医疗权威。
SensorFM 值得关注,因为它以前所未有的规模直击一个真实的技术瓶颈。可穿戴设备项目收集的未标注数据,远多于经过临床验证的结果数据。
Google 的解决方案是学习一种能够感知数据缺失情况的统一生理表征,再将其复用于多种任务。其公布的研究结果表明,无论是设备平台还是数字健康研究人员,都越来越难以忽视这一策略。
下一步的验证必须在原始基准之外完成。值得关注的包括独立复现、实际可用性,以及经过评审且明确披露局限性的产品。
在此之前,Google Research 推出的 SensorFM 应被视为对单任务可穿戴设备建模范式的一次有力挑战,而非已经成熟的个人健康智能系统。读者应依据证据、可用性和问责机制来评判其下一次发布,而不能只看规模。


