Imperial 的睡眠年龄 AI 标记痴呆风险,但预测不等于诊断
- Sophie Larsen

- 1天前
- 讀畢需時 14 分鐘
伦敦帝国理工学院的研究人员凭借一套 AI 系统登上 Google News:该系统利用数月的睡眠数据区分痴呆患者与对照组。在研究人员将模型输出转换为风险类别后,该模型在未见数据上的灵敏度达到 75.7%,特异度达到 74.7%。
这些数字让该项目不只是又一项将睡眠不佳与认知衰退联系起来的实验。该系统使用放置在床垫下方的传感器,将每个人的睡眠模式与其实际年龄所对应的预期模式进行比较。
矛盾点在于持续筛查与临床确定性之间。被动式传感器可以在无需日常测试、就医或坚持佩戴设备的情况下观察行为。然而,该模型不能诊断痴呆、确定因果关系,或解释它检测到的每一项偏离。
随着医疗系统寻找更早期、负担更小的预警信号,这一区别尤为重要。血液生物标志物和认知评估能够提供更直接的证据,但需要走入主动的临床流程。被动睡眠监测则有望在这一流程启动前提供更广泛的观察。
因此,这项新研究检验了一个影响深远的设想:日常夜间行为或许能帮助临床医生判断哪些人值得接受更深入的评估。它并未证明床垫传感器可以取代神经科医生、认知测试、影像检查或实验室证据。
睡眠年龄模型实际带来了什么改变
关键变化不在于 AI 能够分析睡眠,而在于研究人员在普通家庭和临床痴呆人群中测试了被动监测。
这项已发表研究于 2026 年 7 月 21 日在线发表于 npj Digital Medicine。研究人员来自伦敦帝国理工学院、英国痴呆症研究所、伦敦大学学院及多家临床机构。
其流程分析了床垫下传感器的纵向读数。与智能手表不同,这类传感器无需充电、佩戴或每日交互。它从床下记录与睡眠时间、时长和活动相关的信号。
完整数据集包含 1,672 人和 18,369 个人次样本。这种重复测量结构很重要,因为模型并不限于观察单个夜晚,而是能够查看多次观测中的模式和变化性。
研究人员首先训练系统根据睡眠行为估计实际年龄。他们将由此得出的指标称为睡眠年龄指数(Sleep Age Index),它反映估计睡眠年龄与实际年龄之间的差异。
在留出数据上,该系统估计实际年龄的平均绝对误差为 5.52 年。报告的 95% 置信区间为 5.37 至 5.67 年。
这一结果并不意味着传感器能以五年精度识别一个人的生物年龄。训练时使用的目标是实际年龄。具有临床意义的信息来自围绕预期模式出现的偏离。
痴呆患者表现出的睡眠特征偏离了正常的年龄相关趋势。不规律的就寝和起床时间造成了这些差异。报告模式中还出现了深睡眠夜间变化性的降低。
随后,团队将模型输出转换为低、中、高风险类别。经过这种分层后,系统识别痴呆病例的灵敏度达到 75.7%。灵敏度描述系统正确标记实际病例的比例。
其特异度达到 74.7%。特异度描述模型正确识别未患该疾病对照组的比例。
这些指标既显示了模型的潜力,也揭示了它的局限。在 75.7% 的灵敏度下,在可比测试条件中,大约四分之一的痴呆病例仍不会被标记。特异度为 74.7% 时,大约四分之一的对照者会收到阳性标记。
研究人员还考察了一个由 50 名高风险人群组成的试点队列。相对于临床判断,预测结果呈现轻微正向偏差。平均差异为 0.98,一致性限度为负 0.83 至 2.78。
因此,风险标记需要在更完整的临床流程中加以解读。它可以触发认知筛查、用药审查或睡眠障碍评估,但不应成为通过应用通知推送的诊断结果。
这正是 Google News 标题背后的关键变化。该研究推动被动睡眠监测从宽泛关联走向可检验的风险筛查工作流程,同时也揭示了有用信号与可靠医疗决策之间的距离。
为什么被动睡眠数据给现有筛查带来压力
被动监测促使医疗系统决定:频繁但并不完美的观察,是否比偶尔进行的高置信度评估更有价值。
痴呆评估通常始于患者、家属或临床医生注意到某种明显变化之后。这个过程可能错过渐进式变化,尤其是在症状有所波动或人们能够在短暂就诊中进行补偿时。
远程睡眠监测提供了另一条路径。它能反复收集行为证据,无需人们记住测试、打开应用程序或前往诊所。这种低负担方式对独居老年人尤其相关。
承压对象并非某一家竞争企业,而是间歇式筛查模式:临床医生通常只有在担忧变得明显后才评估认知能力。压力来自持续数据,因为它可以揭示两次就诊之间的变化。
这并不意味着传统评估已经过时。认知测试能更直接地测量记忆、注意力、语言和执行功能。影像与实验室生物标志物则能考察睡眠行为无法识别的疾病过程。
不过,临床测试通常只捕捉一个人在狭窄时间窗口内的状态。被动传感器则能记录较长时期内的日常规律。这些方法回答的是不同问题,因此更适合用于分诊而非替代。
分诊系统会对需要优先关注的人进行排序。在实践中,睡眠风险评分可能帮助记忆门诊服务确定评估优先级。社区护理团队也可能利用评分变化来复查脆弱患者。
当医疗服务可及性有限时,潜在收益会更大。根据世界卫生组织,痴呆会影响记忆、思维、行为及日常活动能力。更早发现可支持护理规划,并帮助调查可治疗的影响因素。
不过,规模会改变错误所带来的后果。在大范围人群中筛查时,适度的假阳性率也可能导致大量不必要转诊。假阴性则可能让仍需评估的人获得虚假的安心。
研究人群同样会塑造模型表现。在特定家庭环境、设备和临床群体上训练的模型,可能学到无法顺利迁移到其他环境中的模式。住房条件、共床睡眠、夜间照护和行动受限都会影响读数。
睡眠本身还受许多与痴呆无关的状况影响。疼痛、抑郁、药物、酒精、轮班工作、睡眠呼吸暂停和泌尿症状都可能改变夜间行为。风险模型必须区分这些因素,或明确传达其不确定性。
研究人员使用纵向数据,为应对暂时性干扰提供了一层保障。当模型观察到数月行为时,一个糟糕夜晚的权重应当更低。但持续性变化依然可能有多种解释。
这正是被动监测带来压力、却无法终结这场竞争的原因。它提供了传统评估无法匹敌的观察频率;传统评估则提供了床垫传感器无法复制的背景信息和特异性。
对医疗机构而言,所需的回应很可能是流程上的。它们需要设定转诊阈值、重复测量规则,以及讨论不确定结果的规范。同时,它们还需要证据证明这一过程能够改善结果。
技术团队也面临相关挑战。他们必须保持校准度,即所述风险是否与观察到的结果相匹配。一个能正确排序患者的模型,仍然可能给出误导性的风险估计。
用户还需要记录每项决策受到哪些因素影响。纵向系统可能生成大量观测数据和临床记录。可检索的 AI knowledge base 可以整理这类证据,尽管它无法验证医疗模型。
因此,短期压力将落在数字健康开发者和医疗服务提供者身上。他们必须将持续检测转化为负责任的流程。没有这样的流程,更多数据可能制造焦虑,而非带来有用的医疗服务。
Google News 的关注掩盖了真正的技术较量
核心较量是被动风险筛查与临床确定性之间的较量,而不是一个睡眠算法与另一个睡眠算法的竞争。
这套由 Imperial 主导的系统学习睡眠模式、年龄和痴呆状态之间的关系。它的优势来自在普通环境中的重复观察,主要弱点则来自目标信号的间接性质。
睡眠与大脑健康有关,但相关性可能双向存在。神经退行性变会扰乱睡眠。睡眠不佳也会影响认知,而其他疾病也可能同时影响两者。
模型能够检测两种模式共同出现,却不一定能发现其原因。因此,这一结果适合用于风险估计,却不能据此宣称睡眠导致了认知衰退。
研究人员提出的睡眠年龄指数,在原始数据与临床审查之间提供了一座易于理解的桥梁。它询问观测到的睡眠是否类似于模型对某一年龄的预期。更大的偏离随后可支持风险分类。
但直观的标签也可能引发过度解读。“睡眠年龄”听起来像生物学概念,即使它来自统计估计。临床医生和产品设计人员必须说明,这个数字依赖于模型。
该方法不同于多导睡眠图检查——这是一种记录脑部、心脏、呼吸、眼部和肌肉信号的实验室评估。床垫传感器捕捉的信息细节较少,但可以长期留在家中进行监测。
另一项由 Stanford 主导的项目展现了这种设计选择的另一面。SleepFM 研究使用了来自 65,000 名参与者的近 600,000 小时多导睡眠图数据。
SleepFM 结合多个生理信号通道,并将记录划分为五秒片段。其训练方法会隐藏一种信号类型,并要求模型根据其他信号重建它。
研究人员随后将睡眠实验室记录与长期健康结果相联系。Stanford 报告称,该模型以合理的预测准确度识别出 130 种状况,其中包括痴呆、帕金森病、心血管疾病、癌症和死亡率。
对于痴呆,Stanford 报告的 C 指数为 0.85。C 指数衡量模型正确排序哪一个人更早发生某种结果的频率。它不能与灵敏度或特异度互换。
因此,这两个项目无法用一个醒目的数字直接比较。它们使用不同的数据、预测目标、随访结构和评估指标。一个强调实验室整夜采集的丰富信号,另一个则强调在家中进行重复观察。
这种对比揭示了真正的工程权衡。丰富的临床数据能够捕捉更多生理信息,但采集成本高且不够方便。被动式家庭数据细节较少,但其采集频率能够揭示稳定模式和变化。
消费级可穿戴设备处于另一个位置。手表和戒指可收集心率、运动、体温和估算的睡眠阶段。它们拥有广泛的覆盖范围,但依从性和硬件差异可能使纵向分析变得复杂。
床垫传感器无需充电或佩戴。但当用户更换床铺、与人同床、出行或在夜间接受照护时,它也可能面临挑战。部署细节会成为模型性能的一部分。
Google News 的报道可能会将这些差异简化为“AI 根据睡眠预测痴呆症”的说法。研究支持的是更为狭义的结论:在所评估的数据集中,睡眠衍生模式有助于区分痴呆症病例与对照组。
这一较为狭义的结论依然具有意义。医学常常利用并不完美的信号来判断是否有必要进行更具针对性的检测。血压、症状、家族史和筛查问卷都能提供参考,但并不构成确诊。
因此,标准应当是比较性的。研究人员需要证明,与年龄、病史、用药数据和基础认知问卷相比,睡眠监测是否能够进一步改善决策。
他们还需要测试,系统能否在临床医生或家属察觉症状之前发现变化。在健康人群中预测未来认知下降,与区分现有痴呆症患者和对照组是不同的任务。
当标题强调预测时,这一区别往往会被忽略。横断面分类器识别的是当前差异;预后模型则根据更早期的证据估计未来结果。临床价值在很大程度上取决于系统实际执行的是哪一种任务。
已发表的工作包括一项高风险试点和纵向监测,但更大规模的前瞻性验证仍然至关重要。前瞻性意味着研究人员在结果发生前就定义测试方案,然后在新患者中观察其表现。
在这些证据到来之前,最有力的应用场景是决策支持。该系统可以为临床判断增加一项信号,但不能就个人的诊断或未来状况提供确定结论。
准确率数字无法解决的问题
该模型报告的准确率对研究而言颇具前景,但并不能证明其在常规医疗中的安全性、公平性或益处。
敏感性和特异性取决于所选择的阈值。降低阈值会捕捉更多潜在病例,但通常也会产生更多误报。提高阈值会减少误报,同时漏掉更多人。
风险分层让模型输出更容易使用,但其中嵌入了政策选择。诊所必须决定中等风险结果出现后该如何处理,也必须决定高风险是否应触发紧急评估或重复监测。
患病率会改变任何阳性结果的含义。痴呆症在专门的记忆障碍服务中比在普通人群中更常见。在这些不同场景中,相同的敏感性和特异性可能产生不同的阳性预测值。
阳性预测值衡量的是阳性结果代表真实病例的频率。在低患病率人群中,即使标题中的准确率看起来相当可观,假阳性也可能多于真阳性。
已发表的摘要并未确立一项面向全人群的筛查计划。它报告了在普通人群、痴呆症队列和一项小型高风险试点中的开发与评估。
该试点的 50 名参与者提供了有用的实施证据,但并非确凿的临床验证。小样本可能产生不稳定的估计,也未必能代表国家卫生体系中的多样性。
人口统计学公平性同样需要直接检验。睡眠模式会随着年龄、文化、工作安排、住房条件、残障情况和照护责任而变化。传感器性能也可能因床型和家庭居住安排而不同。
如果训练人群缺乏代表性,模型可能会将合理的社会差异视为医学异常。研究人员应在广泛部署前公布各亚组的敏感性、特异性、校准情况和失效模式。
隐私又带来了另一个尚未解决的问题。夜间行为可以揭示一个人何时上床、醒来、离开房间或经历睡眠中断。长期监测还可能暴露敏感的家庭生活规律。
卫生系统需要制定严格规则,规范访问、保留、二次使用和删除。知情同意应说明传感器的测量内容,以及算法可能推断出的结论。
患者还需要对通知拥有控制权。一条暗示认知下降的消费级提醒可能引发严重焦虑。结果应通过能够提供解释、确认和支持的流程传达。
监管将取决于产品的预期用途。仅追踪睡眠的软件,与建议临床行动的软件面临不同程度的审查。关于痴呆症风险的声明可能使产品进入医疗器械范畴。
FDA device list 显示,已有多少由 AI 驱动的产品进入受监管的医疗领域。被列入该清单并不意味着每个 AI 健康模型都获得了临床授权。
开发者必须明确模型的目标人群和决策角色。他们还需要制定变更控制程序,因为再训练可能改变性能。持续更新的模型会使验证和问责变得复杂。
可解释性仍是另一个问题。临床医生需要知道,高分究竟反映了不规律的作息时间、深度睡眠变异性降低、活动情况,还是设备伪差。缺乏背景的风险数字可能很难受到质疑。
解释本身并不能保证正确。模型可以为错误输出提供看似合理的理由。更重要的保障措施,是建立一个将预测与独立临床证据进行核对的升级处理流程。
最大尚未解答的问题关乎结果。只有当后续应对能够帮助患者时,更早发现风险才有价值。研究人员必须测试监测是否能加快有益的评估、减少危机,或改善规划。
过度诊断也可能造成伤害。一个人可能因短暂的睡眠中断而接受令人紧张的检查。另一个人则可能根据缺乏临床确认的评分改变用药或行为。
该系统的开发者将其定位为识别可能从进一步评估中获益的人群的工具。这种表述是恰当的,它将工具限定在筛查而非诊断的范围内。
Google News 的报道应保留这一界限。“可以识别与认知下降相关的模式”是站得住脚的说法。“可以判断某人是否会患上痴呆症”则超出了所述证据的范围。
独立重复验证将增强可信度。原始合作团队之外的研究人员应在新的卫生系统、家庭环境、设备和患者群体中测试这一流程。
该模型还应与更简单的基线方法比较。年龄、睡眠时长、就寝时间变异性、既有诊断和用药清单可能提供可观的预测价值。复杂 AI 只有在优于这些输入时才有其价值。
一份有用的验证报告应展示纳入和不纳入各类数据源时的性能,说明缺失的夜间数据如何影响预测,以及监测需要持续多久才能得出稳定评分。
这些细节决定了技术是否适合真实医疗场景。一个需要数月完美数据的模型可能难以在实践中发挥作用;一个能在数据缺口中保持稳定的模型,则更支持广泛部署。
决定睡眠 AI 是否重要的三项信号
下一阶段应衡量前瞻性检测、工作流程影响和跨人群迁移能力,而不是追求更高的实验室评分。
第一项信号是一项前瞻性研究,纳入入组时尚未被诊断为痴呆症的人群。研究人员应根据早期睡眠数据计算风险、冻结模型,并追踪之后的认知结果。
这样的研究将回答最重要的时间性问题:异常的睡眠衍生评分是否在公认的认知下降之前出现,还是主要描述已经存在的变化?
如果前瞻性表现仍然强劲,早期筛查的依据将更具可信度。如果表现下降,当前模型可能主要是用于分类既有差异的工具。
第二项信号是在真实记忆照护或基层医疗路径中开展实施试验。该试验应将常规实践与纳入远程睡眠风险评分的工作流程进行比较。
研究人员应衡量转诊时机、完成评估的情况、临床医生工作量、误报、患者焦虑以及获得确诊所需时间。仅凭准确率无法揭示这些后果。
积极的实施结果将表明,该工具能以建设性的方式改变医疗服务。消极的结果则可能意味着模型增加了额外审核,却没有改善决策或结果。
第三项信号是跨不同设备、地区和人口群体的外部验证。研究人员应测试,当家庭环境和患者群体发生变化时,Sleep Age Index 是否仍保持良好校准。
外部验证应纳入睡眠呼吸暂停、抑郁症、慢性疼痛、行动受限以及使用影响睡眠药物的人群。在老年人群中,这些并非边缘情况。
它还应报告由出行、同床、照护和传感器接触不稳定造成的失效情况。这些日常条件能够区分令人印象深刻的模型与可靠的服务。
强大的迁移能力将支持 Google News 关注背后的核心主张:纵向睡眠数据包含一种可复用的信号,能够帮助引导认知评估。
迁移能力较弱并不会使研究失去价值。它会表明,这种信号对本地数据和部署条件的依赖程度高于标题所暗示的水平。
其他发展同样值得关注,但应保持为辅助背景。SleepFM 和相关基础模型将测试,更丰富的生理通道是否能产生更好的风险估计。可穿戴设备将测试,消费级规模的数据能否接近临床实用性。
血液生物标志物提供了另一个重要参考点。它们更直接地测量疾病相关生物学,而被动睡眠系统则强调低负担观察。未来很可能是结合多种筛查信号,而非选出一个普遍适用的唯一赢家。
对于开发者而言,这一未来要求谨慎的界面设计。健康风险产品应展示不确定性、说明其证据时间窗口,并避免将变化中的评分视为已确认的状况。
对于企业采购方而言,采购应从临床路径开始。应询问由谁审查提醒、后续如何确认,以及如何审计性能。硬件便利性无法弥补应对流程的不明确。
知识工作者和 AI 用户应吸取更广泛的教训:模型可以在记录中发现人类无法持续审阅的模式。这些模式是否有用,仍取决于背景、验证和可问责的决策。
这项由 Imperial 牵头的研究值得关注,因为它在真实家庭中测试了被动监测。它提供了可量化的性能,并识别出与痴呆症相关的具体睡眠模式。
这也说明了为何谨慎措辞至关重要。该系统检测到了与风险相关的模式,但并未诊断痴呆症,也没有证明睡眠紊乱会导致认知衰退。
因此,下一则可信的 Google News 标题应报道前瞻性验证,而不是又一个回顾性评分。读者应关注冻结模型试验、外部队列,以及预警能改善医疗照护的证据。
在此之前,睡眠 AI 应作为临床评估的辅助,而非凌驾于其上。每当出现一项新结果时,不妨问一个实际问题:该模型只是预测了一个标签,还是帮助某人获得了更好的照护?


