top of page

耶鲁结构性心脏病 AI 为便携式 ECG 找到新的筛查角色

9月26日
讀畢需時 13 分鐘

耶鲁研究人员在 597 名患者中测试了一种结构性心脏病 AI 模型,结果令人鼓舞,但也存在重要局限。通过便携式单导联心电图进行 30 秒记录,可帮助识别严重疾病,灵敏度达到 86.7%。然而,大多数阳性结果并不代表患者确诊患有严重结构性心脏病。

这种矛盾正是该技术实际价值的核心。它并非可装进口袋、替代超声心动图的工具;超声心动图通过超声检查心脏的结构与功能。它更可能成为一个分诊层,用于判断哪些人应接受这种资源投入更高的检查。

这些发现来自 ACCESS-SHD 研究,这是一项在 Yale New Haven Hospital 开展的前瞻性评估。研究预印本于 2026 年 9 月发布,尚未完成同行评审。因此,其最有力的主张比自动诊断更为有限:便携式 AI 分析或许能让针对性的心脏影像检查更加高效。

随着医疗 AI 从回顾性数据库走入真实临床工作流程,这一区别尤为重要。一个模型在统计学上表现出色,却仍可能产生大量需要专家复核的警报。对于医院、临床医生和设备开发商而言,下一个问题并非算法能否检测到信号,而是基于该信号采取行动能否改善医疗服务,同时不会造成难以承受的检测负担。

耶鲁结构性心脏病 AI 实际检测了什么

该模型将常规便携式 ECG 转化为针对严重结构异常的筛查信号,而非最终诊断。

结构性心脏病是指涉及心肌、心腔或心脏瓣膜的异常。这些病症不同于心律失常,尽管两者都可能在心脏电活动中留下模式。

耶鲁研究聚焦于严重结构性心脏病这一复合类别,其中包括左心室收缩功能障碍、严重左心瓣膜病和严重左心室肥厚。这些病症会影响心脏泵血效率,或影响血液在心脏内的流动。

研究人员纳入了 2024 年 6 月至 2025 年 1 月期间在 Yale New Haven Hospital 接受门诊经胸超声心动图检查的成年人。超声心动图此前已作为每位参与者常规医疗的一部分开具。

就诊期间,每位参与者均使用 AliveCor KardiaMobile 6L 设备记录了一份 30 秒的单导联 ECG。尽管该产品可采集多个导联,研究仅评估了一个导联的信息。所得波形由经过噪声适配的深度学习模型实时处理。

随后,研究人员将 AI 输出与超声心动图结果进行比较。这一设计为团队判断是否存在严重结构性心脏病提供了公认的影像学参考。

在 597 名参与者中,30 人患有严重结构性心脏病,占研究人群的 5.1%。参与者的中位年龄为 61.7 岁,其中 51.4% 为女性。

该 AI 模型的受试者工作特征曲线下面积,即 AUROC,达到 0.872。AUROC 衡量模型在不同分类阈值下区分患病者与未患病者的能力。数值为 1 代表完美区分,而 0.5 则接近随机分类。

在研究选定的阈值下,灵敏度为 86.7%,特异性为 72.5%。灵敏度描述系统识别出患有严重疾病参与者的频率。特异性描述系统正确判定未患病参与者的频率。

这些数据使该模型更适合用于分诊,而非确诊。筛查系统应尽可能少漏掉严重病例,但也需要为被错误标记的人提供后续处理路径。

模型 99% 的阴性预测值尤其值得关注。在这一研究人群中,阴性结果与不存在严重结构性心脏病高度相关。但这并不意味着该工具可在所有人群中安全地排除疾病,因为预测值会随患病率变化。

其阳性预测值仅为 14.4%。从实际角度看,获得 AI 阳性结果的大多数参与者,并未满足研究定义的严重结构性心脏病标准。因此,阳性输出仍是进一步检查的理由,而不是诊断结果。

为什么便携式 ECG 心脏筛查此刻值得关注

这一机会来自于:在比心脏影像设备更便宜、更易部署的设备上增加新的分析能力。

标准 ECG 测量由心脏产生的电信号。临床医生通常利用它识别心律问题、传导异常,以及与其他心血管疾病相关的征象。

超声心动图回答的是不同的问题。它利用超声显示心腔、瓣膜、心壁厚度及泵血功能,通常需要更多设备、经过培训的检查操作人员和专家解读。

在症状变得明显之前,结构性疾病可能一直未被察觉。一些患者直到病情进展或引发并发症后才获得医疗服务。广泛开展超声心动图筛查并不容易,因为为每一位可能存在风险的人进行影像检查将占用大量临床能力。

便携式 ECG 心脏筛查提供了另一条路径。短时记录可在诊所、社区站点或影像资源有限的其他环境中采集,随后由算法估计患者是否应接受确诊性检查。

这种方法依赖于一个微妙的生物学前提:即使人体表面记录到的电活动模式对人类阅图者并不明显,结构异常仍可能改变这些模式。深度学习可以寻找与疾病标签相关的波形特征组合。

ACCESS-SHD 模型针对便携式信号中常见的噪声进行了适配。这是重要的技术选择,因为可穿戴和手持式记录与严格采集的临床 ECG 不同。运动、接触不稳定以及设备间差异都可能影响波形。

研究还将 AI 分析与便携设备自身的解读结果进行了比较。该内置读数主要针对心律信息,并非为筛查研究所定义的心肌与瓣膜疾病复合终点而设计。

与该原生解读相比,AI 系统将灵敏度提高了 34.6 个百分点。在设备标记为正常的波形中,模型仍保持 76.9% 的灵敏度和 80% 的特异性。

这一比较体现了拟议中的变化。硬件已经能够记录电信号,但 AI 为这一信号赋予了额外的临床用途。工作流程不再只问心律是否异常,也会询问波形是否包含与结构性疾病相关的证据。

耶鲁的 ID-SHD study正是围绕这一更广泛的理念设计。该研究评估通过便携设备和智能手表获取 ECG 的 AI 分析能力,并以超声心动图作为参考检测。

这一路径不同于取代专科医生。便携设备采集低负担信号,模型对风险进行排序,临床医生再决定是否需要影像检查。其价值在于引导有限的诊断资源,而非消除这些资源的必要性。

AI ECG 筛查与全民影像检查的竞争

核心较量在于:针对性分诊,还是为每一位可能携带未被发现心脏异常的人进行影像检查。

超声心动图在这一工作流程中仍是决定性工具,因为它能够显示 ECG 模型只能推断的结构。AI 模型无法直接看到受损的瓣膜、增厚的心室壁,或心肌运动减弱。

这带来了一项权衡。为更多人进行影像检查可以发现更多疾病,但也需要设备、预约安排、专业人员和解读时间。减少筛查人数能够降低这一负担,但也可能遗漏那些疾病所产生电信号较弱或不典型的患者。

耶鲁结构性心脏病 AI 试图改进筛选环节。研究人员计算发现,在研究人群中,常规医疗需要检测 19.7 人才能发现 1 例病例。AI 引导策略将发现一例病例所需检测人数降至 6.9 人。

根据预印本,这意味着减少了 64.8%。这一计算表明转诊人群可以更集中,但并未证明患者结局得到改善。它是根据观察到的阳性预测值,对筛查效率作出的模型估算。

效率证据与结局证据之间的差别至关重要。医院或许能减少每发现一例病例所需的超声心动图数量,却仍可能在其他环节面临新成本。工作人员必须解释警报、安排后续检查、处理不确定结果,并追踪未完成影像检查的患者。

假阳性同样会带来后果。它们可能引发焦虑,并产生额外会诊。根据转诊路径的不同,它们可能只是转移工作,而非减少工作。

假阴性则构成更严重的临床风险。报告中的灵敏度意味着,模型并未标记每一位患有严重疾病的参与者。当症状或体格检查结果仍令人担忧时,任何筛查项目都不能将算法阴性输出视为临床判断的替代品。

研究人群还带来另一项限制。参与者原本就已安排接受门诊超声心动图检查,因此并非普通公众的随机样本。他们的基础风险和临床特征,很可能与药店、工作场所或大范围社区筛查中遇到的人群不同。

这一点很重要,因为阳性和阴性预测值都取决于疾病患病率。在风险较低的人群中,同一模型在所有阳性警报中产生的真阳性比例可能更低。

研究人员报告称,该模型在所考察的各亚组中表现相近。不过,严重病例总数仅为 30 例,限制了对更狭窄人口统计学或临床群体表现的精确估计。灵敏度的置信区间范围为 70.3% 至 94.7%。

因此,该模型既不会让心脏病专家退出流程,也不会让超声心动图实验室退出流程。相反,它促使卫生系统重新思考:谁能进入这些服务,以及如何确定转诊优先级。

成功部署将使原本可能一直未被诊断的患者更容易获得确诊服务。失败的部署则会产生一长串算法警报,却缺乏足够的影像能力、临床背景或后续执行。

模型最亮眼的数字也最容易被误读

99% 的阴性预测值听起来具有决定性,但它反映的是本研究的人群,无法证明其在所有场景中的安全性。

阴性预测值回答的是一个具体问题:在获得阴性结果的人群中,有多大比例没有目标疾病?当该疾病在受检群体中变得更常见或更少见时,这一数值也会变化。

由于仅有 30 名参与者患有严重结构性心脏病,队列中的大多数人并未患病。较低的患病率有助于形成较高的阴性预测值。这个数字仍然有用,但不能原封不动地套用到每一家诊所。

阳性预测值揭示了同一方程的另一面。14.4% 的结果意味着,按照研究定义,不到六分之一的阳性警报对应严重疾病。

这并不意味着该模型无效。筛查测试通常优先考虑敏感性,并接受一定的假阳性,因为确证性检查能够最终确定结果。不过,下游体系必须围绕这一现实进行设计。

结果还取决于阈值的选择方式。降低分类阈值通常能捕获更多病例,但也会标记更多并未患病的人。提高阈值则会减少误报,但可能遗漏更多病例。

医疗系统可能会根据其服务人群、可用影像检查能力以及对漏诊的容忍度选择不同阈值。适合心脏病专科门诊的阈值,未必适用于基层医疗或社区筛查。

模型的复合结局也引入了另一层判断。将多种结构性疾病归为一类,形成的目标比针对每种疾病分别建立检测器更宽泛。这可以提高筛查效率,因为每个阳性结果都会导向相同的下一步,通常是超声心动图检查。

但复合结局也掩盖了差异。左心室收缩功能障碍、重度瓣膜病和重度心肌肥厚的病因、治疗方式和紧迫程度各不相同。单一风险评分无法告诉临床医生患者究竟患有哪一种疾病。

这种模糊性进一步凸显了影像检查的作用。AI ECG 的结构性心脏病信号可以帮助确定患者的优先级,但超声心动图才能明确解剖结构,并指导下一项临床决策。

预印本状态也为审慎解读增加了理由。该手稿已公开发布,研究人员可以审阅其方法和结果,但尚未完成期刊同行评审。后续修订可能澄清分析方法、改变报告细节,或收窄作者的结论。

独立重复验证比同一机构给出另一项性能估计更重要。Yale 研究人员开发了这一方法,并在 Yale New Haven Hospital 对其进行了评估。外部测试必须确定其在不同医疗系统、设备、采集实践和患者群体中的迁移表现。

这项研究的前瞻性设计优于纯粹的回顾性数据库分析。研究人员在患者实际就诊期间记录便携式 ECG,并进行实时推理。然而,前瞻性数据收集并不等同于针对 AI 指导医疗路径的随机临床试验。

该模型并不决定治疗方案。研究也没有表明筛查能减少住院、心力衰竭、卒中或死亡。它评估的是相对于超声心动图发现的检出能力。

这些边界应当塑造任何解读。该研究支持一项筛查假设,并提供了前瞻性验证。但它尚未确立标准治疗方案。

Apple Watch 结果增强了技术机制,而非临床主张

Yale 的一项相关研究表明,该信号可跨消费级设备保留,但两项研究都尚未进入真实世界结局测试。

同一研究项目使用单导联 Apple Watch 记录评估了一种经噪声适配的模型。WATCH-SHD study 纳入了 596 名参与者,其记录可在 Yale New Haven Hospital 超声心动图实验室进行分析。

该研究报告称,30 名参与者患有严重结构性疾病,仍占队列的 5.1%。模型的 AUROC 达到 0.841,敏感性为 76.7%,特异性为 83.2%。

其阳性预测值为 19.7%,阴性预测值为 98.5%。Apple Watch 分析还估计,AI 指导的筛选可使每例确诊病例所需的确证性检查数量减少超过 60%。

综合来看,这些研究表明,基础信号并不局限于某一种便携式设备。两项研究均使用 30 秒单导联记录,并将 AI 预测与具有临床指征的超声心动图进行比较。

这种跨设备证据支持了其技术机制。结构性疾病似乎会留下电学特征,经过噪声适配的模型可以在可穿戴设备质量的数据中检测到这些特征。

但这尚不能证明消费者应自行进行筛查。参与者是在接受超声心动图检查时,于受控的研究流程中记录 ECG。数据传输、模型推理和参考检查均在临床环境内完成。

无监督记录会引入额外变量。用户可能错误佩戴设备、在活动中记录,或在症状暂时变化时采集数据。设备在硬件、滤波器、采样和信号处理方面也各不相同。

筛查项目需要针对技术质量不足的波形制定规则。当模型向无症状或没有固定临床医生的人提示风险时,也需要明确的应对机制。

监管构成另一道边界。分析 ECG 数据以检测疾病的算法可以作为医疗器械软件发挥作用。临床部署需要的证据和控制措施,超出了将研究模型公开发布的范畴。

Yale 团队此前已将心脏 AI 扩展至更全面的影像解读。其 PanEcho 系统可分析多个超声视图,并执行 39 项解读任务。经同行评审的 PanEcho study 报告了其在完整和有限超声心动图检查中的内部及外部验证。

PanEcho 和 ACCESS-SHD 位于同一流程的不同环节。便携式 ECG 模型识别哪些人可能需要影像检查。获得图像后,超声心动图模型可进一步协助进行测量和解读。

这一组合暗示了一种更自动化的心血管工作流程,但每个阶段都会引入各自的误差。连接多个模型不会让不确定性消失。上游假阴性可能阻止影像检查,而下游解读错误则可能扭曲确证结果。

因此,人类监督仍是系统要求,而非暂时性的让步。临床医生必须将模型输出与症状、病史、体格检查结果及其他检查结合起来。

便携式 AI 筛查规模化之前必须发生什么

三项信号将决定 Yale 的结果能否成为临床筛查路径,还是仍只是一项前景可期的研究基准。

第一项信号是独立、多中心验证。原始开发环境之外的研究人员需要在不同便携式 ECG 设备及更多样化的人群中测试该模型。

一项有说服力的外部研究应保留前瞻性工作流程。它应报告技术失败情况、亚组表现、校准度、敏感性、特异性和预测值,还应记录阳性患者完成超声心动图检查的频率。

如果重复研究显示出相近的区分能力,将强化该模型捕捉到可泛化生理信号的主张。如果性能显著下降,则意味着它对本地数据、设备或临床筛选的依赖性更强。

第二项信号是对临床效用的试验。此类研究必须将 AI 指导路径与现有转诊实践进行比较,并衡量引入算法后发生了哪些变化。

单靠检出并不足够。研究人员应考察从发现到超声心动图检查的时间、确诊情况、专科转诊、治疗变化、患者焦虑、漏诊病例以及总体临床工作量。

随机或经过严谨控制的实施研究,将揭示该模型能否在不压垮影像服务的情况下改善可及性。它还将表明,更早发现是否发生得足够早,从而改变医疗照护。

第三项信号是明确的监管和运营路径。可部署的产品需要清晰的标签说明、质量控制、监测机制以及后续随访责任。

医疗系统必须决定筛查应放在哪里进行。基层医疗诊所、药房、社区活动和心脏病专科诊所服务的人群不同,获得确证检查的条件也不同。

它们还必须决定由谁接收警报。直接发送给消费者与转交给临床医生,会带来不同的风险。阳性结果需要采用能够说明不确定性、同时不淡化潜在疾病风险的表述。

部署后将需要持续监测性能。患者群体会变化,设备软件会变化,记录实践也各不相同。即使原始验证可靠,模型仍可能发生漂移。

Yale 的结构性心脏病 AI 研究推动该领域超越了回顾性主张。研究人员前瞻性地收集了便携式 ECG,进行了实时分析,并将结果与超声心动图进行了比较。

它的局限同样具有启发性。仅有 30 名参与者患有目标疾病,阳性预测值仍然较低,研究也未检验是否改善健康结局。该手稿仍是一份预印本。

对临床医生而言,恰当的解读应是审慎关注。该模型或许有助于决定哪些人应接受影像检查,尤其是在超声心动图资源受限的地方。它不应凌驾于症状、体格检查发现或既有的心脏检查指征之上。

对医疗系统而言,关键问题在于运营:便携式 AI ECG 项目能否发现被忽视的疾病,同时保持后续随访可管理且公平?

对设备开发者而言,这项研究设定了更高的证据门槛。回顾性准确性已不再是唯一基准。真实记录、前瞻性患者、设备差异和完成转诊路径如今同样重要。

只有当这三项信号一致时,便携式 ECG 筛查才能赢得临床角色:独立重复验证、已证实的患者获益,以及安全的后续随访系统。在此之前,最好将 Yale 的模型理解为超声心动图检查的一个有前景的“守门人”,而不是患者口袋中的诊断工具。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page