top of page

NVIDIA MONAI 心脏护理将一项耗时 30 分钟的移植任务缩短至数秒,但复杂心脏仍是关键考验

59分钟前
讀畢需時 16 分鐘

NVIDIA MONAI 心脏护理将一项原本需要 30 分钟的影像任务,转变为 Cincinnati Children’s 所称其 AI 模型可在数秒内完成的计算。该系统通过 CT 扫描估算心脏总体积,为儿童心脏移植中的供受者匹配提供支持。然而,最大的误差恰恰出现在最需要关注的异常心脏病例中。

这种张力使其不只是又一次医院 AI 演示。Cincinnati Children’s 正尝试用一套其他移植中心也能采用的开源工作流程,替代缓慢且依赖专科人员的测量方式。该模型在回顾性数据集上的表现良好,但临床部署所要求的并不只是出色的平均表现。

该项目也对主要依据体重匹配供体心脏的传统做法提出了挑战。患有先天性心脏病的儿童,其心脏大小可能与体重所显示的情况存在显著差异。心脏总体积提供了更直接的测量方式,而 AI 的目标是在时间紧迫的器官供给决策中让这种测量变得可用。

Cincinnati Children’s 围绕一项时间紧迫的决策构建了 NVIDIA MONAI 心脏护理

最直接的变化很简单:移植团队无需手动勾画数百张 CT 图像,即可获得心脏体积估算结果。

儿童心脏移植团队必须迅速决定捐赠心脏是否适合等待移植的儿童。传统评估会结合供体和受者的体重、身高及临床判断。这些指标能够提供有用的近似值,但无法反映心脏实际的三维大小。

这一局限对先天性心脏病儿童尤为重要。手术、心腔扩张、单心室循环以及其他解剖学差异,都可能削弱体型与心脏体积之间的关联。按照基于体重的规则被拒绝的供体心脏,仍可能适合受者胸腔内的可用空间。

Cincinnati Children’s 的研究人员一直在研究将心脏总体积(TCV)作为替代测量指标。TCV 指由心脏外表面所包围的完整三维体积。临床医生可通过对 CT 扫描进行分割来获得该数值,即在一组医学图像中识别出心脏区域。

人工工作流程准确但耗时。Cincinnati Children’s 的医生兼数字健康负责人 Ryan Moore 表示,处理 300 多张图像大约需要 30 分钟。当器官供给在夜间到来、外科团队面临狭窄的决策窗口时,这种延迟尤其棘手。

医院的模型实现了该分割步骤的自动化。根据一份儿童移植报道,AI 可在数秒内完成计算。该工作流程采用 MONAI,即 Medical Open Network for AI,这是一个面向医疗影像构建的开源框架。

MONAI 提供医学图像转换工具、模型组件、标注工具和部署格式。NVIDIA 与 King’s College London 于 2019 年推出该项目,如今更广泛的临床和研究机构群体正参与贡献。该框架基于 PyTorch,但增加了围绕 DICOM 等格式设计的功能;医院使用这类格式交换医学图像。

Cincinnati Children’s 并非只是下载了一款现成的移植产品。其研究人员开发了定制的三维卷积神经网络(3D-CNN),并将此前已完成分割的扫描结果作为参考数据。该网络学习完整 CT 体积中的空间模式,而不是将每张图像视为孤立的画面进行处理。

这一差异十分重要。临床任务并非在典型扫描中检测一个通用意义上的心脏,而是要足够准确地勾画完整的外部边界以计算体积,其中还包括解剖结构不同于常见训练样本的患者。

因此,该项目将开放的开发基础与医院特定的研究结合起来。MONAI 减少了从零构建每一个影像组件的需求。Cincinnati Children’s 仍必须提供数据、临床定义、整合工作,以及证明所得测量结果足以安全支持医疗决策的证据。

NVIDIA AI 心脏移植的故事归根结底在于最后这一公里。开源代码能够缩短模型开发周期,但无法消除将算法与影像系统、移植流程和可追责的临床审查相连接所需的工作。

为什么心脏总体积对基于体重的匹配提出挑战

AI 在这里的重要性,在于它能让解剖学上更相关的测量在器官供给期间变得可行,而不是取代移植判断。

体重匹配仍然普遍使用,因为几乎每位供体和受者都具备体重数据。它让移植中心无需获取新影像或运行专业软件,就能快速完成比较。其简洁性也使跨机构沟通决策更为容易。

不过,体重只是心脏大小的替代指标。两名体重相近的儿童可能拥有不同的心脏体积,尤其是其中一人患有先天性心脏病时。反过来也可能发生:体型相对较小的儿童可能拥有增大的心脏,并有足够的胸腔容量容纳按体重看似偏大的供体器官。

Cincinnati Children’s 的早期研究说明了这种不匹配。一项回顾性研究比较了 13 名先天性心脏病患者与 94 名对照者。这 13 名患者中有 8 名的影像推导体积所对应的列入移植名单体重,超过其实际体重的 130%。

这 8 名患者中还有 6 名通过超声心动图或心脏磁共振成像记录到中度至重度心腔扩张。研究结果表明,对于部分心脏增大或经历手术改变的儿童,基于体重的筛查可能会排除潜在可用的供体。

该研究样本较小,且仅在一个中心开展。它并未证明每一颗体积匹配的器官都能带来成功移植。但它表明,直接的解剖学测量值得进一步研究。

后续的一种预测模型在供体影像不可用时,利用性别、身高和体重估算心脏总体积。其表现最强的模型在测试集中的 R-squared 值达到 0.98,平均绝对百分比误差为 8.6%。R-squared 用于描述模型估算值与观察到的变化之间的吻合程度。

这些方法面向不同的实际操作情境。合适影像存在时,直接 CT 分割能够测量体积。当供体 CT 扫描不可用或无法快速传输时,预测模型则可提供估算结果。

自动分割使影像路径更具现实可行性。专科人员不再需要在团队评估体积比之前花费 30 分钟勾画心脏。软件可生成初步测量值,临床医生再审阅影像,并判断结果在解剖学上是否合理。

这正是 NVIDIA MONAI 心脏护理给旧有工作流程带来压力的地方。仅仅因为模型能快速处理 CT 图像,基于体重的匹配并不会消失。移植项目将面临一个更棘手的问题:何时应将直接体积测量与既有标准结合起来?

答案取决于分割准确性之外的因素。中心需要及时获取供体扫描、可靠的影像传输、兼容的软件和训练有素的人员。它还需要制定政策,以处理体重、预测体积、实测体积与外科判断之间出现分歧的情况。

临床团队必须理解这一数值所包含的内容。心脏总体积测量的是心脏外部包络,而非单个心腔的内部容积。影像对比度、扫描质量、既往手术、植入材料和解剖结构变形,都可能影响可见边界。

移植决策还涉及血型、免疫相容性、器官功能、距离、缺血时间以及受者状况。更好的尺寸估算可以改善决策中的一个环节,却无法解决其余所有问题。

因此,最可信的解读应比“AI 找到了正确供体”这一说法更为克制。NVIDIA AI 心脏移植软件能够加快一项测量,而这项测量可能扩大对供体器官供给的考量范围。移植团队仍负责决定器官是否可接受。

NVIDIA MONAI 如何在影像流程中发挥作用

MONAI 提供可复用的医疗影像基础设施,而医院则负责临床目标、经整理的扫描数据和部署规范。

已发表的模型采用了出生至 30 岁患者的 CT 扫描。研究人员手动分割这些扫描,以创建真值掩膜,并将其作为训练和评估中的参考边界。

团队共识别出 314 名受试者,其中 270 名用于训练,44 名留作验证。验证组包括 36 名心脏解剖结构正常的受试者,以及 8 名已列入移植名单的心脏病患者。

其定制网络结合了 DenseNet 架构与 ResNet 相关的残差元素。DenseNet 连接各层,使后续阶段能够保留早期阶段的信息。残差连接帮助深层网络在不丢失原始信号的情况下学习变化。

模型接收一个三维 CT 体积,并生成围绕心脏的分割掩膜。研究人员根据该掩膜计算 TCV,并与人工生成的参考结果进行比较。这就是 NVIDIA MONAI 在该项目中的运作方式:它支持影像流程,而经医院训练的模型执行具体的分割任务。

这项同行评审研究报告称,模型在验证组中的平均 Dice 相似系数为 0.94。Dice 用于衡量预测区域与参考区域的重叠程度,1 表示完全重叠。

估算心脏体积的平均绝对百分比误差为 5.5%。平均绝对差异为 29 毫升,且预测体积与人工测量值高度相关。研究人员未发现 Dice 表现与年龄、体重、身高、性别或心脏总体积之间存在显著关联。

这些结果支持该模型在不同年龄范围内复现人工测量的能力。它们并未显示该系统提高了移植存活率。该研究测量的是分割性能,而非患者结局或器官接受决策的变化。

当医疗 AI 从研究论文进入科技报道时,这一区别往往容易被忽视。技术验证关注的是模型能否复现既定测量;临床验证关注的是在不引入新伤害的前提下,使用该测量能否改善决策和结局。

MONAI 通过几个相互关联的组件,帮助衔接开发与临床基础设施。MONAI Core 支持模型训练和医疗健康特定的数据处理。MONAI Label 协助标注,而 MONAI Deploy 则将推理应用打包,以便与临床系统集成。

MONAI Application Package 可以将模型与接收影像检查并返回结果所需的逻辑打包在一起。它能够连接基于 DICOM 的系统,并帮助机构复现既定应用。这种打包方式解决了医疗 AI 中一个常见的失效环节:前景看好的研究代码始终未能成为可靠的医院服务。

开源也让整条流程具备可审查性。医院工程师可以检查各个组件、调整接口并记录变更。不同中心的研究人员无需协商获取某个专有应用的访问权限,也能测试相似的工作流程。

但开源并不意味着部署可以自动完成。Moore 曾将集成工作描述为一个困难的过程,必须有人解决这些问题,系统才有可能接近即插即用。每家医院都有自己的网络边界、影像存档系统、访问政策和安全审查流程。

团队需要对模型和依赖项进行版本控制。他们需要监控失败的检查、格式错误的扫描以及意料之外的解剖学病例。他们还需要一个用于保存验证报告、操作规程、软件版本和事件复盘的可搜索知识库

模型输出必须送达临床医生原本就工作的地方。如果工作人员必须手动导出 CT 扫描、重命名文件、运行独立应用程序,再将结果传回患者记录,那么即使推理只需几秒钟,实际价值也会相当有限。

因此,NVIDIA MONAI 如何运作只构成了整个机制的一半。另一半是编排:选择正确的扫描、以安全方式路由、保持一致处理、返回可复核的结果,并记录影响决策的因素。

最复杂的心脏带来了最大的误差

该模型的核心弱点具有临床意义:对于结构正常的心脏,它的表现优于移植候选者中常见的异常解剖结构。

在 44 例验证病例中,报告的 5.5% 平均绝对百分比误差看起来令人鼓舞。但将队列拆分为不同亚组后,结果呈现出更复杂的一面。

36 名解剖结构正常的受试者平均绝对百分比误差为 4.5%。8 名移植前患者的误差为 10.5%。这一差异未达到传统统计学显著性标准,报告的 p 值为 0.08,但其方向值得关注。

研究人员还考察了先天性心脏病和心肌病亚组。先天性心脏病的平均绝对百分比误差达到 12.6%,而心肌病为 9.3%,解剖结构正常者为 4.5%。

模型倾向于低估异常心脏的总体心脏容积。在移植前组中,预测值平均比手工测量容积低约 10%。如果团队利用这一结果判断供体心脏是否合适,这种偏差可能造成影响。

可能的原因可以从训练数据中看出。大多数训练样本来自解剖结构正常的受试者。网络学习的是其数据集所呈现的模式,因此,非典型心腔几何结构、重建血管、既往手术和心脏增大都会带来分布偏移。

当真实世界病例不同于用于开发模型的数据时,就会出现分布偏移。在医学影像领域,这是一项反复出现的担忧,因为不同医院的扫描仪、检查方案、患者群体和疾病模式各不相同。

在临床风险最高的场景中,验证队列的样本量也很小。保留集内仅有 8 名受试者被列入移植名单。该组包括心肌病、衰竭性 Fontan 生理状态、既往接受过移植者、肥厚型心肌病以及经手术治疗的转位患者。

这种多样性很有价值,但 8 个病例无法界定模型在完整范围的小儿移植解剖结构中的表现。平均值也可能掩盖个体失败案例。一个被严重低估的心脏,在临床上的重要性可能超过数个准确的常规病例。

小儿 CMR 文献进一步印证了这一担忧。综述指出,主要基于成人或典型解剖结构训练的算法,可能难以应对先天性疾病。小儿患者在心率、体型、配合程度、运动伪影和解剖复杂性方面均有差异。

辛辛那提儿童医院的研究本身提出了谨慎的操作应对方式。自动化测量最直接的用途,可能是对解剖结构正常的供体心脏进行分割。复杂受体心脏仍可继续接受人工分割和专科医生复核。

这种混合工作流程在实践中颇为合理。它将自动化用于比较中更可预测的一半,同时为异常解剖结构保留人工关注。它也避免将一个模型视为在所有病例中都同样可靠。

不过,混合运行需要明确的升级规则。移植中心必须界定何时软件结果可以进入决策流程,何时必须由专科医生重新进行分割,以及测量结果不一致时应如何处理。

团队应在推理前监控图像质量。他们应展示分割掩膜,而不只是最终容积,以便复核人员能够判断边界是否遗漏或纳入了错误结构。一个看似合理的数值可能掩盖不合理的掩膜。

外部验证同样重要。该研究使用了与单一机构相关的回顾性数据。当另一家中心提供不同的扫描仪、对比剂方案、重建设置或患者人口特征时,模型表现可能发生变化。

前瞻性测试将提供另一层证据。研究人员可以测量周转时间、模型失败频率、临床医生修正情况、供体接受率,以及结果进入真实工作流程后的结局。静默评估——即软件运行但不影响诊疗——可以在部署前发现问题。

监管状态也很重要。研究模型、经内部验证的临床支持应用,以及获准上市的医疗器械,并不是可以互换的类别。该项目的公开描述并不能证明该算法可以独立指导移植匹配。

目前最有力的结论仍然是技术性的。该模型能够以颇具前景的回顾性准确度自动测量 TCV,尤其适用于解剖结构正常的心脏。它尚未证明能够实现自主决策,或在多个移植中心改善生存率。

这并非无关紧要的限定。它界定了开源模型与可靠的 NVIDIA MONAI 心脏诊疗之间仍待完成的工作。

开源降低了一道门槛,却暴露出其他多道门槛

MONAI 可以减少重复工程工作,但每家医院仍需自行承担验证、治理、集成和临床问责。

医疗 AI 项目常常在论文发表与常规应用之间失败。研究团队训练模型、报告令人鼓舞的指标并共享代码。随后,医院发现生产环境还需要身份验证、图像路由、算力、监控、网络安全审查,以及研究时间之外的支持。

MONAI 通过标准化常见组件,弥合了其中一部分部署缺口。其官方项目介绍了用于训练、标注和临床推理的独立工具。该框架目前报告称拥有数百万次安装和数千篇研究引用,显示出开发者的广泛兴趣。

采用数量并不能证明临床有效性。但这表明,医院可以依托更广泛的技术社区,而非维护彼此孤立的影像技术栈。共享打包方式也可以让多中心测试更具可复现性。

MONAI 部署框架正是围绕这一问题设计的。应用包将模型与推理逻辑结合,使医院能够将其集成进现有影像环境。

辛辛那提儿童医院为这种方法提供了一个高要求的测试场景。移植匹配对时间敏感,涉及罕见病例,并且其后果难以轻易纠正。该工作流程需要可预测的正常运行时间和透明的故障处理机制。

考虑采用同一模型的中心,在部署前必须回答几个问题。其影像存档系统能否自动路由适当的 CT 检查?扫描是否包含完整心脏?系统能否识别不受支持的输入?如果结果在夜间送达,谁来复核掩膜?

医院还必须确定,供体数据能否在机构之间合法且安全地传输。一份器官供体邀约可能涉及供体医院、器官获取组织以及远方的移植中心。每个参与方都可能使用不同的影像和病历系统。

联邦学习提供了一种可能的方法,可在不集中汇集原始扫描数据的前提下扩展模型。在这种方法下,参与医院训练本地副本,并交换模型更新而不是患者影像。辛辛那提儿童医院曾讨论在研究扩展时使用 NVIDIA 联邦网络。

联邦学习降低了一些数据传输方面的担忧,但并不能消除隐私或治理义务。更新仍可能带来安全风险,参与中心也需要兼容的定义、质量控制和审批流程。

本地数据也可能失衡。拥有大量正常扫描的大型中心可能主导训练,而罕见的先天性解剖结构仍然代表不足。研究人员需要采取方法来加权不同中心的贡献,并独立评估每个亚组。

开源许可还带来另一层区别。可访问的代码允许检查和修改,但经过修改的模型会成为新的临床产物。医院必须记录其训练数据、代码版本、依赖项、验证结果和部署日期。

软件更新可能改变行为。新的 MONAI 版本可能改善性能,也可能改变预处理过程。机构需要变更控制程序,防止一次库更新悄然修改已经验证的流程。

商业影像公司正面临来自这一模式的压力,尽管开源并未消除它们的作用。专有供应商可以提供监管支持、服务协议、集成服务以及维护责任。医院自建系统提供控制力和适应性,但会将更多运营工作置于机构自身。

因此,主要竞争并非 NVIDIA 与某一家医学影像供应商之间的竞争,而是可复用的开放基础设施与孤立、劳动密集型实施方案之间的竞争。胜负将由临床可靠性决定,而非仅由代码可用性决定。

其他儿童医院已经在探索相关方法。波士顿儿童医院运营着一个先天性心脏 AI 实验室,聚焦影像、心电图和健康记录数据。辛辛那提儿童医院此前的 MONAI 项目也探索了通过标准化应用包部署心脏 CT 分割。

这些项目表明,人们对小儿专用 AI 的兴趣正在增长。它们也揭示了为何成人模型无法简单移植到儿童诊疗中。更小的结构、更高的心率、先天性解剖结构以及有限的数据集,都要求进行有针对性的开发。

开源路径可以让这项工作更容易共享。但它无法保证另一家医院能够复现相同表现,尤其是在其患者群体和影像方案不同的情况下。

三个信号将显示该模型是否改变移植诊疗

下一阶段必须将技术准确性与多中心可靠性、临床决策变化和可衡量的患者结局联系起来。

首个信号,是在解剖结构复杂的更多移植候选者中获得外部验证。现有模型需要在采用不同设备和扫描协议的医院 CT 扫描中接受测试。结果应区分正常供体、心肌病、先天性心脏病、既往手术病例以及低质量扫描。

一项更有力的研究不应只报告单一的平均重叠评分。它还应包括体积偏差、临床重要离群值、分割失败情况,以及按解剖学亚组划分的表现。独立审查将增强人们对于结果并非仅适用于某一家机构数据的信心。

如果准确性在不同中心和复杂病例中保持稳定,扩大部署的理由就会更充分。如果在 Cincinnati Children’s 之外错误率上升,该模型或许仍可帮助评估正常供体心脏,但在其他地区可能需要本地化再训练。

第二个信号,是证明 AI 能够改变实际的移植决策。研究人员应记录自动化 TCV 测量是否扩大了供体范围、缩短了评估供体邀约所需时间,或避免了潜在适合的器官被拒绝。

此前一项供体池研究发现,基于影像得出的体积数据会为 13 名先天性心脏病患者中的 8 人赋予更高的有效等待名单权重。这一结果说明了其中的机会,但并未证明究竟有多少额外器官能够带来安全的移植。

前瞻性部署应追踪临床医生接受、拒绝或推翻 AI 辅助测量结果的频率,还应记录自动生成的边界是否需要修正。这些运营数据将显示,数秒钟的推理究竟带来了更快的决策,还是仅仅把工作转移到了审核环节。

第三个信号,是患者层面的证据。等待名单生存率、供体器官利用率、手术匹配度、术后并发症、移植物存活率以及更长期的结果,都比单纯的分割指标更重要。

Cincinnati Children’s 的临床医生认为,基于 TCV 的匹配能够扩大可接受供体的范围,并改善生存率。这仍是一项需要更广泛证据支持的临床假设。该分割模型测量的是解剖结构;它并不能直接预测决定移植成功的每一个因素。

任何结局研究都会面临挑战,因为儿童心脏移植较为罕见,且患者解剖结构差异很大。要形成有意义的队列,多中心协作将不可或缺。统一的定义同样重要。

这三个信号为 NVIDIA AI 心脏移植技术提供了清晰的检验标准。第一,模型能否跨医院推广?第二,它能否改善决策?第三,这些决策能否在不增加可避免风险的前提下改善结局?

对开发者而言,该项目展示了领域专用开放基础设施的价值。可复用组件能够缩短影像实验与医院服务之间的距离。不过,部署工程和持续验证仍是医疗产品的一部分。

对医院采购方而言,关键问题不在于 MONAI 是否可免费下载,而在于机构能否支撑完整的临床生命周期,包括数据访问、验证、监控、事件响应和专科监督。

对临床医生而言,该模型提供了一种更快获取某项潜在有用测量值的方式。它应被视为决策支持工具,其适用边界必须保持清晰,尤其是在面对罕见解剖结构时。

在研究条件下,NVIDIA MONAI 心脏护理已将一项技术要求很高的流程从数分钟缩短至数秒。它的未来取决于团队能否在不同机构中保持这种速度,同时不把错误隐藏在看似可靠的体积数值之中。

下一次移植中心在夜间接到供体来电时,有价值的结果不应只是算法快速运行,而应是团队能够足够早地获得可靠、可审查的测量结果,从而考虑一颗原本可能因间接规则而被排除的器官。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page