筑波大学新生儿气胸 AI 准确率亮眼,但临床检验仍在前方
筑波大学研究人员报告称,一套新生儿气胸 AI 模型的准确率达到 94.5%,但其阳性警报中约三分之一属于误报。该系统通过分析床旁胸部 X 光片,检测新生儿肺部周围可能危及生命的积气——气胸。
这项于 9 月 12 日发表在 Pediatric Radiology 的研究,聚焦于一个范围狭窄却颇具难度的医学影像问题。新生儿通常在平卧状态下接受拍摄,这会改变逸出空气的显影位置,并可能掩盖常见的影像学征象。
这一结果的意义不止于在医学 AI 基准测试中取得又一个高分。基于成人数据训练的系统往往难以适用于儿童,而新生儿数据集仍相对稀缺。因此,真正的较量是针对年龄开发的 AI,与围绕成人解剖结构建立的工具和假设之间的竞争。
筑波大学新生儿气胸 AI 检测到了什么
该模型在内部测试中表现强劲,但其最有价值的指标或许是 98.5% 的阴性预测值。
这项同行评议研究评估了由筑波大学和东京科学大学研究人员开发的深度学习系统。其任务仅限于从新生儿重症监护患者的平卧位胸部 X 光片中检测气胸。
气胸发生于空气进入肺部与胸壁之间的空间时。这些空气会压迫肺部并干扰呼吸。严重病例还可能导致循环不稳定,需要紧急治疗。
研究人员收集了来自 288 名新生儿的 648 张气胸 X 光片,并配对使用了来自 3,377 名无气胸新生儿的 5,511 张对照 X 光片。
这些图像来自一家三级大学医院,涵盖 2011 年 1 月至 2024 年 12 月期间的住院病例。回顾性收集为团队提供了多年的临床材料,但也使数据局限于单一机构。
团队按患者而非单张图像划分训练、验证和测试组。这样的选择降低了同一名新生儿的不同 X 光片同时出现在评估两侧的风险。
在留出的测试集中,该模型的受试者工作特征曲线下面积为 0.975。AUC 衡量分类器在不同决策阈值下区分阳性和阴性病例的能力。
在研究人员设定的固定阈值下,灵敏度达到 87.6%,特异度达到 95.3%。准确率为 94.5%,其中包括 113 例真阳性和 1,050 例真阴性。
系统还产生了 52 例假阳性和 16 例假阴性。这些数字很重要,因为单一的准确率百分比可能掩盖临床意义截然不同的错误。
假阴性可能延误对患有气胸新生儿的关注。假阳性则可能引发紧急复核、额外检查,以及对实际并不存在疾病的焦虑。
阳性预测值为 68.5%。因此,在该测试集中,大约每三项阳性预测中就有一项是错误的。
相比之下,阴性预测值为 98.5%。这一结果表明,该系统更合理的早期角色是帮助临床医生分诊或筛查图像,而非独立确认诊断。
作者自己也作出了这一区分。他们将该模型描述为有前景的诊断支持工具,并呼吁在临床实施前进行外部验证。
这种表述比“前所未有的准确率”这一说法更为审慎。该模型表现良好,但并未在所有新生儿影像系统中创下新的普遍纪录。
此前研究已报告成人气胸检测取得较强表现。这里的重要性在于让模型适应新生儿解剖结构和常规平卧位成像,而非击败此前的每一项基准。
这一结果改变了新生儿影像 AI 的起点。研究人员如今有证据表明,专门化模型可在经过严格控制的内部测试中达到接近临床实用的区分能力。
为什么新生儿胸部 X 光片需要专门模型
新生儿不是缩小版成人,平卧位新生儿 X 光片也不是缩小版成人影像。
平卧位成像会改变逸出空气在影像中的分布。空气不会上升至胸部顶部,而可能聚集在肺部前方或内侧。
这些模式可能与心脏、纵隔或其他结构重叠。新生儿胸腔较小、呼吸储备有限,加上吸气程度存在差异,使判读更加困难。
潜在肺部疾病还会增加一层难度。呼吸窘迫综合征、短暂性呼吸急促、吸入性病变及其他异常,都可能改变床旁 X 光片中可见的影像模式。
论文引用的一项早期荟萃分析估计,临床医生判读新生儿胸部 X 光片的灵敏度为 82%、特异度为 96%。这一比较将新模型置于具有临床相关性的范围内。
但这并不能证明该模型优于新生儿科医生或儿科放射科医师。研究人员并未开展直接阅片研究,在同一组测试图像上比较系统与临床医生。
这种差异很重要。不同研究之间的比较会受到患者筛选、疾病患病率、图像质量、标注和统计方法变化的影响。
面向成人的医学 AI 还提供了另一项警示。一个系统可能在其训练数据所代表的人群中表现出色,但应用于更年轻患者时性能下降。
筑波大学论文指出,一项对获批成人软件的评估发现,其在儿科病例中存在显著的年龄相关差异。在那项研究中,两岁及以下儿童占错误预测的 81.5%。
针对年龄的开发旨在弥合这一泛化鸿沟。模型从新生儿样本中学习新生儿的身体比例、体位、疾病模式和图像条件。
一套名为 NeoCLIP 的 2025 年系统采取了更广泛的路线。它旨在判读新生儿 X 光片中的多种异常和医疗器械。
NeoCLIP 报告的气胸 AUC 为 0.93。筑波大学的新生儿气胸 AI 达到 0.975,但两项研究使用了不同数据集,不能据此进行直接排名。
它们的设计选择揭示了儿科影像 AI 的两条可能路径。一条是构建覆盖多种发现的广泛模型,另一条则是为紧急状况开发聚焦型系统。
广泛模型或许更自然地适配放射学工作流程,因为临床医生很少只针对一张图像提出一个问题。聚焦型分类器则可将有限的训练信号集中于一种高风险异常。
筑波大学团队选择了聚焦路线。这一决定可能使目标更清晰,但也留下了模型在多种竞争性诊断并存时如何表现的问题。
真实的新生儿影像很少只包含一个孤立问题。一名新生儿可能在同一张 X 光片中同时出现呼吸窘迫、导管、置管、体位差异和气胸征象。
这种复杂性将基准分类器与完整的临床阅片者区分开来。该系统不能取代放射科医师、新生儿科医生或儿科外科医生所需的更全面判读。
新生儿影像数据集的生态正在开始扩展。研究人员已发布涵盖呼吸窘迫和吸入性病变的图像集合,有时还配有临床变量。
这类工作可以提高可重复性,并鼓励外部测试。不过,各机构在设备、图像处理、临床人群和治疗实践上仍存在差异。
对于考虑引入医学 AI 的医院而言,专门化既创造价值,也带来负担。聚焦型模型可以填补危险的空白,但每一种狭窄用途的系统都需要验证、集成、监测和治理。
问题不只是新生儿 AI 能否识别气胸。医院还必须确定,该系统能否在不增加警报和碎片化工具的前提下提供可靠信息。
训练策略复用了成人图像,却没有复用成人假设
核心技术手段是先从成人影像中学习通用 X 光结构,再利用新生儿病例调整这一表征。
研究人员将教师模型和学生模型均建立在 ResNet-18 之上,这是一种常用于图像分类的卷积神经网络。ResNet 的连接有助于信息穿过更深层网络,同时避免训练效果退化。
在新生儿训练之前,团队使用了 1,802 张公开可用的正常成人胸部 X 光片。这一自监督阶段让编码器在不使用成人疾病标签的情况下学习通用的放射影像模式。
模型可以学习肋骨轮廓、肺野、组织对比度、曝光差异和图像纹理等特征。它并未将成人气胸标签视作新生儿病例的真相。
这一区分很重要,因为部分图像属性可跨年龄群迁移,而诊断关系未必如此。该设计试图保留可迁移的视觉基础,同时重新学习实际任务。
每张 X 光片都被处理为三通道图像,包含原始、较亮和较暗版本。模型接收的图像被调整为 224 × 224 像素。
亮度变化代表成像条件、显示设置和曝光中可能出现的变化。在这些变体上训练旨在降低模型对技术差异的敏感性。
新生儿数据集按 7:1:2 的比例划分为训练、验证和测试集。教师模型使用了来自 2,567 名新生儿的 4,313 张训练图像。
另有来自 366 名新生儿的 615 张图像用于支持模型选择和超参数评估。留出的测试图像始终未参与教师模型开发。
接下来是知识蒸馏,这种方法将教师模型的概率模式迁移给学生模型。学生模型同时从二元标签和教师模型较为柔和的预测中学习。
二元标签只说明是否存在气胸。经软化的预测则包含关于模型置信度及其所感知模糊性的相关信息。
当医学数据集有限或类别不平衡时,这种额外信号可以对训练起到正则化作用。在本研究中,教师和学生均使用相同的 ResNet-18 架构。
研究人员将完整方案与更简单的 ResNet-18 配置进行了比较。成人图像预训练与知识蒸馏的完整组合,在整体测试性能上表现最强。
阈值选择同样具有临床动机。团队采用八折交叉验证,并以 0.001 为步长搜索概率阈值。
对于每一折,他们选择在灵敏度至少保持 90% 的前提下,特异度最高的阈值。中位数选定阈值 0.06 随后被固定用于最终测试。
这一过程说明,模型的原始 AUC 无法定义其临床行为。医院必须决定运行阈值应如何在漏诊与误报之间取舍。
最终测试的灵敏度为 87.6%,低于交叉验证目标。这一差异再次提醒我们,模型行为可能在开发数据和留出数据之间发生变化。
该模型还生成了 Grad-CAM 热力图。Grad-CAM 会突出显示对网络预测贡献较大的图像区域,让临床医生能够粗略了解模型关注的位置。
在真阳性测试图像中,热图在 92 次肺部层面评估中的 84 次与受累右肺一致,占比 91.3%。
左侧定位较弱。71 次评估中,热图仅有 48 次与受累左肺一致,占比 67.6%。
这一差异具有统计学显著性。作者认为,心脏及邻近纵隔结构可能使左侧气胸更难定位。
综合双侧结果,一致率达到 81.0%。这令人鼓舞,但热图并不能证明网络采用了正确的医学推理。
关于显著性图可信度的研究表明,这类视觉解释需要谨慎看待。注意力图可能看似合理,却未必能精确定位真正的异常。
因此,这一机制实现了两项彼此独立的成果:它正确分类了大多数测试图像,其注意力也经常与临床受累肺部重叠。
但这两项成果都不能说明模型理解因果关系,或能够自主运行。它们表明,经审慎适配的图像特征可支持一个有用的新生儿分类器。
准确率掩盖了误报与不均衡的定位表现
最严峻的压力测试来自错误本身,因为这些错误类似于新生儿重症监护中常见的复杂情况。
94.5% 的准确率受益于测试集中阴性 X 光片远多于阳性片。在不平衡的医疗数据中,正确识别阴性样本可能主导总体百分比。
敏感性、特异性、预测值、校准情况和原始错误计数能提供更完整的图景。在这里,模型漏检了 16 张阳性图像,并错误标记了 52 张阴性图像。
其 68.5% 的阳性预测值带来了最明确的操作层面担忧。临床医生不能将阳性结果视为气胸的确诊。
作者警告,误报可能引发不必要的紧急复核或额外影像检查。反复警报还可能带来认知负担和警报疲劳。
这一风险并未抹杀 98.5% 阴性预测值的价值,但它界定了该系统的适当角色。
筛查助手可以对可疑检查进行排序、提示细微异常,或提供第二次阅片参考。独立诊断系统则需要高得多的证据门槛。
疾病患病率同样会影响预测值。即使敏感性和特异性相近,部署在另一家医院的模型也可能产生不同占比的可信阳性警报。
校准带来了另一项局限。该模型的图像层面 Brier 评分为 0.0309,但预测概率在中间和较高区间偏离了理想校准。
经过良好校准的概率应与观察到的风险高度对应。当校准发生漂移时,展示的分数可能显得比临床结局所允许的更确定。
医院在将这些概率用于分诊前,需要进行本地校准和监测。在一家机构选定的阈值未必能顺利迁移到其他地方。
新生儿暂时性呼吸急促与误分类独立相关。这种疾病会因胎儿肺液清除延迟而导致暂时性呼吸困难。
它出现在 52 个假阳性预测中的 17 个,以及 16 个假阴性中的 8 个。这些数字表明,重叠的影像学模式可能令分类的两个方向都产生混淆。
胎龄同样与错误独立相关。在主要多变量分析中,胎龄每增加一周,误分类的比值比为 1.10。
这种关联并不能确立直接的因果机制。它提示模型在新生儿群体中的表现并不均匀。
左侧定位差距增加了一种可见的不对称性。即便图像层面的分类在技术上正确,突出错误一侧的热图也可能削弱临床医生的信任。
心脏在新生儿胸部图像中占据了相当大的空间。其重叠可能掩盖细微的胸膜腔积气,并改变模型可利用的特征。
重症监护中的图像采集本身很难标准化。患者旋转、呼吸相位、肺容量、曝光以及床旁摆位都可能改变图像表现。
该研究排除了质量明显不佳的图像,以及严重异常显著遮蔽肺部的病例。这些排除标准有助于界定一个更干净的评估集。
但它们也限制了该评分对于最棘手现实病例的说明能力。部署后的系统将会遇到运动伪影、设备重叠、重症疾病和质量受损的图像。
标签也带来另一项约束。一名小儿外科医生和一名新生儿科医生共同审阅图像并达成共识,而非进行独立盲法评估。
共识可以形成知情的参考标准,但无法衡量阅片者之间的分歧。它也无法完全消除细微影像学表现中的不确定性。
该研究为回顾性研究,因此模型从未参与实时医疗。研究人员没有测试其警报是否缩短诊断时间或改善结局。
没有前瞻性工作流衡量临床医生如何应对正确和错误的输出。研究也未对有无 AI 辅助的诊疗进行随机比较。
单中心设计仍是最大的泛化局限。不同新生儿病区的设备、流程、疾病患病率和患者特征都可能存在显著差异。
成人气胸系统已经显示,训练伪影如何误导模型。一项混杂偏倚研究发现,当算法学习到便利的视觉捷径时,胸腔引流管可能扭曲性能表现。
该新生儿模型的 Grad-CAM 分析提供了一些安慰,但无法排除隐藏的捷径。外部数据集对于揭示原始医院特有的相关性必不可少。
因此,将这一准确率称为前所未有将超出证据范围。更恰当且仍值得关注的结论是:针对性训练在困难的新生儿任务上实现了较强的内部区分能力。
年龄特异性 AI 正在与更广泛的模型和超声竞争
核心竞争并非 AI 与医生之间的竞争,而是专业化决策支持与多条既有气胸检出路径之间的竞争。
常规胸部 X 光检查仍是新生儿重症监护的核心。它可以显示气胸,同时揭示更广泛的肺部发现、导管位置及其他临床相关细节。
AI 分类器可以叠加在既有工作流之上。它不需要替换影像检查方式,也无需让工作人员学习新的采集技术。
肺部超声提供了另一条路径。它便携、避免电离辐射,并可提供即时床旁信息。
然而,超声图像质量和解读依赖操作者技能。其应用情况可能因医院、班次和可用专家而异。
一项独立的 2026 年超声 AI 研究在平衡的 48 例测试集中报告了气胸检测 100% 的敏感性和特异性。其基准比较包括来自五家医院的 11 名资深临床医生。
由于测试集较小,这些完美的点估计带有较宽的置信区间。该研究评估的也是超声图像,而非新生儿胸部 X 光片。
将其评分与筑波模型直接比较会产生误导。其人群、影像模态、样本量和评估设计均不相同。
不过,两项研究共同展示了 AI 沿着两条影像路径的进展。一项分析已嵌入医院工作流的 X 光片,另一项则辅助便携式超声解读。
更广泛的新生儿基础模型构成了另一种竞争方法。NeoCLIP 致力于识别多种异常和设备,可能从每张图像中提供更多价值。
气胸专用系统可以围绕一种紧急疾病优化敏感性。通用模型则可能减少临床医生需要监管的独立算法数量。
医疗系统最终将根据工作流表现而非基准测试的专业化程度来评判这些工具。它们需要了解警报是否及时到达,以及是否恰当地改变诊疗。
它们还必须衡量工作人员忽略警报、要求额外影像检查,或尽管得到辅助仍漏诊病例的频率。这些结果决定软件是在减少工作,还是仅仅重新分配工作。
成人系统提供了有用的对比,但不能成为新生儿领域的捷径。一项多医院评估报告,在成人胸部 X 光片上检测气胸的 AUC 为 0.979。
该研究纳入了来自四家医院的 985 名成年患者,并以放射科医生共识作为参考标准。其敏感性达到 94.3%,特异性为 92.0%。
相近的 AUC 值并不意味着系统可以互换。成人和新生儿图像反映出不同的解剖结构、疾病模式、摆位、设备和临床风险。
筑波新生儿气胸 AI 的重要性在于缩小了这一人群差距。它表明,相对紧凑的架构能够适配专业化的儿科图像。
其训练设计也为其他数据稀缺领域提供了实用启示。研究人员可以复用通用视觉表征学习,而不应假设成人疾病标签可以直接迁移。
这一模式可能适用于其他新生儿异常。但每一个新增目标都需要具有代表性的病例、审慎的标签、独立测试和临床监测。
其中还存在一个产品设计问题。临床医生可能更倾向于一个整合式新生儿影像助手,而不是分别用于气胸、呼吸窘迫、肠穿孔和设备放置的模型。
整合可以简化界面,但也可能掩盖不同发现之间不均衡的表现。较高的总体平均分可能遮蔽紧急亚组中的薄弱结果。
专用模型能让这些亚组结果更容易被审视。但其范围较窄,也可能增加工具蔓延和多个警报阈值的问题。
因此,眼下的竞争压力主要落在源自成人影像的放射学 AI 开发商身上。没有亚组证据,强劲的新生儿专用结果将使不区分年龄的部署更难辩护。
医院应要求按年龄、病情、设备和站点报告性能。通用监管许可或成人基准无法回答这些本地问题。
开发更广泛新生儿系统的研究人员也面临压力。他们必须证明,多任务的便利性不会牺牲对时间关键疾病的敏感性。
未来很可能不是由单一模型胜出,而是由图像采集、专用检测、更广泛的解读和临床判断构成的分层工作流。
三项测试将决定该模型能否进入 NICU
外部验证、实时工作流测试和错误减少情况,将决定这一研究成果能否成为临床工具。
第一个信号将是多中心外部评估。该模型需要在未参与其开发的医院的新生儿群体中接受测试。
这项评估应涵盖不同国家、患者群体、影像设备、曝光流程和疾病患病率。它还应保持患者层面的数据分离,并公布完整的错误计数。
如果这些站点的敏感性和特异性保持稳定,将强化核心主张。若表现显著下降,则说明模型可能学习了与其原始机构绑定的模式。
亚组报告将尤为重要。结果应按胎龄、出生体重、基础呼吸系统疾病、图像质量和气胸位置分别呈现。
第二个信号来自前瞻性临床研究。研究人员需要将该系统置于真实的新生儿影像工作流程中,并观察其实际影响。
一项有价值的试验应衡量临床医生审阅所需时间、干预时间、误报负担、额外影像检查以及漏诊病例。还应记录临床医生是接受还是忽略每一条警报。
该研究必须比较有辅助与无辅助的诊疗实践。单独的回顾性准确性分析无法揭示:当临床医生看到软件输出时,软件是否真正改善了决策。
人为因素同样值得重视。即使警报准确,若到达过晚、出现在错误的界面中,或缺乏清晰的背景信息,其临床价值也可能十分有限。
热力图也应接受前瞻性评估。研究人员需要确定定位功能究竟能帮助阅片者,还是会在高亮区域错误时造成不当的信心。
第三个信号是系统在容易混淆的肺部疾病上的表现改善。短暂性呼吸急促已成为可量化的误差来源。
未来训练可纳入更多来自这些困难亚组的代表性病例。研究人员还可测试:临床变量是否能在单纯影像之外进一步提升鉴别能力。
任何降低假阳性的措施都必须保持敏感性。提高阈值或许能减少警报,但也可能让更多危险病例在未被察觉的情况下漏过。
固定的 0.06 阈值反映了这一权衡。外部机构可能需要重新校准,但每一项调整都应依据具有临床意义的结局进行评估。
阳性预测值值得密切监测,因为它决定了日常警报负担。即使 AUC 仍然很高,一个对过多健康病例发出警报的系统也可能失去信任。
筑波大学的新生儿气胸 AI 已跨过一项重要的研究里程碑。它在数千名新生儿的影像中,对一种危险病症展现出强劲的内部识别表现。
但它尚未跨过部署这一里程碑。论文没有提供证据表明其能加快治疗、减少并发症或改善患者安全结局。
对于早期临床 AI 研究而言,这一差距很正常,但报道中应清楚呈现这一点。准确性是实现价值的前提,而非临床验证的替代品。
因此,下一批报告应减少对又一个亮眼分数的关注,而应展示该模型能否在不同场所复制表现、临床医生能否正确使用它,以及新生儿护理是否得到改善。
对于关注医疗 AI 的读者而言,实际问题是:外部医院能否复现这一结果,同时避免承受难以管理的误报负担?答案将决定新生儿气胸 AI 是成为可信赖的第二阅片者,还是停留在一个颇具前景的内部基准。



