top of page

CIPHER 肺炎预测从常规 CT 中发现隐藏风险,但临床验证仍在后头

9月25日
讀畢需時 14 分鐘

CIPHER 肺炎预测在不增加新的扫描检查或专用生物标志物的情况下,于免疫治疗前识别出高风险肺癌患者。该模型分析了治疗前的常规 CT 图像,并在两家医学中心取得了接近 0.83 的曲线下面积(AUC)。

这一结果直面癌症治疗中的一个难题。免疫检查点抑制剂能够帮助免疫系统攻击肿瘤,但也可能诱发肺炎。这种肺部炎症可能危及生命,而且在症状出现前仍难以预测。

关键的较量并不是 AI 与医生之间的竞争,而是 CIPHER 与当下尚不完整的临床风险因素、影像阅片和传统影像组学组合之间的比较。该模型在回顾性研究中表现更佳,但前瞻性临床证据仍需证明,其预测能否改善患者照护。

CIPHER 将既有 CT 扫描转化为治疗前风险信号

直接的变化很简单:一张常规胸部 CT 或许已经包含关于未来免疫治疗毒性的可用预警。

得州大学 MD Anderson 癌症中心的研究人员开发了 CIPHER,即 Checkpoint-Inhibitor Pneumonitis Hazard EstimatoR 的缩写。该模型评估患者开始接受免疫检查点抑制剂治疗前获取的 CT 扫描。

免疫检查点抑制剂会阻断抑制免疫细胞的信号。这能够增强针对癌症的免疫反应,但也可能使炎症转向健康组织。

相关并发症是免疫检查点抑制剂诱发的肺炎,通常简称为 ICI-P。它是与检查点抑制剂治疗相关的肺组织炎症。

肺炎在影像和症状上都可能类似于感染、肿瘤进展或其他肺部疾病。患者可能出现咳嗽、呼吸急促、胸部不适或血氧水平下降。

MD Anderson 表示,约 10% 接受免疫治疗的肺癌患者会出现该病症。具体发生率会因治疗方案、患者群体、定义和研究设计而异。

医生在制定治疗方案时已会检查治疗前 CT 扫描。CIPHER 的主张是,这些相同图像在治疗开始前便包含有关肺部易损性的细微信息。

该模型不需要额外预约影像检查,也不依赖新的造影剂或侵入性组织样本。

这使基于常规 CT 的风险预测在实际操作中颇具吸引力。医院已拥有所需的输入数据,但部署仍需要软件集成、治理机制和临床验证。

研究人员在同行评议的 CIPHER study 中报告了结果,该研究于 2026 年 9 月 18 日在线发表。MD Anderson 于 9 月 24 日发布了其 research summary。

该研究聚焦于非小细胞肺癌,即 NSCLC。这是肺癌中最常见的大类。

CIPHER 在 347 名 MD Anderson 患者的治疗前扫描中接受了测试。外部验证则使用了 Johns Hopkins 的 116 名患者数据。

该模型在两种环境中均取得约 0.83 的 AUC。AUC 衡量模型在不同阈值下对有无某一结局的患者进行排序的能力。

AUC 为 0.83 并不意味着模型有 83% 的准确率。它表明模型具有良好的区分能力,但阈值选择及其临床后果仍未解决。

这一差别很重要,因为风险评分并非诊断。CIPHER 预测的是治疗前的易感性,而非检测已经存在的肺炎病例。

因此,这项消息的意义比自动化临床决策系统更为有限。研究人员在既有图像中发现了可复现的信号,但尚未确立新的照护标准。

矛盾也由此开始。常规数据让人更容易设想该系统的应用方式,但回顾性证据限制了临床医生如今应如何依据其输出采取行动。

为什么更早预警对免疫治疗照护至关重要

更早的预警,只有在帮助临床医生监测风险、又不至于不必要地放弃有效抗癌治疗时才有意义。

检查点抑制剂已成为多种癌症的重要治疗手段。其益处带来了艰难的平衡问题,因为免疫相关副作用可能影响多个器官。

肺部炎症在胸部肿瘤学中尤其受到关注。肺癌患者可能原本就有呼吸道症状、既往放疗暴露、吸烟相关损伤或其他肺部疾病。

这些相互重叠的因素使预测和诊断变得困难。治疗后新出现的咳嗽并不能自动证明是肺炎,而正常的基线评估也不能排除未来风险。

临床团队目前会考虑年龄、吸烟史、肿瘤类型、治疗方案和既往胸部放疗等变量,也会审阅治疗前影像中可见的肺部异常。

然而,这些因素并不能完全解释谁会发生 ICI-P。影像目测评估也可能因阅片者而异,尤其是在相关模式细微或弥漫时。

AI 肺炎风险模型可以为这一流程增加一个一致的图像衍生评分。该评分或许能识别出在治疗开始后应接受更密切观察的患者。

可能的应对措施包括更频繁地检查症状、降低追加影像检查的门槛,或更早开展肺科评估。这些行动仍需在前瞻性照护路径中接受检验。

高风险标签不应自动取消免疫治疗。该研究并未检验对模型标记患者替换、延迟或调整癌症治疗是否会改善结局。

这正是核心临床限制。一种有效的抗癌疗法具有已知的潜在益处,而 CIPHER 目前提供的仍是研究阶段的毒性风险估计。

假阴性存在显而易见的危险。被归类为较低风险的患者可能接受常规监测,之后却发展为严重肺炎。

假阳性则带来另一类问题。额外的影像检查、会诊或对治疗的犹豫,可能给那些永远不会发生该并发症的患者增加负担。

因此,后果取决于医院如何选择决策阈值。以筛查为导向的阈值可能优先考虑敏感性,同时接受更多误报。

更严格的干预阈值则可能更重视特异性。这种方法识别出的患者更少,但可能减少不必要的升级处置。

外部队列有助于说明这一权衡。其中包括 20 名发生 ICI-P 的患者,以及 96 名未发生 ICI-P 的患者。

CIPHER 正确识别出 20 例肺炎病例中的 16 例,也正确分类了 96 名未患该病症患者中的 80 名。

这些数字令人鼓舞,但它们来自规模有限的回顾性队列。更大的临床人群可能具有不同的疾病患病率、治疗方案和竞争性肺部疾病。

该模型的高风险组在免疫治疗开始后也更早发生肺炎。这一发现表明,该评分捕捉到了具有临床意义的易损性,而不仅仅是区分最终发生病例的能力。

不过,相关性并不能证明改变监测方式会预防严重结局。下一项研究必须将预测与具体的临床行动及可衡量的患者获益联系起来。

这也是 CIPHER 对既有实践构成压力、却无法取代它的原因。临床因素仍然不可或缺,但影像中或许含有常规解读尚未利用的信息。

CIPHER 肺炎预测如何在无需新增检测的情况下学习

CIPHER 的技术特点在于,它先广泛学习肺部结构,再寻找与后续毒性相关的偏离模式。

研究人员先利用 2,500 名 NSCLC 患者的 590,284 张 CT 切片对 CIPHER 进行了预训练。预训练让模型先学习通用的图像表征,之后再适应更具体的任务。

CIPHER 结合了对比学习和基于 Transformer 的掩码自编码器。对比学习教导系统哪些图像表征应当相似或不同。

掩码自编码器会遮蔽输入的一部分,并学习重建缺失的信息。这一过程促使模型表征更广泛的组织结构,而不是记忆单一标签。

两种方法都属于自监督学习。图像本身提供训练信号,从而减少对大规模人工标注数据集的依赖。

这一特点很重要,因为确认的 ICI-P 病例相对稀少。医疗记录中也可能存在诊断模糊、分级不一致和复杂的竞争性解释。

预训练后,研究人员使用内部免疫治疗队列对模型进行适配。该队列包含 347 名 MD Anderson 患者,其中有 33 例经裁定的 ICI-P 病例。

微调阶段使用了 254 名未发生 ICI-P 的患者。另一个独立留出集包含 33 个病例和 60 个对照,用于评估。

这种不同寻常的设计意味着,该系统并非简单地从大量标注的肺炎样本中学习传统分类边界。它学习常见的肺部表征,然后识别与未来风险相关的偏离模式。

研究的资深作者之一 Jia Wu 强调了这一差异。该模型并非旨在从基线扫描中寻找已经存在的肺炎。

相反,其学习到的表征突出了与日后易感性相关的细微异常。模型的注意力图指向研究人员认为具有临床相关性的肺部区域。

注意力图可以帮助研究人员检查哪些图像区域影响了输出结果。它们不能完整解释模型的推理过程,也不能确立生物学机制。

这一限制应当保持清晰。热图可以辅助审阅,但无法证明被突出显示的组织导致了未来的免疫反应。

团队还测试了 CIPHER 是否仅仅复现了已知临床风险因素。在纳入年龄、吸烟、组织学类型和既往胸部放疗后,其预测仍具有统计显著性。

这表明模型捕捉到了额外的影像信息。但这并不证明模型独立于所有隐藏的临床或技术变量。

外部 Johns Hopkins 评估是该研究最强的特点之一。不同机构可能采用不同扫描仪、重建设置、影像协议和患者筛选实践。

CIPHER 在该外部群体中仍保持 0.83 的 AUC 和 81.7% 的平衡准确率。平衡准确率对不同结局类别的表现取平均,减少类别规模不均带来的失真。

外部验证常常能暴露仅在开发环境中有效的模型。因此,CIPHER 的一致结果增强了进一步测试的理由。

不过,两家学术中心并不能代表所有医院。社区影像环境可能配备较旧的扫描仪,具有不同的转诊模式和更不稳定的数据质量。

该模型也针对特定人群。它研究的是接受免疫检查点抑制剂治疗的 NSCLC 患者,而非每一位接受免疫治疗的癌症患者。

研究人员计划评估其他癌种和治疗场景。在此之前,现有证据支持的是一项具体主张,而非一台通用的免疫治疗风险引擎。

研究摘要和更早的预印本记录也展示了该项目的发展过程。预印本早于经同行评审的期刊版本发布。

这一时间线提供了有益的透明度,也让读者能够区分初步传播与研究后续的期刊发表。

真正的较量:AI 风险评分与传统评估

CIPHER 的重要性在于其表现优于临床和影像组学对照模型,而不在于它消除了对两者的需求。

传统临床模型将已记录的患者变量整合为风险估计。其优势在于可解释性,因为每项输入通常都与医疗决策存在可理解的关联。

其弱点在于信息表征不完整。一小组变量无法编码数百张 CT 切片中可见的每一种细微组织模式。

影像组学采取了不同的方法。它将医学图像转化为描述强度、纹理、形状或空间变化的工程化测量指标。

这些特征能够发现肉眼检查可能遗漏的模式。然而,传统影像组学依赖于分割选择、特征定义以及精心构建的分析流程。

CIPHER 以学习到的表征取代了大量人工特征工程。其训练过程决定哪些图像模式对任务有用。

在内部比较中,AI 肺炎风险模型的 AUC 达到 0.83,优于临床、影像组学和集成对照模型。

外部比较进一步厘清了差异。影像组学模型的敏感性达到 85%,但特异性仅为 45.8%。

高敏感性意味着该对照模型识别出了许多后来发生肺炎的患者。低特异性则意味着它也将许多未受影响的患者标记为阳性。

在报告的外部测试中,CIPHER 在不牺牲敏感性的情况下展现出更强的特异性。与影像组学的统计比较得出 DeLong p 值为 0.0318。

这一结果支持该数据集内存在性能差异,但并不能保证在部署、软件变更或人群变化后仍会出现同样的差异。

因此,最有用的框架应是互补性的。CIPHER 可以处理标准临床审查无法量化的模式,而临床医生则能提供图像无法包含的背景信息。

CT 扫描无法捕捉每一种用药、症状、实验室结果或治疗偏好。它也无法判断患者是否会接受额外监测或调整治疗。

同样,临床检查清单可能遗漏分布在肺组织中的早期结构性征象。未来最强大的系统可能会结合图像、临床数据和其他生物标志物。

研究团队将多模态评估列为下一步。来自血液、肺功能检测或治疗史的生物标志物,可能改善校准度或解释模型失效原因。

这带来了 CIPHER 与影像组学之外的第二层比较。仅依赖影像的预测最终必须与使用多种数据类型的联合模型竞争。

更多输入并不总能打造出更好的临床工具。多模态系统可能更难在不同医院部署、审计和复现。

常规 CT 风险预测在这里有一项重要的实际优势:它从标准癌症诊疗中已经产生的数据出发。

然而,现有数据并不会自动成为干净数据。CT 切片厚度、重建核、扫描仪厂商、运动伪影和肺部覆盖不完整,都可能影响模型行为。

医院需要预处理标准和质量控制规则,也需要针对未通过这些检查的扫描制定政策。

工作流程设计与模型架构同样重要。治疗开始后才到达的风险评分,其价值低于在治疗规划期间即可获得的评分。

输出结果也必须送达正确的专业人员。肿瘤科医生、放射科医生、呼吸科医生和信息学团队,可能会以不同方式解读同一评分。

这些问题解释了为何主要对手仍是传统评估,而非另一款具名 AI 产品。CIPHER 的首要挑战是证明其相较当前诊疗能够带来额外的临床价值。

算法的头对头测试只是开端。决定性的比较将衡量患者结局、员工工作负担、误报以及治疗连续性。

AUC 为 0.83 仍然无法证明什么

CIPHER 拥有可信的回顾性证据,但尚未证明使用其评分能够改善决策或预防重症肺炎。

该研究的外部验证降低了结果仅来自单中心的担忧,但并未消除许多回顾性医学 AI 研究共有的局限。

研究人员评估的是已经存在的扫描和结局。他们并未前瞻性地将患者分配至 CIPHER 指导的监测或标准监测。

因此,该研究无法确定临床医生是否会一致地依据该评分采取行动,也无法显示这些行动是否会帮助患者。

正如论文所总结的,在临床转化之前应开展前瞻性验证。这意味着要在预先定义的方案下,对未来患者测试该系统。

一项强有力的前瞻性研究会在入组前锁定模型,也会明确阈值、预期使用者、使用时机以及对高风险结果的应对措施。

校准度将至关重要。一个排序良好的模型,仍可能在新的人群中高估或低估绝对风险。

临床医生需要的不只是排序。他们需要知道,对于本机构接受特定治疗的患者而言,某个具体评分意味着什么。

患病率也会改变预测的表现。在肺炎病例较少的医院,被标记为高风险的患者中可能会出现更多假阳性。

内部评估集纳入了所述队列中的全部经裁定 ICI-P 病例,以及一组经过选择的对照组。这支持了区分能力测试,但并不反映真实患病率。

外部队列包含 116 名患者中的 20 例病例。其构成对于验证仍具价值,但真实世界部署可能涉及不同的病例组合。

选择偏倚是另一项担忧。学术型癌症中心收治复杂患者,并可能采用专业化的影像或病例裁定实践。

缺少扫描、图像质量不足或诊断不确定的患者,可能会被排除在研究数据集之外。这些棘手病例仍会出现在临床实践中。

诊断标签同样值得审视。肺炎可能与感染、放射性损伤、水肿、肿瘤进展或既存间质性肺病相似。

该研究采用经裁定的病例,增强了标签质量。即便是专家裁定,也无法消除围绕免疫相关肺部事件的所有不确定性。

CIPHER 的注意力图提供了一些可解释性支持,但并未揭示因果路径。被突出显示的异常可能与另一项未测量因素相关。

该系统可能检测到纤维化、肺气肿、血管变化、既往损伤或与扫描仪相关的模式。识别其生物学信号将对信任和泛化能力至关重要。

还存在自动化偏见的风险。当数值评分与担忧一致时,临床医生可能过度看重它;而在低风险结果出现后,也可能忽视症状。

安全的实施方式必须将 CIPHER 呈现为决策支持工具。它绝不应取代新出现的症状、临床检查或不断演变的影像发现。

监管和运营问题仍未解决。报告并未描述已获批准的临床产品,也未说明其已获准用于常规患者管理。

部署后也需要进行模型监测。扫描仪升级、治疗变化和新患者人群都可能随时间推移改变其性能。

数据治理又增加了一层要求。医院必须控制访问权限、记录处理过程、审计输出,并保护敏感的医学图像。

公开可用的 CIPHER 代码支持技术审查和可复现性工作。仅有代码可用性,并不能复现原始数据、工作流程或临床环境。

独立团队应在不依赖开发者运营假设的情况下尝试验证。在更多中心复现将揭示其性能是否保持稳定。

正确的结论既不是否定,也不是立即采用。CIPHER 已通过一项重要的外部测试,但具有决定性意义的临床测试尚未开始。

这种平衡能够保护核心发现免受炒作影响。常规扫描似乎包含有意义的风险信号,但其实用性取决于评分出现后发生的事情。

三项信号将显示 CIPHER 能否进入临床诊疗

下一阶段必须将预测、行动和患者结局联系起来,而不是再报告一个回顾性 AUC。

第一项信号是采用锁定模型的前瞻性多中心验证。它应纳入多样化的医院、扫描仪类型、治疗方案和患者人群。

研究人员应报告区分能力、校准度、敏感性、特异性,以及不同人口学和临床亚组中的表现。若无法维持校准度,将削弱部署的依据。

稳定的结果将强化 CIPHER 能够检测可迁移肺部易感性的主张,也将帮助医院为明确的临床目的选择阈值。

第二项信号是与具体诊疗路径相关的干预性研究。高风险患者可以接受预先定义的监测,而对照组则遵循标准实践。

相关结局包括识别时间、肺炎严重程度、住院、治疗中断、皮质类固醇暴露以及癌症治疗连续性。监测负担和误报也应纳入分析。

这一步将回答最重要的问题:CIPHER 肺炎预测是否能够改善诊疗,而不只是预测一个结局。

一项成功的研究不必消除肺炎。更早识别、更少重症病例或更安全的监测,都可以证明其具有实质价值。

第三项信号是在原始 NSCLC 场景之外进行验证。研究人员计划考察其他接受免疫检查点抑制剂治疗的癌症。

这一扩展应谨慎推进。不同癌种涉及不同的基线扫描、治疗组合、器官以及竞争性毒性反应。

未经适当验证便转移模型,可能会保留一个看似有吸引力的评分,却失去临床意义。每个新场景都需要预先定义的证据和失效分析。

将影像与临床变量或生物标志物结合也值得关注。多模态模型应以足够显著的优势超越单独的 CIPHER,才能证明增加复杂性的合理性。

这些信号的重要性超越了一种并发症。医学影像包含的信息,多于常规报告中所列出的发现。

基础模型有可能将这些未被利用的信息转化为对治疗毒性、疾病轨迹或治疗反应的估计。但每种用途仍需要各自的临床验证。

因此,CIPHER 代表的是一种机制,而非已完成的部署故事。它利用现有扫描,在治疗开始前提出一个新问题。

对临床医生而言,当前应关注前瞻性证据,而非将研究评分视为医疗指令。对开发者而言,挑战在于围绕真实决策与伤害构建评估。

对于医疗系统而言,关键问题同样非常实际:出现高风险结果后应采取什么行动?这一行动能否在不限制有效治疗的前提下改善结局?在试验给出答案之前,CIPHER 肺炎预测仍是一项前景可期的影像生物标志物,而非标准的临床决策门槛。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page