IICM+ 乳腺癌复发风险模型优于一项基因组评分,但尚不能用于指导诊疗
IICM+ 在 4,429 名试验参与者中改善了乳腺癌复发风险分层,尽管使用的是同一批基础患者资源,仍优于一项成熟的基因组评分。最大差异出现在五年后:对于早期预后看似较好的激素受体阳性乳腺癌,复发仍有可能发生。
这一结果带来了一个重要矛盾。该模型结合了病理图像、临床因素和分子测量数据,而当前临床实践往往高度依赖 21 基因复发评分。更好的统计区分能力或许能优化长期风险沟通,但这并不能证明基于 IICM+ 调整治疗能够改善生存率。
这一差别对于激素受体阳性、HER2 阴性、淋巴结阴性的早期乳腺癌患者尤为重要。许多患者可多年无病生存,但远处复发的可能性并不会在五年节点消失。研究表明,多模态模型能够识别单一基因组评分遗漏的风险信号。
IICM+ 从既有肿瘤数据中发现了更多风险信息
核心发现并不是 AI 找到了新的癌症标志物,而是它将几类熟悉的数据流整合为更具信息量的风险估计。
研究人员利用 TAILORx 乳腺癌试验中保存的标本和随访数据开发了 IICM+。模型开发组包含 2,808 名患者,另有 1,621 名患者构成机构留出组。
留出组是指在模型开发期间被单独保留的数据。研究人员随后用它来测试模型表现能否超越用于模型选择的病例。
该模型面向激素受体阳性、HER2 阴性、腋窝淋巴结阴性的早期乳腺癌。激素受体阳性意味着肿瘤生长会对雌激素、孕激素或两者产生反应。HER2 阴性意味着癌症未表现出 HER2 蛋白过度表达或基因扩增。
这一疾病类别较为常见,但其长期病程可能难以预测。复发可能发生在最初五年内,也可能在治疗结束、常规随访方式改变后的更晚时期出现。
IICM+ 处理三大类信息。它使用临床病理变量,包括年龄、绝经状态、肿瘤分级和肿瘤大小分组。它还纳入转录组测量数据,以及从数字化肿瘤切片中提取的表征。
转录组特征描述肿瘤内部基因活性模式。组织病理学表征则是对组织外观的数学概括,包括在染色切片上可见的细胞结构和空间组织。
图像部分分析了以高分辨率扫描的苏木精-伊红全切片图像。这些图像是病理学家日常检查的常规组织切片的数字版本。
该系统并未依赖单一图像尺度,而是同时使用局部图块级特征和更广泛的切片级表征。图块是从超大数字切片中以计算方式裁取的较小区域。
研究人员借助一个在病理图像、RNA 测序数据和病理报告上预训练的基础模型生成这些表征。随后,该模型将图像、临床和分子信息融合为连续的复发风险估计。
根据经同行评审的 IICM+ 研究,留出队列的中位随访时间为 11.2 年。109 名患者发生远处复发,占该组的 6.7%。
开发队列的中位随访时间为 11.7 年。其中 2,808 名患者中记录到 202 例远处复发,占 7.2%。
这些随访时间使研究人员能够考察两个临床上不同的时间窗口。早期远处复发指随机分组后五年内发生的复发。晚期远处复发则指五年后发生的复发。
该模型在留出组中针对总体远处复发的 C-index 达到 0.735。其早期复发 C-index 为 0.791,晚期复发 C-index 为 0.710。
C-index 衡量模型能否稳定地将更早发生事件的患者排在较长时间无事件患者之前。0.5 接近随机排序,1.0 代表完美排序。
这一指标并不意味着个体预测有 73.5% 的准确率。它评估的是患者对之间的风险排序,而不是某一位患者结局的确定性。
这一差异至关重要,因为模型即使能很好地对患者进行排序,仍可能给出校准不佳的绝对概率。校准关注的是预测风险是否与实际观察到的事件发生率相符。
IICM+ 还将预先设定的高风险组和低风险组区分开来。在整个留出队列中,高风险组的远处复发风险率是低风险组的 5.25 倍。
早期远处复发的风险比为 10.29,晚期远处复发的风险比为 2.90。这些数值描述的是随时间变化的相对事件发生率,而不是复发发生的绝对概率。
因此,最有力的解读应当是谨慎但有意义的:IICM+ 从既有存档数据中提取了预后信息,并且比若干更简单的模型更有效地区分了高风险和低风险患者。
晚期复发正是 21 基因评分尚未完全弥补的缺口
IICM+ 之所以重要,在于五年后临床问题发生变化,而激素受体阳性疾病的风险仍可能持续存在。
通常与 Oncotype DX 相关联的 21 基因复发评分用于评估肿瘤基因表达。临床医生会将其与年龄、绝经状态、肿瘤特征和患者偏好结合使用。
其最确立的作用是帮助评估符合条件的早期乳腺癌患者的预后,并辅助作出术后辅助化疗决策。辅助治疗是指手术后实施、旨在降低癌症复发可能性的治疗。
TAILORx 帮助界定了该评分如何指导淋巴结阴性、激素受体阳性、HER2 阴性疾病中的化疗决策。TAILORx 试验纳入了超过 10,000 名女性,成为基因组风险评估的重要证据基础。
这一成功并不意味着该评分能回答所有后续问题。化疗获益、总体复发风险和五年后的风险彼此相关,但属于不同结局。
激素受体阳性癌症呈现出尤其复杂的时间线。患者可能完成初始治疗和数年内分泌治疗而未复发,但休眠的癌细胞仍可能在多年后重新活跃。
这一模式使延长内分泌治疗的决策更为复杂。更长疗程可降低部分患者的复发风险,但也可能增加副作用和治疗负担。
因此,临床医生需要估计哪些患者仍保留足够高的晚期风险,以支持进一步干预。主要围绕早期治疗决策开发的检测,可能无法捕捉与后期风险相关的所有特征。
在 IICM+ 留出组分析中,21 基因评分针对总体远处复发的 C-index 为 0.578。IICM+ 达到 0.735,配对比较具有统计学显著性。
早期复发的差异较小。IICM+ 达到 0.791,而复发评分为 0.722。
晚期复发比较呈现出最鲜明的对比。IICM+ 达到 0.710,而 21 基因评分为 0.514,在这一特定分析中接近随机水平的排序能力。
这并不意味着成熟评分毫无用处。它表明,对于并非其唯一原始设计目的的晚期结局,其预后信号有所减弱。
多模态方法具有信息优势。它能够同时利用可见的组织结构、更广泛的分子特征和标准临床变量。基因组评分则概括了较为狭窄的分子特征组合。
在针对复发评分类别和临床病理因素进行调整后,IICM+ 与远处复发仍保持关联。总体复发的调整后风险比为 3.56。
早期复发和晚期复发的调整后风险比分别为 6.74 和 2.28。这些结果表明,该模型在临床医生已有分类信息之外增加了额外信息。
该模型还识别出不一致病例。一些复发评分在 0 至 25 之间的患者被 IICM+ 归类为高风险。其观察到的结局与同时被两套系统归类为低风险的患者不同。
相反的模式也出现在部分评分为 26 至 100 的患者中。IICM+ 识别出一个观察到的风险低于单靠基因组类别所暗示水平的亚组。
分歧正是新检测可能开始具有临床意义的地方。如果两种工具得出一致结论,额外结果的价值可能有限。当它们出现分歧时,新模型可能会改变风险的解读方式。
然而,分歧也会带来最大风险。临床医生需要证明哪项检测应主导治疗决策的证据,而不只是证明两者分类不同的证据。
当前研究确立的是预后,即与未来结局的关联。它并未确立对治疗获益的预测,即证明某个风险组能从特定治疗中获得更多获益的证据。
这一界限必须保持清晰。目前,IICM+ 的高风险结果并不能证明化疗、延长内分泌治疗或强化监测会改善某位患者的结局。
IICM+ 乳腺癌复发风险模型如何运作
IICM+ 的优势来自多模态融合,而非单一更优的图像分类器或某个新发现的基因。
研究人员评估了 11 个预先设定的模型,采用不同组合的临床、分子和影像输入。这些模型涵盖仅使用临床信息或图像信息的系统,以及完全整合的配置。
在单一模态模型中,仅分子方法表现强劲。一项扩展分子模型针对总体复发的 C-index 达到 0.694,针对晚期复发达到 0.672。
这一发现为 AI 叙事提供了重要校验。新增信号很大程度上来自更广泛的分子信息,而不必然来自数字病理。
完全整合的 IICM+ 模型总体 C-index 达到 0.735。然而,其表现与最强的、结合临床和扩展分子特征但未采用完整图像架构的模型相近。
论文讨论部分承认了这一细微差别。影像增强了整合框架,但留出组结果并未显示图像本身推动了全部性能提升。
这对实施很重要。数字化全切片需要扫描仪、存储空间、质量控制和一致的组织处理流程。扩展分子检测也有其自身的实验室要求。
医疗系统无法仅通过在电子健康记录旁安装普通软件来部署 IICM+。它需要协调病理、分子、临床数据和计算工作流。
切片制备可因实验室而异。染色强度、扫描仪硬件、图像分辨率、组织伪影和文件处理方式都会改变图像模型所见内容。
这一问题称为领域偏移。在一组标本上训练的模型,当实验室实践或患者特征发生变化时,可能会失去准确性。
基础模型可通过学习多种数据类型和图像尺度,降低部分敏感性问题。但它无法取代在不同医院和人群中开展外部测试的必要性。
该研究在开发队列内部采用了五折交叉验证。研究人员将数据划分为多个部分,反复使用其中一部分训练,并在另一部分上检验性能。
随后,他们在由1,621名患者组成的留出队列中评估了入选模型。这比仅报告交叉验证结果更有说服力,因为留出病例并未参与模型开发过程。
不过,这两组数据均来自TAILORx。该机构留出集对模型评估而言是独立的,但并非来自完全独立、前瞻性的医疗系统人群。
TAILORx参与者也符合临床试验的入组标准。与日常临床实践相比,临床试验往往产生更干净的数据和更标准化的诊疗过程。
真实诊所中的患者可能存在记录不完整、罕见组织学类型、合并症,或样本在不同条件下处理的情况。其中还可能包括在开发资源中代表性不足的人口群体。
一个可在临床部署的模型必须经受住这种变化的考验。当同一张切片被重复扫描,或在另一家获认证实验室处理时,它也应提供稳定的结果。
多模态系统还带来了另一个实际问题:输入缺失。模型可能在每位患者都拥有可用图像、完整临床变量和所需转录组检测面板时表现良好。
常规医疗并没有这么整齐有序。样本可能过小,切片可能未通过质量审核,或分子检测结果可能无法获得。
开发者必须明确测试能否拒绝给出结果、能否在数据缺失时运行,或是否需要重新采集样本。在高风险场景中,无法解释的备用预测会带来风险。
可解释性仍然有限。IICM+从许多相互作用的特征中生成风险估计,但临床医生需要了解结果在生物学上是否可信。
突出关键组织区域的热图或许能帮助病理医生检查图像的贡献。但它并不能完整解释图像、分子和临床信号如何共同形成最终评分。
这一挑战贯穿整个医学影像AI领域。关于模型泛化的研究表明,某一数据集上看似公平或准确的表现,未必能顺利迁移到另一种环境中。
因此,这一机制既是模型的优势,也是其部署负担。整合更多信息可以改善风险分层,但每增加一个数据流,就增加一项验证要求。
真正的竞争:更丰富的风险建模与既有临床标准
IICM+并非在与一项过时检测竞争。它挑战的是一个由多年临床试验、指南和临床经验支持的标准。
21基因复发评分在乳腺癌诊疗中占据明确位置。临床医生了解其分类、证据基础、局限性,以及它与治疗决策之间的关系。
IICM+目前在一项针对临床试验样本的回顾性分析中显示出更强的区分能力。但它尚未具备同等层级的证据,证明其能够改善决策或患者结局。
这一区别解释了为何更高的C指数不足以决定胜负。临床效用取决于结果送达肿瘤诊疗团队后会发生什么。
一项有用的检测必须为恰当的患者改变决策。它应减少治疗不足,同时避免让不太可能获益的人接受不必要的治疗。
假设IICM+在复发评分0至25的范围内识别出高风险患者。这一结果可能促使医生讨论增加治疗或延长内分泌治疗。
在采纳这种做法前,研究人员必须证明依据该分类采取行动能够改善结局。否则,模型可能只会带来更多治疗、毒性、焦虑和监测。
反向情况同样值得关注。在较高基因组评分类别中,较低的IICM+分类可能促使治疗降级。
治疗降级尤其需要强有力的证据,因为错误的低风险结果可能使患者错失有益治疗。仅凭回顾性生存曲线分离并不足够。
研究作者明确将不一致分析描述为预后性分析。它们并未确立仅依据IICM+进行治疗升级或降级。
这种谨慎使该研究区别于被夸大的AI主张。模型能更有效地进行风险排序,但与各个风险等级相对应的临床行动仍未确定。
其他研究团队也在探索类似策略。另一项2026年的多模态AI检测结合了病理基础模型特征与常规收集的临床变量。
该研究纳入了15个队列中的8,161名患者。它报告了无病间隔期的合并C指数为0.71,并检验了模型在主要乳腺癌亚型中的表现。
在拥有Oncotype DX结果的三个队列中,该模型的合并C指数为0.67。基因组检测的C指数为0.61,尽管各个队列之间的结果有所差异。
另一模型结合常规病理和临床数据,研究无病生存五年后的晚期复发。其晚期风险验证将4,300名TAILORx参与者作为外部队列。
这些研究共同指向一场更广泛的行业转变。数字病理模型正日益将常规组织切片视为预后信息的来源,而不仅仅是诊断图像。
因此,竞争远不止IICM+与Oncotype DX之间的较量。多个团队正在测试组织形态学、临床背景和分子生物学是否能通过结合发挥更好的作用。
尚无任何一种方法成为毫无争议的替代方案。不同模型使用不同终点、队列、输入、阈值和统计方法,限制了直接比较。
一些系统旨在从图像中近似预测基因组评分,另一些则直接预测复发。一个模型可以在某项任务中表现出色,却并不代表它在另一项任务中同样有用。
IICM+还需要扩展的分子特征,这削弱了其作为简单、基于图像的基因组检测替代方案的说法。更准确地说,它是一项信息更丰富的联合检测。
这一设计仍可能值得采用。如果更复杂的检测能显著改善关键决策,其复杂性便有正当性。
证据必须表明,增加的实验室和计算负担带来的不只是有限的统计增益。它应改善治疗选择、患者结局或可及性。
性能数字仍未说明的问题
主要的不确定性在于临床效用,而不是IICM+是否在TAILORx数据中发现了具有统计学显著性的模式。
留出集分析提供了可信的预后区分证据。但它并未确立模型在实际由其指导医疗决策的患者中的前瞻性表现。
一项前瞻性研究会在结局发生前定义临床医生如何使用IICM+。它可以检验模型指导的医疗是否改善复发率、生活质量或治疗效率。
外部验证同样必要。下一批队列应来自无关联机构,并涵盖不同扫描仪、实验室、人群和临床工作流程。
多样性很重要,因为癌症结局反映的不只是肿瘤生物学。治疗可及性、合并症、治疗依从性和随访模式都可能影响观察到的复发情况。
亚组表现必须包含充分的不确定性估计。较高的总体C指数可能掩盖较小人口学或临床群体中的校准不足或区分能力不佳。
研究人员还应报告绝对风险。患者决策依据的是诸如其十年风险究竟是5%还是15%这样的问题。
高低风险之间的风险比无法直接回答这个问题。即使两组中的事件仍不常见,相对差异也可能显得很大。
留出组记录了109例远处复发。这一事件数支持所报告的分析,但当其进一步按时间窗口和亚组划分时便构成限制。
晚期复发的事件数少于总体终点。因此,置信区间应得到与点估计同等程度的关注。
阈值选择也会影响实际表现。连续评分最终必须触发分类、建议或进一步讨论。
不同阈值会改变敏感性和特异性。能够发现更多未来复发病例的阈值,通常也会将更多从未复发的患者标为高风险。
其后果并不对称。错误的高风险结果可能导致不必要的治疗和痛苦;错误的低风险结果则可能造成虚假安心或错失治疗。
应在预定治疗阈值下检验校准度。随后可通过决策曲线分析估计,使用该模型是否比对所有人治疗或对任何人都不治疗带来更多临床获益。
研究人员还必须将IICM+与当前的联合临床实践进行比较,而非仅与单独的基因组评分比较。肿瘤科医生已经将基因组结果与肿瘤大小、分级、年龄、绝经状态和患者偏好结合起来。
该研究纳入了与临床加评分模型的比较,这增强了其论证力度。然而,真实的多学科判断更难用统计学基线来呈现。
可重复性是另一道障碍。病理实验室需要针对组织质量、切片扫描、图像处理和模型版本控制制定记录完善的流程。
模型更新需要治理机制,因为更换基础模型可能改变风险估计。医院必须了解算法更新后,旧结果是否仍具有可比性。
商业利益也值得透明审查。该研究涉及ECOG-ACRIN研究人员和Caris Life Sciences,后者在其研究材料中介绍了该研究。
行业参与并不会使研究结果失效。但它增加了独立重复验证、可获取的方法,以及清晰披露模型所有权的重要性。
患者和临床医生也需要易于理解的结果报告。缺乏背景说明的数字评分可能被误解为对癌症是否复发的确定判断。
报告应说明所研究的人群、时间范围、绝对风险、不确定性和已验证的临床用途。它还应明确何时结果超出了已支持的人群范围。
目前,独立专家敦促保持谨慎。已发表的临床反应强调了更广泛验证、工作流程测试、可及性,以及证明使用模型能改善结局的必要性。
这才是正确的压力测试。更好的风险排序是一个充满希望的开端,但医学最终需要证据证明,患者能从依据它采取行动中获益。
三个信号将决定IICM+是否改变乳腺癌诊疗
下一阶段应按顺序检验泛化能力、治疗实用性和运营可靠性。
第一个信号是在完全外部的人群中完成验证。研究人员应在TAILORx之外收集的队列中评估冻结的模型参数。
该评估应涵盖多家医院、切片扫描仪、实验室和患者群体,并报告区分能力、校准度、失败率和亚组表现。
成功的结果将增强IICM+捕捉到可迁移肿瘤生物学特征的主张。若性能大幅下降,则表明模型可能依赖于原始试验环境。
第二个信号是证明IICM+能够预测治疗获益或改善决策。预后信息只能告诉临床医生谁的风险更高,而不能说明哪种治疗能够降低这一风险。
一项前瞻性试验可以采用该模型进行治疗分配,或将模型指导的建议与标准实践进行比较。试验应衡量复发情况、治疗暴露、副作用以及患者报告结局。
对于 IICM+ 结果与其基因组评分不一致的患者而言,这一问题尤其重要。这些不一致群体既是该拟议模型最具价值的应用场景,也是风险最高的应用场景。
如果高 IICM+ 风险能够识别出可从额外治疗中获益的患者,该模型的临床价值将显著增强。如果结局没有改善,更好的统计排序可能只具有限制性的实际价值。
第三项信号是其在常规病理工作流程中的可重复表现。实验室必须证明,不同的扫描仪、染色实践和软件版本都能产生稳定的分类结果。
运营研究还应跟踪无法使用的切片、缺失数据、周转时间以及临床医生的解读。一个只能在经过完美筛选的研究输入中发挥作用的检测,很难适用于日常医疗。
这些信号比又一条“胜过既有评分”的回顾性新闻标题更具参考价值。它们检验这种优势能否经受新患者和真实决策的考验。
对患者而言,目前的信息应当保持审慎。IICM+ 乳腺癌复发风险模型提供了令人鼓舞的证据,表明结合组织、分子和临床数据能够提高长期预后的准确性。
但在尚未与肿瘤治疗团队讨论前,它还不足以成为改变治疗方案的理由。患者应继续使用经过验证的检测和临床指导,同时等待研究人员明确 IICM+ 真正能够在哪些方面带来额外价值。
现在的问题并不是多模态 AI 能否给出更好的 C-index,而是独立试验能否将这种改进转化为更安全、更精准的医疗。



