top of page

POSTECH 免疫治疗 AI 通过筛除衰老肿瘤提升预测表现

12分钟前
讀畢需時 14 分鐘

POSTECH 推出了一套免疫治疗预测框架,通过筛除一种棘手的肿瘤状态,在六个患者队列中提升了四项性能指标。这套 POSTECH 免疫治疗 AI 聚焦于细胞衰老,即受压细胞停止分裂、但仍保持生物活性的状态。

这一差异至关重要,因为免疫检查点抑制剂可以带来持久缓解,但外观相似的肿瘤并不总会作出相似反应。传统模型往往将免疫检查点活性直接视为治疗反应信号,而衰老肿瘤可能打破这种表面关联,并干扰预测结果。

这项成果并非可供常规使用的临床诊断工具。它是一项经过同行评审的回顾性研究,基于黑色素瘤、胃癌、膀胱癌和肺癌队列的基因表达数据。其核心论点仍然重要:医疗 AI 有时会在研究人员先识别出误导性生物学因素后,而非仅训练更大模型时得到提升。

POSTECH 如何改变免疫治疗预测

POSTECH 的关键举措,是在构建最终治疗反应分类器之前,先分离出与细胞衰老相关的无应答者。

浦项科技大学的研究人员于 2026 年 9 月 5 日在 npj Digital Medicine 发表了这项研究。该期刊于 2 月 4 日收到稿件,并于 8 月 4 日接受发表。

研究团队成员包括 Minsoo Kim、Woomin Song、Hyunsoo Ahn、Giljae Chung,以及通讯作者 Sanguk Kim。他们隶属于 POSTECH 人工智能研究生院和生命科学系。

POSTECH 于 9 月公开重点介绍了这项研究。后续报道指出,该框架已在涵盖四种癌症、共六个队列中接受评估。这些癌症包括黑色素瘤、胃癌、膀胱癌和肺癌。

该研究关注免疫检查点抑制剂,即 ICI。这类药物可阻断肿瘤用来抑制免疫细胞的抑制性信号。解除这种抑制有助于免疫系统攻击癌症,但患者之间的疗效差异很大。

预测模型通常会考察与 PD-1、PD-L1 和 CTLA-4 等靶点相关基因的表达情况,也可能采用从肿瘤样本中提取的更广泛免疫特征。

新框架质疑这些信号是否应始终被一同解读。两个肿瘤可能表现出相似的检查点相关分子活性,却处于截然不同的生物学状态。

其中一种状态便是细胞衰老。衰老癌细胞已进入稳定的生长停滞状态,但并非失去活性。它仍可持续释放信号分子,从而重塑肿瘤周围的免疫活动。

研究人员将这一周边生物环境称为肿瘤微环境。该环境包括癌细胞、免疫细胞、血管、成纤维细胞及其信号分子。

根据这项同行评审研究,衰老肿瘤状态可表现得像分布外样本。这一术语指与预测模型预期学习的模式存在显著差异的案例。

该框架首先采用基于网络的表征来描述细胞衰老和免疫检查点通路,随后在训练靶点导向的反应模型之前识别与细胞衰老相关的无应答者,简称 SNR。

这是一种筛选策略,而非仅在冗长的特征列表中新增一个生物标志物。该系统会移除那些其生物学特征可能掩盖检查点活性与治疗反应关系的病例。

在所研究的队列中,这一过程提升了队列内评估的准确率、受试者工作特征曲线下面积、精确率和特异性。曲线下面积,即 AUROC,用于衡量分类器在不同决策阈值下区分两类结果的能力。

研究还报告称,该框架在涉及独立黑色素瘤队列的外部测试中表现稳定。不过,作者并未将其描述为已经完成的临床系统。

这一边界对于理解这则新闻至关重要。POSTECH 改变了预测问题的组织方式,但并未证明该框架能在前瞻性临床照护中改善患者结局。

肿瘤细胞衰老为何会干扰医疗 AI

细胞衰老并非免疫反应强弱的简单标志,因为它可能支持相反的肿瘤行为。

细胞衰老会阻止受损细胞继续进行常规分裂。这听起来具有保护作用,在某些情况下确实如此。生长停滞可以限制受损或潜在恶性细胞的扩增。

然而,衰老细胞仍保持代谢活性。它们可产生由细胞因子、趋化因子、生长因子和组织重塑酶构成的混合物,称为衰老相关分泌表型,即 SASP。

这些分泌物可以吸引免疫细胞并促进肿瘤清除,也可能抑制免疫、支持邻近癌细胞、促进血管生成,或导致治疗耐药。

具体结果取决于肿瘤类型、治疗史、遗传背景、周边细胞群体以及 SASP 的组成。单一的衰老评分无法自动解释每一种肿瘤。

一篇重要的细胞衰老综述描述了这种生物学的双重面向。衰老细胞可刺激免疫监视,但持续性衰老也可能形成免疫抑制环境。

部分衰老肿瘤细胞会表达使其更容易被自然杀伤细胞或 T 细胞识别的分子。另一些则会增加包括 PD-L1 和 HLA-E 在内的抑制性蛋白,从而削弱免疫清除能力。

这种双重作用带来了一个特定的机器学习问题。模型可能观察到通常与免疫反应相关的检查点活性,但细胞衰老相关过程会阻止这种活性转化为临床获益。

当这类肿瘤与生物学特征不同的样本被汇集时,模型便会接收到不一致的学习信号。相似的输入模式会与相互矛盾的结局相关联。

标准分类器可能因此学习到不稳定的相关性。它们可能在一个数据集内表现良好,却在生物学组成不同的另一队列中失去可靠性。

POSTECH 的研究人员将这种异质性视为一种混杂结构,而非不可避免的噪声。其框架试图定位具有细胞衰老相关转录特征的无应答肿瘤,并将其单独处理。

转录特征反映肿瘤样本中哪些基因正在积极产生 RNA。它们提供功能性快照,可揭示单一蛋白测量无法捕捉的细胞状态。

该研究利用生物学网络来组织这些基因表达信号。基于网络的表征会考量基因与通路之间的关系,而不是将每个基因视为孤立变量。

这一方法建立在该团队此前工作的基础上。2022 年,一个 POSTECH 团队报告了一种基于网络的机器学习模型,该模型基于涵盖逾 700 名患者的转录组和临床数据开发。

早期的反应模型涵盖黑色素瘤、胃癌和膀胱癌。POSTECH 表示,其网络衍生的生物标志物优于若干传统治疗反应指标。

2026 年的研究增加了另一项洞见。当数据集包含由另一种生物学机制支配的亚组时,仅有更好的特征并不总是足够。

筛除该亚组可以使剩余关系更加清晰。换言之,模型性能的提升源于任务在生物学上变得更加一致,而不只是算法变得更复杂。

这一机制使该工作有别于关于更大规模医疗 AI 模型的常见说法。其新意在于决定哪些患者应为特定预测规则提供信息。

这一选择也带来风险。移除困难病例可能改善报告指标,却无法解决针对每一位患者的预测问题。被排除的群体仍代表需要有用治疗指导的人群。

因此,该框架提出了两个科学问题。研究人员必须检验 SNR 识别是否具有泛化能力,并确定临床医生应如何评估被归入这一类别的患者。

POSTECH 免疫治疗 AI 挑战“一种模型适用于所有人”的预测模式

核心较量在于:单一汇总预测器与能够识别相互冲突肿瘤状态的生物学分阶段系统之间的比较。

许多免疫治疗预测器假设,在混合患者群体中,一种映射关系便可将分子测量结果与治疗反应联系起来。更多数据理应使这种映射更强。

POSTECH 免疫治疗 AI 对这一假设提出质疑。如果部分人群遵循不同的生物学关系,加入这些病例可能会模糊信号,而非增强信号。

这一问题贯穿精准肿瘤学。按解剖部位定义的癌症类别可能包含多种分子亚型、免疫环境和演化历程。

即使接受相似检查点抑制剂的患者,其肿瘤突变、抗原呈递、T 细胞浸润、既往治疗和免疫抑制情况也可能不同。这些差异同时影响疗效与耐药性。

现有临床生物标志物已说明这一难题。PD-L1 表达可在多种情境中帮助指导治疗,但其预测意义会因癌种、检测方法、阈值和药物组合而变化。

肿瘤突变负荷用于估算肿瘤携带的突变数量。较高的突变负荷可能产生更多可被识别的肿瘤抗原,但并不保证能够形成有效免疫反应。

微卫星不稳定性和错配修复缺陷可识别出能够从检查点阻断治疗中获益的重要群体。不过,它们仅适用于许多癌症人群中的有限比例。

基因表达特征提供了另一条路径。它们可以测量干扰素信号、细胞毒性免疫活性、T 细胞炎症、衰竭或基质排斥。

每种方法都只能捕捉复杂系统的一部分。近期的免疫治疗 AI 项目越来越多地将转录组信息与通路知识、组织学或临床变量结合。

例如,独立开发的 COMPASS 框架比较了多种既有预测器,并构建了免疫生物学的概念层面表征。其已发表评估同样强调了跨癌种和治疗情境的泛化能力。

POSTECH 的方法处于一个更具体的位置。它并非首先询问一个模型如何吸收所有异质性来源。

相反,它询问是否存在一种可识别的肿瘤状态,会使靶点导向模型试图学习的关系失效。SNR 阶段在最终反应分类前充当一道生物学关卡。

这一顺序很重要。如果细胞衰老仅作为另一项特征加入,分类器便必须从有限的队列数据中发现它与检查点活性之间的相互作用。

分阶段框架明确提供了这种关系。它利用既有的生物学知识,筛出衰老相关行为可能压过预期检查点信号的病例。

这可以提升可解释性。研究人员可以探究一名患者为何进入 SNR 组,而不只是面对一个黑箱模型给出的最终概率。

不过,可解释性仍不完整。基于通路的评分并不能证明衰老导致了某位患者的治疗失败。

肿瘤整体转录组学也可能混合来自癌细胞、免疫细胞和基质细胞的信号。因此,衰老相关表达模式可能反映多种细胞来源。

研究报告的衰老标志物富集结果支持其解释,但富集仍只是一种关联。机制性实验室实验,以及空间数据或单细胞数据,将提供更有力的证据。

该模型还需要明确的临床定位。它可能支持治疗选择、识别需要额外检测的患者,或指导联合疗法研究。

这些用途对证据的要求各不相同。用于改变治疗方案的模型,需要比用于生成研究假设的模型更强的验证。

目前,最站得住脚的解读是方法学层面的。POSTECH 表明,考虑混杂因素的患者分层可以提升多个数据集上的回顾性免疫治疗预测表现。

这一结果促使整合式模型的开发者检验是否存在生物学上不同的治疗失败群体。较高的总体 AUROC 可能掩盖一个结局遵循另一种机制的亚组。

更好的指标尚不等于更好的癌症护理

该研究报告了可信的性能提升,但前瞻性临床证据仍是研究框架与医疗工具之间的分界线。

这项研究发表于同行评议期刊,使用了多个癌症队列,并纳入独立的黑色素瘤验证。这些特征使其比仅来自单一内部数据集的结果更具说服力。

不过,所有验证并不等价。一个模型可以在既往存档数据集上表现成功,却在医院将其应用于未来患者时遇到新问题。

回顾性队列在样本制备、测序平台、治疗方案、疗效定义和随访周期上往往存在差异。这些差异可能导致隐藏的捷径或分布偏移。

临床数据的采集条件也更难控制。肿瘤组织可能有限、降解、在不同疾病阶段采集,或受到既往治疗影响。

基于 RNA 表达的模型,需要从活检、测序到计算都具有可重复的工作流程。周转时间和组织需求会影响该流程是否适合临床护理。

报告中的六个队列涵盖四类癌症,提供了具有意义的多样性。但这并不能证明其在所有肿瘤、患者群体、检查点抑制剂或治疗组合中都具有普适表现。

黑色素瘤的独立验证很有价值,因为它在模型的直接训练环境之外检验了该框架。其他癌种仍需要更广泛的外部验证。

9 月报道也承认这一局限。报道指出,临床应用还需要在多样化癌种、患者队列和临床数据集上进行额外的外部测试。

这一限定应当比原始标题中的“精确”一词更受重视。精度并不是算法的永久属性;它取决于所测试的人群和临床决策。

该研究评估的也是分类指标,而非患者获益。准确率和 AUROC 显示预测区分能力,而精确率衡量阳性预测实际正确的频率。

特异性衡量测试识别无应答者的可靠程度。该指标具有明确的潜在价值,因为无效的免疫治疗可能消耗时间,并使患者暴露于毒性风险。

然而,具有临床实用性的阈值必须平衡特异性和敏感性。漏掉一名原本会产生应答的患者同样可能造成伤害。

合适的权衡取决于模型控制什么。一种触发额外检测的筛查工具,可以容忍与建议停用治疗的系统不同的错误特征。

校准同样重要。模型可能正确地对患者进行排序,却给出与观察到的应答率不相符的概率。

决策曲线分析有助于评估:在实际阈值范围内,使用模型是否比现有策略带来更多临床获益。前瞻性试验则能更有力地证明整个工作流程是否按预期运行。

另一个担忧涉及被筛除的 SNR 病例。将其移除能使剩余人群的训练更清晰,但临床医生无法将这些患者从治疗决策中移除。

完整系统需要为他们提供路径。这可能包括第二个预测模型、替代生物标志物,或明确表达不确定性,而不是强行赋予应答者标签。

这一局限并不会使该方法失效。它界定了下一个工程问题。

医疗 AI 常在开发者优化平均表现、却未为例外情况设计安全处理机制时失败。POSTECH 让一个例外群体变得更可见,但可见只是第一步。

向生物学感知型医疗 AI 转变的更大趋势

POSTECH 的结果支持一种更广泛的转变:从模式匹配转向围绕生物学机制和已知变异来源构建的模型。

早期医疗机器学习系统常将分子测量数据视为大型特征矩阵。算法在这些矩阵中寻找与诊断、预后或治疗应答相关的统计模式。

当训练人群与预期临床人群相似时,这一策略可以奏效。当多种机制产生相似的测量结果或结局时,它就会变得脆弱。

生物学感知型系统会将通路、相互作用网络、细胞状态或因果假设加入建模过程。这些约束可以缩小搜索空间,并暴露具有临床意义的失败模式。

POSTECH 的序贯框架提供了一个清晰例子。研究人员并未要求单一分类器在没有引导的情况下厘清衰老与检查点应答。

他们首先利用衰老相关网络和免疫检查点网络,识别一个生物学特征鲜明的无应答者群体。下一阶段则从一个更一致的人群中学习治疗应答。

这类似于机器学习中的专家混合设计。不同的专家处理输入分布中的不同部分,由路由过程决定适用哪位专家。

不同之处在于,POSTECH 的路由逻辑来自癌症生物学。这可以使分组更容易被研究,尽管并不保证每次分配都正确。

该方法还可能有助于应对较小型的医疗数据集。生物学结构能够减少对通过暴力训练发现每一种相关相互作用的依赖。

不过,先验知识也可能引入自身的偏差。已发表的通路并不完整,且经常被修订;某些癌种的研究也比其他癌种更充分。

基因网络资源也可能反映在与目标队列不同的细胞系或人群中进行的实验。生物学知情模型仍需要实证验证。

衰老尤其具有挑战性,因为研究人员尚缺乏一种可在所有组织中定义它的通用标志物。不同细胞可因不同压力进入衰老状态,并表达不同的分泌程序。

综述文献区分了抑癌效应与促癌效应。这种依赖情境的特性,正是固定衰老特征需要经过谨慎测试的原因。

更精细的测量可能会提升未来版本的性能。单细胞 RNA 测序可以分离来自肿瘤、免疫和基质细胞的信号。

空间转录组学可以显示这些细胞和信号在肿瘤内部出现的位置。纵向活检能够揭示衰老在治疗后如何变化。

这些技术仍比常规病理检测要求更高。它们的临床实用性将取决于额外信息是否足以改变决策,从而证明增加复杂性的合理性。

该框架也提出了一种治疗可能性。如果衰老识别出一种独特的耐药形式,它可能指导涉及检查点抑制剂和靶向衰老治疗的联合方案。

一些实验策略尝试清除衰老细胞、改变其分泌行为,或阻断免疫抑制信号。这些思路仍高度依赖于癌症情境。

预测和干预不应混为一谈。与无应答相关的标志物,并不会自动成为安全的治疗靶点。

因此,其即时贡献在于诊断推理。它表明,预测错误背后的生物学原因可以成为模型设计的一部分。

这一原则不局限于肿瘤学。医疗数据集常将表面特征相似、但机制不同的疾病亚型混合在一起。

当这些机制可被识别且具有临床相关性时,分阶段模型可以优于通用预测器。若路由阶段误分类患者,它同样可能失败。

教训并不是每个医疗 AI 系统都应筛除困难样本。而是开发者应解释,预测不佳究竟代表随机噪声,还是一个连贯的患者亚组。

POSTECH 已在这些免疫治疗数据集中为后者提供了证据。下一阶段必须证明,该亚组在新的医院和未来患者中依然成立。

三项信号将决定接下来的发展

决定性的检验包括更广泛的外部验证、前瞻性临床评估,以及为被归类为衰老相关无应答者的患者提供有用路径。

第一项信号是在胃癌、膀胱癌和肺癌的独立队列中进行复制验证。已发表的研究报告了利用独立黑色素瘤数据的外部验证,但其主张涵盖四类癌症。

成功的复制验证应在医院、地理区域、测序平台和治疗方案存在差异的情况下保持性能。它还应报告不确定性、校准度、敏感性和特异性。

如果这些结果保持一致,支持通用衰老感知框架的理由将更有力。性能的大幅波动则表明,该方法依赖于特定数据集或癌症情境。

第二项信号是前瞻性评估。研究人员应在观察患者结局之前,定义模型、阈值、样本流程和预期临床行动。

前瞻性研究可以衡量存档数据集往往遗漏的技术失败。这包括组织不足、测序延迟、缺失临床变量,以及未能通过质量控制的样本。

它们还可以将该框架与当前决策流程比较。相关问题并非 POSTECH 的模型能否击败一个较弱的计算基线。

问题在于,它是否能在病理学、PD-L1 检测、基因组生物标志物、影像学和医生判断之外提供有用信息。该比较应与相应的癌症和治疗场景匹配。

若该模型能够在不造成不可接受的漏判应答的情况下改善决策,前瞻性结果将强化本文的核心判断。即使回顾性指标仍具吸引力,若无法泛化,便会削弱这一判断。

第三项信号是 SNR 组患者将如何处理。在模型开发期间筛除这些患者具有方法学价值,但临床护理需要为每一位患者提供答案。

研究人员必须确认,SNR 分类在不同检测方法和重复样本之间是否稳定。他们还必须判断,该群体是否具有可重复验证的预后特征,或对替代治疗是否存在可重复的响应差异。

一条专门的预测路径可以对 SNR 人群内部的结局进行分类。另一种选择是将这些病例标记出来,以便进行额外的分子或病理检测。

近期最安全的功能或许是识别不确定性。能够识别常规响应规则何时不可靠的模型,可以避免给出过度自信的建议。

即使系统尚未直接选择治疗方案,这一功能也能带来实际价值。相比基于错误生物学关系得出的自信结论,可靠地选择不作判断往往更安全。

Sanguk Kim 教授表示,具备衰老感知能力的预测方法可帮助更多患者从免疫治疗中获益。他还指出,后续研究应更准确地反映肿瘤微环境。

这一目标具有合理性,但目前仍属于研究方向。该研究并未证明临床医生如今应根据其预测结果改变治疗方案。

对于研究人员和医疗 AI 团队而言,眼下的行动更为具体:他们可以检验自身的预测错误是否集中出现在细胞衰老、免疫排斥或其他可识别的肿瘤状态中。

他们还应在评估过程中保留这些棘手病例。在某一训练阶段排除混杂群体,不应导致其从最终性能报告中消失。

对临床医生和患者而言,这项工作最好被理解为一种正在发展的生物标志物策略。它不能替代肿瘤科医生的指导或经验证的诊断检测。

POSTECH 的免疫治疗 AI 提出了一项具有价值的假设,并获得多队列证据支持:肿瘤细胞衰老可能会掩盖用于预测检查点抑制剂响应的信号。

下一个问题已不再是筛除相关病例是否能够改善回顾性指标,而是衰老感知路由能否在不同医院中指导未来决策,同时让每一位患者——包括疑难病例——始终处于临床工作流程之内。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page