DeepComp 可在胃癌手术前预测并发症,但仍需前瞻性验证
DeepComp 因在 5,237 名患者中预测胃癌手术前并发症而登上 Google News,但其最重要的临床主张仍未得到证实。
这款多模态模型结合了常规计算机断层扫描和临床信息,评估患者在术后 30 天内发生中度及以上并发症的风险。研究人员还训练它预测总生存期。
已发表的结果让 DeepComp 的目标超越了传统手术评分。据报道,该模型优于九种既有评分,并在一项阅片研究中显著提升了外科医生的敏感性。
然而,预测并发症并不等同于预防并发症。不同干预措施所报告的获益来自目标试验模拟,这是一种利用既有数据重建假设性试验部分内容的观察性方法。
这一差异定义了 Google News 标题背后的真正故事。DeepComp 在多中心研究中取得了令人鼓舞的结果,但医院仍需要前瞻性证据证明,依据其评分采取行动能够改善医疗质量,且不会造成不必要的治疗。
DeepComp 研究不止于单家医院的测试
DeepComp 最有力的结果并非某一个抢眼的准确率数字,而是其在多家医院、不同治疗场景和多种评估方法中的表现。
该研究于 2026 年 7 月 16 日在线发表于 Annals of Oncology。研究人员分析了来自中国 11 家中心的 5,237 名胃腺癌患者。
研究人群包括六个已注册的临床试验队列,涵盖新辅助化疗、放化疗和免疫化疗。新辅助治疗在手术前进行,旨在缩小或控制肿瘤。
在整个研究人群中,1,072 名患者出现了 Clavien-Dindo II 级及以上并发症,占研究样本的 20.5%。
Clavien-Dindo 系统根据术后并发症所需的治疗方式进行分级。II 级通常意味着患者需要使用常规术后药物以外的药物、接受输血或营养治疗。
III 级并发症需要手术、内镜或放射介入治疗。更高级别包括危及生命的事件和死亡。
DeepComp 在合并内部验证集中的受试者工作特征曲线下面积(AUC)达到 0.888。AUC 用于衡量模型区分发生某种结局患者与未发生该结局患者的能力。
0.5 表示仅具随机区分能力,1.0 则表示完美区分。在九个外部队列中,DeepComp 的 AUC 介于 0.824 至 0.869 之间。
原始研究报告称,该模型比表现最佳的临床基线高出 15.3 个百分点。其表现也优于研究人员测试的全部九种既有临床评分。
这些比较很重要,因为临床医生已经拥有风险评估工具。问题不在于 AI 是否能从医院数据中发现某些信号,而在于 AI 能否增加足够有用的信息,以证明改变决策是合理的。
研究人员围绕术前可获得的信息构建了 DeepComp。这个时间点至关重要,因为有价值的预警必须在临床医生仍能调整准备、监测或手术方案时发出。
该模型处理临床变量,并结合从三个 CT 区域提取的特征,包括肿瘤、其周围五毫米区域,以及在第三腰椎附近获取的身体成分测量数据。
该腰椎区域有助于量化骨骼肌和脂肪分布。这些测量可揭示体重或体重指数可能无法反映的生理储备。
随后,模型采用双任务架构,同时学习估计术后并发症风险和总生存期,而不是将二者视为彼此无关的结局。
这一 DeepComp 胃癌方法为系统设定了更广泛的目标。它试图利用相同的术前证据,将短期手术脆弱性与长期预后联系起来。
因此,相关 Google News 报道基于的是一项规模可观的模型开发研究,而非产品发布、监管授权或常规医院部署。
这一界限很重要。论文描述的是一个提供共享代码和部分数据资源的研究系统,而不是可在无人监督下投入使用的临床服务。
为什么 Google News 聚焦外科医生对比
对传统风险评估最直接的压力在于,当外科医生可以参考 DeepComp 的输出时,系统识别出的并发症数量显著更多。
十名外科医生参加了阅片研究。他们的经验跨度很大,从执业不足五年的初级临床医生到执业超过十年的资深外科医生。
在未使用 DeepComp 时,他们的平均敏感性为 47.1%。敏感性衡量的是阅片者正确识别为存在风险的并发症患者比例。
在获得辅助后,平均敏感性升至 87.9%。研究称,这一差异具有统计学意义。
这项提升解释了为何 AI 手术风险预测会受到关注。漏掉一名高风险患者,可能意味着错失提供营养支持、更密切监测或调整围手术期方案的机会。
不过,不能孤立解读敏感性。系统可以通过将更多患者标记为高风险来捕获更多真实病例,但这也可能增加假阳性。
已发表的摘要强调了敏感性的提升,但对于完整的人机协作误差权衡,公开细节较少。医院在判断实际运营价值前,需要了解特异性、阳性预测值、校准度和决策阈值。
特异性衡量模型将较低风险患者正确标记为未预警的频率。校准度则考察预测概率是否与真实患者中的结局发生频率相符。
若模型将过多患者判为高风险,可能消耗重症监护资源,也可能使本可正常恢复的患者延迟手术。
反过来,即使模型的平均区分能力出色,也仍可能在某一家医院失效。不同的扫描设备、治疗方案、患者群体和文档记录方式都会改变输入数据。
这正是多中心设计的重要性所在。九个外部队列提供的证据强度高于从单家医院数据库中随机划分数据集。
但所有中心均位于中国,胃癌疾病负担和临床经验在当地都十分突出。该模型尚未证明其在北美医疗系统中具有同等表现。
根据国际癌症研究机构的胃癌数据,亚洲占 2022 年预计胃癌死亡病例的 70.1%。这一集中度支持建立大型区域性数据集,但并不能保证模型可在全球范围内迁移适用。
北美医院需要评估其患者是否与开发人群相似。癌症分期、身体成分、影像检查、术前治疗和手术方式的差异,都可能影响校准度。
研究人群本身面临较高临床挑战。患者中位年龄为 58 岁,61.6% 为男性,67.6% 处于病理 III 期。
这些特征为模型提供了有价值的压力测试,但也引出了其在高龄患者、早期疾病及训练数据中代表性不足群体中的表现问题。
现有替代方案说明了 DeepComp 为何受到关注。一项较早的胃癌手术机器学习模型纳入 455 名患者,报告的 AUC 为 0.789。
该早期模型使用了吸烟状态、营养筛查、麻醉分级、手术时间和失血量等变量。其中部分输入要到手术开始期间或之后才能获得。
DeepComp 则专注于术前信息。这使临床医生拥有更长的干预窗口,也将该模型与术后诊断系统区分开来。
不过,外科医生对比不应演变为医生与软件之间的竞争。报告中的优势出现在临床医生与模型协同工作时。
因此,有意义的对比对象并非 DeepComp 对阵外科医生,而是多模态评估对阵传统判断和碎片化风险评分。
这是一项更严苛的检验。新工具必须在融入临床工作流程、解释不确定性并避免警报疲劳的同时改善决策。
DeepComp 的机制将肿瘤与患者联系起来
该模型的核心思路是,手术风险既反映癌症的解剖学特征,也反映患者承受治疗的能力。
传统评分往往将患者压缩为少数几个临床类别。DeepComp 胃癌预测则利用术前可获得的多种生物学和解剖学视角。
肿瘤区域可能包含与局部疾病严重程度相关的影像模式。肿瘤周围五毫米区域则捕捉病灶紧邻组织的信息。
L3 身体成分区域用于估算肌肉和脂肪分布。即使患者体重看似正常,这些信息也可发现肌少症,即骨骼肌储备偏低。
DeepComp 并非只是将原始扫描图像输入单一的黑箱分类器。研究人员使用了基础模型影像特征,即从更广泛影像数据中学习得到的数值表征。
这些特征与结构化临床变量在表格架构中结合。随后,模型同时优化并发症和生存预测。
这一安排试图捕捉一种临床关联。患者的疾病状态、营养状况、炎症和生理储备都会影响恢复过程与长期结局。
生存结果支持了这种关联。DeepComp 在总生存期预测中取得了 0.766 的合并一致性指数。
一致性指数衡量模型能否根据结局发生时间正确排序患者。研究报告称,其风险评分每增加一个标准差,经调整后的风险比为 3.08。
五年生存率从最低风险五分位组的 97.5% 降至最高风险五分位组的 2.4%。这些分组反映的是研究人群中由模型定义的风险分层。
这些数字不应被解读为对每一位未来患者的预测。它们取决于研究中使用的人群、随访情况、治疗背景和模型版本。
双重结局也带来了一个棘手的临床问题。模型可能识别出同时具有高并发症风险和较差预测生存率的人,但它无法替该患者决定治疗目标。
临床医生仍须权衡根治意图、生活质量、替代治疗、患者偏好以及延迟手术的后果。
该模型开放的研究材料可能帮助独立团队审查这些主张。论文称,可通过 DeepComp 仓库获取推理代码、预训练权重、评估脚本和示例数据。
研究人员还发布了一个内部验证队列的处理后特征矩阵。这有助于复现部分评估结果。
开放代码并不自动意味着完全可复现。外部团队仍需要兼容的影像流程、患者定义、预处理方法,以及获取具有代表性的临床数据。
该研究的测序数据已存入中国国家基因组科学数据中心。由于包含敏感健康信息,更多患者级材料仍受到访问限制。
这些限制在医学研究中很常见,但会增加独立测试的难度。医院不能只评估源代码,就假定所得评分会以完全相同的方式表现。
影像工作流程带来了另一项实际挑战。肿瘤分割必须在不同扫描仪厂商、层厚、增强方案和本地图像质量条件下保持可靠。
在外科医生看到风险估计之前,静默的分割错误就可能扭曲下游特征。因此,质量控制需要识别无效扫描和分布外病例。
该模型还需要提供可解释的输出。若风险概率没有说明其适用人群、时间范围、置信度和局限性,可能会诱发自动化偏见。
现行的 reporting guidance 在 TRIPOD+AI 框架下强调,应透明描述预测模型的开发与评估过程。这包括数据处理、缺失值、性能指标和公平性考量。
这些要求并非模型之外的文书工作。它们决定了其他临床团队能否理解所报告性能的来源。
其机制在科学上合理,在技术上也颇具吸引力。如今,它的价值取决于这一机制能否经受前瞻性工作流程、不断变化的数据以及真实治疗决策的考验。
预测获益尚未证实为患者获益
DeepComp 最大的不确定性在于干预,因为该研究估计的是治疗效应,而非根据模型评分随机分配医疗方案。
研究人员采用目标试验模拟法,考察了针对高风险患者的三种可能应对措施。该方法试图从观察性记录中重建一项假想的随机试验。
第一种策略是预防性加强监护或高依赖病房监护。该策略与约 6% 的 II 级或更严重并发症绝对减少相关。
第二种策略针对接受新辅助化疗的高风险患者:提供两至四周营养支持并推迟手术。该策略与 20.6% 的绝对减少相关。
第三种策略是优先考虑微创手术。研究报告称,估计绝对风险降低为 11.7%。
这些估计在临床上颇具启发性。它们表明,该模型或许不止能在决策已经作出后描述风险。
但它们并不能证明是 DeepComp 导致了这些改善。接受额外监护、营养支持、延迟手术或微创治疗的患者,可能在病历未能捕捉的方面存在差异。
逆概率加权可以平衡组间已测量的差异,但无法保证控制未测量的混杂因素。
报告中的 E 值为隐匿混杂因素提供了一种敏感性分析。不同干预措施的 E 值介于 1.90 至 5.73。
E 值估计的是:一个未测量因素需要与治疗和结局同时具有多强的关联,才能解释观察到的关联。它不能消除该因素,也不能将观察性数据变成随机试验。
营养结果尤其值得谨慎解读,因为推迟癌症手术本身也会带来后果。模型必须识别可能获益的患者,同时避免不必要地延后治疗。
微创手术的结果同样取决于手术适应证和本地专业能力。被选择接受腹腔镜或机器人手术的患者,可能与接受开放手术的患者存在实质性差异。
预防性重症监护还涉及资源问题。医院不能仅因敏感性提高,就在不了解假阳性和临床获益的情况下预留稀缺床位。
这些权衡使前瞻性验证成为决定性的下一步。已注册的 DeepComp-Prospective 研究被设计为覆盖五家医疗中心的多中心观察性评估。
其 trial registry 显示,预计将纳入 500 名患有潜在可切除胃癌的成人。该研究计划将术前预测与 30 天内观察到的并发症进行比较。
该注册信息还包括一项人类-AI 协作评估,涉及 120 名随机选取的患者和 10 名外科医生。该部分可检验阅片研究中的获益是否能在新收集的人群中重现。
不过,观察性验证仍无法证明模型指导的干预能够改善结局。它可以在前瞻性数据收集条件下确认区分能力、校准度和协作表现。
更有力的检验方式,是将符合条件的患者或临床团队分配至模型指导医疗或常规医疗。随后测量并发症、延误、重症监护使用、误报以及长期结局。
这类试验需要为每个风险类别预先定义应对措施。否则,临床医生即使收到相同评分,也可能在不同医院采取不同做法。
方案还需要防范自动化偏见。外科医生应理解建议背后的证据,并保留解释建议的责任。
在美国,监管分类将取决于系统的预期用途,以及临床医生如何审查其推理过程。FDA 的 software guidance 区分了某些非器械支持功能与受医疗器械监管的软件。
影响时间敏感型医疗的患者特异性风险评分,可能引发重要的监管问题。在中国以外部署,也需要进行本地隐私、安全和医疗器械分析。
Google News 报道中没有证据表明 DeepComp 已获得 FDA 授权、在北美得到常规部署或获得报销。读者应将 DeepComp 视为一个正在验证中的、有前景的研究模型。
同样的克制也适用于生存输出。预测总生存期并不授权该模型推荐手术、化疗、免疫治疗或姑息治疗。
DeepComp 可以提供一项估计。它不能取代病理诊断、分期、多学科评审,或与患者进行充分知情的沟通。
下一批 DeepComp 证据必须证明什么
三个信号将决定 DeepComp 是否具有临床实用性:前瞻性校准、可量化的决策获益,以及在原始卫生系统之外的验证。
第一个信号是完整的前瞻性多中心结果。研究人员应报告多少入组患者可评估、输入缺失的频率,以及模型是否在验证前已锁定。
锁定模型很重要,因为在新数据上反复调整可能模糊验证与额外训练之间的界限。最终报告应明确所测试的确切版本。
结果不应只包括 AUC。校准曲线、敏感性、特异性、预测值、决策曲线,以及在实际运营阈值下的性能,都必不可少。
亚组结果同样重要。应按年龄、性别、癌症分期、治疗类型、医院、扫描方案以及相关身体成分指标评估性能。
该前瞻性注册信息此前列出的预计完成日期为 2026 年 5 月,而其公开状态在 4 月更新时仍为招募中。未来发表的论文应说明实际入组和随访日期。
第二个信号是干预性研究。研究人员需要证明,使用该评分能够改变医疗决策,并且相较适当对照减少并发症。
这项试验应检验一条明确的临床路径,而非泛泛建议“使用 AI”。高风险分类必须对应具体且具有临床依据的行动。
例如,方案可以规定患者何时接受营养评估、强化监护或手术复核。还应记录这些行动所带来的伤害。
相关伤害包括延迟手术、不必要的重症监护使用、额外影像检查、焦虑,以及未改善结局的治疗改变。
模型指导的路径理想情况下应改善以患者为中心的终点,包括并发症严重程度、恢复情况、治疗完成率、医院资源使用、生活质量和生存。
第三个信号是在不同国家和卫生系统中进行外部验证。DeepComp 必须证明,其校准度能够迁移至已发表分析所使用的 11 家中国中心之外。
北美测试应从本地静默验证开始。模型将在不影响治疗的情况下生成评分,研究人员再将预测与实际结局进行比较。
如果性能仍可接受,随后可开展受监测的临床评估。医院需要针对人工覆盖、软件更新、数据漂移和不良事件审查建立治理机制。
AI 手术风险预测还需要持续监测。当新的围手术期方案成为标准时,患者群体和治疗路径都会发生变化。
扫描仪升级和影像方案改变可能影响模型输入。在开发期间表现良好的模型,可能在没有明显软件故障的情况下性能下降。
因此,临床团队需要版本控制和漂移监测。他们应了解系统何时重新训练、支持变更的是哪类人群,以及是否重新进行了本地校准。
Google News 的曝光将帮助 DeepComp 吸引关注,但关注不等于采用。医疗 AI 通过前瞻性证据、透明的局限性和可重复的获益赢得信任。
该研究已经跨越了若干重要门槛。它使用了数千名患者、外部队列、多种治疗场景、一项外科医生阅片研究,以及可访问的研究代码。
但它尚未跨越最后一道门槛。目前还没有随机化证据表明,DeepComp 指导的医疗比审慎的常规实践更能预防并发症。
这一缺口应塑造临床医生、患者和技术团队对标题的理解方式。该模型既不是空洞的演示,也不是完成的医疗产品。
它是一个严肃的候选方案,用于检验一项有用的临床命题:常规扫描或许包含足够的综合信息,能够在进入手术室前揭示手术脆弱性。
后续报告应揭示医院能否将这些信息转化为更安全的决策。它们还必须说明模型出错时会发生什么。
对于通过 Google News 关注这一报道的读者来说,核心问题如今是实际的:前瞻性团队能否重现 DeepComp 的准确性,并在不过度增加警报、延误或资源使用的前提下改善医疗?
在这些结果出炉前,负责任的结论应保持克制。DeepComp 已为更好的术前风险分层提供了令人信服的证据,但其所宣称的治疗获益仍是一项需要临床试验检验的假设。



