AI 模型通过常规非增强 CT 扫描检测结直肠癌
COCA 在连续入组患者中的结直肠癌检测灵敏度最高达到 88.2%,且使用的是常规非增强 CT 扫描,因此登上了 Google News。这一发现挑战了放射学领域长期存在的一项局限:这类扫描十分常见,但临床医生此前并不认为它们是可靠的结直肠癌筛查工具。
该模型并不取代结肠镜检查,也不会新增一次影像检查预约。相反,它分析的是已为体检、急诊、门诊就诊和住院治疗采集的扫描数据。这使得该研究的重点不只是另一种诊断算法,而是从现有数据中提取被忽视的临床价值。
因此,核心差异十分明确。传统筛查要求符合条件的人完成一项专门检测;COCA 则代表机会性筛查,即在一项原本用于其他目的的既有检查中寻找疾病线索。
研究人员报告称,该模型在多家机构和多种临床场景下取得了较强的回顾性结果。不过,该模型尚未证明其预警在前瞻性临床实践中能够改善患者结局。监管审查、工作流整合、随访能力以及假阳性管理等问题仍未解决。
Google News 的关注源于一项大型多中心研究
关键变化并不只是 AI 识别出了癌症,而是它在未针对结直肠筛查进行准备的常规扫描中发现了癌症。
该研究于 2026 年 4 月 21 日在线发表于 Annals of Oncology,先于该期刊 8 月刊正式发表。作者包括来自中国和捷克共和国医院的研究人员,以及隶属于 Alibaba DAMO Academy 和 Hupan Laboratory 的科学家。
研究人员将该系统命名为 COCA,即 Colorectal Cancer detection with AI 的缩写。他们利用两个中心的 1,321 名结直肠癌患者和 1,357 名正常对照者的扫描数据开发了该系统。
这些检查均为非增强 CT,即临床医生未注射碘基造影剂来提高组织和血管的可区分性。肠道也未像 CT 结肠成像那样进行准备。
这一开发设计至关重要,因为在这类图像中,结直肠肿瘤可能难以与邻近组织区分。肠内容物、塌陷的肠段以及有限的软组织对比度,都可能掩盖异常。
COCA 首先定位结直肠区域,随后评估其中是否存在癌症。该模型结合病灶分割与患者级分类:前者标记疑似组织,后者估计扫描中是否存在结直肠癌。
其混合监督训练策略采用了不同层级的标注数据。一个中心同时提供患者标签和人工勾画的肿瘤区域;另一中心则提供患者标签,但没有同等完整的体素级标记。
这种方法使系统能够从更多扫描中学习,而无需放射科医生逐一以三维方式勾画每个肿瘤。此类勾画会占用大量专科时间,也常常限制医学影像数据集的规模。
研究人员在两个开发中心之外对 COCA 进行了测试。他们的多中心研究纳入了来自多家机构的外部腹部、盆腔和胸部 CT 数据集。
在六个中心的 2,053 名患者验证中,报告的受试者工作特征曲线下面积介于 0.967 至 0.996 之间。这一指标概括了模型在不同阈值下区分阳性和阴性病例的能力。
研究人员还开展了一项包含 10 名放射科医生的阅片研究。参与者涵盖具有三至四年经验的住院医师,以及拥有 13 至 21 年经验的专科医生。
每名放射科医生先在无辅助条件下阅览 299 个病例,随后在至少四周的洗脱期后,结合 COCA 再次阅片。研究称,该模型的辅助使阅片者灵敏度提高了 20.4%,特异度提高了 5.4%。
灵敏度衡量系统识别患病患者的频率。特异度衡量系统正确排除未患病患者的频率。
Google News 的报道还强调了另一项操作细节。据称,COCA 可在约 30 秒内处理完整 CT 容积数据,使其在放射科工作流中进行自动后台分析在技术上具备可行性。
这些结果确立了可信的研究信号,但并未证明这是一项成熟的筛查服务,因为回顾性表现只是临床采用的第一步。
常规扫描开辟机会性筛查路径
COCA 将筛查问题从患者是否会预约另一项检查,转向医院能否负责任地复用其已拥有的扫描数据。
当前结直肠癌筛查依赖专门的操作或样本。结肠镜检查直接观察肠道,而粪便检测则寻找与癌症相关的血液或分子标志物。
CT 结肠成像同样可以对结肠进行成像,但需要肠道准备和结肠充气。常规非增强 CT 不具备这些条件,通常也是为回答其他临床问题而开具。
这种差异构成了 COCA 的战略价值。一名因腹痛进入急诊科的患者,可能会接受 CT 扫描,以排查肾结石、炎症或其他疑似疾病。
放射科医生必须优先处理促使此次检查开展的临床问题。未经准备的结肠可能获得较少关注,尤其是在可见异常较小或不明显时。
COCA 可以在后台检查同一份扫描。随后,它可将放射科医生的注意力引向可疑的结直肠区域,而非独立给出最终诊断。
这就是机会性筛查:利用现有临床数据,在无需安排单独筛查就诊的情况下寻找额外疾病。类似方法已用于通过常规图像评估骨质疏松、心血管风险和身体成分。
这一路径旨在解决持续存在的参与率问题。2026 年筛查指南建议,平均风险成年人从 45 岁开始接受筛查。
该指南建议,在预期寿命超过 10 年的情况下持续筛查至 75 岁。76 至 85 岁的成年人应与其医疗服务提供者共同作出个体化决定。
可视化检查和粪便检测仍是首选方案。非结肠镜检查的阳性结果应及时接受结肠镜随访。
从概念上说,这一最后要求同样适用于 COCA。一项被标记的扫描本身不能确认癌症;它会构成进行专家复核,以及在适当情况下开展诊断性结肠镜或其他针对性检查的理由。
因此,该模型所应对的是筛查未参与问题,而非挑战结肠镜的诊断权威性。对它而言,最有价值的患者是那些癌症在扫描中偶然显现、却可能原本未被察觉的人。
这一区别也避免了围绕 Google News 标题的常见误解。患者不应仅为获得 COCA 分析而要求进行医学上不必要的 CT 扫描。
CT 使用电离辐射,而该模型尚未被证明可作为让原本未筛查者接受辐射暴露的理由。其拟议优势来自复用那些已有临床正当性的扫描。
这种方法也可能覆盖标准筛查模式之外的人群。一些接受急诊或住院影像检查的患者尚未完成建议的结直肠筛查。
另一些人年龄低于传统筛查人群,或因障碍而延迟计划中的检查。自动化审查层可以在无需等待这些障碍消除的情况下,标记可见的癌症。
医院无需更换扫描仪或采集第二幅图像即可获得这一机会。然而,它们仍需要软件整合、放射科医生监督、转诊流程以及随访检查能力。
这种运营负担带来了主要矛盾。丰富的影像数据来源能够创造更多筛查机会,但每一项算法预警都会带来临床责任。
COCA 的机制瞄准放射科医生容易遗漏的部分
COCA 将解剖定位与癌症分类相结合,使其任务比通用图像识别系统更聚焦,也更具可解释性。
原始 CT 容积数据包含许多器官、组织及潜在异常。在每个体素中搜索相对少见的结直肠肿瘤,会使模型面临大量视觉噪声。
COCA 分两阶段应对这一挑战。首先,U-Net 分割网络识别结直肠区域,从而缩小诊断组件需要评估的范围。
U-Net 是一种编码器—解码器架构:它将图像压缩为学习得到的特征,随后重建空间细节。跳跃连接使网络在处理扫描时保留位置信息。
第二阶段将肿瘤分割与全患者分类相结合。多尺度图像特征被汇聚为一种表征,用于估计是否存在结直肠癌。
模型在生成最终评估时也会使用疑似肿瘤体积。这种设计能够向放射科医生展示系统发现疑点的位置,而不只是返回一个无法解释的风险评分。
这种位置信息对临床复核十分重要。被高亮的肠段可让阅片者将预警与肠壁增厚、狭窄、周围组织变化或其他可见征象进行比较。
研究报告称,COCA 在乙状结肠和直肠中的表现尤其出色。这些部位占结直肠癌相当大比例,但在常规 CT 上可能难以评估。
开发人员还在训练批次中增加了较小肿瘤的比例。这一步旨在应对图像分类器更容易从大型、视觉上明显的病灶中学习的自然倾向。
内部结果仍显示出剩余的困难。对于小于三厘米的肿瘤,基于该亚组中的 78 个肿瘤,灵敏度为 82.4%。
对于 I 期疾病,在 30 个病例中,灵敏度为 76.7%。在 99 个 II 期病例中,灵敏度达到 96%。
这些亚组样本量远小于完整验证人群。因此,其置信区间更宽,不应将结果视为对每家医院的精确估计。
该模型的结直肠癌分割 Dice 评分为 0.558。Dice 评分衡量模型标记区域与参考标注之间的空间重叠程度。
这一结果有用但并不完美。系统可以在未精确描绘每一条肿瘤边界的情况下正确分类扫描,这解释了为何检测表现可能优于分割准确度。
研究人员还在一个地点比较了配对的非增强扫描与静脉期增强扫描。报告的 AUC 值分别为 0.979 和 0.980。
这一接近的结果支持了所提出的机制。即使常规视觉对比度有限,COCA 似乎仍能够提取相关模式。
加入包括年龄、性别和家族史在内的 10 项临床风险因素,并未显著改善基础模型。报告中的表现主要由图像信号驱动。
早前发表的一项常规 CT 模型采用基于 Transformer 的检测网络,在未进行肠道准备的增强检查中进行分析。该系统聚焦于常规腹盆腔影像中 CT 可见的结直肠癌。
这一比较显示的并非单一、孤立的实验,而是一条正在形成的研究路径。研究人员正测试软件能否将通用 CT 存档转化为辅助癌症检测渠道。
COCA 将这一路径扩展至非增强扫描,以及胸部检查中的局部视野。因此,其机制具有意义,但其临床价值仍取决于连续真实患者的研究结果。
强劲的真实世界数据仍难消除临床风险
连续队列增强了 COCA 的说服力,但也揭示了亮眼准确率与可靠筛查项目之间的差距。
研究人员在两个真实世界队列的 27,433 名连续患者中评估了两个版本的模型。这些患者来自体检、急诊科、门诊和住院服务。
第一个队列包含 9,014 名患者。COCA 的敏感性为 88.2%,特异性为 99.5%。
第二个外部队列包含 18,419 名患者。经迭代改进的版本达到 86.6% 的敏感性、99.8% 的特异性,以及 63.4% 的阳性预测值。
阳性预测值回答了一个实际问题:在被模型标记的人群中,有多少人实际患有结直肠癌。
对于机会性检测而言,63.4% 的数值相当可观,但这也意味着部分阳性警报并不代表癌症。这些警报仍需要复核,并可能需要进一步检查。
研究人员报告称,一些假阳性涉及可能值得临床关注的非恶性异常。这可能有帮助,但也可能扩大模型的预期作用范围。
用于检测结直肠癌的系统需要针对偶发非癌症发现制定明确政策。否则,医院可能面临职责不清、转诊不一致,以及可避免的患者焦虑。
假阴性同样重要。86.6% 的敏感性意味着,该模型在该队列中漏检了一部分癌症。
患者和临床医生不能安全地将 COCA 阴性结果解读为不存在癌症的证明。与专门的筛查方法相比,常规 CT 对癌前息肉的检出能力仍然较弱。
据报道,该模型识别出 5 例最初被临床医生漏诊的癌症。其中一名急诊患者一年后再次接受扫描,但肿瘤直到首次检查两年后才被诊断出来。
这一病例清楚展示了其前景。但它同样来自回顾性审查,在这种情况下,研究人员已知哪些患者最终获得诊断。
前瞻性部署会改变问题本身。警报会在繁忙工作负荷、不完整病历、相互竞争的急症和有限随访能力的环境中出现。
放射科医生必须判断被标记区域是否确实可疑。转诊临床医生则必须接收结果、向患者解释,并安排确认检查。
医院还必须确定算法运行速度,以及它是否会延迟影像可用性。他们还需要为系统中断、软件更新、性能监测和解剖范围有限的病例制定计划。
人群差异也带来另一项不确定性。开发数据主要来自中国医疗中心,国际测试则纳入了一家捷克机构。
这比单中心验证的设计更有力,但仍无法保证其在北美人群、扫描设备、影像协议或转诊模式中具有完全一致的表现。
疾病患病率也会改变阳性预测值。模型即便维持相同的敏感性和特异性,在另一临床人群中产生的有效警报比例也可能不同。
阅片者实验也存在局限性。放射科医生在两次会话中审阅了同一批筛选病例,而且他们知道任务聚焦于结直肠癌。
日常实践的范围更广、可预测性更低。阅片者需要在回应每位患者即时临床问题的同时,寻找多种疾病。
已发表的报告描述了计划开展的前瞻性工作,其中包括与影像归档和通信系统(通常称为 PACS)的整合。
下一阶段至关重要。它必须证明,该模型能否在不造成不可接受的后续伤害的前提下,改变报告、确诊、治疗时机和患者结局。
监管与工作流程将决定 COCA 能否规模化应用
COCA 的下一项考验不是又一次回顾性准确率基准测试,而是在真实临床路径中的受控部署。
研究人员表示,在获得监管许可后,该系统可通过本地 Docker 安装或安全云端访问运行。这两种选择都会给医院带来实际问题。
本地安装可将影像数据保留在机构基础设施内,但也需要进行硬件规划、软件维护、网络安全控制,并确保与影像系统的可靠连接。
云端处理可简化集中更新。不过,医疗系统必须评估数据传输、隐私、延迟、服务可用性和合同责任。
两种路径都无法自动解决警报治理问题。医院必须决定由谁查看警报、由谁负责最终解读,以及结果如何进入病历。
系统开发者为机会性筛查选择了高特异性的运行点。这一决定反映出,在大量扫描中假警报的代价。
即使假阳性率很低,当软件分析数千项检查时,也可能产生大量工作。患者进入诊断路径前,放射科医生必须复核每一个被标记病例。
改变阈值会带来熟悉的权衡。更高的敏感性会发现更多癌症,但通常也会产生更多假阳性;更高的特异性可减少不必要的警报,但会让更多癌症未被察觉。
在模型开发期间,第二种配置将敏感性优先提高到 95% 以上。该研究针对平均风险人群和进展期癌前病变探索了这一版本。
这两种配置不应被混合成一个标题数字。它们各自服务于不同的临床目标,并在漏诊疾病与随访负担之间形成不同平衡。
北美的采用还需要经过适用的监管流程。FDA 设备清单列出了获准在美国上市的 AI 赋能产品。
该机构表示,列入清单的设备已针对其预期用途满足适用的上市前要求。研究设计、安全性、有效性和技术特征都会影响这一审查。
仅凭发表论文并不意味着获得此类授权。COCA 的开发者需要明确其预期用户、患者群体、输入、输出以及在临床决策中的角色。
监管机构和医院还需要了解模型如何随时间变化。论文描述了用于生成 COCA Plus 的困难样本挖掘和持续学习。
持续学习是指在模型原始训练完成后,利用额外数据改进模型。在医疗应用中,未经控制的变化可能削弱支持获批版本的证据。
因此,部署计划需要版本控制和验证边界。医院必须知道,一次更新是否会改变特定扫描设备上的敏感性、特异性、校准度或性能。
安装后不能停止监测。团队需要评估性能漂移、警报接受率、漏诊癌症、假阳性转诊,以及不同人口群体之间的差异。
临床整合在患者沟通中同样需要克制。COCA 标记表明既有影像上存在可疑信号,而非确诊结果。
既有筛查框架仍然适用。筛查建议包括粪便检测、结肠镜检查、柔性乙状结肠镜检查和 CT 结肠成像,适用于符合条件的成年人。
搭载 COCA 的常规非增强 CT 目前并未被列为等效筛查策略。将其如此呈现会夸大证据,并可能削弱人们接受已被验证筛查方式的意愿。
短期内更站得住脚的角色是二次审查。COCA 可以将注意力引向已经存在的扫描,同时让标准筛查和诊断路径保留主导地位。
三项信号将检验这一标题能否成立
前瞻性结局、监管状态和随访表现将决定 COCA 是成为临床基础设施,还是仍停留在前景可期的研究成果。
第一项信号是前瞻性 PACS 整合。研究人员计划在符合条件的常规 CT 扫描上自动运行模型,并将被标记病例发送给放射科医生。
一项有价值的试验应报告的不只是敏感性和特异性。它还应衡量放射科医生接受警报的频率、患者获得确认的速度,以及诊断是否更早发生。
试验还应揭示运营成本。警报量、额外阅片时间、结肠镜转诊、患者联系失败和不必要程序,都会影响真实的临床价值。
强劲的前瞻性结果将支持该研究的核心主张。即便底层模型仍保持较高的回顾性准确率,若后续执行不佳,这一主张也会被削弱。
第二项信号是明确界定的监管申报或授权。这一过程将迫使开发者精确说明临床医生应如何使用 COCA。
用于分诊的授权不同于用于筛查或独立诊断的授权。预期用途决定了医院和患者应期待何种证据。
监管材料还可能披露模型在不同亚组、扫描设备、机构和临床环境中的表现。这些细节将帮助北美医疗服务提供者评估证据是否与其人群相匹配。
在此之前,Google News 的可见度不应与监管就绪度混为一谈。公开标题描述的是一项研究,而不是可获得的标准治疗。
第三项信号是后续确认的质量。医院必须展示警报到达临床医生后会发生什么。
最有意义的指标并不只是 COCA 标记了多少扫描,而是有多少患者完成恰当随访,并在不过度伤害的情况下获得正确诊断。
当患病率变化时,阳性预测值应保持稳定。假阳性不应压垮放射科团队或结肠镜服务。
研究人员还应追踪间期癌,即在阴性结果之后、下一次预期筛查机会之前诊断出的癌症。这一指标可揭示具有临床重要性的漏诊。
公平性也应在同一评估中得到关注。机会性筛查只能覆盖那些已经接受 CT 检查的人,而影像检查的可及性并不均等。
这种方法或可帮助错过常规筛查、但接受急诊或住院影像检查的患者;它也可能更偏向于更容易获得先进医院医疗服务的人群。
COCA 最有力的理念是数据再利用。因一种原因采集的常规扫描,可能包含第二个具有临床重要性的信号。
其最有力的证据是在 27,433 名患者中开展的连续真实世界测试。报告的 86.6% 至 88.2% 敏感性表明,这一信号并不局限于经过精心平衡的实验室数据集。
其最大的弱点在于,从发现异常到改善医疗照护之间仍存在差距。每一个有价值的提示都需要专家确认、与患者充分沟通,以及一条有效的诊断路径。
通过 Google News 持续关注此事的读者,应依次留意这三个信号:前瞻性工作流程结果、监管层面的明确性,以及已完成的随访结果。
如果这三项都得到验证,常规非增强 CT 或可成为结直肠癌的一道重要辅助安全网。在此之前,患者仍应继续接受建议的筛查,并与临床医生讨论适合自己的选择。



