LAA MEA 推进 AI 支持的肺癌筛查
- Martin Chen

- 1天前
- 讀畢需時 15 分鐘
尽管基础设施、证据和可及性仍存在重大缺口,LAA MEA 正在推进一项区域筛查议程,将人工智能与低剂量 CT 结合使用。
近期一条 Google News 结果聚焦于 Lung Ambition Alliance Middle East and Africa Chapter 倡导利用 AI 支持更早发现肺癌。其背后的进展,比又一则医疗 AI 公告更具意义。LAA MEA 希望建立国家级筛查项目,利用软件识别风险、审阅扫描结果并管理随访。
这一提议面对的是严峻的区域现实。肺癌筛查本就需要扫描设备、受训阅片人员、转诊路径、组织学诊断和治疗能力。算法可以改善这条链路中的部分环节,但无法凭一己之力建立整条链路。
这种矛盾定义了中东和非洲医疗 AI 的下一阶段。核心竞争并非 AI 与放射科医生之间的对立,而是 AI 辅助筛查与支离破碎的医疗体系之间的较量;后者往往在肺癌已更难实施根治性治疗后才作出诊断。
LAA MEA 正将 AI 转化为筛查政策议题
眼下的变化在于,AI 已从实验性的影像工具,进入区域层面对有组织肺癌筛查的讨论。
LAA MEA 代表着来自多个国家的专业人士,这些国家的医疗体系、癌症负担和技术资源差异显著。其近期政策工作呼吁建立以证据、公众教育和协调临床路径为基础的国家级筛查项目。
该组织的筛查政策简报将软件和 AI 平台列为有助于扩大并加快这些项目推进的工具。这一表述很重要:它将 AI 置于更广泛的医疗服务之中,而非将其包装成独立的诊断解决方案。
有组织的项目首先要界定哪些人应接受筛查,随后还需要一套流程,用于邀请符合条件的人群、进行扫描、解读结果,以及在必要时召回患者。
低剂量计算机断层扫描,即 LDCT,能在使用比常规诊断性 CT 检查更低辐射剂量的情况下生成详细的胸部影像。它可以在症状出现前识别微小肺结节。
AI 软件可分析这些影像,并为放射科医生标记可疑区域。更先进的系统还能测量结节、比较不同时期的扫描结果、估计恶性风险,并协助确定病例优先级。
这些功能针对的是真实存在的工作流问题。一项 CT 检查包含大量影像切片,而小病灶可能难以与血管、瘢痕或良性结节区分开来。当不同临床医生复核后续检查时,保持一致的测量也颇具挑战。
这项技术并不能判定一个人是否患癌。被标记的结节仍可能需要影像对比、专科评估、正电子发射断层扫描、活检或手术。
因此,LAA MEA 的立场既关乎运营能力,也关乎诊断准确性。只有当医疗体系能够将患者从发现异常顺利转入确诊治疗时,筛查才能产生价值。
这一差别在信息聚合中可能被忽略。关于 AI 和更早检测的 Google News 标题,可能暗示算法可以直接发现原本不可见的癌症。实际模式则涉及多项相互衔接的决策,AI 仅支持其中的一部分。
该区域提案还建立在此前专家工作的基础上。一份MEA 共识声明汇集了来自沙特阿拉伯、阿拉伯联合酋长国、南非、埃及、黎巴嫩、约旦和土耳其的十位专家。
该专家组于 2022 年 10 月召开会议,研究筛查指南、实施障碍以及 AI 的潜在作用。其建议强调应制定符合当地情况的纳入标准、多学科诊疗、数据收集和受控实施。
这段历程表明,最新受到的关注并非一次突然的技术发布,而是推动肺癌筛查成为国家政策议题这一长期努力面向公众的阶段。
如今的问题是,各国政府是否会将这一共识转化为有资金支持的项目。若没有明确的目标人群、临床方案和结果评估,AI 仍只会是单家医院的孤立采购,而非筛查战略。
更早检测很重要,但筛查也会带来额外工作量
AI 之所以重要,是因为 LDCT 筛查能够降低死亡率;但每个成功的筛查项目也会产生大量不确定性发现。
LDCT 的证据构成了临床基础。美国 National Lung Screening Trial 在 33 家医疗中心招募了 53,454 名肺癌高风险人群。
参与者连续三年每年接受一次 LDCT 或胸部 X 光检查。试验结果显示,LDCT 组的肺癌死亡风险低 15% 至 20%。
这一结果相当于在约七年期间,每 1,000 名参与者中少发生约三例肺癌死亡。它确立了筛查能够影响死亡率,而不仅仅是发现更多肿瘤。
不过,这项试验也揭示了这种获益背后的工作量。在三轮筛查中,24.2% 的 LDCT 检查被归类为阳性。
大多数阳性发现最终并非癌症。这些结果会导致重复影像检查、临床复核,有时还会进行侵入性操作。
这正是 AI 可以发挥作用的地方。检测模型可通过标示可能的结节充当第二阅片者。分类模型则可估计某个已选定结节更接近恶性还是良性样本。
追踪系统也能比较同一病灶在不同检查中的变化。与孤立的一次测量相比,生长情况往往具有更重要的临床意义。
这些工具针对的是不同的失效环节。检测软件解决漏诊结节问题;风险模型解决发现结节后的不确定性;工作流软件则处理随访延迟问题。
将这些功能统称为“AI”可能会混淆采购决策。一家医院可能购入检测产品,而其更大的问题其实在于患者召回或专科资源不足。
这种区分在中东和非洲尤为重要。该地区并非一个统一的医疗市场。
一些海湾国家的医疗体系拥有先进的影像网络和不断发展的数字健康项目。其他国家则面临扫描设备可及性有限、专科医生短缺,以及基层医疗与肿瘤服务之间衔接薄弱等问题。
即使在同一个国家,城市癌症中心与农村医疗机构之间也可能存在显著差异。在一家旗舰医院部署 AI 系统,并不能说明更广泛人群同样能够获得服务。
癌症负担数据凸显了紧迫性。International Agency for Research on Cancer 估计,2022 年全球约有 250 万例新增肺癌病例。
肺癌还造成约 180 万人死亡,是全球癌症死亡的首要原因。全球癌症估计数据反映出发病率和诊断能力存在显著地域差异。
针对非洲,现有的 2022 年估计数据显示,约有 49,800 例新增肺癌病例和 45,500 例死亡。这些数字不应被视为对疾病负担的完整衡量。
多个国家的癌症登记仍不均衡。漏诊和报告不完整,可能让较低的记录发病率看起来像是风险较低。
吸烟暴露也因国家、年龄和性别而异。职业危害和空气污染增加了复杂性,基于外国人群制定的筛查规则未必能够捕捉这些因素。
只有在具备合适数据时,AI 才能处理这些因素。它无法仅凭不完整的登记数据和记录不佳的暴露史推导出可靠的本地风险模型。
因此,压力落在卫生部门、筛查规划者、放射科和供应商身上。他们必须证明,一条 AI 支持的路径能够覆盖符合条件的人群,同时不会压垮诊断服务。
有利的准确性评分只是起点。真正有意义的结果,是让更多癌症获得及时诊断和有效治疗,同时减少可避免的操作。
AI 如何在不取代临床医生的情况下支持肺癌检测
AI 最可信的作用,比自主诊断更有限,但又不止于在结节周围画框。
AI 支持的路径可在扫描前启动。风险模型可以结合年龄、吸烟史、职业暴露、呼吸系统疾病和其他临床变量。
这一过程有助于识别应接受 LDCT 的人群。它也暴露出一项重大政策问题,因为不同国家需要不同的纳入标准。
在获取影像后,计算机辅助检测软件会分析 CT 容积数据。它会为影像区域赋予概率,并向阅片者呈现可能的结节。
放射科医生决定每一处标记是否代表真实发现。人工复核仍不可或缺,因为正常解剖结构、炎症、感染和瘢痕都可能看起来像结节。
一旦病灶被确认,分割软件会勾勒其边界。分割是指将疑似病灶与周围组织分离,以便测量其大小和形状。
一致的测量十分重要,因为微小差异就可能改变随访建议。人工测量在不同阅片者之间或不同就诊时间点之间可能存在差异。
随后,风险模型可以评估大小、位置、边缘、密度和生长情况等影像特征。有些模型还会加入人口统计学或临床变量。
输出通常是一个评分,而不是诊断。临床医生会结合指南、既往影像、症状和患者偏好来解读该评分。
美国 Food and Drug Administration 的设备数据库说明了这种分工。数据库中包含用于肺结节检测、测量和风险评估的 AI 支持放射学产品。
在一个市场获得监管授权,并不能证明其适用于整个中东和非洲地区。但这确实表明了监管机构如何界定软件的预期用途及其限制。
一些产品通过检测潜在结节来协助放射科医生。另一些产品则分析已由临床医生选定的结节。这是不同的临床主张。
这种差异会影响评估方式。检测工具需要关于敏感性、误标记和阅片者表现的证据。恶性风险模型则需要证明其风险估计在不同人群中仍保持校准。
集成又增加了一层复杂性。软件必须能与影像归档和通信系统、放射科工作站及电子病历交换影像和结果。
若警报出现在常规工作站之外,可能拖慢阅片速度。若测量结果无法直接流入报告,也可能引入人工抄录错误。
AI 还可以在解读后协助管理项目。软件能够创建随访列表、识别逾期扫描,并将高风险病例转交给多学科团队。
这些行政职能获得的关注少于图像分析。但在患者经常在转诊环节之间失联的系统中,它们可能创造更大的价值。
设想一个小结节,数月后需要再次扫描。只有当患者完成该检查、新图像得到正确比较,并且有意义的增长触发后续行动时,检测才算成功。
除非模型连接到受管理的召回系统,否则它无法联系患者。它也无法确保交通安排、转诊授权或活检能力。
这一机制解释了故事中的主要对手。AI 辅助筛查竞争的对象不是临床判断,而是医疗服务的碎片化。
最强的实施方案将利用自动化,让人类职责更加清晰可见。当一项发现需要随访时,它们会明确责任归属,并记录下一步行动是否发生。
最弱的实施方案则止步于带标注的图像。这样的方案或许能呈现令人印象深刻的演示,却无法改变患者的就医路径。
Google News 的报道可以提升公众对这项技术的认知,但公众关注应覆盖完整的服务路径。关键问题不在于 AI 是否发现了一个异常点。
关键问题在于,该系统是否帮助符合条件的人获得准确、及时且公平的医疗服务。
证据缺口在于本地验证,而非算法可用性
最大的未知数是:在其他地区训练的模型,能否在本地人群、扫描设备和临床环境中可靠运行。
医学影像 AI 从示例中学习统计模式。当部署数据与开发期间使用的信息存在差异时,其性能可能下降。
这种差异可能涉及扫描仪制造商、图像重建设置、层厚、疾病患病率或转诊模式,也可能涉及患者年龄、祖源、吸烟暴露和合并肺部疾病。
结核病及其他感染尤其构成重要挑战。既往感染可能留下与可疑病灶相似的肺部改变,或使自动测量变得复杂。
主要在北美筛查队列中评估的模型,可能会在非洲或中东医院遇到不同类型的检查发现。由此产生的错误模式可能与其公布的基准结果不一致。
这并不意味着软件一定会失效,而是意味着在区域部署之前及部署期间必须测试其性能。
验证不应只报告总体准确率。筛查项目需要敏感性、特异性、假阳性率、假阴性率,以及在相关患者群体中的表现。
它们还需要校准能力。经过良好校准的模型给出的风险,应与实际观察到的结果大致相符。
如果十名患者获得接近 20% 的预测风险,那么在校准良好的环境中,其中大约两人应患有目标疾病。模型可以正确排序病例,却给出误导性的绝对风险。
前瞻性评估比测试回顾性影像档案提供更强的证据。前瞻性研究能够显示临床医生如何使用软件,以及它是否改变日常实践中的决策。
这些研究应将 AI 辅助阅片与现行标准进行比较,还应衡量后续操作、延迟诊断、间期癌和治疗分期。
更短的阅片时间可以帮助繁忙的科室,但不能替代患者结局。发现更多结节,也并不自动意味着发现更多具有临床重要性的癌症。
过度诊断仍是筛查中的一个担忧。当筛查发现一种在患者一生中本不会导致症状或死亡的癌症时,就会发生过度诊断。
美国国家癌症研究所估计,在 NLST 中通过 LDCT 检出的肺癌中,略高于 18% 看起来进展缓慢。AI 可能通过更好的风险评估减少不必要的随访,也可能因发现更多边缘性病灶而增加随访。
虚假的安心感则带来相反的风险。当其他证据提示需要关注时,临床医生可能对较低的算法评分赋予过多权重。
这种行为被称为自动化偏见,即用户接受系统输出,并忽略原本可能会质疑的信息。
世界卫生组织的 AI 治理指南 呼吁透明度、问责制、包容性、人类监督和持续评估。这些原则直接适用于肺癌筛查。
医院需要知道模型是在何种人群上训练、测试了哪些扫描仪,以及更新如何影响性能。临床医生还需要有报告故障的流程。
患者需要清楚了解其影像和临床数据如何被使用。跨境云端处理还可能引发有关同意、存储、网络安全和法律控制的额外问题。
当医院缺乏经过整理的数据集时,本地验证可能变得困难。创建这些数据集需要可靠的诊断结果、一致的标签、安全的基础设施和专科人员的时间。
区域协作可以减少重复工作。多个中心可以建立共享的评估协议,同时在适当的治理下保留患者数据。
联邦学习提供了一种可能的方法。它可在机构之间训练共享模型,而无需将所有原始数据转移到一个中央存储库。
然而,联邦学习无法解决标签不一致或临床记录薄弱的问题,也会引入自身的技术和治理要求。
因此,政策决策应区分三项主张。第一,AI 可以辅助明确界定的筛查任务。第二,某一特定产品在本地环境中表现良好。第三,完整项目能够改善健康结局。
支持第一项主张的证据,并不能自动证明后两项。当地项目若能公布这三个层面的结果,LAA MEA 的议程将更具可信度。
可及性与随访将决定 AI 是否缩小不平等
只有当各国为其周边的扫描、人员、转诊和治疗提供资金时,AI 才能支持更早发现。
筛查始于接触没有症状的人群。这需要外展、资格评估和公众信任。
以医院为基础的服务可能会遗漏很少使用正规医疗服务的人。吸烟污名也可能阻碍参与或坦诚披露。
仅基于吸烟史的资格规则可能排除存在其他相关暴露的人群。然而,在证据不足的情况下扩大资格范围,可能提高成本并增加假阳性发现。
一旦有人符合资格,距离就成为现实障碍。许多医疗系统中的 LDCT 扫描仪集中在大城市。
流动服务和区域转诊网络可以扩大可及性,但它们需要质量保证。如果临床医生和算法要随时间比较图像,图像必须符合一致的技术标准。
AI 可以帮助中心化的专科医生审阅来自多个地点的扫描结果。远程阅片可以分配专业能力,而无需在每个机构配备胸部放射科医师。
这一模式仍依赖网络连接、兼容的影像系统以及明确的临床责任。远程阅片者必须知道由谁联系患者并安排下一步。
人力资源限制也会影响技术选择。能够缩短阅片时间的工具可以帮助科室处理更多检查。
然而,在不扩充诊断能力的情况下增加扫描量,只会转移瓶颈。随后,呼吸科、病理科、外科和肿瘤科服务可能面临更长的排队时间。
当 AI 提高敏感性时,也会出现同样的问题。发现更多异常意味着更多随访工作,即使大多数病灶是良性的。
项目设计者应在启动人群筛查前对这类需求建模。他们需要估计阳性率、复查扫描量、活检能力和治疗可及性。
成本评估必须涵盖完整路径。除软件许可外,扫描仪、维护、人员、存储、外展和治疗都是成本要素。
如果医院无法获取既往图像,廉价算法的价值微乎其微。如果可疑病例要等待数月才能活检,高准确率模型的影响也十分有限。
因此,采购应将付款与运营和临床指标相连。这些指标可以包括完成随访、确诊时间、早期发现率和不必要操作率。
政府还需要为供应商失败或产品退出制定计划。如果合同终止,临床记录和结节测量结果必须仍然可用。
互操作性可以减少这种依赖。医院应要求提供可用的数据导出和文档化接口,而不是接受封闭式工作流。
公共项目还承担额外的公平义务。如果 AI 支持的筛查只在私营城市医院提供,它可能扩大早期发现方面的差距。
这种可能性挑战了对 Google News 报道的乐观解读。数字化能力往往最先到达那些本已拥有最强诊断资源的机构。
公平性应被直接衡量。项目可以按地理位置、性别、收入和相关暴露群体比较邀请、到检、完成率和结局。
目标不应是不惜一切代价实现完全相同的参与率,而应证明可避免的障碍没有系统性地排除某些社区。
AI 可以通过预约安排、风险分层和监测支持这项工作。当训练和行政数据遗漏服务不足群体时,它也可能复制既有的排斥。
政策制定者应将缺失数据视为警告,而不是中性的空白。很少进入医疗系统的群体,也很少会出现在数据集中。
社区组织可以协助设计外展和同意流程。它们的参与能够揭示为何符合资格的人拒绝筛查或未能返回。
这种反馈应与模型指标并列考量。更早发现是一项服务结局,由技术、临床实践和患者参与共同促成。
国家项目应公布这三方面的信息。否则,改进的算法评分可能掩盖可及性问题毫无变化的事实。
当 Google News 的关注消退后,应该观察什么
下一步证据必须来自获得资助的项目、经本地验证的性能,以及朝向更早分期诊断的有据可查进展。
第一个信号是政府行动。关注卫生部或国家癌症机构是否发布资格规则、实施地点、转诊标准和稳定资金安排。
在一家专科中心开展的试点可以测试工作流程。但除非规划者明确额外站点和服务不足人群如何参与,否则它无法建立全国性可及性。
最有力的公告会明确谁能接受筛查以及如何记录结局,还会指定负责质量保证的临床主管机构。
第二个信号是独立的本地验证。医院应报告特定 AI 产品在本地扫描仪、患者群体和疾病模式中的表现。
这些报告应包括假阳性和假阴性,还应描述 AI 是否改变阅片者的决策,而不只是报告独立模型性能。
多国证据将特别有价值,因为中东和非洲医疗系统差异显著。一个城市中心的结果不应被扩大为区域性结论。
监管机构可以通过明确软件更新和部署后监测的要求来强化这一流程。随着工作流程、扫描仪或患者群体发生变化,模型的行为也可能改变。
第三个信号是检测之后发生了什么。项目应追踪确诊时的分期、是否完成后续随访、从发现异常到活检所需时间、治疗启动情况,以及肺癌死亡率。
更早期的诊断是一个有用的中间指标。死亡率需要更长期的随访和谨慎解读,因为治疗可及性同样会影响生存率。
仅仅提高检出率本身并不意味着什么。它可能反映了有价值的早期诊断、更多假阳性警报,或对惰性疾病的更多检出。
对工作流程指标也应保持同样的谨慎。更快的阅片速度只有在提升安全服务能力时才有意义,但不能以漏诊癌症为代价。
决策者也需要了解负面结果。公开模型表现不佳的场景,可以避免同样的错误在多个医疗系统中重复发生。
这种报告文化将推动讨论超越宣传性主张。它将帮助医院根据临床需求,而非泛泛的 AI 品牌宣传来选择工具。
基于血液的风险模型的出现,增加了另一个值得关注的因素。2026 年 5 月,IARC 报告称,一项基于蛋白质的检测可改善对有吸烟史人群进行 LDCT 筛查时的选择。
这种方法并不能取代影像检查。它可以更精准地确定谁应接受扫描,并有望将有限的服务能力优先投向预测风险较高的人群。
未来的项目可能会结合临床风险、生物标志物、影像 AI 和结构化随访。每增加一层,都可能提高筛查针对性,但也可能增加复杂性和成本。
最强有力的区域策略将分阶段引入这些组成部分,并检验每一项新增措施是否能在真实服务条件下改善决策。
对于临床医生和卫生领导者而言,这个话题值得的不只是保存一条 Google News 链接。团队需要一种持久的方法,用于比较政策文件、验证研究、监管记录和本地结果。
结构化的 AI knowledge base 可帮助研究团队留存这些来源并追溯决策过程。它无法判断医学证据的质量,但可以减少机构记忆的碎片化。
眼下的行动很直接:询问每一项拟议的 AI 部署是否明确了目标人群、人类决策者、随访路径和本地验证计划。
如果其中任何一项缺失,该项目就还不是早期检测项目,而只是一次软件安装。
LAA MEA 已将 AI 纳入严肃的区域政策讨论。下一步是证明,这项技术能否帮助患者更早完成筛查并进入治疗。
读者应关注那些公布结果而不只是发布上线公告的项目。这些证据将表明,AI 究竟是在减少延迟诊断,还是只是在不平等的医疗服务中又增加了一层数字化工具。


