视网膜 AI 可预测全身性风险,但预测并不等于诊断
- Sophie Larsen

- 4天前
- 讀畢需時 15 分鐘
Google News 推送了一篇发表在 Cureus 的综述文章,认为人工智能能够将视网膜发现转化为眼部以外疾病的预警信号。矛盾随之而来:研究人员可以从视网膜图像中提取心血管、代谢、肾脏和神经系统信号,但大多数系统仍是风险估计工具,而非诊断工具。
这一差别至关重要,因为视网膜提供了观察血管和神经组织的罕见无创窗口。一张标准眼底照片可捕捉眼球内部表面,包括视神经盘、黄斑和视网膜血管。算法能够分析临床医生在常规检查中未必能始终一致量化的模式。
这一理念已有大量研究支持。Google 研究人员在 2018 年发表了一项重要心血管研究,而较新的系统则瞄准了卒中及更广泛的心代谢风险。然而,证据也揭示了核心张力:在经过筛选的数据集中预测某项结局,并不能证明它在日常医疗中的临床获益。
一个视网膜模型可能给出令人印象深刻的评分,却无法说明下一步应采取什么行动。它在不同相机、诊所、年龄群体和患者人群中的表现也可能不同。只有当预测改善了受筛查者的实际决策时,精准医疗才真正开始。
Google News 重新聚焦的议题
重要进展并非某一款新的诊断产品,而是越来越多证据表明,应将视网膜图像视为全身健康数据。
Google News 所聚焦的这篇 Cureus 综述汇集了一个通常被称为眼部组学的领域。眼部组学研究可测量的眼部特征与身体其他部位健康状况之间的关系。人工智能通过识别难以手工测量的复杂图像模式,拓展了这一方法。
其生物学前提可信。视网膜血管与身体其他部位的微血管具有共同特征。血管宽度、分支、迂曲度、出血或灌注的变化,可能反映血管损伤和长期代谢压力。
视网膜还包含与中枢神经系统相连的神经组织。这种关联推动了人们对其与卒中、认知衰退及其他神经系统疾病之间关系的研究。但这些关联并不意味着一张眼底照片能够直接揭示所有疾病。
深度学习提供了相应的计算机制。深度学习模型从大量带标签图像中学习统计表征,而不只是依赖预先定义的血管测量指标。在训练期间,它会调整内部参数,以减少预测结果与已知临床结局之间的误差。
一项具有里程碑意义的视网膜风险研究使用了 284,335 名患者的数据训练模型。研究人员随后在包含 12,026 名和 999 名患者的独立数据集中测试了这些模型。
该系统估计年龄的平均绝对误差为 3.26 岁。它以 0.97 的受试者工作特征曲线下面积,即 AUC,区分性别。AUC 衡量模型在不同可能的决策阈值下区分两类结局的能力。
该模型估计吸烟状态的 AUC 为 0.71。其收缩压估计的平均绝对误差为 11.23 毫米汞柱。对于重大不良心脏事件,报告的 AUC 为 0.70。
这些数字表明,视网膜照片所包含的全身性信息多于传统检查此前能够提取的信息。但这并不能证明该算法应取代血压计、实验室检测或心血管检查。
论文中的注意力图显示,模型针对不同预测使用了视神经盘和血管。注意力图会突出影响算法输出的图像区域。它们可为理解模型行为提供线索,但并非完整的因果解释。
这正是当前 Google News 关注点需要谨慎表述的原因。研究方向已超越孤立的概念验证。团队如今正跨疾病、人群、成像设备和临床环境测试视网膜预测。
但核心主张仍比某些标题暗示的更有限。视网膜 AI 可以识别与全身健康相关的统计信号。这些信号能否改善结局,取决于验证、工作流程设计和负责任的临床随访。
视网膜 AI 从风险因素走向未来事件
该领域正从估计熟悉的风险因素,转向预测尚未发生的事件。
早期研究通常探讨,视网膜图像能否恢复其他渠道已可获得的信息。年龄、吸烟状态、血压和糖化血红蛋白提供了便于使用的标签。成功表明视网膜包含相关信息,但并未证明其具有额外的临床价值。
事件预测提高了要求。预测心血管疾病或卒中的模型必须在时间推移中保持准确。它还必须在既有风险计算器、病史、体格检查和实验室检测之外提供额外信息。
一项 2025 年的实用性研究评估了两家澳大利亚基层医疗诊所中的自动视网膜摄影和基于 AI 的心血管风险评估。该系统根据非散瞳眼底照片生成视网膜预测的心血管疾病评分。非散瞳成像无需常规扩张瞳孔即可获取视网膜照片。
在 361 名参与者中,339 人获得了风险评分,相当于 93.9% 的成像成功率。研究还报告,终端用户满意度约为 90%。
然而,模型的实际价值取决于预测表现,而非便利性本身。在另一项 UK Biobank 验证队列中,视网膜评分对十年心血管事件的 AUC 为 0.672。传统世界卫生组织评分的 AUC 为 0.693。
这些结果总体相当,但两种评分都远未达到完美的区分能力。这项基层医疗试验还发现,视网膜评分与 WHO 评分之间仅存在中等相关性。
这一比较揭示了一个重要细节。视网膜模型能够通过一张照片近似传统风险评估,这在实验室检测资源有限的地区或许有帮助。但这并不自动意味着它优于收集既有临床变量。
该研究的训练过程进一步增加了解读难度。研究人员以 WHO 心血管风险评分作为参考标签训练视网膜模型。这些评分纳入了年龄、性别、吸烟、收缩压、糖尿病状态和胆固醇。
因此,该模型先学会复现一种临床风险构念,之后研究人员才用未来事件对其进行测试。它最初并非仅基于经裁定的心脏病发作和卒中进行训练。这一区别影响其输出所代表的含义。
卒中研究则采用了另一条路径。DeepRETStroke 使用视网膜图像识别与无症状脑梗死相关的模式,即通过影像发现、但未被识别为临床卒中的脑损伤。该系统还估计五年卒中风险。
研究人员使用 895,640 张视网膜照片对 DeepRETStroke 进行了预训练。他们在外部数据集中测试无症状脑梗死检测,并报告 AUC 值介于 0.751 至 0.792。
对于五年新发卒中预测,外部数据集的 AUC 值介于 0.728 至 0.895。这项卒中预测研究纳入了来自多个国家和族群的数据,增强了验证设计。
不过,如此宽泛的性能范围仍值得关注。它表明,结果会随人群、临床背景、患病率和数据采集方式而变化。一个队列中的高结果不能被视为通用的运行规格。
Google News 的报道可能将这些研究压缩为一个简单承诺:一张照片即可预测全身性并发症。科学记录支持一个更有用的结论:视网膜图像提供了一种可规模化的风险信号,其可靠性高度取决于使用地点和方式。
真正的较量在于能力与临床有效性
视网膜 AI 作为预测能力的发展速度,快于其作为经验证临床服务的发展速度。
能力回答的是模型能否识别某种关联。临床有效性则问,这种关联在目标人群和场景中是否依然准确。临床效用提出了更难的问题:使用这一结果是否能改善患者照护?
这些阶段在公众讨论中常被混为一谈。一个回顾性模型可以接收图像、生成评分并优于基线,但这一结果距离证明减少卒中、实现更早治疗或改善长期生存仍相去甚远。
将全身性预测与自主糖尿病视网膜病变筛查进行比较,这一区别会更加清晰。后者有明确的目标、明确的患者群体和既定的转诊路径。其输出回答的是是否存在超过特定阈值的视网膜疾病。
美国食品药品监督管理局将相关系统归类为视网膜诊断软件设备。其定义涵盖分析数字眼底图像以识别需转诊视网膜疾病的软件。该机构的设备分类将这些产品描述为处方器械。
例如,AEYE-DS 分析眼底图像,以检测成年糖尿病患者中超过轻度的糖尿病视网膜病变。其获准适应证涉及可通过视网膜成像观察到的眼部疾病,并未赋予其广泛诊断全身性心血管或神经系统疾病的权限。
EyeArt 采用了同样有边界的模式。其适应证涵盖对超过轻度及威胁视力的糖尿病视网膜病变进行自动检测。该软件检查图像质量、分析图像,并返回针对特定疾病的结果。
全身性预测缺乏同样的临床简洁性。较高的心血管评分可能触发血压测量、血脂检测、基层医疗就诊或进一步影像检查。每种选择都会改变成本、获益和不必要干预的风险。
模型还需要一个有用的决策阈值。AUC 概括了跨阈值的排序表现,但临床医生最终必须选择一个具体的截断值。该截断值决定敏感性、特异性、误报和漏诊。
当它触及原本不会接受任何评估的人群时,即使 AUC 中等的工具也可能有所帮助。但在已具备完整临床数据时,同一工具可能几乎没有额外价值。情境决定便利性是否产生有意义的价值。
能力与有效性之间的较量,是本文的核心反转。越来越多疾病可从视网膜数据中预测,并不会让部署变得更容易。每增加一项预测,就会增加对证据、解读、知情同意和随访的要求。
医疗系统必须决定谁负责这一结果。验光师可能采集图像,而基层医疗医生负责管理心血管风险。出现卒中信号时,神经科也可能参与其中。
患者还需要得到清晰的解释。风险估计不是诊断,算法警报可能在未确认疾病的情况下引发焦虑。沟通因此成为系统安全的一部分,而非可有可无的界面细节。
这使视网膜 AI 与其说像一台万能扫描仪,不如说是一种临床协同技术。模型只是其中一个组成部分。相机、操作人员、病历、转诊规则、临床医生和患者共同决定最终结果。
数字未能揭示的内容
报告中的准确率可能掩盖了一个事实:在最需要可靠风险评估的人群中,系统表现可能较弱。
澳大利亚基层医疗研究提出了直接警示。其视网膜系统在高风险个体中对传统评分的估计往往不够准确。亚组分析显示,老年男性是尤其需要改进的一类人群。
研究人员将这一局限与开发数据联系起来。UK Biobank 的志愿者群体相对健康,高风险参与者较少。在该数据集上训练的模型,部署到病情更重的患者群体时可能面临分布偏移。
当真实世界的患者或图像与模型训练数据不同时,就会发生分布偏移。这种差异可能涉及年龄、族群、疾病患病率、相机硬件、照明、图像质量或转诊模式。
仅相机变化就可能产生影响。UK Biobank 使用的设备可生成以黄斑为中心的 45 度照片。澳大利亚试验则使用便携式相机生成 50 度图像。不同的视野范围和图像处理方式,可能改变模型可利用的特征。
年龄和性别也可能成为模型的捷径。一项使用 3,000 名 Qatar Biobank 参与者的研究发现,深度模型能够准确预测年龄和性别。研究还发现,这些变量会介导对多项心脏代谢因素的预测。
Qatar Biobank study 报告称,年龄预测的平均绝对误差为 2.78 岁,性别预测的 AUC 为 0.97。对血压、糖化血红蛋白、相对脂肪量和睾酮的预测表现则较弱。
中介作用带来了可解释性问题。模型看似识别出与疾病相关的视网膜特征,但其中一部分可能只是重构了年龄或性别。这仍可支持预测,但会改变结果所对应的生物学解释。
另一个风险来自标签。如果模型从既有风险计算器中学习,它可能继承该计算器的假设与遗漏。它或许只是自动化了传统评分,而没有发现独立的视网膜生物标志物。
基于医疗系统中记录的诊断训练的模型还会面临其他偏差。医疗可及性会影响谁能接受检测,以及哪些状况会进入病历。算法可能同时学习到医疗服务提供模式和疾病模式。
图像质量可能以不均衡的方式排除患者。白内障、瞳孔过小、注视不稳及其他眼部状况都可能使照片无法判读。系统宣称的总体准确率通常只适用于质量控制剔除不可用图像之后的样本。
假阳性会带来后续影响,可能引发实验室检测、专科转诊、影像检查或患者担忧。假阴性则可能带来错误的安心感,而既有筛查本可以识别相关风险。
因此,校准与区分能力同样重要。经过校准的模型所给出的风险应与实际观察到的事件发生率相匹配。如果模型将某个群体标为百分之十风险,那么在规定期间内,约有这一比例的人应发生相应结局。
校准能力可能因地点不同或时间推移而下降。相机、治疗手段、群体健康状况或临床记录方式的变化,都可能改变图像与结局之间的关系。医疗系统需要在部署后持续监测,而不只是在上线前进行验证。
隐私带来了另一项担忧。视网膜图像可编码年龄、性别、心血管特征及其他敏感属性。患者可能同意进行眼科筛查,却并未预期自己的照片会被用于无关的全身性预测。
这种扩展用途需要透明的知情同意和治理机制。机构应明确哪些模型会分析图像、哪些输出会进入病历,以及谁可以访问这些信息。二次研究用途同样应受到清晰的控制。
临床医生还需要能够将评分与证据关联起来的文档。在采购过程中,应能获取模型卡、亚组结果、验证队列、相机兼容性和已知失效模式等信息。单一的准确率数字并不足够。
评估医学证据的团队可以通过结构化的 AI knowledge base 保留研究细节。这类文档有助于审查,但不能替代临床验证或监管许可。
持审慎态度并不意味着视网膜 AI 没有价值,而是指出部署中最不显眼的部分往往决定安全性。数据集构成、校准、知情同意、转诊和监测,与神经网络本身同样重要。
精准医疗需要的是照护路径,而不仅是一项评分
只有当视网膜预测能够为特定患者改变恰当的决策时,它才构成精准医疗。
近期最有力的应用场景可能是机会性筛查。人们本就会前往使用眼底相机的验光诊所、糖尿病项目和基层医疗机构。一张图像既可支持眼科筛查,也可支持经过严格验证的全身性风险评估。
这种方式可以减少数据采集的阻力。视网膜摄影是非侵入性的,也可以自动化。便携设备可能将评估延伸至实验室检测或专科资源仍然有限的场景。
然而,便利性不应决定医疗主张。诊所必须界定适用人群、图像采集流程、输出结果和后续随访,还必须明确何时应由传统检测结果优先于算法判断。
设想一名接受糖尿病眼病筛查的患者。相机拍摄到可判读的视网膜照片,获批系统据此评估糖尿病视网膜病变。处于研究阶段的模型可能会从同一批图像中另行估计心血管风险。
第二项输出不应悄然显示为诊断。诊所需要设定既定阈值、获得患者同意、进行临床医生审核,并制定应对方案。该方案可能先从标准心血管测量开始,而不是立即转诊专科。
照护路径还应处理结果不一致的情况。视网膜评分可能将患者归为高风险,而传统计算器给出较低结果。临床医生需要证据说明,视网膜模型是否提供了独立的信息增益。
多模态系统最终可能解决部分问题。这些模型将视网膜特征与人口统计信息、病史、实验室结果或遗传信息结合。目标是利用互补信号,而不是强迫一张图像回答所有问题。
一项 multimodal risk study 考察了 2 型糖尿病患者的视网膜、基因组和临床信息。其前提是,每种数据来源都提供了心血管风险的不同视角。
这一方向比“万能眼部扫描”的叙事更符合精准医疗。视网膜数据可以贡献另一种表型,即可观察的生物学特征。它无需取代既有测量方法,也能产生价值。
因此,最佳系统或许应提出一个更聚焦的问题:对于传统风险仍不明确的患者,加入视网膜信息是否能改善决策?这一目标有助于开展更清晰的试验,并支持更具可辩护性的临床行动。
前瞻性影响研究至关重要。研究人员应比较有无视网膜 AI 的照护方式,然后衡量转诊情况、完成随访情况、治疗变化、不良事件和患者结局。仅凭模型准确率无法回答这些问题。
即使不讨论具体价格,经济和运营影响同样重要。较高的假阳性率可能压垮转诊能力。较低的图像成功率可能加重工作人员负担,并排除患有常见眼部疾病的患者。
工作流整合必须避免警报疲劳。临床医生已经会收到大量电子提醒,定位不佳的警报常被忽略。视网膜风险结果应只在能够支持明确决策时出现。
输出结果应传达不确定性。风险范围、置信信息和主要局限性,比醒目的红色警告更负责任。患者应了解该工具是否已在与他们相似的人群中得到验证。
即使图像采集实现自动化,人工审核仍然重要。临床医生必须考虑症状、家族史、用药、既往疾病和相互矛盾的证据。算法无法看到患者状况中所有相关部分。
视网膜 AI 也为眼科护理专业人员创造了协同机会。验光师和眼科医生早已能识别与高血压、糖尿病和血管疾病相关的征象。经过验证的工具可在保留临床判断的同时,标准化升级处理流程。
基层医疗团队仍将居于核心地位,因为全身性风险管理不止于图像。他们可以确认测量结果、评估并存状况,并选择预防策略。缺少这座桥梁的预测价值有限。
这一领域应通过完成的照护而非生成的评分来衡量成功。能够识别风险却在转诊过程中失去患者的系统,在运营层面已经失败。能够支持及时确认和恰当治疗的系统,才提供了临床效用。
Google News 关注后值得关注的三项信号
下一阶段将由外部验证、前瞻性结局和界定严格的监管主张决定。
首先,关注在真正独立的医疗系统中的验证。最有力的研究将涵盖不同国家、族群、疾病患病率和相机型号。它们应公布亚组表现、校准情况、图像拒收率和决策阈值。
多国验证增强了 DeepRETStroke 证据,但其报告的表现仍因数据集而异。这种差异应被视为有用信息。它显示了模型在哪些场景中具有良好迁移性,以及在哪些场景中仍需调整。
可信的部署研究还应在评估前锁定模型。研究人员应避免针对最终测试人群反复调整模型。由开发机构之外的团队进行独立复现,将进一步增强信心。
如果广泛的外部表现保持稳定,视网膜生物标志物的论据将更有力。如果结果在老年、高风险或代表性不足的群体中明显下降,该领域就必须收窄其预期用途。
其次,关注衡量患者结局或具体照护变化的前瞻性试验。研究人员需要证明的不只是与既有评分的相关性,还应追踪视网膜警报是否带来完成的评估和有益的干预。
相关指标包括确诊情况、恰当转诊、治疗启动和事件减少。研究还应报告不必要的检测、漏诊病例、患者焦虑和临床医生工作负荷。
随机化或经过严谨控制的研究设计将尤其具有参考价值。它们可以将算法的影响,与仅仅为诊所提供更多关注和资源所带来的影响区分开来。
如果视网膜筛查在不制造过多误报的情况下改善随访,精准医疗的论据就会更有支持。如果它只是给病历再增加一项评分,热情则应降温。
第三,关注监管申报和临床指南中的措辞。FDA 现有的视网膜 AI 案例主要聚焦眼科疾病,包括糖尿病视网膜病变。全身性预测需要不同的预期用途声明和证据。
该机构维护了一份公开的 AI 医疗器械 清单,但被列入其中并不意味着获批用于所有可能的用途。每种设备都有特定的适应证和临床应用场景。
相比宽泛的全身性筛查标签,范围更窄的声明或许更现实。开发者可以聚焦于明确的人群、疾病、风险时间范围、相机设备和转诊路径。这种具体性可使评估和安全实施更加容易。
Google News 很可能会持续推送将视网膜图像与更多疾病关联起来的研究。读者应当透过“可预测疾病数量”这一表象,关注更深层的问题:验证情况、增量价值和临床行动。
对开发者而言,挑战在于构建可追溯的系统,使其在不断变化的数据环境中保持一致表现。企业采购方需要与自身人群和硬件相关的证据。临床医生则需要能够支持明确下一步行动的输出结果。
患者所需要的更简单:诚实地解释图像能够揭示什么、不能揭示什么。他们应当知道,视网膜风险信号既不是确诊,也不能替代全面的医疗照护。
新出现的证据支持审慎乐观。视网膜图像包含有意义的全身性信号,而人工智能能够大规模提取其中的一部分。一些研究如今已超越基础风险因素,延伸至心血管事件和卒中。
然而,预测只是工作流程的起点。精准医疗需要经过验证的决策、负责任的沟通,以及能够改善结局的后续随访。缺少这些要素,眼睛或许会成为观察风险的窗口,却无法打开通往更好医疗照护的路径。
随着更多视网膜 AI 相关报道出现在 Google News 中,请问自己三个问题:该模型是否在其开发环境之外得到验证?它的使用是否改善了患者决策?其监管声明是否与新闻标题相符?
这些检验能够区分一项有趣的研究成果与可靠的医疗工具。它们也提供了最清晰的方法,帮助人们关注这一领域,而不将算法信心误认为临床确定性。


