RETFound 视网膜年龄模型可从一张眼底图像读取衰老信息,但尚不能作为临床时钟
RETFound 视网膜年龄模型可根据一张彩色眼底照片估算一个人的年龄,平均误差为 2.85 岁。研究人员使用来自 71,343 名 UK Biobank 参与者的图像训练了该系统。然而,更具意义的输出并非年龄估计本身,而是这一估计值与个体实际年龄之间的差距。
这一视网膜年龄差与心脏代谢特征、炎症、认知表现、死亡率、痴呆、癌症和心血管疾病有关。这项同行评审研究还发现,男性和女性呈现出不同的生物学模式。这些发现使眼睛看起来不再只是一个孤立器官,而更像是全身性衰老可被测量的记录。
不过,相关性不等于诊断,三年的误差也不足以让针对个人的预测具有决定性的临床意义。核心的较量在于便捷的影像生物标志物,与医疗决策所要求的验证标准之间。研究人员已经证明,一张照片蕴含着大量惊人的健康信息;但他们尚未证明每一家诊所都能安全地解读这些信息。
RETFound 视网膜年龄模型将一张照片转化为衰老信号
这项研究将常规眼部图像转化为紧凑的衰老测量指标,继而探究这一指标所代表的含义。
彩色眼底照片可捕捉眼球后部的视网膜、视盘、黄斑和可见血管。眼科诊所已在使用这类图像评估糖尿病视网膜病变和黄斑变性等疾病。该过程无创,通常可在普通影像检查预约中完成。
研究团队对 RETFound 进行了微调。RETFound 是一个预训练于视网膜图像的基础模型,用于预测实际年龄。基础模型会先学习可复用的视觉模式,之后研究人员再将其适配到更具体的任务。与从零开始构建模型相比,这种方法可减少所需的任务专属训练量。
该模型分析了来自 71,343 名 UK Biobank 参与者的眼底图像。根据研究的 UK Biobank 记录,其预测的平均绝对误差为 2.85 岁。平均绝对误差描述预测年龄与记录年龄之间的平均距离,不会对高估和低估作区别处理。
这一结果并不意味着每次估计都落在 2.85 岁以内。有些预测更接近实际年龄,另一些则偏差更大。这个总体数值概括的是整个研究队列的表现,而非保证针对某位患者的准确性。
年龄预测也是研究的起点,而非最终临床主张。研究人员通过从模型估计值中减去实际年龄,计算每位参与者的视网膜年龄差。正值意味着视网膜看起来比预期更老,负值则意味着看起来更年轻。
这一差异之所以重要,是因为按实际年龄训练的模型仍可能捕捉到受健康状况、环境和遗传因素影响的特征。血管管径、组织外观、视盘结构及其他细微信号都会随年龄变化。疾病和生活方式因素也可能改变其中一些相同结构。
因此,团队将预测误差视为潜在的生物学信息。他们将视网膜年龄差与临床特征、健康结局、认知测量和遗传数据进行比较。除实际年龄本身外,这一差值还与多项衰老相关特征和疾病有关。
这改变了该系统的用途。一个简单的年龄估计器,充其量只是令人印象深刻的计算机视觉演示。可重复的视网膜年龄差则可能成为一种研究表型,即用于研究不同人群健康差异的可测量特征。
单图像设计也使该模型区别于需要血液或组织样本的生物年龄时钟。眼底摄影已广泛用于眼科和糖尿病眼病筛查。这一既有基础设施为收集额外信号提供了一条可行路径,无需增加另一项侵入性检测。
但这张照片并不能直接揭示一个人的普遍生物学年龄。它记录的是某一器官在某一时刻、通过一种影像方式呈现的状态。模型随后将其视觉特征压缩为具有年龄特征的输出。在评估结果能够支持何种用途时,这一区别至关重要。
为什么视网膜年龄差比预测生日更重要
真正具有临床意义的问题,不是 AI 能否猜中年龄,而是它的误差是否能持续揭示隐藏的健康差异。
若模型将一名 60 岁的人预测为 64 岁,它在实际年龄上产生了四年的误差。研究人员也可以将这一结果解读为视网膜呈现出更老的状态。如果类似的差距反复与疾病或未来结局相对应,这种误差就会成为候选生物标志物,而非单纯的统计噪声。
这项新研究报告称,视网膜年龄差与心脏代谢特征、炎症、认知表现、全因死亡率、痴呆、癌症和新发心血管疾病有关。新发疾病指初始评估后记录的疾病。它比既有诊断的静态快照更具信息价值,但仍不能证明因果关系。
视网膜提供了一种无需手术即可观察神经和血管组织的独特窗口。可见的变化可能反映影响血管、代谢和神经系统的过程。这一生物学位置有助于解释,为何研究人员持续测试视网膜图像与眼科学之外结局的关联。
早期研究得出了类似结论。Google 研究人员开发了 eyeAge 模型,使用数十万张视网膜图像进行训练,并在独立数据上进行了测试。他们的视网膜衰老时钟给出了与实际年龄相关的估计,并将较高的预测年龄与多项健康指标联系起来。
该早期系统报告的预测年龄与实际年龄之间的 Pearson 相关系数为 0.87。它还将更高的 eyeAge 测量值与研究人群中的全因死亡率相关联。Google 认为纵向影像尤其有价值,因为重复拍摄的照片可能揭示视网膜变化的方向和速度。
RETFound 研究通过大规模 UK Biobank 分析和视网膜基础模型拓展了这一研究路径。它还整合了遗传数据和按性别划分的分析。因此,其结果并不只是另一场追求最低预测误差的竞赛。
相反,该研究探讨的是视网膜衰老是否构成具有生物学意义的表型。其全基因组分析识别出与长寿、代谢、神经退行性疾病和年龄相关眼病有关的信号。遗传关联可帮助研究人员探究哪些生物学通路促成了这一基于图像得出的测量结果。
不过,遗传学并不会自动证明该模型可作为临床检测。一个具有统计学关联的变异可能只能解释极小部分的差异,也可能与眼部结构有关,却并不代表全身衰老。研究人员必须区分有用的生物学线索和可据此采取行动的临床效应。
同样的谨慎也适用于疾病关联。糖尿病、高血压、吸烟、药物和社会经济状况都会影响视网膜外观,也会影响心血管和认知结局。因此,模型可能是通过视觉代理捕捉已知风险因素,而非发现独立的衰老机制。
这种可能性并不意味着该信号毫无用处。若一种易于获取的代理指标可在既有测量之外提供额外信息,它仍可支持筛查或研究。决定性问题在于,在考虑年龄、血压、实验室结果、病史和既有风险评分后,视网膜年龄是否能改善决策。
目前,最有力的解读仍应更为谨慎:RETFound 可从一张眼底照片中提取与年龄相关的表征。这一表征中的差异,在群体层面与多项健康和生物学特征相对应。
性别特异性结果使“单一生物时钟”的概念更复杂
该模型的输出并不描述一个普遍适用的单一衰老过程,因为男性和女性展现出不同的临床和解剖学关联。
研究人员报告称,按性别分层的模型在年龄预测表现上相近。然而,视网膜年龄差背后的生物学特征并不相同。在男性中,更高的视网膜年龄与代谢综合征的关系更强。在女性中,模型注意力和遗传证据更强调视网膜血管。
模型注意力是指用于识别对预测贡献较大的图像区域的方法。这些图谱可提供系统使用何种信息的线索,但不能完整解释其推理过程的因果机制。
研究还发现,女性的视网膜衰老模式会随绝经期过渡而变化。绝经后参与者具有更高的视网膜年龄差值,其临床关联则更接近男性所观察到的模式。
这些结果挑战了一种很有诱惑力的产品叙事。人们很容易将视网膜年龄营销为可在所有人之间比较的单一数字。但该研究反而表明,相同的输出在不同群体中可能反映不同的生物学组合。
一个群体中的四年差距,可能主要反映代谢特征;在另一个群体中,血管结构或激素变化可能贡献更大。即使预测准确度看起来相似,模型也可能依赖不同信号。
这一问题并不限于性别。族裔、相机硬件、影像流程、瞳孔散大、图像质量和疾病患病率都可能影响视网膜模型。获得眼科护理的机会差异也会影响哪些患者被纳入训练数据集。
UK Biobank 是宝贵的纵向资源,但它并非全球人口的随机样本。其志愿者通常比英国总体人口更健康。年龄范围、祖源分布和临床环境可能与其他地区社区诊所遇到的情况不同。
另一项针对 RETFound 的研究说明了这一担忧。研究人员使用彩色照片、光学相干断层扫描和组合模型,对 9,668 名健康 UK Biobank 参与者的视网膜年龄预测进行了评估。他们的人口学偏差研究发现,偏差取决于人口学群体和影像方式。
组合系统的平均绝对误差为 3.01 岁。仅使用照片的模型达到 3.40 岁,而光学相干断层扫描模型达到 4.37 岁。研究人员发现,照片模型存在显著的性别差异,而断层扫描模型存在族裔差异。
在该项特定分析中,结合两种图像类型消除了具有统计显著性的性别和族裔差异。然而,这也需要更多设备和数据。多模态模型更难被包装成一种简单的一图筛查工具。
教训并不是性别特异性建模必然会失败,而是平均准确率可能掩盖群体层面的表现。一个系统的总体误差或许可以接受,却可能系统性地高估某一人群、低估另一人群。
当输出结果被解读为加速衰老时,这种校准尤为重要。持续存在的群体层面偏差,可能会将健康人标记为更年长,或掩盖其他人群升高的风险。这会将统计伪影转化为看似生物学上的结论。
在向个体患者呈现视网膜年龄之前,开发者需要提供亚组报告、进行校准检查并完成外部验证。临床界面也应展示不确定性,而不是脱离背景地显示一个精确年龄。
该机制很高效,但其含义仍存在争议
RETFound 让特征提取变得高效,但其最终得出的数字介于时间年龄预测、器官衰老和全身性风险之间。
该模型首先基于从视网膜数据中学习到的视觉表征开展工作。研究人员随后对这些表征进行微调,以用于年龄预测。这使网络能够复用涉及血管、组织纹理、视盘及其他结构的模式。
这一过程不同于测量已知分子或解剖特征。实验室检测或许会通过明确的化学流程量化葡萄糖浓度。深度学习年龄模型则结合了许多视觉特征,其中包括人类难以轻易分离出的模式。
研究人员可以检查注意力图,将输出结果与健康记录进行比较,并研究相关遗传变异。这些方法有助于改善解释性,但没有任何一种能完整说明每个像素如何影响个体估计结果。
标签本身也带来了另一项复杂性。系统从时间年龄中学习,因为这一信息可获得且客观。然而,生物学年龄并不是具有单一定义、可被直接观察到的真实值。
只有当偏差携带可重复的健康信息时,经过训练以复现出生日期的模型才能成为生物时钟。这种转变需要跨队列、设备、人口群体和时间的证据,也需要与更简单的临床测量指标进行比较。
已发表文献中已包含多种视网膜衰老系统,包括 Retinal Age、eyeAge、RetiAGE 及其他卷积模型。一项视网膜年龄综述发现,数据集、验证方法、模型定义和目标结局之间存在显著差异。
这些系统未必测量的是相同现象。一个模型可能更强调血管模式,另一个则可能更依赖视盘或组织特征。不同的图像预处理选择,也可能改变哪些信息得以保留。
这使直接比较变得困难。即使两个系统都具有合理的平均准确率,同一个人也可能从中获得不同的视网膜年龄。在缺乏统一基准的情况下,任何一种输出都不具备普适的临床解释。
“年龄”一词也可能让这项测量显得比实际更确定。患者将日历年龄理解为固定事实;视网膜估计则是一个概率性评分,受到训练数据、图像质量、模型架构和校准情况的影响。
更安全的表述是将视网膜年龄视为一种影像生物标志物。它概括了与年龄相关的视觉信息,并可能在与其他证据结合时支持风险分层。它不应取代医学评估,也不应单独作为寿命预测依据。
纵向数据或可澄清其含义。如果个体的视网膜年龄差在控制血压、戒烟或其他干预后发生变化,研究人员可以检验这种变化是否与结局改善相一致。稳定的重复测量结果也能表明,该信号是否超出了正常影像变异的范围。
不过,干预研究面临很高的标准。模型评分发生变化,并不必然意味着衰老速度变慢;相机、预处理流程或图像质量也可能发生了改变。研究人员必须同时证明技术上的可重复性和生物学上的响应性。
因此,该模型近期最大的价值可能在于研究。它可以帮助科学家按视网膜衰老模式划分大型队列、探索遗传通路并生成假设。临床应用则需要另一层专注于决策和患者结局的证据。
视网膜年龄结果并未证明什么
该研究支持的是群体层面的关联,而不是自主诊断或针对个体的疾病与死亡预测。
第一项局限是泛化能力。主要分析使用了 UK Biobank 数据,而该队列中的表现并不能保证在其他地方也能得到同等结果。不同卫生系统使用不同的相机、工作流程、图像分辨率和质量控制措施。
外部队列对于医学影像尤其重要,因为模型可能会学习到设备特异性信号。色彩平衡或视野的变化可能改变预测结果。当实际部署人群的眼病比例高于训练群体时,模型性能也可能下降。
第二项局限是混杂因素。视网膜外观和与衰老相关的结局受到许多共同因素的影响。吸烟、糖尿病、高血压、肥胖、用药情况和贫困程度都可能同时影响二者。统计调整能够缓解这一问题,但很少能将其完全消除。
第三项局限涉及反向解读。看起来更老的视网膜可能反映的是既有疾病造成的损伤,而非导致未来疾病的潜在过程。图像仍可能提供有价值的信息,但这种关系的方向会改变临床医生应得出的结论。
第四项局限是测量稳定性。诊所需要了解,该评分在重复拍摄、不同相机型号、不同技术人员以及轻微定位变化的情况下是否保持一致。如果常规技术变异会导致年龄大幅波动,生物标志物就无法指导随访。
第五项局限是沟通。被告知自己的视网膜看起来老了八岁的患者,可能会认为自己的身体额外衰老了八年。研究并不支持如此字面化的结论,也无法据此判断一个人的寿命。
虚假的安心感则构成相反的风险。较年轻的视网膜估计并不能抵消升高的胆固醇、高血压、家族史或症状。单一有利的生物标志物,绝不应压倒既有的临床证据。
隐私同样值得关注。视网膜图像能够揭示的信息不止于被筛查的疾病。研究已从眼底照片中提取出年龄、性别、与吸烟相关的信号、心血管特征及疾病信息。患者可能不会预期,一张图像能支持如此多的推断。
如果医疗机构将存档图像重新用于新的预测,就需要明确的同意与治理规则。访问控制应反映推断信息的敏感性,而不应仅依据照片最初的用途。
监管状态是另一条边界。同行评审的关联研究并不意味着该模型已获准用于诊断或筛查。临床产品需要明确的预期用途、质量控制、验证证据、监测机制以及适当的监管审查。
前瞻性测试将至关重要。研究人员应在真实就诊流程中的患者身上评估模型,而非仅分析历史记录。这种设计能够衡量图像拍摄失败、工作流程影响、临床医生反应以及对患者造成的后果。
相关终点也必须与拟议用途相匹配。如果模型旨在改善心血管筛查,试验应评估它是否能在既有工具之外识别风险。如果模型旨在用于衰老研究,那么可重复性和对变化的敏感性就会成为核心。
这些局限并未抹去研究的贡献。它们界定了具有信息价值的研究信号与可靠医疗工具之间的距离。视网膜 AI 已经进步到足以让这段距离被测量,而不是被忽视。
三项信号将显示视网膜年龄能否走出实验室
外部验证、重复成像和以决策为重点的试验,将决定视网膜年龄能否在研究队列之外发挥价值。
第一项信号是跨人群和相机系统的独立验证。研究人员应测试同一个已锁定的模型,而不是为每家新医院重新训练。若模型能在不同祖源群体、年龄范围、疾病和设备之间保持稳定校准,将强化 RETFound 捕捉到可迁移生物学信号的主张。
性能下降并不会否定研究发现,而是表明本地校准或多模态输入仍然必要。开发者应公布亚组误差和年龄差分布,而非仅发布一个总体准确率数字。
第二项信号是纵向可靠性。同一个人在相近条件下、时间间隔较短拍摄的图像,应获得相似结果。在更长时间尺度上,变化应对应有意义的临床或生物学变化,而非随机图像变异。
重复成像还可以揭示视网膜衰老是否是一条轨迹,而不是静态评分。这将支持对生活方式改变、治疗和疾病进展的研究,同时也会带来更棘手的问题:哪些变化可逆,哪些变化具有临床意义。
第三项信号是证明该评分能够改善真实决策。一项有价值的试验可以测试,在常规眼部成像后,视网膜年龄是否有助于识别需要进行心血管评估的人群。另一项试验则可以检验,它在认知测试和既有生物标志物之外,是否能为痴呆风险研究增添价值。
成功所需的不仅是统计学显著性。模型应在检测、优先级排序或结局方面带来足以证明额外复杂性合理的改进,同时还应避免因误差率或获取机会不均而扩大差距。
竞争压力与其说来自另一家 AI 公司,不如说来自传统风险评估。现有工具使用病史、实验室检测、生命体征和经过验证的临床评分。视网膜 AI 必须证明,其低摩擦的图像信号是在增加信息,而不是间接复述这些输入。
对临床医生、开发者和 AI 采购方而言,恰当的反应是保持审慎关注。在将视网膜年龄差视为个人健康结论之前,应追踪外部验证、亚组校准和前瞻性试验。对于正在整理快速增长证据基础的研究人员而言,结构化的 AI knowledge base 可以将模型版本、队列和局限性联系起来。
如今,一张眼部照片已能对与年龄相关的视网膜模式作出可信估计。尚未解决的问题是,这些模式能否安全地改善医疗服务。应关注有关可重复性和临床决策的证据,而不只是更低的预测误差。



