AI 绘制区域脑老化图谱,但早期痴呆检测仍未获证实
- Aisha Washington

- 10小时前
- 讀畢需時 14 分鐘
Google News 展示了一项对 148 个脑区老化情况进行绘制的研究,但其中存在一项尚未解决的关键矛盾:遗传图谱并不等同于早期痴呆检测。研究人员利用来自 41,708 名 UK Biobank 参与者的深度学习、MRI 扫描和基因组数据,发现区域老化模式与遗传通路以及易受神经退行性疾病影响的脑区之间存在联系。
这种区别至关重要。传统脑龄模型会将一份 MRI 扫描压缩为单一的年龄估计值。新研究则将老化视为一个区域性过程,显示同一大脑的不同部位可能遵循不同的生物学时间线。
这一额外细节让研究人员能够更清晰地观察阿尔茨海默病和额颞叶痴呆的易感性。但它并未证明医生可以根据区域脑龄图谱诊断任一疾病。真正的较量在于:引人注目的研究信号,与临床预测所要求的更高证据标准之间的差距。
Google News 标题实际涵盖的内容
这项研究改变了研究人员呈现脑老化的方式:从单一的全脑估计,转向逐脑区的遗传图谱。
这项发表于 GeroScience 的同行评议研究,考察了局部脑龄的多基因架构。多基因架构指的是大量遗传变异共同产生的影响,而不是某一个基因单独发挥作用。
研究人员分析了 UK Biobank 中 41,708 名认知正常成年人的 T1 加权 MRI 扫描。T1 加权 MRI 是一种结构扫描,可提供脑组织之间的精细对比。团队使用深度神经网络,估计各个不同皮层区域的老化差异。
该模型将大脑皮层划分为 148 个区域。针对每个区域,它计算了局部脑龄差,即估计生物学年龄与参与者实际年龄之间的差值。
正差值表明某一区域看起来比预期更老。负差值则表示相对于模型参考人群,其老化较慢。两种结果都不会自动意味着存在疾病。
随后,研究人员进行了全基因组关联研究,通常称为 GWAS。这种方法会在大量参与者中测试遗传变异与某项测量特征之间的统计关联。
分析评估了超过 60 万个变异,并发现至少一个区域的局部脑老化与 1,212 个单核苷酸多态性相关。单核苷酸多态性,即 SNP,是 DNA 单个位点上常见的差异。
这些关联映射到参与发育、代谢、免疫和细胞骨架过程的基因。细胞骨架是帮助细胞维持形状、运输物质和组织活动的内部框架。
研究强调了包括 KCNK2、NUAK1、GMNC 和 MSL2 在内的基因附近变异。KCNK2 有助于调节参与神经元电信号传递的钾通道。这些发现并不意味着任何一个被强调的基因就能决定一个人大脑老化的速度。
研究人员还将区域遗传关联特征归为三大类。这些类别分别对应形态发生、细胞骨架,以及免疫或表观遗传过程。表观遗传过程会影响基因如何运作,但不会改变其底层 DNA 序列。
与痴呆研究最相关的结果涉及空间重叠。区域遗传模式出现在默认模式、边缘和运动网络中,而这些网络同样会在阿尔茨海默病或额颞叶痴呆中表现出易损性。
默认模式网络支持以内在思维为中心的心理活动,包括自传体记忆。边缘系统结构参与记忆、动机和情绪。它们的参与赋予了这项研究生物学相关性,但仅凭重叠无法建立诊断路径。
变化在于:研究人员如今拥有一张详细图谱,可在群体规模上将基于 MRI 推导的区域老化与遗传变异联系起来。尚未改变的是,仍需根据未来临床结果验证这张图谱。
为什么单一脑龄已不足够
单一脑龄数字掩盖了解剖学差异,而这些差异或许能够区分普通老化与疾病特异性的易感性。
全局脑龄模型通常会根据整份扫描预测一个年龄。如果一名 65 岁参与者获得的估计脑龄为 72 岁,那么其全局脑龄差便是 7 年。
这种总结方式易于沟通,却舍弃了位置信息。7 年的差值无法显示最显著的差异究竟出现在与记忆相关的颞叶区域、额叶区域,还是遍布整个大脑皮层。
局部模型通过生成多个区域估计来解决这一限制。一名参与者可能呈现更显老的颞叶区域和符合年龄特征的额叶区域;另一名参与者则可能通过完全不同的模式得到相同的全局平均值。
这种区别很重要,因为神经退行性疾病并不会均匀影响每一种脑结构。阿尔茨海默病通常会先在内侧颞叶结构产生特征性变化,随后损伤才变得广泛。额颞叶痴呆则遵循其他解剖学模式,不过个体病例仍具有多样性。
早期研究已经奠定了这一方法的技术基础。2021 年的一种 U-Net 模型从结构 MRI 扫描中生成了高分辨率脑龄图。U-Net 是一种神经网络架构,旨在分析图像时保留空间信息。
该模型使用了 3,463 名 18 至 90 岁健康参与者的扫描数据进行训练,并在 692 名健康参与者中进行测试,同时单独评估了 267 名轻度认知障碍或痴呆患者。
该模型在健康对照组、轻度认知障碍患者和痴呆患者之间检测到不同的区域模式。包括海马体、杏仁核、壳核、苍白球和伏隔核在内的皮层下区域显示出显著的组间差异。
然而,其参与者内平均绝对误差的中位数为 9.5 年。平均绝对误差衡量预测误差的平均大小,而不考虑误差方向。这一结果同时说明了局部预测的前景与噪声。
研究人员并未将该系统描述为可直接用于临床的检测工具。他们的局部脑龄模型旨在揭示空间模式,并改进机制研究。
更新的研究已将这一思路推进至更具临床意义的时间线。一项独立研究考察了来自 National Alzheimer's Coordinating Center 和 Alzheimer's Disease Neuroimaging Initiative 数据库的 1,320 名参与者。
该团队比较了始终保持稳定的认知正常成年人,与后来出现认知障碍的成年人。发生转变的参与者按其距离认知障碍发作的时间进行分组。
短期组在 0.5 至 2.5 年内发生转变。中期组在 2.5 至 6 年内发生转变,长期组则在超过 6 年后发生转变。
与未发生转变者相比,短期和中期转变者的全局脑龄差更高。在该分析中,传统脑容量测量未显示出同样显著的组间差异。
区域图谱似乎也会随接近认知障碍的程度而变化。中期转变者在颞叶、岛叶和眶额区域呈现更高的脑龄差。短期转变者则在扣带回、额叶、颞叶和顶叶区域表现出更广泛的差异。
这种进展与已知的阿尔茨海默病相关神经退行性变模式相似。作者认为,结构 MRI 所包含的时间维度信息可能多于传统脑容量测量所揭示的内容。
不过,这些发现来自组间比较。组与组之间具有统计学意义的差异,并不能保证能够准确预测某一位患者的情况。
这正是 Google News 报道的核心差距。区域模型揭示了全脑平均值所掩盖的信息,但其更高的细粒度也带来了更多扫描仪效应、人口统计偏差、统计噪声和假阳性结果的可能性。
这项新的遗传研究加强了对局部脑龄的生物学解释。它表明,区域差异反映了与发育、代谢、免疫老化和细胞结构相关的协同遗传程序。
但它并未独立证明,局部图谱能够识别出哪位尚无症状的人会发展为痴呆。遗传关联、解剖学相似性和个体预后是三种不同的主张。
真正的较量:研究信号与临床证据
区域脑老化图谱看起来具有生物学意义,但临床实用性取决于能否在用于开发模型的数据集之外进行前瞻性预测。
乐观的一面始于可解释性。面对一个全局脑龄差,临床医生几乎没有解剖学背景信息。区域图谱则可以显示模型在哪些位置发现了异常模式。
这种定位能够产生可检验的假设。研究人员可能会考察,特定网络中加速老化是否与记忆衰退、执行功能障碍、语言变化或其他临床轨迹相关。
它也能支持疾病比较。如果阿尔茨海默病和额颞叶痴呆产生不同的空间特征,研究人员或许能够研究其底层通路如何分化。
遗传分析又增添了一层信息。与特定区域老化相关的变异,能够指向值得进一步研究的细胞机制。
KCNK2 提供了一个例子。该基因编码一种参与神经元兴奋性以及细胞对机械或化学条件反应的钾通道。某个关联位于该基因附近,并不会自动使其成为痴呆基因或治疗靶点。
NUAK1 参与细胞信号传递,并与细胞骨架组织有关。GMNC 和 MSL2 则参与其他发育或调控过程。在研究人员能够确定因果作用之前,这些信号仍需要功能实验加以验证。
这正是前景遭遇现实的地方。GWAS 识别的是统计关联,而非直接的生物学原因。相邻变异可能会通过遗传共同传递,使人难以确定究竟是哪一种变异或基因驱动了观察到的关系。
UK Biobank 也具有已有充分记录的样本选择特征。参与者总体上比更广泛的人群健康,而且该资源对不同祖源的代表性并不均衡。当遗传关联被转移到原始样本中未被充分覆盖的人群时,其效应可能减弱。
MRI 数据带来了另一类变异来源。扫描仪制造商、磁场强度、采集协议、头部运动和图像处理选择,都会影响测量结果。
模型可能会学习数据集中与年龄相关的技术差异。当它被用于设备或患者人口统计特征不同的另一家医院时,表现可能就不那么可靠。
年龄预测本身会带来一个统计学难题。模型往往会高估年轻参与者的年龄,并低估年长参与者的年龄。研究人员会采用偏差校正方法,但这些校正可能影响其与健康结局之间的关联。
局部预测会进一步放大这一问题。研究人员不再只需处理每次扫描的一项估计,而必须评估多个彼此相关的区域估计值。对大量脑区和遗传变异进行检验,会增加偶然关联的风险,除非统计控制足够严格。
这项 GeroScience 研究采用全基因组显著性检验程序,识别出 1,212 项关联。这使这些发现作为研究结果更具可信度。但它仍无法确立用于痴呆筛查时的敏感性、特异性或预测价值。
敏感性衡量的是,一项检测识别出真正患有或将发展为某种疾病的人群的频率。特异性衡量的是,它正确排除未患病人群的频率。阳性预测值部分取决于该疾病在受检人群中的常见程度。
当模型从回顾性研究走向临床应用时,这些指标至关重要。对规模庞大且大多数健康的人群进行筛查时,即使较低的假阳性率也可能产生大量令人担忧的结果。
一颗在区域层面看起来更“老”的大脑,可能反映多种影响因素。血管健康、糖尿病、吸烟、炎症、既往损伤、精神疾病、药物以及正常的生物学差异,都可能影响脑结构。
即使是海马萎缩,也并非阿尔茨海默病所独有。同样的解剖学信号可能出现在正常老化以及其他神经系统或精神疾病中。
一项对脑龄估计的广泛综述指出,缺乏疾病特异性始终是一项局限。局部模型改善了空间细节,但空间细节并不会自动解决病因重叠的问题。
因此,最有力的解读比标题所暗示的更为有限。AI 帮助研究人员将 MRI 和遗传数据组织为一个细致的区域老化模型。其输出为研究易感性提供了一种新的表型。
表型是由生物学和环境共同产生、可观察或测量的特征。在这里,它是一种由模型推导出的特征,而非直接观察到的疾病标志物。
最站不住脚的解读则是,该模型已经能够揭示个体患者的早期痴呆。现有证据并不支持这一结论。阿尔茨海默病协会的诊断指南将诊断描述为一个综合过程,结合病史、认知与功能评估、神经系统评估、影像检查,以及在适当情况下的体液生物标志物——而不是从一张模型生成的图谱得出结论。
这种差异会影响知情同意和沟通方式。即便某项发现的临床意义尚不明确,告诉某人其某个脑区看起来更“老”,也会带来情感上的负担。
研究人员需要明确的阈值、置信区间和后续处理路径。否则,一张可解释的图谱可能会制造出验证数据无法支撑的确定性印象。
Google News 的传播可能会加剧这一问题。聚合式标题会剥离方法学背景,将谨慎的研究与面向消费者的健康建议并置。读者很容易将“早期迹象”理解为经过验证的诊断,而非统计学研究信号。
压力落在医疗 AI 开发者和医疗系统身上
这项研究提高了人们对可解释影像 AI 的期待,同时也加大了压力:必须证明区域图谱能改善决策,而不只是带来更直观的可视化。
医疗 AI 开发者面临第一项挑战。一张色彩鲜明的区域图谱具有直观说服力。然而,可解释性不只是展示神经网络在哪个位置产生了高数值。
开发者必须证明,被突出显示的脑区在重复扫描中保持稳定。他们还需要证明,结果在不同医院、扫描仪型号和图像处理流程之间保持一致。
一个有用的系统必须在既有评估之外提供额外信息。对于痴呆研究,这些对照手段包括认知测试、临床病史、结构测量、血液生物标志物、脑脊液分析和正电子发射断层扫描。
针对阿尔茨海默病相关蛋白的血液检测正在快速发展。其中一些检测无需 MRI 处理即可发现淀粉样蛋白或 tau 蛋白相关信号。阿尔茨海默病协会的血液生物标志物临床实践指南强调,应在专业临床照护中使用这些检测,并配合以患者为中心的沟通和知情决策。区域脑龄模型必须证明,与这些成本更低的选项相比,它们能提供何种独特价值。
它们或许能在血液检测结果异常后提供解剖学背景,也可能有助于监测结构变化或区分疾病模式。但在比较性试验对其进行评估之前,这些用途仍只是假设。
医疗系统面临的是另一种压力。MRI 已较为普及,因此软件分析看起来似乎比一种新的扫描方法更容易部署。但在实践中,整合会带来运营和监管工作。
医院需要经过验证的软件、质量控制、安全的数据处理、临床医生培训以及处理不确定结果的流程。它们还需要证据证明,使用该模型能改善结局或提升试验招募效果。
如果一项预测无法改变管理决策,其临床价值就有限。早期检测最有意义的前提是,患者和临床医生能够基于结果采取行动,例如进一步检查、降低风险、治疗或参与研究。
监管机构会要求明确预期用途。用于发现疾病机制的研究工具,与用于预测无症状成年人的认知衰退的软件,面临不同要求。
风险分层与诊断之间的区别尤其重要。风险分层是将人群划分为需要不同后续随访的组别;诊断则是判断患者是否符合某种疾病的标准。
区域脑龄图谱看起来更接近风险研究,而非诊断。开发者不应在产品声明中模糊这一边界。
神经科学研究人员也面临标准化方法的压力。不同团队采用不同的 MRI 预处理、脑图谱、神经网络、训练人群和年龄偏差校正方法。
两个系统都可能产出“局部脑龄”,但实际测量的构念可能存在重要差异。共享基准和外部验证数据集将使比较更具信息价值。
研究人员还应在区域层面报告不确定性。没有置信度估计的图谱,可能会让轻微或不稳定的偏差看起来像是确定结论。
纵向数据将至关重要。横断面研究是在某一时间点比较不同人群;纵向研究则追踪同一批人,能够显示区域差距是否在症状出现前发生变化。
美国国家老龄化研究所此前曾介绍一项 AI 辅助研究,该研究结合神经学、遗传学、心血管及其他信息,识别出三种广泛的大脑老化模式。这项老化模式分析强化了一个更广泛的趋势:向多维模型发展。
正在出现的竞争并不只是一个 AI 模型对抗另一个 AI 模型,而是区域影像与多模态预测之间的竞争。
多模态模型结合多种数据类型,例如 MRI、血液生物标志物、遗传信息、病史和认知表现。这种方法可以捕捉更多生物学信息,但也带来成本、缺失数据和可解释性问题。
局部脑龄可能成为这类系统的一个组成部分。它独自充当完整痴呆检测器的可能性较低。
关注医疗 AI 的知识工作者,应采用与评估企业模型相同的证据标准。一套引人注目的输出界面,并不能证明其准确性、泛化能力或实际价值。
团队可以在结构化的 AI knowledge base 中保存研究主张、局限性、数据集和后续结果。当新闻标题、预印本和同行评审证据同时流传时,这种区分很有帮助。
目前的实际压力在于,开发者必须超越回顾性关联。他们必须证明局部图谱在前瞻性研究中保持可靠、能改善预测,并支持更好的决策。
三个信号将决定这些图谱是否重要
下一阶段并不是再出现一张吸引眼球的大脑图像,而是独立的前瞻性证据,将区域年龄差距与真实临床结局联系起来。
第一个信号是跨多元人群和影像中心的重复验证。研究人员需要在 UK Biobank 之外、覆盖更广泛祖源群体的样本中,复现区域遗传关联。
成功的重复验证将强化这一主张:局部脑龄反映的是普遍的生物学过程。如果识别出的基因或脑区发生较大变化,则可能说明队列构成塑造了原始图谱。
外部 MRI 验证应涵盖多家扫描仪制造商和采集协议。稳定的区域估计将支持未来的临床标准化。
第二个信号是前瞻性转化准确性。研究必须招募认知健康的参与者,在症状出现前生成预测,并对他们进行多年随访。
研究人员应报告敏感性、特异性、校准度和阳性预测值。校准度衡量预测风险是否与观察到的结局相符。
最有说服力的设计,是将局部脑龄图谱与全脑脑龄、常规 MRI 指标、认知测试和现代生物标志物进行比较。它应表明,在考虑这些替代方案后,区域模型是否仍能提供有用信息。
若证据表明这些图谱能够更早且可靠地识别个体的疾病转化,将强化早期检测的叙事。若仍主要依赖群体层面的差异,该叙事就仍未得到证实。
第三个信号是临床效用。即使预测准确,也必须带来更好的决策或结局。
一项试验可以测试局部图谱是否能改善预防性研究的入组资格决策。另一项可以考察这些图谱是否有助于临床医生选择后续检查或监测疾病进展。
研究人员还必须评估危害,包括误报、不必要的医疗操作、焦虑、不均等的表现,以及阴性结果带来的错误安心感。
通过 Google News 突出的这篇文章之所以重要,是因为它将区域解剖学与大规模遗传分析联系起来。它为科学家提供了更丰富的框架,以探究为何某些神经系统似乎比其他系统更容易受到影响。
这并不是 Google 构建了医疗模型的证据。它并不能证明一次 MRI 就能诊断临床前痴呆。它也不是让个人在缺乏临床指导的情况下解读研究级脑龄估计的理由。
目前,最站得住脚的结论是,AI 能揭示被全脑平均值掩盖的结构化模式。这些模式值得仔细检验,因为它们与具有生物学相关性的网络和遗传通路存在重叠。
决定性问题在于,它们是否比现有证据更好地预测一个人的未来。请关注独立重复验证、前瞻性转化结果,以及证明这些图谱能改善照护的试验。在这些信号出现之前,读者应将 Google News 的标题视为一项有前景的研究,而非临床定论。


