USC 的 AI 绘制局部脑衰老图谱,但并非诊断工具
- Olivia Johnson
- 1小时前
- 讀畢需時 14 分鐘
Google News 重点报道了一款由 USC 主导、基于 14,250 份 MRI 扫描训练的 AI 模型,但其细致的脑衰老图谱仍属于研究发现,而非临床诊断。
该模型不再只给出一个预估脑龄,而是在整个大脑皮层表面提供数千个局部估计。这一转变让研究人员能更清晰地观察结构性衰老似乎集中在哪些位置。
其中的矛盾很直接。区域图谱能够揭示单一全局评分隐藏的模式,但更高的细节并不会自动带来更高的诊断确定性。
研究团队发现,与阿尔茨海默病相关的最大差异位于海马旁回,这是一个参与记忆和导航的脑区。不过,该模型从结构解剖特征中学习年龄模式,而非阿尔茨海默病特异性的分子生物学特征。
这种区别划清了信息丰富的研究工具与医学检测之间的界线。它也解释了为什么放射科医生、神经科医生和 AI 开发者在接受其最吸引人的图像之前,应先审视模型的运行机制。
Google News 报道的这款 MRI 模型
重要变化并非又一种脑龄估计,而是从单一全脑数值转向高分辨率皮层图谱。
由 Samuel D. Anderson 和 Andrei Irimia 领衔的研究人员开发了一种用于估计局部脑龄的图神经网络。团队成员包括与南加州大学和阿尔茨海默病神经影像倡议组织有关联的研究者。
图神经网络处理的是以相互连接的点表示的信息。在这里,这些点对应于大脑皮层表面标准化模型上的顶点。
这些连接保留了相邻区域之间的空间关系。这种设计让模型能够分析皮层解剖结构,而不必将大脑视为平面图像或普通的矩形网格。
根据团队的局部脑龄研究,每个人的皮层表面都以多个网格分辨率表示。最高分辨率的表示在两个半球中共包含 81,924 个顶点。
最终预测中,相邻顶点之间的平均距离为 1.37 毫米。每个顶点都会根据从 T1 加权 MRI 中提取的结构特征获得一个预估局部脑龄。
T1 加权 MRI 是一种标准解剖扫描,可提供脑组织之间的细致对比。该方法并不直接测量淀粉样斑块、tau 蛋白缠结、神经活动或血液化学指标。
该模型使用了五种形态测量特征,分别为皮层厚度、表面积、曲率、脑沟深度,以及灰质与白质强度比。
皮层厚度衡量大脑外层灰质跨越的距离。表面积描述该折叠层的范围,而曲率和脑沟深度则刻画其几何形态。
灰质与白质强度比反映相邻组织类型之间的对比度。这一比值的变化可能反映衰老、组织组成、扫描仪特征,或其他生物学和技术因素。
研究人员使用 14,250 名认知正常成年人的皮层网格训练网络。他们使用 UK Biobank 数据进行训练,并利用阿尔茨海默病神经影像倡议组织的数据评估与阿尔茨海默病相关的模式。
这款 USC 脑衰老 AI 模型在每个皮层顶点都生成预测。对这些预测取平均值仍可得到全局脑龄估计,但局部输出保留了空间信息。
在 13,146 名参与者中进行交叉验证后,模型的平均绝对误差为 7.56 年。平均绝对误差描述预测年龄与实际年龄之间的平均差距,不考虑偏差方向。
在完整数据集上重新训练后,该模型在认知正常的 ADNI 参与者中记录到 7.33 年的误差;在阿尔茨海默病参与者中,误差达到 8.15 年。
这些数字为色彩鲜明的图谱划定了必要的边界。该模型能够识别人群层面的解剖模式,但个体的区域估计仍可能与实际年龄存在较大差异。
因此,谨慎解释局部脑龄意味着将其视为一种解剖学比较,而不是对每个微小脑区实际年龄的字面测量。输出结果反映的是网络从训练数据中学到的内容。
Google News 的关注之所以重要,是因为这种呈现方式在直觉上非常有吸引力。一张显示某些区域看起来更老、另一些区域看起来更年轻的图谱,比单一抽象评分更令人觉得可采取行动。
但目前,这类图谱的价值仍在于研究解读。它可以帮助研究人员提出问题:结构性衰老在哪些部位存在差异,以及这些模式是否与认知或疾病有关。
通过皮层结构理解局部脑龄
该模型的主要贡献是解剖学定位,而不是声称 AI 可以通过常规 MRI 诊断阿尔茨海默病。
大多数脑龄系统会将多项解剖测量压缩为一个预测年龄。研究人员随后从中减去实际年龄,以计算脑龄差。
正值意味着在模型的参考人群中,大脑看起来比预期更老。负值则意味着看起来更年轻。
这一全局评分简洁易懂,但简洁也会带来信息损失。两个人可能得到相同的全局结果,却呈现不同的区域模式。
一个人可能具有看起来更老的颞叶结构和更年轻的额叶区域。另一个人则可能恰好相反,但经过平均后,两人的总体评分可能显得相似。
局部估计能够保留这些差异。USC 脑衰老 AI 系统将这一理念直接应用于皮层表面,而不只是生成全脑摘要。
其架构采用基于图的 U-Net 设计。U-Net 通过编码器压缩信息,并通过解码器重建细致预测,同时借助跳跃连接保留早期特征。
在这里,图卷积层会聚合相连皮层顶点的信息。网络逐步在多种网格分辨率之间转换,随后在最精细层级返回局部年龄估计。
这种方法适合皮层,因为皮层是折叠且不规则的。传统图像卷积天然适用于矩形像素或体素,但皮层邻域遵循的是弯曲表面。
图表示保留了这些邻域关系,也让研究人员能够在数千人之间对齐相同的解剖框架。
团队利用积分梯度来检视哪些特征影响了预测。积分梯度是一种归因方法,用于估计每项输入对模型输出的贡献强度。
表面积产生了最强、最广泛的贡献,尤其是在脑回顶部和高度折叠区域。脑回是大脑外表面可见的隆起褶皱。
皮层厚度在枕叶表现出更集中的影响。这些后部区域支持视觉处理,其衰老模式可能不同于额叶或颞叶区域。
灰质与白质强度比在额叶区域和深脑沟中贡献最强。脑沟是皮层褶皱之间的沟槽。
曲率在脑沟区域周围呈现出相关模式。脑沟深度的贡献低于其他特征,且影响更弱、更分散。
这些结果为解读模型提供了机制依据。它并未在每个位置依赖同一种便捷的测量指标。
相反,不同解剖特征在不同皮层区域具有更大权重。表面积在广泛范围内重要,而皮层厚度的作用更为局部化。
研究人员还将前额叶和顶叶联合皮层确定为认知正常参与者中形态测量衰老的早期部位。联合皮层负责整合专门化感觉和认知系统中的信息。
这一模式与“后进先出”假说相一致。该假说认为,发育较晚的脑区往往更容易受到与年龄相关的衰退影响。
不过,归因图并不能确立因果关系。一项特征可以影响预测,却未必是观察到的衰老过程的生物学驱动因素。
扫描仪设置、预处理选择、人口统计构成和相关解剖特征都可能影响模型归因。积分梯度让系统更便于检查,但并不能解决所有解释性问题。
此前的研究已经显示,局部脑龄估计在技术上是可行的。一项 2021 年的U-Net 脑模型基于 3,463 名健康参与者训练,从 MRI 体积数据生成了局部年龄图谱。
该早期模型在 692 名健康参与者以及 267 名轻度认知障碍或痴呆患者中进行了测试。其报告的个体内平均绝对误差中位数为 9.5 年。
新系统改变了表示方式和规模。它沿皮层网格工作,使用多种形态测量特征,并在规模大得多的认知正常人群中训练。
因此,其底层概念属于演进,而非完全创新。技术进展在于利用图架构以高空间分辨率绘制皮层形态。
这种区别让报道保持客观。该模型推动的是一条已经发展多年的研究路径,而不是凭空创造局部脑龄分析。
MRI AI 对阿尔茨海默病的影响具有区域性
最显著的阿尔茨海默病结果并不是病患大脑整体看起来更老,而是特定的记忆相关颞叶区域呈现最大差异。
当研究人员将阿尔茨海默病参与者与认知正常参与者进行比较时,经偏差校正后的平均全局脑龄差相差 1.49 年。
若看区域结果,多个区域的差异更大。海马旁回显示出最大的区域平均差异,为 2.72 年。
海马旁回支持记忆形成和空间处理。它靠近阿尔茨海默病期间经常受影响的结构。
其他几个颞叶区域显示出 2.21 至 2.34 年的差异,包括颞下回、颞极、颞平面、梭状回和外侧枕颞沟。
外侧眶沟显示出报告中最小的区域差异,为 0.71 年。这种对比说明,单一全局平均值为何会掩盖空间差异。
当 MRI AI 对阿尔茨海默病影响的分析能够识别差异集中在哪里时,其信息价值会更高。它可以引导研究人员关注值得进行更深入生物学或纵向研究的区域。
团队还检验了脑龄差与认知测试评分之间的关系。他们将全局结果与选定皮层区域的局部估计进行比较。
在认知正常参与者中,研究人员没有发现所测试的脑龄差与认知评分之间存在显著关联。
阿尔茨海默病组则呈现不同模式。全局和区域脑龄差均与多项记忆、日常功能和疾病严重程度指标相关。
海马旁回估计值与功能活动问卷、临床痴呆评定量表总分盒数、阿尔茨海默病评估量表和简易精神状态检查之间表现出尤其强的关联。
对于其中大多数测试,海马旁回的关联强于基于全脑脑龄差的关联。作者指出的例外是数字符号替换测试表现。
颞极也捕捉到了全局指标遗漏的关联,包括与连线测试 B 部分和语言学习表现之间的关系。
作为对照中最弱的区域,外侧眶沟显示出较少的显著关系。在研究的分析后,其局部差值与即时语言回忆或简易精神状态检查得分均无显著关联。
这种模式支持了研究人员的核心论点:局部估计能够保留在整个皮层被简化为一个数字时消失的、具有临床相关性的空间信息。
然而,关联并不等于前瞻性预测。该研究并未证明区域脑龄图能够预测哪位健康人士会发展为阿尔茨海默病。
它也未证明改变局部差值会改善认知。研究结果将结构模式与所分析队列中既有的疾病状态和测试表现联系起来。
因此,模型输出应被理解为候选影像表型。表型是研究人员可与基因、症状、暴露因素或治疗反应进行比较的可观察特征。
这一研究方向已经在扩展。另一项区域遗传学研究分析了 41,708 名认知正常 UK Biobank 参与者的 MRI 和遗传数据。
该研究将局部脑龄值映射至 148 个区域,发现至少在一个区域中与局部脑龄差相关的 1,212 个遗传变异。
涉及的基因涵盖发育、代谢、免疫和细胞骨架通路。这些发现表明,区域性衰老模式可作为解剖结构与群体遗传学之间的桥梁。
图模型增添了互补的一层。它并非从预先定义的区域平均值出发,而是在密集的皮层网格上估计衰老情况。
这些方法共同推动脑龄从单一记分牌转向一组空间测量指标。研究人员可以将这些指标与认知、遗传变异或疾病进展进行比较。
这才是 MRI AI 对阿尔茨海默病产生的实质影响:它创造了更细致的研究变量,而不是为患者给出自动化结论。
地图比证据基础更精细
更高的空间分辨率增加了研究人员可以提出的问题数量,但也加重了验证负担。
该研究最重要的局限涉及临床解释。结构性衰老并非阿尔茨海默病所特有。
许多疾病都会影响皮层厚度、表面积或组织对比度,包括血管疾病、损伤、炎症、精神疾病及其他神经退行性疾病。
正常变异同样重要。教育程度、心血管健康、睡眠、药物、饮酒和社会经济状况都可能与脑结构相关。
模型可以检测到看起来更老的区域,却无法确定其原因。它无法判断差异代表活跃的退化、终生存在的解剖特征,还是测量变异。
当前的阿尔茨海默病评估结合病史、认知评估、神经系统检查和适当的生物标志物。MRI 通常有助于识别结构性变化,并排除其他解释。
阿尔茨海默病协会的诊断指南将 MRI 描述为更广泛医学检查的一部分,并未将 AI 衍生的结构年龄图视为独立诊断。
现代生物学标准强调阿尔茨海默病特异性证据,尤其是淀粉样蛋白和 tau 生物标志物。结构性神经退行可支持分期,但并非由阿尔茨海默病病理独有地引起。
新模型从未声称相反。其论文将其描述为研究皮层衰老模式及未来研究或临床应用的框架。
其阿尔茨海默病评估还使用了 ADNI——一个经过深入研究的研究数据集。ADNI 提供精心收集的影像和认知信息,但其参与者和流程并不代表所有临床环境。
现实中的医院使用来自不同制造商的扫描仪、不同磁场强度、采集协议和软件配置。运动、头部定位、伪影和不一致的预处理都会改变结果。
人口学泛化也带来另一个担忧。当模型部署到与训练队列不同的人群中时,其表现可能不同。
一项 2026 年的多队列评估在四个包含 1,634 名参与者的独立数据集上测试了四种公开可用的脑龄模型。
研究人员发现泛化能力和偏差存在实质性差异。结果强调了年龄偏差校正和谨慎外部评估的必要性。
年龄偏差是指回归模型系统性高估较年轻参与者、低估较年长参与者的情况。这种模式会扭曲脑龄差。
USC 牵头的团队在报告组间差异前进行了偏差校正。即便如此,校正方法仍可能依赖参考人群和统计假设。
相对于组间报告的区域差异,模型误差仍然显著。7.56 年的交叉验证误差远大于海马旁回 2.72 年的组间差异。
这种比较并不否定统计发现。即使个体预测误差相当大,群体层面的效应仍可能出现。
但它限制了针对单一患者的随意解读。临床医生不能安全地将较小的区域差值转化为关于疾病状态的精确结论。
这些地图还带来了多重比较问题。数千个局部估计可以揭示有意义的模式,但也提供了许多产生不稳定关联的机会。
研究人员需要预注册验证、独立队列和重复扫描。他们还需要不确定性区间,以传达个体和区域层面的置信度。
纵向数据将增强模型的价值。单次扫描只是将一个人与从不同年龄人群中学习到的模式进行比较。
这种横断面设计无法直接测量同一个人的大脑变化速度。仅观察一次时,稳定的解剖差异可能看起来像加速衰老。
USC 研究人员已在关于 AI 衍生衰老速度指标的另一项工作中探讨过这一区别。他们的衰老速度研究尝试估计生物学变化,而不仅是年龄外观。
局部皮层模型尚未解决累积解剖特征与当前衰老速度之间的差异。重复扫描将显示,看起来更老的区域是否持续以异常快速的速度变化。
最有说服力的未来测试将长期跟踪多元化的参与者。它会将局部地图与认知变化、分子生物标志物、诊断和治疗结果进行比较。
在此之前,用临床语言解释局部脑龄需要保持克制。它描述的是解剖结构与年龄预测模型的比较,而不是某个区域实际经历了多少生物学年限。
Google News 读者接下来应关注什么
下一阶段应以外部验证、纵向预测和临床整合来评判,而不应仅凭更清晰的可视化效果。
第一个信号是跨扫描仪和人群的独立复现。另一个研究团队应在不依赖相同训练流程的情况下复现这些区域模式。
复现研究应包括来自多种种族、族裔、地理和社会经济背景的参与者,也应测试普通临床扫描,而不仅是精心筛选的研究数据。
稳定的模型应能在不同地点保留有意义的区域排序,而不应要求每家医院围绕单一扫描仪或狭窄的参考队列重建系统。
如果独立研究复现海马旁回和颞叶发现,人们对该模型解剖学信号的信心将会提升。若无法复现,则可能表明队列或预处理选择推动了部分结果。
第二个信号是纵向预测。研究人员需要证明局部差值能否预测后续扫描中的认知下降、疾病转化或区域萎缩。
一项有用的研究会从认知正常参与者或轻度认知障碍患者开始,随后检验基线地图能否在标准年龄、认知和 MRI 指标之外进一步预测结果。
这种比较必须体现增量价值。如果传统测量能够提供相同信息,再技术先进的模型也只有有限的临床价值。
纵向工作还应将稳定的解剖差异与活跃变化区分开来。一个人的正脑龄差可能多年保持不变,并不表明正在发生更快的持续衰退。
证明特定局部模式可预测未来恶化的证据,将加强其研究价值。预测若较弱或不一致,该模型仍将主要是描述性的。
第三个信号是与阿尔茨海默病特异性生物标志物的整合。结构地图应与淀粉样蛋白、tau、血液生物标志物和临床评估进行比较。
这项工作可以确定局部衰老反映的是阿尔茨海默病生物学、一般性神经退行,还是多种过程的混合。
修订后的生物学标准将核心阿尔茨海默病生物标志物与非特异性神经元损伤标志物区分开来。局部结构地图目前更接近后者。
这种整合仍可能证明具有价值。区域脑龄模式可以帮助解释损伤出现在哪里,而分子生物标志物则识别与该损伤相关的疾病过程。
它们还可能帮助研究人员对临床试验进行分层。分子检测结果相似的参与者,可能表现出不同的解剖脆弱性、进展速度或认知特征。
目前没有证据支持使用该模型选择治疗方案。这一步需要前瞻性试验、标准化阈值、不确定性报告和监管审查。
开发者应关注该团队是否发布代码、模型权重、预处理要求和校准程序。可复现性并不只取决于发表一张架构图。
放射科团队应关注阅片者研究。这类研究将测试,在现有工作流程中加入区域地图后,是否能改善解读、降低变异性或改变决策。
患者应关注个人获益的证据,而不是吸引人的图形。一个有用的临床工具必须提供医生能够解释并据以采取行动的信息。
Google News 可以让一种新兴方法获得广泛关注,但关注度并不等于验证。负责任的问题是,未来研究能否弥合队列层面绘图与个体照护之间的差距。
关注医疗 AI 的读者应将源论文、验证报告和后续复现研究一并保存。结构化的个人知识系统可以让这些不断变化的主张更易于随时间比较。
USC 的大脑衰老 AI 模型作出了重要的技术贡献。它以适配大脑褶皱几何结构的形式表征皮层解剖特征,并保留了全局平均值所掩盖的区域差异。
其关于阿尔茨海默病的发现具有生物学合理性,也提供了有统计意义的信息。但这些发现仍受预测误差、队列依赖性以及结构性 MRI 缺乏特异性等因素限制。
下一条新闻不应只是庆祝一张更密集的图谱,而应报道独立复现、前瞻性预测或可量化的临床价值。
当 Google News 上再次出现呈现这类证据的报道时,请问三个问题:该模型是否在其他环境中接受过测试?它是否预测了未来结果?它是否改善了实际决策?