top of page

新型 AI 模型绘制区域脑老化图谱,但精细图谱并非诊断

8月11日
讀畢需時 15 分鐘

Google News 聚焦了一款新型 AI 模型,它能将 MRI 扫描转化为精细的区域脑老化图谱,用更细致的画面取代单一的年龄汇总值。

这一转变带来了核心张力。单一脑龄估计易于沟通,却可能掩盖不同区域之间的重要差异。局部图谱提供了更多信息,但每增加一项估计,也就多了一次出现误差、偏差或过度解读的机会。

最新报道的这项研究使用深度学习,从 T1 加权 MRI 扫描中估计局部脑龄。其图谱显示,在认知正常成年人中,额叶和颞叶区域的老化程度相较顶叶和枕叶更为显著。该分析还将区域模式与认知表现联系起来,并考察了轻度认知障碍和阿尔茨海默病中逐步显现的、更具老化特征的额颞叶模式。

这并不是首次尝试对脑老化进行定位。早期的 U-Net 研究已生成体素级年龄图谱,其他团队也研究了区域梯度和可解释的 MRI 特征。新研究的重要性在于,它将这一研究方向拓展至一个大型多中心数据集,并将空间估计与认知联系起来。

因此,主要竞争并非发生在某个 AI 实验室与另一个实验室之间,而是在区域脑龄绘图与将整个大脑压缩为一个预测年龄这一传统做法之间。

这场竞争将决定脑龄 AI 是发展为有用的研究工具,还是成为又一种外观吸引人、但临床意义仍不确定的医学可视化成果。

Google News 聚焦更精细的脑老化图谱

该模型改变了分析单位,从单一预测脑龄转向多个空间局部化估计。

传统脑龄系统从 MRI 数据中学习与实际年龄相关的模式,然后估计一份新扫描相对于训练扫描呈现出的年龄。

研究人员常会计算脑龄差,即预测年龄与实际年龄之间的差值。正值表示在模型看来,大脑显得更老;负值则表示它显得更年轻。

这一全局数值显然颇具吸引力。研究人员可以将一个数字纳入分析、比较不同群体,并考察其与健康状况或认知能力的关联。这种简洁性也让脑龄更容易向神经科学领域之外的人解释。

然而,单一数值可能掩盖同一个人体内不同的变化轨迹。额叶区域或许呈现更老化的模式,而枕叶区域则看起来更接近其基于年龄的参考水平。将这些信号合并,可能会抹去这种对比。

Google News 所聚焦的研究通过局部脑龄来应对这一限制:它是在 MRI 的不同部分生成的空间估计,而非将大脑作为一个整体进行估计。据报道,该模型使用来自多个中心的 14,748 名认知正常参与者的 T1 加权扫描进行训练。

T1 加权 MRI 是一种结构性成像方法,可在脑组织之间形成清晰的细节对比。它被广泛用于检查包括灰质、白质和区域体积在内的解剖结构。

该系统学习与年龄相关的图像特征,并生成一幅图谱,显示哪些组织看起来相对更老或更年轻。其报告的模式显示,额叶和颞叶的老化程度高于顶叶和枕叶。

在现有神经科学框架下,这种从前部到后部的差异是合理的。一项针对 335 名神经功能完整成年人的 2025 年研究发现,相较于感觉运动区域,额叶联合皮层的老化更为加速。其区域脑梯度也比全局脑龄差更能解释行为差异。

新模型并非只是为熟悉的解剖学测量结果着色。深度神经网络能够识别研究人员并未预先定义的强度、形状、纹理和空间关系组合。

这种灵活性既是其吸引力所在,也是问题所在。图谱可以揭示超出常见测量指标的结构,但一个有颜色的区域并不会自动说明其评分背后的生物学过程。

一块看起来更老化的区域可能反映多种因素,包括普通的解剖差异、血管健康状况、扫描仪特性、图像预处理,或与神经退行性变相关的模式。

因此,重要的变化是技术性的,而非诊断性的。研究人员如今拥有了一种更精细的假设生成工具,可用于探究与老化相关的 MRI 信号集中于何处,以及这些信号如何与认知相关。

Google News 的标题捕捉到了视觉层面的进步。然而,其科学价值取决于这些局部估计能否在不同扫描仪、不同人群以及重复测量中保持稳定。

单一脑龄始终是不完整的概括

区域绘图对全局脑龄方法提出了挑战,因为大脑并不会作为一个均匀的解剖整体而老化。

不同区域以不同的节奏发育,支撑不同的功能,也表现出不同的脆弱性。额叶联合区参与规划、执行控制和复杂行为。颞叶结构则有助于记忆、语言和物体识别。

顶叶区域帮助整合感觉信息并支持注意力。枕叶区域处理视觉信息。这些宽泛描述彼此有所重叠,但清楚说明了为何单一年龄评分会丢失有意义的空间信息。

设想两名全局脑龄差相同的人。其中一人的较高估计值可能集中在额叶区域周围,另一人则可能在多个脑叶中呈现较小幅度的升高。

全局模型可能为他们给出相同的数值。区域模型则能够保留他们不同的模式,从而提出有关认知、风险因素和未来变化的可检验问题。

此前的研究为这一思路奠定了技术基础。一项在 3,463 名 18 至 90 岁健康参与者中训练的局部脑龄模型生成了个体化三维图谱。它还发现,健康对照者、轻度认知障碍患者和痴呆患者之间存在不同的局部模式。

更新近的研究已将区域估计与皮层组织结构联系起来。2025 年的梯度研究在两个独立队列中识别出六种可重复的空间模式,其中四种与既有的神经生物学层级相吻合。

这些结果支持“后进先出”的解释。发育较晚的大脑区域,尤其是联合皮层,在老化过程中可能比更早形成的感觉运动系统表现出更大的脆弱性。

该研究也提出了重要警示。其行为效应幅度有限,研究人员明确呼吁进一步探究可改变的健康因素和个体差异。区域精度并未使这种方法成为临床检测。

另一项 2026 年分析采取了不同路径。研究人员利用来自多个大型数据集的 14,555 名认知正常参与者 MRI 数据,训练了可解释的深度神经网络,随后对另外 25,539 名 UK Biobank 参与者进行了脑龄估计。

这项可解释 MRI 研究发现,在参与者进入 50 多岁时,与老化相关的特征开始在额外侧、边缘系统中部、楔叶和枕颞区域变得突出;其空间扩张速率则在 60 多岁达到峰值。

研究人员报告称,包括厚度、面积、体积和曲率在内的常见形态学测量指标,只能解释模型显著特征中的一小部分。这一发现表明,深度学习能够检测到标准解剖学概括之外的信息。

但这并不能证明这些额外信息代表什么。模型显著性标示的是影响预测的图像位置,而不是其背后的细胞或分子原因。

这一区别很重要,因为医学受众往往会将图谱视为直接观察结果。红色区域看起来像是测得的异常,即便其颜色实际代表的是模型相对于参考人群的统计偏离。

区域脑龄绘图促使研究人员在术语上更加严谨。“看起来更老”应当意味着模型发现了一种与年龄相关的 MRI 模式,而不应自动意味着受损、患病或注定会衰退。

超越单一数字在科学上是合理的。然而,它也带来了更重的验证负担,因为研究人员现在必须在许多空间位置上建立可靠性,而不仅仅是验证一个整体评分。

局部脑龄如何将 MRI 与认知联系起来

区域图谱最有用之处不在于其视觉细节,而在于它能够检验位置特异性模式是否与特定的人类能力相对应。

全局脑龄差可能与认知或神经系统疾病等广泛结果相关。但这种关联仍无法让研究人员确定究竟是哪种解剖模式承载了信号。

局部估计让更具体的假设成为可能。颞叶模式可与记忆表现进行比较,额叶模式则可结合执行功能、注意力或处理速度来考察。

据研究摘要介绍,新近报道的模型将这一逻辑扩展到认知正常的成年阶段。其局部图谱显示,额叶和颞叶存在相对更显著的老化,并将区域差异与认知表现联系起来。

这种关系使该图谱有可能成为一种研究表型。表型是用于研究人群差异的可观察特征,无论其是否用于医学诊断。

“联系”一词值得强调。一项横断面关联无法证明看起来更老化的区域导致了较低的认知表现。这两项测量都可能反映年龄、健康、教育、血管因素或其他影响。

最有力的支持证据来自直接比较区域方法与全局方法的研究。在 2025 年脑梯度研究中,在考虑人口统计学因素后,参与者层面的区域模式有助于解释认知和感觉运动表现。

在年龄、性别和教育程度之外,全局脑龄差并未改善行为模型。这一对比表明,空间组织可能携带了全脑平均过程中丢失的信息。

这些效应并不一致。区域因素改善了包括认知、视觉和听觉在内的一些指标模型。对于平衡和运动能力,结果则取决于分析方法。

这种不均衡的表现本身具有信息价值。区域模型不应仅因能生成解剖细节丰富的图谱,就被期待预测每一种行为。

其他研究表明为何需要更大规模的研究。一项 2026 年调查汇集了来自 13 项研究、3,700 名认知健康成年人的逾 10,000 次 MRI 扫描和超过 13,000 次记忆评估。

记忆衰退分析发现,结构变化与记忆之间存在非线性关系。这种联系在年龄较大的成年人中更强,并不局限于某一个区域。

这一结果并不支持“一个区域对应一种功能”的简单化解读。记忆依赖于网络,而结构性衰老可能同时影响多个相互连接的区域。

如果研究人员分析协调变化的模式,新的局部模型可以帮助呈现这种复杂性。若孤立解读单个彩色斑块,其说服力就会减弱。

这一机制也解释了为什么详细图谱可能优于单一评分,却并不因此具备决定性的临床意义。它们保留了空间协方差,即不同区域之间共享的变化模式。

模型或许会发现,多个区域以反复出现的构型共同衰老。研究人员随后可以探究,这种构型与认知的关联是否强于任何单一区域或全脑平均值。

这为管理大型影像数据集的神经科学团队带来了实际机会。局部图谱可以整理观测结果、支持亚组发现,并为纵向研究提供假设方向。

这些工作流程也会产生大量辅助材料,包括模型卡、预处理记录、分析笔记本和影像协议。可搜索的技术知识库可以帮助团队关联这些文档,而不将 AI 输出视为事实依据。

科学价值将来自重复测量。如果同一个人的局部估计发生变化,研究人员需要判断这种变化是否超出了扫描仪和模型的正常波动范围。

缺乏这类证据时,详细图谱仍只是统计相似性的快照。它尚不能说明某个特定个体大脑衰老的速度。

临床鸿沟比图谱所呈现的更大

在研究人员确定其诊断意义之前,高分辨率预测很容易显得具有医学精确性。

这项新研究中认知正常的训练人群有助于建立年龄参考,但也限制了模型能够针对疾病得出何种结论。

训练目标为预测实际年龄的模型,并不会直接学习阿尔茨海默病病理。它学习的是训练数据中有助于区分年龄的 MRI 特征。

其中一些特征可能与神经退行性过程重叠。另一些则可能反映典型衰老、群体差异、扫描仪效应或相关健康状况。

因此,报告中从认知正常成人到轻度认知障碍和阿尔茨海默病的进展过程很重要,但并非定论。一个看起来更老的额颞叶模式可以区分群体,却未必能预测个体未来的诊断结果。

轻度认知障碍也有多种成因和结局。有些人会进展为痴呆,有些人保持稳定,另一些人在后续评估中则会改善。

有用的临床生物标志物必须在既有变量之外提供额外信息。这些变量包括年龄、认知测试、病史、结构 MRI 发现,以及在适当情况下的疾病特异性生物标志物。

与淀粉样蛋白和 tau 蛋白的比较尤其敏感。淀粉样蛋白和 tau 蛋白与阿尔茨海默病病理相关,通常通过正电子发射断层扫描、脑脊液或血液检测进行评估。

MRI 模型特征与已知病理模式在空间上的相似性具有科学意义,但并不意味着结构 MRI 模型测量了其中任一种蛋白质。

这项 2026 年的可解释性研究发现,一些由 AI 检测到的特征呈现出类似淀粉样蛋白或 tau 蛋白模式的空间和时间动态。作者在指出潜在临床相关性的同时,也呼吁未来进行验证。

他们的论文同样表明,解读为何困难。标准皮层厚度和萎缩指标并未紧密追踪相同模式,说明该网络可能学到了更细微的特征。

细微并不必然意味着特异。某项特征可以具有可重复性并能预测年龄,同时在生物学上仍然含义不明。

数据集构成带来了另一种风险。多中心训练扩大了样本量和变异范围,但扫描仪、采集协议、重建软件和预处理流程都可能留下可检测的特征。

当这些特征与参与者年龄相关时,神经网络可能会利用它们。细致的协调处理和按站点留出验证可以减轻这一问题,但任何单一评估都无法将其完全消除。

人群代表性同样重要。许多大型神经影像数据集中的参与者,相比最终进入临床的人群,往往更健康、更富裕且多样性较低。

基于某一人口统计分布构建的参考图谱,可能会向该分布之外的人群赋予误导性的偏离值。年龄、性别、祖源、教育程度、血管健康和社会经济条件都可能影响观察到的解剖结构或其解读。

一项 2026 年国际研究展示了更广泛的背景。研究人员分析了来自 34 个国家的 18,701 人,并对 73 项环境因素建模。他们的大脑暴露组研究发现,环境和社会条件的综合作用比单独考虑的个体暴露因素解释了更多的大脑衰老差异。

这些证据并未否定局部脑龄图谱。它意味着,源自影像的评分可以概括结果,却无法识别产生这些结果的驱动因素。

临床部署还需要在个体层面进行校准。模型可能在数千份扫描中表现良好,却为某一特定患者产生不稳定或误导性的结果。

研究人员需要了解亚组表现、不确定性估计、重复扫描可靠性和前瞻性结局。他们还需要与能够改善医疗决策的阈值建立联系。

缺少这些要素时,这些图谱应继续作为研究输出。它们可以支持发现、队列分析和假设生成,但不应让个体患者感到安心或恐慌。

在这些区别尚未厘清之前,Google News 的曝光可能会加速公众兴趣。出版商、研究人员和医疗系统应将该模型描述为一种影像分析方法,而非痴呆检测器。

区域 AI 模型正汇聚到同一研究方向

更广泛的领域正从通用脑龄评分转向可解释的空间模式,尽管不同方法对这些模式的定义并不相同。

一种路径产生体素级估计。每个体素,即三维图像元素,都会获得用于局部年龄预测的信息。

另一种路径为预先定义的解剖区域计算年龄。这种方法更容易与已知结构比较,但取决于所选用的大脑图谱。

第三种路径识别跨越多个区域的潜在梯度或聚类。它将衰老视为跨网络的协调变化,而非孤立结构中的独立变化。

这些方法并不能互相替代。体素图提供精细的空间细节,但可能存在噪声。基于图谱的估计更易于汇总,但可能掩盖区域内部的变化。

梯度模型能够捕捉分布式组织结构,但需要额外的统计层。其因子也可能随着数据集或建模决策变化而改变。

新的 AI 模型属于细粒度图谱方法。若基础研究提供完整的外部验证,其规模和认知分析可使其成为有价值的基准。

其他研究也在并行推进。一项遗传学研究使用了来自 41,708 名认知正常 UK Biobank 成人的 T1 加权 MRI 扫描所得到的局部脑龄估计。

研究人员确定了 1,212 个与至少一个区域局部脑龄相关的遗传变异。他们的遗传衰老图谱将这些变异与发育、代谢、免疫和细胞骨架通路联系起来。

空间聚类还与阿尔茨海默病和额颞叶痴呆易受累的区域重叠。这一发现支持这样一种观点:区域性衰老模式反映的是协调的生物学程序,而非随机的局部噪声。

不过,遗传关联增加的是群体层面的解释,而非个体层面的确定性。与区域评分相关的变异,并不会使该评分成为确定性的标志物。

另一种模型——规范性偏离图谱——分析了 10,539 名年龄介于 4 至 98 岁参与者的 223 个脑区 MRI 衍生体积。它先比较不同年龄段的区域体积,再将偏离值整合为最终年龄估计。

这种方法偏向预先定义且可解释的区域测量。深度学习则直接从图像中学习特征,可能捕捉更多信息,但也使生物学解读更加困难。

因此,竞争并不只是局部与全局之间的竞争,也涉及透明度与特征发现之间的取舍。

传统测量方法告诉研究人员哪些内容进入了模型。皮层厚度、体积、表面积和曲率都具有熟悉的解剖学含义。

深度网络可以发现这些测量遗漏的模式。研究人员随后需要借助显著性工具、外部数据集、遗传证据、病理比较或纵向结局,来理解网络使用了什么。

没有任何一种方法赢得了这场竞争。最可能的结果是一个分层系统,将可解释的测量与学习得到的特征和明确的不确定性结合起来。

对技术团队而言,这个领域为可解释 AI 提供了一个有益教训。可视化并不会仅仅因为人类能够看见它,就成为一种解释。

合理的解释必须将模型特征与稳定测量、可信的生物学过程或经验证的结局联系起来。否则,可视化展示的只是模型关注的位置,而非结果为何重要。

这一原则同样适用于医学之外。详细的模型输出往往通过分辨率制造信心。更多像素、类别或小数位,可能暗示了基础证据并不支持的确定性。

区域脑龄研究的价值恰恰在于它揭示了异质性。其下一阶段必须保留这种细微差异,而不是将复杂模式转化为新的简单标签。

研究人员接下来应关注什么

三项信号将决定这些图谱能否成为持久的生物标志物:独立重复验证、纵向稳定性和额外的临床价值。

第一个信号是在不同人群和影像站点之间进行独立重复验证。研究人员应在未参与开发的队列中测试训练好的模型,包括具有不同人口统计和健康状况特征的人群。

强有力的结果应当能够在不为每个站点重新校准模型的情况下,重复出现所报告的额颞叶模式及其与认知的关系。这将增强一种主张:这些图谱捕捉的是一般解剖特征,而非数据集结构。

若无法重复空间模式,模型更广泛的价值将会减弱。这可能表明其对扫描仪、预处理选择、受试者招募或数据集之间的隐藏差异较为敏感。

第二个信号是纵向稳定性。研究需要对同一参与者进行重复扫描,并提供足够长的随访期,以将局部估计与认知变化进行比较。

有用的图谱应在短时间间隔内显示出可接受的重测信度。在更长时期内,有意义的变化应与后续结局的关联强于普通测量噪声。

这一测试比报告横断面准确率更难。模型可能通过比较年轻人与年长者而很好地估计实际年龄,却无法追踪同一个人内部的变化。

纵向研究还应区分典型衰老与新出现的疾病。这需要临床随访,并在有充分依据时与血管、淀粉样蛋白、tau 蛋白或血液生物标志物进行比较。

第三个信号是新增的临床价值。研究人员必须检验,这些区域图谱能否在年龄、标准 MRI 指标、认知评分和既有生物标志物之外,进一步提升预测效果。

统计上的小幅改进并不自动等于有用。这种改进应当能够支持实际决策,例如筛选临床试验参与者,或识别哪些人需要进一步评估。

前瞻性评估将进一步增强证据力度。研究人员应在观察未来结果之前,预先定义模型、阈值、结局指标和分析方法。

监管与工作流程问题则在后续阶段出现。医疗系统需要证据证明,临床医生能够一致地解读这些图谱,并且患者能从据此作出的决策中获益。

模型还应传达不确定性。一项区域年龄估计需要给出置信区间或其他可靠性指标,尤其是在输入扫描与训练数据存在差异时。

因此,通过 Google News 看到这则报道的读者,应将标题视为证据链的起点。该模型推进了空间分析,但并未厘清每项局部预测具体意味着什么。

最有成效的回应,不是追问 AI 是否能揭示某人的“真实”脑龄。研究人员应当问的是:区域估计能否保持可重复性、预测未来变化,以及是否能比更简单的指标更好地改善决策。

未来几个月,应关注外部验证数据集、重复扫描分析,以及与临床结局进行的前瞻性比较。这些结果将表明,这张精细图谱究竟是一种可靠工具,还是一幅信息丰富、但仍在等待明确医疗应用场景的研究图像。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page