top of page

AgeNet-SHAP 绘制区域脑龄图谱,但它并非阿尔茨海默病风险检测工具

Google News 展示了一项覆盖 145 个脑区的 AI 研究,但其中存在一项关键限制:该模型并不能预测谁会患上阿尔茨海默病。

圣路易斯华盛顿大学医学院的研究人员利用 825 名参与者的结构性 MRI 数据开发了 AgeNet-SHAP。该系统可估算脑龄,并对影响每项估算结果的脑区进行排序。研究还发现,认知正常参与者、轻度认知障碍患者和阿尔茨海默病患者之间的区域模式存在差异。

这种组合听起来接近个体风险评估,但实际上并非如此。该模型在研究数据集中将 MRI 衍生的脑容量与年龄、诊断分组及临床严重程度联系起来。它并未确立筛查阈值、预测未来诊断结果,或证明区域性加速老化会导致阿尔茨海默病。

真正的进展更聚焦,也更实用。AgeNet-SHAP 将单一脑龄估算转化为可解释的解剖学贡献图谱。其张力在于:研究洞见本身,与读者可能赋予“风险”一词的更强临床含义之间存在差距。

Google News 标题未提及的内容

AgeNet-SHAP 描绘的是 MRI 数据内部的关联,而不是某个人未来患上阿尔茨海默病的概率。

这项基础同行评审研究于 2025 年发表于《Biology Methods and Protocols》。作者包括 Gauri Darekar、Taslim Murad、Hui-Yuan Miao、Deepa S. Thakuri、Ganesh B. Chand,以及 Alzheimer’s Disease Neuroimaging Initiative。

研究人员分析了基线 T1 加权结构性 MRI 扫描。这一常见的 MRI 序列可提供解剖学对比度,帮助软件测量不同脑组织和结构的体积。

其实验数据集包含 825 名年龄在 55.1 岁至 94 岁之间的参与者。其中,684 人来自 ADNI-2,另有 141 人来自 Alzheimer’s Disease Neuroimaging Initiative 的其他阶段。

ADNI-2 组包括 206 名认知正常参与者,以及 478 名被归类于轻度认知障碍或阿尔茨海默病连续谱的人群。后者包括 171 名早期轻度认知障碍患者、152 名晚期轻度认知障碍患者、6 名未明确类型的轻度认知障碍患者,以及 149 名阿尔茨海默病患者。

其余 ADNI 阶段贡献了 28 名认知正常参与者,以及 113 名轻度认知障碍或阿尔茨海默病患者。这些数据来自 ADNI research program,这是一个为研究生物标志物和疾病进展而建立、长期运行的公私合作项目。

研究人员将每份 MRI 划分为 145 个感兴趣区。这些测量覆盖灰质、白质和脑脊液区域。他们对区域体积进行了标准化,以减少头部大小造成的差异。

随后,AgeNet 学习这些测量值与实际年龄之间的关系。它使用了四个隐藏神经网络层,分别包含 256、128、64 和 32 个单元。研究人员采用十折交叉验证对模型进行训练和测试,并将这一过程重复五次。

交叉验证会将数据集划分为多个部分,反复使用其中一部分训练、另一部分测试。这种方法可降低结果对某一次有利划分的依赖,但不能替代在独立临床人群中的验证。

团队将 AgeNet 与 Lasso 回归、岭回归和支持向量回归进行了比较。论文称,该神经网络在预测年龄与实际年龄之间产生的相关性强于这些传统模型。

这一结果证明 AgeNet 是团队首选的年龄估算模型。它并不能证明其在阿尔茨海默病诊断方面更优,因为预测实际年龄才是该模型的主要训练任务。

当一个简短标题通过 Google News 传播时,这一区别尤为重要。“脑龄”是基于参考数据中模式生成的模型估算,并非直接测得的生物学时钟,也不能与痴呆状态互换。

较年轻的估算脑龄并不保证认知健康。较高的估算值也不构成疾病诊断。该输出概括的是:所选解剖学特征与训练数据中年龄相关模式的相似程度。

因此,这项研究改变了问题的粒度。研究人员不再只问大脑是否看起来比预期更老,还可以问:是哪一组脑区共同驱动了这一答案。

这对于生成研究假设很有价值。但它也带来了更大的解释负担,因为对模型的解释,始终只是对该模型的解释,并不会自动成为对人类生物学的解释。

可解释 AI 以区域图谱取代单一评分

核心机制是 SHAP,它为每个测得脑区分配其对 AgeNet 预测结果的贡献。

许多脑龄系统会将一份 MRI 压缩为一个数字。研究人员可以将预测年龄与实际年龄比较,计算脑龄差。正值意味着模型识别出一种更接近老年大脑的模式。

这种概括显然颇具吸引力,但也较为粗略。即使推动结果的解剖学变化不同,两个人也可能获得相近的总体估算值。

AgeNet-SHAP 试图揭示这些差异。SHAP 是 Shapley additive explanations 的简称,它估算每项输入相对于参考基准如何影响模型输出。其逻辑源自一种在协作贡献者之间分配功劳的方法。

在这项研究中,每位贡献者都是一个区域脑容量特征。绝对 SHAP 值越大,意味着该脑区对某位参与者年龄预测的影响越强。

团队首先使用 187 名认知正常参与者的半模拟数据测试该方法。研究人员有意扰动选定的区域测量值,从而获得一个已知答案,用以评估解释方法。

AgeNet 搭配了三种解释方法:SHAP、局部可解释模型无关解释,以及逐层相关性传播。作者称,AgeNet-SHAP 将所有被有意扰动的脑区识别为重要预测因子。

这一测试支持该流程在受控条件下的技术有效性。它表明,当研究人员知道哪些特征被改变时,该方法能够恢复那些被有意引入的信号。

模拟并不能证明,真实患者数据中每个高排名脑区都代表一种阿尔茨海默病机制。真实解剖数据包含相互关联的测量值、生物学变异、扫描仪效应、年龄效应以及疾病相关变化,这些因素无法被清晰分离。

不过,论文采用的多变量方法依然重要。脑结构并不会独立老化,神经退行性疾病也不遵循简单的“一次一个脑区”模型。相互连接或在发育上相关的区域,其体积常常会共同变化。

传统分析常常分别测试每个脑区。这一过程可以识别与年龄或诊断相关的区域,但可能遗漏多项测量如何共同影响预测结果。

AgeNet-SHAP 则询问神经网络如何同时利用全部 145 项特征。这种方法可以捕捉简单线性模型未必能够表达的非线性关系。

其代价在于,SHAP 值取决于训练后的模型、所选基线、特征间相关性及可用数据。高数值意味着某项特征影响了 AgeNet 的输出,并不表示该特征独立导致了加速老化。

这是可解释医疗 AI 面临的更广泛问题。一项SHAP 系统性综述发现,SHAP 及相关方法在阿尔茨海默病检测研究中的应用正在增长。该综述也强调,可解释性是评估模型可信度的必要条件。

可信度需要的不只是视觉上直观的热图。研究人员还必须检验:这些解释在不同扫描仪、人口群体、预处理方法和外部数据集之间能否保持稳定。

AgeNet-SHAP 研究为这项工作提供了一个框架,但并未完成这项工作。

它最强的贡献在于方法学:将一个相对简单的神经网络与参与者层面的区域解释相连,再将这些解释与诊断和临床指标联系起来。

这构建了一条从预测走向解释的路径,也揭示了为何“可解释”一词需要谨慎使用。该系统解释的是哪些测量值影响了其估算,而不是疾病为何会发生。

阿尔茨海默病严重程度呈现为分布式模式

从轻度认知障碍到阿尔茨海默病,疾病信号变得更加广泛,而非收敛于一个决定性结构。

研究人员比较不同诊断组时发现,与认知正常参与者相比,轻度认知障碍显示出中等程度的区域差异。阿尔茨海默病则产生了更强、分布更广泛的差异。

这一进展支持论文的主要生物学解释。晚期疾病涉及一个解剖学变化网络,因此多变量区域模型能够揭示被总体脑龄评分掩盖的模式。

该研究还考察了临床痴呆评定量表盒子总分。CDR-SB 汇总六个认知和功能领域的评分,用于衡量临床损害的严重程度。

在阿尔茨海默病连续谱中,个体化 AgeNet-SHAP 特征与 CDR-SB 存在关联。换言之,对预测脑龄的区域贡献会随临床严重程度而变化。

若干涉及的区域与既有阿尔茨海默病研究相一致。作者讨论了与记忆相关的颞叶和边缘系统结构,以及额叶、顶叶、枕叶和皮质下区域。

他们还发现,临床严重程度与涉及顶上小叶和枕叶梭状回的特征之间存在负相关。研究人员将更广泛的结果解释为:正常老化和疾病特异性过程都对观察到的区域模式有所贡献。

这种表述比称该模型“绘制阿尔茨海默病风险图谱”更精确。该分析主要是横断面的,即比较基线访视前后的测量结果和临床状态。研究并未追踪每位认知正常参与者,直至其结局明确。

风险预测需要不同的研究设计。研究人员需要从尚未患阿尔茨海默病痴呆的人群开始,生成预测,并观察谁后来出现认知损害或疾病。

他们还需要明确时间范围。五年内的转归估算,与终生层面的疾病关联在临床上并不相同。

随后,该模型还需要进行校准,也就是预测概率必须与观察到的结局相匹配。仅有区分能力——例如区分已知存在差异的群体——并不足够。

AgeNet-SHAP 并未完成这一整套验证。其年龄预测和区域严重程度关联属于研究发现,而非经过验证的个体概率。

这一差距并不意味着结果不重要。它界定了这些结果在证据链中所处的位置。

区域脑龄有助于研究人员提出更具针对性的假设。全局估计可能表明存在非典型衰老,而区域画像则可显示关键特征是集中于与记忆相关的结构,还是分布得更为广泛。

其他团队也在朝着类似方向推进。一项 2023 年的区域脑龄模型采用岭回归,在 3,418 名健康对照者上训练,并在 651 名独立对照者上测试。

这项早期研究在测试组中实现了 7 年的平均绝对误差。研究重点关注了伏隔核、颞下回、丘脑、脑干和尾状核等结构。

其更为简单的统计方法可直接估计每个区域的贡献。AgeNet-SHAP 则在以阿尔茨海默病为重点的数据集中,探索非线性预测和参与者层面的特征归因。

这一比较明确了本文的核心对照:可解释的区域研究与经临床验证的个人风险预测之间的差别。

区域解释有望提供更丰富的解剖学细节。临床预测则需要前瞻性证据、稳定表现、实用阈值,以及结果能够改善决策的证明。

AgeNet-SHAP 推进的是前一条路径。新闻标题却很容易让人误以为它已经完成了后一条路径。

为什么它尚不是阿尔茨海默病风险测试

该模型的解释在科学上颇具意义,但其数据集和任务并不支持临床筛查方面的主张。

第一个局限是队列依赖性。所有实验扫描数据均来自 ADNI——一个拥有结构化招募流程、影像协议和广泛临床表征的研究项目。

ADNI 产生了极具价值的数据集。然而,其参与者并不天然代表所有在常规医疗中接受 MRI 检查的人群。

临床人群在教育程度、种族、族裔、收入、共病情况、用药暴露、扫描设备可及性和疾病阶段等方面可能存在差异。这些差异会改变测量到的解剖特征和模型表现。

因此,外部验证必须在其他地点采集的数据上测试完整流程。ADNI 内部的交叉验证可降低过拟合风险,但每个折叠仍来自同一更广泛的研究环境。

第二个局限在于模型目标。AgeNet 学习的是估计实际年龄,而非预测未来阿尔茨海默病发病。随后,SHAP 对这一年龄估计进行了解释。

研究人员随后比较了不同诊断组和不同临床严重程度之间的这些解释。这是一项合理的探索性分析,但无法将年龄预测模型转化为经过验证的疾病风险计算器。

第三个局限是模态。结构性 MRI 捕捉解剖特征,包括区域体积减少。阿尔茨海默病还涉及分子病理,淀粉样蛋白和 tau 生物标志物可通过正电子发射断层扫描、脑脊液或血液检测进行测量。

作者明确将 PET、脑电图和弥散张量成像列为未来扩展方向。结合多种模态,或许能更有效地区分一般衰老与疾病特异性过程。

第四个局限涉及相关特征。区域体积会因解剖结构、发育、退化和测量流程而相互影响。SHAP 必须在这些相关输入之间分配重要性。

不同的特征分组、基线或预处理流程都可能改变这种分配。因此,即使模型产生相似的年龄估计,两个解释也可能不同。

第五个局限是因果解释。一个区域的 SHAP 值回答的是计算层面的问题:这一特征如何影响该模型针对该输入的输出?

它并不能说明该区域的萎缩或保留会改变疾病进展。它也无法判断结构差异究竟是原因、结果、相关因素,还是代偿机制。

第六个局限是临床实用性。研究模型在进入实践前,必须优于或补充现有评估方法。这意味着需要与认知测试、临床医生判断、血液生物标志物、遗传信息和既有影像标志物进行比较。

一个较新的基于图块的框架展示了另一种区域路径。它针对十个皮质下结构的双侧图块,分别训练了三维神经网络。

该系统将区域预测结合为全局年龄估计,并将其与认知评分配对,以构建认知储备的代理指标。其报告的年龄估计相关系数达到 0.983,平均绝对误差为 2.92 年。

在数据集和评估规则未对齐的情况下,这些数字不应与 AgeNet-SHAP 直接排名比较。不同的队列、年龄分布、预处理选择和测试流程,都可能导致实质性不同的结果。

更广泛的竞争并非排行榜之争。研究人员正在测试多种方法,以在不丧失泛化能力的前提下获得解剖学特异性。

一些系统使用全脑图像并生成显著性图。另一些则基于分割后的体积、体素或预定义图块运行。更简单的回归模型牺牲了一些灵活性,但使系数更易于检查。

没有任何一种设计解决了这一核心权衡。更复杂的模型可以捕捉非线性交互,但复杂性也增加了解释验证所需的工作量。

对于临床医生而言,虚假的精确感构成直接风险。即使不确定性仍然很高,一张以颜色编码的区域图也可能显得结论明确。

对于患者而言,“更老”的区域估计可能造成焦虑,却无法提供可操作的诊断。相反,即使存在认知症状,一个令人安心的估计也可能使人不愿接受适当评估。

因此,医疗 AI 除了技术验证外,还需要沟通保障措施。报告应区分预测年龄、年龄差、诊断关联、严重程度关联和前瞻性疾病风险。

Google News 的读者很少能仅从标题中获得这些区分。现有证据支持一张反映模型贡献和疾病相关模式的区域图。它不支持自我诊断或治疗决策。

三项信号将显示区域脑龄是否重要

独立验证、前瞻性预测和额外临床价值,将决定 AgeNet-SHAP 是否会成为不止于研究框架的工具。

第一个信号是在 ADNI 之外进行复现。研究人员需要在不同医院采集的独立队列上运行冻结后的完整流程,这些队列应使用不同扫描仪,并涵盖更广泛的人口统计特征。

有说服力的结果应能保持年龄估计性能,并产生相对稳定的区域模式。若性能显著下降或特征排名发生变化,将削弱该系统捕捉可泛化生物学机制的主张。

这项测试必须覆盖完整工作流。若仅重复神经网络,却改变分割、归一化或参考数据,将难以确定结果变化的原因。

第二个信号是前瞻性转归预测。未来研究应招募认知正常者或轻度认知障碍患者,生成基线区域画像,并追踪临床结局。

随后,研究人员可测试 AgeNet-SHAP 特征是否能在实际年龄、认知能力、海马体积和既有生物标志物之外,进一步预测疾病转归。

这种比较至关重要。如果统计显著关联无法为现有评估增加有用信息,其价值就有限。

前瞻性研究应报告敏感性、特异性、校准度,以及在实际时间跨度内的表现。还应说明缺失扫描、扫描仪变化和参与者退出会如何影响结果。

第三个信号是决策层面的获益。即使风险估计准确,也只有在改善实际临床选择时才有意义。

研究人员必须在验证前明确预期用途。可能的用途包括为试验筛选参与者、确定生物标志物检测优先级、追踪结构变化或支持专科评估。

每种用途都需要不同的阈值和误差容忍度。研究招募工具可以接受一些权衡,而这些权衡对于筛查无症状成年人则并不合适。

最强大的未来系统或许不会仅依赖 MRI。结构模式可以与认知评估和分子生物标志物结合,同时保留区域可解释性。

这种组合还将检验 AgeNet-SHAP 是否捕捉了独特信息。如果其区域特征只是重复表达海马萎缩或临床严重程度,那么更简单的指标可能更可取。

研究人员还应发布解释稳定性分析。区域图不应因为轻微的预处理变化或略有不同的参考样本而发生剧烈改变。

文档的重要性将不亚于模型架构。临床团队需要对训练人群、排除标准、扫描仪要求、不确定性和失效模式有清晰定义。

论文作者将其方法定位为诊断、预后、疾病进展研究和个体化医疗的基础。这些属于未来应用,而非已经完成的验证。

对于开发者而言,这一教训超越了神经影像领域。可解释性工具能够揭示模型如何构建答案,但不会自动验证该答案在现实世界中的含义。

对于通过 Google News 关注医疗 AI 的知识工作者而言,最安全的工作流程是将标题、原始论文、队列细节和已述局限一并保留。一个可搜索的AI 知识库有助于让这些层次保持关联,而不是将一项研究简化为单一主张。

下一则区域脑龄新闻标题应引发三个问题:模型是否在原始队列之外接受测试?它是否预测了未来结果?它是否在既有指标之外改善了决策?

在这三个问题都有明确答案之前,AgeNet-SHAP 最适合被理解为一张可解释的研究地图。它展示了分布式解剖特征如何影响 AI 生成的年龄估计,以及这些模式如何与阿尔茨海默病严重程度相关。

这是一项有意义的进展。但它尚不是个人阿尔茨海默病预测。读者、临床医生和 AI 构建者应根据证据是否最终弥合这一差距,来评判下一波 Google News 报道。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page