Nordic AI-Health 是一项数据基础设施计划,而非又一个医疗模型
尽管跨境健康研究多年来一直面临技术、法律和机构层面的障碍,Nordic AI-Health 仍提出了一项覆盖六国的医疗数据基础设施计划。一则 Google News 条目将该提案关联至 Nature,但目前可访问的研究论文似乎是一篇 13 页的预印本。其论点的规模远超任何单一 AI 模型。
作者希望丹麦、爱沙尼亚、芬兰、冰岛、挪威和瑞典连接纵向健康记录、生物样本库、基因组资源和科研系统。数据仍由各国掌控,而获批的计算任务则在安全环境之间流转。这一区别使该提案不再只是另一个数据库项目,而成为对联邦式医疗 AI 的一次检验。
时机至关重要。欧洲健康数据空间(European Health Data Space,EHDS)已进入漫长的实施阶段,将为跨境健康数据访问建立规则。与此同时,欧洲项目正在建设基因组、影像和计算基础设施。Nordic AI-Health 认为,该地区应在这些欧洲系统成熟前,组织好其异常详尽的人口数据。
真正困难的比较并非欧洲与美国之间,或公共研究与私营科技公司之间的比较,而是协调联邦与持续国家碎片化之间的比较。北欧地区已经拥有许多必要的数据资产,但尚未建立将它们作为统一研究系统使用所需的共享治理、语义体系、验证流程和运营权责。
这正是 Google News 标题淡化了故事重点的原因。该提案并未宣布一个已部署的临床平台,而是在提出一项基础设施论题,其成功更多取决于制度而非算法。
该提案在不转移数据的前提下实现连接
Nordic AI-Health 提出了一套联邦研究系统,敏感健康数据将留在获批的国家级环境内。
该提案由来自北欧及波罗的海地区大学、医院、生物样本库和生命科学机构的 22 位作者提出。其 2026 年 4 月 26 日的论文于 5 月 4 日发布。文件描述了一套用于开发和测试医疗及生物医学基础模型的通用基础设施。
基础模型是在广泛数据上训练的模型,之后可支持多项更具体的任务。在医学领域,这些任务可能包括疾病风险估计、患者分层、影像分析或生物关系发现。该提案聚焦于负责任地创建这类模型所需的数据和计算层。
其核心主张是,北欧国家拥有纵向和多模态信息的独特组合。纵向数据持续追踪人群随时间发生的变化。多模态数据则连接不同来源,包括电子健康记录、登记系统、医疗影像、实验室结果、基因组学及其他分子测量数据。
作者认为,这种组合能够产生比仅在单一医院或狭窄患者队列上训练的系统泛化能力更强的模型。这一主张仍是一项研究命题,而非已确立的临床结果。Nordic AI-Health 论文呈现的是路线图,而非已完成区域平台的性能数据。
联邦学习提供了拟议的技术机制。它将模型代码或分析指令发送至参与方的数据环境,而不是集中收集每一条记录。每个站点在本地执行获批计算,并返回获准的结果或模型更新。
这种设计降低了跨国转移可识别记录的需求,但并未消除隐私风险、法律责任或安全要求。在某些情况下,模型更新可能泄露信息,而且每个参与环境都必须执行访问、日志记录、披露和输出控制。
该提案还呼吁建立可信研究环境。可信研究环境是受控计算空间,获批用户可在其中分析敏感信息,但不能自由下载底层记录。这类环境可以执行身份核验、权限管理、审计追踪以及导出结果限制。
第三个组成部分是通用数据模型。北欧医院和登记系统以不同的模式、分类、语言和本地惯例记录相似事件。将这些系统映射至 OMOP Common Data Model,可为研究人员提供用于观察性健康分析的共享结构。
这些要素已存在于彼此独立的项目中。变化在于,Nordic AI-Health 试图将它们视为统一北欧研究基础设施的组成部分。因此,Google News 条目指向的是一项架构提案,而非新发布的医疗产品。
北欧健康数据为何吸引 AI 研究人员
该地区的优势来自可关联的历史数据和人群覆盖面,而不只是拥有大量医疗记录。
北欧国家数十年来一直维护全国性的行政和健康登记系统。稳定的个人标识符使获授权研究人员能够连接医疗服务、处方、诊断、出生、死亡和社会记录中的事件。生物样本库则为规模可观的队列补充了生物样本和基因组信息。
芬兰的 FinnGen 项目体现了其研究价值。FinnGen 将芬兰生物样本库中的遗传信息与国家健康登记系统中的数字记录结合起来。其最初的 Nature 报告描述了对 412,000 份已采集样本中 224,737 名参与者的分析,目标队列规模为 500,000 人。
底层登记系统的历史远早于遗传样本收集。FinnGen 研究使用了覆盖住院医疗、门诊医疗、死因、用药权益、处方购买和癌症诊断的全国记录。其中部分登记数据可追溯至 1969 年。
这种深度为研究人员提供的不只是横截面快照。模型可以考察诊断前事件、治疗序列、长期结果、用药史和共病情况。与基因组数据关联后,同一段历史还可支持遗传关联和疾病机制研究。
冰岛则通过 deCODE genetics 和覆盖全体人群规模的基因组研究提供了另一种模式。丹麦、挪威、瑞典和爱沙尼亚也维护着各自的登记系统、队列、生物样本库和临床信息系统。该地区还拥有公共资助的医疗体系,能够覆盖广泛的人群。
这些资产共同应对了医疗 AI 的一项重大局限。许多系统仅基于单一机构、单一临床专科或某一时期的数据训练。当患者人口统计特征、医疗实践、编码标准或设备发生变化时,性能可能下降。
覆盖多个医疗系统的联邦架构创造了外部验证机会。研究人员可以在某一组国家组合内训练模型,再利用其他地区持有的数据进行测试。他们还可以考察预测结果在不同语言、医疗体系和人口结构下是否依然可靠。
不过,地域广度并不保证代表性。北欧人口并未涵盖全球范围内完整的遗传、文化、社会经济和临床多样性。在广泛部署前,基于当地开发的模型仍需在其他地区进行验证。
覆盖范围也不等同于数据质量。登记字段通常源自行政管理或医疗服务,而非经过严格控制的机器学习研究。缺失值、不断变化的诊断标准、编码激励以及医院间差异,都可能引入系统性错误。
这些局限使该基础设施具有价值,但并不使其具备普遍权威性。Nordic AI-Health 可以为纵向和联邦研究打造强大的实验平台,却无法以区域规模取代国际临床证据。
Google News 用技术外衣捕捉到了一则监管故事
该提案此时出现,是因为欧洲健康数据监管正将互操作性从研究偏好转变为运营要求。
欧洲健康数据空间法规于 2025 年 3 月 5 日刊登于欧盟官方公报,并于 3 月 26 日生效,由此开启将历经多个实施阶段的过渡期。
EHDS 为电子健康信息的主要使用和二次使用建立了共同框架。主要使用涉及向个体患者提供的医疗服务。二次使用涵盖获批的研究、创新、监管、政策和公共利益用途。
对于二次使用,相关机构将需要获得指定健康数据访问机构的许可。处理必须在安全环境中进行。该法规限制下载个人数据,并禁止试图重新识别获批数据集所代表个体的行为。
EHDS 时间表为 Nordic AI-Health 提供了实际的规划周期。欧盟委员会预计将在 2027 年 3 月前通过重要实施法案。众多电子健康记录类别的二次使用规则将于 2029 年 3 月开始适用。
基因组数据的适用时间更晚。包括基因组学在内其余类别的二次使用规则,将于 2031 年 3 月开始适用。这一分阶段安排为参与国留出了时间,用于协调访问系统、技术规范、治理程序和安全处理环境。
因此,Nordic AI-Health 并非试图发明一个独立的法律体系。其作者将该基础设施定位为与 EHDS 兼容。该地区可以利用欧洲框架,同时围绕既有登记系统和生物样本库构建更聚焦的联邦体系。
欧洲也在资助基础设施建设,这既带来支持,也带来竞争。欧盟委员会表示,在 1+ Million Genomes 倡议下,26 个成员国正在建设基因组数据基础设施。委员会预计,到 2026 年底,将有 15 个国家级结构按照共同技术规范投入运行。
Cancer Image Europe 旨在于 2026 年底前提供对 6,000 万张癌症影像的访问。欧洲 AI 工厂、测试设施、重症监护数据项目和虚拟人类孪生项目,则增加了计算和验证能力。这些工作均出现在欧盟委员会的健康 AI 战略中。
这种更广泛的建设进程推动北欧机构开展协调。如果每个国家都独立开发接口、术语映射和访问程序,研究人员将反复面对整合工作。碎片化也可能削弱该地区对欧洲技术标准的影响力。
协调则可带来另一种结果。北欧机构可以提出共享需求、复用基础设施,并将多国验证纳入研究设计。该地区将成为 EHDS 内部的一个实际运行节点,而非一组彼此孤立的国家级数据仓库。
标题通过 Google News 浮现,但监管才构成真正的新闻周期。算法吸引了人们对论文的注意力;欧洲实施期限则解释了为何这篇论文此刻如此重要。
联邦并不能解决机构碎片化问题
最困难的部分,是在掌握不同数据、法律、预算和临床风险的组织之间明确责任归属。
联邦学习常被视为应对健康数据敏感性的简洁答案。数据保留在本地,因此各机构无需转移完整的患者数据集。然而,实际部署仍需要围绕身份、权限、软件、安全、输出结果和问责机制达成持续性的协议。
近期一个北欧—波罗的海项目提供了有益的警示。FederatedHealth 汇集了来自芬兰、瑞典、挪威、丹麦和爱沙尼亚的九家机构。该项目历时三年建设临床自然语言处理网络,同时应对组织与监管障碍。
一项针对该项目的 2026 年分析认为,人际网络比神经网络更重要。参与节点必须就合同、安全审查、共同任务、基础设施所有权和可接受的信息披露风险达成共识。这份联邦评估将这些问题视为部署工作的核心,而非行政负担。
语义对齐带来了另一个问题。将多个医疗系统转换为 OMOP,并不会自动使其数据变得等价。某个诊断代码在不同国家可能反映不同的诊疗路径、报销规则或筛查实践。
临床文本还涉及当地语言和缩写。实验室单位与参考范围可能不同。影像设备会产生不同的技术特征。基因组流程可能采用不同的测序、推断和质量控制程序。
共享模型可能在吸收这些不一致性的同时,呈现出统计上成功的表象。当团队只优化总体表现、却不检查按国家、医院、人口群体和临床场景划分的错误时,风险会进一步加大。
因此,Nordic AI-Health 需要为数据质量建立治理层。每个参与节点都必须记录数据来源、转换过程、缺失情况、编码变化及已知局限。共享基准应检验某个表面信号能否在不同节点间成立。
该项目还需要明确的运营主体。科学联盟可以制定标准,但生产级基础设施需要资金、服务承诺、事件响应、软件维护和可执行的决策机制。临时资助很少能够提供所有这些职能。
临床责任仍然属于国家和地方层面。一个在六个国家训练的模型,仍可能需要在每个卫生系统内获得批准、完成采购、融入工作流程、接受监测并接受专业监督。研究访问权限并不会自动产生面向患者使用的许可。
网络安全也带来类似问题。联邦模式限制了数据的集中汇聚,但增加了连接环境和软件组件的数量。一个被攻破的节点可能威胁模型完整性,或通过控制不佳的输出泄露信息。
基础设施还必须将发现与部署区分开来。识别统计关联的模型可以支持研究,但并不意味着它已准备好指导治疗。临床系统需要前瞻性评估、与现行实践的比较,以及部署后的持续监测。
这些条件使该提案的推进速度可能比其架构图所暗示的更慢。但也正因如此,它更具可信度。严肃的健康数据联邦体系,应以其围绕计算建立的控制机制来评判,而非以训练模型的速度来衡量。
公共数据带来公共问责考验
如果公共机构将患者数据视为工业资源,却缺乏有意义的公众参与,Nordic AI-Health 将失去正当性。
拟议中的基础设施结合了公共健康记录、学术研究与商业专长。多位作者与制药、生物技术和健康科技机构存在任职关联或已披露关系。这类参与可以支持成果转化,但也会引发关于访问权和收益分配的问题。
谁可以利用人口数据训练模型?哪些研究目的应获得优先权?企业能否获得公共医疗团队无法获取的结果?共享模型带来的改进归谁所有?这些都是具有政治后果的基础设施决策。
EHDS 设定了边界。二次使用需要经过批准的目的和许可,而营销用途及对个人造成伤害的决策面临限制。人们也享有退出权,但须遵守明确的公共利益条件和各国实施规定。
仅靠合规并不能消除公众的期待。北欧卫生系统依赖社会信任和广泛参与。患者可能会区分旨在改善公共医疗的研究,与主要为了创造私人知识产权而开展的项目。
AI 政策研究者 Jason Tucker 曾批评北欧国家战略将私营部门参与描述为几乎不可避免的医疗创新路径。他的公众参与批评认为,这种框架为公众影响技术优先事项留下的空间太少。
这种批评并不能证明 Nordic AI-Health 将私有化公共健康数据。它指出了一项该提案必须回应的治理风险。透明的访问政策和公开报告将使二者之间的区别清晰可见。
可信的系统应公布哪些组织获得访问权限、哪些目的得到批准,以及产生了哪些输出。它应在不暴露患者机密信息的前提下说明商业条款。它还应披露数据质量失败、安全事件和未成功的临床评估。
患者代表不应只有顾问头衔。他们应影响研究优先事项、可接受用途、沟通方式和收益共享安排。他们的参与应从基础设施设计阶段开始,在技术默认设置变得难以逆转之前介入。
公平性同样值得重视。大规模人口数据仍可能不足以代表近期移民、边缘化群体、罕见病患者,以及医疗服务获取不稳定的人群。更好的数据关联本身并不能纠正不公平的医疗服务。
模型也可能复制这些缺口。一个基于已记录治疗训练的预测系统,可能学到的是服务在哪里可得,而不是患者在哪里真正需要服务。风险模型也可能将未获得医疗服务误读为没有疾病。
这正是 Google News 关注背后的主要权衡。北欧国家可以让公共数据更有用,同时不让其公共目标被削弱。实现这两个目标需要可执行的治理,而不是假设隐私保护计算会自动产生公共价值。
三项信号将表明路线图能否成为基础设施
下一阶段应以运营证据来衡量:共同治理、跨国验证,以及进入临床实践的路径。
第一个信号是正式的多国治理协议。该提案需要明确参与节点、决策权、统一访问程序、持续资金以及对安全事件的责任分配。泛泛的合作声明远远不够。
2027 年 3 月的 EHDS 实施法案截止日期提供了一个有用的检查点。北欧机构应说明其拟议的访问与计算系统如何对应欧洲要求。这种对齐将增强该联邦体系能够成为持久基础设施的说服力。
未能建立治理机制将削弱其核心论点。这将表明,国家层面的碎片化仍强于区域协调的激励。研究人员可能继续开展临时合作,却无法形成可复用的服务。
第二个信号是在至少三个国家环境中完成有记录的演示。该演示应使用协调后的数据、共享分析协议,并在每个节点进行独立评估。它应报告性能差异,而不只是给出合并结果。
有价值的试点还应披露运营指标。研究人员需要知道审批耗时多久、需要多少人工映射、软件在哪些环节失败,以及哪些输出能够离开各个可信环境。
成功执行将表明联邦模式能够跨越真实的法律与技术边界运行。使用准备好的数据集开展狭窄实验,提供的证据会较少。目标不仅是验证统计模型,也要验证基础设施流程。
第三个信号是前瞻性临床评估。Nordic AI-Health 强调发现和精准医疗,但其公共价值取决于是否最终改善医疗服务。至少一个用例应从回顾性数据分析进入受监测的临床研究。
该研究应将 AI 支持的工作流程与现行实践进行比较。它应衡量患者结局、临床医生工作负荷、误报、亚群表现和意外后果。仅凭技术准确性无法证明临床获益。
失败或结论不明确的试验,并不会否定整个基础设施。它会说明为何区域数据访问和临床部署必须保持为不同阶段。该网络仍可支持生物学发现、安全监测和可复现的观察性研究。
读者还应将该提案与另一项独立的 AI-HEALTH Nordic 项目区分开来;后者聚焦于挪威北部、瑞典和芬兰的远程医疗试点。相似的名称并不意味着它们是同一项目。随着两项工作的发展,清晰的机构品牌将十分重要。
对开发者而言,这份路线图提醒人们,医疗 AI 需要的不只是模型代码。互操作性、部署控制、文档和可审计性都会成为产品要求。忽视这些层面的团队将难以进入受监管的临床环境。
对企业采购方而言,该提案将尽职调查重点转向数据来源和外部验证。一个在知名生物样本库训练的系统,仍可能在另一家医院失效。采购方应询问模型在哪些地方接受测试、代表了哪些人群,以及如何监测性能变化。
对研究人员而言,机会相当可观。一个正常运作的北欧联邦体系可以支持疾病机制研究、治疗反应研究、罕见病分析和跨国复现,而无需建立一个集中的患者数据仓库。
Google News 的收录为该提案带来了可见度,但可见度并不等于部署。Nordic AI-Health 现在需要将可信的架构转化为共享运营规则、可重复的研究和临床证据。
首先关注治理协议,其次关注跨境演示,第三关注临床验证。如果三者都能出现,北欧地区建立的将不只是又一个 AI 倡议,而是一种可检验的模式:在保留国家控制权的同时,跨境使用敏感健康数据。



