top of page

DCSE 药物组合副作用预测揭示 AI 基准测试问题

14分钟前
讀畢需時 14 分鐘

DCSE 药物组合副作用预测通过了一项比大多数医疗 AI 模型面对的测试更严苛的考验,但距离为患者开具药物处方仍相去甚远。该模型于 2026 年 10 月 5 日发表,试图预测与药物配对相关的不良反应。它带来的更大挑战,是研究人员应如何判断此类预测是否值得关注。

Rubén Jiménez 和 Alberto Paccanaro 使用固定时间截点之前可获得的信息训练 DCSE,随后测试它能否预判 2009 年至 2014 年间报告的副作用。这种基于时间的设计,与将同一历史数据集随机划分为训练和测试样本的基准测试形成对比。

这一差异至关重要,因为随机划分可能让模型解决一个更容易的回顾性问题。系统可能会识别熟悉的药物、药物配对或报告模式,却无法证明它能预测真正发生在之后的新发现。因此,DCSE 挑战的不仅是竞争模型,也包括支撑其所报告性能的评估惯例。

这并非 AI 药物相互作用预测的首次尝试。2018 年发表的 Decagon 使用图卷积网络预测与药物配对相关的特定副作用。此后,许多系统引入了新的图结构、分子特征和学习目标。

DCSE 采取了不同路径。它为单个药物、药物组合和副作用学习数值表征,再通过非线性模型将它们连接起来。其核心观点是,现实的评估条件至少与架构复杂性同样重要。

这一观点也界定了模型的局限。预测是一项有待研究的假设,而非某种药物组合会导致不良反应的证据。临床部署需要独立验证、患者个体层面的背景信息、校准,以及不会以推测性警报淹没临床医生的工作流程。

DCSE 药物组合副作用预测检验未来

DCSE 最重要的改变,是试图将预测与回顾性模式匹配区分开来。

该模型发表于同行评审期刊 PLOS Computational Biology,论文题为“Robust prediction of drug combination side effects in realistic settings”。发表记录显示,Jiménez 和 Paccanaro 为作者,Royal Holloway 的研究中心名列其所属机构。

DCSE 是 Drug Combinations Side Effects 的缩写。它估计某一指定副作用与给定药物配对相关的概率。输出结果是排序后的预测,而非诊断或治疗建议。

该模型学习一种潜在表征,即从观测数据中导出的紧凑数值表示。它为药物和副作用建立这些表征,随后由多层神经网络将两个药物表征组合为一项药物配对的表征。

这种非线性组合意义重大。简单相加或平均两个药物表征,假定它们的共同作用遵循相对简单的关系。药物相互作用则可能取决于只有在两种化合物同时存在时才会显现的机制。

研究人员评估了两种前瞻性情境。热启动测试向模型提供一个已有部分已知副作用的药物配对。DCSE 必须对后来与该配对产生关联的其他副作用进行排序。

冷启动测试更为困难。它提供的药物配对没有此前已表征的副作用,尽管单个药物已在训练数据中得到表示。模型必须从其在其他场景中学习到的药物知识中进行泛化。

两项测试都将 2009 年至 2014 年报告的副作用作为后续结果。训练仅使用该时期之前可获得的信息。这种时间分隔降低了后续证据悄然泄漏至模型开发过程中的风险。

作者报告称,DCSE 在两种前瞻性情境中均持续优于对比方法。这是一项有意义的研究结果,但并不能证明其在临床床旁的表现。现有证据涉及基准预测,而非前瞻性临床试验或已部署的处方系统。

热启动与冷启动之间的区别也改变了实际问题。热启动预测可以帮助补全既有药物组合不完整的安全性档案。冷启动预测则考察模型能否识别历史证据少得多的药物配对所带来的风险。

该模型的代码和数据集说明已在研究人员的 DCSE repository 中公开。该仓库介绍了独立的训练、热启动和冷启动数据集,并报告了评估期间的 AUROC 和 AUPRC。

AUROC 衡量模型在不同阈值下,将正例排在负例之前的频率。AUPRC 强调精确率与召回率之间的关系。当真正的正例较为罕见时,它往往更具揭示性。

这些指标仍需谨慎解读。较高的排序分数并不能告诉临床医生,排名靠前的警示是否适用于某一位患者;也不能证明两种药物导致了所报告的结果。

因此,眼前的事件比标题所承诺的范围更窄。DCSE 提供了一种新模型和一种要求更高的评估设计,但并未提供自动化的用药安全裁决。

真正的进展是更不宽容的测试

DCSE 对那些只有在测试人群被人为简化后才显得强大的生物医学 AI 模型施加了压力。

一种常见评估方法是构建一个正例和负例数量大致相当的平衡数据集。研究人员可能通过抽样未出现在已知报告中的关联来创建负例组。由此形成的测试易于管理、可重复,却也可能产生误导。

真实的药物警戒数据并不平衡。已确认或已报告的药物配对效应,只占更大范围未记录可能性中的很小一部分。这个范围受到处方频率、药物上市年限、患者群体和报告行为的影响。

未记录的关联并不自动意味着真正的负例。它可能代表安全的组合、罕见事件、报告不足的事件,或医生很少开具的组合。将每一个缺失关联视为等同,可能扭曲训练和评估。

随机训练—测试划分还会引入另一项问题。涉及相似药物或重叠组合的记录可能出现在划分的两侧。即便没有完全重复,这些关系也可能使测试的独立性低于未来实际部署的情形。

DCSE 的前瞻性设置提出了一个更清晰的问题:如果研究人员在评估期之前停止使用可获得记录,模型会将哪些后续关联排在较高位置?这更接近一个实际运行的安全系统必须遵循的工作方向。

这种压力不仅延伸至 DCSE 的直接竞争对手。医疗 AI 研究往往奖励在既有数据集上的改进,因为通用基准使模型易于比较。但基准测试可能脱离赋予其分数临床意义的实际条件。

平衡测试本身并非无效。它们可以帮助研究人员判断模型是否学到了有效信息,并在受控条件下比较不同架构。问题在于,当这种构建任务上的表现被视为现实世界准备就绪的证据时。

类别不平衡使这一差距清晰可见。假设模型筛查数量巨大的药物配对和副作用组合。即使假阳性率很低,由于真正的正例稀少,也可能产生远多于有用信号的警报。

这一负担会落在临床医生、药师和安全分析人员身上。他们必须在持续开展日常诊疗的同时调查这些警报。一个能够检索更多潜在风险的系统,如果将紧急病例埋没在噪音中,仍可能使安全状况恶化。

这正是 AUPRC 值得与 AUROC 一同关注的原因。当模型正确排除许多容易识别的负例时,AUROC 仍可能表现良好。精确率—召回率分析则更直接地关注,被检索出的警报中是否包含具有实际价值比例的相关病例。

从这个角度理解 DCSE,它与其说是一个新神经网络的故事,不如说是一场围绕测量方法的争论。该模型的主张取决于:在更接近实际问题分布的条件下,根据后续观察结果进行测试。

这种方法也让失败更具信息价值。如果一个系统在时间测试下表现崩溃,研究人员便能了解到,早先的准确性依赖于稳定的历史模式。随后,他们可以调查数据漂移、缺失数据或对熟悉组合的依赖。

基于时间的评估并不能消除所有捷径。药物身份仍然已知,报告实践可能保持相似,后续标签也仍可能反映监测偏差。尽管如此,它仍使测试朝着正确的因果方向推进:从过去证据走向后续发现。

这一更广泛的教训适用于整个临床机器学习领域。基准测试应重现决策场景,包括稀缺性、不确定性和不断变化的数据。否则,更高的分数可能掩盖一个解决了错误问题的模型。

AI 药物相互作用预测有着悠久历史

DCSE 进入了一个成熟的研究领域,但它主要凭借评估现实性而非所吸收的生物数据类型数量展开竞争。

一个重要前身是 Decagon,这是由 Stanford University 和 Chan Zuckerberg Biohub 的研究人员开发的图卷积系统。其网络通过多种关系类型连接药物、蛋白质和多重用药副作用。

Decagon 将该任务定义为多关系链接预测。每一种可能的副作用都成为一种不同的关系,可以连接两个药物节点。模型随后学习哪些缺失链接最为可信。

同行评审的 Decagon study 评估了 964 种副作用类型。其作者报告称,该模型在 AUROC、AUPRC 和高排名精确率指标上均优于对比方法。

这项工作帮助确立了 AI 药物相互作用预测的范式。后续系统加入了注意力机制、分子结构、对比学习、知识图谱、文本特征和其他表征。每种方法都力图更好地解释药物如何相互作用。

DCSE 采用了更紧凑的、基于嵌入的设计。其单个药物和副作用向量从关联中学习得到,而一个多层感知机则对药物配对建模。这将每种药物的表征,与生成组合的非线性操作分离开来。

这一设计具有实际优势。学习得到的表征可在共享某种药物或与既有模式相似的配对之间迁移信息。这种迁移支持冷启动任务,即该组合本身没有已记录的副作用历史。

不过,可迁移表征也会带来不确定性。嵌入将许多模式压缩为难以从临床角度解释的坐标。高分可能反映真实药理学、报告相似性、处方模式,或这三者的某种混合。

基于图的方法可以更明确地纳入分子靶点和蛋白质相互作用。基于描述符的模型能够呈现化学特征。使用电子健康记录的系统则可加入诊断、剂量、实验室检测结果和患者病程轨迹。

这些策略没有哪一种必然胜出。更多生物学输入可能引入缺失数据和彼此不兼容的证据。较简单的表征或许具有良好的泛化能力,但提供的机制性解释较少。患者层面的系统获得了更多背景信息,同时也带来了隐私、可迁移性和混杂因素方面的担忧。

DCSE 的前瞻性结果表明,其学习到的特征签名包含有用且可迁移的信息。但这些结果并未揭示哪一类模型能够在不同医院、国家或新获批药物中表现最佳。

该领域还包含多项不应混为一谈的相关任务。有些模型预测是否存在任何相互作用;另一些则对相互作用机制进行分类、预测某一特定不良反应、推荐药物组合,或估计个体患者的风险。

DCSE 聚焦于药物对的特定副作用。它并不建模包含多种药物的完整用药方案,尽管现实中的多重用药可能涉及多种同步治疗。两两预测很有价值,但它简化了高阶相互作用。

该模型也无法取代传统的相互作用资源。经过整理的药物知识、药理学研究、对照试验、观察性分析、自发报告和临床医生审查回答的是不同问题。模型可以帮助确定优先调查的方向,但不能使这些来源彼此互换。

这种竞争背景改变了衡量进展的标准。如果一个模型无法在后续记录上有效表现,那么它在随机划分上取得的又一个百分点提升价值有限。经过诚实时间测试的更简单系统,反而可能提供更有用的证据。

因此,DCSE 持久的贡献或许在于方法流程。它为研究者提供了一个可复现的 warm-start 和 cold-start 前瞻性评估范例。如今,竞争模型可以在这一更严苛的设置下接受测试,而非只依赖熟悉的平衡样本。

预测并非临床证据

最大的不确定性不在于 DCSE 能否对历史关联进行排序,而在于其警示在患者照护中能否持续保持有用、经过校准并可付诸行动。

药物安全报告属于观察性信号。它们可能不完整、重复、延迟,并受到公众关注度的影响。它们也可能遗漏关于剂量、治疗时长、疾病严重程度和其他用药的关键信息。

FDA 在其不良事件报告系统中明确说明了这一局限。该机构的报告指南指出,仅凭 FAERS 数据无法确定事件发生率、比较不同产品之间的发生率,或确认因果关系。

这一警示同样适用于基于相关报告证据训练的模型。机器学习能够识别报告中的模式,但无法将薄弱标签转化为受控的因果证据。它还可能复现决定哪些事件被录入数据库的偏差。

适应症混杂就是一个例子。两种药物可能经常被共同用于患有严重疾病的患者。与该药物组合相关的不良结局,可能源于基础疾病而非药物相互作用。

暴露频率带来了另一个问题。即使单项风险较低,广泛使用的组合也可能比罕见组合累积更多报告。若没有可靠的分母数据,模型学习到的可能是可见度,而非危险性。

负例的定义同样困难。没有记录到副作用,可能意味着没有效应、没有暴露、没有报告,或随访不足。这些可能性在临床上的含义截然不同,但在稀疏数据集中可能看起来完全相同。

时间测试能够减少信息泄漏,却无法解决这些标签问题。后续报告仍然只是报告。模型可能正确预见未来关联,但后续因果分析未必能够证实该关联。

因此,校准很重要。经过校准的概率应当对应于可比较群体中的观察频率。仅靠排序指标无法证明 0.8 的分数代表 80% 的临床风险。

这一差距在临床决策点变得至关重要。临床医生需要知道,某项警示是否应阻止开方、触发额外监测、改变剂量,或只是促使进一步审查。排序列表无法提供这一操作阈值。

警报疲劳构成了另一项约束。现有电子处方系统已经会生成药物相互作用警示。临床医生经常遇到缺乏患者特异性相关性或明确处置建议的警报。

加入来自未经证实关联的预测,可能会进一步增加这一队列。模型需要证明,它能够发现重要风险,同时不会生成数量难以管理的误报。这一平衡应在真实临床工作流程中进行衡量。

人因因素应与区分能力指标一同测试。研究者需要观察药师是否理解输出结果、解释是否支持审查,以及用户是否会对模型分数产生过度信心。

患者多样性同样重要。药物代谢会随年龄、遗传、器官功能、妊娠、饮食和并发疾病而变化。除非系统后续纳入患者特异性数据,否则药物对层面的模型无法体现所有这些因素。

多重用药进一步增加了复杂性。五种药物会产生十个独特的药物对,但两两审查可能遗漏涉及三种或更多药物的相互作用。它也可能生成多条相互重叠的警示,却无法说明它们合并后的重要性。

临床负担足以证明持续研究的合理性。一项针对 65 岁及以上住院成人的系统综述发现,在 27 项研究中,药物不良反应的合并患病率为 16%。该项老年人综述还发现,不良反应的识别方法存在显著差异。

这些证据证明了改进监测的必要性,而非某一个模型已具备应用条件。DCSE 应被视为预测结果需要确认的优先级排序系统。称其为临床决策者将超出已发表证据的支持范围。

独立复现是下一项可信度检验。原始团队以外的研究者应重新运行前瞻性评估,审查预处理选择,并在相同的负采样规则下比较模型。

外部验证随后必须超越原始数据来源。应使用不同的报告系统、处方环境和患者群体来衡量表现。能够跨越这些变化实现泛化的模型,比针对单一基准优化的模型提供更强证据。

机制性后续研究将增加另一层证据。高排名预测可与已知代谢通路、靶点相互作用、实验室研究及经过严格控制的观察性分析进行核对。一致性并不能证明因果关系,但会增强其优先级排序价值。

该模型公开的代码有助于实现这类审查。开放实现并不保证可复现性,因为结果还取决于精确的数据版本和预处理方式。但它降低了独立测试的门槛。

三项信号将表明 DCSE 是否重要

只有当其评估标准得到推广、预测经受住外部测试、并且输出改善实际安全工作时,DCSE 才会产生实质影响。

第一项信号是基准采用。其他药物相互作用研究者应使用相同的基础定义,报告在时间上分离的 warm-start 和 cold-start 结果。直接比较将揭示,当每个模型都面对更困难的任务时,DCSE 的优势是否仍然存在。

即使另一种模型最终排名更高,采用这一标准仍会强化论文的核心判断。重要的转变在于,从针对平衡历史样本优化表现,转向根据后续证据衡量预测。

如果研究者继续只报告随机划分结果,该领域将保留一个尚未解决的可信度问题。所谓改进可能反映了对基准结构更好的记忆,而非对安全信号更好的预判。

第二项信号是独立的外部验证。独立团队应针对另一数据来源或更晚的时间窗口,测试冻结的 DCSE 预测。评估应保留自然不平衡的候选项,而非构建一个更容易的平衡子集。

该测试应报告最高排名警示中的精确率、对具有临床重要性结局的召回率、校准情况和子群表现。AUROC 和 AUPRC 仍然有用,但部署决策需要更多操作层面的细节。

cold-start 表现值得特别关注。此前未经表征的药物对代表了最具雄心的应用场景,也最容易受到假阳性的影响。此处强劲的外部结果将支持这样一种主张:学习到的药物特征签名能够迁移到熟悉组合之外。

失败同样具有信息价值。它可能表明,表现依赖于某一历史报告系统、某一时期,或某一种负例构建方法。这一结果会削弱部署主张,但不会抹去前瞻性基准测试的价值。

第三项信号是一项前瞻性工作流程研究。药物警戒团队可以接收数量有限的高排名 DCSE 警示,并记录其中有多少值得深入审查。研究者可以将这些决定与现有安全流程进行比较。

一项有用的研究将衡量每条警示所花费的时间、审查者之间的一致性,以及触发分析或监测的比例。它还应测试解释是否能改善决策,还是仅仅让不确定的预测显得更具说服力。

临床结局试验应在后续开展。研究者首先需要确认,该系统能够高效且安全地识别可信信号。只有在此之后,才应探讨使用这些信号是否能减少用药伤害。

在整个过程中,监管响应都将很重要。用于研究优先级排序的工具,与建议改变治疗方案的软件会带来不同后果。主张、界面和验证标准应与预期角色相匹配。

对开发者而言,眼前的教训很直接。医疗 AI 需要保留时间、不平衡性和未知案例的评估数据集。便利的随机划分不应承载超出其设计所能支持的解释权重。

对医疗机构而言,DCSE 不是应放在处方按钮旁的产品。它证明现有模型比较可能过于安逸。采购团队应询问,系统在未来时期、未见组合和自然罕见事件上的表现如何。

对患者而言,任何模型预测都不应促使自行改变用药。药物相互作用可能很严重,但停止治疗同样可能造成伤害。用药决策仍应由能够评估完整用药方案和病史的合格临床医生作出。

最站得住脚的结论应当保持审慎。DCSE 药物组合副作用预测推进了一项困难的预测任务,并暴露了其标准基准中的弱点。其时间测试使研究主张更可信,但并未将统计关联转化为临床事实。

下一步取决于独立研究者和安全团队。他们应测试 DCSE 排名最高的警示能否经受新数据考验,并支持有针对性的调查。若能做到,该模型可能成为筛选庞大搜索空间的有用工具。若不能,其评估设计仍将迫使该领域面对一个更困难、也更诚实的问题。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page