HierHGT-DTI 冷启动预测瞄准药物发现中最严峻的考验
一项新的同行评议研究显示,在涉及未见蛋白靶标的关键测试中,HierHGT-DTI 的冷启动预测击败了六个对比模型。这一结果直指计算药物发现中的一个难题:当测试数据与训练样本相似时,模型往往表现良好;但当靶标没有已记录的相互作用历史时,其准确率可能大幅下降。
南华大学研究人员 Zhangben Chen 和 Yaping Wan 开发了 HierHGT-DTI。该系统将化学结构与蛋白质序列信息整合到一个具有类型区分的多尺度图中,随后预测候选药物是否会与蛋白质发生相互作用。
这里的分歧并不只是 HierHGT-DTI 与另一模型之间的较量,而是可迁移的分子推理能力与部分建立在熟悉化合物、蛋白质和化学骨架之上的基准测试成功之间的较量。该模型在训练阶段未见蛋白质身份的场景中取得了最大优势;但多项发现也表明,这些分数尚不足以证明其在实验室中的实用价值。
当蛋白质历史消失时,HierHGT-DTI 胜出
重要的结果不在于模型的总体排名,而在于最大的性能差距出现在哪里。
这项同行评议研究于 2026 年 9 月 14 日发表在 BMC Bioinformatics。Chen 和 Wan 在 DrugBank、BioSNAP 和 BindingDB 上评估了 HierHGT-DTI。这些公开数据集收录了药物与蛋白质靶标之间已记录的关联。
研究人员采用了三种评估设置。随机划分会将相互作用对分配到训练、验证和测试组中,因此熟悉的药物和蛋白质可能同时出现在划分两侧。
冷药物划分会将完整的药物身份排除在训练之外。冷蛋白划分则对蛋白质序列采取相同做法。第三种设置最接近一种新近被关联、却没有既有配体数据的靶标。
药物-靶标相互作用(DTI)预测会对可能与特定蛋白质发生相互作用的化合物进行排序。它并不能证明临床疗效,甚至不能确认物理结合;相反,它可以缩小被送往生化或细胞实验的候选名单。
在 DrugBank 和 BioSNAP 的全部六种随机及冷启动设置中,HierHGT-DTI 均排名第一。研究人员使用五个随机种子重复评估,以减少结果对某一次有利初始化的依赖。
在 DrugBank 的冷蛋白测试中,该模型取得了 0.864 的 AUROC 和 0.878 的 AUPR。AUROC 衡量模型在不同阈值下对正负样本的排序表现。AUPR 则强调检索到的正样本中的精确率,因此在正样本稀少时尤为有用。
DrugBank 上表现最强的基线模型在冷蛋白 AUROC 上达到 0.776。因此,HierHGT-DTI 领先 8.8 个百分点,其 AUPR 优势为 7.9 个百分点。
BioSNAP 的结果也呈现相同趋势。HierHGT-DTI 的冷蛋白 AUROC 达到 0.863,AUPR 达到 0.866。最强基线模型的 AUROC 为 0.805,相差 5.8 个百分点。
这些差距大于模型在熟悉测试数据上通常只有零点几分的差异。它们也通过了该研究针对 DrugBank 和 BioSNAP 基准测试组进行的多重比较校正。
在 BindingDB 上,结果则没有那么明确。HierHGT-DTI 以 0.681 取得了最佳冷蛋白 AUPR。不过,HiGraphDTI 的冷蛋白 AUROC 略高,为 0.835,而 HierHGT-DTI 为 0.831。
HiGraphDTI 还在 BindingDB 的随机和冷药物设置中领先。其随机 AUROC 和 AUPR 分别为 0.934 和 0.837,HierHGT-DTI 则达到 0.932 和 0.829。
这一混合结果很重要。它将新模型最有力的论据集中于为未见蛋白质筛选候选分子的能力,而未能证明其在所有药物-靶标预测任务中具有普遍优势。
三个数据集之间也存在显著差异。DrugBank 包含 34,748 个处理后的样本对,其中包括 17,250 个正样本。BioSNAP 包含 27,457 个样本对和 13,830 个正样本。
BindingDB 包含 24,743 个样本对,但正样本只有 5,784 个,正样本比例为 23.4%。DrugBank 和 BioSNAP 的正样本比例都接近 50%。
AUPR 会随正样本比例变化。因此,其原始数值应在同一数据集内比较,而不应跨数据集比较。研究明确承认了这一限制。
作者将 HierHGT-DTI 与 MolTrans、TransformerCPI、DrugBAN、DO-GMA、GeNNius 和 HiGraphDTI 进行了比较。这些基线涵盖序列模型、注意力系统和基于图的方法。
这比与其他论文中直接照搬的结果进行比较更严格。所有模型都使用了匹配的数据划分和相同的五个随机种子。这种一致性减少了若干常见的、可能误导性能差异的来源。
不过,匹配的基准测试终究仍是基准测试。这些分数衡量的是模型对经过整理的样本和抽样未标记样本对进行排序的能力,并不能说明其领先预测是否会成为经验证的药物。
为什么冷蛋白预测带来了真正的压力
当生物学研究发现一个缺乏已知配体的靶标时,若模型在未见蛋白质上失效,其帮助将十分有限。
随机测试划分可能让分子预测看起来比实际部署更容易。系统可以利用反复出现的蛋白质、相关化合物或熟悉的化学骨架,在无需真正跨入陌生生物学领域的情况下,对留出样本对进行排序。
这一担忧早于 HierHGT-DTI。有关基准记忆的研究表明,基于配体的测试可能会奖励与训练化合物的相似性。因此,随机划分下的高准确率可能夸大模型的泛化能力。
冷启动问题移除了其中一部分支撑。在冷蛋白评估中,每个测试蛋白质序列都不会出现在训练和验证集中。模型必须迁移在其他地方学到的模式。
这一设置之所以重要,是因为人类蛋白质组中只有一部分蛋白质被现有药物覆盖。早期研究绘制了与获批及临床阶段疗法相关的有限蛋白质集合,也识别出许多具有潜在治疗相关性的未探索靶标。
一个靶标可能因遗传学、疾病生物学、耐药性研究或新的通路证据而变得重要,但它仍可能缺乏足够的已测试配体,供传统监督模型使用。
这给所有围绕相互作用历史构建的 DTI 系统带来压力。最新的靶标往往也是标签最稀缺的靶标。一个高度依赖既往标签的方法,恰恰会在发现团队最需要筛选支持的地方变得最弱。
HierHGT-DTI 尝试将证据来源从相互作用历史中移开。它使用药物的 SMILES 表示法——以文本编码其化学结构——以及靶标的氨基酸序列。
该模型不需要实验解析得到的蛋白质三维结构。相反,它使用 ESM-2——一种经训练可从生物序列中学习模式的蛋白质语言模型。
研究使用了参数量为八百万的紧凑型 ESM-2 变体。它为每个残基生成一个 320 维表示,同一模型还生成描述残基之间可能关系的预测接触图。
这一选择使该系统更容易应用于已知序列、但缺少实验结构的蛋白质。但这也意味着,一部分表面上的智能来自预训练蛋白质表示,而不仅是新的图架构。
作者承认了这一差异。他们呼吁构建一个使用相同 ESM-2 嵌入的更简单预测器。这样的比较将有助于区分冷蛋白增益中有多少来自图设计。
冷药物评估带来了另一项复杂因素。被留出的分子仍可能与训练化合物在化学结构上相似。在研究采用的传统 DrugBank 和 BioSNAP 冷药物划分中,超过一半的测试化合物与训练或验证数据共享 Bemis-Murcko 骨架。
Bemis-Murcko 骨架代表分子的核心环系及连接框架。共享同一骨架并不意味着两个化合物完全相同,但可能保留大量结构上的熟悉性。
研究人员增加了骨架不重叠测试以应对这一问题。HierHGT-DTI 的 AUROC 在 BioSNAP 上下降 2.5 个百分点,在 DrugBank 上下降 2.1 个百分点,在 BindingDB 上下降 1.4 个百分点。
这些下降支持了这样一种担忧:常规冷药物分数受益于保留的骨架相似性。不过,研究仅在这一更严格协议下测试了 HierHGT-DTI,并未重新运行六个基线模型进行直接比较。
冷蛋白测试也存在相关缺口。测试中的精确序列被排除在训练之外,但蛋白质并未通过序列家族聚类进行分离。高度同源的蛋白质可能仍分布在划分两侧。
这意味着该测试代表的是未见身份,而不一定是陌生的蛋白质家族。更严格的未来协议应留出序列簇或整个家族。
因此,HierHGT-DTI 的冷启动预测提高了标准,但尚未完成对泛化能力的测试。它显示出超越精确身份的强大迁移能力,但尚未证明可跨越远缘蛋白质家族进行迁移。
多尺度图让分子细节保持连接
HierHGT-DTI 的核心机制在保留细粒度分子信号的同时,为这些信号通向完整药物和完整蛋白质决策提供了短路径。
该系统将每个候选对表示为一个异构图。异构意味着图中包含不同类型的节点和关系,而非将每个对象和连接都视为相同。
其中有六种节点类型。药物侧包括原子、化学子结构和一个完整药物节点;蛋白质侧包括残基、残基社区和一个完整蛋白质节点。
化学层级从 74 维原子描述开始。这些描述编码了包括元素身份、化合价、电荷、芳香性、杂化和手性在内的属性。
随后,RDKit 将每个分子划分为 BRICS 子结构。BRICS 是一种基于规则的片段化方法,可围绕具有化学意义的键将分子分开。
蛋白质层级从 ESM-2 残基嵌入开始。模型保留完整记录的序列,而不会截断长蛋白质。当序列过长、无法一次处理时,重叠窗口会提供预测接触信息。
残基通过序列邻近性、预测接触和嵌入相似性相连接。Louvain 聚类将该图分组为中间层级的社区。
源代码将这些社区节点称为“pockets”,但这一标签需要谨慎看待。它们是基于序列信息得出的计算分组,并非实验测得的配体结合口袋。
随后,HierHGT-DTI 在两个方向上连接相邻尺度。原子与子结构相连,子结构与完整药物相连;残基与其社区相连,社区与完整蛋白质相连。
直接捷径还将原子与药物节点、残基与蛋白质节点相连。这些路径让细节信息无需经过每个中间层级,就能抵达全局表示。
最后,对于每个候选对,一条双向边连接药物和蛋白质超级节点。这条边同时出现在正样本和未标记样本中,并不会泄露正确的相互作用标签。
完整图使用 18 种有向关系类型。两个异构图 Transformer 层以四个注意力头和共享的 128 维隐藏层大小处理这些关系。
异构图 Transformer 在应用注意力机制时,会考虑相连对象和关系的类型。因此,模型可以将化学键与残基连接或层级链接区别对待。
每个节点首先针对每一种入边关系分别聚合消息。随后,学习得到的分配机制会组合这些关系特定的消息。计算同时考虑学习到的关系偏好和可用邻居的数量。
经过两层后,模型提取药物和蛋白质超级节点的表示。它将原始向量、逐元素乘积和绝对差组合起来。多层预测器将该表示转换为相互作用评分。
这一架构之所以看起来颇具说服力,是因为它映射了化学和生物学推理中的多个层次。原子构成功能结构,残基构成更大的蛋白质区域,两者共同影响整体行为。
但消融结果呈现出更为克制的结论。在六个 DrugBank 和 BioSNAP 设置中,移除中间层级结构仅使 AUPR 变化了负 0.0042 至正 0.0041。
这些层级比较均未达到统计显著性。完整的双侧层级结构在相关变体中仅在六个设置里的三个设置中排名第一。
相比之下,移除直接的细粒度到全局快捷连接会在全部六个设置中降低平均 AUPR。降幅介于 0.0002 至 0.0109。
即便这一证据也需要限定解读。在完整的 96 项检验族中进行校正后,没有任何消融比较仍具显著性。同时移除两类快捷连接,也无法将影响归因于其中任意一侧。
事后检验提供了另一种视角。在一个 BioSNAP 检查点中,推理时移除快捷关系导致 AUROC 下降 0.239。移除蛋白质内部关系导致下降 0.069,而移除层级结构则下降 0.038。
这些诊断结果表明某个训练完成的模型依赖什么。它们并不能证明某条特定路径造成了更广泛的基准优势。
因此,最可支持的机制比标题所暗示的更为有限。HierHGT-DTI 作为一个拥有多条信息路径的集成系统取得成功。直接路径似乎尤其重要,而中间层级结构则提供了上下文,其可测量收益并不稳定。
可复现性软件包使这一主张能够接受检验。它包含源代码、配置、处理后的数据划分、清单、结果摘要和复现说明。
这种透明度应有助于独立团队开展更严格的对照实验。与基准构建过程无法重建的论文相比,它也让这项工作更具实用价值。
基准仍包含未知的负样本
最大的未知并非报告中的计算是否正确运行,而是这些标签是否清晰地代表了所研究的生物学问题。
该研究将任务定义为二元相互作用预测。正标签对应已记录的相互作用。然而,许多负标签并非经过实验确认的非相互作用。
它们是未被观察到的候选配对。其中一些可能代表研究人员尚未测试或尚未添加到源数据库中的真实相互作用。
这是生物数据库中的常见问题。“未被记录”并不必然意味着“不发生相互作用”。将每个未观察到的配对视为负样本会引入标签噪声。
去重后,DrugBank 的预处理样本池包含 17,250 个正样本配对和 17,498 个候选负样本配对。有关原始负样本采样的元数据并不完整。
上游版本没有完整记录其候选样本宇宙、采样随机种子、度加权、骨架控制或蛋白质相似性控制。这些遗漏限制了后续研究人员能够从该基准中推断出的结论。
作者通过改变候选样本构建方式探讨了这种敏感性。在选定测试中,相较于均匀采样,考虑端点度数的采样使 AUPR 降低了 0.040 至 0.067。
三比一的候选负样本比例产生了介于 0.680 至 0.878 的 AUPR 值。这一区间表明,绝对性能取决于研究人员如何构建筛选样本池。
指标选择同样会改变结论。当负样本占主导时,AUROC 可能显得令人安心,因为假阳性率在数值上仍然较小。
AUPR 更直接地关注高排名候选项是否确实为正样本。比较这两个指标的研究解释了为何精确率-召回率评估通常更适合不平衡筛选任务。
BindingDB 说明了这种差异。HiGraphDTI 的冷蛋白 AUROC 略好,而 HierHGT-DTI 的 AUPR 则显著更高。
对于实验室资源有限的发现团队而言,排名列表顶部的候选项至关重要。较高的 AUPR 可能意味着在优先候选项中开展的无效检测更少。
不过,若没有前瞻性测试,基准 AUPR 仍无法估计真实的实验室成功率。该模型尚未接收一个真正全新的靶标,并产出经过验证的化合物列表。
该研究纳入了一项小规模的外部解释性练习,涉及 GABAA 受体 alpha 亚基的五个已记录正向相互作用。所选化合物包括 clonazepam、isoflurane 和 desflurane。
针对每一对配对,研究人员将模型排名最高的五个残基与预期的粗粒度区域进行比较。重叠数量从五个残基中零个到五个不等。
仅有一个案例达到未经校正的置换检验值 0.050。另一个达到 0.077,其余案例的证据更弱。
这一不均衡的结果并不能验证结合机制。作者对此作出了直接说明。他们的残基社区是计算得到的邻域,而这五个案例并不能确立物理结合位点。
因此,可解释性必须与预测排序区分开来。注意力评分可以显示哪些输入特征影响了模型,但并不会自动揭示生化原因。
该模型还依赖多项固定的预处理决策,包括 0.5 的接触阈值、1.0 的 Louvain 分辨率,以及三个残基的最小残基社区规模。
这些设置并未经过系统优化。不同的阈值或聚类方法可能会改变中间蛋白质表示。
该研究使用了一个八百万参数的蛋白质模型,而非更大的 ESM-2 版本。这一选择降低了计算需求,但也留下了一个问题:更丰富的序列表征是否会改变排序结果。
作者在一张 Nvidia RTX 4090 上使用预计算的分子和蛋白质输入训练每次运行。九种主要数据集与数据划分组合中,每个随机种子的训练时间为 26.8 至 43.6 分钟。
平均测试推理耗时为 5.3 至 11.1 秒,即每秒约 592 至 890 个样本。峰值分配 GPU 内存介于 1.53 至 2.54 GiB。
这些数字表明,对于拥有一张现代 GPU 的许多学术团队而言,复现该分类器是可行的。预计算序列表征仍会增加工作量,而这一部分并未计入报告的训练时间。
更重要的是,计算可及性无法解决实验验证问题。前瞻性检测仍是区分有前景的排序方法与可被信赖用于实际决策的发现工具的分界线。
下一步应如何验证 HierHGT-DTI 的冷启动预测
三项测试将决定报告中的提升能否超越既有基准惯例而成立。
第一项信号是在蛋白质家族留出条件下的表现。排除完全相同的序列虽有帮助,但仍允许近缘同源蛋白出现在训练期间。
更严格的实验应在划分之前按序列一致性对蛋白质进行聚类。随后,整个聚类或家族都将被排除在训练集之外。
若 HierHGT-DTI 在这种条件下保持优势,针对真正陌生靶标的迁移证据将更有力。若性能显著下降,则说明近缘生物亲属支撑了当前结果。
这项测试应包含相同的六个基线模型。每个模型均应保持相同的候选样本、随机种子、指标和超参数预算。
第二项信号是一项前瞻性实验室研究。研究人员应选择一个没有既定相互作用标签的蛋白质,冻结模型,并对可用化合物库进行排序。
随后,一个盲法团队可以测试排名列表中确定比例的候选项。应报告确认的结合、功能活性、假阳性率,以及相对于实用基线的富集程度。
这种设计能够回答任何回顾性数据集都无法解决的问题。它将揭示高排名预测是否能节省实验,以及模型是否能在既有标签惯例之外发挥作用。
负面结果仍然具有价值。它们可能揭示具有误导性的序列相似性、数据库偏差,或与已记录相互作用相关但未捕捉结合机制的特征。
第三项信号是表征受控的消融实验。一个更简单的预测器应接收相同的 ESM-2 残基嵌入、原子描述符、数据划分和优化预算。
这一比较将隔离 HierHGT-DTI 类型化图组织结构的价值。它还将表明预训练序列特征是否解释了冷蛋白性能提升的大部分原因。
作者已将其视为重要的下一步。他们还提出分别进行药物侧和蛋白质侧快捷连接消融、正样本-未标记学习、时间划分以及匹配的候选样本构建。
正样本-未标记学习将已记录相互作用视为正样本,而不假定其余每一对配对都是真正的负样本。这种方法更符合不完整生物数据库的现实。
时间评估将带来另一项现实挑战。模型可以使用截止日期之前已知的相互作用进行训练,并预测之后发现的关联。
这种结构可防止未来知识进入预处理或数据划分构建。它也更接近已部署系统随时间接触新证据的方式。
对于制药和生物技术团队而言,短期价值在于分诊筛选。HierHGT-DTI 并不能取代分子对接、生化检测、细胞研究、毒理学或临床评估。
相反,它可以提出哪些化合物-靶标配对应优先接受这些昂贵步骤。当一个新靶标带来数千个看似合理的候选项、而实验室能力有限时,这一角色就变得很有价值。
开发人员还应注意该研究更广泛的工程学启示。评估设计的重要性可能不亚于架构设计。随机划分可能回答的是与已部署系统所面临问题不同的问题。
此类系统的模型卡应记录实体重叠、骨架重叠、蛋白质家族相似性、负样本采样、类别流行率和时间来源。仅报告一个标题分数掩盖了太多信息。
可复现的证据还需要有组织的记录。比较模型、数据集和检测结果的团队需要一个可搜索的技术历史,例如工程知识库。否则,基准假设可能会在实验之间消失。
HierHGT-DTI 的冷启动预测是一项可信的进展,因为其最佳结果出现在更严格的评估设置下。其开放实现和匹配比较进一步增强了这项工作的说服力。
这个审慎的结论依然很重要。该系统在两个主要基准测试中对未见过的蛋白质靶点排序表现更佳,并在一项 BindingDB 精确率—召回率测试中领先。它尚未证明存在物理结合、作用机制或临床价值。
下一步的决定权属于独立研究人员:复现当前结果,设置蛋白质家族留出集,并在实验室中测试一个冻结版本的排序结果。这些步骤将表明,该模型究竟发现了可迁移的生物学规律,还是仅仅掌握了另一个经过精心构建的基准测试。



