DualGPT-AB 测试用于治疗性抗体的多属性 AI 设计
研究人员报告称,在抽样的 100 个抗体设计中,有 8 个对癌症靶点 HER2 表现出强结合能力,DualGPT-AB 因此登上了 Google News。其作者还表示,在实验室实验中,该框架生成的候选物展现出强于 Herceptin 的肿瘤杀伤活性。
这一结果值得关注,但原因并不只是又一个生成式模型能够提出蛋白质序列。DualGPT-AB 旨在解决一个更棘手的问题:在同时改善多项抗体属性的同时,避免某一项指标的提升损害其他指标。
这项于 2026 年 4 月 15 日发表在 Nature Computational Science 上的研究,将条件生成与强化学习相结合。它主要挑战的是传统的序贯优化流程:随着新的开发问题出现,研究人员不断调整并测试抗体候选物。
这一比较仍处于早期阶段。DualGPT-AB 尚未产出获批药物、进入临床试验,也未证明其在患者中的表现更优。它的贡献在于提供了一种研究工作流,将多属性计算设计与有针对性的湿实验室证据连接起来。
Google News 标题未提及的内容
DualGPT-AB 的重要之处在于,它试图将抗体优化为药物候选物,而不只是优化为能够结合靶点的分子。
抗体在成为可行药物之前,必须满足许多要求。候选物需要识别预定抗原、保持可接受的物理性质、避免引发不必要的免疫反应,并且便于生产和给药。
这些要求之间可能相互冲突。能够改善结合能力的序列变化,可能增加疏水性、聚集风险或黏度。另一种修饰或许能降低免疫原性,却同时削弱与预定靶点的相互作用。
这一多目标问题正是这项已发表研究的重点。来自西北工业大学、北京大学和天津大学的研究人员开发了 DualGPT-AB,将其设计为一个两阶段条件生成框架。
条件生成模型会根据指定属性生成输出。在这里,所需的抗体属性成为可学习的信号,用以引导序列生成。
该系统聚焦于 CDRH3,即抗体重链的第三互补决定区。CDRH3 是高度可变的序列区域,通常在抗原识别中发挥核心作用。
DualGPT-AB 并非从零开始设计抗体的每一个部分。它生成 CDRH3 序列,并在更广泛的抗体背景中对其进行评估,其中靶向 HER2 的 Herceptin 是一项重要的实验参考。
HER2 是一种在多种癌症中高表达或发生其他改变的受体。Herceptin,也称 trastuzumab,是一种针对该靶点的成熟抗体疗法。
研究人员首先训练了一个条件 GPT,以建模抗体序列与所需特征之间的关系。随后,该框架采用强化学习,由生成序列获得评分,以引导后续探索。
第二阶段之所以重要,是因为生成器可能复现训练数据中的模式,却无法找到同时满足异常严苛属性组合的候选物。强化学习将模型推向与目标属性谱相关联的序列空间区域。
计算实验表明,该系统能够在多项同步约束下生成 CDRH3 序列。随后,作者没有止步于模型评分,而是挑选候选物进行实际测试。
在从设计文库中随机选取的 100 个抗体中,有 8 个表现出研究人员所称的优异 HER2 结合亲和力。额外的湿实验室实验将选定候选物与 Herceptin 进行了比较,发现它们在测试条件下具有更强的肿瘤杀伤活性。
这两种表述之间的区别至关重要。8 个候选物达到了报告中的结合标准,而只有选定的抗体接受了功能实验。该研究并未证明每一个强结合物都在每一种检测中优于 Herceptin。
它同样没有证明临床优效性。实验室中的肿瘤杀伤活性是生物学功能的证据,但无法回答剂量、毒性、稳定性、暴露水平、免疫反应或患者结局等问题。
Google News 的表述将这种区别压缩为一个简单的加速故事。实际结果更聚焦,也更具价值:一个生成式优化系统产生了若干可测试候选物,其中一些通过了初步实验筛选。
为什么抗体优化会形成瓶颈
抗体发现中耗时的环节往往不是找到结合物,而是将该结合物转化为一种表现得像药物的分子。
传统抗体发现可始于免疫、杂交瘤方法、展示技术或大型筛选文库。这些方法会生成可能的结合物,研究人员随后通过反复实验循环对其测试和优化。
一旦出现有前景的抗体,开发团队考察的远不止亲和力。他们还会评估特异性、溶解性、黏度、化学稳定性、自缔合、清除率、免疫原性以及生产行为。
亲和力描述抗体与其靶点结合的紧密程度。特异性考察其是否避免与非预期靶点结合。可开发性涵盖影响候选物能否成为实际治疗产品的物理和生物学特征。
这些目标并非一份简单的核对清单。它们共同构成一个存在权衡、测量稀疏且反馈成本高昂的优化景观。
一篇 2026 年 6 月的多目标综述将这些权衡描述为持续存在的障碍。作者指出,先导抗体通常需要在亲和力、特异性、稳定性、聚集、免疫原性及其他特征之间进行优化。
实验筛选仍不可或缺,因为计算评分只是对生物学行为的近似。与此同时,每一次设计—构建—测试循环都会消耗材料、设备和专业人员时间。
序贯优化可能使流程尤为低效。研究人员可能先改善结合能力,随后发现黏度问题,再次修改序列,然后发现新版本丢失了部分原有优势。
DualGPT-AB 通过将多项目标属性置入生成目标来挑战这一工作流。研究人员不必先要求模型生成强 HER2 结合物、再在之后处理所有其他特征,而是可以让生成过程以组合属性谱为条件。
研究团队成员此前的工作已探索过用于抗体文库设计的生成式 Transformer 和深度强化学习。那项工作以 Herceptin 为模板,并结合与黏度、清除率和免疫呈递相关的指标,评估 HER2 特异性。
DualGPT-AB 通过双阶段架构扩展了这一思路。第一阶段在明确条件下学习序列—属性关系。第二阶段则寻找能够在所选约束条件下获得良好评分的序列。
这一结构应对两种不同的失效模式。无约束生成器可能产出看似合理、却不满足项目要求的抗体。优化过于狭窄的智能体则可能钻预测器的空子,或失去发现更优候选物所需的多样性。
条件阶段提供方向,而强化学习则围绕这一方向扩展搜索。原则上,这种组合应产生既相关、又不那么局限于显而易见序列模式的候选物。
压力落在传统筛选和优化管线之上,而不是实验室生物学本身。DualGPT-AB 仍依赖实验数据、预测器质量、候选物表达和湿实验室确认。
它的价值主张在于更好的优先级排序。如果模型能够让文库中满足多项约束的候选物更加集中,研究人员就可以将实验室产能投入到规模更小但更有前景的候选集合上。
在 100 个抽样设计中发现 8 个成功结合物,提供了一个早期富集信号。然而,这一数字不能被换算为抗体发现领域的通用成功率。
候选样本来自一个设计文库,围绕一个研究充分的靶点以及已知治疗参考物构建。其表现会随抗原、可用训练数据、属性预测器、序列框架和实验成功定义而变化。
即便如此,这一结果直接回应了一个公认的瓶颈。仅能生成数百万个看似合理蛋白质的模型,可能加重筛选负担;而能提高实验上有用候选物浓度的模型,则可能降低这一负担。
双阶段设计改变搜索机制
核心技术举措,是将属性条件生成与奖励引导的探索分离开来。
单一生成模型能够学习抗体序列的统计语法。这种能力有助于避免生成明显不合理的输出,但合理性并不等同于治疗价值。
DualGPT-AB 通过可学习嵌入来表示所请求的属性。嵌入是一种数值表示,使模型能够在预测序列的下一个元素时纳入条件信息。
这让生成器能够将序列模式与属性谱关联起来。模型并非依赖固定的自然语言提示,而是接收与优化任务相连的结构化信号。
强化学习阶段随后将属性预测作为反馈。与目标更匹配的序列获得更高奖励,从而改变模型的采样行为。
这一机制类似于迭代式计算筛选流程。模型提出序列,评分函数对其进行评估,生成器再适应性地朝着属性更理想的候选物发展。
它不同于生物亲和力成熟,后者是免疫细胞在活体系统内发生突变并经历选择的过程。DualGPT-AB 则基于学习到的序列模式和计算属性估计器进行人工搜索。
这一差异避免了一个看似顺理成章却具有误导性的结论。该框架并未重建完整免疫系统,也没有建模支配抗体表现的所有生物学因素。
其最具体的设计目标是 CDRH3。该区域对抗原结合贡献很大,但完整抗体的行为还取决于其他互补决定区、框架残基、重链—轻链配对以及 Fc 区域。
结构背景又增加了一层复杂性。两个预测属性相近的序列,可能折叠方式不同、结合残基取向不同,或在作为完整抗体表达时呈现不同表现。
DualGPT-AB 尝试让一个受约束的问题更易于处理,而不是消除这些依赖关系。其输出是一个供进一步评估的候选文库。
该模型的公开代码提升了接受技术审查的前景。研究人员可以检查实现选择、在其他数据集上测试该框架,并将其结果与替代生成器进行比较。
底层的公开数据集也有助于确保可重复性。公开可用并不能保证每项结果都能复现,但它降低了独立评估面临的一项主要障碍。
复现不应只着眼于生成相似的数值评分。真正有意义的检验在于,外部团队独立合成并检测自行选定的候选物时,是否能获得可比的富集效果。
该框架还需要与强有力的替代方案进行比较。可用的基线包括展示文库筛选、传统机器学习、蛋白质语言模型、扩散系统、结构引导设计以及混合式流程。
公平的比较必须将实验室预算和候选物数量保持在合理的一致水平。生成更多序列可以提高找到命中物的机会,却未必能提升优先级排序的质量。
研究人员还应披露,在最终实验候选集形成之前,评估过多少计算生成的候选物。采样和筛选决策会影响任何生成式设计系统表面上的效率。
另一个问题是奖励设计。如果评分模型存在系统性偏差,强化学习可能会通过寻找利用预测器弱点的序列来放大这些偏差。
这一问题通常被称为奖励黑客。生成的序列会获得很高的计算评分,却无法带来预期的现实世界属性。
湿实验验证是最佳防线,DualGPT-AB 也纳入了这一环节。然而,少数几个有利的实验并不足以证明奖励函数在陌生靶点或更广泛的序列家族中依然可靠。
因此,该系统的机制才是真正的重点。它提供了一种严谨的方法,将多项所需属性、生成式探索和实验室测试连接起来。最终结果仍取决于这条链路中的每一个组件。
Herceptin 对比需要明确边界
在选定实验室测试中表现出比 Herceptin 更好的活性,是一个有前景的结果,而不是疗效更佳癌症药物的证据。
Herceptin 是一个有意义的基准,因为它是一种已在临床确立的靶向 HER2 抗体。它还提供了一个熟悉的序列框架,用于探索关键结合区域的变化。
研究报告称,选定的 DualGPT-AB 候选物与 Herceptin 相比表现出更强的肿瘤杀伤活性。作者使用湿实验检测来支持这一主张,使该项目不再只是纯计算层面的展示。
这比单凭预测亲和力更有说服力。候选物可能获得颇具吸引力的结合评分,但在合成、表达或活细胞测试时仍可能失败。
不过,实验室活性只衡量了治疗性能的一部分。一种成功的抗体必须在生产、制剂、储存、给药及生物学条件下保持其表现,而这些条件与受控实验检测存在显著差异。
一种抗体可以与 HER2 紧密结合,却仍可能因清除速度过快而失败。它可能表现出强效的细胞杀伤能力,却产生不可接受的脱靶效应。它可能在模型系统中有效,却在人类异质性肿瘤中表现不佳。
该研究的样本也应谨慎解读。在随机选取的 100 个设计中,有 8 个表现出强 HER2 结合能力,这意味着大多数抽样候选物并未达到所报告的标准。
这未必是糟糕的结果。实验命中率取决于任务难度和筛选标准。只有在相同条件下与相关基线进行一致比较时,这一数字才具有意义。
更大的担忧在于泛化能力。HER2 和 Herceptin 提供了异常丰富的生物学和工程学背景。围绕这一场景训练和评估的框架,在表征较少的靶点上可能会有不同表现。
序列数据稀缺、结构柔性较高、构象依赖膜环境或检测较弱的靶点,都可能暴露模型局限性。它们也会降低属性预测器的可靠性。
一项 2026 年 Biogen 的工业评估说明了通用蛋白质模型与实际药物研发项目之间的差距。研究人员利用来自 33 个历史治疗项目的测量数据评估了蛋白质语言模型。
在内部抗体序列上进行微调,提升了模型在多项可开发性检测中的预测表现。这一发现支持专门化建模,但也表明私人实验数据为何仍具有重要战略价值。
DualGPT-AB 的抗体专用方法与这一经验相符。领域适配和任务专属信号可能优于通用表征,因为治疗性开发所提出的问题比广泛蛋白质建模更具体。
然而,工业数据会带来公开基准可能无法捕捉的分布偏移。基于可用序列训练的模型,在制药研发流程中可能遇到陌生的骨架、靶点、检测格式或失效机制。
另一项 2026 年的筛选流程展示了另一条路径。研究人员结合结构对接、图神经网络、分子动力学和自由能分析,针对 Activin A 筛选了约 5,000 个抗体结构。
该项目将范围缩小至 11 个候选物,并通过实验确认了其中两个结合物。据作者称,其中一个表现出亚纳摩尔亲和力和中和活性。
这一比较揭示了设计理念之间更广泛的竞争。DualGPT-AB 强调生成式序列优化,而多尺度流程则将学习型预测与基于物理的结构分析相结合。
两种方法都尚未定论。生成式模型可以高效搜索巨大的序列空间。基于物理的工具可以增加机制约束,但需要更多计算资源和可靠的结构数据。
混合系统最终可能比单一模型更具实用性。生成器可以提出候选物,结构方法可以筛选它们,实验室自动化则可提供用于重新训练的新数据。
相关问题并非 AI 是否会取代实验性抗体发现,而是某个特定系统是否能减少获得具备开发质量候选物所需的高成本循环次数。
DualGPT-AB 在发现阶段提供了令人鼓舞的证据。它尚未回答主导后期开发的转化问题。
这些问题包括药代动力学、毒理学、可制造性、制剂、动物疗效和临床反应。在此类数据出现之前,“加速发现”不应被理解为“缩短药物开发的每一个阶段”。
三个信号将决定下一步走向
只有当 DualGPT-AB 的富集效果经得起独立复现、新靶点和日益严苛的生物学测试时,它才会产生实质性影响。
第一个信号是对 HER2 结果的外部复现。独立实验室应运行已发布的代码,采用记录在案的筛选标准,合成新样本,并重复结合与功能检测。
成功复现将增强这样一种主张:观察到的富集效果来自该框架,而非某项未记录的筛选选择。若无法复现,关注点将转向数据集泄漏、检测差异或筛选效应。
第二个信号是在数据成熟度较低的新靶点上的表现。重复一次有利的 HER2 测试会增加信心,但一个困难的抗原将检验该方法是否学到了可迁移的抗体设计原则。
一项有说服力的后续研究应预先定义候选物预算,并将 DualGPT-AB 与强有力的计算和实验基线进行比较。它应当像报告成功候选物一样清楚地报告失败案例。
跨靶点的积极结果将增强其作为可复用抗体专用 AI 框架的论据。若性能显著下降,则表明当前成就高度依赖 HER2 数据和 Herceptin 骨架。
第三个信号是超越初始细胞检测。动物研究、药代动力学测量、稳定性测试、免疫原性评估和生产分析,将揭示早期计算评分无法充分表征的属性。
这些测试中的进展将支持多目标前提。如果候选物因已纳入优化目标的属性而失败,研究人员就需要重新审视预测器和奖励机制。
这正是抗体 AI 下一阶段变得不那么耀眼、却更具信息价值的地方。序列生成之所以受到关注,是因为它能产出可见的设计。候选物淘汰则揭示模型是否理解了真正重要的约束。
Google News 的曝光可以让计算蛋白质设计领域以外的研究人员看到这项工作。但它也可能将一篇审慎的论文简化为“AI 即刻生产更好药物”的故事。
更有力的解读应当更加克制。DualGPT-AB 加入了日益壮大的一类系统,它们试图将生成式模型与具有实验实用价值的分子连接起来。
其 8 个强结合物和选定的功能性候选物代表的是证据,而非一个完成的治疗项目。这些证据之所以有价值,是因为许多计算项目止步于合成和生物学测试之前。
药物开发者应关注该系统是否能在受控比较中减少实验工作量。计算研究人员应审视其条件控制、奖励函数、多样性及其对靶点特异数据的敏感性。
评估类似平台的企业团队应要求提供候选物级别的审计轨迹。他们需要了解每个预测器由哪些数据训练、哪些约束塑造了生成过程,以及为何特定序列得以进入测试。
当结果在计算科学家、抗体工程师、检测团队和决策者之间流转时,这条证据链至关重要。一个可搜索的技术知识库可以帮助团队将这些假设与实验结果一同留存。
未来三个月应会出现对已发布实现的审查、对所报告结果的复现尝试,以及关于后续靶点的讨论。这些反馈将比又一波泛泛的 AI 药物发现主张更重要。
DualGPT-AB 能否产出一个经受完整临床前项目考验的候选物,还是会停留在以 HER2 为中心的强有力概念验证?关注 Google News 的读者应超越标题,追踪这三个信号:独立复现、靶点迁移和更深入的生物学验证。



