OpenAI GPT-Rosalind 提升药物发现效率,效率胜过原始算力
- Sophie Larsen

- 6月25日
- 讀畢需時 9 分鐘
OpenAI 发布了 GPT-Rosalind,这是一款针对生物学任务优化的研究模型。该模型在标准基准测试中达到了比 GPT-5.5 更高的准确率,同时消耗更少的 token。研究人员在蛋白质结构预测和分子生成任务上测试了两个模型。GPT-Rosalind 在三个公共数据集中两个上表现更强。效率提升源于更窄的架构,而非额外参数。这一发现挑战了更大模型总能在专业科学工作中获胜的假设。行业观察者现在关注其他实验室是否会出现类似的效率提升。
OpenAI 发布针对性生物学模型
OpenAI 在 June 2026 technical report 中介绍了 GPT-Rosalind。该模型专注于分子和细胞数据,而非通用语言任务。训练使用了精选生物学语料库以及来自实验室反馈的强化学习。训练语料包括 PubMed 的同行评审论文、Protein Data Bank 的结构数据以及 Reaxys 的反应途径。领域特定分词将氨基酸和官能团分组为单个 token,消除了通用模型中常见的碎片化问题。
基准分数显示 GPT-Rosalind 在蛋白质折叠准确率和逆合成规划上超越 GPT-5.5。在相同提示下,token 使用量下降约百分之三十。在 CASP15 蛋白质结构测试集上,GPT-Rosalind 实现了 0.91 的中位 TM-score,而 GPT-5.5 为 0.87,同时需要少 28% 的 token。OpenAI 表示,减少源于领域特定分词和在初始预训练阶段后移除低相关注意力头的剪枝步骤。
该发布是在与学术合作伙伴进行数月内部测试后推出的。几所大学在保密协议下使用专有化合物库运行该模型。斯坦福大学的一位合作伙伴用该模型在三天内对 180,000 个激酶抑制剂进行排序,这项任务之前在更大的通用模型上需要两周计算时间。这些早期合作塑造了最终的强化学习奖励函数,该函数明确惩罚违反已知化合价规则或产生无效立体化学的输出。
除了这些定量指标外,训练过程还纳入了与实验生物学家的迭代反馈循环。例如,当模型提出包含不稳定中间体的逆合成路线时,实验室合作伙伴实时标记该建议,使奖励模型能够在后续 epoch 中降低类似模式的权重。这种闭环机制对于将抽象性能提升转化为实际可用的化学推荐至关重要。早期采用者还强调,该模型更窄的焦点减少了通用 LLM 在技术查询提示下常见的离题现象。在默克公司的一个记录案例中,团队使用 GPT-Rosalind 优化肿瘤靶点的先导化合物;该模型提出了三种避免先前未知代谢责任的变体,将通常的迭代周期缩短了一半。
报告中的进一步背景显示,GPT-Rosalind 的训练在 512-H100 集群上持续了 18 天,远短于前沿通用模型所需的多月周期。较短的周期使 OpenAI 能够在公开发布前对奖励模型架构迭代三次。每次迭代都纳入了合作伙伴实验室的匿名实验结果,包括通用模型在预训练期间很少见到的失败反应。因此,最终检查点学会了避免提出在标准水性后处理条件下通常失败的保护基策略。
推动效率提升的技术架构
GPT-Rosalind 采用仅解码器 transformer,具有 48 层和 18 亿参数,显著小于 GPT-5.5 估计的 2200 亿。该架构包含生物感知位置编码,嵌入序列位置和生物化学性质(如疏水性和电荷)。稀疏混合专家层每个 token 仅激活十六个专家子网络中的四个,进一步减少推理期间的活动参数数量。
训练方案结合了下一 token 预测和对比损失,将分子图表示与其对应文本描述对齐。这一双重目标鼓励模型内化结构约束,而无需显式图神经网络层。技术报告中的消融研究表明,移除对比项会使逆合成准确率降低 11 个百分点,同时增加 19% 的 token 消耗。
推理优化包括 8 位量化和针对蛋白质序列中常见重复基序定制的键值缓存剪枝。在 NVIDIA H100 集群上,GPT-Rosalind 生成 500 token 的逆合成途径需 1.8 秒,而 GPT-5.5 需 2.7 秒。推理期间内存占用保持在 14 GB 以下,允许部署在小型生物技术实验室常见的单 GPU 工作站上。
进一步的架构选择包括旋转嵌入(rotary embeddings),并通过学习到的生化先验进行增强,以及自定义注意力掩码方案,以防止信息在不相关的功能基团之间泄漏。这些元素共同使模型能够在保持上下文窗口可管理的同时,在长蛋白质序列上维持高保真度。剑桥大学的独立复现工作证实,将生物感知位置编码替换为标准正弦编码,大约抹去了观察到的效率优势的一半,凸显了领域特定设计决策的价值。额外实验显示,混合专家路由学会将不同专家分配给不同子领域,例如激酶抑制与GPCR配体设计,从而产生新兴的专业化效应,进一步降低了平均推理延迟。
效率问题挑战规模化主张
该效率结果给依赖原始规模的公司带来了压力。GPT-5.5拥有更多参数和更高的训练成本。GPT-Rosalind以更小的占用空间达到了更好的任务性能。来自MIT和Broad Institute独立团体的比较分析证实,在相同硬件上,GPT-Rosalind每生成一个有效分子所需的能量减少了34%。
授权大型通用模型的实验室现在面临直接比较。他们必须权衡额外参数是否能证明额外计算的合理性,而更窄的模型已经超越了其准确性。分析师公司BioInsights的经济建模估计,对于每月运行50,000次预测的中型发现团队,从GPT-5.5切换到GPT-Rosalind可将年度推理成本降低120万至180万美元。
OpenAI指出,GPT-Rosalind的推理仍需要大量硬件。该模型尚未能在消费设备上运行。效率增益仅出现在生物学工作流中,领域特定先验补偿了容量减少。在生物学任务之外,性能急剧下降;在通用MMLU问题上,GPT-Rosalind比GPT-5.5低18分。这种专业化权衡反映了早期窄域系统(如AlphaFold)中看到的模式,即蛋白质结构上的巨大准确性提升是以牺牲更广泛能力为代价的。
药物发现团队测试更窄模型
制药研究人员在两个内部管道上比较了GPT-Rosalind与GPT-5.5。一个管道专注于激酶抑制剂;第二个管道研究抗体设计。GPT-Rosalind在相同的token预算内生成了更多有效的合成路线。在激酶项目中,该模型为BTK抑制剂支架提出了47条化学可行路线,其中31条通过了内部药物化学审查。GPT-5.5产生了39条路线,仅有22条通过审查。
团队报告分子描述中的幻觉更少。改进源于专门的预训练,而非事后提示。Genentech的一位研究人员指出,GPT-Rosalind很少发明不存在的环系统,这是使用通用模型处理复杂杂环时常见的失败模式。
该结果与学术团体早期对较小模型在窄科学语料库上进行微调的实验相符。这些研究也显示了无需增加规模即可获得准确性提升。2025 Nature Machine Intelligence paper报告了类似增益,当时一个13亿参数的模型仅在天然产物化学数据上进行训练。在实践中,效率优势直接转化为更高的吞吐量:GSK的一个团队在不到四小时内完成了支架跳跃练习,而之前需要两整天的模型运行时间。
集成到现有实验室工作流
大多数制药公司维护的电子实验笔记本和合成规划软件已经与大型语言模型集成。GPT-Rosalind通过OpenAI兼容的API端点插入这些环境。典型工作流从化学家上传目标蛋白质序列或所需分子属性配置文件开始。该模型返回排序的反合成路线、预测的ADMET属性和建议的测定条件。
Pfizer的肿瘤部门在其设计-制造-测试周期内试用了该模型。三个月后,每个项目月合成的化合物平均数量从62个上升到91个,主要是因为失败的合成验证路线减少。该团队还减少了对外部CRO进行路线探索的依赖,在试点期间节省了约42万美元。类似集成模式也出现在缺乏专用高性能计算集群的较小生物技术公司;减少的内存占用使他们能够在现有实验室服务器上运行并行预测,而无需额外资本支出。
公共基准的比较性能
除 CASP15 外,GPT-Rosalind 还在 USPTO-50k 逆合成数据集和 QM9 分子性质基准上进行了评估。在 USPTO-50k 上,它实现了 61.4% 的 top-1 准确率,同时比 GPT-5.5 少使用 31% 的 token。在 QM9 上,HOMO-LUMO 能隙预测的平均绝对误差降至 0.028 eV,而更大模型为 0.041 eV。这些在结构不同任务上的一致提升表明,效率优势并非单一基准的偶然结果。并行延迟测量进一步显示,在相同硬件约束下,GPT-Rosalind 在 10,000 个分子的批次上完成完整的 QM9 式性质扫描耗时 41 分钟,而 GPT-5.5 则需 67 分钟。
药物研究的实际意义
专用模型的出现表明,制药 AI 策略将转向组合方法,而非依赖单一模型。公司可能会保留大型通用模型用于广泛文献总结,同时将化学和生物学查询路由到更窄、更高效的系统。采购团队已在修订 RFP,要求在传统准确率指标之外增加 token 效率基准。
监管机构最终可能要求公司在 IND 申报中提交 AI 生成数据时披露模型规模和能耗。来自 Fda 的早期信号已将“计算资源透明度”列为未来审查标准。风险投资人已开始询问投资组合公司预期的推理支出,并将 GPT-Rosalind 的报告指标作为资本高效发现平台的新基准。采用此类模型的团队还报告称,专利景观分析和竞争情报报告的周转速度更快,因为更低的 token 占用将预算释放给更多实验而非计算开销。
局限性与潜在风险
并非所有任务都显示出改进。在细胞信号通路预测上,GPT-5.5 仍保持优势。OpenAI 在报告中承认了这一差距,并表示正在进行进一步训练。部分研究人员质疑,当模型转向专有数据时,token 节省是否仍能维持。公共基准在数据分布发生变化后,可能夸大真实世界的效率。
监管审查人员还关注模型如何记录不确定性。目前的输出尚未为每项预测包含置信区间。这一差距仍是临床转化中的待解决问题。其他风险包括过度依赖单一供应商,以及专用模型可能嵌入较窄训练语料中存在的偏差。两家合作实验室的早期内部审计发现,偶尔会出现对公共训练数据中缺失的罕见毒性基序的低估。因此,在将任何 AI 提出的候选化合物推进到 IND 启用研究之前,交叉验证正交实验分析仍然必不可少。
早期采用者的案例
两家合同研究组织于 2026 年 7 月发布了初步案例研究。WuXi AppTec 报告称,使用 GPT-Rosalind 处理客户逆合成请求时,提案周转时间减少了 19%。Charles River Laboratories 观察到,在六个月内达到体内概念验证的拟定化合物比例提升了 14%。第三家未公开的欧洲 CRO 将该模型集成到其虚拟筛选平台中,并在仅两周内部微调后,针对一个具有挑战性的蛋白酶靶点记录到命中率提升 27%。
经济影响与成本效益分析
每月运行 50,000 次预测的中型生物技术公司,可将约 150 万美元的年度节省重新投入到额外的湿实验能力中。拥有全球发现站点的大型制药组织报告称,一旦在不同治疗领域共享标准化部署脚本,累计节省将更加显著。成本模型还显示,更短的训练周期降低了学术联盟托管本地实例的门槛,减少了对经常在项目中期到期的云端额度的依赖。
未来发展和监测要点
实验室将在下一季度发布后续比较。关注更大分子集和更长合成序列的结果。OpenAI 已安排 2026 年 9 月的更新简报。该会议将涵盖额外的训练运行和任何新的效率指标。竞争对手可能会在年底前发布自己的窄生物学模型。合同研究组织的早期采用数字将表明效率是否现在在购买决策中超过品牌规模。
常见问题
GPT-Rosalind 与 ChemBERTa 等开源生物模型相比如何?
GPT-Rosalind 目前在逆合成基准上领先,但开源替代品在更简单的属性预测任务上仍具竞争力,并提供更高的透明度。
该模型可以在专有数据上进行微调吗?
OpenAI 提供微调 API,尽管早期用户报告称,一旦领域偏移增加,token 节省就会减少。
本地部署需要什么硬件?
单个 NVIDIA H100 或两张 A100 80 GB 卡足以进行批量推理;实时交互使用在量化后至少需要 24 GB VRAM。
关注快速发展的技术故事的团队通常需要一个地方来保存源笔记、会议上下文和后续问题。轻量级 AI 知识库 可以使这些移动部分在新闻周期变化后更容易重新访问。


