top of page

Apple SimpleDesign 蛋白质模型取消了 Tokenizer,但仍离不开实验室验证

9月13日
讀畢需時 16 分鐘

Apple 研究人员推出了 Apple SimpleDesign 蛋白质模型,这是一个可同时生成氨基酸序列及其对应三维结构的单阶段系统。其核心矛盾十分明确:SimpleDesign 移除了多种多模态蛋白质模型所使用的结构 Tokenizer 环节,但尚未获得实验室验证。

这一差别很重要,因为“单阶段”并不意味着一个完整蛋白质能在一次计算中生成。SimpleDesign 在推理过程中采用迭代采样。它简化的是模型学习和表示序列与结构的方式,而不是生成所需的更新次数。

这项发表于 2026 年 9 月的研究对 ESM3 和 DPLM-2 等模型提出了挑战,后者使用离散 token 表示蛋白质结构。Apple 团队则直接基于氨基酸符号和连续的主链坐标进行训练。由此得到的是一种更简单的建模方案,同时在多项计算基准测试中保持竞争力。

不过,该论文并未证明 SimpleDesign 能够生成具有功能的药物、酶或生物工具。其生成的蛋白质由其他计算模型进行评估,尚无任何样本被合成并在实验室中测试。

这让 SimpleDesign 处于一个重要但有限的位置。它表明,蛋白质协同设计所需的表征机制可能比研究人员此前设想的更少。但它并不意味着生物学验证已变得可有可无。

Apple 实际为 SimpleDesign 做了哪些改变

SimpleDesign 移除了联合蛋白质序列与结构生成中的独立结构 Tokenizer。

蛋白质结合了两种密切关联的信息形式:序列是按顺序排列的氨基酸字符串,结构则是连续的三维空间排布。一个有效的协同设计模型必须让这两种表示保持一致。

一些多模态蛋白质系统会将三维几何转换为离散的结构 token。这些 token 让语言模型架构能够通过更统一的接口处理序列和结构。该方法较为便利,但也增加了一个需要学习的组件。

结构 Tokenizer 的作用类似于压缩层。它会先将精细坐标转换为有限词表,再让生成模型从中学习。转换过程中丢失或扭曲的信息,可能影响建立在其上的所有环节。

Apple 研究人员质疑,这种中间词表是否确有必要。根据 SimpleDesign 论文,其模型直接嵌入连续的三维坐标,并在一次端到端训练过程中结合分类序列目标与坐标回归目标。

序列目标采用交叉熵,用于衡量模型预测氨基酸类别的准确程度。结构目标则训练模型从带噪输入中恢复连续坐标。两项目标共同帮助模型学习序列和结构之间的联合关系。

SimpleDesign 通过不同的扰动设置支持多项相关任务。它可以根据已知序列重建结构、根据结构信息恢复序列,或同时生成两者。共享的配置减少了为不同任务单独设计流程的需要。

该模型的默认骨干采用 Mixture-of-Transformer 设计。这一架构为序列和结构分别提供投影、归一化和前馈处理。全局自注意力机制仍使信息能够在两种模态之间流动。

这种分离承认了两者真实存在的技术差异。氨基酸身份属于离散类别,而原子坐标是连续的几何数值。将它们完全等同处理,会掩盖各模态各自有用的特性。

不过,专用骨干并非论文的核心成果。在研究人员的消融测试中,标准 Transformer 变体同样表现出竞争力。因此,作者将 SimpleDesign 的许多表现归因于直接在数据空间中训练,而非某一种专用架构。

团队使用 ESM2-650M 权重初始化了两种变体的部分模块。这为序列通路提供了预训练基础,而不是迫使系统从零开始学习全部蛋白质序列关系。

Apple 的研究摘要称,SimpleDesign 在超过 200 万个序列—结构配对样本上完成训练。论文指出,AFESM 是主要数据集,随后还在经过筛选的 SwissProt 数据上进行了额外微调。

AFESM 集合汇集了与 AlphaFold Database 和 ESM Metagenomic Atlas 相关联的预测结构。其原始数据池包含超过 8 亿个预测结构。聚类先将这一数据池缩减为约 500 万个非单例结构组,之后再进行过滤和采样。

SimpleDesign 在 AFESM 上训练了 300,000 步,随后又进行了 50,000 步 SwissProt 训练。研究人员评估了长度为 100、200、300、400 和 500 个氨基酸的生成蛋白质。

这些细节界定了实际发生的事件。Apple 发布的是一种研究方法,而非生物技术产品或临床平台。其贡献在于一种更精简的联合建模策略,以及所报告的基准测试结果。

为什么无 Tokenizer 的蛋白质设计很重要

Tokenizer 问题会影响训练复杂度、信息损失,以及单个模型连接序列与几何结构的难易程度。

结构 Tokenizer 解决了一个棘手的接口问题。Transformer 是围绕离散 token 序列开发的,而蛋白质结构存在于连续的三维空间中。将坐标转换为 token ID,会让两类输入看起来更加相似。

DPLM-2 采用了这一路径。其多模态模型使用无查找量化,将三维坐标转换为离散结构 token。随后,它在扩散蛋白质语言模型中从序列和结构中学习。

ESM3 同样对包括序列、结构和功能在内的多种蛋白质模态进行建模。其基于词表的框架帮助生成了一种远缘荧光蛋白设计,研究人员已将其合成并开展研究。因此,经同行评审的 ESM3 研究提供了 SimpleDesign 尚未具备的证据:生成结果与实验观察之间的联系。

Tokenization 仍伴随着取舍。离散的结构词表无法保留每一种坐标层面的差异。扩大词表容量可以捕捉更多细节,但也会扩大表征问题的规模。

单独训练的 Tokenizer 会形成另一项依赖。其行为会在联合学习开始前约束生成模型。对结构表示训练方式的调整,也可能需要同步改动流程中的其他部分。

SimpleDesign 通过直接学习连续坐标绕开了这种依赖。该模型仅预测 alpha-carbon 位置,通常写作 Cα 坐标,即以每个残基的一个参考原子描绘蛋白质主链。这种表示比完整原子模型更简单。

模型在生成序列时,以被掩码的氨基酸位置作为起点;在生成结构时,则从经高斯噪声扰动的坐标开始。采样过程中,它逐步揭示序列身份,同时对结构进行去噪。

这些更新仍然是迭代式的。序列调度线性推进,而结构调度将更多更新安排在最终精修阶段附近。因此,把 SimpleDesign 称为字面意义上的“单次通过”生成器,会夸大论文的结论。

更严谨的描述是“单阶段”或“端到端”。系统并不存在一个独立训练的结构 Tokenizer,随后再进行另一阶段生成训练的流程。但训练完成的系统在创建输出时,仍需要多个计算步骤。

这种区别不只是措辞问题。单次通过模型意味着推理流程和延迟可能大幅降低。SimpleDesign 的研究主张则关乎训练和表征的组织方式。

直接方法可能让实验更容易开展。研究人员可以修改坐标目标,而不必先重新设计结构码本。他们还可以研究离散压缩是否掩盖了有用的几何细节。

SimpleDesign 的标准 Transformer 结果强化了这一论点。如果只有 Mixture-of-Transformer 版本有效,其优势可能来自架构专业化。共享 Transformer 模块取得的竞争性结果表明,训练目标可以跨越不同骨干选择发挥作用。

消融实验也防止人们得出夸大的结论。论文并未证明模态专属处理总是更优。在若干已报告的设置中,普通 Transformer 的表现与更专用的设计相当,甚至更好。

这一结果让 SimpleDesign 的意义超出了蛋白质生成领域。多模态 AI 系统常依赖 Tokenizer 来协调彼此不兼容的数据类型。Apple 的研究提出了一个问题:在何种情况下,直接预测可以取代单独学习的词表。

蛋白质设计提供了一项严苛测试,因为序列和几何结构会相互约束。一个看似合理的序列若与不相容的结构配对,就不能算是成功的联合设计。两项输出必须在独立评估下保持一致。

这一概念对研究基础设施具有实际意义。更少的独立训练组件可以减少流程协调、故障点和模型版本依赖。但这并不自动降低总计算需求,论文也未通过全面成本比较证明这一点。

更大的机会在于方法论。研究人员如今拥有一个具备竞争力的无 Tokenizer 基线,可用来与 token 化蛋白质语言模型进行比较。这有助于澄清结构 Tokenization 是否提供了持久价值,还是主要带来了实现便利。

Apple SimpleDesign 蛋白质模型与专用几何系统之比较

SimpleDesign 对 token 化蛋白质语言模型构成压力,但专用几何系统在多项结构一致性指标上仍处于领先。

主要竞争并非 Apple 与某一家生物技术公司之间的较量,而是直接连续坐标学习与结构 Tokenization 或嵌入更强几何假设的流程之间的比较。

SimpleDesign 将自身与 ESM3、DPLM-2 等多模态蛋白质语言模型进行比较,同时也与 MultiFlow、RFdiffusion、Proteina 和 La-proteina 等几何系统进行基准测试。

这些模型家族优化的重点不同。多模态语言模型寻求在蛋白质表示和任务之间建立共享基础。几何模型则往往对旋转、平移、主链框架或分子去噪施加更强的假设。

SimpleDesign 有意选择了最简化的坐标表示。它生成的是 Cα 主链坐标,而不是每一个主链和侧链原子。这降低了表征复杂度,但也限制了可立即获得的化学细节。

在无条件序列生成方面,SimpleDesign 报告的平均 pLDDT 为 81.19。pLDDT 是用于预测折叠结构的模型衍生置信度评分。在同一张评估表中,DPLM-2 报告的结果为 81.97。

SimpleDesign 的 ProGen2 困惑度为 5.18,而 DPLM-2 为 4.63。较低的困惑度意味着,对评估所用的蛋白质语言模型而言,生成序列看起来更可能成立。

这些数字表明其表现具有竞争力,但并非明确胜出。DPLM-2 在所列出的两项保真度指标上都略占优势。SimpleDesign 报告的序列新颖性更高,为 0.80;相比之下,作者给出的 DPLM-2 基于相似度的数值为 0.90,但多样性仍然有限。

论文承认了这种张力。在解码序列的同时联合实现一个结构,会施加额外约束。这些约束能够提升输出之间的一致性,但也会缩小所采样序列的范围。

结果还会随模型的噪声参数而变化。在一种微调后的 Mixture-of-Transformer 设置下,SimpleDesign 在两项评估标准中的协同设计能力得分分别为 0.53 和 0.74。提高噪声设置会增加多样性,同时降低一致性。

这是生成任务的核心权衡。一个系统可以反复生成安全、熟悉的结构,并在保真度上取得较高分数;也可以探索更多样的结构,但会增加序列与几何构型不一致的风险。

SwissProt 微调让 SimpleDesign 更偏向一致性。在两种 Transformer 骨干网络中,经过整理的数据均提升了协同设计能力。同样的微调通常会降低 FoldSeek 聚类多样性,表明生成的结构模式更为保守。

因此,数据质量也应与模型设计共同获得认可。SimpleDesign 的最终结果并未将无 tokenizer 目标与所有训练数据效应完全区分开来。论文直接承认了这一限制。

专门的几何模型仍然实力强劲。MultiFlow 通过生成流联合建模离散序列和连续结构。SimpleDesign 的作者报告称,MultiFlow 在多项指标上的协同设计能力更强。

在论文扩展的结构生成评估中,MultiFlow 在一种基于 ProteinMPNN 的设置下取得了最高 0.86 和 0.90 的可设计性数值。因此,SimpleDesign 的核心论点并不是几何导向模型已经过时。

其论点在于:即使没有结构 tokenizer 或专用几何架构,更简单的 Transformer 形式依然具有竞争力。这在复杂度与性能曲线上创造了一个新的位置。

RFdiffusion 说明了为何基准领先只是故事的一部分。其经过同行评审的蛋白质设计研究包含了对设计组装体、金属结合蛋白和结合蛋白的实验工作。

研究人员在多项任务中合成了数百个 RFdiffusion 设计。针对一项结合蛋白项目,报告的筛选成功率达到 19%。冷冻电子显微镜结构与预期的流感靶点设计高度吻合。

SimpleDesign 没有可比的湿实验结果。即使它在某项计算评分上接近或超过竞争对手,也无法抹去后者的实验性证据。

ESM3 从另一个方向带来了类似压力。它体现了更广泛的多模态雄心,并已生成一种在计算机之外接受测试的荧光蛋白。SimpleDesign 提供了更精简的表示方式,但尚未达到同等水平的验证。

这种格局使得“轻松决出胜者”的叙事难以成立。无 token 训练可能简化模型构建;专门的几何方法可能保留更强的结构约束;而经过实验验证的系统则拥有计算评分无法替代的证据。

对开发者而言,相关问题并不是哪篇论文拥有最高的孤立数值,而是哪种设计能在真实的算力、条件控制、合成和测试约束下产生有用的候选方案。

SimpleDesign 目前只回答了这一问题的一部分。它表明,一个相对直接的模型可以生成在计算上保持一致的序列—结构对。但它并未说明,哪一种候选筛选流程能让实验室在每次实验中获得最佳结果。

基准结果止步于计算验证

SimpleDesign 最大的不确定性并非模型准确度,而是其生成的蛋白质是否能在物理实验中折叠并发挥功能。

研究人员通过重新折叠生成序列,并将预测结构与 SimpleDesign 生成的结构进行比较来评估一致性。指标包括自一致性 RMSD 和自一致性 TM-score。

RMSD 衡量结构对齐后平均位置差异。TM-score 强调整体折叠相似性,对蛋白质长度不那么敏感。两者都很有用,但在这项研究中仍然只是计算代理指标。

评估还采用了 ESMFold、ProteinMPNN、ProGen2、FoldSeek 以及数据库比对。这构成了一套广泛的计算测试体系,但并未将预测转化为实测结果。

一个生成序列可能因为类似于某个模型训练分布中的模式,而在该模型看来很合理。另一个预测模型随后可能为其赋予可信的折叠结构。模型之间的一致性很有价值,但相关的假设可能贯穿整条评估链。

真实蛋白质还面临这些评分未涵盖的条件。它们必须能在生物系统中表达、避免聚集、形成稳定折叠,并保持所需行为。功能性设计还必须按预期与靶标相互作用,或催化反应。

SimpleDesign 未报告蛋白表达、纯化、结合实验、酶活性、热稳定性或结构测量。作者明确将实验测试列为未来工作。

他们提议与实验团队合作,在体外表达并表征 5 到 10 种生成蛋白。这将构成初步的现实检验,而非覆盖治疗或工程任务的广泛验证。

论文还将评估范围限定为 100 至 500 个残基的蛋白质。该范围排除了许多超大型组装体和多结构域酶,也未覆盖与生物学相关的所有蛋白质类别。

内在无序蛋白带来了另一项限制。这类蛋白并不维持单一稳定的三级结构,却承担重要的信号传导和调控功能。以单一骨架几何构型为中心的生成框架,并不能自然覆盖这类行为。

SimpleDesign 仅预测 Cα 坐标。完整的蛋白质模型还需要额外的主链原子、侧链、键几何和化学相互作用。在许多下游用途之前,其他工具仍需重建或优化这些细节。

论文最广泛评估的是无条件生成。在这项任务中,模型生成蛋白质时无需针对特定治疗靶点或生化功能提出要求。这不同于针对明确分子表面设计结合蛋白。

无条件基准可以揭示模型是否学到了合理的蛋白质分布,但无法展示其在实际设计需求下的可控性。实验室很少需要一种没有功能规格的随机折叠。

缺乏公开的产品接口也限制了当前采用。Apple 的研究页面指向该论文,但公告并未确立托管服务、受支持的模型发布版本或面向生产的生物技术工作流程。

这一状态应当让人谨慎看待其与开放可用或已有实验基础系统的比较。一种方法可以在真正被外部团队使用之前影响未来架构。发表与部署是两件不同的事。

训练数据溯源同样值得审视。AFESM 在很大程度上依赖其他 AI 系统预测的结构。大型预测数据库扩大了覆盖范围,但也可能将模型特有的偏差带入新的生成器。

在 SwissProt 上微调提升了报告中的一致性,同时降低了部分多样性。这表明数据整理选择会显著塑造结果。不同的数据组合可能改变 SimpleDesign 表面上的优势。

基准指标之间也可能不一致。论文在连续 TM-score 比较下报告了较高多样性,但在 FoldSeek 聚类下的多样性较低。作者将这种差异部分归因于训练数据差异。

这种不一致并非无关紧要的技术细节。多样性决定一个生成器是在探索新的结构空间,还是反复修改熟悉的折叠。不同指标捕捉的是“新颖”的不同含义。

因此,研究人员不应将 SimpleDesign 简化为单一排名。保真度、局部结构多样性、整体折叠多样性、新颖性与功能成功是不同属性。提升其中一项,可能削弱另一项。

最有力的解读是范围有限但具有价值的:Apple 团队已经表明,无 tokenizer 的协同设计值得认真评估。这项工作尚未证明,无 tokenizer 模型能够带来更多实验室成功案例。

这一区别将决定 SimpleDesign 会成为实用蛋白质工程的基础,还是仅作为一项有影响力的架构实验而存在。

Apple 为何此时投入蛋白质 AI

SimpleDesign 将 Apple 的机器学习研究扩展至科学建模领域,在这里,架构效率的重要性可与面向消费者的功能相当。

Apple 最为人所知的是设备和软件,而非实验室生物技术。然而,其机器学习团队经常发表涵盖视觉、语言、多模态学习和科学应用的研究成果。

多位 SimpleDesign 作者也参与过 SimpleFold——Apple 此前的蛋白质结构预测研究。SimpleFold 探索了精简的流匹配系统能否接近更复杂的折叠架构。SimpleDesign 将这种降低复杂度的偏好延伸至生成任务。

这两个项目面向不同方向。蛋白质折叠从序列出发并预测结构;蛋白质设计则在指定约束下搜索序列、结构或两者。

联合生成更难,因为两方面都不是固定的。模型必须创建两个彼此兼容的对象,而不是从其中一个推断另一个。任一模态的错误都可能使这一对结果失效。

随着蛋白质 AI 从预测走向设计,Apple 的贡献适逢其时。AlphaFold 展示了高质量结构预测的价值。RFdiffusion 和 ESM3 等系统随后推动了新蛋白质的创造。

该领域也正在分化为专用系统与基础模型两种路线。专用系统为特定生成任务融入分子几何信息;蛋白质语言模型则试图在一个可适配系统内支持预测、表示和生成。

SimpleDesign 位于这两种路线之间。它的 Transformer 基础类似蛋白质语言模型,但其结构路径直接处理连续坐标。它保留了通用架构,同时避免建立结构词汇表。

这种折中对扩展研究可能很重要。预训练序列模型包含有价值的进化信息,而坐标目标保留了几何细节。SimpleDesign 的设计让两条路径能通过共享注意力机制相互作用。

论文还表明,预训练的 ESM2 组件可以为该系统提供初始化。这降低了既有蛋白质语言模型与直接结构生成之间的概念壁垒。研究人员无需为了避免 token 化几何表示而放弃序列预训练。

不过,Apple 的战略目标仍不明确。该公司尚未宣布与 SimpleDesign 相关的药物发现计划、商业蛋白质设计服务或合作伙伴关系。任何关于其商业计划的说法都将超出已有证据。

更稳妥的解读是,Apple 正在积累多模态科学 AI 方面的能力。蛋白质建模为测试 Transformer 如何同时处理离散与连续数据提供了一个极具挑战性的环境。

这项工作的经验可以延伸到生物学之外。机器人技术将符号化动作与连续运动结合起来。空间计算将语言与三维场景结合起来。科学模拟也经常把类别实体与物理坐标结合起来。

不应将 SimpleDesign 视为针对上述任何产品领域的隐晦预告。论文并未提供这样的关联。但它确实说明了 Apple 为何可能重视这一底层建模问题。

科学 AI 同样暴露出基准驱动开发的局限性。消费级模型可以通过任务完成情况和用户反馈来评判。生物生成模型最终则必须面对更缓慢、更昂贵的物理实验。

这使得下一阶段显得格外清晰。Apple 的研究人员已经将实验室表达和功能表征列为后续工作。落实这些工作,将推动项目从架构层面的证据走向生物学层面的证据。

跟踪这项研究的团队需要有序记录不断演变的数据集、模型变体和测定结果。可搜索的知识库可以帮助将论文与后续实验发现关联起来,同时避免把早期预测当作既定事实。

其实用意义并不限于蛋白质专家。AI 开发者应关注直接多模态目标是否能够取代学习型 tokenizer。生物技术团队则应关注这种简洁性是否能经受功能设计约束的考验。

企业采购方应保持更谨慎的态度。SimpleDesign 是一项研究发表成果,而非可获得支持的采购选项。它的重要性在于建模结果,以及它为竞争架构提出的问题。

Apple SimpleDesign 蛋白质模型后续值得关注的方向

三项信号将决定 SimpleDesign 会成为实用的设计方法,还是仅停留为一个引人注目的计算基线。

第一项信号是湿实验验证。研究人员明确将五到十种设计蛋白的表达和功能表征列为后续工作。该项工作的公开结果将提供最清晰的进展更新。

基础表达能够证明细胞可以产生这些候选序列。生物物理测量可检验蛋白质是否保持可溶性和稳定性。结构学方法则可判断实际折叠是否与 SimpleDesign 生成的坐标相符。

功能性将设定更高的门槛。蛋白质即使正确折叠,也未必能够结合有用的靶标或完成预期反应。测定必须与每项设计被赋予的具体生物学任务相匹配。

积极结果将强化这样一种主张:直接坐标建模保留了具有生物学重要性的信息。反复失败则可能表明,计算层面的共可设计性尚未捕捉到足够的化学信息或功能约束。

第二项信号是条件生成。SimpleDesign 的核心结果很大程度上聚焦于无条件样本,但实际设计需要明确指令。研究人员需要能够指定基序、结合表面、目标相互作用、对称性或其他属性。

一项有说服力的后续研究应在一致的比较条件下测试基序支架构建、逆向折叠、结合蛋白生成或与酶相关的约束。它应同时报告计算筛选率和实验室结果。

条件性能也将揭示这一极简架构是否依然具备灵活性。专门的几何模型之所以能为其复杂性辩护,部分原因在于其可控性。SimpleDesign 必须证明,当设计要求变得更严格时,简洁性不会转化为局限。

第三项信号是可复现性和资源可得性。独立研究人员需要代码、训练权重、预处理细节和评估脚本,以验证所报告的权衡。仅凭一篇论文无法揭示所有实现层面的敏感因素。

外部复现将检验无 tokenizer 训练是否能在不同数据混合方式和计算预算下保持稳定。它也将澄清,所报告的提升是否依赖于专有基础设施或难以复现的预处理流程。

竞争对手的回应同样属于这一信号的一部分。DPLM-2 或 ESM3 的研究人员可以将直接坐标目标与改进后的 tokenizer 进行比较。几何模型团队则可以测试:在控制数据和模型规模后,更简单的 Transformer 是否仍具优势。

即使 SimpleDesign 本身未能领跑每一项基准测试,这些实验也可能强化 Apple 的核心论点。如果竞争系统采用直接坐标路径,这篇论文就将影响该领域的设计选择。

另一种结果同样具有参考价值。更好的结构 tokenizer 可能在减少信息损失的同时保留其优势。专门的几何模型也可能继续在条件化设计和实验成功率方面表现更强。

因此,SimpleDesign 提出了一个可检验的挑战,而非尘埃落定的结论。它提出的问题是:蛋白质共设计是否必须先学习一种结构语言,才能开始生成。

Apple SimpleDesign 蛋白质模型已经给出了一个可信的计算答案:并不总是如此。下一个答案必须来自独立复现、目标生成和真实的蛋白质实验。

评估这项工作的研究人员应按顺序关注这三项信号:首先看实验室数据,其次看条件任务,最后看可复现的模型访问。这样的顺序能够让生物学证据优先于对架构的热情。

最有价值的问题不再是 SimpleDesign 在论文中看起来是否更简单,而是这种简洁性是否能帮助实验室以更少的计算和实验尝试,产出更多成功的蛋白质。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page