上海科学智能研究院开源 ShenZhen,挑战越大越好的模型理念
- Sophie Larsen
- 24小时前
- 讀畢需時 15 分鐘
上海科学智能研究院开源了 ShenZhen,这是一个拥有约 110 亿参数、可处理六类科学数据的模型。上海科学智能研究院的 ShenZhen 多模态基础模型涵盖 DNA、RNA、蛋白质、小分子、地球系统和医学影像。
这一覆盖范围带来了核心矛盾。科学人工智能通常依靠围绕单一领域、数据结构或预测目标设计的专用模型取得进展。而 ShenZhen(又称 Monkey King Bang 或 MKB)则将各领域的专用组件部署在同一个共享语言与视觉骨干模型周围。
该研究院表示,这个规模较小的统一系统在 20 项生物学理解基准中的一半任务上,追平或超越了一个拥有约 1 万亿参数的科学模型。研究院还报告了在分子、天气和医学影像方面具有竞争力的结果。这些比较挑战了这样一种假设:科学人工智能必须主要通过扩大通用模型的规模来发展。
此次发布尚不能证明一个模型可以取代专用科学系统。相关基准测试来自开发团队,许多已报告的结果仍未通过独立研究验证。不过,开放的权重和代码为外部研究人员检验这一更广泛的主张提供了切实可行的途径。
ShenZhen 多模态基础模型连接六类科学数据
ShenZhen 的重要之处在于,它将科学数据视为边缘处各不相同、模型中心彼此相连的对象。
该模型使用 Qwen3-VL-8B-Instruct 作为共享骨干模型。信息在进入该骨干模型之前,独立的编码器和解码器会保留每种科学模态的结构。据该研究院介绍,整个系统包含约 110 亿个参数。
这种设计避免了将所有输入都转换为普通文本词元。DNA 和 RNA 需要能够保留序列顺序的模型。小分子需要能够表示原子和化学键。天气数据包含随时间变化的空间场,而医学影像则依赖精细的局部结构。
ShenZhen 通过专用组件处理这些不同的输入。其模型文档显示,蛋白质使用 ESM-2,DNA 和 RNA 使用卷积 Transformer 组件,分子则使用图编码器。它还包含一个 Swin-ViT 天气组件和一条基于 SAM 的医学影像处理路径。
模态路由器会为每项任务选择相应的处理路径。专用组件将输入转换为共享骨干模型可以处理的表示形式。随后,相应的解码器会生成文本、科学序列、空间场或图像掩码。
这一架构同时支持理解与生成,尽管不同模态上的支持程度并不完全相同。该模型可以对蛋白质、RNA、DNA、分子和文本输入进行分类或分析,也可以生成 RNA 序列、分子 SMILES 字符串、天气预报、医学影像分割结果和文本。
SMILES 是一种以计算机可读形式表示分子结构的文本记法。图像分割用于识别属于指定解剖结构或异常区域的像素。即使推理层是共享的,这些输出仍需要不同的解码器。
因此,此次发布的成果不只是一个配备多种文件读取器的科学聊天机器人。其组件能够生成原生科学输出,研究人员可以将这些输出传递给下游软件。生成的天气场或分割掩码,与描述相同数据的文字说明相比,具有不同的实际应用价值。
这种方法也使 ShenZhen 区别于那些将科学论文、图表和示意图纳入传统视觉语言训练流程的模型。此类系统可以回答与科学内容有关的问题,却不会直接对 DNA 碱基、分子键或大气网格进行建模。
该研究院已经发布了模型权重、推理代码、示例脚本、配置文件和输入指南。研究人员可以通过 Hugging Face 和 GitHub 获取这些材料,中国的 NovaInspire 平台也提供了额外的访问渠道。
模型页面显示,大多数组件采用 Apache 2.0 许可证。不过,医学分割分支包含受 Meta 单独许可证约束的 SAM 相关权重。用户在部署完整软件包之前,必须审查这些限制。
此次发布还将 ShenZhen 与该研究院于 2026 年 3 月推出的科研智能体 Dasheng 联系起来。Dasheng 通过自然语言请求协调模型和工具。如今,ShenZhen 为该系统内的多项科学操作提供共享建模层。
这一背景解释了为什么统一对该研究院至关重要。如果每项任务都需要互不相关的模型、环境、接口和输出格式,科研智能体将更难操作。共享骨干模型可以减少这种割裂,同时保留各领域的原生结构。
一个 110 亿参数的模型正在向规模优先的方法施压
最具影响力的基准并非某个单项得分,而是 ShenZhen 与一个规模大近 100 倍的模型之间所报告的性能对比。
该研究院在 20 项任务上评估了生物学理解能力,这些任务涉及 DNA、RNA、蛋白质以及生物序列之间的关系。据报告,ShenZhen 在九项任务中排名第一,并在 17 项任务中位列前两名。
与拥有 80 亿参数的文本词元基线模型 Biology-Instructions 相比,据称 ShenZhen 在 20 项任务中的 16 项上得分更高。在骨干模型规模相对接近的情况下,这一比较支持了科学编码器的价值。
更具争议性的比较涉及 Intern-S1-Pro。其开发者将它描述为一个拥有约 1 万亿参数的混合专家科学模型。混合专家模型只让每项输入通过其整个网络的一部分,从而减少处理每个词元所需的计算量。
据此次发布的信息,ShenZhen 和 Intern-S1-Pro 各自在十项生物学任务上领先对方。这一结果并不意味着两个模型完全等同,但确实表明,仅凭参数数量并不能完整衡量科学能力。
Intern-S1-Pro 更直接地采用了规模优先的路线。其前身 Intern-S1 使用拥有 2410 亿参数的混合专家架构,其中激活参数为 280 亿。该团队报告称,它使用 5 万亿个多模态词元进行持续预训练,其中包括超过 2.5 万亿个科学词元。
当前的 Intern-S1 代码仓库将 Intern-S1-Pro 定位为用于科学推理的万亿参数级模型。其覆盖范围包括科学文本和图像,因此是一个重要的参照对象。它的架构和训练策略与 ShenZhen 的领域路由设计仍有显著差异。
在解读生物学对比时,这些差异至关重要。ShenZhen 使用针对科学结构选择的编码器,而 Intern-S1-Pro 则以大得多的规模追求更广泛的科学推理能力。聚焦特定领域的基准测试,可能更有利于输入格式与其高度匹配的架构。
ShenZhen 报告的最强生物学结果通常出现在序列结构至关重要的任务中。在检测 300 碱基对 DNA 序列中的启动子时,它取得了 91.17 的 MCC 分数。MCC 在衡量分类质量时会考虑类别不平衡问题。
该模型还报告称,在一项 RNA 修饰任务上取得 96.03 的 AUC,在非编码 RNA 功能任务上达到 91.46% 的准确率。在蛋白质稳定性任务上,其 Spearman 相关系数达到 70.63。这些指标衡量的是不同能力,不应合并为一个总体智能分数。
其结果并非全面占优。Intern-S1-Pro 在蛋白质荧光、酶分类和一项 RNA 异构体基准等任务上领先。Biology-Instructions 在增强子活性和一项跨模态序列任务上也略胜 ShenZhen。
这种并不均衡的表现模式,使此次发布比笼统宣称全面领先更具可信度。它表明,架构专业化可以在某些任务上带来显著提升,但不会消除规模在其他方面的优势。
因此,压力落在了构建超大型科学基础模型的团队身上。他们必须证明,增加参数能够带来那些规模更小但科学表示更优的系统所不具备的能力。基准测试的广度、迁移性能和科研实用性,将比模型规模本身更加重要。
同样的压力也适用于高度专业化的项目。如果统一模型在简化部署的同时接近它们的准确率,那么专用模型就必须证明其运维复杂性是合理的。实验验证、领域深度以及在真实实验室条件下的可靠性,将是它们最有力的优势。
原生科学编码器才是真正的机制
ShenZhen 的核心理念是架构分工,而非通用词元化。
通用多模态模型通常会将文本、图像,有时还包括音频,投射到一个共享表示空间中。这种策略之所以有效,是因为这些模态包含大型神经网络可以通过规模化训练进行对齐的模式。而科学数据带来了更棘手的问题。
蛋白质序列并不只是使用了不同字母表的句子。氨基酸通过跨越多个尺度的相互关系,影响蛋白质的折叠、稳定性、结合能力和功能。分子也不只是其书面 SMILES 表示,因为它的图结构决定了化学连接关系。
天气数据则呈现出另一种不匹配。全球大气状态包含分布在纬度、经度、高度和时间维度上的物理变量。将这种场展平为通用序列,可能会丢失预报系统所需的空间关系。
ShenZhen 通过保留专用前端来解决这种不匹配。每个编码器首先捕获其所属领域的原生结构。随后,共享的 Qwen 骨干模型会处理与自然语言指令及其他模态对齐的表示。
解码器则执行相反的过程。对于天气,它会生成一系列全球大气状态。对于医学影像,它会将文本提示和图像转换为分割掩码。对于分子,它可以返回有效的 SMILES 表示。
这种安排类似于一支通过同一位协调者开展工作的专家团队。协调者提供统一接口和共享推理空间,而专家则保护那些在强行将所有问题转换为相同格式时可能受损的细节。
报告的分子测试展示了这种方法的潜在优势。在六项 SMolInstruct 属性任务中,据称 ShenZhen 在四项上领先或并列第一。它在血脑屏障穿透任务上取得 96.95% 的准确率,在一项与 HIV 相关的分类任务上达到 97%。
在用于估算水溶性的 ESOL 基准上,ShenZhen 的均方根误差为 0.550。数值越低,表示预测结果越接近参考数据。作为对比的 LlaSMol 基线为 1.150。
这些只是基准测试结果,并不能证明生成的分子会成为安全药物。属性预测通常只是漫长药物发现流程中的一道早期筛选环节。实验室合成、毒性测试、药代动力学研究和临床评估仍然不可或缺。
天气组件遵循相同的原生输出原则。给定一个初始大气场,ShenZhen 每六小时生成一个新状态,最长可预测十天。该院使用 0.25 度分辨率的全球 ERA5 数据评估了这些预测。
发布信息显示,在第十天,ShenZhen 对 500 百帕位势高度、两米气温和平均海平面气压的预测误差均低于 ECMWF HRES。HRES 是欧洲中期天气预报中心投入业务运行的高分辨率数值天气预报系统。
模型卡给出的第十天近似误差显示,位势高度为 740,而 HRES 为 810。气温误差约为 2.65 Kelvin,而后者为 2.90;气压误差约为 680 Pascals,而后者为 745。
这些数据不应被解读为 ShenZhen 优于业务天气预报服务的证据。该比较采用离线 ERA5 评估,并且仅涵盖有限的一组变量。业务天气预报还包括数据同化、集合不确定性、频繁更新以及众多区域性能要求。
这里能够得出的结论范围更窄,但依然值得关注。一个共享模型在学习生物和化学任务之后,还能够生成可信的十天大气预报。专门化路由似乎保留了足够多的天气结构,从而取得具有竞争力的离线结果。
这一机制构成了本文最重要的观念反转。科学 AI 未必能通过剥离领域结构而变得更加通用。ShenZhen 尝试先保留这些结构,再通过共享骨干网络将其对齐,以此实现通用性。
医学影像既展现了潜力,也暴露了验证缺口
医学影像结果既是 ShenZhen 最明确的实用性主张,也是最需要谨慎看待的理由。
该院在 BiomedParse 测试集拆分出的 102,855 个图像—提示词对上,测试了文本提示分割能力。该数据集涵盖九种成像模态,包括 CT、MRI、病理影像、X-ray、内窥镜影像和视网膜影像。
根据模型卡,ShenZhen 的平均 Dice 分数达到 91.20。Dice 用于衡量预测区域与参考标注之间的重叠程度。百分比越高,表示两者越一致。
报告中的比较涵盖七种方法。BiomedParse 得分为 90.73,MedSAM 达到 83.55,最初的 Segment Anything Model 得分为 71.29。ShenZhen 在综合测试集上排名第一。
其性能因模态而异。据报告,它在 X-ray 上达到 98.02,在 CT 图像上达到 93.36,在 MRI 扫描上达到 85.29。BiomedParse 在 MRI、光学相干断层扫描、X-ray 和眼底图像上仍略微领先。
在病理图像上,ShenZhen 报告的得分为 87.29,而 BiomedParse 为 81.57。这一差距很有意思,因为病理图像通常包含复杂的纹理和组织边界。然而,单项基准测试无法确立临床可靠性。
该模型使用基于 SAM 的分割路径。SAM 指 Meta 的 Segment Anything 架构,它可以将视觉提示转换为对象掩码。ShenZhen 在这一图像组件之外增加了科学路由和自然语言交互能力。
研究人员可以请求获取与肿瘤、器官或组织结构相对应的区域。系统随后会返回掩码,而非仅仅描述图像。此类输出可以支持定量分析、辅助标注,或作为另一个模型的预处理步骤。
然而,医学分割分数存在若干局限。基准图像可能不同于其他医院、扫描仪或患者群体所采集的数据。当成像协议、疾病患病率、标注方式或提示词措辞发生变化时,性能可能下降。
Dice 衡量的也是重叠程度,而不是临床后果。较高的平均分可能掩盖病灶边界附近虽小但重要的误差,也可能掩盖模型在罕见病症或代表性不足的患者群体上的薄弱表现。
此次发布没有提供前瞻性临床验证,也未证明临床医生能够在缺少全面监督的情况下安全使用该系统。读者应将 ShenZhen 视为研究模型,而不是诊断产品。
许可证也带来了另一项限制。该软件包包含受 Meta 的 SAM 许可证和可接受使用限制约束的第三方分割权重。其他部分采用 Apache 许可证,并不会自动解除这些义务。
因此,独立复现是当前最直接的检验。外部团队需要使用已发布的代码,在未被使用过的数据集上运行测试并报告其环境。他们还应考察校准、失败案例、提示词敏感性和跨机构性能。
同样的标准也适用于医学影像之外的领域。生物学分数需要在能防范训练数据重叠的数据集上进行验证。分子输出需要接受化学有效性检查,而天气预报则需要在不同季节和地区与业务预测进行比较。
开放权重使这些测试成为可能,但开放并不等于可复现。研究人员仍然需要准确的预处理步骤、数据拆分、评估脚本和合适的硬件。缺失的细节可能会实质性改变基准测试结果。
采用该模型的科研团队还将面临知识管理方面的挑战。复现结果需要持续追踪提示词、数据集、模型版本、许可证和失败的实验。可搜索的技术知识库可以帮助研究团队长期保存这些证据。
这一验证缺口并不是否定此次发布的理由。恰恰相反,它正是开放发布之所以重要的主要原因。当独立用户发现其统一架构在哪些方面有效、又在哪些方面仍然需要专用模型时,ShenZhen 的价值将变得更加清晰。
专用模型仍然定义着科学领域的标准
ShenZhen 的竞争对象是一整套专用系统,而不是某一个通用竞争对手。
在基因组学领域,Google DeepMind 的 AlphaGenome 专注于预测 DNA 变异如何影响基因调控。它可以处理最长达一百万个碱基对的序列,并生成数千项分子预测。这种纵深能力与 ShenZhen 更广泛的跨领域目标有所不同。
Google 最初通过 API 向非商业研究开放 AlphaGenome。随后发表的一篇 Nature 论文介绍了它在调控变异预测方面的表现,并发布了研究资源。AlphaGenome 研究展示了一个科学领域内部可以容纳多大程度的领域专用工程。
在蛋白质科学领域,ESM3 同时对序列、结构和功能进行建模。其开发者使用 980 亿个参数训练了最大版本,并将其描述为用于蛋白质设计的生成模型。该系统依然专注于蛋白质生物学。
ESM3 研究报告称生成了一种与已知样本差异较大的荧光蛋白。此类实验案例十分重要,因为它超越了基准预测,迈向了物理世界中的实际成果。
天气预报领域也有自己的专用模型,包括来自 Google DeepMind、Huawei、Nvidia 和 ECMWF 的系统。在特定变量和预测时长上,这些模型与数值天气预报的竞争力日益增强。业务机构仍然会结合多种系统与人类专业知识。
医学影像领域同样拥有多种多样的基础模型。MedSAM 专注于分割,而 BiomedParse 则连接了不同生物医学模态中的图像和文本提示。当相关文档与验证符合特定工作流时,临床机构可能更倾向于采用这些专用系统。
ShenZhen 的优势并不在于明显优于这些专用模型。它的吸引力在于跨越它们之间的边界。一个研究项目可能需要连接基因组序列、蛋白质功能、候选分子、医学影像和环境条件。
目前,此类项目通常需要使用多个输入格式互不兼容的模型。研究人员必须维护独立的环境,并在工具之间转换输出。每一次交接都会增加技术工作量,也可能造成信息损失。
共享的自然语言界面可以减少这些障碍。更重要的是,共享的表示空间可能使从一种模态中学到的信息改善另一种模态。在实验对这种跨领域迁移进行分离和测量之前,这仍然只是一个假设。
该院的配套平台进一步强化了这一系统层面的论点。SAIS 推出了 Dasheng,这是一种能够拆解研究任务并协调模型和工具的智能体。其 NovaInspire 平台汇集了科学模型、数据、论文和专利记录。
根据上海官方概览,SAIS 由上海市政府与 Fudan University 于 2023 年共同成立。该研究院还开发了用于材料、药物发现、天气和气候的模型。
ShenZhen 整合了此前产品组合中的部分能力,但并没有让每一个专用模型都变得过时。该模型自身的设计仍包含专用编码器和解码器。统一发生在编排层和表示层,而不是通过实现完全一致的架构。
这一区别应当指导相关比较。问题并不只是选择一个通用模型还是多个专家模型。更值得关注的竞争,是经过协调的共享骨干网络与松散连接的独立系统集合之间的较量。
Intern-S1-Pro 等大型模型提供了另一条路径。它们试图通过扩大参数规模、开展广泛的科学预训练以及进行多模态推理来实现广度。ShenZhen 则通过围绕较小骨干网络进行领域感知路由来实现广度。
这两条路径仍然都需要专用工具。万亿参数规模的推理模型可能会调用外部模拟器或数据库。ShenZhen 则依赖其软件包内部的专用组件。实际问题在于,专门化能力应当位于技术栈的哪一层。
如果 ShenZhen 能够在不同领域之间实现有效迁移,它将强化共享骨干网络这一路径。如果独立测试发现负迁移,即学习一个领域会损害另一个领域的表现,那么模块化专用系统仍将保有重要优势。
三个信号将决定 ShenZhen 能否改变科学 AI
下一阶段的重点是可复现性、跨领域迁移和实际采用,而不是又一个吸引眼球的基准分数。
第一个信号是独立复现基准测试。研究团队应重新运行 20 项生物学任务、6 项分子测试、天气评估和医学分割基准测试。一致的结果将强化该院关于规模效率的论点。
复现还应包括训练数据重叠测试。科学基准通常依赖可能被纳入预训练语料库的公开数据集。如果模型已经见过完全相同的序列、标签、图像或高度相似的样本,那么高分的意义就会减弱。
一项令人信服的独立研究应使用留出的时间段数据或新采集的样本。对于生物学,这可能包括近期收录的序列。对于天气,研究人员可以测试训练期间无法获得的时段的预测结果。
第二个信号是真正跨领域迁移的证据。ShenZhen 的架构假设共享骨干网络能够捕捉对不同科学模态均有用的关系。当前的基准测试集主要衡量各个独立领域内部的性能。
研究人员应将统一模型与分别在各模态上单独训练的版本进行比较。如果共享模型表现更好,或者能用更少的样本完成学习,这将支持该院的核心论点。如果表现相近或更弱,则表明这种整合的主要作用可能只是简化部署。
跨模态研究会提供更多信息。一项测试可以检验蛋白质表征是否能提升 RNA-蛋白质相互作用预测。另一项测试可以将分子生成与生物靶点信息相结合,而不是评估孤立的属性基准。
第三个信号是通过开放仓库和 NovaInspire 实现的持续采用。仅凭下载量衡量的意义有限,但外部贡献能够反映该软件包是否真正可用。新的评估脚本、领域适配器、错误报告和可复现实验将表明一个正常运作的研究社区正在形成。
采用情况也取决于算力需求。一个 110 亿参数的模型比 Intern-S1-Pro 更小,但对每个实验室而言都算不上轻量。该软件包整合了多个大型科学组件,可能会增加内存使用和部署的复杂性。
清晰的硬件配置说明、量化版本和模块化加载将扩大其可及性。研究人员应当能够仅加载某个工作流所需的组件。否则,统一软件包的效率可能反而低于它试图取代的各个独立工具。
还应关注专业研究人员的反应。如果基因组学、蛋白质、天气或成像模型背后的团队发布更强大的跨领域接口,ShenZhen 的编排优势将会缩小。如果这些模型仍然彼此孤立,共享的科学基础模型就会更具吸引力。
该研究院还应公布更完整的训练细节和受控消融实验。消融实验会移除一个组件,以衡量其贡献。这些研究可以揭示性能提升究竟来自编码器、联合训练、Qwen 骨干网络,还是针对特定基准的适配。
Shanghai Academy of AI for Science 的 ShenZhen 多模态基础模型已经做出了一项有益贡献。它将有关科学模型规模的争论转化为一个可检验的架构问题。
一个更小的骨干网络能否在不牺牲专业任务准确率的情况下协调原生科学表征?开放发布使研究团队能够直接探究这一问题。
下一步最好的做法,不是接受所有报告的分数,也不是因为验证尚不完整就否定该模型。研究人员应复现一项相关任务,记录每项依赖,并将失败与成功一同发布。这些证据将决定 ShenZhen 是成为共享基础设施,还是仅停留在一组雄心勃勃的基准测试结果上。