Sakura Internet 医疗 LLM 向研究人员开放,不用于临床
Sakura Internet 通过国内 AI 平台提供其医疗 LLM,并在一项基于日本医师国家考试的基准测试中取得 93.3% 的成绩。然而,Sakura Internet 医疗 LLM 仅面向研究用途开放,试用期已于 2026 年 8 月 31 日结束。
这一边界比醒目的分数更重要。该模型让研究人员能够实际使用日语医疗 AI,而无需自行运行一个拥有 1,090 亿参数的系统。它并未成为诊断服务、临床助手,或面向大众的商业产品。
此次发布也检验了一个更广泛的主张。日本希望拥有在本地托管、能反映其语言、医疗标准和数据治理要求的 AI 系统。Sakura Internet 正将国内算力基础设施定位为一种替代方案,以避免将敏感工作负载交由全球 AI 提供商处理。
OpenAI 的 o1 和 GPT-4o 是最初公告中最醒目的性能参照对象。不过,通过考试题目与支持临床工作仍是两种不同的考验。因此,真正的竞争并非一个模型对抗另一个模型,而是本地控制与全球 AI 平台便利性、快速迭代能力之间的较量。
Sakura Internet 医疗 LLM 实际改变了什么
关键变化在于访问方式:研究人员可以通过托管界面使用大型日语医疗模型,而不必自行搭建基础设施。
2026 年 3 月 5 日,Sakura Internet 开始通过 Sakura AI Engine 提供 Weblab-MedLLM-Qwen-2.5-109B-Instruct。该公司将访问权限限定为研究用途,并在公布的试用期内免费提供。
该模型来自东京大学松尾-岩泽实验室及更广泛的研究合作。参与方包括 Sakura Internet、ELYZA、ABEJA、RIKEN 和医疗机构。日本跨部门战略创新促进计划为这项工作提供了支持。
模型名称透露了部分技术脉络。它以 Qwen 2.5 为基础,拥有 1,090 亿参数,即用于生成回复的学习所得数值。研究人员随后使用日语医疗资料对其进行了适配。
根据模型发布公告,该模型在一项基于日本 2025 年医师国家考试的基准测试中,正确回答了 93.3% 的问题。Sakura 表示,这一结果超过了同一比较中 OpenAI o1 和 GPT-4o 所记录的分数。
这个数字需要谨慎表述。它由参与机构依据其自身评估设计报告,并不意味着该模型能够以 93.3% 的准确率诊断患者。
东京大学还评估了一项具体的行政任务。该模型能将传染病和实验室术语转换为标准名称,F1 分数达到 85%。F1 将精确率和召回率合并为一项分类质量指标。
这一用例指向了日语医疗 LLM 的实际价值。医院经常使用不同标签、缩写或本地代码记录相似概念。自动化完成部分规范化工作,可能减少重复的数据处理,并改善互操作性。
不过,研究结果明确设定了限制。用户可以提出医疗知识问题,但该服务不得用于诊断、医疗实践或治疗。
该服务还附带一项重要的数据提示。试用期间提交的提示词、输出内容和用户反馈,可能被用于后续研究。这一条件使该公共界面不适合处理真实患者信息。
访问期从 3 月 5 日持续至 8 月 31 日。截至 9 月 26 日,已公布的公共开放期已经结束。任何持续或重新开放的访问现均需运营方另行确认。
这一时间点改变了读者解读该新闻的方式。Sakura 证明了自己能够托管该模型,并将其提供给研究社区使用。它尚未宣布面向医疗机构永久、无条件开放。
这一区分既保留了成果的价值,也避免夸大其意义。该平台消除了实验中的基础设施门槛,却没有消除围绕临床部署的验证、隐私、工作流和问责障碍。
为何本地托管才是战略重点
Sakura Internet 销售的是对 AI 运行地点的控制权,而全球提供商则通过模型质量、开发者覆盖面和发布速度竞争。
医疗语言模型需要的不只是专业词汇。其运行环境还必须应对敏感记录、机构控制、审计要求,以及错误输出可能带来的后果。这些要求使托管架构成为产品的一部分。
Sakura AI Engine 是一个推理平台,即运行已训练模型来生成回答,而不是从头训练模型。用户可以通过应用程序编程接口和基于浏览器的 playground 调用受支持的模型。
平台文档称,Sakura 自行托管所有受支持的模型。文档还称,客户通信仅发生在客户与 Sakura 之间,提交的聊天数据不会被用于训练托管模型。
这些通用平台条款并不等同于医疗研究试用的条件。东京大学警告称,试用互动内容可能支持未来研究。因此,采购方必须审查每个界面和模型所附的规则,而不能只看底层云服务。
这种差异说明了主权 AI 的复杂性。国内基础设施可以明确司法管辖范围,并降低对海外处理的依赖,但并不会自动为建立在其上的每一项应用形成统一政策。
该模型也让国内基础设施在研究人员面前变得更具可见性;否则,他们可能默认选择国际 API。托管式日语医疗 LLM 可以支持受控测试,而无需每个实验室都配备数百个加速器。
Sakura 以相当大的规模构建了底层模型开发环境。其 SAKURAONE 高性能计算集群在 100 个节点上配备了 800 张 Nvidia H100 图形处理器。该系统采用开放式以太网网络设计,而非专有互连方案。
该集群在 High Performance Linpack 基准测试中取得 33.95 petaflops,并在 2025 年 6 月 TOP500 榜单中位列第 49 名。Sakura 表示,它是前 100 名系统中唯一采用完全开放网络栈的系统。
这些基础设施细节并非装饰。训练大型模型会产生高度集中的突发需求,普通企业云部署未必能高效承载。Sakura 观察到,在医疗项目中,使用至少 17 个节点的任务占据了大部分 GPU 时间。
其集群分析发现,使用 17 至 32 个节点的任务中,有 13.6% 运行超过一周。工作负载随后从大型训练任务转向较小规模的微调运行。
这一演进解释了 Sakura 的商业逻辑。该公司可以在受管计算集群上支持模型创建,再通过 Sakura AI Engine 提供完成后的模型。它正在构建一条从训练到应用访问的国内路径。
全球提供商仍拥有重大优势。OpenAI、Google 和 Anthropic 频繁更新通用模型,并服务于广泛的开发者社区。它们的系统还受益于工具、多模态功能和成熟的企业集成。
Sakura 的回应并不只是更高的考试分数,而是将日语专业化能力与由国内运营商掌控的基础设施结合起来。医疗机构因而可以评估一条更受本地控制的部署路径。
这一定位给双方都带来了压力。国际供应商必须说明其如何满足日本的临床要求并处理敏感记录。国内提供商则必须证明,控制权并不意味着客户必须接受较弱的模型或更慢的改进速度。
93.3% 的分数并非临床证据
核心权衡很清楚:基准测试表现可以支持进一步测试,但医疗部署需要考试无法提供的证据。
医师国家考试是合理的知识基准。它测试模型能否检索并应用以日语表达的医疗概念,也提供了不同系统之间熟悉的比较参照。
然而,考试题通常有明确的提示和预期答案。临床记录则包含缺失的背景信息、本地缩写、相互矛盾之处、历史细节,以及多人录入的信息。正确行动还可能取决于病历之外的事实。
因此,模型即便获得高分,在日常医疗中仍可能不可靠。它可能对清晰问题给出流畅回答,却无法妥善处理含糊的记录;也可能以毫无根据的自信陈述不确定信息。
93.3% 的结果针对的是 Weblab-MedLLM-Qwen-2.5-109B-Instruct 和 2025 年医师国家考试基准。后续在另一项 NEDO 项目下开展的工作评估了更新的模型、任务和安全方法。这些结果不应混合为单一分数。
初始模型的行政任务评估与实际运营更相关。将不一致的检验名称转换为标准术语,类似于医院已在执行的工作。即便如此,85% 的 F1 分数仍意味着存在需要复核的错误。
公布的界面也禁止诊断和治疗。这一限制并非无关紧要的法律脚注,而是将该模型界定为研究工具,而非自主医疗系统。
人工监督仍然至关重要,但这句话可能掩盖实际问题。谁来审核每项输出,审核需要多少时间?审核者能否在错误进入另一个系统前发现一个自信却错误的回答?
有用的工具必须在完成这些检查后减少工作量,而非只是将工作转移到别处。若临床医生必须从源记录中重建每一项回答,该模型可能只是增加了一层验证,而无法带来有意义的节省。
与 OpenAI 模型的比较也带来另一项提醒。单一日语基准上的较高分数,并不能证明其总体更优。全球系统在摘要、推理、检索、编程、视觉或多语言任务上的表现可能不同。
反过来也是如此。通用模型的广泛能力并不能保证与日语术语、治疗指南或医院数据格式相匹配。专业化可以改善定义狭窄的工作流,即使它并不能赢得每一项基准测试。
因此,最可信的评估路径应从具体任务开始。病历规范化、登记准备、出院小结起草和文档检索,各自都具有可衡量的输出。研究人员可以将错误与人工工作和现有软件进行比较。
以这种方式界定时,日语医疗 LLM 项目最具说服力。它不是医生的替代品,而是用于测试专业语言模型能否安全减少行政负担的平台。
这种定位也有助于机构明确责任归属。医院可以为摘要草稿或代码建议设计审批流程,但不能将最终责任交给一个基准测试分数。
试用期的封闭时间窗口还造成了额外的验证缺口。外部研究人员需要持续访问权限、文档和可复现的评估,才能检验最初的主张。临时演示所能接受的审视,少于可长期使用的研究服务。
Sakura 与东京大学成功让一个大型模型在数月内可供测试。下一项标准则更为严格:他们必须证明结果能否跨越不同机构、不断变化的医学知识以及复杂的运营数据而保持成立。
后续结果显示进展,也显示目标在移动
3 月发布只是更大计划中的一个阶段,而后续模型将证据重心从考试分数转向安全性和行政工作流。
2025 年 6 月,Sakura 与日本新能源和产业技术综合开发机构签署了一份合同。该项目聚焦于日本医疗模型的安全验证与实际测试。
这份 NEDO 合同总价值约为 45 亿日元。其中约 20 亿日元用于 GPU 云资源,25 亿日元用于其他服务及联合研究活动。
合同计划于 2026 年 3 月结束。它将 Sakura 的基础设施业务与一项由大学、研究机构、科技公司和医疗机构参与的十家组织研究计划连接起来。
5 月 28 日的一份发布材料介绍了该计划的后续结果。这并非只是重复 Qwen 2.5 模型取得的 93.3% 考试分数。此次合作测试了数个经过更新适配及自主开发的模型。
东京大学的一款模型在使用检索增强生成时,于一项专科考试任务中达到 90.8%。RAG,即检索增强生成,会在模型作答前向其提供外部文档。
商业参考模型在该任务中达到 91.4%。这一结果表明,经过适配的模型已接近所引用的商业系统,但尚未超过它;同时也说明,随着模型代际演进,比较结果变化得很快。
表现最佳的适配模型在一项日本临床指南评估中,比其基础模型高出 10.8 个百分点。这一结果支持了领域适配——即用专业材料训练现有模型的过程。
该项目还建立了一个包含超过 5 万次交互的日本医疗安全基准。研究人员开展了规模达 6,000 个案例的红队测试,以检验模型抵御对抗性请求的能力。
这些测试揭示了一个不那么令人欣喜的发现。根据项目方的说法,基础模型的选择会显著影响安全性是否能在后续医疗训练中得以保留。专业数据并不能抹去底层系统原有的特性。
这一发现进一步证明了重复评估的必要性。医疗模型不能因某一成功版本而获得永久认可。基础模型、训练过程、检索系统或提示词的变化,都可能改变其行为。
这项 后续评估还测试了四种行政场景,包括实验室代码映射、卒中登记准备、出院摘要起草,以及针对电子病历的自然语言查询。
在来自三家医疗机构的数据中,实验室名称映射至 JLAC11 代码的准确率达到 80.3%。JLAC11 是日本用于实验室检测的编码系统。
在卒中登记整理任务中,该模型的准确率为 92.2%。项目方将这一结果与 94% 至 95% 的人工准确率进行了比较。
九名专科医生评估了出院摘要草稿。该适配模型的平均得分为满分 5 分中的 4.748 分,项目方称其表现可与商业参考模型相当。
这些结果比单一考试分数更具参考价值,因为它们揭示了不同的失败成本。错误的代码、遗漏的登记细节和具有误导性的摘要会带来不同风险。每种工作流都需要自己的审核流程。
这些测试仍然来自项目参与方。独立复现、详细的错误分布以及医院长期运行结果,将使证据更具说服力。平均准确率本身无法揭示哪些患者或专科得到的输出最差。
后续计划也维持了一条明确边界:其所声明的用途是支持文档和行政工作,医生及其他专业人员仍保留最终判断权。模型不负责诊断或治疗患者。
这并非对最初雄心的退缩,而是更可信的部署顺序。行政辅助能够带来可衡量的收益,同时保留明确的人类决策节点。
竞争在于本土控制与平台便利性之间
Sakura 面临的主要挑战,是证明本土控制能够成为可持续服务,而非短暂的研究优势。
医疗机构已经可以试用能力出色的全球模型。这些服务提供熟悉的 API、丰富的文档以及快速的产品迭代周期。一些服务还提供企业级控制功能和区域处理选项。
Sakura 必须给出选择较小平台的理由。日本本地托管是其中之一,尤其适合希望明确掌控数据存放位置的机构。专业模型和本地研究合作关系则构成另一项优势。
但主权并非非此即彼。模型可以运行在日本,却依赖于在其他地方开发的基础模型。Weblab-MedLLM-Qwen-2.5-109B-Instruct 使用了由 Alibaba 开发的 Qwen 2.5 模型家族。
因此,该项目将源自海外的基础模型与日本本地的训练、评估、算力和托管结合起来。这种架构提供了更多运营控制能力,但并未宣称每一层都源自本土。
后续研究也探索了完全在日本训练的模型。按报告的任务表现来看,这些系统仍落后于表现最强的适配模型。这一比较展示了技术独立性与即时能力之间的张力。
在本地构建每一层可以增强控制力和研究知识。适配成熟的开放模型则能更快达到实用性能。日本的医疗 AI 计划正在测试两条路径,而不是假装这种取舍已经消失。
商业可持续性则提出了另一个问题。3 月的试用是免费且临时的,而底层 AI Engine 则是按使用量计费的平台。Sakura 在引用材料中尚未公开说明永久性的医疗模型服务方案。
医院需要的不只是一个端点,还包括采购条款、服务可靠性、安全审查、访问控制、日志记录、事件处理、模型变更通知,以及与现有记录的集成。
它们还需要稳定的评估。一个未经通知便发生变化的托管模型,可能会使医院此前的测试失效。版本化部署和变更文档将与亮眼的性能数据同样重要。
集成也构成独立的障碍。日本医院使用不同的术语、代码、病历结构和运营实践。同一模型接入不同数据环境时,可能产生不同结果。
这种多样性解释了多机构测试的重要性。一家医院干净的研究数据集所得结果,未必能迁移到另一家医院的历史记录上。本地适配可能提升契合度,但也会带来新的安全问题。
全球供应商的竞争回应不会停滞。它们的模型会继续提升,企业级控制功能也会扩展。Sakura 不能依赖于一次针对旧系统取得的基准领先。
其更具防御力的定位是基础设施加本地验证。该公司可以支持大规模训练、在日本本地托管模型,并与机构合作处理日本工作流。这一组合难以被简单归结为排行榜上的一个名次。
但公司仍须证明,这一组合能够减少真实的运营摩擦。模型的登记准确率接近人工水平固然令人期待;真正部署的系统若能在不增加错误的情况下节省员工时间,才是更有力的证据。
因此,压力既落在 Sakura 身上,也落在全球供应商身上。它必须将一项获得国家支持的研究计划转化为可重复提供的服务。否则,该项目仍只是一场令人印象深刻、却无法被医疗采购方常规采用的演示。
三个信号将决定下一步走向
重新开放访问、多医院验证以及明确的生产服务,将显示 Sakura Internet 医疗 LLM 是否正超越研究阶段。
第一个信号是新的访问计划。已公布的交互式试用已于 2026 年 8 月 31 日结束。重新开放的研究端点、具备文档说明的 API 访问权限,或永久模型列表,都将表明外部评估可以继续进行。
访问计划应包含明确的数据条款和模型版本信息。研究人员需要知道提示词是否会被保留、输出是否会用于后续训练,以及底层模型何时发生变化。
若没有重新开放访问,将削弱更广泛的平台叙事。这会表明 3 月的发布是一项定期研究,而非持久医疗 AI 服务的开端。
第二个信号是独立的多医院证据。该计划已测试多项行政任务,并在实验室代码映射中使用了来自三家机构的数据。更广泛的复现应能揭示性能如何因病历系统和专科而变化。
最有价值的报告将描述错误类别,而不仅仅是平均值。它们应展示系统在哪些地方失败、审核人员如何发现错误,以及经过验证后是否真正节省时间。
来自日常运行的证据将大幅强化这一论点。前瞻性研究可以衡量员工在真实工作负荷压力下使用模型输出时会发生什么。历史基准无法复现该环境的每一个部分。
第三个信号是生产边界。Sakura 及其合作伙伴必须界定商业系统支持哪些任务、谁可以使用它,以及哪些人工审批仍属强制要求。
可信的服务还应披露监控和更新实践。医院必须知道部署后如何检查性能,以及事件会如何影响其他客户。
这些信号的重要性超出日本。各国政府和受监管行业日益希望对模型、基础设施和数据位置拥有更多控制权。Sakura 项目为检验这种控制能否与有竞争力的性能并存提供了一个具体案例。
对开发者而言,教训是应将托管、模型行为和应用政策视为彼此独立的层面。一个安全的本土端点并不意味着所有使用方式都安全。强大的基准表现也不能消除工作流风险。
对医疗采购方而言,下一个问题很实际:这款日本医疗 LLM 能否在可衡量的监管下减轻一项明确的行政负担?这一检验,而非又一次排行榜胜利,将决定 Sakura 的研究平台能否成为持久的临床基础设施。



