top of page

AWS HCLS Agent Skills 瞄准医疗 AI 的推理缺口

9月17日
讀畢需時 14 分鐘

AWS 在发现一个令人担忧的缺口后,发布了 38 项开源 AWS HCLS agent skills:基础模型能够引用临床规则,却可能错误地应用这些规则。这套集合覆盖 11 个医疗和生命科学领域。AWS 表示,在一项包含 410 条提示词的评估中,具备技能的 agents 在对比中取得了 69.5% 至 85.9% 的胜率。

这一结果挑战了人们对专业化 AI 的一种普遍假设:检索到更多信息,并不一定会带来更好的判断。一个 agent 可以找到正确的指南、复述其中的术语,却依然会错误处理阈值、排序规则或证据类别。

AWS 提出了一种不同的干预方式。其 skills 将决策流程编码为可读文件,agent 会在任务符合既定触发条件时加载这些文件。因此,核心竞争并非 AWS 与其他云服务提供商之间的竞争,而是显式方法论与通用模型知识之间的较量。

这一方法也附带一个重要限定:AWS 生成了评估提示词,并使用另一款模型评判答案。这些结果令人鼓舞,但并不构成独立的临床验证。在任何具备技能的 agent 进入具有重要后果的工作流程之前,这一区别都至关重要。

AWS HCLS Agent Skills 将专家流程转化为开放文件

该发布将领域方法论与基础模型分离,使专业推理更易于检查和更新。

AWS 于 2026 年 9 月 16 日发布了这一集合。其首发版本包含 38 项 skills,覆盖 11 个领域,包括基因组学、药物发现、医疗运营、临床数据和医学影像。

每项 skill 都是结构化的 SKILL.md 文件,而不是一个新模型。这些文件包含决策框架、有序流程、参数参考、验证标准和已知失效条件。YAML front matter 会告知兼容的 agents 某项 skill 何时适用,以及它需要什么。

该集合遵循 Agent Skills standard,该标准定义了一种可移植格式,用于打包指令、脚本和辅助资源。AWS 以宽松的 MIT-0 许可证发布了这套集合。

AWS 将这些文件分为推理 skills 和流水线 skills。推理 skills 说明如何评估问题。流水线 skills 则为完成技术工作提供命令、参数和实施模式。

这一区分针对两种不同的失效模式。即使代码正确运行,agent 也可能选错临床标准。它也可能理解标准,却生成无效命令、过时参数或排序错误的流水线。

基因组变异解读 skill 说明了第一类情况。它编码了既有 ACMG guidelines 背后的证据框架,包括分类标准和人群频率考量。

相关的变异调用 skill 则说明了第二类情况。它为 GATK4 等工具提供实施指导,包括注释组和配置模式。前一项 skill 塑造判断,后一项则支持执行。

这种结构不同于检索增强生成,即 RAG。RAG 会在生成答案前,从索引化来源中检索相关段落。相比之下,skill 提供的是使用信息的流程,包括排序规则和错误检查。

两种方法可以相互补充。检索可以提供最新的政策文件或研究;skill 则可以告诉 agent 应优先考虑哪些证据、哪些排除条件适用,以及应如何检验结论。

这种差异在医疗领域尤为相关。指南很少只是事实的集合;其中往往包含依赖关系、阈值、例外、层级结构和文档要求,且必须按顺序应用。

这些文件也可以在无需重新训练基础模型的情况下修订。团队可以在可读文本中更新政策阈值或实施警示,审阅者随后可以检查确切的改动。

可移植性也是这一主张的一部分。AWS 表示,该格式可与超过 20 种 agent 环境配合使用,包括 Kiro、Amazon Quick、Strands Agents、Claude Code 和 OpenAI Codex。

安装过程有意保持简单。开发者可以克隆开放仓库,并在使用前检查每一个文件:

通用 skills 安装器提供了第二种途径:

Kiro 用户可以运行随附安装器,并选择预先配置的 HCLS agent。Strands 开发者可以通过 AgentSkills 加载 skills 目录,再将其附加到 agent。

这些选项降低了集成门槛,但安装只是第一步。各组织仍需根据现行政策、本地流程和预期用途验证每项流程。

因此,这套集合改变了专业化行为的存放位置。它将部分领域层从模型权重和隐藏提示词转移到可版本控制的文件中。这使推理辅助工具变得可见,但可见性并不保证正确性。

为什么通用模型知道规则,却仍可能做错决策

医疗 AI 往往在流程应用上失效,而非简单的事实回忆。

AWS 以一个颇具启发性的例子开篇。某个 agent 收到请求,要求根据 ACMG 和 AMP 标准对 TP53 错义变异进行分类。模型可以识别相关框架,却可能错误处理其证据类别。

它可能跳过人群频率阈值,或编造计算预测器评分。由于术语使用正确,回答听起来可能颇具权威性;但底层分类仍可能是错误的。

这比虚构一项不存在的指南更难处理。伪造引用会形成明显的核查目标;而被正确命名却遭错误应用的框架,则可能通过表面的审查。

类似风险遍布医疗和生命科学领域。理赔裁决需要处理层级关系和最新系数。影像流水线依赖于预处理操作的正确顺序。药物研究则需要明确的证据排序和转化限制。

基础模型从海量文本集合中学习统计关联。这种训练可以产生广泛的事实流畅度,却不能确保可靠地执行每一种专业决策流程。

系统提示词也存在类似局限。提示词可以要求 agent 遵循标准、检查工作并避免没有依据的结论,但这些指令很少包含每个领域任务所需的完整操作流程。

加载所有可能的流程同样会带来问题。AWS 估计,将全部 38 项 skills 放入一个上下文中,约会消耗 80,000 个 tokens。无关指令可能争夺注意力,并增加推理开销。

该集合采用渐进式披露来解决这一问题。agent 首先看到描述可用 skills 的紧凑元数据,只有在将请求匹配到相关能力后,才会加载详细指令。

AWS 还为 Kiro 提供了多 agent 配置。一个轻量级协调器在八名专家之间路由请求。每位专家加载约 15,000 个 tokens 的领域材料,而不是整个集合。

这种设计带来了一项新的依赖:路由准确性。当协调器选错专家时,再强的临床流程也几乎没有价值。跨领域问题也可能需要按审慎顺序使用多项 skills。

不过,这种路由模型明确了 AWS 的核心论点。该公司并未声称一条更长的提示词就能解决医疗推理问题,而是提出了按当前任务选择的模块化流程。

这一方法对那些依赖日益强大的通用模型、却没有独立方法论层的团队构成了压力。更大的上下文窗口和更强的基准测试,并不会自动编码本地政策或强制实现流程一致性。

它同样对仅依赖检索的架构构成压力。一个检索出五个相关段落的系统,仍可能缺乏协调这些内容的指令。agent 需要处理冲突、阈值、缺失证据和升级处置的规则。

微调提供了另一条路径,但它会将更多行为隐藏在模型权重之中。更新一项政策可能需要新的训练数据、验证和又一个部署周期。基于文本的 skill 则可通过熟悉的变更控制实践进行审查。

Skills 不应在所有情况下取代检索或微调。当缺失要素是一套明确流程时,它们的优势最为明显;而当成功主要取决于不可获得的事实或无法访问的患者数据时,它们的作用较小。

成熟的架构可以结合这三种方法:检索提供当前证据,skills 提供操作逻辑,微调塑造反复出现的行为。这次发布使流程层更容易被分离和审计。

这种分离也支持知识融合,即团队将检索到的上下文与有组织的工作知识连接起来。在受监管场景中,关键问题仍是 agent 如何将这些上下文转化为决策。

三项工作流程展示结构化推理带来的变化

这些实例聚焦于足够合理、因而可能逃过随意审查的错误。

AWS 通过药物再利用、Medicare 风险调整和脑影像预处理来展示这些 skills。每个示例都将通用回答与由明确领域流程塑造的回答进行比较。

药物发现场景要求 agent 评估影响 TGFBR1 信号传导、可用于特发性肺纤维化的获批药物。通用 agent 可以列出相关抑制剂,并总结现有文献。

但这样的回答未必能一致地排列证据等级。它可能混淆直接靶点结合与较弱的通路关联,也可能在未检验临床可转化性的情况下讨论生物学合理性。

具备技能的版本会激活药物再利用和转化研究流程。它优先考虑相互作用类型和选定数据库,然后通过既定的证据层级对候选药物进行排序。

该工作流程还将提出的机制映射至纤维化过程,检视成纤维细胞转变、上皮变化和细胞外基质沉积。最后,它会考虑安全性历史、治疗窗口和模型相关性。

这并不会使最终候选药物具备临床有效性,但会使推理路径更加明确。研究人员无需重建一个不透明的回答,就可以质疑排序标准或替换阈值。

第二个示例涉及一项拥有 12,000 名成员的 Medicare Advantage 计划。任务是根据 CMS-HCC Model V28 下的诊断和人口统计数据计算 Risk Adjustment Factor 分数。

一个表面上看似合理的流水线可能遗漏疾病层级、使用过时模型,或在处理优先级更高的疾病状况前就汇总系数。这些错误可能抬高分数,同时让 SQL 看起来仍然易读。

具备技能的 agent 会在测量年度内执行去重,并在汇总前处理层级关系。它还会按人口统计和资格类别对成员进行分组。

这一场景说明了流程正确性为何在商业和法律层面都至关重要。CMS 维护官方风险调整资源,而支付模型和映射关系可能会随年份变化。

静态技能本身也可能过时。因此,组织必须将技能绑定到经过验证的政策版本,并测试其假设。可移植性不应成为将旧逻辑复制到新的支付年度的借口。

第三个示例涉及用于基于体素的形态学分析的 T1 加权 MRI 预处理。一个研究团队需要使用 FSL 和 ANTs 处理 45 名健康成年人的扫描数据。

未经技能训练的智能体能够说出预期步骤,却可能将它们排错顺序。AWS 强调,偏置场校正和颅骨剥离之间存在重要的依赖关系。

在颅骨剥离之前校正强度不均匀性,有助于保护脑掩膜免受组织边界附近信号不均的影响。颠倒这些步骤可能会扭曲提取出的组织,并使后续分析产生偏差。

具备技能的回答会明确步骤顺序,提供脚本,并包含中间质量控制。它还列出了与方向、残余阴影、颈部组织和配准有关的失败条件。

在这里,价值并不来自晦涩难懂的事实。许多模型都知道工具和操作的名称。技能通过带有检查点的有序流程,将这些事实连接起来。

在这三个案例中,智能体都更不容易从请求直接跳到润色完成的输出。它必须揭示假设、对证据排序、遵循依赖关系,并描述失败模式。

这一模式对企业采用具有重要意义。医疗保健买家通常更需要可重复性和可追溯性,而非一个令人印象深刻的初始答案。审阅者能够检查的流程提供了更清晰的验证目标。

不过,这些示例来自该集合的创建者。AWS 选择了任务、流程和对比方式。独立团队必须测试,同样的收益能否在不同数据集、组织和运营约束下持续存在。

410 条提示词测试偏向技能,但测试框架会改变结果

AWS 报告了显著优势,但不同测试框架之间 16.4 个百分点的差距提醒我们,不能将单一胜率视为普遍结论。

该评估使用了 410 条提示词。其中,380 条针对单项技能,30 条要求跨技能推理。AWS 将每个智能体与没有访问这些技能权限的基线版本进行了比较。

一种配置使用了具备自动模型选择功能的 Kiro CLI。智能体可以使用思考工具并读取文件。技能版和基线版均在这一总体设置下运行。

第二种配置使用了 Strands Agents SDK,并明确选择 Claude Sonnet 4.6。两种条件都获得了思考工具,而技能版还加载了该集合。

AWS 使用 Claude Opus 4.7 作为自动评审器。它以 100 分制评估科学准确性、连贯性、相关性、批判性思维和可操作性。

该公司强调胜率,因为模型评审器通常会将分数压缩在较窄的范围内。一次获胜意味着技能版回答的得分高于其对应的基线回答。

Kiro 的总体胜率为 69.5%,Cohen’s d 效应量为 0.39。Cohen’s d 衡量的是组均值差异相对于合并变异程度的大小。

Strands 配置的总体胜率为 85.9%,效应量为 0.97。在第二种测试框架下,这是明显更大的报告效应。

批判性思维表现出最清晰、最持续的改进。其在 Kiro 中的胜率达到 78.0%,在 Strands 中达到 85.1%。对应的效应量分别为 0.65 和 1.03。

科学准确性在 Kiro 对比中赢得了 69.3%,在 Strands 条件下为 86.2%。可操作性的胜率则分别为 68.0% 和 77.3%。

这些数字支持 AWS HCLS agent skills 背后的机制。最大的收益似乎体现在应用框架、质疑假设以及产出可执行的后续步骤上。

结果也表明,智能体基础设施至关重要。69.5% 的胜率和 85.9% 的胜率对应着不同的实际预期。技能选择、上下文处理、模型选择和可用工具都会影响性能。

AWS 的技术报告承认存在多项局限性。所有评分均为自动评分,没有人类专家对部分答案进行验证。

测试提示词同样由模型生成。这可能会使问题的构造方式、技能的编写方式以及评审器奖励回答的方式之间产生一致性。

报告称,每项单独技能仅有 10 条提示词。这个样本量不足以对各项技能进行可靠排序。AWS 指出,置信区间较宽,且不同配置之间的排名并不稳定。

Kiro 配置还使用了自动模型选择,而非固定版本。两种条件共享这一机制,但并未完全控制确切的模型行为。

这项评估作为集合级方法的证据最有力。它较难证明每项技能都会改善每项任务,或证明智能体能够在无人监督下作出临床决策。

基线质量进一步增加了结果的复杂性。AWS 发现,基线能力与技能收益之间的相关系数为负 0.59 和负 0.61。总体而言,较弱的基线回答获得了更大的提升。

在 Kiro 中,弱基线提示词的技能胜率为 87%。中等提示词达到 79%,而强提示词降至 55%。强档的平均得分下降了 0.3 分。

Strands 显示出相似模式。弱提示词的胜率达到 96%,中等提示词达到 89%,强提示词达到 54%。

这带来了实际权衡。当模型缺少可靠流程时,技能带来的收益最大。当模型已经能够很好地处理任务时,技能可能会增加噪声或约束。

AWS 还报告了某些领域中方差的下降。Kiro 中临床数据得分的变异从 6.8 降至 3.3,减少了 51%。即使平均改进并不显著,更一致的回答也可能具有价值。

一致性不等于安全性。一个系统性错误的流程也会稳定地产生错误答案。团队需要参考数据集、人工审查以及围绕关键用途设置的控制措施。

FDA 的AI 生命周期指南提供了有用的更广泛背景。医疗 AI 需要持续关注风险、文档、监测和变更管理。

AWS 并未声称这些文件满足监管要求,或能够取代专业判断。该评估衡量的是受控提示词下的回答质量,而非患者结果或监管认可。

真正的较量是明确的方法论与看似合理的即兴发挥

AWS 押注于透明流程能够减少隐性的推理错误,同时避免将专业知识锁定在单一模型中。

这一押注具备多项优势。技能可读、可差异比较、可版本化。审阅者可以检查其阈值、识别缺失的例外情况,并将回答变化追溯到文件变化。

这一格式还将领域工作与模型采购分离。医疗保健团队可以保留经过审查的流程,同时测试不同的智能体环境或基础模型。

这种可移植性可减少对单一供应商提示系统的依赖,也让缺点更容易比较。同一项技能可以在两个测试框架中使用受控提示词进行评估。

开放许可鼓励外部审查和改编。医院、支付方或实验室可以增加组织特定的政策,也可以删除本地不适用的部分。

然而,定制化会带来治理义务。一旦组织修改了技能,AWS 的评估便不再验证该版本。团队必须对其证据、测试、审批和更新流程负责。

可读文本也可能制造虚假的信心。一项流程在软件审阅者看来可能合理,却包含细微的临床错误。领域专家必须审查内容及其触发条件。

触发设计同样值得关注。过宽的触发条件可能会在技能不适用时加载它;过窄的触发条件则可能遗漏最需要它的案例。错误路由可能隐藏在原本强大的技能背后。

冲突是另一个尚未解决的领域。两项有效技能可能反映不同的司法管辖区、人群或政策年度。智能体需要一种确定性的方式来选择其一,或请求澄清。

本地流程可能偏离公开标准。健康计划可能采用组织特定的审查规则。实验室可能应用细化通用框架的基因特异性规范。

数据访问也限制了流程能够实现的效果。技能无法补回缺失的临床病史、解决成像质量不佳的问题,或验证未记录的诊断。它只能指示智能体发现或升级处理这一缺口。

安全团队必须在安装前检查脚本和依赖项。开源技能可能包含可执行资源、命令或链接。组织应将它们视为代码,而非无害的提示文本。

评估设计也必须反映实际部署。团队不应复制这 410 条提示词并假设能够得到可比结果。他们的测试应包括本地数据形态、模糊请求、对抗性输入和过时政策陷阱。

人工审查应聚焦于风险最高的环节。这些环节包括证据分类、排除标准、层级解析和最终建议。通用文风检查对流程错误几乎无法提供保护。

因此,首要优势并不是技能让智能体成为专家。它让专家获得了一个可供审查的具体工件。这比依赖未记录的模型直觉,是一个更具可辩护性的起点。

这次发布还重新定义了模型竞争。如果领域流程存在于模型之外,买家就可以比较模型遵循这些流程的可靠程度。原始记忆能力只是决策的一部分。

这种转变有利于具备强大路由、上下文隔离、可观测性和评估工具的智能体平台。它也会对那些给出令人印象深刻的答案、却不披露哪些指令塑造了答案的系统施加压力。

医疗 AI 团队接下来应关注什么

下一步证据必须表明,技能收益能够经受独立专家、政策变化和真实部署条件的考验。

第一个信号是独立复现。临床、支付方和研究团队应使用自行创建的提示词进行盲测比较。人类专家应至少评判具有代表性的一部分样本。

如果收益能在不同模型和组织之间持续存在,复现将强化 AWS 的核心主张。较小或不一致的效应则表明,已发布的结果可能严重依赖于原始测试框架。

第二个信号是围绕更新建立的治理机制。医疗保健流程会变化,本地改编也会迅速增多。团队需要明确责任归属、审查日期、版本固定、审批记录和回滚路径。

一个有用的技能注册表应显示每项流程实施的是哪个指南版本。它还应记录谁批准了该文件,以及部署前通过了哪套评估。

第三个信号是生产环境中的行为。关注路由准确性、升级率、错误严重程度、回答方差和专家覆盖频率。平均基准分数无法揭示所有运营失败。

团队还应测试,在加入检索、患者特定上下文和外部工具后,改进是否仍然存在。这些组件可能会引入在孤立提示词评估中不会出现的冲突。

AWS HCLS agent skills 令人信服地表明,医疗 AI 需要的不只是事实流畅度。这次发布将临床和技术流程转化为可检查的工件,并报告了在两种智能体配置下的显著收益。

这项包含 410 条提示词的评估令人鼓舞,但它仍由创作者主导,并由模型评判。其最重要的启示并不在于醒目的胜率,而在于结果对基线强度和智能体架构的敏感性。

医疗团队现在就可以行动,无需赋予智能体最终决策权。先从一个边界明确的工作流入手,选择一项现行流程,并建立一套由本地专家审核的评估机制。比较同一模型在有无该技能支持下的表现。

随后提出那个比任何基准测试都更重要的问题:这项技能是否让错误更容易被发现、解释和纠正?如果在独立审查下,答案依然是肯定的,那么显式方法论有望成为医疗 AI 系统中的标准层。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page