Cognita Imaging FDA 合同测试 LLM 陪审团能否安全评估放射学 AI
Cognita Imaging 获得了一份价值 129 万美元的 FDA 合同,将在约一百万例患者检查中测试 LLM 陪审团。这项为期 18 个月的项目聚焦于一个棘手的监管问题:如何评估能够生成完整放射学报告的 AI 系统,同时又不必将每一个病例都交由人工审核。
Cognita Imaging 的 FDA 合同并未授权医疗器械上市,也不代表 FDA 认可该公司的技术。相反,这笔资金支持的是监管科学研究,旨在检验多个大型语言模型能否一致地评估报告。放射科医生将审查具有临床重要性的分歧,而非人工审核全部数据集。
这一差异构成了项目的核心张力。自动化评估使百万级病例研究成为可能,但也在报告生成器与人类专家之间引入了另一层可能出错的 AI。因此,该项目必须同时评估报告模型及其评判模型。
Cognita 计划交付软件代码、构建 LLM 陪审团的指导、验证队列对比结果,以及经放射科医生审核的差异研究。FDA 还将收到涵盖项目结果和局限性的报告。
其结果的意义不止于 Cognita。医疗 AI 开发者正日益希望生成完整的临床文本,而监管机构则必须决定何种证据能够支持这类更广泛的系统。该合同将检验自动化能否在不削弱临床意义的前提下扩展此类证据。
Cognita Imaging FDA 合同实际资助的内容
该合同资助的是一种评估方法,而非允许销售自主放射学产品的许可。
FDA 向 Cognita Imaging 授予了一份总值 1,294,042 美元的固定总价合同。联邦合同记录将其列为奖项编号 75F40126C00035,涵盖用于评估放射学报告的 AI 虚拟领域专家代理。
合同于 2026 年 6 月 22 日生效,持续至 2027 年 12 月 21 日。Cognita 于 9 月 16 日公开宣布该项目。该公司通过 FDA 的监管科学研究广泛机构公告计划获得该合同。
该项目名为“用于放射学报告评估的虚拟领域专家代理”。Cognita 将开发并验证一个框架,由多个 LLM 对人工撰写和 AI 生成的放射学报告进行评估。
LLM 陪审团是指一组独立评估同一输出内容的语言模型。它们的综合判断能够揭示单个自动化评估器可能掩盖的分歧。
随后,该方法将应用于来自美国大型队列的约一百万例患者检查。研究将考察其在不同患者群体、医疗场景、影像设备、疾病和罕见发现中的表现。
这一规模是该提案的核心。传统阅片研究要求放射科医生将模型输出与参考病例进行对照审查。这类研究仍然不可或缺,但专家时间限制了其可覆盖病例的数量和多样性。
完整报告的评估范围也比聚焦于特定问题的检测系统更广。分诊模型或许能够识别疑似血栓或肺萎陷。其输出受到约束,并可与明确的参考标准比较。
一份生成报告可能包含多项发现、限定说明、对比和建议。它可能遗漏异常、凭空编造异常、错误表述严重程度,或含糊地描述正确发现。
Cognita 的方法要求多个 LLM 大规模分类这些差异。当陪审团发现具有临床重要性的分歧时,放射科医生将介入。
据该公司的合同公告,审核人员将判定问题源于生成报告、LLM 陪审团,还是原始放射科医生报告。这种三方裁决至关重要,因为参考报告并非天然完美。
该研究将由 Cognita 联合创始人 Akshay Chaudhari 领导。他同时也是 Stanford University 的放射学与生物医学数据科学副教授。Cognita CEO 兼联合创始人 Louis Blankemeier 将担任共同研究者。
Cognita 是 Mosaic Clinical Technologies 的全资子公司,而后者归 Radiology Partners 所有。这一关系使研究团队能够获得多样化执业环境中的临床基础设施和放射学专业知识。
Radiology Partners 表示,其更广泛的网络包括逾 4,000 名放射科医生,为超过 3,400 家医疗机构提供服务。该公司称每年解读的影像检查超过 5,500 万例。
这些公司数据描述的是潜在运营背景,而非合同验证结果。这一百万例检查组成的队列仍需加以界定、测试和报告,并提供足够细节以供其他人评估其代表性。
合同交付成果使该项目的分量超过私人基准测试。Cognita 必须提供代码、实施指导、大型与小型队列分析、经裁决的差异研究以及已记录的局限性。
不过,FDA 尚未承诺将该框架采纳为监管标准。这项研究可为未来政策提供参考,但不会成为每款生成式放射学产品的必经路径。
这一界限很重要,因为合同资助与产品授权服务于不同目的。Cognita 独立的胸部 X 光模型已获得突破性器械认定,但尚未获得上市许可。
原始报道也确认,研究合同与突破性认定是两项不同的计划。两者都不能替代支持未来器械申报所需的证据。
为什么完整报告打破了旧有评估模式
生成式放射学系统将评估从狭义准确性测试转变为开放式临床比较问题。
过去,大多数获授权的放射学 AI 执行的是边界明确的任务。系统可能分割器官、标记紧急扫描、测量结构,或检测指定异常。
这些功能仍可能需要复杂测试。然而,开发者通常可以在开展研究前定义预期输出、参考标准和目标人群。
完整报告生成则不同。模型接收影像以及可能的临床背景,随后生成涵盖其认为相关全部内容的叙述。
一项检查可能包含多种临床优先级不同的异常。另一项检查可能正常,但包含不应被误认为疾病的术后改变。
生成报告可能在事实上准确,却未能恰当排序优先级。它可能提及正确发现,却使用改变紧急程度的表述。它也可能生成一句看似合理但缺乏影像支持的文字。
幻觉是指看似可信、却缺乏基础证据支持的信息。遗漏则是指报告未纳入应当记录的发现。
这两类错误都难以通过简单文本匹配加以识别。两位正确的放射科医生可能以不同方式描述同一影像,而两份相似报告也可能具有实质不同的临床含义。
传统语言指标通常会奖励相同的词语或短语。它们无法可靠地区分无害的措辞变化与会改变患者管理的错误。
Cognita 此前参与开发了 GREEN,即生成式放射学报告评估与错误标注。GREEN 使用语言模型识别、分类并解释生成报告与参考报告之间具有临床重要性的差异。
经同行评审的 GREEN 论文显示,其与专家评估的一致性优于多种传统文本指标。它还会生成解释和错误计数,而不只是返回相似度评分。
FDA 合同从两方面扩展了这一基本理念:它采用多个模型评审者而非依赖单一模型,并在自动化判断具有临床意义的病例中引入放射科医生。
陪审团可降低对单一模型偏好的依赖,但前提是其成员能够提供具有实质差异的判断。多个模型可能共享训练来源、推理失误,或对相同措辞具有相似敏感性。
因此,共识并不等同于正确性。五个模型犯下同一错误,可能在未增加有效证据的情况下制造更强信心。
拟议的差异处理流程应对了部分风险。当评审者就具有临床重要性的问题存在分歧时,放射科医生可以审查报告并判断何处失效。
但一致意见也值得测试。如果每个陪审团成员都忽略同一项遗漏,基于分歧的升级机制就不会将该病例交给人工审核。
因此,该项目需要一套单独抽样的人工审核集。该集合可估计陪审团一致决定和意见分歧决定中的错误。
大型和小型队列对比同样重要。公司必须说明,当评估范围从数百个精选病例扩大时,能够发现哪些额外的失效模式。
一百万项检查应当包含更多罕见病症和不常见的组合。它还可能揭示与扫描设备、机构、患者群体和临床环境有关的性能变化。
然而,规模本身并不能保证覆盖性。大型数据集仍可能低估重要人群、少见设备或来源网络之外的场景。
这正是队列构成应持续纳入最终分析的原因。读者需要的不仅是醒目的数字,才能判断该方法是否反映美国真实临床实践。
FDA 需要与生成式 AI 相匹配的证据
该合同出台之际,FDA 正在决定现有器械规则应如何适用于输出更广泛、可预测性更低的系统。
8 月 18 日,FDA 发布了一份关于生成式 AI 赋能医疗器械的讨论文件。该机构征求了关于风险评估、上市前评价、上市后监测和全生命周期管理的反馈意见。
这一时机使 Cognita Imaging FDA 合同尤具相关性。该机构不仅在审查单个产品,也在研究其评估方法是否适合能够创造新内容的器械。
FDA 的讨论文件提出了当输出具有可变性或开放性时如何衡量性能的问题。它还询问开发者应如何发现编造内容、评估人工监督,以及在部署后监测产品。
AI 生成的放射学报告涉及上述每项问题。其输出在不同运行之间可能有所差异,可能包含多项临床主张,并且即使最终报告由放射科医生签署,仍会影响决策。
上市前研究必须在获授权前证明安全性和有效性。然而,有限的测试集可能遗漏后来在临床使用中出现的罕见组合。
上市后监测可提供更广泛的证据,但审查每一份已部署的报告会带来巨大的运营负担。自动化评审者或许有助于识别值得专家关注的病例。
这在上市前验证与现实世界监测之间搭建了潜在桥梁。同一评估框架既可在模型发布前进行测试,也可在部署后监测特定输出。
该框架仍需设定明确阈值。会改变治疗方案的差异,应与文风分歧或无害的措辞变化采用不同处理方式。
它还需要可追溯的记录。监管机构和医院必须能够还原:自动评审为何判定某一错误类别,以及某个病例为何被提交给人工审核。
模型更新带来另一项挑战。若报告生成器发生变化,其错误分布也可能改变。若陪审团成员发生变化,评估系统的判断同样可能偏移。
这就形成了两个动态系统,而非一个。已验证的报告生成器看上去可能变得更好或更差,仅仅是因为评估者进行了更新。
因此,版本控制、锁定的测试集和可重复的提示词将成为必要条件。开发者必须记录被审查的产品,以及用于评估它的每一位评审模型。
FDA 已维护一份涵盖各医疗专科获批产品的 AI device list。放射学仍占已列设备中的较大比例。
该机构指出,希望在未来更新名单时更清晰地标识包含基于 LLM 功能的设备。这表明,随着生成式功能进入医疗产品,监管可见性需要更加精确。
成熟的放射学 AI 市场也带来竞争压力。Aidoc、Viz.ai、Lunit、Annalise.ai、Rad AI 和 DeepHealth 等公司,已在检测、分诊、工作流和报告工具之间探索不同组合。
可扩展的报告评估方法不会自动偏向 Cognita。如果 FDA 发布具有广泛适用性的指导意见,竞争对手也可以采用类似的证据策略。
压力反而会落在所有基于有限阅片研究提出广泛性能主张的开发者身上。监管机构和采购方可以追问:数百个经过筛选的示例,是否足以揭示模型在真实临床变异条件下的表现。
医院在采购过程中也可能提出同样的问题。它们需要证据证明,模型能适用于本地扫描设备、检查方案、患者群体和报告惯例。
如果该合同形成可信的方法学,更大规模的验证队列可能成为证据包的预期组成部分。这将提高测试要求,也会使基于选择性案例支撑广泛生成式主张变得更加困难。
LLM 陪审团也必须接受审查
核心权衡十分直接:LLM 评审具备规模优势,但其自身错误也可能扭曲监管机构获得的证据。
LLM 并非从中立立场评估报告。其判断取决于训练数据、提示词、模型版本、评估顺序以及每份候选报告的措辞。
评审模型可能偏好更长的回答,即使额外文本会带来临床风险。它也可能偏好熟悉的写作风格,或为与自身回答相似的输出打出更高分。
模型还可能在重复评估中做出不一致的决定。当开发者需要为监管申报提供稳定测量结果时,这会造成可重复性问题。
医疗领域提高了风险,因为细微差异也很重要。在通用医疗问题上表现良好的评估器,仍可能无法妥善处理不确定性、左右侧信息、时间序列比较或影像学特定术语。
一项近期针对 LLM judge systems 的医疗综述指出,自动化评估很有前景,但强调仍需验证、透明度和人工监督。
Cognita 项目的结构旨在研究其中若干问题。多个评审模型可以揭示不稳定性,而放射科医师裁决可检验分歧是否指向具有临床意义的不确定性。
不过,陪审团架构不会自动消除偏差。其成员应依据互补性能进行选择和测试,而不是按模型数量简单拼凑。
研究应披露评审模型是否来自不同模型家族。还应说明是否有任何评审模型与报告生成器共享技术、数据或优化方法。
自我偏好是一个特别值得关注的问题。某个模型家族可能偏爱在结构、冗长程度或推理模式上与自身相似的输出。
若开发者使用关联模型评估其生成器,这一问题会更加严重。看似强劲的评分可能反映的是文风亲和性,而非临床正确性。
提示词敏感性同样需要检验。对指令的微小修改,可能改变评审模型对遗漏、不确定性和临床重要性的权重。
监管框架不能依赖只在某一未记录配置下有效的提示词。提示词、温度参数、模型版本和决策规则应可复现。
陪审团还必须区分报告质量与影像事实。纯文本评审模型可以比较两份报告,但无法独立确认哪种描述与扫描结果相符。
如果原始报告漏掉一项发现,生成报告即使正确补充该发现,也可能因此受罚。反过来,当两份文本对同一错误达成一致时,也会出现类似情况。
Cognita 提议的放射科医师审核可通过回看影像解决部分冲突。最终方法学应明确何时影像审核是强制要求,而非可选项。
完全具备影像感知能力的评估器也会带来新的复杂性。视觉语言模型可以检查影像和文本,但其视觉解读同样必须接受验证。
这形成了分层保障问题。每增加一个模型,能力虽然扩展,却也增加了一个可能静默失效的组件。
具有临床重要性的分歧也不是固定类别。对一位患者而言无关紧要的措辞差异,若影响随访、紧急程度或治疗,就可能变得重要。
该框架需要明确的错误类别和严重程度定义。放射科医师在应用这些规则时,应体现出有意义的一致性。
阅片者之间的分歧不应被视为需要消除的噪声。它可能揭示影像、报告或临床背景中真实存在的模糊性。
因此,最有用的结果或许是经过校准的不确定性,而不是一个放之四海而皆准的单一评分。能够可靠识别不确定病例的系统,可以支持监督,而无需假装替代专家判断。
成本和延迟也会影响采用。对一百万份报告运行多个专有模型,可能需要大量计算资源和重复处理。
这些经济因素不会否定该方法,但会影响较小开发者能否复现它。若只有大型组织负担得起评估基础设施,监管方法的实用性便会降低。
Cognita 的代码和实施指南可能有所帮助。但最终交付成果仍应说明硬件要求、模型访问方式、处理时间,以及对封闭模型更新的敏感性。
因此,该合同的成功应以透明度和可重复性来衡量,而不只是与放射科医师达成一致的亮眼结果。可信的负面结果同样能提供有用的监管证据。
如果 LLM 陪审团在特定错误类别上失效,FDA 可以相应限制其角色。这项研究无需证明普遍可靠性,仍能改善评估实践。
跨越一百万例检查的成功意味着什么
成功的结果将使人工审核更有针对性,而不是让放射科医师变得可有可无。
该项目的核心运行模式是选择性升级处理。自动评审模型处理大规模数据集,专家则聚焦于存在实质不确定性或分歧的病例。
这一设计可以扩大有限专家时间的覆盖范围,也可让审核人员集中处理最可能暴露模型弱点的病例。
其收益取决于分诊敏感性。陪审团必须将足够多真正有问题的报告提交给放射科医师,同时又不能让无害差异淹没他们。
假阴性带来更大的安全担忧。这类情况发生在陪审团接受了具有临床重要性的报告错误,却从未请求人工审核时。
假阳性则造成另一种负担。如果升级的安全报告过多,承诺的效率便会消失,系统将趋近于另一项全面阅片研究。
研究应针对不同错误严重程度报告这两类结果。单一的一致率百分比会掩盖实际运行中的权衡。
性能还应按疾病、检查模态、患者特征、机构类型和设备分别呈现。汇总结果可能掩盖较小群体中的薄弱表现。
罕见发现应得到特别关注。模型可能获得很高的总体准确率,却在不常见但紧急的疾病上失效。
一百万例检查使罕见事件分析更具可行性,但实际计数仍然重要。仅有少数示例的罕见亚组,无法支持稳定结论。
小型与大型验证队列之间的比较将尤其具有参考价值。它可以显示,当病例构成扩大时,从传统研究中得出的结论是否依然稳定。
若排名或错误率发生实质变化,开发者和监管机构将获得证据,表明较小规模评估遗漏了重要行为。即使陪审团本身仍需改进,这一结果也可能重塑研究设计。
成功还会影响上市后监测。医院可以抽样生产环境中的报告,应用获批准的评估方法,并将高风险差异转交质量团队。
这种监测需要本地治理。医疗系统需明确警报责任、审核时限、纠正措施以及与供应商的沟通方式。
自动化评估不能成为替代报告安全问题的机制。它应生成证据,以支持现有质量和监管流程。
该方法也可能有助于比较产品版本。开发者可以评估更新是否修复了已知错误,同时不会在其他方面引入新问题。
这种用途需要稳定的基准和冻结的评审器配置。否则,陪审团的变化可能被误认为是产品变化。
更广泛的竞争影响可能十分显著。生成式放射学开发者越来越多地宣称,其系统能够起草或生成完整报告。
当评估器可以审核大规模、多样化队列时,这些主张将更易于检验。证据有限的公司可能面临压力,需要公布亚组结果和经裁决的错误率。
不过,FDA 合同赋予 Cognita 在塑造方法学方面的早期角色。该公司开发自己的放射学 AI,因此利益冲突管理和外部可重复性将至关重要。
独立团队应能够在其他报告生成器上测试该框架,也应能在不依赖 Cognita 私有系统的情况下复现其核心发现。
开源代码可以支持这一过程,但仅有代码并不足够。外部验证需要可访问的数据集、有记录的提示词、错误定义和模型版本记录。
患者隐私将限制可发布的源数据规模。项目可通过受控访问、去标识化基准或独立验证环境来应对这一问题。
最强的结果将兼具规模与可审计性。届时,监管机构可以检查结果是如何产生的,而不是接受一个不透明的评分。
这一标准也将惠及医疗采购方。医院可以依据与临床后果挂钩的错误类别比较主张,而不是依据供应商自行定义的准确率数据。
三个信号将显示 LLM 陪审团是否已准备就绪
接下来的证据应揭示,Cognita 的框架衡量的是临床安全性,还是仅仅实现了语言模型之间的一致意见自动化。
第一个信号是一份详尽的验证方案。它应明确陪审团成员、提示词、模型版本、队列构成、错误分类体系以及升级处理规则。
这些细节将决定该方法是否具备可复现性。它们也将揭示,陪审团是否包含真正存在显著差异的评估者,还是由关系密切的模型组成。
一份严谨的方案会说明研究人员如何抽样一致通过的决策,并交由人工复核。这项测试至关重要,因为一致意见可能掩盖共同犯下的错误。
第二个信号是由放射科医生裁定的差异分析。研究人员应报告生成报告、原始报告和 LLM 陪审团分别在哪些方面出现失误。
这项分析应区分幻觉、遗漏、严重程度判断错误、左右侧错误、缺乏依据的建议,以及影响相对较小的措辞差异。
它还应披露各子群体的表现。整体结果稳定,无法弥补在罕见疾病、代表性不足的人群或特定医疗场景中的评估薄弱问题。
如果陪审团能够发现具有临床重要性的差异,同时将复核工作量控制在可管理范围内,这份合同的核心论点便会获得支持。较高的漏检率或过度升级处理则会削弱这一论点。
第三个信号是研究成熟后 FDA 的回应。该机构可能会在指导文件、公开研讨会、设备审查或上市后监测提案中提及这一方法。
FDA 无需强制采用 LLM 陪审团,这个项目依然具有意义。即使只是有限度的认可,也可能为大规模队列评估和人工裁定建立预期标准。
沉默同样具有参考价值。这可能表明该方法仍需进一步验证,或监管机构更倾向于产品特定的证据。
公众不应将 Cognita Imaging 获得的 FDA 合同解读为 AI 能够安全监管自身的证明。该项目之所以存在,正是因为这个问题仍未得到解决。
其更站得住脚的前提更为狭窄:如果自动化评判者自身的表现也以同等严谨的标准加以衡量,它们或许能帮助放射科医生审查更多证据。
开发者、临床医生和医疗采购方应关注最终成果是否揭示失效模式,而不是将其压缩成一个分数。他们还应追问,独立团队能否复现这些发现。
决定性的问题不在于多个 LLM 能否就一份报告达成一致,而在于它们的一致与分歧能否可靠地将人工注意力引向最重要的病例。



