GPT-4 肺活检规划找到更短针路,但两例未通过审查
GPT-4 肺活检规划在 30 个病例中有 28 个提出了可接受的进针路径,但两次失败暴露出一个影响重大的安全缺口。该模型依据的是经过标注的二维 CT 图像,而非在实时手术中控制穿刺针或评估患者。
纪念斯隆·凯特琳癌症中心的研究人员回顾性测试了 GPT-4 是否能为 CT 引导下肺活检推荐进针角度。独立放射科医生认为,其提出路径中的 93.3% 足以用于实施活检。
AI 路径穿过的肺组织中位距离为 5 毫米,而经验丰富的临床医生此前选择的路径为 23 毫米。不过,更短并不必然更安全。其中一条被否决的路径穿过的肺组织是对应人工路径的四倍,另一条则可能造成穿刺针稳定性问题。
这种张力比醒目的百分比更重要。研究表明,通用多模态模型能够解读经过精心准备的医学图像,并生成看似合理的几何规划。它并未证明 GPT-4 能改善结果、减少并发症,或可在无需大量人工准备和监督的情况下规划活检。
GPT-4 肺活检规划研究实际测试了什么
该实验评估的是历史图像上的拟议进针角度,而非由 AI 引导的患者手术。
这项开放获取研究发表在 CVIR Oncology,涵盖了连续 30 例肺活检手术。研究人员使用了由三名介入放射科医生此前完成手术的去标识化图像。
每位临床医生均拥有至少十年的经验。患者队列包括 17 名男性和 13 名女性,中位年龄为 65 岁。肺结节直径范围为 5 至 45 毫米,中位直径为 21 毫米。
样本包括 5 个肺尖病灶、7 个胸膜下病灶、3 个纵隔旁病灶,以及 4 个肺底附近病灶。这些位置带来了涉及肋骨、血管、肺组织和穿刺针稳定性的不同规划挑战。
CT 引导下肺活检要求医生将穿刺针经胸壁推进至可疑病灶。路径必须到达适合诊断的组织,同时避开骨骼、肺裂、纵隔和主要血管。
规划还会考虑穿刺针穿过多少正常肺组织。较长的肺内路径可能暴露更多组织,尽管路径长度只是手术风险的一个要素。
研究并未向 GPT-4 提供未经处理的 CT 检查结果。研究人员选取了一张轴位图像,对其进行裁剪和放大,并使用 GIMP 添加了放射状网格。图像从原始医学格式转换为 PNG 文件。
随后,一名作者用蓝圈标记目标,并以红色勾勒敏感结构。这些标注向模型提供了未来可部署系统最终需要自动识别的信息。
研究人员通过标准化提示词提供了五项规划标准。所要求的路径必须到达目标、减少穿过肺组织的距离,并避开骨骼、肺裂和纵隔。
每个病例都在新的聊天会话中开始。当首次回答未涵盖所有条件时,研究人员可以继续提示。模型所需迭代次数中位数为两次,四分位距为一次至三次。
团队记录了首个纳入所有要求参数的回答。两名经验丰富的介入放射科医生——均未参与原始手术——在不知道路径来源的情况下,独立审查了最终路径。
这一设置将可行性与临床表现区分开来。模型是在人工专家选定图像、标记目标、识别风险并制定规则之后才提出角度。放射科医生在每个重要阶段仍不可或缺。
因此,该研究测试的是一个狭窄的问题:通用多模态模型能否根据准备好的图像生成看似合理的进针角度?它并未测试自主分割、三维规划、实时导航或机器人穿刺针控制。
这种区别避免将一项有前景的规划实验夸大为关于自动化手术的无根据主张。
更短路径构成了研究最强的信号
GPT-4 提出的穿过肺组织的路径短得多,但研究并未证明这些路径带来了更安全的临床结果。
独立审查者认为,模型提出的 30 条路径中有 28 条足以用于实施活检。该结果得出了研究中 93.3% 的可行性数据。
AI 生成的路径穿过肺组织的中位距离为 5 毫米,四分位距为 0 至 25 毫米。
相比之下,已完成手术中采用的人工路径穿过肺组织的中位距离为 23 毫米,四分位距为 5 至 57 毫米。
这一差异具有统计学显著性,报告的 p 值为 0.0063。无需穿过肺组织的路径涉及胸膜下结节,这类结节位于胸膜表面附近。
直接进入此类病灶的路径可避免穿过正常肺实质,即参与气体交换的功能性组织。这使短路径在几何上颇具吸引力,但单凭几何关系无法定义最佳临床方案。
AI 的平均进针角度为 179 度,而临床医生采用的路径为 174 度。这一差异没有统计学显著性。
相近的平均值并不意味着模型复现了人类决策。根据主要结果,仅 30 个病例中的 8 个在研究所述的比较标准下表现出良好一致性。
作者将进针角度相差不超过十度且穿过相似组织平面的路径定义为匹配。在其他部分,他们报告了仅 3 个病例符合更严格的匹配解释,凸显结果对所选定义的敏感性。
这一差异值得关注,因为中心平均值可能掩盖病例层面的显著差异。两组路径可以拥有相近的平均角度,却在个体患者层面存在巨大分歧。
因此,AI 看起来是在寻找替代路径,而不仅仅是模仿已完成的手术。一些替代方案看起来更短,且仍获审查者认可;另一些则暴露出汇总结果很容易掩盖的弱点。
这种比较在结构上也并不对等。人工路径已在患者身上成功执行,而 AI 路径仅作为规划图像上绘制的线条存在。
一条拟议路径在单个轴位切面中可能看似合理,但在相邻切面中评估时可能变得不切实际。真实手术必须考虑呼吸运动、身体位置、穿刺针固定、设备限制和不断变化的解剖结构。
原始手术未出现重大并发症。4 名患者出现无需干预即缓解的轻微气胸,另有 2 名出现轻度、自限性咯血。
这些结果不能归因于 AI,因为模型并未引导手术。研究人员也未模拟若采用其路径,是否会改变这些并发症。
因此,更短路径的结果是一个有价值的假设。它支持进一步测试自动化规划是否能发现临床医生可能忽略的路径,尤其是在存在多个几何上有效的选择时。
它并不支持“GPT-4 让肺活检更安全”这一说法。要确立这一主张,需要在受控条件下比较临床结果的前瞻性研究。
两条被否决的路径说明为何最短并不总是最安全
模型的失败揭示了:优化可见指标与理解穿刺针在实际活检中如何表现之间存在冲突。
在病例 19 中,GPT-4 建议了一条穿过 20 毫米肺组织的路径。人工路径仅穿过 5 毫米。
因此,AI 建议在肺组织中行进的距离是人工路径的四倍,这与提示词中提供的优化目标相矛盾。它还返回了较宽范围的可选进针角度,而非精确、明确优选的方案。
审查者认为该路径在理论上可行,但并不代表良好的临床实践。这一区别概括了避开明显障碍与制定可靠手术规划之间的差距。
病例 27 暴露了另一个问题。目标是一个胸膜下结节,意味着它位于肺外表面附近。
拟议的 AI 路径不必要地穿过了 5 毫米肺组织。审查者还对穿刺针稳定性提出了担忧。
穿过支撑组织的路径若过短,可能导致同轴活检针固定不足。穿刺针在取样过程中会更容易发生移动或脱位。
这构成了研究的核心权衡。减少穿过正常肺组织的距离听起来天然有益,但稳定的路径可能需要足够的组织嵌入,以牢固固定穿刺针。
模型接收的是简化规则,而非对手术实践的完整表征。它可以寻找符合这些规则的角度,却无法理解放射科医生为何可能选择不那么直接路径的所有原因。
研究人员承认,该分析仍然是二维的。人类放射科医生通常会浏览多个 CT 切片,并使用多平面重建来理解三维解剖结构。
单张轴位图像无法完整呈现延伸至该平面上方或下方的结构。它也无法显示一条看似清晰的线如何在穿刺针完整的三维路径中发生变化。
图像在送入 GPT-4 前经过了人工标注。模型并未独立定位每个病灶、分割器官,或可靠地界定关键解剖结构周围的安全边界。
研究还未纳入与锁骨下及腋窝神经血管束保持至少 5 毫米距离的明确标准。患者体位使这些结构远离所评估的路径,但未来系统不能假定同样的条件。
提示过程引入了另一种变异来源。研究人员以标准化提示词开始,但当模型遗漏某项标准时,后续互动并未完全脚本化。
因此,两名用户可能将同一模型引导至不同答案。临床规划系统需要一种可复现的流程,在无需临时对话的情况下产出可审计的结果。
病例在独立会话中处理,减少了跨病例污染。不过,研究未确定对同一图像重复运行时是否会返回相同角度。
当一项建议会影响侵入性手术时,一致性至关重要。若系统在不同运行之间改变方案,就需要一种解释、排序并解决这些差异的方法。
模型版本带来了另一项挑战。通用 AI 服务会随时间变化,有时不会向临床用户披露每项技术修改。
从某一 GPT-4 配置获得的结果,不能自动迁移至后续模型。医学验证必须对应受控的系统版本、定义明确的输入和有文档记录的操作流程。
专用系统为通用模型提供了参照
GPT-4 的结果值得关注,因为它使用的是通用模型;但专用算法已经能够提供更具结构性、可重复的规划方法。
一项 2024 年的路径规划研究评估了专为经胸肺活检开发的软件。该系统结合三维病灶检测与贝叶斯优化来提出穿刺路径。
该系统使用来自 219 次扫描的 2,147 个结节进行训练。研究人员又使用包含 354 个病灶的 235 次扫描验证了病灶检测能力。
该模型报告的受试者工作特征曲线下面积为 97.4%。其平均敏感性为 93.5%,平均特异性达到 93.2%。
研究人员将系统提出的路径与 150 名患者实际活检路径进行了比较,并将角度差小于五度定义为匹配。
该系统在 85.3% 的评估病例中生成了可行路径。按照研究定义,82% 的路径与实际路径匹配;在匹配路径中,平均角度偏差为 2.30 度。
该系统处理了 GPT-4 未执行的任务,包括三维分割和病灶检测。不过,它仍属于回顾性评估,而非改善患者结局的证据。
更早的研究同样将基于规则的 AI 规划与专家判断进行了比较。一项 2023 年的概念验证研究为 28 名患者中的每位生成了五条候选路径。
四名经验丰富的医生对 140 条路径进行了评分。计算机与医生在 57.9% 的病例中给出了完全相同的评分,算法选择的 28 条最佳路径均被认为安全。
较新的研究进一步拓展了这一比较。用于 CT 引导活检的路径推荐算法,即 TRAX,在医生确定目标后,会生成并排序约 20,000 条候选路径。
在一项纳入 53 名患者的 TRAX 对比研究中,盲法评估的放射科医生认为每一条 AI 选择和医生选择的路径都安全。58% 的比较中评分完全一致。
评审者在 23% 的情况下更倾向于 TRAX,在 19% 的情况下更倾向于医生路径。差异不具统计学显著性,但 TRAX 路径平均略短。
TRAX 还选择了更多位于标准轴位平面之外的路径。其一半路径采用倾斜平面,而 81.1% 的医生路径保持在轴位平面。
这些研究并未形成一场胜负分明的简单竞赛。它们的输入、定义、数据集和路径匹配阈值各不相同。
专门构建的系统可以编码解剖学约束、量化距离,并一致地对数千条路径排序。多模态语言模型则提供了更大的灵活性,但更依赖图像准备、提示设计和人工解读。
因此,GPT-4 的角色可能更接近规划助手,而非路径生成引擎。它可以帮助临床医生比较选项、发现被忽略的方案,或记录选择背后的理由。
即便是这种辅助角色也需要安全保障。界面必须区分模型建议与已获批准的方案,展示完整的解剖学路径,并保留人工审查记录。
真正有意义的竞争并非 AI 与放射科医生之间的竞争,而是自动化几何建议与将图像上的一条线转化为安全操作所需的完整临床判断之间的比较。
GPT-4 肺活检规划仍需前瞻性验证
下一步证据必须证明可重复性、三维表现和患者获益,而不只是再次报告较高的可行性比例。
首先需要关注的是可重复性。研究人员应在受控条件下跨不同会话重新运行相同病例,并测量模型选择相同路径的频率。
他们还应标准化每一项提示和后续条件。如果仍需要人工修正,研究必须记录其发生频率,以及对建议造成的改变程度。
可重复的系统将更有力地支持在正式规划工作流中使用生成式 AI。即使评审者认为大多数单次输出看似合理,不同运行之间的巨大差异也会削弱这一论点。
第二个信号是原生三维分析。未来系统需要访问完整 CT 体数据,而不是人工选取的 PNG 图像。
该工作流应自动分割病灶、肺、血管、肋骨、叶间裂、纵隔及其他相关结构,还应计算明确的安全边界并展示完整路径。
将语言模型与专用医疗分割技术结合,或可解决当前研究中部分人为图像准备的问题。但这也会带来需要单独验证的新集成风险。
三维分析必须适应不同扫描仪、重建设置、患者体位和病灶位置。多中心数据至关重要,因为一家癌症中心的表现未必能迁移至其他医院。
第三个信号是前瞻性临床比较。这类研究将在操作前评估 AI 辅助方案,同时由具备资质的放射科医生对每项最终决定负责。
研究人员可以比较诊断产出率、气胸、出血、操作时长、辐射暴露、穿刺针重新定位和恢复时间。他们应单独报告失败的建议,而不是让平均值掩盖这些情况。
前瞻性测试应谨慎起步。影子模式可以在不影响医疗决策的情况下生成建议,使研究人员能够在真实条件下将 AI 方案与实际决策进行比较。
后续试验可以评估使用该系统的临床医生是否能制定更优或更一致的方案。任何向直接机器人执行的推进,都需要显著更强的证据和设备层面的监管。
这项涵盖 30 个病例的研究无法回答诊断产出率问题,因为所提路径并未实际使用。它也无法说明更短的路径是否会减少观察到的轻微并发症。
其价值在于证明通用多模态模型能够参与高度受限的规划任务。这一发现支持开展更好的实验,而非立即部署到临床。
真正的进展是一项可检验的规划假设
这项可行性研究将生成式 AI 路径规划转化为可量化的研究问题,同时将临床责任牢牢留在专家手中。
GPT-4 在 30 个历史病例中的 28 个病例里识别出了独立专家认为充分的路径。其提出路径的中位数比已完成的手动路径少穿过 18 毫米肺组织。
这些数据使该方法值得进一步研究。但它们也伴随着两项被否决的方案、人工图像准备、未预先设定的后续提示,以及对三维解剖结构的二维视图。
最有价值的解读既不是否定,也不是庆祝。通用 AI 模型识别出了足够的视觉和操作结构来提出看似合理的替代方案,但它缺乏可靠规划所需的完整背景信息。
对于放射科医生,这项研究指向一种比较路径而非取代临床判断的决策支持方式。对于医疗 AI 团队,它界定了从聊天机器人实验到经验证软件之间仍缺失的工程工作。
对于医院和患者,标准应始终以结局为基础。AI 辅助是否能改善组织取样、减少并发症、缩短操作,或使不同医疗环境中的专家规划更加一致?
下一阶段研究应通过受控系统、完整 CT 体数据、外部数据集和前瞻性临床评估来回答这些问题。在此之前,GPT-4 肺活检规划仍只是对一张准备好的图像提出的一项有趣第二意见,而不是为实时穿刺针导航的工具。



