Longformer ECOG 模型填补关键缺口,但其预测并非临床评分
研究人员在来自 79,698 名患者的 495,862 份记录上训练后,Longformer ECOG 模型能够从肿瘤科病历中推断缺失的体能状态。这一规模意义重大,因为东部肿瘤协作组体能状态(ECOG PS)往往隐没在自由文本病历中。然而,这一结果也带来了关键的张力:模型生成的估计可改善真实世界肿瘤学数据,但不能取代临床医生的评估。
Wenxin Xu 领衔的研究团队使用语言模型,将体能状态分类为良好(ECOG 0 或 1)或较差(ECOG 2 至 4)。其最佳模型的受试者工作特征曲线下面积达到 0.95,精确率-召回率曲线下面积也达到 0.73;当某一类别较少见时,后者是更严苛的衡量指标。
这些数字令该系统在回顾性数据研究中颇具潜力,但尚不足以用于无人监督的治疗决策。此前基于理赔数据的代理指标利用计费事件和实验室变量估计同类缺失信息。新方法则直接读取肿瘤科医生已撰写的文本,在带来更丰富信号的同时,也使验证问题更为复杂。
该模型将临床语言转化为缺失的研究变量
这一进展的直接意义并非在床旁自动生成 ECOG 评分,而是为标注不完整的肿瘤学数据提供一种可扩展的方法。
ECOG 体能状态是由临床医生评定、用于衡量疾病如何影响患者日常活动的指标。0 分表示活动能力完全正常。分数越高,表示限制越多;4 分则表示完全失能。
这一指标会影响治疗选择、预后、临床试验资格,以及不同患者群体之间的比较。因此,它在医疗和研究中均具有价值,也使缺失值尤具破坏性。
即使肿瘤科医生在其他位置描述了患者的功能状况,结构化数据库字段仍可能显示为空。病历可能提及患者是否工作、能否独立行走、是否需要协助自我照护,或是否一天中大部分时间卧床。这些细节包含体能状态信息,却未必附有正式评分。
Xu 及其同事首先使用正则表达式,即固定的文本匹配规则,识别明确记录的评分。该过程在 79,698 名患者的 495,862 份病历中找到了 ECOG PS。随后,团队在训练模型前,从其余病历内容中移除了检测到的评分文本。
这一移除步骤至关重要。否则,模型可能只是找到诸如“ECOG 2”这样的隐藏标签,再返回同一数值。那是在提取评分,而不是从更广泛的临床描述中推断评分。
研究人员按约 80%、10% 和 10% 的比例,将患者划分为训练、验证和测试组。按患者层级进行分离,降低了同一患者的病历同时出现在训练和测试数据中的风险。
团队评估了多种自然语言处理架构,其中 Longformer 表现最佳。它是一种 transformer 模型,设计上可一次处理比许多传统语言模型更长的文档。
这项已发表研究报告的受试者工作特征曲线下面积为 0.95。该指标反映模型在不同阈值下区分良好与较差体能状态的排序能力。
其精确率-召回率曲线下面积为 0.73。这一区别很重要,因为当较差体能状态类别相对少见时,较高的受试者工作特征得分可能看似令人安心。精确率-召回率表现则为研究人员提供了观察假阳性和漏检病例的另一视角。
这一方法结合了 ECOG 状态提取与插补。提取是指找到已以可识别形式写入的数值;插补则是在无法找到明确评分时估计其数值。
第二项功能解决的是更具影响力的缺口。仅能捕捉可见评分的文本流程,可以改善数据库整理;而能在没有正式评分的病历中识别功能状态信号的模型,则能扩大可用于研究的队列。
因此,Longformer ECOG 模型改变了研究人员能够从既有电子健康记录中恢复的信息范围。它并未改变临床医生最初记录的内容。这一界限将决定如何负责任地使用其输出。
为何缺失的 ECOG 状态会扭曲真实世界肿瘤学证据
缺失的体能状态可能改变哪些患者进入分析、治疗组如何比较,以及研究人员对结果得出何种结论。
真实世界证据研究使用的是常规医疗过程中收集的信息。数据来源可包括电子健康记录、保险理赔、登记系统、实验室系统和药房数据。
这些来源覆盖的人群比许多临床试验更广泛。然而,这些信息通常是为支持医疗或计费而记录,并非服务于预先设定的研究方案。重要变量可能不一致、过时或缺失。
ECOG PS 是一个尤为棘手的案例。它既有重要影响,也具有一定主观性。它可能影响患者是否接受强化治疗、进入试验或获得支持性治疗,同时也与生存期相关。
假设研究人员利用电子记录比较两种癌症疗法。如果一组中功能状态较差的患者更多,即使治疗效果相近,该组的结局也可能显得更差。若 ECOG PS 的缺失分布不均,传统调整方法可能无法纠正这种差异。
剔除所有存在缺失值的记录又会带来另一问题。完整病例分析假定被保留的患者足以代表被排除的患者。但当记录行为本身反映临床流程、疾病严重程度或医疗可及性时,这一假定往往并不成立。
缺失本身也可能携带信息。临床医生在讨论治疗资格或管理晚期疾病时,可能更一致地记录 ECOG PS;而另一家诊所则可能在每次就诊时都通过结构化模板保存该评分。
这意味着,空白字段并不必然代表患者健康、病情严重,或不存在临床判断。它可能仅仅反映不同的记录实践。
这一问题也具有监管重要性。美国食品药品监督管理局的真实世界数据指南要求申办方评估电子健康记录和理赔数据对于拟议研究是否相关且可靠。缺失情况、数据来源和验证都会直接影响这一评估。
ECOG PS 还可能决定真实世界患者是否与药物获批所依据临床试验中的参与者相似。许多试验仅招募体能状态相对良好的人群,而常规医疗人群通常包括功能受限程度更高的患者。
如果缺少体能状态,研究人员便无法可靠地描述这种差异。他们可能会高估试验结果对研究环境外接受治疗患者的可迁移性。
早期研究尝试利用结构化信息解决这一问题。一项 2018 年模型使用了跨 10 个肿瘤组别的、与电子记录关联的医疗理赔数据,分析了 8,442 名患者,在识别较差体能状态方面取得了 0.821 的 c 统计量。
另一项电子健康记录代理指标研究考察了晚期非小细胞肺癌、膀胱癌和黑色素瘤。其模型结合了临床、社会人口学和实验室特征。在三个癌症组别中,报告的分类准确率介于 73.3% 至 85.4%。
当病历文本无法获取时,这些方法仍然有用。理赔数据可覆盖多个医疗机构的诊疗,实验室数值则可提供客观的临床信号。但这两条路径都可能遗漏肿瘤科医生叙述中包含的功能细节。
如今,AI 肿瘤学数据系统面临压力:必须整合这些来源,同时不能将任何单一估计视为事实标准。文本、理赔、实验室数据和结构化字段各自捕捉患者状况的不同部分。
这一机遇不止于获得一张更整洁的电子表格。更完善的体能状态信息可改善队列选择、混杂因素调整、试验模拟和卫生服务研究。风险在于,看似精确的模型输出可能掩盖不确定性,而非消除它。
Longformer ECOG 模型如何在未发现评分时推断状态
该模型学习与功能受限相关的模式,但无法确定无疑地重建临床医生缺失的判断。
这项研究的核心机制始于弱监督。研究人员将正则表达式检测到的评分作为训练标签,因此无需人工审阅近 50 万份病历,便可构建大型标注语料库。
模型接收的是移除可识别体能状态表述后的周边病历文本。随后,它学习哪些短语、临床描述和文档模式通常与良好或较差状态相伴出现。
一份描述正常工作、独立行走且症状轻微的病历,很可能产生与描述需要大量协助或长期卧床的病历不同的信号。该模型可整合长文档中的线索,而非依赖单一关键词。
Longformer 适合这一任务,因为临床病历可能超过较短上下文 transformer 模型所能接受的输入长度。其注意力设计能够处理更长的序列,同时降低与对每个 token 执行全注意力相关的部分计算负担。
然而,更长的上下文并不自动意味着临床理解。模型可能学习到与病历模板、医生用语、科室实践、诊断构成和记录习惯相关的关联。
其中部分关联确实反映功能状态,另一些则可能是局部捷径。某个特定短语在某家机构中可能强烈预测较差 ECOG PS,只因模板会在某些就诊期间插入该短语。
这正是该研究评估内容不止于分类表现的原因。研究人员还测试了插补评分是否与总生存期这一客观且具有临床相关性的结局相关。
在未被正则表达式检测到评分的病历中,插补出的较差状态与较差生存期相关。报告的死亡风险比为 11.9,95% 置信区间为 11.1 至 12.8。
风险比表示各组随时间推移的相对事件发生率。它并不意味着每位被归类为较差状态的人都会面临相同结局,也不能证明插补评分导致了生存差异。
研究人员进行了更严格的分析,排除了包含可能间接透露体能状态术语的病历,包括“ECOG”、“performance”、“self-care”、“work”和“ambulatory”。插补输出与生存期之间的关系依然存在。
该测试减少了一项担忧:该模型并非只依赖明显的同义词或被忽略的评分表述。它似乎捕捉到了临床叙述中更广泛的模式。
对于1,301名确诊后30天内有病历记录的远处转移患者,模型的连续输出在生存预测中取得了0.73的一致性指数。该指数衡量的是,较高的预测风险是否通常对应更早发生的事件。
团队还考察了770名开始接受姑息性系统治疗的转移性肺癌、结直肠癌、乳腺癌或前列腺癌患者。在按年龄和癌种调整后,治疗开始时附近推算出的评分仍与死亡率相关。
这些分析赋予了模型输出表面效度。旨在近似反映功能状态的模型应当与生存情况相关,因为体能状态本身就具有预后价值。
但与生存相关并不等同于标签准确。模型可能识别出能预测死亡率的疾病严重程度、晚期疾病或临终语言,却未必能精确复现ECOG PS。
这一区别决定了它究竟是有用的研究变量,还是忠实的临床测量。Longformer ECOG模型可能捕捉到具有意义的潜在健康信号。研究人员仍需明确,该信号在不同机构和人群中究竟代表什么。
较新的研究也在测试通过直接提示大型语言模型来提取ECOG状态。一项2026年的提示方法比较评估了基于规则的处理、简单提示、思维链提示以及双重过滤方法在多种癌种中的表现。
这条研究路径提供了更灵活的指令,以及可能更易部署的方案。同时,它也带来了人们熟悉的担忧:输出一致性、模型更新、隐私和缺乏依据的回答。
Longformer系统走的是一条更窄的路径。它针对特定分类任务进行训练,并生成受约束的输出。与开放式生成工作流相比,这种有限范围可能让验证更加清晰。
这种对比并不只是旧式NLP与新式生成式AI之间的差别,而是专门化预测与灵活解释之间的差别。肿瘤数据团队在选择任何一种路径之前,都需要获得关于可移植性、校准、错误模式和运营成本的证据。
预测评分既可能填补空白,也同样可能延续偏差
该模型最强的结果仍受限于单一系统数据、继承的标签、主观评分,以及尚未解决的部署阈值问题。
训练标签来自临床医生记录的ECOG PS。这带来了规模优势,但也意味着模型从可能因观察者而异的人类判断中学习。
一项经典研究让三名肿瘤科医生评估100名患者,结果发现各个ECOG类别之间的总体一致性仅为中等。其总体kappa值为0.44,不过当评分被归入更宽泛的范围时,一致性有所提高。
另一项研究使用12个临床情境和72名肿瘤临床医生,发现其与指定参考评分的一致率介于19.4%至56.9%之间。情境中包含的社会特征也影响了部分评分。
一项涵盖16项研究和6,619名患者的系统综述发现,临床医生与患者评分之间的一致性处于较低至中等水平。其ECOG评估的合并相关系数为0.584。
这些结果并不意味着ECOG PS没有价值。该量表仍深度嵌入肿瘤诊疗和研究之中。它们表明,记录在案的评分是一项临床评估,而非观察者差异可以忽略不计的实验室测量。
基于这些评估训练的模型可能会复现其中的不一致性。它也可能让这些问题更难被审查,因为其输出以计算得出的概率形式呈现。
偏差可能在模型训练开始前就通过文档记录进入系统。病历更长、就诊更频繁或接受特定类型照护的患者,会向模型提供不同的证据。语言也可能因临床医生、人口群体、机构和肿瘤服务体系而异。
关于大型语言模型的研究已经凸显了这种风险。一项研究训练了按种族划分的语言模型,以根据临床评估赋予体能状态。大多数模型在应用于训练数据所代表种族群体之外的人群时,呈现出不同的分类模式。
这一发现来自另一种场景,并不能证明Longformer研究存在偏差。但它指出了一项必要的评估。在广泛使用前,应按人口群体、癌种、地点和文档记录环境报告模型表现。
因此,外部验证是当前最大的缺失环节。在单一机构数据环境中训练和测试的系统可能表现良好,因为训练和测试病历共享许多结构性特征。
按患者划分训练集和测试集可以防止模型记忆同一患者的记录。但这并不能检验模型是否适用于采用不同模板、缩略语和照护模式的社区肿瘤网络。
时间验证同样重要。源病历覆盖1997年至2023年,而生存分析受限于可获得的死亡数据更新。肿瘤学语言、治疗方式、电子病历系统和文档要求在此期间均发生了变化。
模型的总体准确性可以保持稳定,但校准可能随时间漂移。校准衡量预测概率是否与实际观察到的频率相对应。当评分决定分析中的纳入、加权或调整时,校准至关重要。
报告的受试者工作特征曲线下面积并不能回答这一问题。它衡量的是跨阈值的排序能力。选择单一操作阈值的研究人员仍需在假阳性与假阴性之间权衡。
这种权衡取决于使用场景。将良好状态误分为较差状态,可能导致符合条件的患者被排除在比较效果队列之外。将较差状态误分为良好状态,则可能留下大量残余混杂。
0.73的精确率-召回率曲线下面积同样意味着仍存在具有实际意义的误差。这并不否定结果,而是警示人们不要将每个推断标签都视为观察到的事实。
生存分析也需要同样谨慎。11.9的风险比表明预测组之间存在显著分离。它并不能验证每份病历的确切ECOG类别。
临床文本包含许多死亡风险的直接指标。模型可能利用临终关怀讨论、疾病进展、症状、停止治疗或照护强度等信息。这些信号与功能状态重叠,但并不等同。
下游研究人员应在其数据模型中保留这一差别。观察到的临床医生评分、基于规则提取的评分和AI推算的评分应置于独立字段中,并具有明确的来源信息。
每个推算值都应附带置信度评分和模型版本。研究人员还应预先规定如何处理不确定病例:排除、复核、加权或单独分析。
敏感性分析应比较仅使用观察评分、使用观察评分加推算评分,以及采用其他缺失数据方法时的结果。如果治疗效果发生实质性变化,模型就已成为因果假设的一部分,而不再是中性的清洗步骤。
这一原则与更广泛的肿瘤数据质量实践一致。结合结构化和非结构化来源可提高完整性,但每一次转换都需要可追溯的定义和质量控制。
近期最安全的角色是可供人工审计的研究支持。该模型可以标记病历、优先安排人工抽取、丰富回顾性队列,并支持敏感性分析。它不应悄无声息地填充临床记录,仿佛评分由肿瘤科医生录入。
在AI推算的ECOG状态成为可信证据之前,必须发生什么
三项信号将决定AI推算的体能状态会成为可靠的基础设施,还是停留在令人印象深刻的单一系统结果。
第一项信号是独立、多中心验证。研究人员应首先在不进行本地再训练的情况下,测试现有模型在学术中心、社区诊所以及不同电子病历平台上的表现。
该评估应报告按肿瘤类型划分的区分度、校准度、精确率、召回率和错误率。在数据允许的情况下,还应衡量其在年龄、性别、种族、语言、残障和社会经济群体中的表现。
若模型在原始机构之外表现显著下降,将削弱其作为可移植模型的依据。若结果稳定,则会强化这样一种观点:临床语言包含可复用的功能状态信号。
本地再训练应在可迁移性测试之后进行。否则,每个组织都可能构建出成功的内部模型,却无法证明其底层方法具有普适性。
第二项信号是与独立复核的临床状态达成一致,而不仅仅是与历史文档一致。多中心研究应要求经过培训的临床医生依据一致的流程评估抽样病历。
这些裁定标签将提供比常规评分更受控的参考标准。研究人员随后可以检视模型出现分歧的原因:是模型错误、原始临床医生评分不一致,还是病历缺乏足够证据。
这类复核应纳入接近ECOG 1与2这一临床重要边界的病例。这一分界常常影响试验资格和治疗强度,但已发表的模型将0至1与2至4归为两组。
二元分类提高了统计稳定性,但也掩盖了相邻类别之间的错误。未来验证应确定更宽泛还是更细粒度的输出最能服务于各类研究任务。
第三项信号是在真实世界证据研究中实现透明使用。研究人员应将模型来源、验证结果、缺失模式、阈值和敏感性分析与临床发现一同发表。
如果一项研究悄然用模型输出替代缺失的ECOG PS,读者便无从判断其假设。透明的分析可以展示,当移除或以不同方式处理推算值时,结论会如何变化。
监管用途会进一步提高标准。申办方需要将模型表现与审查中的特定人群、数据来源和问题相联系。一个在某一癌症队列中准确的分类器,并不会自动成为另一项适应症的可靠证据。
该领域还应比较专门化模型与较新的生成式方法。通用语言模型可在一个工作流中提取多个资格变量。专门化系统则可提供更严格的控制、稳定的输出和更聚焦的验证。
任何一种架构都无法独自解决文档记录不佳的问题。当患者接受评估时,更好的临床工作流仍是捕捉体能状态最清晰的方式。
自动化之所以有价值,是因为历史记录无法重写,而完美的结构化文档记录仍不太可能实现。目标不是让不确定性消失,而是更好地识别、量化和管理这种不确定性。
对于研究团队而言,实际的下一步是将Longformer ECOG模型视为一种具有可测量误差的标注方法。保留原始病历,记录每个值的生成方式,并将预测与观察结果区分开来。
处理大量论文、临床定义和模型文档的团队,同样需要可追溯的证据管理。可检索的AI知识库可以帮助分析人员将模型版本、验证发现和研究假设关联起来。
Longformer ECOG 模型为现实世界肿瘤学中一个长期存在的数据缺口提供了可信的解决方案。更大的考验在于,独立团队能否复现这一结果,而不将有用的估计误作临床事实。在依赖 AI 推断的状态之前,研究人员应直接问一个问题:每一项预测值是否都能被追溯、质疑并移除,且不会导致研究结论崩塌?



