Stanford 皮肤癌 AI 偏见揭示算法遗漏了谁
Stanford 关于皮肤癌 AI 偏见的研究,揭示了多年亮眼准确率主张之下的严重矛盾。算法在经过筛选的测试中能够很好地识别恶性病变,但当患者拥有较深肤色或患有罕见疾病时,其表现便会下降。
这种差距挑战了自动化皮肤筛查最诱人的承诺。AI 本应扩大专科知识的可及性,尤其是在皮肤科医生稀缺的地区。然而,最可能从中受益的人群,反而可能获得最不可靠的预测。
较新的系统正尝试通过更好的数据集、结构化图像分析和关注公平性的训练来弥合这一差距。不过,近期证据仍将实验室表现与安全的临床应用区分开来。这场较量已不再是 AI 对阵皮肤科医生,而是宣传中的准确率对真正使用这项技术的患者群体之间可靠表现的较量。
皮肤癌 AI 偏见在准确率热潮中依然存在
AI 在研究人员证明它能在各种肤色上同样有效之前,就已更擅长分类常见皮肤病变。
现代皮肤科 AI 的兴起可追溯至基于大量带标签病变照片训练的图像分类器。这些系统学习将像素与诊断结果关联的统计模式。在受控比较中,部分系统取得了接近资深皮肤科医生的结果。
这一成果意义重大,因为皮肤评估首先是一项视觉任务。患者或临床医生注意到可疑斑点后,会评估其形状、颜色、边缘以及随时间的变化。能够识别危险模式的模型,可以帮助确定转诊优先级,或为缺乏专科训练的临床医生提供支持。
然而,算法的总体评分可能掩盖测试数据中包含了哪些人。许多有影响力的图像集,来自浅色皮肤患者的样本远多于深色皮肤患者。还有一些数据集侧重于常见疾病和拍摄规整的病变。
因此,模型接受的最充分训练来自最常出现的病例。较高的总体准确率可以与某一较小人口群体中的低表现并存。当研究人员只报告整个测试集的一个评分时,这种局限很容易被忽视。
由 Stanford 牵头的团队通过创建 Diverse Dermatology Images 数据集,即 DDI,使这一问题更加清晰。该数据集包含 656 张经病理学确认的病变照片,病理学确认即对活检组织进行实验室检查。
该数据集包括 208 张来自 Fitzpatrick 皮肤类型 I 和 II 人群的图像、241 张来自 III 和 IV 型人群的图像,以及 207 张来自 V 和 VI 型人群的图像。Fitzpatrick 类型描述皮肤对紫外线照射的反应,尽管研究人员越来越认识到,该量表只是肤色的不完美替代指标。
团队在这一刻意构建的多样化基准上测试了既有系统。其临床图像研究发现,这些系统在深色肤色和罕见疾病上存在显著局限。为 AI 数据集提供标签的皮肤科医生,在这些更具挑战性的病例上表现也较差。
这一发现并不意味着每个模型都会在每一位深色皮肤患者身上失效。它表明,平均表现并非完整的安全性主张。一个模型可以在熟悉的基准上看似能力出色,却在患者群体变化后失去可靠性。
研究人员还发现了一条切实可行的改进路径。利用多样化、经病理确认的图像对模型进行微调,缩小了浅色与深色皮肤群体之间的性能差距。更具代表性的样本改变了输出,因为训练数据决定了模型学习哪些模式。
这正是皮肤癌 AI 故事的核心反转。这项技术在图像识别上的进步是真实的,但支撑许多进步的证据范围狭窄同样是真实的。一个系统可以在某个基准上表现卓越,却不一定能对所有人都可靠。
最需要更广泛可及性的人群,面对的证据却最薄弱
当 AI 被视为稀缺专科资源的替代方案时,公平性差距的影响最为重大。
研究人员估计,约有 30 亿人无法获得充分的皮肤科医疗服务。地理因素、成本、临床医生短缺和转诊延迟,都造成了这一缺口。
自动化筛查看似适合应对这一问题。基层医疗临床医生可以拍摄病变照片并获得风险评估。远程医疗服务可以优先处理可疑病例。面向患者的应用程序可以在斑点看起来可疑时建议接受专业评估。
这些场景也使模型走出其开发环境。光照条件各异,智能手机相机对颜色的处理方式不同,患者拍摄病变时的取景也不一致。疾病患病率在专科门诊、基层医疗和社区筛查之间也会变化。
肤色只是这种变化的一部分,疾病构成同样重要。一个主要训练用于区分常见良性痣和黑色素瘤的模型,在面对炎症性疾病、感染或罕见肿瘤时可能会遇到困难。
一篇发表于 2026 年 9 月的预印本,通过比较肤色代表性与疾病分布变化来考察这一区别。研究人员评估了一个经癌症训练的系统、两个皮肤科基础模型,以及一个通用视觉模型。
其泛化分析认为,肤色和疾病患病率往往相互混杂。在服务不足人群中部署的模型,可能同时遇到更深的肤色和不同的疾病组合。
这意味着,仅在原本狭窄的癌症数据集中加入多样化肤色,并不能解决所有部署问题。模型还必须识别其目标应用场景中存在的疾病。否则,公平性干预可能改善一个基准上的表现,却无法解决更广泛的泛化失败。
深色皮肤患者本就面临既有的诊断差异。一些皮肤癌在这些人群中较少见,但较低的发生率并不代表没有风险。当危险病变被忽视时,延迟识别可能导致更差的结果。
病变在不同背景色素上也可能呈现不同外观。发红、炎症和颜色变化在深色皮肤上可能不那么明显。主要在浅色皮肤上训练的模型,可能学到无法稳定迁移的对比特征。
图像采集方式又增加了一层复杂性。皮肤镜图像使用带有受控照明的放大仪器,而普通临床照片包含更多背景变化。一个在某种格式上训练的系统,不能自动被信任用于另一种格式。
因此,压力落在医院、应用开发商、设备制造商和监管机构身上。他们必须明确模型在哪些情况下有效、评估了哪些患者,以及当置信度较低时会发生什么。
单一的敏感性指标无法回答这些问题。采购方需要按肤色、疾病、成像设备、医疗场景和相关人口统计因素细分的表现数据。他们还需要不确定性估计和失效处置程序。
没有这些证据,更广泛的可及性可能以新形式复制不平等的可及性。更多人或许能够接触到算法,但并非每个人都能获得同样可靠的评估。
更好的训练数据有所帮助,但代表性不是勾选框
最直接的补救措施是使用更具代表性的临床数据,尽管高质量采集数据远比把图像加入文件夹困难。
DDI 的结果提供了令人鼓舞的信号。研究人员使用多样化、经病理确认的病例对模型进行微调后,模型表现有所改善。这表明观察到的差距并非计算机视觉不可避免的属性。
病理学确认非常重要,因为仅凭外观无法提供明确的癌症诊断。活检比在线图片说明或视觉共识提供了更可靠的参考标签。
质量较差的标签会训练模型复现人类的不确定性。在 Stanford 研究讨论的一项审查中,专家复核了公共图谱中的一部分图像。只有 69% 的图像看起来符合所分配疾病的诊断特征。
当标签不可靠时,规模更大的数据集未必就是更好的数据集。重复图像、不一致的诊断、临床标记和不均衡的图像质量,都可能产生误导性信号。
设想一张图像中,临床医生在可疑病变周围画了一个圆圈。分类器可能将该标记与癌症关联,而不是学习病变的生物学特征。当测试中出现类似标记时,它可能获得高分,却在没有标记的照片上失效。
代表性数据必须覆盖的不只是肤色。它还应包含解剖部位、患者年龄、相机类型、临床环境、疾病阶段,以及与癌症相似的良性疾病。每个变量都可能影响表现。
研究人员还需要一种站得住脚的方法来描述肤色。Fitzpatrick 量表是围绕日晒反应而非计算机视觉公平性开发的。根据照片或病历追溯性地进行分类可能引入分歧。
一项 2025 年前瞻性研究比较了皮肤科数据集的标注方法。研究发现,Monk Skin Tone 量表在捕捉 AI 黑色素瘤评分差异方面,比 Fitzpatrick 分类更有效。该肤色评估强化了一个基本教训:用于审查偏见的测量方法,会影响研究人员观察到的偏见。
数据来源还会引发更多问题。来自单一学术中心的图像,可能反映当地的转诊模式和摄影实践。它们能够提升多样性,却仍可能在地理分布上过于狭窄。
多中心采集能提供更好的覆盖范围,却让标准化更加困难。相机、活检阈值、记录系统和标注实践各不相同。隐私要求也可能限制临床图像的共享方式。
合成图像已成为另一种被提出的解决方案。生成模型可以改变色素沉着,或创建新的病变示例,从而提供一种更快地平衡数据集的方法。
不过,合成多样性并不等同于临床多样性。生成器从现有图像中学习,可能保留其中隐藏的偏见。它还可能生成医学上不合理的组合,或让病变看起来像是被贴到不同背景上。
合成示例可以支持数据增强,即在训练期间加入受控的变体。它们不应取代系统实际运行人群中的真实、经确认的病例。
最强的数据策略结合了具有代表性的招募、具有临床意义的标签、在适当情况下进行的病理确认,以及外部测试。它将多样性视为研究设计的一部分,而不是最后的审查步骤。
这种方法比抓取公开图像成本更高、推进更慢,但它也能产出医院和患者都能理解的证据。
新模型正学习观察结构,而不只是颜色
一种颇具前景的技术应对方式,是在保留临床医生所需视觉线索的同时,降低模型对颜色的依赖。
皮肤病变的边缘、不对称性、纹理和内部模式中都包含结构信息。颜色仍具有临床相关性,但过度依赖色彩对比的算法,可能会对背景肤色产生敏感性。
2026 年 7 月的一项研究提出了一套由草图引导的系统,旨在平衡这些信号。该方法将普通红、绿、蓝图像与自动生成的结构草图结合起来。
独立的编码器分别处理彩色图像及其草图。随后,门控融合组件决定从每种表征中提取多少信息。特征蒸馏促使彩色路径与结构模式对齐,同时不丢弃有用的颜色线索。
研究人员使用 Fitzpatrick17k 和 DDI 对该方法进行了评估。他们还在不同图像来源之间进行了测试,以衡量其在主要训练分布之外的表现。
他们的公平性感知模型在保持具有竞争力的准确率和 F1 分数的同时,显示出低于基线方法的测量差异。DDI 结果也显示,不同肤色组之间的表现波动更小。
一项实验有助于解释其机制。分类器仅根据彩色图像预测 Fitzpatrick 类型时,准确率为 42.7%。使用草图时,准确率降至 32.3%,这表明结构表征去除了一部分肤色信息。
组合表征下的准确率仍为 39.2%。该模型减少了对肤色的编码,但并未完全消除它。
这种平衡十分重要。去除所有与肤色相关的信号未必安全,因为色素沉着可能携带具有医学意义的信息。目标是防止无关依赖,而不是让系统对患者特征视而不见。
该技术也无需为每张训练图像提供肤色标签。当数据集包含诊断结果和照片、却缺乏一致的人口统计学标注时,这一点尤其有帮助。
不过,作者谨慎地描述了研究发现。草图生成器使用自然图像而非皮肤病学图像训练。它生成的抽象结果可能会因皮损或拍摄条件而异。
该研究使用了公开的去标识化数据集,未开展新的前瞻性临床试验。基准测试中的较低差异并不能证明该系统能够改善患者结局。
其他方法则从不同方向解决同一问题。开发者可以重新加权代表不足的病例,针对经过验证的人群调整决策阈值,学习域不变特征,或在微调期间加入更多样化的示例。
基础模型提供了另一条路径。这些系统从大型数据集中学习通用图像表征,再适配至临床任务。更广泛的预训练可能有所帮助,但规模本身并不能保证医学表征的充分性。
一个庞大的通用图像集合中,经过病理确认的深色皮肤病变可能仍然很少。它也可能编码与疾病无关的社会或摄影相关性。
因此,有意义的比较并非旧架构与新架构之争,而是以总体准确率为导向的开发与围绕亚组可靠性展开的开发之间的差异。
后者要求工程师在部署前定义失败情形。他们必须决定哪些亚组差距不可接受、不确定性应如何触发人工复核,以及当成像条件变化时性能是否仍能保持稳定。
真实临床环境暴露出基准测试忽略的风险
较高的癌症检出率并不意味着 AI 系统就是准确的诊断工具,或能够安全替代人工复核。
一项 2026 年前瞻性观察研究追踪了一套皮肤癌算法在英格兰西北部一家三级皮肤科部门最初三个月的表现。评估纳入了该系统判读的所有皮损。
该算法的敏感性达到 95.3%,即它正确标记出的癌症比例。作为比较,皮肤科医生的敏感性为 88.5%。
在其他指标公布前,这一结果看似具有决定性。该系统的阳性预测值为 46.5%,而皮肤科医生为 62.1%。阳性预测值描述阳性结果实际正确的频率。
AI 对具体诊断的准确率为 28.6%,皮肤科医生则为 61.6%。该算法正确识别肿瘤或皮损类型的比例为 51.4%,而皮肤科医生为 75.5%。
最令人担忧的是,系统判定为良性的皮损中出现了 4 例癌症。按照此次评估的流程,这些患者将会在没有人工复核的情况下被出院。
这项真实世界评估得出结论:取消人工验证还为时过早。研究还警告了自动化偏见,即人们过于轻易接受机器建议的倾向。
敏感性仍然很有价值。筛查工具应尽量少漏诊癌症。然而,假阳性可能造成不必要的转诊、活检、焦虑和临床工作负担。
假阴性则带来另一种风险。令人安心的输出可能延误评估,尤其是在患者认为软件给出的是诊断,而非初步风险评估时。
这一差异应当塑造产品措辞。“检测皮肤癌”暗示诊断确定性;“支持可疑皮损分诊”则描述了一项更有限的任务,且人工决策仍然参与其中。
部署条件决定这种支持是否有帮助。专科医生可能立即识别出不合理的结果;使用手机应用的患者则可能不知道何时图像质量不足,或模型已超出其经验证的适用范围。
临床背景还包括照片中缺失的信息。皮肤科医生会考虑皮损病史、症状、解剖位置、家族史、用药情况、免疫状态以及随时间发生的变化。
模型可以纳入其中一些变量,但每项额外输入都必须被准确采集。缺失或错误的背景信息可能改变预测结果。
性能也可能在上线后发生漂移。手机摄像头会变化,图像压缩系统会演进,不同地区的患者群体也有所不同。一项固定的验证研究无法保证行为会无限期保持稳定。
监管授权提供了必要的检查点,但并不代表对所有用途的普遍认可。FDA 表示,所列 AI 赋能设备已针对其预期用途满足适用的上市前要求。其医疗器械列表也指出,该资源并不全面。
“预期用途”是关键表述。针对临床医生决策支持的证据,并不能自动证明其适用于直接面向消费者的诊断。来自皮肤镜检查的证据,也不能自动迁移至普通手机摄像头。
考虑采用这些系统的医院应要求提供亚组结果和本地验证。他们还应在部署后监测漏诊癌症、转诊量、人工推翻系统建议的行为及结局。
开发者需要披露弃判规则,即模型拒绝对病例进行分类的情形。面对陌生数据时,安全地拒绝回答可能比自信地给出答案更有用。
无论应用程序给出何种结果,患者都应将任何令人担忧或发生变化的皮损视为寻求专业医疗帮助的理由。AI 输出不应替代活检或临床评估。
三项信号将表明差距是否正在缩小
进展应通过前瞻性证据、透明的亚组报告,以及让人类保持问责的工作流程来衡量。
第一项信号是前瞻性、多中心验证,其中应包含足够多的深色皮肤参与者,以支撑有意义的结论。当某个亚组中的癌症病例过少、无法获得稳定估计时,研究便无法证明公平性。
研究人员应针对每个相关群体公布敏感性、特异性、预测值和校准度。校准度衡量预测风险是否与实际疾病发生频率相符。
这些结果不应仅覆盖 Fitzpatrick 分类。在样本量允许的情况下,评估还需要涵盖疾病类型、成像方法、年龄、性别、解剖部位和医疗场景。
如果前瞻性研究在这些群体中保持强劲表现,临床采用的依据将更充分。若差距在经过筛选的数据集之外再次出现,近期基准测试的改进将显得不那么可迁移。
第二项信号是产品与监管透明度。开发者应说明预期用户、支持的摄像头、排除的情况、训练人群、验证人群以及人工复核要求。
一个总体准确率数字绝不能替代这些信息。医院需要足够细节,才能判断其患者是否与接受评估的人群相似。
公开摘要还应说明模型更新。训练数据、架构或决策阈值的变化都可能改变亚组表现。每次重大更新都需要与其临床影响相称的验证。
清晰的标签将削弱夸大的宣传,同时增强可信系统的说服力。它能帮助购买者区分获授权的临床工具和使用相似营销语言的通用健康应用。
第三项信号来自真实工作流程中的证据。研究人员应追踪临床医生收到 AI 结果后采取了什么行动,而不仅是预测是否与病理结果一致。
一个系统可能提高敏感性,却产生如此多的误报,以至于诊所不堪重负。它可能在技术上表现良好,却导致临床医生忽视自身判断。它可能加快某一群体的转诊速度,却延误另一群体。
有用的运营指标包括皮肤科医生复核所需时间、活检阳性率、漏诊癌症率、人工推翻频率,以及摄像头或软件变更后的表现。这些指标将算法准确性与患者护理联系起来。
人工监督也必须具有实质性。只看到模型结论的临床医生可能会受到其影响而形成锚定偏见。在揭示 AI 结果前保留独立评估的工作流程,或许能降低这一风险。
因此,皮肤癌 AI 偏见正成为整个医疗 AI 领域的一项考验。该领域已经认识到,亮眼的平均表现可能掩盖不均衡的性能。如今,它还在认识到,静态数据集上的公平性改善仍需在临床环境中验证。
令人鼓舞的是,这一差距会对有意识的工程设计作出响应。多样化、经病理确认的数据改善了早期模型;结构表征在较新的实验中降低了测量差异。这两种结果都不支持技术宿命论。
但它们同样不支持过早的信任。为提升可及性而设计的算法,不应将不确定性转嫁给本就较少获得专科照护的患者。
下一阶段需要提出一个比“AI 能否在特定图像上匹配皮肤科医生”更严格的问题。研究人员和采购方应当问:它能否在不同肤色、疾病、摄像头和临床环境中始终保持可靠?
这是开发者在自动化筛查兑现其承诺前必须达到的标准。在此之前,应将 AI 评估视为决策支持,要求提供亚组证据,并为可疑皮损寻求专业评估。这项技术在发现癌症方面正不断进步,但它最重要的考验是:这种进步能否惠及每一位患者。



