人脸视频 AI 可筛查高血压和糖尿病,但不能用于诊断
- Martin Chen

- 2小时前
- 讀畢需時 14 分鐘
Google News 推送了一项引人注目的医疗 AI 主张:仅凭一段五秒钟的人脸视频,就能以 90.3% 的准确率识别高血压,并以 81.2% 的准确率识别糖尿病。东京大学和东京科学大学的研究人员于 2026 年 8 月 29 日在欧洲心脏病学会大会上公布了最新结果。
这一前景不难理解。人们看向摄像头,算法便会分析皮肤血流中几乎难以察觉的变化,进而提示可能存在慢性疾病。这一过程中无需血压袖带,也无需采血。
更棘手的问题是,受控的研究系统能否在实验室之外成为可靠的筛查工具。这项研究仅涉及单一中心的 215 名参与者,并使用了专用光谱摄像机。其血压估算结果也未达到医疗设备的一项关键误差波动基准。
这一矛盾比标题中的准确率数字更重要。该研究强化了无接触健康筛查的潜力,但并不意味着普通人脸视频能够作出诊断。它也让基于摄像头的系统与传统临床测量方法形成直接对照:后者虽然不那么便捷,却经过了更充分的验证。
人脸视频研究实际发现了什么
这项研究所报告的进展是一种快速风险筛查方法,而非血压袖带或实验室检测的替代品。
这项前瞻性研究在日本一家中心招募了 215 名已确诊患者和健康志愿者。研究人员使用高速光谱摄像机记录每位参与者的人脸和手掌短视频。高血压和糖尿病的参考结果则来自传统临床评估。
光谱摄像机可记录多个波长的光线,使软件能够分析标准图像可能无法保留的颜色信息。该系统捕捉了与血液在皮肤中流动相关的细微变化。此前有关该项目的报道指出,该摄像机的拍摄速度为每秒 150 帧。
随后,机器学习算法分析了三类主要信号,包括脉搏波动态、皮肤血流模式,以及肤色的光谱特征。脉搏波动态描述压力波如何沿动脉传播,并可携带与动脉硬化程度相关的信息。
最新的人脸视频结果分别给出了不同录制时长和疾病条件下的数据。30 秒录制可通过 95.0% 的准确率识别高血压。其高血压敏感性为 89.2%,而对正常血压的敏感性为 100.0%。
将录制时长缩短至五秒后,高血压识别准确率降至 90.3%。对于糖尿病,该算法在 30 秒视频中的准确率达到 88.2%,在五秒视频中则为 81.2%。
仅凭准确率无法说明一项检测在不同人群或不同疾病患病率下的表现。它还可能将正确的阳性和阴性结果合并为一个看似亮眼的数字。评估筛查系统时,敏感性、特异性、预测值和各亚组表现都至关重要。
该研究还测试了人脸视频能否在不使用袖带的情况下估算收缩压。收缩压是血压读数中的上方数值,代表心脏收缩时的动脉压力。
平均绝对百分比误差为 8.6%。平均误差为负 2.6 mmHg,这意味着估算值平均略低于参考测量值。
不过,误差的标准差为 12.0 mmHg,高于研究公告中讨论的 8.0 mmHg 标准。因此,较小的平均误差仍可能与单次测量中相当大的误差并存。
该技术的糖尿病结果也比“检测糖尿病”这一说法所暗示的范围更有限。算法对与患有 1 型或 2 型糖尿病参与者相关的模式进行了分类。它并未直接测量葡萄糖、糖化血红蛋白,或区分糖尿病类型的生物学过程。
这一差异应当指导人们对 Google News 标题的所有解读。该系统在一个小型临床数据集上识别了与疾病相关的信号。它并未证明消费级摄像头可以独立诊断任一疾病。
为什么 Google News 的关注对无接触筛查很重要
这项研究针对的是巨大的筛查缺口,这也解释了为何一个小型临床项目能够吸引全球关注。
高血压往往不会产生明显症状。根据高血压数据,2024 年,30 至 79 岁成年人中有 14 亿人患有该病。约 6 亿人不知道自己患病,且仅有 23% 的患者血压得到控制。
糖尿病也带来了另一项重大的检出和管理挑战。全球糖尿病估计数据显示,2024 年 20 至 79 岁成年患者人数为 5.89 亿,占所测年龄段成年人的 11.11%。
两种疾病都会增加心血管风险,但常规筛查仍取决于人们能否获得合适的设备和专业护理。血压测量需要合适的袖带、正确的体位和重复读数。糖尿病诊断通常需要血液检测。
基于摄像头的检查改变了这一流程的第一步。筛查可以在药房自助终端、工作场所诊所、远程医疗预约或社区健康活动中进行。可疑结果可引导人们接受标准检测。
研究报告人、东京大学研究人员 Ryoko Uchida 表示,该项目的目标是在日常环境中开展无接触筛查。这一措辞很重要,因为筛查与诊断承担着不同的任务。
筛查优先考虑覆盖范围,并识别应当接受进一步评估的人群。诊断则使用公认的临床标准来确定一个人是否患病。如果后续路径能够避免漏诊和不必要治疗,有用的筛查工具可以容许一定程度的不确定性。
五秒结果增添了实际应用的吸引力。30 秒已经很短,但在光线变化、受试者移动,或有数百人等待的情况下,即使这一时长也可能形成负担。五秒录制更容易融入签到台、移动工作流和公共筛查站。
该技术还避免了直接接触。这一特点可降低共享设备的清洁要求,并帮助不喜欢袖带或针头的人群。它可能提高那些回避常规健康检查者的参与度。
然而,流程摩擦的降低也带来自身风险。由于界面即时且看似客观,人们可能会将轻松获得的摄像头结果视为定论。假阴性可能带来错误的安心感,假阳性则可能导致焦虑或不必要的后续检查。
因此,Google News 的放大效应同时给研究人员、设备制造商、临床医生和监管机构带来压力。研究人员必须在原始中心之外验证信号。设备制造商必须明确所需的硬件。临床医生必须决定如何将结果纳入诊疗,而监管机构则必须确定哪些主张需要接受医疗器械审查。
这种压力也延伸至消费电子公司。智能手机和可穿戴设备制造商多年来一直在日常设备中加入健康测量功能。可靠的人脸扫描将降低对实体传感器的依赖,但也需要谨慎校准以及更严格的医疗主张。
机遇在于扩大可及性。责任则在于防止筛查捷径演变为诊断捷径。
该机制将肤色变化转化为风险信号
该算法并非根据面部外观识别糖尿病或高血压;它分析的是与循环系统相关的光线变化。
这项核心技术属于光电容积描记法这一更广泛领域。传统光电容积描记法利用光线追踪皮肤附近的血容量变化,通常通过接触手指或手腕的传感器实现。
远程光电容积描记法,通常简称为 rPPG,可在无直接接触的情况下从视频中提取相关脉搏信号。每次心跳都会造成微小的血容量变化。这些变化会轻微改变皮肤吸收和反射光线的方式。
摄像头记录的是一连串画面,而非单张照片。软件会识别合适的皮肤区域,并随时间追踪其颜色值。随后,信号处理方法会将与脉搏相关的模式与由移动、光照、压缩和摄像头行为造成的噪声分离开来。
这套日本系统超出了基础消费级摄像头的实现方式。其光谱摄像机可记录波长信息,并采用高速采集。该模型同时分析人脸和手掌,以获得最佳的高血压识别结果。
脉搏波不会在完全相同的时刻抵达每个位置。其时间和形态反映了心血管系统的特性,包括动脉硬化程度。算法将这些空间和时间差异用作与血压相关的特征。
糖尿病检测的路径则更为间接。糖尿病可能影响小血管、循环和组织特性。该模型寻找与已确诊参与者相关的血流和光谱模式组合。
这种关联并非直接的生化测量。血糖检测测量的是葡萄糖浓度,而 HbA1c 检测估算数月内的平均葡萄糖暴露水平。相比之下,人脸视频分类器估算的是所捕捉特征是否类似其训练数据中发现的模式。
这种差异构成了本文的核心矛盾。摄像头筛查提供速度和规模,而标准临床检测与医生用于治疗的指标之间具有更清晰的联系。
该项目自 2024 年首次公开亮相以来已有演进。当时,一份早期研究摘要描述了一台高速摄像机,可对人脸和手掌录制 5 至 30 秒的视频。
该初步报告称,依据分析中采用的美国心脏协会阈值,该系统检测 1 级高血压的准确率为 94%。30 秒配置检测高于正常水平血压的准确率为 86%,而五秒版本达到 81%。
2026 年的报告提供了更详细的高血压结果和新的糖尿病准确率数据。它也揭示了在更广泛使用前必须改善的血压估算误差波动问题。
研究人员表示,未来工作将采用更大规模的多中心数据集,并进行特征优化。他们还希望系统能够使用普通智能手机摄像头,并实现连续测量,包括在睡眠期间。
这些目标涉及不同的工程问题。标准手机摄像头通常比研究硬件捕捉更少的帧数和光谱信息。消费级视频还会面临不可控的光照、摄像头处理、网络压缩和移动等问题。
持续测量会带来更多复杂性。五秒钟的坐姿记录与监测一个正在说话、行走、转身或睡眠的人截然不同。生理信号还会随压力、温度、药物、姿势和近期活动而变化。
这一机制在科学上具有合理性,因为视频可以捕捉与脉搏相关的信息。尚未解决的问题是,经过训练的模型能否将疾病信号与所有会改变皮肤血流的日常因素区分开来。
专用摄像头仍须经受临床现实的检验
最强的实验室结果依赖于普通用户目前尚不具备的硬件和条件。
单中心研究可以证明可行性,但无法证明其在不同医疗系统中的可靠表现。这215名参与者可能无法代表大规模筛查中会遇到的年龄、皮肤特征、用药情况、共病情况和环境。
研究人员尚未在会议公告中公开所有亚组结果。这留下了关于不同肤色、生物学性别、年龄段以及不同糖尿病类型中表现的重要疑问。
皮肤色素和光照会影响反射光,因此光学系统的表现可能不同。化妆、面部毛发、疤痕、出汗和运动也会改变记录到的信号。光谱成像有助于区分不同波长,但消费者普及仍取决于更低成本的硬件。
选择偏倚是另一个值得关注的问题。临床研究中已确诊的患者可能与健康志愿者存在明显差异。真实筛查人群中包括临界病例、未诊断疾病、多种用药情况以及重叠的心血管风险。
如果这些因素在研究组之间存在差异,模型可能会利用非预期的相关性。它可能将药物效应、年龄分布或记录条件与疾病标签联系起来。多中心验证有助于揭示这些相关性能否在其他地方依然成立。
糖尿病类别将1型和2型疾病合并在一起,尽管二者病因不同。1型糖尿病涉及对产生胰岛素细胞的自身免疫性破坏。2型糖尿病主要涉及胰岛素抵抗和进行性代谢功能障碍。
血管信号可能反映两组共有的后果,但无法解释疾病类型。它也可能与其他影响循环的疾病重叠。未来试验中,对这些混杂因素的特异性将十分重要。
血压估计面临尤其严苛的标准。研究中的平均收缩压误差满足所述的平均误差限值,但其12.0 mmHg的标准差超过了引用的8.0 mmHg标准。
AAMI、欧洲高血压学会和ISO联合框架将平均差值不超过5 mmHg、标准差不超过8 mmHg作为主要验证标准。验证框架还强调了标准化样本和比较的重要性。
平均误差与误差离散程度之间的差异至关重要。设想一次估计值高出12 mmHg,另一次低出12 mmHg。它们的平均误差为零,但对这两位用户而言,结果都不令人满意。
这就是为什么一个准确率百分比无法解决这一问题。筛查分类器要回答的是某人是否属于某个风险类别。测量设备则必须在目标人群中产生足够准确、可供临床解读的数值。
监管机构正更加密切地关注无袖带测量。美国食品药品监督管理局已警告消费者,不要依赖声称能够测量或估计血压的未经授权产品。
该机构的设备安全警告指出,不准确的读数可能延误治疗或导致漏诊。该机构建议,当医疗决策依赖准确性时,应使用获授权的设备。
该警告并未评估这一研究系统。它表明,任何商业版本一旦其宣称会影响诊断、治疗或监测,都将面临何种标准。
因此,眼下的竞争对手并非另一家AI公司,而是由经验证的袖带、重复测量和实验室检测构成的成熟临床路径。这一路径存在摩擦,但其局限性已得到理解。
摄像头系统必须证明,其便利性并未掩盖不可接受的不确定性。在此之前,它最适合的角色是引导人们接受传统评估,而不是取而代之。
标题中的准确率数字没有说明什么
研究的标题数据描述的是一个数据集中的表现,而不是任何一名特定个体的摄像头结果正确的概率。
81.2%的糖尿病准确率听起来很直观,但其实际意义取决于受测人群。如果疾病患病率发生变化,阳性结果中反映真实疾病的比例也可能大幅变化。
假设某项筛查计划检测的是一个未诊断糖尿病患者相对较少的人群。即使一项测试具有可观的敏感性和特异性,也可能产生比预期更多的假阳性。这些人仍需通过血液检测来确定自身状况。
假阴性的反向问题同样重要。高血压患者可能得到令人安心的结果,从而推迟进行经验证的测量。当产品在没有不确定性说明或后续指引的情况下呈现结果时,这一风险会更加严重。
会议公告提供的方法学细节也少于完整的同行评审论文。目前材料并未充分解释数据集划分、模型训练程序、置信区间、阈值选择或外部验证。
目前尚不清楚,报告的准确率是否来自与模型开发完全分离的参与者。受试者层面的分离至关重要,因为来自同一个人的多次记录可能共享高度可辨识的特征。
标签本身也值得审查。高血压并非仅凭一次随意测量就能诊断。临床定义采用受控条件下的重复测量,且不同指南和场景的阈值各不相同。
糖尿病标签需要被认可的生化检测和临床解读。面部扫描无法在没有这些参考测量的情况下确定某人是否需要治疗。它同样无法替代对症状、病史或急性并发症的评估。
Google News的叙事框架可能会将这些区别压缩成一个简单故事:AI通过面部检测两种疾病。实际工作更精确,也更有限。它检验的是,光学循环信号能否对已经通过传统评估识别出的疾病进行分类。
隐私带来了另一层不确定性。面部视频既是生理数据,也可能是可识别个人身份的图像。已部署的系统需要针对存储、传输、二次使用、删除和模型训练制定明确规则。
本地处理可以降低暴露风险,但高速光谱分析起初可能需要专用设备或集中式计算。云端处理会带来更大的安全与治理负担。
开发者还必须将身份识别与健康分析分开。筛查系统无需识别个人面孔,即可测量皮肤信号。在没有临床必要性的情况下保留可识别视频,会造成可避免的风险。
偏差测试必须超越单一肤色比较。光照、摄像头硬件、压缩设置、面部遮挡、年龄和疾病严重程度可能相互作用。验证工作应报告失败情况,而不仅是成功读数。
在困难条件下拒绝生成结果的系统,可能比总是返回自信评分的系统更安全。然而,高失败率可能会排除无接触筛查本应覆盖的人群。
临床工作流程设计与模型准确性同样重要。阳性结果需要明确的下一步,例如经验证的袖带读数或实验室检测。阴性结果则需要采用不会劝阻常规就医的表述。
研究团队恰当地将智能手机使用定位为未来工作。任何消费者版本都应被视为新的实现方案进行评估,因为更换摄像头就改变了数据。
从每秒150帧的光谱视频转向普通前置摄像头,并非简单的产品封装工作。它会改变波长分辨率、时间分辨率、噪声和曝光行为。模型可能需要重新训练和新的临床验证。
负责任的解读应当是充满希望但范围有限。这些发现为更大规模的无接触筛查试验提供了依据。它们并不能证明今天可以通过手机自拍诊断高血压或糖尿病。
三项信号将表明面部视频AI能否走出实验室
下一阶段取决于外部验证、消费者摄像头表现,以及受监管的临床使用场景。
第一个信号是具备透明验证过程的完整同行评审论文。研究人员需要报告置信区间、参与者特征、疾病定义、模型开发方法以及受试者层面的测试分离。
多中心研究应涵盖设备、患者群体和临床流程不同的机构。如果模型在这些地点均表现强劲,就能降低其学习到仅属于单一中心信号的可能性。
亚组结果应涵盖年龄、性别、皮肤色素、用药情况和相关共病。研究人员还应公布系统无法产生可用结果的比例。
这些证据将强化面部血流模式具有泛化能力的主张。如果在原始中心之外表现大幅下降,则可能表明当前准确率反映的是受控条件或数据集特有的相关性。
第二个信号是普通消费者摄像头上的表现。一份有价值的报告应明确支持的硬件、最低帧率、光照要求、录制时长,以及处理是否在本地完成。
智能手机版本应与光谱摄像头直接比较。研究人员必须说明,当光谱和高速信息被移除后,准确率会损失多少。
独立测试应涵盖不同手机型号和摄像头处理流程。制造商采用各不相同的降噪、色彩校正、曝光和压缩方法,所有这些都会改变生理信号。
消费者摄像头验证成功将大幅拓展潜在市场。验证失败并不会推翻基础科学,但会将该系统限制在配备专用摄像头的诊所、药房或自助亭中。
第三个信号是明确定义的监管与临床路径。开发者必须决定,该产品是用于筛查风险、估计血压、监测治疗,还是宣称能够诊断疾病。
每种用途都会带来不同后果。低风险的健康提示并不等同于用于药物决策的测量结果。产品措辞和界面设计必须与证据相匹配。
未来试验应在预定使用场景中,将该系统与经验证的袖带和实验室测量进行比较。它们应追踪筛查是否带来确诊和适当照护,而不仅仅是模型能否在数据集中复现标签。
医疗系统还需要关于工作流程负担的证据。产生过多误报的工具可能消耗预约和检测资源。漏掉高风险患者的工具则可能削弱筛查的目的。
对于通过 google news 看到这篇报道的读者而言,实际结论很直接:不要根据一段脸部视频来排除高血压或糖尿病,也不要依据实验性的摄像头检测结果调整治疗方案。
应将这则报道视为医疗 AI 发展方向的一个标志。摄像头正逐渐成为生理传感器,而机器学习能够提取人眼无法识别的健康相关信号。这项研究已从 2024 年的初步展示,推进到 2026 年更为详尽的研究结果。
下一步应由证据,而非标题来决定。请关注多中心验证、透明的亚组表现数据,以及普通智能手机上的测试结果。如果这些成果能够在准确率没有明显下降的前提下出现,无接触筛查就有望真正进入日常医疗服务。在此之前,最有用的行动仍是传统做法:获取经过验证的血压读数,遵循建议进行糖尿病检测,并与合格的医疗专业人士讨论任何令人担忧的结果。


