top of page

Google 的“迈向可证明的联邦数据隐私学习”将信任转移至安全服务器

2小时前
讀畢需時 16 分鐘

尽管联邦学习长期以来与设备端计算紧密关联,Google 仍将 Gboard 的关键训练工作从手机转移到了受保护的服务器上。其“迈向可证明的联邦数据隐私学习”项目借助可信执行环境,限制上传样本可被处理的方式。

这一转变承诺带来更快的训练、更广泛的设备参与,以及可由独立方审查的隐私控制机制。但它也改变了系统的核心交换条件。私密样本如今以加密形式抵达 Google 的基础设施,获批准的程序仅能在受硬件保护的环境中对其解密。

这一架构挑战了集中式训练与传统联邦学习之间的惯常取舍。Google 表示,它可以获得服务器端计算的大部分运营优势,同时不让运营人员无限制访问个人数据。眼下的证据来自已通过 Gboard 部署的英语和日语下一词预测模型。

“迈向可证明的联邦数据隐私学习”改变了训练发生的位置

Google 的核心变化在于架构:手机负责授权并加密样本,受保护的服务器工作负载则承担更多训练任务。

Google 于 2026 年 10 月 2 日宣布该系统,此前相关技术论文已于 9 月发布。该公司将其描述为下一代联邦学习基础设施。

传统联邦学习让众多设备为共享模型作出贡献,无需将其原始本地数据集发送至普通的中央数据库。Google 早期系统会在参与训练的手机上执行重要的模型更新计算,随后由服务器协调并合并这些更新。

这种安排减少了直接的数据收集,但也使训练进度受制于移动设备的条件。手机在处理能力、可用电量、连接状况、语言、时区和参与意愿方面各不相同。这些差异可能拖慢训练,并影响每轮中实际参与贡献的设备构成。

新设计改变了这一流程。设备会在本地加密选定的训练样本,并为其关联一项访问策略。该策略指定哪些服务器端程序获准处理上传的内容。

加密样本只能在可信执行环境(TEE)内被打开。TEE 是一类硬件隔离的计算区域,旨在保护代码和数据免受周边主机系统的影响。

Google 表示,获准工作负载只会发布匿名化指标和经过差分隐私处理的模型权重。差分隐私通过贡献限制和经过校准的统计噪声,限制单个人记录对发布结果的影响程度。

因此,在该系统中,“联邦”的含义更加宽泛。设备依然决定哪些数据可以离开,以及哪些工作负载可以使用这些数据。不过,它们不再需要在本地计算每一个梯度。

梯度是训练期间用于调整模型的数值更新。将该计算移至服务器,消除了移动处理器能力和不断变化的设备可用性带来的一项主要限制。

Google 报告称,生产环境部署覆盖了 Gboard 中的英语和日语下一词预测模型。该公司表示,这些模型获得了更强的隐私保障,并提升了准确率。这些说法来自 Google 及其研究论文,而非独立的生产审计。

实验规模提供了更具体的背景。Google 使用训练 5,000 轮的英语预测模型,生成了隐私与效用曲线。每个系统均使用由 6,500 台设备构成的群组。

该公司还表示,类似模型过去需要一到两个月才能完成训练。训练进度取决于可用手机、其计算资源,以及争取访问这些设备的工作负载之间的竞争。

在新模式下,服务器端训练任务开始前即可收集上传样本。之后,任务无需等待适配的手机同时可用,便可选择高效的参与调度方案。

这正是该公告的重要性超出常规隐私升级的原因。Google 的联邦学习正逐渐摆脱这样一种假设:私密计算必须在终端用户硬件上保持物理分布式状态。

新的押注在于,授权、加密、证明和可验证处理的重要性可以高于处理器所在的位置。这让 Google 对训练性能拥有更大控制力,同时要求硬件隔离机制来执行这一边界。

该公司的系统公告坦承,这仍是迈向严格证明的一步。它并未宣称每个组件都拥有关于实现正确性的完整数学证明。

这一区别很重要。“可证明隐私”可以指一种形式化的隐私机制,但已部署系统还包括硬件、配置、软件、密钥、日志和恢复流程。覆盖其中一层的证明,并不会自动验证所有其他层。

尽管如此,运营层面的变化已经成为现实。Gboard 正在生产环境中使用这套基础设施,而非仅在学术基准测试中进行测试。这一部署使 TEE 联邦学习成为一个具有即时影响的移动系统议题。

Google 正以可验证策略取代对运营方的信任

该系统的核心承诺并非 Google 永远不会接收加密数据,而是外部方能够审查并验证支配其使用方式的规则。

早期联邦系统要求用户和审计人员信任关键的服务器行为。服务器可能承诺不会记录单独更新,也不会检查临时数值。外部观察者未必总能从基础设施外部验证这一承诺。

安全聚合改善了这一局面。该加密协议会合并受保护的设备更新,使协调服务器接收到的是聚合结果,而不是每一份单独贡献。

但安全聚合也带来运营约束。此外,它并不会自动带来最强的中央差分隐私结果。中央差分隐私通常假设存在一个可信处理器,能够限制贡献、执行聚合并添加精确校准的噪声。

Google 的设计试图保留中央模型的准确性,同时缩小必须被信任的主体或组件范围。可信处理器变成了隔离硬件内部经过证明的工作负载,而非由运营人员控制的常规服务。

远程证明允许另一方验证在 TEE 内运行的软件身份和配置。原则上,设备可以检查其数据是否只会提供给预期的工作负载。

四项相互关联的机制实施了这一方案。

首先,手机会加密每个选定样本,并预先授权列出可接受计算的访问策略。策略之外的工作负载不应获得解密密钥。

其次,密钥管理服务控制这些密钥。Google 表示,该服务在由 TEE 构成的集群中运行,并采用 Raft 共识协议,使多个节点围绕一致状态保持同步。

第三,根 TEE 执行一个 Python 训练程序。它将并行工作委派给其他受保护的工作节点,随后定期发布匿名化模型权重。

第四,系统会在训练轮次结束后保存加密的恢复状态。这一状态使工作能够在根节点或工作节点发生故障后恢复,而不会有意暴露额外的敏感信息。

这些组件使访问同时受策略和经证明代码的约束。根据所述威胁模型,数据库管理员无法仅仅运行无关查询来访问已解密的样本。

公开记录同样重要。设备要求潜在工作负载被登记在 Rekor 中;Rekor 是一项仅追加式透明度服务,旨在暴露后续变更或冲突记录。

Sigstore 的 Rekor documentation将该服务描述为用于签名软件元数据的抗篡改账本。审计人员可以监控其一致性并检查收录记录。

对于 Google 的系统,这些记录旨在揭示设备可能授权的工作负载集合。审计人员可以审查已声明的程序,而不必接受服务运营方提供的非公开描述。

Google 还在其机密计算代码库中发布了密钥管理和处理代码。该项目包含旨在实现可复现构建的 TEE 托管组件。

可复现构建让独立方能够编译源代码,并将结果与证明中识别出的二进制文件进行比较。相匹配的输出能够更可信地将公开源代码与已部署软件关联起来。

这并不意味着 Gboard 的每个部分都是开源的。Google 表示,训练环境可以动态加载序列化信息,其中包括专有模型架构细节和预处理逻辑。

与隐私相关的行为应保持固定在可审计的 Python 程序中。专有材料随后可在运行时进入系统,而不会改变控制访问、保留、聚合和发布的机制。

这种划分既带来灵活性,也带来张力。Google 可以保护产品特定的知识产权,同时公开执行隐私边界的代码。

不过,审计人员必须判断动态加载的材料是否确实不具备隐私相关性。模型或预处理组件可能影响内存访问、时序、输出,以及对所谓匿名结果的解释。

因此,新方法以若干更狭窄的验证问题取代了一项宽泛的信任主张。经证明的二进制文件是否与审查过的源代码一致?策略是否覆盖每一个允许的工作负载?加载的材料是否维持了所声称的边界?

这些问题比单纯信任运营方的内部流程更具体。但它们同样主要面向专业人士,而非普通 Gboard 用户。

这代表了问责机制的一项实质变化,但并不等同于彻底消除信任。

服务器端计算同时提升隐私与效用

令人意外的机制在于,集中受保护的计算能够在减少移动端训练瓶颈的同时增强差分隐私。

隐私系统往往看似存在一种取舍。本地处理限制了直接暴露,但可能降低模型质量、增加设备成本,并使协调更加复杂。集中处理提升效率,却会集中敏感信息。

Google 的设计尝试改变这一权衡。设备保留授权控制权,而受保护的服务器硬件则执行那些难以在手机之间可靠协调的工作。

其中一项好处来自调度。传统移动训练会在特定轮次招募符合条件的设备。参与与否取决于手机是否在线、闲置、充电,以及是否能够以其他方式作出贡献。

这些条件遵循日常使用模式。由于某些地区、设备类别或时区的手机恰好可用,一项训练任务可能从它们那里获得更多贡献。

TEE 联邦学习将数据收集与训练时间分离。服务器可以等到获得合适的加密群组,再在获批程序中计算参与计划。

该计划会影响差分隐私。隐私核算部分取决于参与用户数量、抽样方式、每位用户的贡献量,以及系统添加的噪声量。

控制得更好的群组,可以在既定隐私目标下采用更小的噪声乘数。或者,系统也可以在保持相近实用性的同时,提供更严格的隐私保证。

这项进行了 5,000 轮、每轮包含 6,500 台设备群组的实验说明了这一机制。Google 报告称,其隐私—实用性曲线优于早期系统。

隐私—实用性曲线衡量信息保护与模型实用性之间的关系。增加更多噪声通常会改善隐私性,但会降低准确率。更好的曲线能在相近隐私预算下带来更高实用性。

Google 还称,其生产模型在更小的隐私预算下实现了更高准确率。隐私预算量化了个人数据所允许产生的影响;在可比假设下,数值越小通常意味着保护越强。

论文将这些保证描述为可由外部验证的中心化差分隐私。“中心化”很重要,因为受保护的服务器工作负载能够在生成私有输出之前,在 enclave 内观察单个样本。

这不同于本地差分隐私:后者由每台设备在发送贡献之前自行随机化。本地保护降低了对服务器的依赖,但当信号较复杂时,其噪声可能损害准确率。

它也不同于 Google 早期的分布式差分隐私工作。该方法将本地噪声与安全聚合结合,使协调者只能看到带噪声的总和。

Google 在 2023 年报告称,其分布式系统以每个模型参数 12 比特的数据量达到了与中心化差分隐私相当的准确率。该技术已部署于 Android Smart Text Selection。

不过,该公司也披露了一项限制。其形式化 epsilon 值虽是有限的,但数值很大,可达数百。Epsilon 是衡量单个用户能够在多大程度上改变输出分布的差分隐私参数。

同一项隐私研究指出,完全恶意的服务器可能通过操纵密钥交换或注入虚假客户端来绕过保护。这段历史解释了 Google 为何将重点转向可验证的服务器执行。

在 TEE 模型下,设备无需执行每一次梯度计算,也无需添加所需噪声的每一部分。它只需授权特定的受保护程序完成这些工作。

这降低了移动端计算负担,也让更多设备具备参与资格。较旧或资源受限的手机无需完成完整的本地训练工作负载,也能贡献样本。

更广泛的覆盖可以改善数据集的代表性,尽管 Google 尚未发布完整的人口统计或设备类别分析。更多符合资格的设备并不自动意味着样本没有偏差。

该系统还允许 Google 在多台服务器之间并行训练。该公司表示,TEE 容量如今限制了训练速度,取代移动设备可用性成为主要瓶颈。

这并非无关紧要的工程细节。更快的模型迭代能够改进键盘预测、缩短评估周期,并允许在受控隐私政策下开展更多实验。

这也给移动计算领域带来商业压力。Apple、Samsung、消息服务提供商和键盘开发者,都面临个性化、隐私声明与模型迭代速度之间同样的矛盾。

Google 现在提供了一个生产环境中的实例,表明服务器端处理并不要求服务器拥有不受限制的访问权限。竞争对手需要给出能够回应可验证性的方案,而不只是声称数据保持加密或在本地处理。

这一方法也可能扩展到键盘之外。Google 表示,其受保护基础设施可以运行任意 Python 工作负载,包括涉及合成数据生成和专用 LLM 推理组件的实验。

这种可能性将系统与私有 AI 评估联系起来。产品团队日益需要获取有关模型失效、异常输入和语言变化的真实世界信号,同时又不建立包含敏感交互的永久存储库。

Google 此前曾将相关的机密分析技术用于 Pixel Recorder。在该案例中,受保护的工作负载会先对已选择加入的转录文本进行分类,再发布经过差分隐私处理的汇总统计数据。

这一方向是一致的。Google 希望让敏感样本能够在严格治理的计算环境中被使用,即便这些样本仍无法供常规检查。

该模型可在不让每部手机执行大型训练任务的情况下,支持更丰富的移动 AI。它也可能加深对由少数提供商控制的服务器硬件与认证基础设施的依赖。

因此,这一机制结合了隐私主张与基础设施策略。更好的调度和中心化并行提高了实用性,而政策和 TEE 则试图约束中心化运营者。

隐私保证止步于 TEE 威胁模型

最需要保持谨慎的理由在于:可验证代码无法消除执行它的硬件本身存在的弱点。

Google 在一些重要表述上十分谨慎。它将这项工作描述为迈向可证明私有学习,并将 TEE 保证建立在当前硬件局限的前提之上。

这一限定避免了该公告演变为绝对保密性的主张。可信执行环境曾出现与推测执行、内存访问模式、固件以及恶意主机观测有关的漏洞。

TEE 可以保护数据免受许多周边软件组件的影响,但无法让所有物理或信息侧信道消失。

侧信道会通过时序、内存行为、页面故障、缓存、功耗或其他可观测效应间接泄露秘密。程序即使能生成正确的加密输出,也仍可能通过其执行模式泄露信息。

当专有组件以动态方式加载时,风险更难评估。公开代码或许会强制执行输出聚合,但加载的逻辑可能改变所访问的内存区域,或改变特定记录的处理时间。

Google 在自身讨论中链接了有关机密虚拟机的研究。SNPeek analysis 发现,在运行于 AMD SEV-SNP 硬件上的代表性隐私工作负载中存在此前未被注意到的信息泄露。

其中一个演示的隐蔽信道达到了每秒 497 千比特。这一结果并不能证明 Google 的 Gboard 部署存在漏洞,但它说明了为何 TEE 保密性必须始终是有条件的。

威胁模型同样重要。认证可以验证预期二进制文件正在运行,但该证据仍依赖于硬件根信任、固件测量、证书基础设施以及验证者行为的正确性。

这些层中的任何一层存在缺陷,都可能削弱经过审查的代码与实际执行之间的联系。修补存在漏洞的基础设施,也可能使可复现构建和历史审计记录更加复杂。

密钥管理形成了另一个集中风险点。Google 将服务分布在 TEE 集群中,但该集群必须持续可用、保持一致、配置正确,并能抵御回滚。

Raft 为参与节点提供共识。它并不能独立证明每一项策略决策都正确,也不能证明底层硬件始终未被攻破。

恢复状态增加了另一层攻击面。系统会加密检查点,以便中断的轮次能够恢复,而不暴露额外的私人信息。

审计人员仍需检查重复恢复、回滚或重放是否会改变隐私核算。如果攻击者迫使计算反复执行,一次本可安全运行的计算可能超出其预期隐私预算。

数据保留同样值得审视。Google 表示,样本在上传后只能于有限期限内被处理。该公告没有为普通用户提供简明仪表盘,以展示每个保留样本、到期时间、工作负载和隐私预算。

透明度日志记录的是获授权软件的元数据,而不是可读的个人活动账本。大多数用户无法确定自己的哪一次贡献影响了哪一轮训练。

因此,授权与知情同意之间的区别仍然重要。即使设备所有者不了解某项已发布的访问策略,设备也可以在技术上执行它。

Google 表示,参与的客户端仍掌控工作负载和匿名化属性。这种控制将如何呈现在 Gboard 设置中,会影响该理念能否成为有意义的产品透明度。

独立审计也存在类似缺口。外部各方可以检查日志和源代码,但公告并未说明生产部署是否设有定期的第三方审计计划。

只有具备资质的研究人员投入时间进行验证,开放验证才有可能实现。公开工件的存在并不确保有人持续检查它们。

系统的准确率主张同样需要克制看待。Google 报告了英语和日语预测模型的改进,但尚未发布覆盖不同语言、地区或设备类别的广泛比较。

服务器端调度可以改善参与覆盖率,但也可能根据哪些加密样本抵达、保持有效并满足工作负载策略而引入不同的选择效应。

差分隐私解决的是个人对发布模型的影响问题。它并不保证公平性、事实准确性、抗投毒能力,或不同用户群体之间的同等表现。

它也不会让输入数据变得无害。除非有单独的防御机制识别并限制恶意贡献,否则恶意贡献仍可能针对模型行为发起攻击。

Google 的平台地位又带来了另一层担忧。该公司开发 Android、Gboard、服务器基础设施、认证软件、工作负载代码和模型训练流程。

发布关键代码和政策,能够对这种集中化形成制衡。然而,Google 仍定义了被检查系统的大部分内容。

因此,可信的长期评估应当区分三项主张:数学机制可以满足差分隐私;经过认证的软件可以实施该机制;周边生产系统可以维持其前提条件。

一项主张的证据不应被视为另外两项的自动证明。Google 自己的措辞大体尊重这一区别,尤其是在讨论未来证明和侧信道防御时。

这种克制反而强化了该公告。它为研究人员提供了可供检验的具体假设,而不是将“可证明私有”包装成已完成的认证。

对读者而言,正确的理解范围更窄,但仍意义重大。与传统的私有后端相比,该系统让重要的服务器行为更可检查,也受到更多约束。

它并不会使 Google 不可能犯错、硬件不可能被攻破、策略不可能出错,或配置不可能具有误导性。可证明的组件仍嵌入在持续演变的运营系统之中。

Google 及其竞争对手接下来需要证明什么

下一阶段将取决于独立验证、更广泛的部署,以及受保护的加速器能否维持同样的隐私边界。

首个值得关注的信号是独立的生产审计。研究人员应复现构建、检查 Rekor 条目、验证工作负载策略,并测试已部署的认证是否与公开代码相对应。

这样的审计将强化 Google 的核心主张:外部人士能够验证获准的数据处理。若政策、二进制文件或生产环境行为之间存在实质性不一致,这一主张就会被削弱。

最有价值的审计不应仅覆盖开源代码库。它还应检查密钥轮换、恢复行为、隐私核算、侧载组件,以及对硬件漏洞的响应。

第二个信号是扩展到两个 Gboard 模型组之外。Google 已部署英文和日文的下一词预测,但更广泛的语言和产品覆盖将检验该架构在不同数据分布下的表现。

扩展至合成数据生成或 LLM 辅助工作负载尤为重要。这些项目具有更复杂的内存行为,并可能带来新的非预期披露途径。

更广泛的部署将增强这样一种判断:TEE 联邦学习是一种通用平台。若始终局限于少量键盘模型,则可能表明其收益依赖于异常受控的工作负载。

第三个信号是对机密加速器的支持。Google 表示,更大的模型将需要与加速器集成的 TEE,因为受保护的 CPU 容量目前限制了训练。

加速器可以提高吞吐量,但也会增加固件、驱动程序、共享内存、互连机制和新的证明关系。每一层都会扩大审计人员必须评估的实现范围。

与受保护的 TPU 或同类硬件成功集成,将支持 Google 推进更大联邦模型的计划。隐私例外或不透明组件则会削弱端到端可验证性的承诺。

竞争对手的做法也将提供另一项有用的参考,尽管这并非本文的主要竞争焦点。移动平台可以继续强调本地计算,采用类似的受保护服务器设计,或结合两种方式。

纯端侧系统避免上传原始样本,但仍受到电池、硬件、连接性和协调可用性的限制。传统云端系统获得了更大的灵活性,却要求用户信任运营方拥有更广泛的访问权限。

Google 的架构位于两者之间。它上传加密样本,同时尝试让对这些样本的获准使用在技术上可强制执行,并可供公众检查。

这种平衡将吸引构建个性化移动 AI 的团队。真实世界的语言、行为和交互数据之所以有价值,恰恰是因为合成测试集往往会遗漏少见的故障。

风险在于,“机密计算”可能成为收集更多敏感材料的通用理由。更强的处理控制不应取代数据最小化原则或清晰的用户选择。

评估这一模型的团队应先从必要性入手。他们应当问:某项工作负载是否需要个体样本,这些样本能在多长时间内保持价值,以及哪些聚合输出必须离开受保护环境。

接着,他们应检查验证链。当政策含糊、构建无法复现,或获授权程序能够发布过于详细的结果时,证明的价值就很有限。

最后,他们应审视故障情况下的行为。隐私保障必须能够经受住轮次中断、密钥服务中断、政策更新、恶意主机和紧急硬件补丁的考验。

《Toward provably private learning from federated data》之所以重要,是因为 Google 已将这些问题与一款真实的消费级产品联系起来。该公司不再只把可验证的机密训练作为实验室设计来展示。

其最重要的成就并不是证明服务器端学习毫无风险,而是展示了服务器端性能与可由外部检查的隐私控制如何在同一生产架构中共存。

尚未解决的问题是,随着 Google 扩展该架构,独立审计人员能否同样迅速地验证它。读者应关注公开日志、可复现构建、硬件披露以及未来的部署报告。

如果这些工件始终可访问且可验证,Google 联邦学习将为私有移动 AI 树立更高标准。如果随着工作负载扩大,验证变得不完整,该设计将重现它原本旨在缩小的信任鸿沟。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page