top of page

INSPIRE 光子训练将 AI 学习搬上芯片

15分钟前
讀畢需時 14 分鐘

INSPIRE 光子训练已将梯度测量转移到光学硬件上,突破了长期依赖数字仿真的局限——后者无法完美呈现制造完成的芯片。研究人员于 2026 年 10 月 5 日在 Nature Computational Science 上报告了这一方法。四天后,Nature 的研究简报将该成果描述为迈向可训练 AI 硬件的一步。

这项实验之所以重要,是因为光子处理器已经能够利用光完成某些矩阵运算。但如何训练这些处理器,始终是一个独立的问题。团队通常先优化数字副本,再将所得设置转移至硬件;而硬件中的缺陷可能会改变实际计算。

INSPIRE 直接针对这种不匹配。该方法通过物理电路测量梯度,再利用这些测量结果更新可调参数。它真正要挑战的并非某一家公司或某款芯片,而是将硬件视为数学模型可预测副本的“仿真优先”训练路径。

INSPIRE 光子训练改变了什么

核心变化在于:电路本身参与计算应如何调整自身。

Tiankuang Zhou、Yun Zhao、Shanglong Li、Guocheng Shao、Ruqi Huang 和 Lu Fang 开发了这一方法。清华大学确认,该论文的牵头机构为其电子工程系和北京信息科学与技术国家研究中心。

研究人员将这一框架称为 INSPIRE,即原位物理梯度下降(in situ physical gradient descent)。原位意味着训练通过物理设备的测量结果进行,而非仅在软件表征中完成。

梯度下降是这项工作的核心优化过程。梯度描述了改变某个参数会如何影响模型产生的误差。训练过程会反复测量或估计这一方向,再调整参数以降低误差。

常规神经网络软件通过在数字处理器上执行数学运算来获得这些梯度。光子电路则带来了不同的挑战。光在穿过波导、相位控制器、散射结构及其他光学组件时会发生干涉。

模拟器可以估计这些相互作用,但其估计依赖于每个相关组件和连接的准确模型。制造公差、热漂移、噪声和环境变化,都可能使制造出的电路与预期表现不同。

INSPIRE 则使用片上合成时间反演全息术。这项技术测量光在电路中沿相反方向传播时所对应的复光场。这些光场同时包含振幅和相位信息。

研究人员利用测得的光场计算电路可调参数的梯度。由此产生的优化信号植根于制造后硬件的实际行为,无需该硬件的完整数字模型。

根据经同行评审的 INSPIRE 研究,该框架与拓扑无关。这意味着训练方法并不局限于某一种特定的光学组件排列方式。

这一点使该成果区别于针对单一光子神经网络进行狭义优化的演示。研究人员将该方法应用于矩阵设计、通过散射介质进行宽带计算,以及元学习架构。这些测试考察了不同形式的可编程性,而非某一项固定的推理任务。

报告中的矩阵训练实验实现了 0.26% 的相对误差。该指标衡量研究人员要求的矩阵变换与训练后光学系统产生的变换之间的差异。

论文还报告了跨多个波长的计算。波长通道可在同一物理系统中传输彼此独立的信息流。这种能力正是光子技术因并行计算而受到关注的原因之一。

最重要的是,该方法在制造完成后训练真实电路。芯片相对于理想设计的偏差,成为优化环境的一部分。优化器响应的是实际存在的设备,而不只是工程师原本计划制造的设备。

因此,Nature 研究简报将这项工作描述为从离线电路设计向物理训练的转变。这一表述是准确的,但需要补充一个重要限定:该研究确立的是一种方法和实验演示,而非可替代电子 AI 加速器的大规模量产方案。

为什么仿真优先训练面临压力

随着光子电路日益复杂,维持精确数字孪生的成本本身已成为计算问题的一部分。

仿真优先的工作流程将优化与物理执行分开。工程师建立光学电路模型,在软件中计算设置,再将这些设置应用于制造完成的设备。随后,校准可以补偿部分差异。

当模型能够以足够精度捕捉物理系统时,这种方法行之有效。但当设计包含许多相互作用的光路时,难度会随之上升。微小的相位误差可能累积,而温度变化可能改变组件行为。

这种不匹配之所以重要,是因为相干光子系统通过干涉编码信息。相干性保留光波之间的关系,使其振幅和相位能够组合。因此,微小的物理偏差也可能改变规模更大的计算。

离线训练还会带来维护负担。工程师必须表征硬件、更新其模型、运行数字优化、转移参数并测试结果。任何后续漂移都可能迫使他们再次进行校准或重新训练。

INSPIRE 光子训练改变了这种关系。物理测量提供更新设备所需的梯度。如果组件的行为与标称规格不同,测得的梯度便会反映这一差异。

这并不意味着软件被淘汰。训练循环仍需要目标函数、控制逻辑、参数更新,以及光学与电子系统之间的接口。论文的贡献更聚焦,却也更具影响:梯度不再依赖于电路的完整可微数字副本。

这给围绕离线仿真构建的逆向设计方法带来了压力。逆向设计从目标光学功能出发,搜索能够实现这一功能的物理结构。它已促成紧凑器件的发展,但随着设计规模和复杂度增加,高保真仿真的成本可能变得高昂。

物理训练提供了另一条路径。工程师可以制造一个可配置系统,测量其实际状态如何影响目标,并在制造后进行调优。硬件同时成为计算介质和优化过程的一部分。

研究人员将这一思路扩展到散射介质。散射结构会通过许多难以单独建模的物理路径混合光信号。这类无序通常被视为精确计算的障碍。

INSPIRE 将这种复杂性视为可利用的变换。论文报告称,所训练的目标矩阵大于原生可调元件的数量。实际上,该方法利用了更广泛的物理系统,而非将计算限制在理想化的显性控制元件数量上。

这一结果并不意味着电路获得了无限数量的可训练参数。可实现的变换仍取决于可控性、测量质量、噪声,以及可通过系统访问的自由度。不过,它说明了为何物理训练循环能够利用简化设计模型可能遗漏的行为。

这种压力是长期的,而非迫在眉睫的。仿真仍将是设备设计、验证和制造的关键。更可信的转变是从仅靠仿真的优化,走向将先验模型与已部署硬件测量结合的混合工作流程。

这一差别对 AI 硬件买家而言很重要。可训练光子电路可以在制造后适应、吸收设备差异,或针对特定工作负载进行专门化。但这些优势只有在完整系统于实验室之外仍能保持稳定和高效时才有意义。

INSPIRE 如何测量物理梯度

INSPIRE 将光学互易性转化为训练信号,而非在软件中重建每一种内部相互作用。

该方法从正向光场开始。输入光穿过电路,并根据当前参数设置产生输出。系统随后将该输出与期望结果进行比较。

训练需要了解每个可调元件对误差的贡献。通过暴力扰动计算每项贡献成本很高。每个参数都需要单独改变和测量,扩展性较差。

INSPIRE 使用双向光学模式来避免这一过程。第二个光场沿反向穿过系统,携带与误差相关的信息。正向与反向光场之间的相互作用揭示了局部变化如何影响整体目标。

合成时间反演全息术捕获了这一计算所需的完整复光场。复光场包括振幅和相位,两者都决定干涉结果。仅测量强度会丢弃部分信息。

光学互易性提供了两个传播方向之间的物理关系。在互易系统中,当交换源和观测方向时,传输行为彼此关联。INSPIRE 利用这种关系从测量结果中构建梯度。

参数控制器随后可以调节可调光学元件。重复这一序列会缩小期望变换与测得变换之间的差异。这之所以是物理梯度下降,是因为设备本身提供了指导自身更新的信息。

早期研究已经建立了这一路线的重要基础。2018 年的一篇 Optica 论文提出,可通过原位反向传播和梯度测量训练光子神经网络。2023 年的一项 Science 实验随后在集成光子神经网络中演示了原位反向传播。

另一种方法减少了对反向传播的依赖。2024 年的一项 Nature 研究提出了前向模式训练,仅使用前向传递来训练物理系统上的光学神经网络。这一设计解决了通过硬件向后传递误差信号所面临的实际困难。

2026 年 3 月,研究人员报告了一套片上反向传播系统,将线性和非线性计算集成在一枚光子芯片上。它在两项非线性分类任务中实现了超过 90% 的准确率,并达到了参考数字模型的鲁棒性。

INSPIRE 属于这一发展脉络,但其主要主张关乎通用性。作者表示,其梯度方法可适用于多样化的电路拓扑。它并非仅被定位为某一种分层网络设计的训练程序。

这种拓扑独立性支撑了矩阵和散射实验,也使团队能够展示其元光子学成果。元学习训练系统快速适应新任务,而不是从头开始学习每一项任务。

论文报告的元学习结果利用经过学习的光学结构实现单次适应。论文称,在特定任务训练中实现了 251 倍模型压缩和 136 倍加速。

这些比率需要谨慎解读。它们描述的是作者实验框架内的比较结果,并不直接意味着商用光子处理器训练任意 AI 模型的速度比 GPU 快 136 倍。

算法层面的加速与系统性能之间的区别至关重要。实验室方法可以减少优化步骤,但仍依赖激光器、探测器、控制电子设备、数据转换器和测量周期。每个组件都会增加能耗、延迟和工程约束。

不过,这一机制改变了光子硬件可能实现的能力边界。它使电路从被动的执行对象转向可适应的物理系统。这正是该工作值得获得光子学界之外关注的最有力理由。

光子训练与电子 AI 硬件

真正相关的竞争并非每种工作负载下光与硅的对决,而是自适应光学计算与成熟电子系统之间的较量。

图形处理器和其他数字加速器主导 AI 训练,因为它们结合了可编程算术、高带宽内存、成熟软件和可预测的数值精度。其生态系统能够支持超大模型和分布式工作负载。

光子系统则从另一条路径切入这一问题。光能够并行传播并发生干涉,使某些线性运算得以高速完成。作为神经网络核心运算的矩阵-向量乘法,可以自然映射到多种光学架构上。

这种优势取决于具体工作负载。光学组件并不会自动提供高效的内存、非线性激活、控制流或参数存储。完整的神经网络必须将光学计算与这些其他功能连接起来。

这带来了输入输出问题。数据必须编码为光学信号,随后再被探测。数模转换和模数转换可能消耗能量并引入延迟。电子控制系统还需要配置可调谐光子组件。

2026 年 9 月的一篇扩展性综述指出了三类主要的光子神经网络架构,包括 Mach-Zehnder 干涉仪网络、衍射光学网络和波分复用网络。

同一篇综述还强调了模拟精度限制、误差累积、信噪比下降和转换效率不足等问题。随着研究人员增加通道、层数或物理维度,这些挑战会变得更加严重。

INSPIRE 解决了其中一个重要环节。利用真实电路的测量结果进行训练,可以补偿制造误差和不完美的组件行为。它并不能消除噪声,也不能保证系统规模扩大后精度仍然稳定。

这一方法在输入原本就是光学信号的场景中可能尤其有用。通信、传感、成像和科学仪器都能直接产生光。将部分处理保留在光学域内,可以减少不必要的转换。

传感器在部署后也可能需要适应。环境变化、组件老化和任务差异,都会削弱在制造前计算出的设定。原位学习为硬件提供了根据测量条件重新调谐自身的途径。

通用大语言模型训练则是一个困难得多的目标。这类系统需要大规模参数存储、反复执行非线性运算、高数值可靠性,以及加速器之间的大量通信。新研究并未展示这一工作负载。

这篇 Nature 论文提供的,实际上是自适应智能光子系统的构建模块。矩阵设计展示了精确的可控性,多波长处理测试了并行光谱通道,元学习则测试了快速任务适应能力。

这些演示很有价值,因为它们考察了许多光学加速器所缺失的一项能力。固定处理器可以很快,却可能很脆弱;可训练处理器能够响应自身实际硬件状态和不断变化的任务。

因此,商业压力最先将落在专用加速器上,而不是所有 GPU。开发光学矩阵引擎的光子初创企业和研究团队,如今必须说明其硬件能否在不依赖昂贵数字孪生的情况下自行训练或校准。

电子系统同样能从这项研究中受益。混合加速器可以将密集型光学运算交给光子组件,同时由电子系统负责内存和控制。更好的物理训练能够让这种分工更加可行。

因此,未来的竞争很可能发生在系统设计之间。一条路径是让大部分计算保持数字化,并加入光学通信;另一条路径是用光子学处理特定数学运算;第三条路径则尝试通过物理学习和适应实现更深入的光学执行。

INSPIRE 强化了第三条路径,但并未终结这场竞争。它的贡献是一种遵循已制造设备物理特性的训练机制。其市场相关性将取决于工程师能否把这一机制整合进可靠、可编程的系统。

结果尚未解决规模或效率问题

可训练光子电路尚不能证明它是一个经济的大规模 AI 训练平台。

论文报告的 0.26% 相对矩阵误差是一个精确结果。然而,实验设置下的矩阵精度,并不能证明深度网络在跨越多层和长期训练运行时的精度。

模拟误差可能会累积。光学损耗会降低信号强度,而探测器噪声和相位不稳定性会影响测量。热相互作用可能导致一个被调谐的元件影响附近组件。

梯度质量尤其重要。训练依赖梯度可靠地指向更低误差的方向。测量噪声可能扭曲这一方向,导致收敛变慢或优化不稳定。

合成时间反演全息术也增加了仪器要求。工程师必须生成、路由和测量所需的光场。可扩展实现需要在不造成过多控制开销的前提下保持这一过程的准确性。

论文中关于拓扑无关的主张很有前景,但兼容性并不等于易于集成。不同的电路材料、调谐机制、波长和布局都具有不同的工程约束。通用数学方法仍可能需要针对平台的专用硬件。

能耗主张同样需要谨慎对待。光子计算通常与低能耗矩阵运算相关联,但真正相关的指标是总系统能耗,其中包括激光器、调制器、探测器、转换器、热控制和电子更新。

INSPIRE 摘要并未报告与当前 GPU 或 AI 加速器进行端到端能耗比较。因此,将该方法描述为在系统层面更节能是不准确的。

所报告的 251 倍压缩也需要结合背景理解。它指的是实验中使用的元光子架构。该设计内部的压缩,并不等同于以同样倍数降低生产模型的总内存占用。

同样,136 倍特定任务训练加速取决于研究人员选择的基线、任务、硬件和测量边界。这一比率支持元学习演示,但不能泛化到所有 AI 训练工作负载。

可制造性仍是另一个悬而未决的问题。光子芯片可能存在工艺差异,而物理训练有助于补偿这些差异。不过,商业产品还必须在大量设备中实现可接受的良率、封装、寿命和校准效果。

这种方法必须证明其可重复性。独立团队需要在其他光子平台上复现物理梯度测量。不同制造工艺下的结果将增强作者关于通用性的主张。

规模是最大的不确定性。一篇 2026 年综述认为,光子神经网络在支持拥有数十亿参数的模型方面仍面临困难。INSPIRE 改进了物理电路的学习方式,但它本身并不能提供数十亿个稳定、可调谐的元件。

内存构成了相关障碍。神经网络需要存储参数和中间状态。光子电路通常依赖电子内存或持续维持的模拟控制,这可能削弱光学算术的优势。

软件工具同样重要。开发者通过成熟的框架、编译器、分析器和库来使用数字加速器。可训练光学平台需要提供能够暴露物理优化能力的接口,而不强迫用户管理每一个光子细节。

这些限制都不会抹去这一成果。它们界定了下一步必须完成的工作。这项研究将一个困难的理论和硬件问题转化为可衡量的工程计划。

这比将该芯片称为电子 AI 的替代品更有意义。INSPIRE 提供了一条绕开模型失配的路径。其商业价值取决于以有意义的规模实施这一路径的成本。

Nature 成果之后值得关注的事项

三个信号将表明 INSPIRE 光子训练能否从研究方法走向可用的 AI 硬件。

第一个信号是在另一种电路拓扑或制造平台上实现复现。作者将 INSPIRE 描述为拓扑无关,实验也涵盖了多种光学任务。独立复现将检验该方法能否在无需大幅重新设计的情况下迁移。

成功的复现应报告梯度准确性、收敛性、光学损耗、测量开销和稳定性,还应说明系统中哪些部分需要重新校准。若在不同平台上获得可比性能,将强化其通用性主张。

第二个信号是端到端效率测量。研究人员需要统计光源、光场测量、调谐、电子控制、转换和参数更新所消耗的能量与时间。仅考察光学算术并不是充分的边界。

可信的基准测试应在相近精度下比较等效任务,并披露训练是否包括初始化、校准和数据移动。如果 INSPIRE 在这些条件下仍保有优势,那么自适应光学加速的理由将大幅增强。

第三个信号是一个需要反复适应的更大规模应用。多层模型、变化的传感器环境或已部署的光学系统,测试的不只是静态矩阵拟合,也能揭示梯度质量在更长运行周期中的表现。

最强的应用未必类似于基于云端的语言模型训练。能够从自身物理环境中学习的光学传感器或许更加契合。这类系统会在同一条光子路径中结合信号采集、变换和适应。

研究人员还应将 INSPIRE 与仅前向训练及集成式光学反向传播进行比较。每种方法对信号路由、测量和硬件对称性都有不同要求。尚无任何单一训练方法确立普遍优势。

历史发展模式支持保持谨慎。光子神经网络已经从提出梯度测量方法,发展到实验性反向传播、仅前向学习和集成式非线性系统。每一项进展都解决了一个约束,同时暴露出另一个系统层面的问题。

INSPIRE 在这一脉络中的贡献格外广泛。它将物理电路本身视为梯度的来源,并在矩阵、波长、散射和元学习等方面验证了这一概念。

这一成果也改变了最值得提出的问题。与其宽泛地追问光子技术是否会取代 GPU,更实际的问题是:在何种场景下,硬件感知的光学学习所带来的收益足以抵消构建和控制光子系统的复杂性。

对于开发者和企业采购方而言,目前无需立即作出平台决策。这项工作仍处于研究阶段,其最强性能数据来自受控实验。在可复现的系统基准测试出现之前,不应据此作出采购判断。

对于研究人员而言,下一步更为明确:在更大规模的电路上测试该方法,披露完整的测量成本,并与其他物理训练方案进行比较。这些结果将决定,随着复杂度提升,原位梯度能否保持准确。

对于 AI 用户而言,其意义还在更远的未来。能够在制造完成后继续适应的硬件,或可支持在传感或通信端实现更快的专用化,也可能减少对精细设备仿真的依赖。

这一未来并非必然实现。光学损耗、模拟精度、内存、封装和软件集成,仍是从实验走向广泛部署之间的障碍。

尽管如此,INSPIRE 光子训练改变了基准认知。光子电路不再必须只是执行其他地方计算得出的固定参数;它可以测量自身物理特性如何影响目标函数,并利用这些信息进行学习。

下一项决定性证据不会是又一个孤立的速度比率,而将是一个更大规模的系统,完整报告其能耗、准确性、稳定性和训练成本。当所有配套组件都被纳入计算时,物理学习能否保持其优势?

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page