top of page

康奈尔大学的光学 AI 链路挑战内存瓶颈

IEEE Spectrum 报道称,Cornell Tech 的研究人员以每比特 0.7 皮焦耳的能耗,利用光将数据传入芯片内存,绕过了传统光学接收器的一个环节。该数据来自一款 28 纳米原型芯片,而非已经完成的机器人部件。不过,这项实验直指一个代价高昂的问题:AI 处理器需要反复通过电连接,从独立内存中调取模型参数。

博士后研究员 Yifan He 与副教授 Jae-sun Seo 围绕改造后的静态随机存取存储器,即 SRAM,构建了这款接收器。每个感光单元都会将入射光转换为电流,从而改变已存储的二进制值。因此,光可以直接将数据写入内存,而无需先转化为电信号,再由其他电路进行解码和路由。

眼前的成果仍较为有限。实验室发射器通过近一米距离传送了一个静态的 14×14 比特图案。研究人员接下来需要可变化的发射器、更高密度的单元,以及证明系统在移动机器周边仍能保持可靠运行的证据。更大的挑战很明确:电内存链路已经成熟、速度很快,难以被取代,即使其能耗仍在上升。

IEEE Spectrum 的光学接收器可直接写入 SRAM

这款接收器的重要性在于,它在同一阵列内结合了光学探测与内存编程。

康奈尔团队于 2026 年 6 月,在 IEEE/JSAP Symposium on VLSI Technology and Circuits 上展示了其可通过光学编程的 SRAM 接收器。已发布的会议摘要介绍了一款 28 纳米芯片,配备片上偏斜校准功能,实测能耗为每比特 0.7 皮焦耳。

传统光连接会将接收过程拆分为多个步骤。光电二极管首先将光转换为微弱电流,随后模拟组件对该电流进行放大,数字电路再恢复传输的比特。这些组件会增加接收端的能耗、芯片面积和设计复杂度。

He 和 Seo 改变了这一流程。他们将光电二极管置于改造后的 SRAM 单元内部。入射光产生的光电流足以改变每个被照亮单元中存储的状态。数据以空间图案的形式并行到达,每个明亮或黑暗的位置代表一个比特。

这一图案类似二维码,但这种类比也有局限。手机摄像头会先捕捉完整图像,再由软件解读像素;康奈尔的阵列则利用每个被照亮的位置,改变相应内存单元的状态。传输目的地本身也是探测器。

这一差异正是该设计的核心吸引力。AI 模型参数是大量数值的集合,决定模型如何将输入转换为输出。加速器在执行推理时会反复读取这些数值。让参数更靠近处理器,可减少获取它们所耗费的时间和能量。

该原型为两类常见内存分配了不同角色。动态随机存取存储器,即 DRAM,可在既定面积内存储更多数据,但需要定期刷新。SRAM 占用面积更大,却响应迅速,且通常靠近处理逻辑部署。

在研究人员提出的架构中,DRAM 仍位于光学发射器旁边,接收器则构成处理器本地 SRAM 的一部分。光图案将选定数据从较大的内存传送出去,并写入附近的阵列。

对准是一个直接的问题。台架上的发射器与接收器可能发生位移、倾斜,或处于不够理想的角度。因此,光学图案的不同部分到达指定单元的时间或位置可能略有不同。

该芯片使用参考框架和校准电路校正这种偏斜。在接收实际数据前,它会将预期像素位置与收到的图案进行比对。Seo 向 IEEE Spectrum 表示,直接点对点放置最为理想,不过校准机制可支持略微倾斜的链路。

演示中使用了穿过金属掩模的红光。该掩模生成了固定的 14×14 比特图像,这意味着演示期间发射器只能呈现一种物理图案。它并未将不断变化的模型参数流式传入运行中的机器人。

这一局限界定了实验与标题所述应用之间的距离。实用的发射器必须每秒数百万次改变其空间图案。研究人员正与光学团队合作开发一个目标达到千兆比特每秒传输速率的系统。

这篇光学接收器报道谨慎地看待这一差距。它描述的是一种未来可能更新 AI 模型的设计,而不是已经可部署的硬件。实测接收器是真实存在的,但端到端机器人链路仍属于未来工作。

尽管如此,测试证实了三项有用事实。光可在近一米距离内无线到达芯片;接收器将该图案转换为存储的数字状态;并且无需采用往往会削弱光链路能耗优势的标准模拟前端。

这些事实构成了核心张力。接收器从数据路径中移除了部分电路,但这种简化的代价是让每个参与的内存单元更大且具备感光能力。最终系统能否整体节能,取决于这种取舍在规模化后带来的收益。

真正的目标是 AI 的数据搬运成本

康奈尔的设计重点不在于让光更快,而在于模型权重传入处理器时避免反复转换。

AI 加速器会并行执行大量算术运算,但计算只是其工作负载的一部分。它们还需要持续供应模型参数和中间值。当这些数值存放在处理器外部时,每一次传输都会消耗时间和能量。

这一问题通常被称为“内存墙”。处理器吞吐量的增长速度快于外部内存供给数据的能力。当算术单元还在等待下一块参数时,增加更多算术单元的价值有限。

大型模型让这种失衡更加难以忽视。处理器通常无法将所有参数装入本地 SRAM。设计人员因此会将大部分参数存放在密度更高的片外内存中,并在需要时将选定数据块移入更快的内存。

金属连接仍是这些传输的标准路径。它们已被充分理解、具备可制造性,并兼容现有系统。但随着设计人员提高带宽或延长链路,其损耗和能耗需求也会增长。

光互连提供了另一条路径。光可通过并行空间通道、波长或光纤承载多路数据流,也能在更长距离上传输,而不会产生与金属布线相关的电损耗。

接收器历来削弱了这一论点。光仍须在目的地转化为可用的数字信息。跨阻放大器会将光电二极管的电流转换为电压,额外电路则负责放大、采样和恢复数据。

康奈尔的接收器试图消除大部分终端处理工作。每个感光 SRAM 单元既是探测器,也是存储位置。该设计并非只是通过光学方式承载信息,而是改变了转换和写入发生的位置。

这一差异使该项目区别于用光执行神经网络算术运算的系统。光学计算研究通常利用光子结构执行矩阵运算;康奈尔瞄准的则是将数字参数移入电子内存的过程。

这种区别对落地至关重要。替换整个电子处理器会带来大量软件、制造和精度问题;替换一条数据链路则是更狭窄的集成挑战,尽管仍然困难。

一项 2020 年的光学内存综述将能耗、速度和物理尺寸列为实用光学内存的主要衡量指标,也指出扩展规模始终是一项障碍。康奈尔的原型属于这一更广泛的努力,但其存储状态仍保持为电子形式。

这种混合结构具有现实逻辑。电子 SRAM 已能在处理器附近提供快速随机访问。研究人员为选定单元增加光学可编程性,而不是要求光子以光子的形式持续存储。

对于机器人而言,所设想的优势涉及模型分发。一座仓库可能运行多台使用相同感知或导航模型的机器。通过电连接器或无线电链路更新每台设备,会消耗基础设施、能源和维护时间。

架空光学发射器可向视野内的机器发送新的参数块。每台机器人都能将该数据块直接接收至本地内存。这一概念类似视觉广播,但载荷将是可执行的模型数据。

微型机器人是第二种可能的应用场景。它们的物理尺寸限制了内存容量和电池体积。基于光的链路可在不增加有线连接器的情况下传递新参数,尽管接收器当前的单元尺寸同样与这一空间限制相冲突。

数据中心则代表另一种规模。其加速器已经依赖复杂的内存层级和高带宽链路。若能与高密度封装和现有调度系统集成,减少接收器开销的光学路径或可降低通信能耗。

因此,竞争压力指向传统电内存链路,而不是某一家特定芯片公司。这类链路拥有数十年的优化积累,也受益于成熟的封装、测试、纠错和供应链。

光学替代方案必须击败一个不断演进的目标。电接口持续改进其信号传输、封装和电源管理。高带宽内存将 DRAM 在物理上放得更接近加速器,从而缩短数据必须传输的距离。

康奈尔的方法提出了不同的主张。它不是优化电学路径,而是改变接收操作。光不会止步于探测器,然后等待传统电子设备完成传送。

因此,这一能耗数字值得关注,但不应孤立看待。接收器的每比特皮焦耳数并未涵盖发射器、光源、对准硬件、校准、冷却或模型更新软件。系统级结果比单一芯片测量更重要。

光如何在没有模拟前端的情况下翻转内存

该设计通过让内存单元直接响应光来提升效率,而非将整个 AI 处理器变成光子计算机。

SRAM 单元使用一个小型电路存储一个比特,其两种稳定状态分别表示零和一。与需要反复刷新操作的 DRAM 不同,SRAM 在通电状态下可保持该数值。传统 SRAM 单元无需探测光。

康奈尔的设计为每个参与的单元增加了光电二极管。当光子在半导体结构中产生载流子时,光电二极管便会产生电流。该光电流会推动单元转向由入射光学图案编码的状态。

空间调制提供并行能力。发射器并非通过一条光通道依次发送每个比特,而是呈现由明暗位置构成的二维场。每个位置对应一个接收器单元。

这种布局解释了其类似二维码的外观。两套系统都通过矩阵编码信息。不过,Cornell 的接收器不会拍摄完整阵列以便后续处理。该矩阵会在接收过程中直接写入目标单元。

这一方法还省去了对有效载荷进行数模解读的步骤。某个位置要么明亮、要么黑暗,对应一个二进制值。校准仍需确定该值应当出现的具体位置和时机。

随着传输加速,时序误差会变得更难处理。光线可能经由长度或强度略有差异的路径到达不同单元。制造差异也会改变各个光电二极管和晶体管的响应方式。

片上偏斜校准可解决其中一部分问题。接收器利用已知参考信息估算空间和时序偏移,随后将接收到的数据与预定单元位置对齐。

对于机器人而言,这并非可有可无的实验室级优化,而是必不可少的要求。机器会移动、振动、积尘,并面临不断变化的照明条件。只能在经过精确对齐的红光下工作的固定接收器,实际应用价值有限。

因此,该原型接近一米的传输距离值得关注,但仍不完整。研究人员证明了自由空间光可以在无需物理线缆的情况下到达阵列,但并未展示其在运动、遮挡或工业照明环境下的持续运行能力。

量产设计还需要不同的发射器。金属掩模证明接收器能够区分一种空间编码,但无法生成流式传输模型参数块所需的连续变化帧。

下一代发射器或许会采用高速切换的微显示器、调制器阵列或其他光学结构。无论选择何种方案,其能耗都应纳入最终效率计算。快速变化也会提高对同步和错误处理的要求。

报告中的目标是每秒数百万次图像变化,以及每秒数吉比特的数据传输。达到这些水平,将使这项静态写入内存实验转变为通信链路。只有能够可靠地持续实现这些指标,才有意义与电气替代方案进行比较。

模型更新还带来另一项技术问题。AI 参数并不是无序位图就能发挥作用。控制器必须将其拆分为帧、识别目标位置、验证完整性,并防止不完整传输损坏正在使用的模型。

因此,接收器需要配套的数字逻辑。这些逻辑可以缓冲更新、检查错误,并在不同模型版本之间切换。这些操作并不会抹去光学方案的优势,但会降低将接收器测量结果视为完整系统成果的合理性。

一旦光线承载可执行参数,安全性也会进入设计考量。可见光链路暴露出清晰的物理路径,有助于运营者划定授权更新区域。然而,若攻击者能够注入或篡改光信号,就可能试图破坏机器人的模型。

身份验证和完整性检查仍然必不可少。系统必须验证更新由谁发送,并确认每个参数均未被篡改。光学传输无法取代密码学控制。

安全方面也是如此。移动机器人不应在执行关键动作途中更换其感知模型。部署软件需要制定规则,规定新参数何时可以进入活动内存。

这些配套要求表明了该硬件能解决与不能解决的问题。它提供了一条从光到存储比特的低能耗路径,却无法提供车队运营者所需的完整模型管理层。

近期的光子系统分析将光学硬件置于多个距离尺度中考察,涵盖芯片封装到数据中心链路。Cornell 的自由空间接收器探索了这张图谱中的一个特殊位置:它将短距离无线光学与处理器本地内存结合起来。

这一定位可能适合受控环境。仓库可以安装顶部发射器并标记更新区域;工厂可以安排机器在已对齐的发射器下方运行;数据中心封装则可能在无需移动对齐的情况下采用固定光学几何结构。

消费级机器人面临更严峻的考验。家庭环境中存在障碍物、多样照明、移动的人群以及不一致的摆放位置。接收器可能恰好在更新开始时失去视线连接。

因此,这一机制在物理条件受控的场景中最具说服力。若它能形成首个可行市场,该市场更可能类似工厂单元,而非不受限制的家庭环境。

更大的单元可能抹去能耗优势

接收器最大的风险在于物理密度,因为每个光电二极管都会占用传统 SRAM 原本用于存储的空间。

IEEE Fellow、密歇根大学工程学教授 Dennis Sylvester 赞赏了该项目对问题的选择,并称这一方法很巧妙。他也指出了核心弱点:光敏单元比普通 SRAM 单元更大。

更大的单元会减少芯片可容纳的内存量。处理器若要保持原有容量,可能需要更大的芯片面积,从而提高成本,并可能增加能耗。或者,设计人员可以接受更少的本地内存,并进行更多外部传输。

这两种结果都可能抵消接收器的效率优势。如果本地容量下降导致系统必须移动更多比特,那么接收每个比特节省的能耗就没有那么重要。正确的比较必须涵盖面积、容量和工作负载行为。

Seo 表示,晶体管和电路优化可以缩小这些单元。未来制造工艺也可能通过互补金属氧化物半导体缩放带来帮助,从而减小某些电路尺寸。但这两条路径都无法保证能与标准 SRAM 达到同等水平。

光电二极管具有普通晶体管没有的物理要求。它们需要足够的感光面积来收集可用电流。缩小这一面积可能降低灵敏度,或要求更强的照明。

这就形成了密度、光功率和可靠性之间的三方权衡。更小的探测器可保留更多内存容量;更大的探测器可收集更多光线,并容忍较差的对齐条件;更亮的发射器则会消耗更多能量。

0.7 皮焦耳的测量结果针对的是测试条件下的接收器阵列。它并未解决这种系统级权衡。独立测量还需要纳入光源以及改变图案的硬件。

该原型同样缺少实现预定用途所需的动态发射器。静态掩模呈现出干净的光学图案,帧与帧之间不存在转换。高速调制会引入开关噪声、时序裕量和发热问题。

比特错误性能是另一个尚未回答的问题。模型参数中一个错误比特造成的影响,可能从几乎可以忽略到相当严重。运营者需要测得在不同距离、角度、振动、温度和环境光条件下的错误率。

纠错可以提高链路安全性,但会增加冗余比特和计算量。重复传输也会消耗额外能量。在纳入这些保障措施后,该系统仍必须优于电气传输方案。

视线连接构成另一项独立的运行约束。机器人可能将接收器转离发射器;设备、人员或库存物品可能中断光束;反射路径则可能扭曲空间图案。

校准可以修正有限范围内的倾斜和位置差异,但无法在没有另一条路径或发射器的情况下恢复被阻断的链路。实际部署可能需要多个发射器、更宽的视场或预定的停靠位置。

这些补充配置会改变商业逻辑。与物理连接器相比,无线光学接收器听起来对基础设施要求较低;但多个发射器、对齐系统和受保护的更新区域,可能使安装变得更复杂。

该技术还必须证明其能够支持实用的模型规模。一个 14×14 比特帧仅包含 196 比特。即使压缩或量化减少了分配给每个值的比特数,现代 AI 模型仍包含远多于此的参数数据。

每秒千兆比特的链路会显著改善这一计算结果。然而,模型分发时间取决于完整有效载荷、重传次数以及服务的机器人数量。该研究尚未报告端到端的车队更新。

因此,“动态更新”的定义需要谨慎。它可以指无需打开机器外壳或连接线缆即可更新机器,但目前不应被理解为机器人工作时持续替换庞大的活动模型。

更新参数与本地学习之间也存在差异。光学接收器传输的是在其他地方生成的数值,并不训练机器人的模型、评估新样本,或决定哪些参数应当改变。

这一区别避免了对项目的夸大表述。该硬件关注的是模型交付,而非自主学习。它的价值取决于在目标系统中,模型交付是否已成为显著的能耗或维护瓶颈。

竞争性解决方案也不会停滞不前。工程师可以压缩模型、缓存常用数值、改进电气链路,或在处理器旁配置更多内存。每种方案都从不同方向应对同一笔数据移动成本。

存内计算提供了另一条路径,即在数据已存储的位置执行部分计算。Cornell 研究人员和其他团队已经为此探索了模拟内存硬件。光学传输可以与此类系统互补,但必须证明其额外面积是值得的。

Seo 的AI 硬件研究涵盖机器学习加速器和硬件感知算法。这一背景契合该项目对高成本接口的聚焦,也凸显出工作负载测试比单独测试接收器更重要的原因。

怀疑论者的观点并非光线无法写入阵列。该原型已经支持这一基本主张。悬而未决的问题是,在计入每一个必要组件后,完整的光学更新系统是否仍能保留其测得的优势。

三项测试将决定机器人是否通过光接收 AI

动态发射器、密度改进和端到端机器人测试,将决定该接收器能否从电路成果变为完整系统。

第一个信号是能够每秒数百万次改变其光学矩阵的发射器。这是研究人员指出的直接技术依赖。没有它,接收器就无法流式传输不断变化的模型参数块。

后续演示应报告跨越多帧的持续吞吐量、发射器能耗和错误情况。可信的每秒千兆比特链路将强化这样一种观点:空间光学编程能够承载真实 AI 有效载荷。若无法超越静态掩模,机器人应用叙事将被削弱。

第二个信号是更小的接收器单元。未来论文应将光敏单元的面积与在类似条件下制造的传统 SRAM 进行比较,还应展示缩小光电二极管会如何影响灵敏度和照明要求。

密度方面的进展将强化该项目的核心权衡。这意味着处理器可以获得光学可编程性,而无需牺牲过多本地内存。若改进有限,则会支持 Sylvester 的担忧:容量降低抵消了通信节能。

第三个信号是在移动或运行中的机器上完成端到端更新。测试应包括模型有效载荷、完整性检查、不断变化的对齐条件、环境光,以及经过测量的总能耗预算。

仓库试验将尤其具有参考价值。研究人员可以在光学发射器下方布置多台机器人,分发一次感知更新,并测量完成时间和传输失败次数。结果应与当前的有线或基于无线电的方法进行比较。

这样的试验也能明确“on the fly”的含义。一项有价值的演示应说明机器人是暂停、停靠,还是继续移动;还应报告软件如何在不让机器暴露于部分写入版本的情况下激活完整模型。

这些测试的重要性不止于一种接收器。AI 硬件正越来越多地将能量消耗在信息传输而非算术运算上。每一次可信的数据移动减少,都能让系统设计人员在更大缓存和更高密度封装之外多一种选择。

光学技术早已在电信网络和数据中心中传输数据。让光更接近处理器内存是合乎逻辑的延伸,但距离越短,集成要求就越高。芯片级的经济性几乎不容忍面积浪费。

Cornell 的方法之所以有趣,是因为它并未要求光取代所有电子功能。它为光分配了一项明确任务:将数字值直接写入高速本地内存。电子电路仍负责存储状态和运行模型。

这种分工或许会让该系统比全光子处理器更易于采用。但这也意味着,接收器必须与标准芯片设计、封装和软件共存。兼容性的重要性可能不亚于纯粹的效率。

对于开发者而言,眼下的启示并不是围绕天花板安装的 LED 重新设计机器人更新系统。这项工作仍是研究原型。它目前的价值在于表明,光学接收器本身可以成为可写入内存。

对于企业采购方,正确的问题应聚焦于完整的运营成本。一座设施需要多少发射器?光束被遮挡时会发生什么?车队在更新中断后能多快恢复?

研究人员应在下一项芯片成果发布时一并公布这些系统层面的测量数据。仅凭接收器能耗不足以证明商业价值。密度、发射器功率、纠错能力和部署基础设施必须纳入同一套成本核算。

IEEE Spectrum 提出了一种可信的机制,也指出了同样可信的限制。该机制通过让光直接改变 SRAM,省去了模拟接收阶段;限制在于,感光内存会占用稀缺的芯片面积,而且仍缺少高速发射器。

下一项里程碑应在一次实验中连接这两方面。值得关注的是可变化的光学阵列、更小的存储单元,以及机器人在运行期间接收经验证模型的能力。如果 Cornell 能报告这三项成果,光学模型交付就值得在实验室之外获得考虑。否则,这一原型仍将是一个巧妙的答案,其整体系统成本依然没有定论。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page