top of page

Pathway BDH 架构在 SageMaker HyperPod 上挑战基于 Token 的推理

5小时前
讀畢需時 15 分鐘

Pathway 已在 Amazon SageMaker HyperPod 上扩展其拥有 1.5 亿参数的 BDH-CQ 模型,对“更强推理能力需要更长的生成 Token 链”这一假设提出挑战。Pathway BDH 架构转而在循环潜在状态内部执行迭代计算。其最新结果在 ARC-AGI-1 上达到 29.5% 的 pass@2,同时创下新的已报告效率水平。

这一结果并未让 BDH-CQ 跻身该基准表现最高的通用模型之列。它带来了另一种压力。Pathway 认为,推理效率取决于架构,而不只是模型规模、上下文长度或更大的推理预算。

因此,这里比较的是两种计算策略。Transformer 推理模型通常会生成中间 Token,将其作为书面的计算工作区。BDH-CQ 则更新内部状态,在其中探索候选变换,并且只解码其提出的答案。

Pathway 使用 Amazon SageMaker HyperPod、H200 GPU、Elastic Fabric Adapter 网络和 EC2 UltraClusters 开发了该架构。AWS 于 2026 年 9 月 8 日发布了对这项工作的介绍。部署细节之所以重要,是因为非 Transformer 研究模型仍需能在现有 GPU 基础设施上运行,才能成为可行的替代方案。

这一基准结果的范围仍比 Pathway 更宏大的架构主张更窄。ARC-AGI-1 测试的是陌生的视觉变换,而不是通用语言使用或长时间运行的企业代理。关键问题在于,BDH-CQ 的效率能否在更难的任务、更大的模型、独立复现以及 ARC 环境以外的工作负载中保持下来。

Pathway BDH 架构达到新的效率水平

重要变化不在于 BDH-CQ 赢得了 ARC-AGI-1,而在于它以紧凑模型改变了该基准的成本—准确率边界。

Pathway 的 BDH-CQ 论文报告称,其在包含 400 项任务的公开 ARC-AGI-1 评估集上取得了 29.5% 的 pass@2 分数。Pass@2 意味着,系统的两项排序答案中只要有一项正确即可获得计分。

该模型在这一评估方法下回答正确了 400 项任务中的 118 项。其 pass@1 结果为 24.25%,即仅使用第一个候选答案时正确解决了 97 项任务。

Pathway 在所报告的运行点上测得,每项任务约消耗 0.85 H200 GPU 秒。研究人员表示,没有任何绘制出的系统能以相同或更低的已报告推理成本达到至少同等的准确率。

这一主张描述的是帕累托前沿,即提升一项指标必须牺牲另一项指标的配置边界。在这里,两项指标是任务准确率和推理成本。

BDH-CQ 并未在排行榜上取得最高分。相反,它占据了一个此前空白的区域:实用准确率与异常低的计算量在此交汇。

这一差异很重要,因为头条式的基准报道往往会将性能简化为单一排名。生产系统面对的是更广泛的优化问题,涉及准确率、吞吐量、延迟、硬件利用率和运营成本。

一个对每次请求都使用大量测试时计算的模型,在能力图表上可能显得很强。但当应用需要处理大量请求,或必须在严格延迟限制内响应时,这种做法就更难证明其合理性。

ARC-AGI-1 为每个系统提供若干展示未知视觉变换的输入—输出示例。系统必须推断规则,并将其应用于新的网格。每项任务都可能要求理解涉及对象、颜色、位置、计数、对称性或拓扑关系的不同关系。

这种格式测试的是上下文中的技能习得。系统不能只依赖识别固定的任务标签,因为所需变换必须从示例中推断出来。

BDH-CQ 将这些示例作为对循环记忆的更新进行处理。随后,它会在不更新已训练参数的情况下,对查询应用迭代计算。

研究人员还在 ConceptARC 上测试了该系统;该基准将视觉变换归为 16 个概念类别。BDH-CQ 在 160 项任务上的 pass@2 达到约 60%,具体取决于标识符是否带有语义含义。

这些结果揭示了能力分布并不均衡。包括边界延伸和上下空间关系在内的一些类别取得了较强分数,而复制与排序仍困难得多。

AWS 文章中有一处值得注意的数值不一致:其基准标题和正文引用的是 29.2%,而 Pathway 的论文、评估表和公告均报告为 29.5%。

该论文提供了更详细的统计,包括 400 项任务中解决 118 项。这一比例支持本文采用的 29.5% 数字。

该基准也是公开且成熟的,但模型评估并非开放权重复现。隶属于 Bielik 和纽约大学的共同作者对已部署服务进行了黑盒审计。

根据论文,该审计在有记录的协议下复现了 29.5% 的结果。审计人员未获得模型权重访问权限。

这为托管系统的输出提供了有用验证,但并不能独立确认究竟是哪个架构组件产生了这一结果。

因此,最好将 Pathway 的成果视为一个已验证的运行点,其因果解释尚未明确。效率是可测量的,而更广泛的后 Transformer 结论仍需要比较实验加以验证。

潜在推理移除了必须生成 Token 轨迹的要求

BDH-CQ 将语言视为输入与输出接口,而非每一步中间推理所必需的媒介。

许多当前推理系统通过生成更多 Token 来分配更多计算。模型生成一条中间陈述,将该陈述作为上下文读取,然后以自回归方式持续处理,直至得出答案。

这种思维链过程提供了灵活的计算工作区,但也将额外计算与串行文本生成绑定在一起。

每个中间 Token 都必须投射到离散词汇表中,随后被生成、存储和使用,之后才能生成下一个 Token。

这一机制在延迟和上下文使用上带来显性成本。更长的推理轨迹还会扩展键值缓存,后者在生成过程中存储早期 Token 的注意力信息。

Pathway BDH 架构采用了不同路径。其原始设计将计算表示为类神经元粒子图中局部交互的结果。

该模型使用高维正激活、低秩通信、线性注意力和循环联想状态。原始 BDH 论文将模型状态描述为该图中连接关系的变化。

BDH-CQ 将这一架构适配用于上下文视觉推理。示例会修改循环记忆,而查询则在连续潜在工作区中通过重复变换处理。

潜在空间是模型的数值内部表征。迭代潜在推理意味着系统在解码答案前反复更新这一表征。

模型无需将每个局部假设都转换为自然语言 Token。它可以以连续形式保留尚未完成的变换、相互竞争的候选项和中间结构。

这一差异的重要性不止于隐藏书面的思维链。隐藏的 Token 序列仍会通过词汇表进行串行计算。

BDH-CQ 改变了输入与答案之间所使用的计算底层机制。Pathway 表示,活跃神经元群体可以同时表示不同的候选解。

该架构还将上下文记忆与查询计算分离。示例首先塑造记忆状态,查询随后在循环推理期间使用该状态。

推理期间不会发生参数更新。不断变化的循环状态充当工作记忆,而不是对模型权重进行永久再训练。

AWS 表示,通常在任一时刻只有约 5% 的 BDH 神经元处于活跃状态。稀疏激活能够减少不必要的计算,因为大部分特征空间在每一步中保持非活跃。

Pathway 还表示,BDH 可以处理额外示例,而其内存消耗不会像 Transformer 上下文那样增长。这一主张需要谨慎解读。

系统仍具有有限的表征容量。固定大小的循环记忆可以压缩更长的序列,但压缩可能丢失信息或造成干扰。

Transformer 会明确保留 Token,直至它们离开上下文窗口。BDH 则更新不断演变的状态,以显式保留换取紧凑持久性。

这种取舍同时带来机遇与不确定性。紧凑状态可以支持更长的交互,而无需持续增长的 Token 缓存;但它也可能使从早期上下文中精确检索信息变得更困难。

“受大脑启发”这一标签同样应谨慎看待。BDH 借鉴了局部交互、稀疏激活、Hebbian 学习以及类似突触的状态更新。

这些属性提供了有用的设计类比,但并不意味着该系统复现了人脑的生物机制。

该架构仍通过传统加速器上的数值运算实现。它的相关性来自循环与稀疏性的计算后果,而不只是这一隐喻。

Pathway 的核心主张更为狭窄,也更容易测试:推理不必被串行化为语言,循环潜在工作区可以将推理时学习与迭代计算结合起来。

其他研究人员也在探索连续思维、循环深度和小型递归推理系统。BDH-CQ 加入了这一更广泛的转向:不再将 Token 生成视为测试时计算的唯一实用途径。

其独特贡献在于,将受示例条件化的记忆与潜在循环结合到一个紧凑系统中。ARC 任务提供了一个受控环境,用于测试这一组合能否应用新近推断出的规则。

这种方法也改变了可观测性。生成的推理轨迹可供阅读,尽管它未必忠实反映模型的内部计算。

潜在轨迹则更难由人直接检查。Pathway 认为,稀疏、正向且与概念关联的内部状态可以提供另一种可解释性形式。

这一承诺仍未完成。研究人员将需要能够把不断演变的潜在状态与真实任务中稳定的概念、决策和失败模式联系起来的工具。

SageMaker HyperPod 将非同寻常的模型变为分布式工作负载

Pathway 的基础设施选择表明,替代性架构仍需适配围绕 Transformer 训练构建的 GPU 系统。

一个有前景的方程本身并不会成为生产模型。研究人员需要分布式训练、快速通信、可重复运行、故障恢复,以及对资源利用率的可见性。

Pathway 在开发 BDH 和 BDH-CQ 时使用了 Amazon SageMaker HyperPod。该服务为跨大型 GPU 集群进行分布式训练和推理提供托管集群。

HyperPod 开发报告介绍,Pathway 使用配备 NVIDIA H200 GPU 的 EC2 p5en.48xlarge 实例运行系统。这些实例部署在 EC2 UltraCluster 中。

每个实例支持高达每秒 3,200 吉比特的网络性能。Amazon Elastic Fabric Adapter 连接各个节点,并与 NVIDIA 的 Collective Communications Library 集成。

这一网络层负责在 GPU 之间传输模型权重、激活值、梯度和训练数据。通信效率不佳会让昂贵的加速器等待其他节点。

相较于稠密 Transformer,BDH 呈现出略有不同的扩展问题。Pathway 将其描述为主要沿单一高维神经元轴进行扩展。

其局部且稀疏的交互旨在避免每个计算步骤都激活所有特征。不过,GPU 实现仍需将这些属性转换为张量操作和集体通信。

Pathway 集成了 PyTorch,而非要求使用一套全新的软件环境。这种兼容性降低了研究人员测试该架构的运维门槛。

团队还使用了 Amazon Managed Service for Prometheus 和 Amazon Managed Grafana。这些工具在分布式实验期间收集并展示集群指标。

当模型架构本身仍在开发时,可观测性尤为重要。性能放缓可能源于数学设计、张量实现、网络拓扑、数据管线或硬件配置。

GPU 利用率可反映加速器是否始终处于忙碌状态。内存指标则显示状态或激活值在何处形成压力。通信测量会揭示节点之间的同步延迟。

这些信号可帮助研究人员区分架构弱点与基础设施瓶颈。当后续版本改变模型内部组织方式时,它们也有助于保证可复现性。

AWS 将 HyperPod 定位为负责预置、扩展、网络和集群韧性的一层。因此,Pathway 的研究人员可以投入更多时间测试架构,减少维护分布式基础设施的时间。

这种分工同样有利于 AWS。目前,大多数基础模型训练需求仍来自 Transformer 的各种变体,但云服务提供商希望其基础设施能够支持未来可能出现的任何架构。

若一种后 Transformer 系统能在 H200 集群上高效运行,将进一步凸显现有加速器集群的价值。客户无需放弃熟悉的工具和网络,即可探索不同的模型架构。

不过,使用标准 GPU 也可能限制架构本身。硬件和软件库更偏向稠密矩阵运算、可预测的内存访问以及成熟的并行化模式。

具有稀疏局部交互的生物启发式图结构,并不会自动高效映射到这些假设之上。因此,适配 GPU 的 BDH 表述是 Pathway 工作中的关键部分。

公开报告并未提供完整的训练运行概况。它没有披露集群规模、总训练时间、能耗、平均利用率,或不同节点数量下的扩展效率。

AWS 表示,HyperPod 可针对合适的工作负载实现接近线性的扩展。文章并未提供 Pathway 专属的扩展曲线,以独立证明 BDH-CQ 达到了这一结果。

这些缺失的信息限制了其与 Transformer 训练的比较。高效的 ARC 推理结果并不能证明 BDH 在同等能力下训练成本更低或速度更快。

它同样无法证明,稀疏性是否能在当前 GPU 上带来成比例的节省。即便能降低理论运算量,不规则的稀疏操作有时仍会导致硬件利用不足。

未来的基础设施证据应包括端到端吞吐量、加速器利用率、通信开销和扩展行为。比较时应尽可能保持数据、硬件和模型质量一致。

对于企业团队而言,这一区别具有实际意义。训练效率、服务效率和任务准确率是彼此独立的衡量指标。

一种模型可能训练缓慢,但服务成本低廉。另一种可能训练高效,却需要庞大的推理时搜索。架构决策必须考虑整个生命周期。

Pathway 的 HyperPod 工作证明了其在现代分布式技术栈上的可行性。但它尚未证明该方案在整个生命周期中具有优越性。

这种开发模式的价值并不局限于 BDH。探索陌生架构的团队需要详细记录代码、配置、训练数据、失败案例和评估变化。

可搜索的工程知识库能够在长期实验项目中保留这些背景。仅靠基础设施遥测数据无法解释研究人员为何修改模型。

ARC-AGI-1 同时揭示了优势与局限

BDH-CQ 的结果支持其在视觉抽象任务上的效率主张,而非宣告 Transformer 推理已被全面取代。

ARC-AGI-1 的价值在于,其任务要求系统从少量示例中学习陌生的变换规则。答案具有精确性,错误也可通过视觉方式检查。

这一基准也限制了将事实记忆作为捷径的可能。彩色网格不会因为模型记住了互联网上大量文本而给予奖励。

这些特性使 ARC 成为检验上下文学习与迭代推理互动关系的合理测试。但它并不是衡量智能的完整标准。

BDH-CQ 使用了混合训练数据,其中包括公开的 ARC-AGI-1 训练集、RE-ARC、ConceptARC、ARC-Heavy、ARC-GEN100K,以及私有策划样例。

论文称,评估任务的示例对和任务标识符已被排除在训练之外。不过,该模型仍是在更广泛的 ARC 问题分布中进行优化。

这种专门化使其不同于同一成本—准确率图表中列出的通用商业模型。这些系统还必须支持语言、编程、工具使用、事实问答及许多其他工作负载。

因此,这一比较回答的是一个有价值但受限的问题:系统能以何种效率,在特定准确率水平上解决这些视觉规则归纳任务?

它并未回答一个拥有 1.5 亿参数的 BDH-CQ 模型能否取代通用推理模型,也未衡量围绕该架构构建完整助手的成本。

行为分析进一步强化了这种谨慎解读。BDH-CQ 在测试变化中能够可靠处理简单的传播和复制干预。

排序和更深层的嵌套则带来了更明显的失败。提供匹配示例改善了部分结果,表明该模型难以外推到示例所展示的关系深度之外。

这些模式具有参考价值,因为它们揭示了结构化的局限。单一汇总分数会掩盖错误究竟来自感知、规则选择、组合还是执行。

Pathway 的受控干预表明,BDH-CQ 能从示例中绑定部分可复用操作。但它们也显示,将这些操作进行组合和排序仍然困难。

这正是它与基于 Token 的推理之争变得更复杂的地方。语言模型可以使用显式草稿区,将嵌套问题拆解为具名的子步骤。

潜在推理避免了 Token 成本,但它必须发展出同样可靠的内部组合、检查与纠正机制。由于中间状态缺少直接标签,这些机制很难监督。

可见的思维链并非完美解决方案。模型可能生成看似合理的解释,但这些解释未必忠实反映其答案背后的计算过程。

不过,生成文本仍为开发者提供了提示、干预和调试的接口。循环式潜在状态则需要不同的控制和监测工具。

评估方法还带来了另一个疑虑。BDH-CQ 的推理成本来自测得的硬件时间,而部分对比系统使用的是报告的 API 成本或排行榜估算。

这些量彼此相关,但并不完全相同。服务商利润率、批处理、利用率和硬件核算方式都可能改变每个系统的表面位置。

因此,成本前沿应被解读为一项报告中的基准比较,而非普遍规律。在标准化硬件上进行复现,将使架构比较更具说服力。

开放访问同样会有所帮助。Pathway 提供了一个示例实现,但完整的 BDH-CQ 服务尚未以可复现的权重和训练材料形式发布。

黑箱审计确认了已部署系统的输出。开放检查点将使独立团队能够在自身条件下检验准确率、延迟、内存使用和失败模式。

AWS 的文章还将这一结果延伸至网络安全调查、交通协调、工业运营和长期运行的自主代理。这些是合理的未来方向,而非已证明的部署案例。

每项应用都引入了 ARC 中不存在的要求。网络安全需要证据追踪和对抗性韧性。交通系统需要安全约束和实时可靠性。

工业控制涉及现实物理后果。长期运行的代理则需要持久记忆、工具治理、从错误中恢复的能力,以及针对恶意输入的防护。

模型能够推断视觉变换,并不代表其已准备好应用于这些场景。两者之间的联系必须通过面向应用的评估和受控部署来验证。

下一个基准同样重要。ARC-AGI-2 被设计得更困难,也更能抵抗那些在原始语料库上表现出色的任务专用方法。

Pathway 已将更困难的 ARC 任务、语言推理、数学和约束满足列为未来方向。这些类别上的结果将显示其效率优势是否能够迁移。

最可信的解读既不是否定,也不是宣告胜利。BDH-CQ 证明了紧凑的循环潜在系统能够在某一推理基准上占据一个有意义的位置。

它挑战了这样一种假设:推理能力的每一次有用提升都必须表现为更多生成文本。但它并未证明潜在循环能够扩展到现代基础模型相关的全部能力。

三个信号将决定 BDH-CQ 能否迁移

Pathway 现在需要证明,其效率结果能够经受更困难的评估、更大规模的实现和独立访问的检验。

第一个信号是在 ARC-AGI-2 或其他更困难、抗污染的推理基准上的表现。如果它在这些基准上仍具备有竞争力的效率表现,将加强 BDH-CQ 学到了可迁移推理机制的论点。

若性能急剧崩溃,则表明其优势在很大程度上依赖 ARC-AGI-1 的视觉词汇和训练分布。仅有准确率还不够。

Pathway 应发布任务级结果、推理计算量、候选生成方法和失败类别。这些细节将揭示,扩展究竟提升了泛化能力,还是仅仅在熟悉的变换上投入了更多计算。

第二个信号是在视觉谜题之外进行端到端评估。数学、语言推理、约束满足或交互式工具使用,都会测试该架构承诺的不同部分。

语言任务将检验循环记忆是否能保留精确指令和证据。数学将测试多阶段组合与验证。

约束问题将检验潜在递归能否在大量相互依赖的决策中维持全局一致性。工具使用则会引入不确定的观测、外部故障和不断变化的状态。

成功的结果应当在对齐的硬件条件下,将 BDH-CQ 与强大的 transformer 和循环模型基线进行比较,并报告准确率、延迟、吞吐量、内存占用和总推理计算量。

这些证据将强化 Pathway 关于优势源自架构的主张。若缺乏匹配的基线,训练数据和系统工程仍是合理的替代解释。

第三个信号是更广泛的独立可复现性。研究人员需要获得足够的访问权限,以便在托管的黑盒评估之外检视模型行为。

模型权重、详细的架构规格、评估代码或稳定的公共 API,任何一项都能提升审查力度。完整披露训练数据可能仍不现实,尤其是在涉及私有样本的情况下。

至少,独立评估者应能运行未由 Pathway 选定的新任务,并且还应直接测量硬件使用情况。

随着系统混合使用专用模型、通用 API、搜索流程和不同的核算方法,基准测试方法必须保持透明。只有坐标可以比较,前沿才有意义。

这三个信号应按这一顺序出现。更难的基准测试检验核心主张;新领域检验迁移能力;独立访问检验结果能否在 Pathway 自身环境之外成立。

SageMaker HyperPod 在整个过程中仍将具有相关性。将 BDH 从紧凑的 ARC 模型扩展到更大的系统,需要稳定的分布式训练和审慎的性能测量。

云平台并不是该架构必然成功的证据。它是让 Pathway 得以运行必要实验、从而找出答案的基础设施。

对开发者而言,眼前的启示并不是替换 transformer 技术栈,而是将 token 生成视为一种可能的推理机制,而非不可避免的唯一选择。

对企业采购方而言,这一结果提供了提出更精确问题的理由。每单位任务性能需要多少计算量?这种关系在真实工作负载下是否依然成立?

团队还应询问:当系统失败时,有哪些证据可以被检视?潜在推理能够减少 token 开销,但也会增加对新型诊断接口的需求。

Pathway 的 BDH 架构之所以值得关注,是因为它将一种理论替代方案转化为可测量的系统。其在 ARC-AGI-1 上取得的 29.5% 成绩,在专门化评估范围内界定了一条真实的效率前沿。

下一步需要的是更严格的验证,而不是更宽泛的口号。应关注 ARC-AGI-2 的结果、匹配的跨领域比较,以及对 BDH-CQ 的可复现访问。

如果这些信号一致,潜在循环推理将成为生产级 AI 中一种严肃的架构选项。否则,BDH-CQ 仍将是一项有价值的实验,展示专门化能够将单一基准前沿推进多远。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page