Qualcomm 与 Multiverse 开始测试 Dragonfly 的软件能力
- Ethan Carter

- 1天前
- 讀畢需時 15 分鐘
Qualcomm 和 Multiverse Computing 因一项计划进入 Google News 报道:双方将为计划在 2026 年和 2027 年陆续推出的两款 Dragonfly 加速器优化 AI 模型。据报道,此次合作将模型压缩技术与 Qualcomm 的新数据中心硬件结合起来,旨在解决一个棘手问题:如何将颇具吸引力的加速器规格转化为可用且经济的推理系统。
这一合作之所以重要,是因为 Qualcomm 正在挑战一个由 Nvidia GPU 及其软件生态主导的 AI 基础设施市场。内存容量和能效固然能吸引关注,但模型可用性往往决定客户能否迁移。Multiverse 为 Qualcomm 带来了一家专注于让已训练模型更小、更易部署的专业合作伙伴。
不过,现有报道并未证实量产基准测试结果、已点名的优化模型、客户部署情况或商业条款。两家公司都尚未公开足够细节,因此不能将此次合作视为已经验证的性能成果。更恰当的解读是:这是一项整合集成承诺,其价值取决于合作伙伴接下来发布什么。
Dragonfly 合作实际改变了什么
在 Dragonfly AI200 和 AI250 面临最重要的部署考验之前,Qualcomm 正在引入模型优化合作伙伴。
Google News 的条目称,Multiverse Computing 与 Qualcomm 正合作,为 Dragonfly AI200 和 AI250 加速器优化 AI 模型。这一表述指向芯片之上的工作。Multiverse 并非以芯片供应商、服务器制造商或数据中心运营商的身份出现。
其潜在贡献来自 CompactifAI,这是一套基于张量网络的模型压缩系统。张量网络是一种数学表示方法,可将大型多维数组分解为较小、彼此连接的组件。Multiverse 利用这种方法识别并压缩已训练神经网络内部的冗余结构。
Qualcomm 提供推理硬件及其部署软件。推理是指训练完成的模型处理新提示词、图像或其他输入的阶段。它不同于训练;训练会使用大型数据集和大量计算资源来调整模型内部参数。
两家公司尚未公布这一具体项目的技术范围。目前仍不清楚它们将优化现有的 Multiverse 模型、压缩外部模型、调优 Qualcomm 运行时,还是将这些工作结合起来。支持的架构清单和发布时间也尚未公开。
这些缺失的信息很重要,因为“优化”涵盖多种截然不同的干预方式。它可能包括降低数值精度、删除低价值权重、重构模型层、为特定加速器编译算子,或改变请求调度方式。每种方法都会带来不同的权衡。
Multiverse 表示,其方法会将选定的神经网络层重组为张量网络,随后进行短暂的恢复过程。该恢复阶段会重新训练受影响的部分,使压缩后的模型能够恢复在重构过程中损失的性能。这一方法还可与传统量化结合,即使用更少的位来存储模型权重。
因此,据报道的合作连接了两层优化。Qualcomm 正围绕内存容量、带宽和效率设计推理加速器;Multiverse 则试图减少这些加速器必须传输和存储的模型状态量。
这比单纯认证某个模型可以启动更具意义。更小的模型可以为更长上下文、更大的请求批次,或单个系统上的多个模型腾出更多内存。它还可减少生成 token 时的权重传输,不过实际收益取决于架构和工作负载。
眼下的变化仍然有限。尚无买家公开报告称,此项联合工作已带来更低延迟、更高吞吐量或更低能耗。该合作创造了实现这些结果的路径,而不是客户已经获得这些成果的证据。
当一则公告通过聚合平台传播时,这一区别很容易被忽略。最初的 Google News 条目 确立了这一已报道事件。技术和商业成果仍有待揭晓。
Qualcomm 需要的不只是更快的卡,还需要优化模型
Dragonfly 必须成为一个易于使用的模型平台,因为仅靠加速器规格不足以构成 GPU 的可行替代方案。
Qualcomm 最初于 2025 年 10 月发布 AI200 和 AI250,将其定位为专为推理打造的机架级系统。其加速器路线图预计 AI200 将于 2026 年上市,AI250 将于 2027 年推出。这一时间安排意味着,软件准备工作如今已处于关键路径上。
AI200 发布时配备了每卡 768 GB 的 LPDDR 内存。LPDDR 是一种更常与移动设备相关的低功耗内存,但 Qualcomm 正将其容量和能效特性应用于数据中心推理。该公司将这一设计定位于大型语言模型和多模态模型。
AI250 则转向 Qualcomm 的 High Bandwidth Compute 架构。Qualcomm 将其描述为近存计算,也就是让更多计算在存储模型数据的附近完成。目标是降低内存受限推理中拖慢 token 生成的数据传输瓶颈。
目前公布的 AI250 规格显示,每卡有效内存带宽为每秒 133 TB,是可比 AI200 数值的 18 倍。Qualcomm 还列出了每卡 768 GB、每机架 56 张卡及 43 TB 机架内存。该公司称,一个机架可提供每秒 7.455 PB 的有效带宽。
这些是 Qualcomm 公布的规格和估算,并非独立的量产基准测试结果。该公司称,AI250 可支持参数规模达到 10 万亿、上下文长度达到 100 万 token 的模型。它还估计,在以内存带宽衡量的基础上,AI250 的每瓦性能可比当代 GPU 架构高出四至八倍。
高容量卡本身无法解决模型接入问题。客户需要受支持的算子、可靠的编译器、服务框架、监控、编排以及优化后的模型制品。当模型跨越多张卡、服务器或机架运行时,他们还需要可预测的行为。
这正是 Multiverse 可以帮助缓解的压力。其工作可能为 Qualcomm 提供可部署的示例,展示压缩模型在 Dragonfly 上的表现。更重要的是,它可能在客户遇到问题之前暴露兼容性缺陷。
这项工作也契合 Qualcomm 更广泛的软件推进策略。2026 年 6 月,该公司扩大了与 Hugging Face 的合作关系,以支持从设备到数据中心的模型部署。这项开发者合作面向 Hugging Face 的社区和模型生态,并覆盖 Qualcomm 的各类平台。
Qualcomm 还同意收购 Modular,这家公司开发了跨硬件 AI 软件平台和 Mojo 编程语言。这笔交易强化了同一个战略要点:Qualcomm 希望开发者无需围绕专有技术栈重构每一项工作负载,就能使用其硬件。
Multiverse 在这一战略中处于不同的位置。Hugging Face 提供分发、开发者访问渠道和庞大的模型目录。Modular 提供软件基础设施和编程工具。Multiverse 则专注于在部署前改变模型结构及其资源需求。
这些合作关系共同应对了替代加速器长期存在的弱点。Nvidia 的优势包括 CUDA、库、已受训练的开发者、部署工具以及优化模型方案。评估另一种芯片的买家,必须计算整个技术栈的迁移风险。
Qualcomm 无需复制 Nvidia 的每一个组件。但它确实需要提供一条可信路径,将广泛使用的模型带到稳定的 Dragonfly 部署环境。优化模型可以缩短这条路径,尤其是在内存和推理成本主导采购决策时。
这也是为什么这项合作值得获得超出一般合作伙伴公告的关注。它表明 Qualcomm 已认识到,模型准备是产品的一部分。即使不同公司分别构建各个组件,加速器及其优化工作负载也必须作为一个统一的运行系统交付给客户。
Google News 突出了一条由软件驱动、挑战 GPU 基础设施的路径
真正的竞争并非 Qualcomm 对阵某一款芯片,而是软件驱动的 Dragonfly 技术栈对阵 GPU 部署的运营确定性。
Nvidia 仍是核心参照,因为大多数大型 AI 部署都围绕其硬件和软件设计。开发者能够找到成熟的内核、服务框架、调试实践和运维专业知识。硬件买家也知道哪些模型配置已经实现大规模运行。
AMD 通过 Instinct 加速器和 ROCm 软件栈挑战这一地位。云服务提供商的定制加速器则提供了另一条路径,尤其是在同一平台所有者同时控制模型、服务器和部署环境时。Qualcomm 进入的是一个每位挑战者都必须克服软件惯性的领域。
Dragonfly 提出的优势,侧重于推理经济性,而不是通用训练。AI200 强调内存容量,而 AI250 强调有效带宽和低功耗解码。解码是模型处理初始提示词后,按顺序生成输出 token 的阶段。
这一重点很及时,因为推理模型在给出答案前可能生成很长的内部推理链。智能体系统在规划、使用工具、检查结果和修订行动时,也可能反复调用模型。这两种模式都会增加生成 token 的数量,让推理成本更加显眼。
Qualcomm 当前的 AI250 规格描述了一套机架系统:使用 PCIe 6.0 实现纵向扩展连接,并通过支持 RoCE 的 Ethernet 实现横向扩展。RoCE 可通过 Ethernet 承载远程直接内存访问,使互连系统在较少处理器参与的情况下交换数据。
这些设计选择显示了 Qualcomm 的雄心规模。Dragonfly 并非只是一张安装在现有 GPU 服务器内的加速器卡。Qualcomm 将其定位为一个包含冷却、网络、存储、编排和故障管理组件的机架平台。
Multiverse 为这一架构增加了一个软件杠杆。如果压缩模型需要更少内存,运营者就可以将容量用于并发处理或更长上下文。如果压缩能够减少权重传输,模型就能更好地利用为高效内存推理设计的架构。
然而,压缩与内存带宽并不能相互替代。更小的模型并不意味着会自动高效利用每个硬件单元。它可能引入不规则操作、改变算术强度,或需要在新加速器上尚不成熟的内核。
因此,合作双方需要联合优化,而不是各自独立提出主张。Multiverse 必须了解 Dragonfly 如何处理其张量化层;Qualcomm 则必须确保其编译器和运行时能将这些结构转化为高效执行。
这正是 Google News 标题比有限的公告细节更具分量的地方。它指出了正确的竞争战场:模型在硬件上的表现,而不是孤立的规格参数。客户购买的是完整的推理服务,而非内存带宽图表。
Qualcomm 在 2026 年 7 月发布的投资者材料进一步明确了其竞争主张。该公司的数据中心计划显示,AI200 将于 2026 财年开始提供样品,AI250 则处于其年度路线图的下一阶段。该公司还预计,到 2029 财年,加速器市场将存在巨大的机会。
同一份演示材料使用 Qualcomm 自有的每瓦性能方法论,将 AI250 和 AI300 与同期 GPU 产品进行比较。这些预测提供了战略背景,但客户仍会要求工作负载层面的证据。模型名称、序列长度、批处理规模、质量评分以及功耗测量方法,都会影响结果。
Multiverse 可以帮助产生这类证据。其压缩模型组合为合作双方提供了可在不同配置下进行基准测试的受控工作负载。不过,仅涉及专有模型或经过特别优化模型的结果,无法解答更广泛的兼容性问题。
最有力的证明应包括买家已在使用的模型,也应披露未压缩基线、GPU 对比、输出质量测量结果以及可复现的软件版本。缺少这些细节,市场便无法区分压缩带来的收益与加速器带来的收益。
更小的模型遇上更大的内存,但准确性才是分界线
压缩可以放大 Dragonfly 的容量优势,但每节省一个参数,都会带来模型究竟遗忘了什么的问题。
神经网络中存在冗余,模型开发者已通过量化、剪枝、蒸馏和低秩方法加以利用。Multiverse 认为,与仅采用传统压缩相比,量子启发式张量网络能更有效地保留重要关系。
该公司首先评估哪些层能够容忍重构,随后将选定的权重矩阵分解为张量网络,并进行有限的再训练。目标是在不从头重建模型的前提下,降低参数和内存需求。
Multiverse 已将这一流程用于小型边缘模型和更大的语言模型。SuperFly 包含 9400 万个参数,源自一个拥有 1.35 亿参数的模型。ChickenBrain 则将一个拥有 80 亿参数的 Llama 3.1 变体压缩至 32 亿参数。
一份独立的压缩分析报道称,SuperFly 在 iPhone 14 Pro 上占用 191 MB,并能以每秒 115 个 token 的速度运行。同一报道指出,ChickenBrain 相较其源模型减少了 60% 的参数。
这些案例表明,该技术能够产出可运行的模型成品。但它们并不能证明同样的方法在 Dragonfly 机架所针对的模型、提示词和服务条件下会有怎样的表现。
准确性也需要更精确的定义。压缩模型可能维持平均分数,却在罕见事实、长推理链、多语言提示词、代码生成、安全行为或工具使用方面变弱。企业买家往往比起醒目的平均值,更在意这些长尾表现。
复旦大学人工智能创新与孵化研究院教授 Zenglin Xu 在同一篇 IEEE 报道中提出了一项重要限定。他认为张量网络很有前景,但警告称,在更长的推理链上,其表现可能落后于其他技术。
这一担忧与 AI250 的目标市场直接交汇。Qualcomm 将该加速器定位于推理、智能体 AI 和长上下文场景。这些恰恰是微小的质量变化可能在大量生成步骤中不断累积的工作负载。
一个压缩后的智能体可能能够正确回答单个基准问题,却会在 20 步工作流中变得不那么可靠。一次薄弱的工具选择就可能让流程走向错误路径,后续步骤随即在错误状态下运行,放大一次小型模型错误的实际代价。
长上下文支持还带来了另一层区别。硬件可以容纳 100 万 token 的上下文,但模型仍必须能够有效利用该上下文。内存容量并不保证检索准确性、稳定注意力,或跨越整个窗口的可靠推理。
因此,Qualcomm 和 Multiverse 应报告的不只是每秒 token 数。他们需要提供压缩前后的质量测量,包括长上下文检索和智能体任务。能耗和延迟结果也应采用相同的输出质量门槛。
两家公司还必须说明,其优化模型是否保留现有接口。买家会希望知道提示词格式、工具模式、安全控制、微调适配器和监控系统能否继续运作。如果迁移需要修改应用程序,更小的模型成品价值就会降低。
模型许可带来了另一项实际限制。开放权重模型和专有模型之间的优化权利各不相同。Qualcomm 可以宣传广泛的框架兼容性,但 Multiverse 未必能在相同条款下压缩并重新分发每一个热门模型。
安全团队会询问优化流程是否改变了模型溯源。他们可能要求保存涵盖源权重、压缩设置、恢复数据、评估结果和最终校验和的记录。受监管部署需要可重复的验证,而非一次性的基准测试。
这些问题都不会否定此次合作。它们界定了合作所需的证据。核心问题并非压缩在原则上是否有效,因为 Multiverse 已经产出了压缩模型。问题在于,它能否在 Dragonfly 的目标工作负载中持续保持可靠。
这种不确定性应当让人谨慎对待将 Google News 内容直接用于投资或采购决策的报道。该公告确立了合作关系,但并未证明质量对等、性能领先,或在客户条件下拥有更低的总运营成本。
此次合作如今合乎逻辑,因为两条路线图都需要证据
Multiverse 需要大规模硬件验证,而 Qualcomm 需要具备辨识度的模型,让 Dragonfly 更易于评估。
过去一年,Multiverse 一直在扩大其业务,超越孤立的压缩演示。该公司已推出多个模型系列、构建 API,并达成覆盖云端、企业、边缘、国防和主权 AI 项目的合作协议。
其近期合作展现出一致模式:公司提供压缩模型或优化能力,另一方则提供分发、硬件、客户或行业专业知识。Qualcomm 则提供了进入更大规模基础设施测试的机会。
此次合作也与 Multiverse 的边缘业务形成了有益对照。运行在手机或 Raspberry Pi 系统上的紧凑模型,证明了极限资源缩减的可行性。Dragonfly 机架提出的是另一个问题:同样的方法能否在超大规模环境中改善吞吐量和经济性?
若能在机架规模上取得成功,将拓宽公司的定位。Multiverse 将不再只是边缘模型专家,而可以将 CompactifAI 定位为跨硬件类别的优化层,覆盖从消费级设备到液冷数据中心的各类场景。
Qualcomm 面临的是相反的挑战。该公司在为手机、PC、车辆和嵌入式系统构建高效神经处理器方面已有深厚经验。数据中心买家仍需要证据,证明这种专业能力能迁移到持续运行的多租户推理。
最初的 AI200 公告提供了硬件时间表和软件愿景。到 2026 年年中,买家需要看到具体的可用性、支持的模型、部署文档和基准测试结果。每一个缺少这些成品的季度,都会让成熟 GPU 平台拥有更多改进时间。
Qualcomm 已通过更广泛的生态战略作出回应。Hugging Face 可以减少模型发现的阻力;Modular 可以强化可移植性和开发者工具;Multiverse 则可以针对特定资源目标重塑模型。
这些要素也揭示了 Qualcomm 如何看待这一障碍。它并未将硬件制造视为全部问题,而是在模型分发、编程、编译、优化和部署各环节建立合作关系。
这种方式类似于每一家严肃的加速器供应商最终都必须面对的平台建设工作。芯片或许能在实验室中取得令人印象深刻的数字,但应用团队实际体验的是周边软件。缺失的算子、不稳定的编译器和困难的调试,都可能抹去理论上的节省。
Multiverse 的动机同样清晰。针对硬件的优化能够将其压缩主张转化为运营指标。Dragonfly 的大内存配置也让该公司得以测试超出边缘设备限制的模型和上下文。
不过,双方均未披露排他性安排。Multiverse 已与其他硬件公司合作,其中包括 Nvidia 及与 Intel 相关的项目。Qualcomm 也支持众多外部合作伙伴提供的模型和工具。
这种开放性是合理的。模型提供商希望获得广泛覆盖,而加速器供应商需要丰富的产品目录。但这也意味着,此次合作本身并不会形成受保护的软件优势。
竞争对手可以采用压缩、稀疏化、量化和优化推理服务。Nvidia 拥有广泛的模型优化软件,而 AMD 和云端加速器团队也在持续改进各自的软件栈。Qualcomm 需要的是可重复的部署优势,而不只是获得一种技术。
因此,此次合作的时机反映了双方的共同压力。Multiverse 必须证明,张量网络压缩能够跨平台和工作负载规模迁移;Qualcomm 则必须在采购决策固化之前,将 Dragonfly 从路线图转化为开发者可用的系统。
这一共同的期限使该公告作为战略匹配显得可信,但并不意味着结果必然发生。下一批发布将显示,这种匹配能否经受真实模型和真实服务要求的考验。
Google News 标题之后值得关注什么
三个信号将决定此次合作是成为基础设施证据,还是仍只是一则生态系统公告。
第一个信号是具名模型发布。Qualcomm 和 Multiverse 应至少明确一个源模型、其压缩版本、Dragonfly 目标以及运行它所需的软件。公开成品将让开发者能够检查模型卡、许可证、评估方法和集成步骤。
面向 AI200 的发布将尤其具有分量,因为该产品的计划时间早于 AI250。这将表明合作与近期硬件相关,而非只面向未来架构。若能提供可下载或客户可访问的成品,论证将进一步增强。
第二个信号是质量匹配的基准测试。双方应报告首 token 时间、输出吞吐量、能耗、内存消耗和系统总功耗。这些数据应在等效输出质量下比较压缩版与未压缩版。
基准测试披露应包括批量大小、输入长度、输出长度、数值精度、服务器数量和软件版本。对于推理模型,还应包括任务准确率和长链可靠性。缺少这些背景信息,原始吞吐量数字可能具有误导性。
独立复现会比仅由公司自行测试更有说服力。大学、云服务运营商或潜在客户都可以评估相同的模型工件。他们的结果将揭示性能在优化演示环境之外如何变化。
第三个信号是生产环境客户。在 Dragonfly 上运行这些优化模型的买家,将提供最有意义的证据。有用的披露应涵盖工作负载类型、服务量、延迟目标、可用性、运营限制以及迁移工作量。
客户无需公开保密的经济数据,但需要确认该系统并非只运行于短暂演示中。持续部署将检验编译器稳定性、编排、故障恢复、模型更新和监控能力。
随着时间推移,缺少这些信号将削弱这一公告的可信度。如果没有具名模型出现,其范围可能仍处于探索阶段。如果基准测试未涵盖质量,压缩带来的损失可能尚未解决。如果客户迟迟未出现,集成阻力可能大于标题所暗示的程度。
还有一些产品里程碑值得关注。AI200 的可用性将检验 Qualcomm 的 2026 年时间表。AI250 的样品、更新后的规格以及合作伙伴访问情况,将显示其 2027 年计划是否仍然完整。
Qualcomm 目前将 AI250 列为 140 kW 的机架散热设计功耗,而其 2025 年公告中将两种机架解决方案均描述为 160 kW。差异可能反映产品细化或配置不同。买家将需要最终的、针对具体配置的文档。
更广泛的竞争回应同样重要。Nvidia、AMD 和云加速器团队正通过新的内存系统和软件提升推理效率。在 Qualcomm 和 Multiverse 完成其工作期间,Dragonfly 的比较基准将持续变化。
对于开发者而言,实际问题在于可移植性。应关注优化后的模型是否采用标准接口和常见的服务框架。只能通过专用路径运行的模型仍可能有价值,但会带来更高的集成和运营风险。
企业买家应聚焦与自身工作负载相关的证据。长上下文文档分析、代码智能体、客户支持和多模态生成对系统的压力各不相同。一项表现良好的基准测试无法代表所有部署场景。
知识工作者也应关注,因为基础设施效率会影响 AI 能在何处运行,以及组织如何对其进行治理。高效硬件上的更小模型可以扩展私有或专用部署,也能在固定容量内支持更频繁的使用。
因此,最终结论并不包含在 Google News 的标题中。Qualcomm 和 Multiverse 选择了一个技术上连贯的问题:协同优化模型和加速器,而不是将它们视为彼此独立的产品。尚未解决的问题是,这种合作能否在不造成不可接受的质量损失的情况下,带来可复现的收益。
首先关注具名的 AI200 模型,其次是质量相匹配的基准测试,最后是生产环境客户。这三个信号将表明 Dragonfly 正在成为可用的推理平台,还是仍只是一份雄心勃勃的硬件路线图。


