top of page

Qualcomm 1-Bit AI 登上 Snapdragon 眼镜,但基准测试只是第一道考验

2天前
讀畢需時 16 分鐘

Qualcomm 1-bit AI 已进入采用 Snapdragon 平台的智能眼镜,一项已披露测试显示,其语言模型权重内存占用减少了 74%。同一配置下,生成 token 的速度是同类 4-bit 模型的两倍以上。这些结果让眼镜中的本地视觉 AI 更具可行性,但尚不足以证明其续航、准确性或商业化成熟度。

PrismML 在 Snapdragon Summit 2026 上展示了其 Bonsai 视觉语言模型在 Qualcomm Snapdragon AR1 Gen 1 平台上的运行情况。该模型直接在可穿戴硬件上处理摄像头输入并生成回复,而非将每项请求都转交给手机或云服务。

这改变了可穿戴 AI 眼下的竞争格局。最重要的分野不再只是 Qualcomm 与其他芯片供应商之间的较量,而是紧凑型本地处理与云优先智能之间的竞争;隐私、延迟、内存和模型质量正将产品拉向不同方向。

Microsoft 的 BitNet 研究已表明,在受控评测中,极低精度模型仍能保留实用的语言能力。如今,Qualcomm 和 PrismML 将这一思路带到了商用智能眼镜平台。悬而未决的问题是:会议演示能否成为一款可全天佩戴的产品,同时不牺牲准确性或舒适度。

Qualcomm 1-Bit AI 将 20 亿参数模型装进眼镜

核心成果是一项针对特定硬件的演示,而非声称所有 AI 模型都能以相同幅度缩小。

PrismML 于 2026 年 9 月 23 日在 Snapdragon Summit 期间公布了这项演示。其智能眼镜公告称,一款拥有 20 亿参数的视觉语言模型可在 Snapdragon AR1 Gen 1 硬件上本地运行。

视觉语言模型能够同时处理视觉信息与文本或语音请求。在这个案例中,该系统将一个拥有 17 亿参数的语言组件与一个拥有 3 亿参数的视觉编码器结合起来。

只有语言组件采用 PrismML 的 1-bit 设计。视觉编码器仍保持 4-bit 精度,因此若将整个模型称为 1-bit,将夸大实际在眼镜上运行的内容。

Qualcomm Technologies International 于 2026 年 9 月进行了已披露的测试。测试平台配备 4 GB 内存、1,024-token 上下文长度,以及支持 1-bit kernel 的内部 QNN 软件开发工具包。

Kernel 是针对特定计算操作优化的底层软件例程。在这里,这些例程帮助 Qualcomm 的 Hexagon 神经处理单元高效执行这一异常紧凑的模型。

1-bit 语言模型的权重占用 0.43 GB。相同 17 亿参数语言模型对应的 4-bit 版本则占用 1.66 GB。

这意味着内存占用减少 74%,即权重内存约减少至原来的 1/3.83。PrismML 因此将这一设计描述为:在相同内存预算下,可容纳约四倍参数量。

在已披露的配置中,生成速度也有所提升。1-bit 版本每秒生成 15.36 个 token,而 4-bit 版本为每秒 7.44 个 token。

Token 是语言模型处理或生成的一个小型文本单元。根据 Qualcomm 的测试条件,所报告的差异相当于 2.06 倍的提升。

这些数字之所以重要,是因为智能眼镜几乎没有空间容纳更多内存、散热或大容量电池。减少模型权重的搬运可节省内存带宽,并缩短生成答案所需的时间。

Qualcomm 的 AR1 平台专为智能眼镜设计,而非由手机平台改造而来。它将摄像头处理、连接功能、音频功能和第三代 Hexagon NPU 集成在受热限制的封装中。

该平台还支持视觉搜索、实时翻译和双目显示。这些能力为解读佩戴者所见内容的模型提供了所需的周边硬件。

演示的使用场景很直接。佩戴者可以注视某个物体、标识、文档或场景,并就此提问。模型将摄像头输入转换为视觉特征,对这些特征进行推理,再生成回复。

将这一流程保留在本地,可以减少把图像发送到远程服务器带来的延迟,也能限制必须离开设备的敏感视觉数据量。

不过,该公告没有说明零售产品、制造商、发布日期或支持的应用范围。它证明的是开发配置上的技术可行性,而不是消费者可获得性。

这一区别至关重要。Snapdragon 智能眼镜可以承载紧凑型多模态模型,但实验室配置所面对的约束少于一副需要连续佩戴数小时的成品镜框。

消费级设备必须在摄像头、麦克风、无线连接、传感器和用户界面服务之间共享内存与电力。AI 模型只能获得这笔有限预算中的一部分。

因此,这项演示构成了本文的核心张力:内存障碍已经移动,但整个可穿戴计算问题仍远大于模型存储本身。

1-Bit 模型如何改变可穿戴 AI 的计算方式

1-bit 模型着手解决的是权重在内存中移动的成本;在可穿戴设备上,这通常与原始算力同样重要。

模型权重是在训练期间学习到的数值。它们决定信息如何在模型中流动,以及模型如何生成答案。

许多已部署模型以四、八或十六 bit 存储每个权重。更少的 bit 能降低存储需求,但激进压缩也可能损害推理、指令遵循和输出质量。

PrismML 表示,Bonsai 是作为低 bit 模型进行训练的,而非仅在传统训练后再进行压缩。这一区别很重要,因为训练后量化往往会迫使既有模型采用精度更低的表示方式。

原生低 bit 系统可以让训练过程适应这一约束。其架构、优化方法和推理软件都能围绕相同的紧凑数值格式进行设计。

更广泛的研究领域一直在向这一方向发展。Microsoft 研究人员在其 BitNet 研究中描述了使用负一、零和一三个值的三元权重。

这种方法通常被称为 1.58-bit,因为三种可能值比二元选择需要更多信息。研究人员报告称,在保留与同等规模全精度模型相近结果的同时,该方法具有效率优势。

PrismML 将 Bonsai 描述为在其语言网络中采用真正 1-bit 的模型。它的设计与 BitNet 不同,尽管二者都在追求单位内存下更高的能力。

这并不只是存储技巧。内存传输会消耗能量,反复移动大型权重数组可能成为推理过程中的主要瓶颈。

更小的表示形式可减少每个生成 token 需要传输的数据量。专用 kernel 随后可以直接利用这种表示,而非将一切转换回传统格式。

这一组合有助于解释为何 1-bit 配置在 Qualcomm 的测试中更快。该平台处理的权重数据更少,而内部 QNN 堆栈提供了针对该工作负载设计的 kernel。

这一结果并不意味着 1-bit 运算会在每个处理器上自动更快。硬件支持、内存布局、批处理、编译器行为和模型架构都会影响性能。

已披露的实现专门针对 Qualcomm 的 Hexagon NPU 进行了优化。缺少适当 kernel 的其他芯片可能实现更小的模型,却无法获得同等的速度提升。

这种依赖性让 Qualcomm 的角色不止于提供处理器。它可以协调模型、编译器、运行时和 NPU,使压缩带来的优势在部署后得以保留。

对智能眼镜制造商而言,实际吸引力在于灵活性。更小的模型占用可支持更大的模型、更低成本的内存、更多应用空间,或这些优势的某种组合。

制造商也可为视觉处理和操作系统服务保留更多内存。当设备持续处理摄像头、音频、传感器和用户上下文数据时,这一点尤为重要。

但参数量仍是不完整的智能衡量指标。参数量增加四倍的模型,并不一定能给出四倍有用的答案。

训练数据、架构、评测方法和周边应用共同决定额外参数是否会改善用户体验。一个紧凑却不可靠的助手,仍然无法成为成功的可穿戴产品。

1,024-token 上下文窗口也限制了演示系统。上下文窗口是模型在一次交互中能够考虑的近期输入量。

这种容量可以支持简短指令和视觉提问,但不太适合长时间对话、详细文档,或需要记住一长串事件的助手。

将这项演示视为效率里程碑时,它最具说服力。它表明 1-bit AI 模型可以在现有 Snapdragon 智能眼镜芯片上运行,并带来可衡量的内存和速度优势。

它并未证明 1-bit 模型能全面替代 4-bit 模型。开发者仍需判断模型的准确性、上下文容量和支持的任务是否足以证明这种效率提升的价值。

本地处理向云优先可穿戴 AI 施压

Qualcomm 和 PrismML 正在挑战一种假设:有能力的可穿戴助手必须将最重要的工作发送至远程服务器。

云端处理让可穿戴产品能够使用更大的模型和频繁更新的服务,也让设备制造商能将繁重计算从小容量电池和受限散热设计中移开。

这种架构也伴随着成本。每次云端请求都依赖连接性,会增加网络延迟、消耗无线电能量,并可能传输敏感的音频或摄像头信息。

智能眼镜让这些问题格外显眼。一台佩戴在眼睛高度的摄像头,可能在一天中持续捕捉人脸、屏幕、文档、住宅、工作场所和旁观者。

本地推理并不能消除隐私风险,但会改变数据路径。设备可以先对视觉信息进行分类或总结,再决定是否有内容必须上传至云端。

本地模型也能在网络缓慢或缺失时维持基本功能。翻译、物体识别、通知摘要和简短的情境化回答,无需持续访问服务器即可实现。

最强的产品设计很可能会结合本地与远程模型。快速、私密的任务可以留在眼镜上,而困难查询则转交给手机或云服务。

Qualcomm 已在早期的多模态眼镜演示中展示了这种分层架构。Snapdragon AR1 负责视觉管线的一部分,而配对手机则执行检索和其他 AI 工作。

PrismML 的演示将更多推理任务转移到眼镜本身完成。这使得这类可穿戴设备在一小部分交互场景中不再那么依赖附近的手机。

这也让设备制造商在持续性的云端支出上拥有更大的主动权。每一项在本地完成的请求,都能避免部分服务器端推理需求,尽管实际节省额度仍取决于真实使用情况。

这对需要频繁响应的产品很重要。一款可穿戴助手可能会在一天中面对大量短请求,其中包括并不值得进行云端往返的指令。

竞争压力并不止于云服务提供商。芯片厂商、操作系统开发者、模型公司和眼镜品牌如今都需要一套连贯的本地 AI 战略。

Google 的 Android XR 路线图将智能眼镜置于其下一轮平台扩张的核心位置。其公布的合作伙伴包括 Samsung、Warby Parker 和 Gentle Monster。

Google 以模型为先的优势依然显著,因为 Gemini 能将眼镜接入广泛的服务生态系统。Qualcomm 的应对方式,则是让底层硬件能够在本地承载更多智能能力。

这些策略并不相互排斥。Android XR 设备可以在同一款产品中使用 Snapdragon 处理器、本地模型和基于云端的 Gemini 服务。

真正的分歧在于每项任务应在哪里运行。每一次决策都会影响响应时间、电池消耗、隐私、订阅经济性和能力上限。

Meta 的消费级智能眼镜战略提供了另一个重要参照。其产品已证明,在人们熟悉的眼镜形态中,摄像头、音频和助手功能存在市场需求。

然而,云端连接的助手仍是许多高级交互的核心。可信的本地模型能让竞争产品主打离线功能,或更具隐私性的视觉处理。

因此,Qualcomm 1-bit AI 会对云端优先的产品形成压力,但不会取代它们。它减少了那些明显必须依赖远程模型的任务数量。

这可能改变产品谈判格局。眼镜品牌可能要求模型提供商提供更多本地能力,而云服务则可能将其最大型的系统保留给复杂查询。

开发者也会获得一种不同的应用模式。他们不再只是把眼镜视为连接远程助手的传感器,而可以把设备看作一个小型推理终端。

这一模式支持即时操作,例如识别所见物体或提取简短指令。但对于研究、长时间规划或需要实时在线信息的任务,其说服力则较弱。

最现实的结果是出现一个路由层,在眼镜、配对手机和云端之间选择任务执行位置。用户或许永远不会看到这一决策,但它将塑造每一次响应。

一个好的路由器必须考虑敏感性、复杂度、连接状况和剩余电量。糟糕的路由可能抹杀本地处理的优势,或让用户得到明显更弱的答案。

这正是内存效率的重要性超越基准领先地位的原因。它让产品团队在计算栈中分配任务时拥有更大自由度。

Snapdragon 的可穿戴战略如今取决于软件效率

Qualcomm 的优势将来自于将紧凑模型与可部署软件相结合,而非再展示一项孤立的处理器规格。

Snapdragon AR1 Gen 1 并不是 Qualcomm 唯一的可穿戴平台。该公司如今通过多个专用芯片系列,覆盖智能眼镜、手表、戒指、音频产品和新兴的个人 AI 设备。

2026 年 3 月推出的 Snapdragon Wear Elite 为 Qualcomm 的高端可穿戴计算产品线带来了集成式 Hexagon NPU。Qualcomm 表示,可穿戴 AI 平台支持参数量最高达 20 亿的端侧模型。

这一名义容量与 PrismML 智能眼镜模型高度接近。这表明 Qualcomm 将 20 亿参数系统视为多个可穿戴品类的实际目标。

不过,各类产品的约束条件不同。手表、音频设备和配备摄像头的眼镜,在电力与内存分配方式上存在很大差异。

智能眼镜必须管理图像传感器和持续的视觉处理。手表则需要将资源分配给显示屏、健康传感器、定位服务和后台连接。

音频可穿戴设备的电池更小,但可以围绕语音构建实用的智能体。它们可能需要较少的视觉计算,同时对实时音频性能提出严格要求。

低比特模型让 Qualcomm 能够为这些品类提供统一的软件叙事。该公司可以主张,硬件限制并不意味着必须放弃有意义的本地智能。

当模型已能在 AR1 Gen 1 上运行时,这一叙事会更具说服力。软件优化有望延长已部署或此前设计硬件的实用寿命。

但移植并非自动完成。每个平台都需要经过验证的内核、内存规划、热管理,以及与其运行环境的集成。

已披露的智能眼镜测试使用了内部 QNN SDK,而不是已有广泛文档支持的生产级工具链。因此,开发者不能假定自己今天就能复现该结果。

商业采用取决于编译器、调试器、性能分析工具和模型转换工作流是否易于使用。如果只有 Qualcomm 和 PrismML 能运行所需技术栈,再出色的演示也可能停滞不前。

对标准模型格式的支持同样重要。设备制造商需要可预测的方法,以便在产品生命周期内评估、更新和保护模型。

模型更新带来另一项挑战。高度专用的 1-bit 模型可能需要重新训练,而不是从现有 4-bit 版本快速转换而来。

这可能延缓新能力的获取,也可能让制造商更紧密地绑定于特定模型供应商和运行时环境。

与 PrismML 的合作有助于 Qualcomm 弥合这一缺口。PrismML 提供围绕低精度设计的模型,而 Qualcomm 提供针对硬件的执行路径。

对制造商而言,这减少了部分集成工作。但同时也引入了有关许可证、更新计划、支持承诺和模型透明度的供应商问题。

该模型家族的开放程度将影响采用率。当开发者能够检查权重、复现基准测试,并在自身工作负载上测试行为时,通常能更快推进开发。

制造处方眼镜或企业设备的厂商,可能会要求更强的保障。这包括安全更新、已记录的失效模式和稳定的长期支持。

企业买家还会关心本地数据控制。他们可能重视这样一种眼镜:无需上传每一帧摄像头画面,也能解读设备、文档或工作流程。

消费者买家会关注不同的细节。重量、发热、电池续航、响应延迟和社会接受度,比比特宽度更重要。

这种差异应指导 Qualcomm 接下来的传播策略。“One-bit” 在技术上令人印象深刻,但没有消费者会仅仅因为数值精度而购买产品。

真正有用的承诺是:一款更快、能更频繁地工作、且不会将每次交互都暴露给云端的助手。底层模型格式只有在带来这种体验时才有意义。

Qualcomm 1-bit AI 能够强化该公司的可穿戴战略,因为它让现有硬件显得不那么受限。但软件必须走出受控的峰会演示,变得真正可用。

已公布的基准测试留下四个重大问题

该基准证实了权重内存和 token 速度的提升,但并未衡量完整的产品体验。

第一个未解问题是输出质量。PrismML 表示,这一紧凑模型提供了可与 4-bit 版本媲美的智能能力,但演示中并未公布独立评估结果。

语言模型可能在选定基准上表现良好,却在指令、视觉细节或罕见情境中失效。可穿戴使用场景还会带来移动摄像头、噪声、眩光和不完整的视觉上下文。

已披露的比较聚焦于对应的 17 亿参数语言模型。它没有对推理、视觉理解、幻觉或安全评估中的错误提供详细拆分。

第二个问题是功耗。更低的内存传输通常有助于提高效率,但该发布并未披露每生成一个 token 所需的焦耳数,或对整机电池的影响。

仅凭 token 速度无法回答这一问题。模型可能运行得更快,同时瞬时功耗更高;也可能因为更快完成同一任务而节省能源。

一副成品眼镜还必须为摄像头、麦克风、无线电模块、传感器和音频输出供电。模型效率只是这一系统预算的一部分。

发热与此密切相关。眼镜直接贴近用户面部,即使温度略有升高,也可能使持续 AI 处理变得不舒适。

该公告没有提供热测试数据或持续性能结果。一次短暂演示无法揭示平台是否会在反复视觉查询期间降频。

第三个问题涉及上下文长度。测试使用了 1,024 个 token,这构成了一个受控且相对较小的工作窗口。

这或许足以完成简短描述或翻译。但当助手需要持续对话、更丰富的个性化信息或多次视觉观察时,就会受到限制。

更长的上下文还会通过键值缓存增加内存需求。权重压缩并不能消除这项不断增长的运行时成本。

第四个问题是可复现性。Qualcomm 使用具备专用 1-bit 支持的内部 QNN SDK 进行测量。

独立开发者目前还没有一套公开流程可复现完全相同的测试。他们也缺少实现完整产品设计的零售硬件。

这些限制并不会否定该基准。它们界定了这些数字能够支持的结论,并避免结果被扩大为超出证据范围的主张。

最有力且有证据支持的结论是明确的:在一项配备 4 GB 内存的 Snapdragon AR1 Gen 1 配置中,PrismML 的语言模型权重比对应 4-bit 模型少占用 74% 的内存。

在 Qualcomm 所述条件下,同一配置的 token 生成速度快 2.06 倍。这些都是有意义的工程成果。

这些数据并不表明每个 1-bit 模型都能保持同等准确性,也不表明总应用内存或设备功耗能降低 74%。

它同样不意味着用户感知到的智能水平会提升四倍。“四倍”的表述指的是语言模型权重预算内可容纳的大致参数容量。

另一个不确定性是产品需求。可穿戴 AI 既催生了成功的摄像头眼镜,也出现了被放弃的独立助手。

用户已表现出对便捷拍摄、音频和免手操作查询的兴趣。但对于不可靠的答案、有限的电池续航和不明确的日常价值,他们的容忍度更低。

本地处理可以改善这些条件,但无法独自创造有吸引力的使用场景。制造商仍需提供足以让用户整天佩戴摄像头和麦克风的应用。

隐私控制同样仍然至关重要。本地推理减少了部分数据传输,但设备依然可能记录敏感信息或保留衍生数据。

产品需要清晰可见的拍摄指示、易于理解的权限设置、安全存储,以及明确的云端升级政策。模型压缩并不能解决这些治理要求。

因此,Qualcomm 和 PrismML 应接受下一层证据的检验。基准测试打开了一扇门,而产品验证决定用户是否会走进去。

在 1-bit AI 成为可穿戴功能之前,值得关注的事项

三个信号将决定这次演示会推动平台变革,还是仅停留在令人印象深刻的优化成果。

第一个信号是采用 Bonsai 或其他原生低比特模型的商用设备公告。明确的制造商名称、上市时间窗口和支持的功能集,将增强 Qualcomm 的论证。

设备应说明哪些任务完全在眼镜端运行,同时解释何时会将处理任务转移至手机或云服务。

这类披露将把抽象的效率提升转化为可测试的产品架构,让评测者能够比较延迟、离线表现和隐私主张。

第二个信号是易于获取的 Qualcomm 开发工具链。开发者需要公开的 1-bit 内核支持、文档、性能分析工具以及可复现的参考模型。

正式发布的生产级 QNN 版本将表明,这项技术能够超越双方工程合作项目。若支持 AR1 及更新的 Snapdragon 平台,这一信号将更具说服力。

缺乏可用工具时,大多数制造商无法独立评估其中的取舍。这项优化依然有价值,但难以在整个生态系统中规模化推广。

第三个信号是完整的设备级测试。评测应衡量电池消耗、温度、持续 token 生成速度、回答质量和视觉准确性。

这些测试应涵盖繁忙场景、弱光、背景噪声和间歇性网络连接,也应将本地响应与云端支持的替代方案进行比较。

如果 1-bit 模型能保持响应速度,同时不损害佩戴舒适度或续航能力,本地处理的论点将更有说服力。若准确性明显下降,云端路由仍将占据主导地位。

上下文容量值得特别关注。真正出货的系统需要说明:它将如何处理超出此次 1,024-token 演示范围的对话历史和个性化信息。

开发者可以利用检索机制,仅向紧凑模型提供相关信息。检索会在生成提示词前筛选有用记录,从而减少一次需要处理的上下文量。

这种方法可以帮助可穿戴设备将当前观察结果与用户已有信息关联起来,但也会带来权限和数据治理方面的问题。

对于知识工作者而言,真正实用的机会并不是把一个微型聊天机器人挂在脸上,而是提供基于当前任务的选择性、即时协助。

技术人员或许会询问眼前设备的相关信息。旅行者可能会请求翻译。用户可以记录一项决策,之后再将其与 AI knowledge base 关联起来。

这些工作流依赖准确采集、相关检索以及跨设备的可靠交接。模型大小只是这条链路中的一个环节。

尽管如此,Qualcomm 1-bit AI 已跨越了一条重要界限:它将原生低比特语言处理从研究构想带入了已披露的智能眼镜实现方案。

据报道,其内存占用减少了 74%,速度提升至 2.06 倍,为制造商测试本地多模态 AI 提供了具体理由。它也挑战了“可穿戴助手应以云端优先”为前提的假设。

下一步的决定权在设备制造商和开发者手中。在将该基准视为定论之前,他们应要求提供可复现的工具、产品级能耗数据和独立的准确性测试。

请关注具名的量产产品、公开的 1-bit Snapdragon 工具,以及完整的电池与热管理测量数据。这些信号将共同揭示,紧凑型本地 AI 是否已准备好走下发布会舞台。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page