Qualcomm Snapdragon Sound Elite Gen 2 将 AI 装进耳塞,但产品仍需证明其价值
Qualcomm 推出了 Snapdragon Sound Elite Gen 2,宣称其 AI 能力是前代的两倍,面向的不只是播放音频的耳塞。这个新平台将本地 AI 处理、高端音频硬件、传感能力和直连云端功能整合进专为小型可穿戴设备设计的方案中。
其愿景不止于更好的降噪。Qualcomm 希望制造商打造可作为常驻 AI 助手的耳塞、耳机、音频眼镜和配备摄像头的设备。这些产品可用于翻译对话、理解周边情境、个性化听觉体验,并直接连接在线智能体。
这一雄心也构成 Qualcomm 面临的核心考验。Apple 已通过受支持的 AirPods 和搭载 Apple Intelligence 的 iPhone 提供实时翻译。Qualcomm 必须证明,更独立的 AI 耳塞芯片能够带来值得额外硬件、软件、隐私和电池负担的体验。
Snapdragon Sound Elite Gen 2 将 AI 引入音频设备
Snapdragon Sound Elite Gen 2 将音频处理器从辅助组件转变为潜在的计算平台。
Qualcomm 于 9 月 23 日在毛伊岛举行的 Snapdragon Summit 2026 上发布该平台。该公司将其描述为首个专为个人 AI 打造的高端音频平台,而非后来仅加入少量机器学习功能的音频芯片。
根据 Qualcomm 的平台公告,该芯片的 AI 能力最高可达前代的两倍。Qualcomm 还宣称,其功耗最高降低 40%,占用面积最多缩小 30%。
这三个数字需要结合来看。若 AI 性能的提升耗尽耳塞本就有限的电池,或挤占麦克风和声学组件所需空间,其价值便十分有限。更小、更高效的平台让制造商能更自由地平衡智能能力、电池容量、佩戴舒适度和工业设计。
该公司称,平台可同时运行多项智能体验。理论上,一只耳塞能够维持主动降噪、处理语音指令、识别环境声音,并支持 AI 助手,而无需将每项操作都交给手机。
这种本地处理以 eNPU 为核心,即一类为机器学习工作负载设计的节能神经处理单元。不过,Qualcomm 尚未公布足够的独立基准测试信息,无法比较其在实际产品中的性能。所谓“两倍能力”仍是该公司基于其选定前代产品和测试条件作出的说法。
该平台还集成了微功耗 Wi-Fi 6E。这种连接支持直接访问云服务,无需让每项请求都经由配对的智能手机。Qualcomm 将配套软件层称为 Snapdragon Sound Apps & Agents。
本地与云端处理之间的区别很重要。唤醒词检测、声音分类和自适应噪声管理等任务可从本地执行中获益。更大的语言模型和不断变化的在线服务在许多情况下仍需要云端接入。
因此,Qualcomm 正在推进一种混合式设计。设备在近端处理对延迟敏感的音频和传感任务,而在线智能体提供更广泛的知识和更复杂的推理能力。这种架构比将耳塞视为蓝牙扬声器和麦克风更具灵活性。
该平台支持耳塞、传统耳机、开放式产品、音频眼镜、助听设备以及配备摄像头的耳塞。Qualcomm 还计划推出参考设计,供制造商更快地进行产品原型开发和验证。
Cleer 在峰会上展示了一款融合音频、视觉和 AI 的早期概念产品。这证明至少有一家硬件公司正在探索该平台,但尚不能证明其具备大众市场需求、可靠续航,或已有消费者可以购买的成品。
这正是此次消息的关键。Qualcomm 已提供旨在让音频可穿戴设备更独立的硬件,但制造商仍须将这些硅芯片转化为实用设备。
为什么 AI 音频可穿戴设备需要不同类型的芯片
挑战不在于把助手放到人耳旁,而在于让它保持快速响应,同时不牺牲人们对耳机的基本期待。
音频可穿戴设备受到异常严格的限制。它们的电池小、空间有限,配有多个麦克风、无线电模块,并且所有组件都必须舒适地置于耳内或耳周。许多产品还需在保持稳定音频和通话的同时连续运行数小时。
持续运行的 AI 会带来更大压力。实用的助手必须检测语音、将用户声音与背景噪声分离、管理打断情况,并判断请求何时需要云端处理。配备摄像头的设计还会为这类工作负载增加图像采集和多模态理解。
Qualcomm 表示,其集成式设计减少了从独立组件拼装这些功能的需求。该芯片结合了 AI 计算、传感、语音处理、连接能力以及成熟的 Snapdragon Sound 功能。
这种集成正是该公司更大主张背后的机制。Qualcomm 并非认为耳塞仅凭更快的处理器便能取代智能手机,而是认为一个协同平台能在可穿戴设备的功耗限制内管理多项持续运行的任务。
产品平台保留了 aptX Lossless,可在兼容硬件上支持高质量无线音频。它还包括 XPAN,即 Qualcomm 用于通过 Wi-Fi 扩展音频连接、而非完全依赖蓝牙范围的技术。
Qualcomm 表示,XPAN 可通过微功耗 Wi-Fi 提供最高 192 kHz 的无损音乐。实际体验将取决于涉及的手机、网络、产品设计和服务。芯片组支持某项功能,并不保证每个制造商都会启用完整功能集。
该平台还引入 Qualcomm 第五代主动降噪技术以及更新的 cVc 语音处理技术。ANC 利用麦克风和信号处理降低不必要的外部声音。cVc 则旨在提升语音采集和通信的清晰度。
这些功能并不炫目,却决定 AI 层是否能够运作。若一名助手在火车上或拥挤办公室中误解请求,它的价值会迅速下降。更好的语言模型无法完全弥补糟糕的音频输入。
Qualcomm 的 Audio Sense 解决方案增加了旨在改善设备对语音和周边环境感知能力的麦克风与算法。这一传感层可帮助助手区分直接请求和附近对话,或在不持续将原始音频发送到线上时识别情境。
研究人员已展示了专用硬件为何重要。近期一项语音 AI 加速器在其实验系统中实时处理六毫秒音频片段,功耗为 71.6 毫瓦。该研究并非对 Qualcomm 平台的测试,但说明了其中的工程权衡。
持续语音处理既需要可预测的延迟,也需要低能耗。通用手机处理能够完成这项任务,但将选定功能移近麦克风可减少延迟和无线传输。
这并不意味着每项工作负载都适合放在耳塞中。大型模型需要的内存、计算能力和功耗,超出了舒适音频设备可以轻易提供的范围。Qualcomm 的直连云端功能正是对这一限制的回应。
因此,Snapdragon Sound Elite Gen 2 最适合被理解为一个编排平台。它决定哪些任务可留在本地,维持音频功能,并在可穿戴设备需要更多智能时提供通往在线服务的路径。
Qualcomm 正在挑战以手机为中心的 AirPods 模式
这场主要竞争是 Qualcomm 更独立的音频平台与 Apple 以手机为中心的智能耳塞方式之间的较量。
Apple 的实时翻译展示了现有模式已能提供什么。受支持的 AirPods 可播放译文语音,但该功能依赖运行兼容操作系统、并启用 Apple Intelligence 的 iPhone。
Apple 的翻译要求清楚说明了分工。AirPods 提供聆听界面、麦克风和音频输出;配对的 iPhone 则提供更广泛的计算环境及 Apple Intelligence 访问能力。
这种安排具备显著优势。手机提供更大的电池、更多处理能力、用于设置的显示屏,以及已经了解用户应用的操作系统。Apple 还同时控制连接两端的硬件和软件。
Qualcomm 的方式为制造商提供了另一条路径。微功耗 Wi-Fi 6E 可将可穿戴设备直接连接到云服务,而 eNPU 则在本地处理适合的工作负载。手机依然有用,但不必介入每一次 AI 交互。
这种区别在高度受控生态系统之外尤为重要。Android 音频制造商往往要面对不同的手机品牌、操作系统版本、应用程序和助手提供商。功能更强的音频平台可能让它们对产品体验拥有更大的控制权。
例如,制造商可以围绕其偏好的服务构建实时翻译,而无需等待某家手机厂商的实现。另一家厂商则可能专注于个性化听觉体验,或为现场工作中检索信息的企业助手提供支持。
开发者还可通过 Snapdragon Sound Apps & Agents 在硬件出货后更新服务。Qualcomm 表示,这一层提供对可随时间演进的助手、内容和体验的访问。
这一机会颇具意义,但碎片化仍是风险。采用通用 Qualcomm 芯片组,并不保证拥有通用的控制方式、隐私政策、更新周期或应用支持。每家设备制造商仍可作出不同选择。
Apple 的优势在于一致性。当该公司在受支持的 AirPods 和 iPhone 上启用某项功能时,它控制配对流程、权限、固件、语言资源和用户界面。Qualcomm 则向众多制造商提供构建模块。
这种差异可带来更多实验,也可能造成功能宣传因手机、地区、助手或订阅要求而异的产品。买家可能难以判断某款特定设备究竟支持平台的哪些部分。
竞争者不只有 Apple。由 MediaTek 支持的 Airoha 是重要的蓝牙音频芯片供应商。消费品牌也可开发专有处理器,或将专用 AI 组件与现有音频硅芯片结合。
例如,Anker 已为部分 Soundcore 产品采用计算内存一体化音频芯片。这类设计在存储数据附近处理 AI 计算,以减少计算组件和内存组件之间的数据移动。
Qualcomm 的优势在于广度。Snapdragon Sound Elite Gen 2 将音频、AI、Wi-Fi、麦克风、感知能力以及面向开发者的服务层整合在一起。更专注的竞争对手或许能在某一项工作负载上表现出色,但在其他环节可能需要更多集成工作。
该公司还受益于现有的认证和设备生态系统。其早期的 Snapdragon S7 platforms 已经提供专用 AI 加速、自适应降噪,以及通过 XPAN 实现的可选 Wi-Fi 音频。
这段积累意味着,此次发布是一次扩展,而非 Qualcomm 突然进入 AI 音频领域。不同之处在于,Qualcomm 如今将智能体访问能力和多模态上下文置于产品叙事的核心。
最终结果将取决于制造商的执行情况。如果产品只是多加一个助手按钮,以手机为中心的模式依然更简单。如果直接连接能够实现更快速、更具上下文感知能力的交互,Qualcomm 就将打造出更清晰的替代方案。
这款 AI 耳机芯片仍面临隐私与续航考验
只有当用户信任设备所感知、存储和向外发送的信息时,始终可用的辅助功能才有价值。
音频穿戴设备处于敏感的位置。它们可以全天听到对话,始终贴近用户,并可能收集环境上下文。配备摄像头的耳机还增加了视觉通道,影响的不仅是拥有者,也包括周围的人。
Qualcomm 表示,其平台将端侧 AI 与以安全为重点的云端智能结合起来。本地处理可以减少发送到网上的原始数据量,尤其适用于唤醒词、声学分类和常规音频增强。
不过,直连云端也为数据离开设备开辟了新的路径。隐私结果取决于制造商、助手提供商、应用开发者和云服务商所作出的选择。
消费者需要获得明确答案。哪些声音在本地处理?麦克风何时会将信息发送到网上?录音是否会被保留?视觉传感器能否在没有明显提示的情况下启用?哪些第三方会收到上下文数据?
芯片组本身无法解决这些问题。它可以提供安全处理和连接功能,但最终产品决定权限、提示标识、默认设置、数据保留方式和账户控制。
配备摄像头的耳机尤其面临较高的信任门槛。Qualcomm 将摄像头描述为收集环境上下文的方式,而非拍摄传统照片。旁观者未必能理解这种区别。
一个能够解读标识、物体或对话的系统,依然会处理有关周围世界的信息。若想让人们在办公室、教室、商店和私人住宅中接受这些设备,制造商就需要提供明显的提示标识和易于理解的控制方式。
续航表现是另一项尚未解决的考验。Qualcomm 宣称平台功耗最高可降低 40%,但这一比较并未揭示使用持续感知和云端访问的成品设备能运行多久。
实际续航将取决于麦克风、摄像头使用情况、Wi-Fi 活动、模型选择、电池容量和散热设计。一场演示可以同时运行多项 AI 功能,却无法证明消费者能够在正常的一整天里持续使用它们。
30% 更小的占用面积同样需要结合背景理解。节省电路板空间可以支持更大的电池、更小的机身,或增加另一种传感器。制造商也可能将这部分空间用于会消耗额外能量的功能。
音质不能沦为次要因素。人们购买高端耳机,是为了音乐、通话、舒适性和降噪效果。AI 功能无法挽救一款连接不稳定、麦克风表现不佳或佩戴不舒适的产品。
可靠性同样重要。若助手错误理解周围对话,可能执行不必要的操作。翻译错误可能扰乱商务讨论。若感知失效,个性化听力调节也可能变得令人不适。
Qualcomm 尚未公布广泛的独立测试、已上市零售产品清单或明确的消费者发售时间表。其百分比描述的是平台潜力,而非消费者可以在商店中验证的性能。
这种不确定性并不否定该架构。更小、功耗更低的 AI 硬件确实解决了实际工程约束。但这意味着,此次发布应被视为一个赋能步骤,而非某个成功产品类别的证明。
最可信的早期应用或许会是较为聚焦的场景。更好的语音隔离、自适应听力和可靠翻译提供了明确价值,并不要求耳机表现得像自主的通用助手。
更具野心的智能体需要谨慎的权限设计。一款有用的穿戴设备应当知道何时聆听、何时询问,以及何时保持静默。这一行为层与底层处理器同样重要。
最佳应用场景应从听觉出发,而非自主智能体
当 AI 先改善听觉体验,而非试图管理用户生活时,Qualcomm 的平台最具说服力。
实时翻译是一个直接的例子。耳机本就提供私密音频通道,麦克风也早已用于通话时收录语音。更快的本地预处理可以在翻译服务进行语言转换前,先清理输入语音。
个性化听力是另一项实用用途。设备可以根据用户的听力档案和环境,调节放大、降噪和通透模式。这些变化可以持续发生,无需屏幕参与。
更清晰的语音采集也能支持远程办公。有人在嘈杂街道上加入通话时,可以在音频传送至会议服务前受益于本地语音分离。同样的处理也可以改善与助手的交互。
环境感知提供了第四种用途。开放式产品和通透模式需要在娱乐体验与重要外界声音之间取得平衡。AI 可以帮助突出语音、警报或驶近的车辆,同时降低不太有用的噪声。
这些场景有一个共同的实用特性:音频穿戴设备能够提供口袋中手机无法如此直接提供的能力。它的麦克风靠近用户头部,扬声器则以极低延迟提供私密输出。
当视觉进入系统后,上下文辅助会变得更有意思。配备摄像头的耳机可以识别物体、读取标识,或通过音频提供导航信息。这与智能眼镜开始追求的角色相似。
但摄像头也让设备偏离了人们熟悉的耳机范畴。制造商必须解释为何传感器应位于耳边、它如何朝向相关场景,以及人们如何知道它何时处于活动状态。
Qualcomm 的 Cleer 概念为行业提供了原型,而非定型设计。它融合音频、视觉和 AI,展示该平台能够支持多模态硬件。此次发布并未证明消费者是否会接受这种形态。
AI 助手层的不确定性高于音频增强功能。管理日历、消息、购买事务或工作场所系统,需要身份验证和可靠的操作控制。仅靠语音确认可能变得繁琐或模糊。
持续上下文还带来记忆问题。当助手能够将当前请求与先前的会议、文档和承诺联系起来时,它会更有用。这些历史记录必须保持可检索、权限受控且准确。
对于知识工作者而言,有趣的问题并不是耳机能否记录更多信息,而是由此产生的上下文能否被组织起来,而不形成另一条难以管理的转录文本流。
这正是成熟的 personal knowledge management 实践仍然具有相关性的原因。被捕捉的信息需要先具备结构、检索能力和用户控制,助手才能负责任地使用它。
Qualcomm 提供感知和连接基础,但并不拥有其上的所有层级。设备制造商、应用开发者和 AI 提供商必须决定上下文如何进入软件,以及用户如何纠正它。
这为差异化产品创造了空间。听力公司可以优先考虑自适应放大。工作场所供应商可以专注于现场指令。旅行品牌可以围绕受限的一组任务构建翻译和导航功能。
最弱的产品可能会将 AI 当作一个含义不明的标签。它们可能宣传助手,却无法展示更快的响应、更少的手机交互、更好的音频,或明确的隐私优势。
最强的产品将让智能几乎无形。降噪会正确适应,语音会始终清晰,有用信息也会在无需复杂设置的情况下到来。
Snapdragon Sound Elite Gen 2 为制造商提供了更多实现这一结果的工具。它并不能决定哪些公司会善用这些工具。
三个信号将显示 Qualcomm 的押注是否奏效
零售硬件、实测续航和开发者支持,将比新一轮平台演示更重要。
第一个信号是拥有明确发布时间窗口的具名上市产品。Qualcomm 已展示早期 Cleer 概念,但市场需要成品耳机或音频眼镜,并明确说明它们实际启用了哪些平台功能。
一场可信的发布应说明 AI 处理是在本地、通过手机还是在云端进行。它还应明确支持的助手、地区、语言和操作系统。
如果多家成熟音频品牌在未来几个月内宣布产品,Qualcomm 的地位将得到加强。若长期停留在概念和参考设计阶段,则表明集成仍然困难。
第二个信号是在真实 AI 工作负载下独立测得的电池续航。评测者应测试翻译、语音交互、自适应降噪、Wi-Fi 访问和多模态感知,而不应仅测试普通音乐播放。
若结果接近传统高端耳机的续航表现,将支持 Qualcomm 的效率主张。若智能功能开启时续航大幅下降,则表明该平台尚未摆脱穿戴设备的核心权衡。
评测者还应比较复杂环境下的延迟和语音准确率。安静的演示室无法复现通勤、刮风的街道、繁忙餐厅或多语言办公室。
第三个信号是真实的应用与智能体生态系统。Snapdragon Sound Apps & Agents 需要参与其中的服务、稳定的开发者工具,以及制造商会在发布后持续维护的更新机制。
当开发者能够在不设计新硬件的情况下添加实用能力时,Qualcomm 的平台便会增值。若每次集成都需要定制协议,且只能在一台设备上运行,其价值便会下降。
Apple 仍是最清晰的参照点,因为它可以在受控的手机和 AirPods 基础上分发功能。Qualcomm 必须证明,其更广泛的合作伙伴模式能够带来更快的实验,同时避免造成令人困惑的碎片化。
Snapdragon Sound Elite Gen 2 确立了技术方向。AI 音频穿戴设备将更多地在本地处理信息、保持云端访问,并将声音作为主要交互界面。
尚未回答的问题是,这一方向究竟会带来更好的耳机,还是只会带来更复杂的耳机。请密切关注首批零售设备。它们的续航、隐私控制和日常可靠性,将决定 Qualcomm 的 AI 耳机芯片会成为一个平台,还是包装盒上的另一项规格说明。



