top of page

尽管视频泄露,Apple 配备摄像头的 AI AirPods 仍瞄准 2027 年推出

8月20日
讀畢需時 14 分鐘

尽管一段泄露视频让这款尚未发布的产品看起来离上市更近了一步,Apple 配备摄像头的 AI AirPods 目前仍计划于 2027 年推出。

据报道,这段视频来自 macOS 26.7 的候选发布版本。视频似乎展示了 AirPods 使用 Visual Intelligence——Apple 用于分析设备捕捉到的物体和文字的系统。Apple 尚未公布配备摄像头的 AirPods,也未确认其设计、功能或发布日期。

这种表面上的矛盾才是真正的看点。Apple 似乎已推进到能够制作精致教学素材的阶段,但相关报道仍将其商业发布定在 2027 年。这一差距指向的问题,比在耳机上加装小型摄像头要困难得多。

Apple 需要让摄像头、Siri、视觉模型、电池系统和隐私控制共同构成一款可靠的产品。与此同时,Meta 已将配备摄像头的眼镜交到消费者手中。因此,这场竞争是在已上市的智能眼镜平台与 Apple 尚未完成的、试图将视觉 AI 融入熟悉音频配件的方案之间展开。

泄露改变了预期,而非 Apple 据报的时间表

泄露视频证明产品正在积极开发中,但并不意味着它即将零售上市。

这段视频于 2026 年 8 月 18 日在网上出现。据报道,视频展示了一名佩戴者使用 AirPods 为 Siri 捕捉视觉上下文。根据对这段泄露 AirPods 视频的报道,该文件据称是在 macOS 26.7 候选发布版软件中发现的。

这一来源很重要,因为软件资源可能会暴露仍在开发中的硬件。Apple 必须在联网产品出货前准备界面、引导页面、无障碍文字和支持材料。这些资源有时会比预期更早地出现在测试软件中。

不过,准备好一段视频并不能证明制造、软件可靠性或监管审查已达到同一阶段。企业也会为原型制作内部演示,而这些原型可能会发生重大变化,或根本不会进入商店销售。

视频中可见的场景表明,Apple 将摄像头视为 AI 助手的传感器。它们将向 Siri 提供有关佩戴者周围环境的视觉信息。用户随后可以询问遇到的物体、标志、地点或物品。

这一功能不同于将耳机当作传统摄像机使用。早前报道指出,Apple 的摄像头主要目的并非个人拍照或录像。拟议中的系统将转而解读周围环境,并返回答案、提醒、翻译或指引。

这种差异有助于解释:产品在视频中看起来可能已经完成,但作为一个平台仍未成熟。在受控条件下捕捉图像并不困难;要在不断变化的光线、运动、噪音、连接状态和身体姿势下提供准确协助,则难得多。

此前报道将该产品的发布时间定在 2027 年末,可能接近 Apple 第二十周年 iPhone 以及其折叠手机的另一代产品。泄露并未改变这一时间表。Apple 尚未公开承诺,而报道也警告称,计划仍可能变动。

因此,这段视频改变的是公众预期,而非 Apple 据报的产品路线图。消费者如今可以想象这种交互方式,而不再只能依赖抽象的供应链描述。Apple 仍需证明,这种交互在宣传演示之外也能可靠运作。

泄露也缩小了讨论范围。配备摄像头的 AirPods 不再只是一个奇特的硬件传闻。它们代表了一项明确押注:AI 耳机能够理解现实世界,同时又不会变成微型运动相机。

这一押注构成了 Apple 的核心挑战。该公司必须让视觉感知足够实用,足以证明在用户脸部附近放置摄像头的合理性,同时限制让可穿戴摄像设备引发争议的录制行为。

Apple 为何想在 AirPods 中加入摄像头

Apple 试图让 Siri 获得持续的视觉上下文,而无需用户每次提问都举起 iPhone。

Visual Intelligence 已为这一想法提供了概念基础。在支持的 iPhone 上,用户可以将摄像头对准文字、物体、地点或其他内容,并请求相关信息。配备摄像头的 AirPods 将把视觉输入从手持屏幕中解放出来。

其实际吸引力在于即时性。旅行者可以询问哪块标志指向火车站台。购物者可以在拥挤货架上找到某件商品。视力受限的用户可以请求描述前方的物体。

另一种场景涉及情境记忆。用户可以让 Siri 记住曾在哪里看到某件物品,再在之后调取这项信息。这种用法将摄像头变为个人上下文的输入工具,而非媒体创作工具。

Apple 尚未确认这些能力。此前报道将物体问答、情境提醒和改进的步行导航描述为潜在用途,而非已公布功能。每一项都依赖准确的感知能力和强大的助手。

其底层技术路径是可信的。一项名为 VueBuds 的 2026 年研究项目测试了集成到无线耳机中的低功耗摄像头。该系统结合双耳视角,以克服佩戴者面部造成的部分遮挡。

其摄像头在按需启用时功耗低于 5 毫瓦。研究人员在 17 项视觉问答任务中评估了 90 名参与者。他们报告称,在这些测试中,其回答质量可与 Ray-Ban Meta 眼镜相当。

这项工作并不能验证 Apple 的具体实现,但它表明耳部是视觉感知的可行位置,即使每个单独摄像头的视野并不完美。

耳机形态也为 Apple 提供了可依托的既有使用习惯。人们已经佩戴 AirPods 听音乐、通话、接收导航提示和发出语音指令。加入视觉输入可以扩展这些交互,而无需消费者接受一种全新的眼镜品类。

但熟悉感并不能消除人体工学问题。AirPods 在耳中可能轻微转动,头发或衣物也可能遮挡摄像头。一只耳机可能被取下,另一只仍留在耳中。用户头部所朝的方向也并不总是与其关注的物体一致。

智能眼镜在这一点上具有天然优势,因为摄像头更接近佩戴者的视线方向。耳机必须推断其合并视角是否对应用户所说的“那块标志”或“我前面的物体”。

Apple 自己的研究人员也研究了该问题的另一部分。该公司的第一人称视角 AI 研究考察多模态模型如何随时间理解第一人称视频。其 MM-Ego 工作包括一个含有 629 段视频和 7,026 个问题的基准测试集。

研究人员描述了涉及视觉记忆、时间顺序以及较长录制内容中分散细节的挑战。这些挑战与可穿戴助手面临的要求密切相关,尽管已发表研究并非产品公告。

因此,摄像头只是更长系统链条中的第一环。Apple 需要一个能识别相关视觉信息、记住适当上下文、排除无关画面并快速响应的模型。

它还必须做到不耗尽微小电池,也不将不必要的视觉数据发送到其他地方。这种组合能力,而非原型的存在,很可能决定了产品何时准备就绪。

Apple 的 AI AirPods 面临 Meta 的先发优势

Apple 并非进入一个空白市场,因为 Meta 已将智能眼镜确立为面向消费者的视觉 AI 的主导形态。

Ray-Ban Meta 眼镜在一副熟悉的镜框中整合了摄像头、麦克风、扬声器和 AI 助手。其摄像头位置比安装在耳部附近的摄像头更贴近佩戴者视线。它们还可以拍摄照片和视频,为客户提供 AI 问答之外的直接用途。

Apple 据报的方案作出了不同取舍。配备摄像头的 AirPods 将保留熟悉的耳机形态,同时限制或避免普通图像捕捉。其价值将更重度依赖 Siri 理解场景并提供有用回答的能力。

这种差异让 Apple 的软件承受压力。当 AI 回答不够理想时,Meta 用户仍可将眼镜当作免手持相机使用。如果 Apple 的摄像头主要用于机器解读,其产品的后备用途就更弱。

泄露视频表明 Apple 理解这一要求。据报道,视频强调的是 Visual Intelligence,而非摄影。Apple 推销的是有用上下文的前景,而不是又一种记录音乐会或社交短片的方式。

Meta 的领先也为其提供了更多时间,去改善那些无法完全在实验室中模拟的使用模式。现实世界中的可穿戴摄像头会遇到眩光、雨天、拥挤空间、口音、不稳定网络和社交不适。

Apple 可以在发布前研究这些经验。它可以观察人们反复提出哪些视觉问题、哪些隐私控制能够建立信任,以及智能眼镜在哪些方面未能提供持久价值。

等待也有其代价。每多一年,Meta 就多一年的机会扩展其助手、开发者关系和消费者熟悉度。这也会进一步强化一种观念:视觉 AI 天然属于眼镜。

Apple 必须提供一个清晰理由,让用户改选耳机。这个理由不能只是生态系统整合,因为 Meta 的产品已经可以与智能手机配合使用,并支持熟悉的语音交互。

AirPods 可能会凭借低调、舒适和连续性取胜。用户可能更愿意使用既能提供音频协助、又不改变外观或不要求适配处方镜框的耳机。Apple 还可以协调 AirPods、iPhone 与 Siri 之间的处理。

然而,低调也带来了社会问题。耳机中的小型摄像头可能比眼镜上的摄像头更难被旁人察觉。可见度更低的硬件可能让人感觉更具侵扰性,即便它录制得更少。

据报的产品细节包括一枚指示灯,当摄像头向 Siri 发送数据时会亮起。这样的信号只能解决部分担忧。附近的人必须理解这盏灯的含义,并相信设备会如其所述地运行。

因此,Apple 的战略取决于一个困难的主张。它必须论证:一个不显眼的视觉传感器可以比明显的摄像头更注重隐私,因为其软件限制了用户和应用程序可对数据做什么。

这一主张需要明确的产品规则。Apple 将需要解释感知何时开始、哪些内容会被存储、处理在哪里发生、信息会保留多久,以及第三方应用程序是否可以获得访问权限。

Meta 的先发优势让这些解释更加紧迫。Apple 不能将视觉可穿戴设备描绘成一个全新概念,而必须说明其实现为何能解决现有智能眼镜尚未解决的问题。

真正的限制是信任,而非摄像头尺寸

Apple 可以缩小硬件,但无法缩小围绕随时可用视觉传感器的隐私和可靠性问题。

第一个问题是激活方式。按需感知与持续采集存在本质差异。只有在用户明确指令后才进行观察的产品,比持续扫描有用情境的产品暴露的信息更少。

泄露的演示并未证实 Apple 选择了哪种模式。它同样没有说明激活是通过语音指令、触控手势、自动检测,还是多种方式完成。

每种选择都会带来相应后果。语音激活很直观,但在安静场所可能显得尴尬。触控操作更隐蔽,却不易被旁人察觉。自动感知带来便利,同时也会加剧人们对无感采集的担忧。

第二个问题是数据处理。Apple 必须决定视觉分析是在耳机上、配对的 iPhone 上、其 Private Cloud Compute 基础设施中,还是通过这些系统的组合完成。答案将影响延迟、电池使用和用户信心。

由于功耗和散热能力有限,耳机端处理所有内容的可能性不大。将画面传输到 iPhone 可以提供更多计算资源,但无线传输同样会消耗能量。云端分析可支持更大的模型,但也会带来额外的隐私问题。

成熟的产品或许会分配这类工作负载。基础激活和过滤可在本地完成,而 iPhone 负责更重的图像分析。更高要求的请求则可能在用户授权后发送至云端模型。

这只是基于产品形态限制作出的推断。Apple 尚未披露配备摄像头的 AirPods 架构。

第三个问题是准确性。视觉助手必须在不可控条件下识别物体、文字、距离和情境。误读一家餐厅的招牌尚且只是麻烦;在车流附近给出错误方向则可能造成危险。

因此,Apple 必须控制 Siri 呈现不确定结论的方式。助手应区分已观察到的事实与模型猜测,并避免将不完整图像当作可靠证据。

摄像头位置进一步加剧了这一挑战。头发、帽子、头部运动和面部轮廓都可能遮挡视野。两只耳机也可能捕捉到不同曝光的画面,或略微指向不同方向。

研究系统可以通过融合两个视角来补偿。消费级硬件则必须快速完成这种融合,同时应对其中一个摄像头失效的情况。它还必须识别何时可用图像质量过低,无法作答。

电池续航带来了另一项限制。摄像头、无线传输、麦克风和 AI 处理都会消耗能量。Apple 不能让偶尔的视觉提问削弱人们购买 AirPods 的首要理由:可靠的音频体验。

这种平衡或许解释了相较早期目标所报道的延期。对2027 年末路线图的报道指出,Apple 还需要进一步开发能够识别附近物体的视觉模型。该报道同时指出,时间安排仍可能发生变化。

该公司还面临一场更广泛的 Siri 可信度考验。只有当助手理解问题、选择正确的视觉证据并给出简洁回答时,Visual Intelligence 才有价值。硬件无法弥补推理能力薄弱或执行不可靠的问题。

这些风险并不意味着产品无法实现。它们解释了为什么一个看似完整的宣传素材不应被视为产品已准备就绪的证明。

Apple 可以在解决涉及隐私、电池续航、无障碍功能和模型错误的边缘情形前数月,展示一次成功的交互。2027 年发布将给予其更多时间,把引人注目的演示转化为可重复实现的体验。

配备摄像头的 AirPods:以记录换取理解

Apple 最突出的差异化优势,也是其最大的商业风险,在于摄像头可以理解世界,却不能作为普通摄像头使用。

取消传统的拍照和录像功能,将减少可穿戴设备录制行为所引发的若干担忧。如果操作系统从不提供图片库或录制界面,用户便无法隐蔽地收集片段供日后查看。

这一限制也会让产品更容易解释。摄像头将是服务于 Siri 的传感器,原则上类似用于语音指令的麦克风。视觉数据的存在是为了响应某项具体请求。

但图像包含的附带信息比大多数语音指令更多。一帧画面可能包含人脸、文件、屏幕、住宅内部、车牌和位置线索。限制访问并不能消除对留存和处理政策的审慎需求。

Apple 需要在购买前就提供易于理解的控制机制。仅有一份技术隐私文档无法消除社会层面的不确定性。附近的人需要在系统观察他们时看到明确、一致的信号。

据报道的指示灯是一种可能的解决方案。它是否有用取决于亮度、位置和执行机制。如果应用或设置可以将其关闭,信任会迅速流失。

Apple 还必须决定是否允许开发者围绕这些摄像头构建体验。封闭系统让公司拥有更多控制权,但也限制了创新。应用接口可以创造更多用途,同时增加意外采集的风险。

这种张力同样延伸至记忆功能。情境回忆可让视觉 AirPods 变得真正实用。用户可能会询问停放的自行车留在了哪里,或此前出现过哪个产品标签。

记忆也会产生最敏感的数据。除非某种场景表征得以保留,否则系统无法回忆过去的场景。Apple 需要界定它存储的是图像、提取的文本、物体标签、加密嵌入,还是短暂的情境摘要。

商业层面的问题是,仅靠理解是否足以提供足够价值。消费者理解摄像头为何要记录照片。让他们购买永远不会交付图像的摄像头,需要他们相信助手确实有用。

该产品可能强烈吸引希望获得免手操作翻译、导航、物体识别或无障碍支持的人群。这些任务能够带来即时收益,而不会将佩戴者变成内容创作者。

对于习惯举起 iPhone 的客户而言,同一款产品也可能显得没有必要。Apple 必须减少足够多的阻力,才能让这种新输入方式显得不可或缺,而非可有可无。

这正是 AirPods 形态能够发挥作用的地方。耳机已具备助手所需的私密输出通道。Siri 可以描述场景或提供路线,而不会通过手机扬声器公开播放回答。

这种形态也可能带来不利影响。与眼镜不同,AirPods 没有视觉显示屏,也无法展示已校正的画面。如果助手查看了错误的物体,用户几乎没有办法看到或调整其理解。

当精度至关重要时,Apple 可以利用配对的 iPhone 进行确认。这会提升控制力,却削弱免手操作视觉智能的承诺。

供应链报道还指出了红外摄像头和可能的手势感知。此前关于红外 AirPods的报道援引分析师郭明錤的预期,称生产将涉及红外传感器。

红外感知与泄露的视觉助手演示可能描述的是不同能力、传感器配置或原型。Apple 尚未公开将二者联系起来。将每则传闻都视为同一份最终规格,会夸大已知信息。

更可信的结论更为有限。Apple 已探索将摄像头作为 AirPods 的新输入方式,而视觉 AI 似乎是这项工作的核心。最终的传感器组合和允许的功能仍未得到确认。

2027 年前值得关注的事项

三个信号将显示 Apple 是否已从先进原型走向能够经受日常使用考验的产品。

第一个信号是 Apple 的下一次重大软件发布。开发者应关注将 AirPods 视为视觉传感器的接口、权限措辞、无障碍描述或框架。

软件层面的提及并不保证产品发布。但它会揭示 Apple 预期硬件如何与 Siri 及配对的 iPhone 通信。明确的权限控制也将表明隐私行为正成为公共平台的一部分。

最有力的确认将是一套有文档说明的激活模式。Apple 需要明确摄像头是否仅在用户明确请求后运行,以及用户能否查看或删除由此产生的数据。

如果即将推出的软件提供这些控制,2027 年的时间线将更具可信度。如果相关提及消失,或仍仅限于内部素材,产品可能仍在经历重大变化。

第二个信号是 Siri 在普通 Visual Intelligence 任务中的表现。Apple 可以在新硬件到来前利用 iPhone 这一现有视觉输入,改进助手能力。

关注 Siri 识别物体、读取标志、记住所请求情境以及处理不确定性的可靠程度。这些能力比微型摄像头的分辨率更重要。

如果 Siri 能够持续有效地回答简短、结合情境的视觉问题,配备摄像头的 AirPods 这一论点就会更有力。如果用户仍频繁遇到回答延迟、识别错误或多步骤请求失效,这一论点则会减弱。

Apple 已发布的机器学习研究表明,第一人称视觉理解仍是一个活跃的研究领域。研究进展不会自动成为正式发布的功能,但它阐明了 Apple 认为重要的技术问题。

第三个信号是 Meta 和其他可穿戴设备制造商的竞争反应。Meta 可以在 Apple 进入市场前改进电池续航、隐私指示灯、实时翻译和无障碍功能。

更强大的眼镜平台将提高 Apple 必须达到的标准。它也可能验证市场对视觉助手的需求,使消费者更愿意接受其他可穿戴形态中的摄像头。

Apple 不应复制眼镜的每项功能。更有价值的比较在于,耳机能否针对常见视觉问题提供更快的访问、更好的隐蔽性或更强的隐私保护。

市场还将揭示哪些行为能在新鲜感消退后持续存在。频繁使用导航、翻译、购物或无障碍功能,将支持 Apple 以理解为核心的设计。若人们持续强调拍照和录像,则会更有利于眼镜。

在 Apple 宣布产品之前,每一种时间表都应谨慎对待。一段泄露视频可能反映严肃的开发工作,同时仍为取消、重新设计或再次延期留有余地。

核心说法仍有意义。据报道,配备摄像头的 AI AirPods 仍有望于 2027 年推出,因为 Apple 打造的不只是一个传感器配件。它正试图在 Siri 与现实世界之间建立一个私密、可靠的接口。

这项努力对硬件、软件和社会接受度提出了不同寻常的要求。设备必须看得足够多,却不能显得一直在监视。它必须快速作答,却不能牺牲电池续航。它必须记住有用情境,却不能形成不受控制的视觉档案。

未来一年将显示 Apple 能否守住这些边界。读者应关注 Apple 软件中内置的权限机制、Siri 视觉回答的质量,以及 Meta 在眼镜方面的进展。

如果这些要素能够协同,AirPods 就可能成为日常 AI 的实用视觉输入方式。如果不能,泄露视频将仍如它今天所呈现的那样:对一款 Apple 尚未证明已准备好出货的产品所作的一次有说服力的演示。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page