top of page

SCM AI 媒体搜索以全文件夹视频搜索挑战 Apple Photos

4天前
讀畢需時 14 分鐘

SCM AI 媒体搜索在 Hacker News 上亮相时作出了一项直接的承诺:无需上传个人媒体内容,即可搜索 Mac 上的每一张照片和每一个视频瞬间。这款开源应用可搜索普通文件夹、将视频划分为场景、识别可见文字,并为语音对话建立索引。这一能力范围让 SCM 进入了 Apple 已通过 Photos 涉足的领域,但它对用户文件采取了不同的边界定义。

Apple Intelligence 可以通过自然语言描述查找照片和视频中的关键时刻。不过,Apple 的体验以 Photos 资料库内的媒体为核心。SCM 则面向文件夹、外置硬盘归档、截图、项目导出文件以及其他无法自然归入 Photos 的内容集合。

这一差异让 SCM 在电影制作人、研究人员、设计师,以及拥有多年松散整理媒体的人群中获得了可信的切入机会。但这也构成了项目的核心考验:随着资料库规模远超精心打磨的演示环境,本地索引必须保持准确、易于理解且便于管理。

SCM AI 媒体搜索将文件夹变为可检索资料库

SCM 的重要变化不只是自然语言照片搜索,而是在用户选定的文件夹中整合了多种本地检索系统。

SCM 代码库描述了五种搜索模式。Files 模式可按视觉语义检索完整照片或视频;Scenes 模式定位视频中的片段;OCR 模式查找可见文字,Dialogue 模式则搜索转录文本。可选的本地语言模型能够基于已从资料库中提取的文本回答问题。

这些模式解决的是不同的检索问题。视觉模型可以将“红色汽车旁奔跑的狗”与视觉相似的图像关联起来,但无法保证一个极小的序列号可被读出。OCR 则能更直接地处理这类字面文本任务。

对话搜索承担着另一种角色。SCM 使用 Whisper 转录,并在特定时间戳查找精确词语。记得采访中某句话的用户,无需描述周围场景即可搜索该句内容。

这种分离很重要,因为广义的 AI 搜索常常把多个不确定过程隐藏在同一个输入框之后。SCM 将不同模式明确呈现,并标示结果出现的原因。文件结果可以说明是视觉匹配还是文件名匹配;对话结果则会展示命中的转录片段。

这一设计应能让错误更容易诊断。如果搜索遗漏某个短语,用户可以判断是转录失败,还是这些词从未一同出现。单一、不透明的相关性评分能提供的指引更少。

SCM 也可在单一受管理的照片集合之外工作。用户可以通过应用导入、将文件拖入其中,或选择受监控文件夹。该项目表示,受监控文件夹会获得实时更新,并在 SCM 启动时重新扫描。

导入的文件会被复制到应用管理的资料库中。SCM 会在复制前计算 SHA-256 内容哈希,因此即使文件重命名后也能识别重复内容。它还会检查实际媒体类型,而不是仅信任文件扩展名。

这种方法有助于建立稳定的本地索引,但会占用额外存储空间。外置硬盘上的内容并不会仅保留为索引引用;SCM 会在应用支持目录下保留自己的副本。

在有人为大型归档建立索引前,这一区别应被明确理解。拥有数 TB 素材的创作者,面临的存储计算不同于仅导入截图文件夹的人。

该项目目前提供了适用于运行 macOS 12 或更高版本、搭载 Apple silicon 的 Mac 的 Homebrew 安装方式。其打包应用采用 Electron,界面使用 React,并为视觉、OCR 和语音识别设置了独立工作进程。

SCM 同时采用 MIT License 授权。开发者可以检查实现、构建应用、运行测试,并据此改造项目。这种开放性使其区别于那些提出相似本地处理主张、却保持封闭的媒体搜索产品。

在提供的快照中,这则 Hacker News 投稿最初仅获得四个积分且没有评论。这并不能证明产品已被采用,更适合被理解为一个技术雄心勃勃的开源项目的公开首秀。

那么,变化在于 Mac 用户如今可以检查并在本地运行一套整合式搜索管线。问题也从这种检索是否可行,转向 SCM 的实现能否在真实资料库条件下持续有用。

真正的竞争在于 SCM 与 Photos 资料库边界

SCM 在资料库边缘向 Apple Photos 施压:媒体文件存在于磁盘上,却尚未进入 Apple 的受管理集合。

Apple 已支持自然语言检索。其文档指出,Photos 搜索可以定位特定图像或视频中的关键时刻。用户可以描述一个场景,再按照片、视频、截图、收藏或关键词筛选结果。

这使 Apple Photos 成为最明确的参照对象,而不是一个缺乏语义搜索的产品。双方的分歧在于范围与控制权。

Apple 针对高度整合的个人资料库进行优化。Photos 将搜索与人物、宠物、相簿、编辑、回忆和 iCloud 同步连接起来。这种整合对于家庭照片集和手机摄影很有价值。

SCM 则将文件系统视为起点。其潜在用户会把素材保存在制作文件夹、下载归档、相机存储卡备份和客户目录中。他们可能不希望将这些文件重复导入 Photos,或通过 iCloud 同步。

设想一位纪录片剪辑师,拥有采访录音、B-roll、扫描的授权文件和参考图片。一个查询可能针对说过的话,另一个可能描述视觉场景,第三个则可能搜索授权表中可见的电子邮件地址。

没有一种单一表示方式能很好地处理这三类请求。SCM 将它们分别交给转录文本、视觉嵌入和 OCR,再返回完整文件或带时间码的场景。

这种多模态划分是该项目最有力的论据。它认识到,“搜索我的媒体”涵盖语义、字面文字、语音、文件名和时间信息。这些输入彼此重叠,但不可互换。

SCM 还提供以标签页形式呈现的已保存搜索。用户可以保留查询及其模式,并随着受监控文件夹接收新文件而重新查看该视图。截图和面向电子邮件的视图,则在共用资料库之上增加了更细分的工作流。

电子邮件视图尤为具体。它尝试重建被 OCR 拆分到不同文本框中、或因标点而识别错误的地址。这项功能将截图和拍摄的文档变成了轻量级的联系人恢复界面。

截图视图会利用文件名、元数据、文件夹上下文和手动覆盖设置,而不只依赖视觉相似度。当有用的元数据仍可用时,这种分层分类方式可以适应已重命名的文件。

对于知识工作者而言,这类似于围绕媒体而非文档建立的本地个人知识库。其价值在于,无需知道文件名或原始文件夹,便能找回记得的细节。

Apple 仍拥有显著优势。Photos 随 macOS 提供,界面成熟,并受益于 Apple 设备之间的整合。它还可利用独立文件夹工具未必拥有的资料库上下文。

SCM 的优势更为聚焦,但依然有意义。它让用户定义内容语料,而不是要求语料适应某一应用。当文件夹本身已编码项目、客户、日期或存储位置时,这种灵活性尤为重要。

目前还有数款 Mac 应用正致力于本地照片和视频检索。有些专注于专业视频素材,另一些则增加了字幕、转录或关键帧提取。因此,SCM 进入的是一个活跃品类,而非空白市场。

其开源地位仍可能吸引独特的受众。开发者可以核实文件存储位置、检查网络行为,或替换索引栈的部分组件。他们也能发现营销页面可能未解释清楚的风险。

SCM 对 Apple 的压力并不在于它将取代大多数 Mac 用户的 Photos,而在于原生于文件夹的工具揭示了仍处于 Photos 之外的可搜索媒体规模。Apple 的资料库边界为专业应用留下了竞争空间。

场景采样让“每一帧”承诺变得更复杂

SCM 并不会独立嵌入每一张解码后的视频帧,而是构建场景片段,并为代表性的中点帧建立索引。

这是 SCM 视频搜索背后的核心机制。FFmpeg 首先分析视频的镜头边界,随后 SCM 根据设置中选定的密度创建片段计划。

可用预设从每 60 秒一个搜索点到每 2.5 秒一个搜索点不等,其片段预算也不同。默认的平衡设置以 30 秒间隔采样,标称范围为 8 至 128 个片段。

对于每个计划片段,SCM 会嵌入中点帧并保留一张海报图。查询会被转换为同类的数值表示,应用再根据查询与每张已存储帧之间的相似度对片段排序。

嵌入是一种紧凑的内容数值表示。相似的图像和描述应在这一数学空间中彼此接近。搜索比较的是这些位置,而非匹配文件名或标签。

默认视觉引擎为输入尺寸 336 像素的 CLIP ViT-L/14。OpenAI 的 CLIP 模型概述解释了该模型如何学习图像与自然语言描述之间的关联。这种训练支持检索,无需为每一个可能的概念手动分配标签。

SCM 表示,默认模型下载量约为 435MB。它还提供三种 SigLIP 变体,包括更快的模型,以及旨在保留更多细节的更大表示模型。

底层的 SigLIP 2 研究强调了更强的多语言理解、图文检索和定位能力。这些特性使 SigLIP 模型适用于多样化的个人资料库。

SCM 声称,其最快选项的 CPU 推理时间约为每张图像 50 至 100 毫秒。较慢选项则约为每张图像 200 毫秒或 480 毫秒。这些是项目自行报告的数字,并非在不同 Mac 上进行的独立基准测试。

因此,模型选择会同时影响导入时间与检索行为。切换模型会在后台重新嵌入资料库;在此过程中,SCM 会暂时回退为文件名搜索。

重要的限定在于“每一帧”。SCM 可以搜索视频各处并返回带时间码的匹配场景,但其文档所述管线嵌入的是采样中点帧,而不是视频解码器产生的每一张独立帧。

这种实现是合理的。一段 30 分钟、每秒 30 帧的视频包含 54,000 帧。对每一帧建立嵌入会成倍增加计算量和索引大小,而相邻帧往往包含几乎相同的信息。

场景分段压缩了这种重复。它旨在保留不同的时刻,而不是将每一秒的每个片段都当作独立记录。结果的质量取决于镜头检测与采样是否保留了用户想找的那个时刻。

短暂事件仍可能落在代表性帧之间。设想一下:一张仅出现一秒的标题卡、驶过的车牌,或是在连续镜头中短暂出现的人物。较粗的设置可能会错过这些视觉内容。

提高采样密度可以缩小遗漏范围,但会增加处理时间和存储需求。SCM 的详细设置让这种权衡变得可见。用户可以为重要素材选择更密集的索引,也可以为大型归档采用更轻量的方案。

整段视频文件搜索采用了另一种捷径。SCM 表示,它会在视频的 20%、50% 和 80% 位置采样画面,再对其嵌入向量取平均值。这种摘要可以代表整个文件的整体内容,但无法捕捉每一个不寻常的场景。

因此,Scenes 模式才是面向时刻级检索的有效途径。Files 模式回答的是关于整段视频整体内容的更宽泛问题。

该应用加入了噪声门限,避免将较弱的场景匹配呈现为有用结果。它还将每个视频的场景结果限制为三个。这些限制可以提升结果多样性,但也可能隐藏同一文件中的多个合理时刻。

搜索排序包含经过模型校准的阈值,以及用于过滤近似重复项的机制。SCM 还通过结果徽章和工具提示展示分数细节。这种透明度有助于用户理解:某个匹配来自视觉内容、短语,还是文件名。

但相似性并不等于识别。模型可能检索到颜色、构图或常见关联相似的图像,却并不包含用户要求的主体。它也可能漏掉人类认为显而易见的概念。

原始 CLIP 模型卡警告称,受约束的图像搜索必须针对目标领域进行充分测试。CLIP 最初作为研究系统开发,其训练过程可能会将社会与文化偏见带入检索结果。

SCM 的模型选择为用户提供了替代方案,但并未消除这种根本性的不确定性。最适合识别标志和小型物体的模型,未必是处理数千张普通照片时最快的选择。

更诚实的描述是:SCM 创建了一张可搜索的视频场景地图,并以可配置的密度对这张地图进行采样。“每一帧”传达的是用户体验,而仓库文档展示的是一个更具选择性的工程过程。

本地处理提升隐私,但也带来新的成本

SCM 用本地存储、算力、维护与信任决策,取代了云端暴露。隐私更强,但并非没有代价。

该项目称,媒体文件永远不会离开 Mac。视觉模型权重仅需下载一次,之后的视觉索引可离线运行。OCR 和 Whisper 处理也会在所需文件下载完成后于本地进行。

SCM 表示不设账户、不采集遥测数据,也不上传媒体。其可选语言模型功能会保持禁用状态,直至用户主动启用。本地模型接收的是提取出的对话、OCR 文本和文件名证据,而不是将整个媒体库发送给托管聊天机器人。

这种设计对敏感材料很有吸引力。家庭照片、法律录音、研究访谈、客户素材和拍摄的文件都可能暴露个人信息。本地处理减少了将这些材料传输给外部服务的需求。

该应用还在回环接口上运行其语言模型侧车服务。在正常情况下,该地址将连接限制在同一台设备上。SCM 表示,该功能会为每项回答引用所使用的本地证据。

不过,用户仍需评估软件分发安全性。Homebrew 安装说明中包含信任项目 tap 或 cask 的命令。这种信任会影响安装和升级期间 macOS 隔离机制的处理方式。

由项目控制的安装渠道并不等同于 Apple Mac App Store 的审核流程。开源允许审查,但大多数用户不会亲自审计每个依赖项或发布构件。

仓库指出,未签名的本地构建可能触发 macOS 警告。代码签名可识别开发者,并有助于验证应用自签名后未被篡改。但它并不能独立证明该应用是安全的。

SCM 的依赖面也相当庞大,包括 Electron、FFmpeg、ONNX Runtime、视觉模型、Tesseract 数据、Whisper 权重,以及可选的 llama.cpp 组件。每个部分都会带来功能、更新和潜在维护工作。

该项目表示,下载内容会通过 SHA-256 哈希进行校验。这可以防止构件与预期文件不一致,但无法证明预期构件或其上游模型本身是否可信。

本地存储是另一项成本。SCM 会将导入的媒体复制到其托管媒体库中。因此,索引大型外部归档的人可能需要足够的内部或已配置存储空间,同时容纳源集合和 SCM 的副本。

其索引还会增加嵌入向量、缩略图、场景海报、转录文本、OCR 边界框和侧车文件。更密集的视频采样会产生更多记录。多个嵌入版本还会进一步增加存储占用,尽管 SCM 将这些快照限制为十个。

处理时间可能相当可观。即使一个快速模型每张图像仅需 50 毫秒,面对数十万样本时仍需要持续处理。OCR 和转录也会形成独立队列。

笔记本电脑还必须管理发热、电池消耗和可用内存。SCM 提供后台工作控制与全局暂停功能,这也承认索引会与日常工作争夺资源。

搜索质量引入了一项不那么显眼的成本:用户必须了解哪种模式适合回答哪类问题。即使目标图像实际存在,在 OCR 模式中输入视觉查询仍会失败。

可选的 Ask 功能增加了另一层解释过程。它先检索提取出的证据,再通过本地模型生成回答。SCM 表示,当证据为空时会在生成前终止请求,这可以减少缺乏支持的回答。

引用有帮助,但小型本地模型仍可能错误概括证据。返回的答案应引导用户回到所引述的转录文本、文件名或 OCR 结果,而不应取代对源媒体的核验。

转录也有类似局限。口音、重叠说话、背景噪声和专业词汇都可能导致错误。Whisper 转录错误的词语无法通过精确对话搜索找回。

OCR 表现取决于图像分辨率、对比度、方向、字体和语言支持。SCM 包含英语,并提供 35 个额外语言开关。下载语言包并不能确保每一张截图或每一帧都能被准确识别。

视觉嵌入本身也面临歧义。“一场紧张的会议”需要对情绪作出解读。“批准合同的人”则要求获取像素中可能根本不存在的知识。

隐私也可能因普通计算机使用习惯而失效。本地数据仍可能受到恶意软件、不安全备份、共享账户或未锁定 Mac 的威胁。离线 AI 缩小了网络暴露面,但无法替代设备安全。

相较于强制云端分析,SCM 的架构提供了可信的隐私优势。它真正的交换条件更具体:用户将数据保留在本地,同时承担存储、硬件、更新和验证的责任。

准确性与规模将决定 SCM 能否超越演示阶段

下一阶段取决于它能否在杂乱媒体库中实现可重复的表现,而不是增加更长的功能清单。

首要关注信号是独立搜索评估。SCM 需要基于真实照片和视频集合开展测试,其中包含已知目标时刻,并且查询应在查看结果前就已制定。

有价值的评估应衡量召回率、误匹配和获得结果所需时间。还应将场景搜索、OCR、对话和整文件检索分开衡量。混合成功率会掩盖系统真正的困难所在。

模型比较也需要同样的处理。SCM 列出四种速度与体积各异的视觉模型。用户需要知道:哪种模型最可靠地找到小型标志、罕见物体、多语言概念和短暂的视频时刻。

该项目已经包含单元测试、Electron 冒烟测试和基准脚本。这些检查可以捕捉软件行为回归,但不能替代具有代表性的检索基准测试。

第二个信号是大型媒体库性能。索引少量文件夹无法揭示应用在面对多年素材、重复导出文件、中断导入、断开连接的驱动器和不断变化的模型版本时的表现。

SCM 的内容哈希和缓存场景计划提供了有用基础。重新导入的文件可以避免重复部分工作,而受监控文件夹则能让媒体库保持更新。

但规模会带来运维问题。用户需要在导入前获得明确估算:他们应知道预期的存储增长、转录时间、场景数量,以及选择更密集预设的后果。

恢复行为同样重要。模型下载失败、索引损坏或迁移中断,不应迫使用户完整重建。SCM 的嵌入快照和重试逻辑解决了部分问题,但真实使用会检验它们。

第三个信号是社区维护。采用 MIT 许可证的仓库可以吸引贡献者、审计与专业集成,但也可能让单一维护者难以持续应对 macOS 版本变化和上游依赖更新。

问题响应速度、可复现发布、文档化的安全报告和外部贡献,将揭示 SCM 是否正在成为持久基础设施。仅凭 Star 数量无法回答这个问题。

竞争会使这些测试更加严格。Apple 可以将搜索扩展至更多系统内容,专业视频工具则能优化转录与专业剪辑工作流。SCM 不能将自然语言搜索作为独特功能来依赖。

其可辩护的定位在于开源代码、本地处理、文件夹定义的集合和多种检索模式的结合。失去其中任何一个要素,都会使其与成熟产品的比较处于更不利的位置。

该项目也应避免夸大帧级覆盖能力。明确说明场景采样将增强信任。当应用精确解释更密集分析的成本时,创作者能够理解这些成本。

一个实际的成功案例看起来并不复杂:用户记得某个视觉时刻、一句说过的话,或旧截图中的文字;SCM 返回正确来源,并在相关位置附近打开它。

这种小型交互中的反复成功,比精致的聊天界面更有价值。检索能力一次一个结果地赢得信任。

开发者应关注 SCM 是否发布基准数据集或评估工具。媒体所有者应关注磁盘使用情况和导入估算。重视安全的用户应关注签名发布、依赖更新和安装实践。

这些信号将强化 SCM 的核心主张,或暴露其局限。大规模下的准确检索将证明原生文件夹本地搜索是一类可持续的 Mac 产品;不可预测的匹配或高昂的索引成本,则会让它停留在专业实验阶段。

Mac 用户下一步该怎么做

SCM 值得作为开源本地搜索系统进行测试,但用户应从可控媒体库和可衡量的问题开始。

先从一个具有代表性的文件夹开始,而不是完整归档。加入长视频、截图、口语对话、可见文字和视觉上相似的文件。在开始索引前,写下几个你预计 SCM 能找到的时刻。

分别测试 Files、Scenes、OCR 和 Dialogue。将返回的来源与时间戳同原始媒体进行比较。然后在不同采样密度或视觉模型下重复进行视觉搜索。

跟踪导入耗时、新增存储占用、误匹配和遗漏片段。这些观察比一场吸引人的演示更能说明问题,也能反映 SCM AI 媒体搜索是否适配你实际拥有的硬件和素材。

请将源文件和备份保存在应用程序托管副本之外。在导入敏感素材前,检查安装方式、权限与发布历史。将可选的聊天回答视为导航辅助工具,并根据引用证据进行核实。

SCM 的首次亮相之所以重要,在于它让先进的媒体检索变得可检查且可在本地运行。它的未来取决于,当新鲜感消退后,普通 Mac 用户是否仍能信任其搜索结果。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page