top of page

美团 LongCat 发布 LoHoSearch,搜索智能体遭遇新的难度壁垒

7月19日
讀畢需時 13 分鐘

已更新:7月20日

美团 LongCat 发布了 LoHoSearch,其测试结果对“领先的搜索智能体正趋近于完全掌握搜索能力”这一观点提出了挑战。美团 LongCat 的 LoHoSearch 基准包含 544 个问题,但表现最佳的受测模型正确率仅为 34.74%。

与 BrowseComp 相比,这一结果显得尤为严峻。BrowseComp 是过去一年中帮助界定高难度网络研究的基准。据报道,如今领先系统在 BrowseComp 上的得分已超过 90%,导致其区分这些系统的能力受到限制。

LoHoSearch 试图重新校准这一衡量尺度。其创建者没有让人类构思更难的问题,而是基于一个包含 762 万个实体的 Wikipedia 知识图谱生成复杂问题。

该基准之所以重要,是因为搜索智能体正日益广泛地支持研究、分析和知识工作。一个能够检索到某个看似可信页面的系统可能显得能力出众,而当系统必须追踪数十条充满不确定性的线索时,就会暴露出截然不同的弱点。

美团在发布论文和数据集后,通过其 LongCat 账号公布了这一项目。相关的 LoHoSearch 论文列出了六位美团研究人员,修订日期为 2026 年 6 月。

这一醒目的分数并非对所有模型或商业研究产品的独立裁决。它来自单一基准、单一工具配置和自动化评分。尽管如此,如此大幅的性能下滑仍值得关注。

美团 LongCat 的 LoHoSearch 基准改变了测试方式

LoHoSearch 通过控制搜索空间来提高基准难度,而非仅仅增加更多推理步骤。

该基准包含 544 个经过人工审核的英文问题,覆盖 11 个领域。这些领域包括音乐、体育、影视、地理及其他通识类别。

其评测集包含 282 个树状结构问题和 262 个图状结构问题。树状问题沿着层级化线索展开,而图状问题则加入交叉连接和循环,使其难以被清晰拆解。

这一区别非常重要,因为许多看似困难的问题实际上仍有一条狭窄的答题路径。智能体只需找到一个可识别的实体,沿着少量链接追踪,再验证结果即可。

LoHoSearch 试图消除这种捷径。它的问题将低知名度实体隐藏在多层间接关系之后,同时让众多候选实体都能满足每条单独的线索。

该基准以完整的英文 Wikipedia 数据转储为起点。每个 Wikipedia 页面都会成为一个实体,而页面之间的链接则成为有向关系。

Wikidata 分类用于提供实体类型。由此生成的知识图谱包含约 762 万个实体和 2.65 亿条有向边。

研究人员利用这一全局图谱寻找拥有庞大候选池的关系。人类撰写者通常不知道整个 Wikipedia 中有多少实体共享某种关系,但图谱可以计算出这一规模。

对于树状结构问题,该流程会选择一个与多个中间实体相连的隐藏答案。每个中间实体又会连接到其他叶实体或属性。

每一条主要关系都必须不可或缺。移除任意一条关系后都应留下多个可能答案,而将所有关系结合起来后,则应能在图谱中确定唯一答案。

图状结构问题更难拆分为较小的任务。它们最多可在十个实体之间包含循环和交叉约束。

这些图状结构平均包含 10 个节点和 12.5 条边。树状结构则平均包含 7.9 个节点和 6.9 条边。

随后,语言模型会将采样得到的结构转换为自然语言问题。实体名称会被隐藏,关系描述也会被有意模糊化。

该流程会测试单独的描述是否能通过搜索被直接找到,同时还会检查这些描述组合在一起时是否会过度暴露答案。

根据论文,DeepSeek-V3.2 负责语言模型相关阶段,包括关系提取、问题生成和自动化验证。

问题随后会经过覆盖度检查和答案满足度检查。多个搜索智能体会寻找其他可能成立的答案,同时由专业标注人员审核最终保留下来的条目。

公开可用的 LoHoSearch 数据集包含由 544 个条目组成的基准,以及 2,000 个自动生成的训练问题。只有基准问题经过了所述的人工验证。

这种自动化构建方法才是真正值得关注的突破。仅仅依靠冷门知识、含糊措辞或有缺陷的评估,也能制造出低分。

而 LoHoSearch 提出了一种可重复使用的难度生成器。通过调整参数,可以增加候选实体数量、关系复杂度以及线索之间的依赖程度。

因此,这一基准不仅仅是又一个排行榜。它提供了一种方法:当现有测试无法再区分领先系统时,可以持续生成新的测试。

在 BrowseComp 上取得成功已不足以回答搜索智能体的能力问题

核心矛盾在于:系统在熟悉基准上的表现,与其在更漫长、更缺乏结构的搜索过程中的可靠性并不一致。

OpenAI 推出的 BrowseComp 由一组高难度问题组成,这些问题的答案可以被简洁地核验。其由专家撰写的提示旨在抵抗常规搜索,并要求系统持续浏览。

最初的 BrowseComp 研究报告了 1,266 个问题。在该研究的条件下,OpenAI Deep Research 得分为 51.5%,而人类参与者得分为 33.3%。

这一结果使 BrowseComp 具备实用价值,因为它留下了巨大的提升空间。它会奖励那些能够改写查询、检查页面、关联线索,并在搜索失败后继续推进的智能体。

据美团研究人员称,在大约十个月内,BrowseComp 上的得分从约 30% 上升至 90% 以上。这种迅速提升导致了基准饱和问题。

饱和并不意味着所有网络研究任务都已得到解决。它意味着,当多个先进系统的得分聚集在基准上限附近时,该基准能够提供的信息变少了。

LoHoSearch 对那些宣称具备广泛深度研究能力的模型开发者施加了压力。它追问的是:当前进展究竟反映了通用搜索能力,还是对可识别基准模式的适应?

DeepSeek-V4-Flash 的对比结果清楚地展示了这一差距。在美团的实验中,该模型在 BrowseComp 上得分为 58.84%,但在 LoHoSearch 上仅得 10.02%。

正确完成 LoHoSearch 的搜索轨迹也需要更多工具操作。平均工具调用次数从 BrowseComp 的 35 次增加至 LoHoSearch 的 61 次,相对增幅达 74%。

中位数的变化更为剧烈,从 26 次工具调用上升至 59 次。因此,少数异常冗长的运行并不足以解释全部差异。

长时间搜索会带来层层累积的问题。智能体必须记住哪些候选项已被排除、保留证据、追踪尚未满足的条件,并避免重返已穷尽的路径。

每个搜索结果还可能引入新的实体。智能体必须判断一条新线索究竟是在缩小答案范围,还是仅仅扩大了调查范围。

这一过程比检索某个已知事实更接近真实研究。分析师经常从不完整的描述、相互冲突的术语,以及分散在无关来源中的证据开始工作。

不过,LoHoSearch 仍然是一种基于 Wikipedia 关系生成的合成基准。它无法复现商业研究、法律审查、科学分析或时事核查中的所有困难。

其价值在于能够隔离并测试一种特定能力:智能体能否在不丢失原始约束的情况下,驾驭范围广泛且相互依赖的搜索过程。

正因如此,该基准对智能体架构的压力不亚于对基础模型的压力。如果外围系统会遗忘证据或过早停止搜索,那么再强的模型也无济于事。

开发者可能需要显式的候选项追踪、条件级验证和持久化研究记忆。他们或许还需要更好的方法,将图状问题分配给并行工作的多个执行单元。

对于知识工作者而言,其中的启示非常实际。一个表达精致、附带数条引用的答案,并不能证明智能体已经穷尽了所有合理的替代可能。

评估研究系统的用户应检查其搜索过程。他们应确认系统是否保留了失败路径、核验了每个条件,并将可信度与语言流畅度区分开来。

可搜索的知识库可以保存源材料,但仅靠检索无法解决协调问题。智能体仍必须正确地关联并验证证据。

因此,美团 LongCat 的 LoHoSearch 基准重新定义了这场竞赛。关键指标不再是智能体能否浏览网页,而是它能否在数十个充满不确定性的步骤中持续进行严谨有序的浏览。

真正的问题出现在上下文管理中

LoHoSearch 表明,更长的上下文窗口并不会自动带来连贯一致的长周期研究能力。

每个受评估模型都获得了相同的两种基础工具。搜索工具用于提交关键词查询,浏览工具则用于获取所选 URL 的内容。

研究人员还使用了 BrowseComp 的系统提示。模型的上下文分配为 200,000 个 token,其中包括 184,000 个输入 token 和 16,000 个输出 token。

这足以容纳相当庞大的研究轨迹。然而,可用上下文与可用记忆并不是一回事。

智能体可能会用重复结果、已放弃的假设和无关页面文本填满窗口。更多 token 反而会制造更大的信息组织难题。

论文在 ReAct 框架内使用 DeepSeek-V4-Flash 测试了多种上下文管理策略。ReAct 在推理步骤和工具操作之间交替进行,使模型能够搜索并更新计划。

第一种策略是在 token 使用量超过上下文窗口的 80% 后总结搜索轨迹,然后利用这份压缩后的记录重新开始搜索。

第二种策略会丢弃此前的工具调用,并从原始问题重新开始。这两种方法还可以在提交答案前使用验证模块。

LoHoSearch 的基线得分为 10.02%。摘要策略将得分提高至 11.31%,而丢弃历史记录则将得分提高至 12.41%。

加入验证模块带来的帮助更大。摘要与验证相结合时得分达到 15.35%,而全部丢弃与验证相结合时达到 16.82%。

这一最佳结果比基线高出 6.8 个百分点。在论文的对比中,同系列干预措施在 BrowseComp 上带来了 14.03 个百分点的提升。

这种差异揭示了一项根本局限。压缩搜索轨迹可能会删除后续排除候选项所需的证据。

丢弃轨迹则会产生相反的问题。智能体虽然获得了干净的上下文,却可能重复搜索并再次发现同样的死路。

验证模块能够发现一些过早得出的结论,但它不一定能告诉智能体,不完整的调查究竟错在何处。

这有助于解释为什么上下文管理正成为智能体设计中的核心问题。长周期搜索需要结构化状态,而不只是更长的对话记录。

一种实用的状态表示可以分别记录候选实体、支持证据、已排除的关系、待解决条件和来源质量。纯粹的对话历史则会将它们混杂在一起。

图结构问题使这一弱点更加明显。DeepSeek-V4-Flash 在这些问题上的得分为 8.01%,相比之下,在树结构问题上的得分为 11.89%。

树可以被划分为多个分支。智能体可以分别解决每个分支,再将结果合并起来。

图则包含跨分支的依赖关系。针对某个实体找到的证据,可能会改变对其他若干线索的解读方式。

这要求重新审视先前的结论,同时不能将其抹去。还需要明确哪些主张依赖哪些来源。

这些都是严肃知识工作中常见的问题。研究人员可能收集到了正确的文档,却未能维护其中内容之间的关系。

个人信息系统也面临类似的挑战。捕获资料只是第一步,而知识融合则能连接来自不同来源的证据,同时不抹平各自的语境。

对于智能体开发者而言,LoHoSearch 指出了几个架构层面的优先事项。搜索历史应当成为一个可查询的工作区,而不是一个不断增长的提示词。

验证应当在条件层面进行。在选择答案之前,智能体应展示哪些要求尚未满足。

并行搜索同样需要协调。多条搜索轨迹可以覆盖更广的范围,但前提是系统能够比较它们的证据,并检测相互冲突的结论。

论文中的重复采样实验支持了这一观点。DeepSeek-V4-Flash 的 16 个独立回答使理论通过率从 9.3% 上升至 38.3%。

然而,选出一个可用答案仍然很困难。表现最佳的基于置信度的选择方法达到了 24.6%,低于可达到的通过率上限。

因此,仅仅在一批回答中的某处生成正确答案是不够的。系统必须能够从看似合理的备选答案中可靠地识别出正确答案。

34.74% 的结果不能证明什么

LoHoSearch 揭示了巨大的能力差距,但其排行榜不应被视为对 AI 系统的通用排名。

研究人员评估了来自多个主要系列的 11 个模型。GPT-5.5 以 34.74% 位居榜首,DeepSeek-V4-Pro 以 15.99% 紧随其后。

Claude Opus 4.6 得分为 15.62%,Kimi-K2.6 达到 15.53%。Gemini 3.1 Pro 得分为 13.32%,GLM-5.1 得分为 12.77%。

Claude Opus 4.7 达到 10.29%,DeepSeek-V4-Flash 得分为 10.02%。LongCat-Flash-Thinking-2601 的得分为 9.74%。

MiniMax-M2.7 和 MiniMax-M2.5 的得分分别为 2.48% 和 2.29%。这些数据来自基准测试作者的实验,本文并未对其进行独立复现。

第一名与第二名之间异常悬殊的差距值得进一步研究。它可能反映了模型能力,但工具行为和提供商的具体实现也可能影响结果。

Meituan 指出,DeepSeek-V4-Pro 和 Kimi-K2.6 遇到了服务不稳定或安全拒答的问题。这些问题可能拉低了它们的得分。

各模型还使用了默认的思考设置。统一提示词和上下文限制提高了可比性,但并不能保证每个系统都处于最佳配置。

该基准测试采用自动化评判。每个回答都会接受两次评估:一次使用 GPT-4.1 和 BrowseComp 提示词,另一次使用 Qwen2.5-32B 和 SimpleQA 提示词。

最终得分是这两次评判结果的平均值。这降低了对单一评判模型的依赖,但并未消除评分噪声。

有些回答在语义上可能是正确的,只是措辞与参考答案不同。另一些回答可能给出了一个看似合理的实体,却没有满足所有隐藏条件。

论文还报告了较高的置信度校准误差。然而,一些模型未能遵循要求的置信度格式,从而引入了额外噪声。

问题有效性构成了另一项局限。人工标注员明确确认基准测试中 70.8% 的问题具有唯一答案。

对于剩余的 29.2%,标注员在搜索后未发现其他答案,但也无法断然排除其存在。知识图谱只能保证答案在其自身表示范围内是唯一的。

Wikipedia 可能遗漏链接、包含过时陈述,或以不一致的方式描述关系。即使没有审查者发现,有效的备选答案也可能存在于图谱之外。

构建流程还使用 DeepSeek-V3.2 对难度进行筛选。该模型在多次尝试中均能正确回答的问题会被移除。

这一选择可能产生模型系列偏差。剩余问题可能会突出 DeepSeek-V3.2 或与其密切相关的搜索行为所特有的失败模式。

静态基准测试也会面临污染和时间漂移问题。一旦问题广泛流传,模型开发者就可能在评估、训练或提示词优化过程中接触到它们。

数据集包含一个金丝雀警告,旨在防止训练过程中意外使用该数据。此类标记有助于检测数据暴露,但无法阻止所有形式的污染。

此外,还有一个关于生态有效性的更广泛问题。LoHoSearch 奖励的是找出一个满足复杂线索组合的实体。

专业研究通常看重不同形式的输出。用户可能需要的是附带限定条件的综合分析、多个站得住脚的选项,或对不确定性的解释。

在 LoHoSearch 上表现不佳的智能体仍可能很好地完成文档摘要。反过来,基准测试的领先者仍可能在实时网站、私有数据或时效性较强的主张上失败。

因此,该基准测试应作为其他评估的补充。它不应取代对来源质量、事实一致性、任务完成度、延迟和对人类实际效用的测试。

它最突出的贡献在于诊断价值。它对候选项排除、结构化推理和长会话记忆施加了可控压力。

34.74% 的结果最适合被解读为这些能力仍不均衡的证据。它并不能证明某个模型在所有研究场景中都占据主导地位。

三个信号将表明 LoHoSearch 是否重要

如果独立复现、更强的智能体记忆和更新后的基准测试版本能够保持 LoHoSearch 的诊断价值,它就会产生重要影响。

第一个信号是独立复现。研究团队和模型提供商需要使用有明确记录的工具、提示词、访问日期和推理设置重新运行该基准测试。

如果多次复现都能得到稳定的排名,就会增强 Meituan 核心主张的可信度。若结果发生巨大变化,则表明该基准测试衡量的不仅是底层模型能力,还包括运行框架的配置。

复现研究还应检验自动化评判模型。对具有统计意义的结果样本进行人工审查,可以揭示评分错误是否对排行榜产生了实质性影响。

第二个信号是上下文管理方面的架构进步。论文中效果最佳的干预措施仅将 DeepSeek-V4-Flash 的得分提高了 6.8 个百分点。

一个能够维护明确候选项和条件级证据的系统,应当优于对交互记录进行摘要的方法。这一结果将支持该基准测试的诊断,而不仅仅是提高某一个分数。

研究人员应报告工具调用次数、重复搜索、放弃的路径和验证失败情况。仅凭准确率无法说明为什么某种架构能够更好地处理长时间搜索。

第三个信号是基准测试的更新。Meituan 表示,生成流程可以调整搜索空间大小和结构复杂度,这应当有助于推出更新版本。

重新生成的数据集将检验性能改进能否迁移到未见过的结构上。它还将降低公开问题被受评估系统熟悉的风险。

多语言版本将提供另一项重要测试。目前发布的版本仅涵盖英语,尽管其创建者称构建过程与语言无关。

仅仅翻译基准测试并不足够。新版本应根据特定语言的来源重新构建关系,并考虑不同的搜索环境。

这份采用 MIT 许可证发布的开放版本让研究人员有空间检查数据并构建替代评估框架。这种开放性也会加速数据暴露,使更新变得更加紧迫。

开发者应关注性能提升究竟来自更强的模型、更多采样,还是更好的协调。这些途径对成本、延迟和可靠性有着不同的影响。

重复采样已经表明仍有潜在的提升空间。然而,通过率与答案选择之间的差距证明,投入更多计算资源并不能保证获得可靠的最终结果。

企业买家应要求供应商针对与自身工作流程相似的任务进行评估。通用的基准测试分数无法取代使用内部文档、术语和验证要求所进行的测试。

知识工作者应将智能体的输出视为一条研究轨迹,而不只是一份回答。最有用的系统会将尚未解决的条件和已排除的备选项清晰呈现出来。

Meituan LongCat 并未证明 LoHoSearch 是最终的搜索智能体基准测试。它证明了为什么在昨天的基准测试中取得高分,无法解答今天的可靠性问题。

未来几个月将揭示其他团队能否复现 34.74% 的上限、结构化记忆能否突破这一上限,以及重新生成的问题是否仍然困难。

这些结果将决定 LoHoSearch 是会成为一项持久的标准,还是一次短暂的压力测试。在此之前,它发出的警告十分明确:流畅地浏览并不等同于受控的研究。

评估搜索智能体时,应要求它在漫长的调查过程中保留证据。检查每项条件是否都有支持,以及被排除的候选项是否始终保持排除状态。

然后要求系统解释哪些方面仍存在不确定性。这种行为比一条自信的最终结论更重要,尤其是在决策依赖冷门或分散证据的情况下。

Meituan LongCat LoHoSearch 基准测试为开发者提供了一个高难度环境,用于检验这些能力。它能否产生持久价值,将取决于更广泛的研究社区是否能够验证、扩展并一次又一次地攻克它。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page