Meituan LongCatがLoHoSearchを公開、検索エージェントは新たな難易度の壁に直面
更新日:7月20日
Meituan LongCatがLoHoSearchを公開し、その結果は、主要な検索エージェントが熟達の域に近づいているという見方に疑問を投げかけています。Meituan LongCatのLoHoSearchベンチマークには544問が含まれていますが、テスト対象の最高モデルでも正答率はわずか34.74%でした。
この結果は、前年に難易度の高いウェブ調査の基準形成に貢献したベンチマーク、BrowseCompと比較すると、とりわけ鮮明です。現在、主要なシステムはBrowseCompで90%を超えると報告されており、システム間の差を識別する能力が低下しています。
LoHoSearchは、その評価尺度を再設定しようとしています。作成者は、人間にさらに難しい質問を考案させるのではなく、762万のエンティティを含むWikipediaの知識グラフから複雑な問題を生成しました。
検索エージェントが調査、分析、知識労働を支える機会が増えているため、このベンチマークは重要です。もっともらしいページを1つ取得するシステムは、有能に見えるかもしれません。しかし、何十もの不確かな手掛かりを追わなければならないシステムでは、まったく異なる弱点が露呈します。
Meituanは、論文とデータセットの公開後、LongCatアカウントを通じてこのプロジェクトを発表しました。基礎となるLoHoSearchの論文にはMeituanの研究者6名が名を連ね、2026年6月の改訂日が記載されています。
この注目すべきスコアは、あらゆるモデルや商用調査製品に対する独立した評価ではありません。これは、1つのベンチマーク、1つのツール構成、自動採点によって得られたものです。それでも、この大幅な性能低下は注目に値します。
Meituan LongCatのLoHoSearchベンチマークがテストを変える
LoHoSearchは、単に推論ステップを増やすのではなく、検索空間を制御することでベンチマークの難易度を変えています。
このベンチマークには、11の分野にわたる、人間によるレビュー済みの英語の質問544問が含まれています。これらの分野には、音楽、スポーツ、映画・テレビ、地理、およびその他の一般知識カテゴリが含まれます。
評価セットは、木構造の質問282問とグラフ構造の質問262問で構成されています。木構造の質問は、手掛かりの階層をたどります。グラフ構造の質問には、きれいな分解を阻む相互接続や循環が加わります。
この違いが重要なのは、難しそうに見える質問の多くにも、依然として答えへ至る狭い経路が存在するからです。エージェントは認識可能なエンティティを1つ見つけ、いくつかのリンクをたどり、結果を検証します。
LoHoSearchは、この近道を排除しようとしています。その質問では、知名度の低いエンティティが複数の間接的な関係の背後に隠されており、同時に多数の候補が個々の手掛かりを満たします。
このベンチマークは、英語版Wikipediaの完全なダンプから始まります。各Wikipediaページがエンティティとなり、ページ間のリンクが有向関係となります。
Wikidataの分類によってエンティティタイプが付与されます。その結果得られる知識グラフには、約762万のエンティティと2億6,500万の有向エッジが含まれています。
研究者らは、このグローバルグラフを使用して、候補集合の大きい関係を見つけます。人間の執筆者は、Wikipedia全体でどれほど多くのエンティティがある関係を共有しているかを把握していることはまれですが、グラフならその規模を計算できます。
木構造の質問では、パイプラインが複数の中間エンティティにつながる隠れた答えを選択します。各中間エンティティは、追加の葉エンティティまたはプロパティにつながります。
主要な関係はすべて必要不可欠でなければなりません。1つを削除すると複数の答えが残り、すべての関係を組み合わせるとグラフ内で唯一の答えが特定される必要があります。
グラフ構造の質問は、より小さなタスクへ分割することが困難です。最大10個のエンティティ間に循環や交差制約を含む場合があります。
これらの構造は平均10個のノードと12.5本のエッジを持っていました。木構造は平均7.9個のノードと6.9本のエッジでした。
その後、言語モデルがサンプリングされた構造を自然言語の質問に変換します。エンティティ名は隠されたままで、関係の説明も意図的に曖昧にされます。
パイプラインは、個々の説明が検索によって直接見つけられるかどうかをテストします。また、説明を組み合わせた際に、答えが明らかになりすぎないかも確認します。
論文によると、言語モデルを用いる工程はDeepSeek-V3.2が担当しました。これらの工程には、関係抽出、質問生成、自動検証が含まれていました。
その後、質問はカバレッジと回答適合性のチェックを通過しました。複数の検索エージェントが別の有効な答えを探し、専門のアノテーターが残った項目をレビューしました。
一般公開されているLoHoSearchデータセットには、544項目のベンチマークと、自動生成された2,000問の訓練用質問が含まれています。明記された人間による検証を受けたのは、ベンチマークの質問のみです。
この自動構築手法こそが、真に注目すべき点です。低いスコアだけなら、極端に難解な雑学、曖昧な表現、あるいは不完全な評価によっても生み出せます。
それに対してLoHoSearchは、再現可能な難易度生成手法を提案しています。そのパラメータによって、候補数、関係の複雑さ、手掛かり間の依存度を高めることができます。
そのため、このベンチマークは単なる新たなリーダーボード以上のものです。既存のテストで主要システム間の差を見分けられなくなったときに、新しいテストを生成する手法を提示しています。
BrowseCompでの成功だけでは、もはや検索エージェントの実力を判断できない
主な対立点は、よく知られたベンチマークでの性能と、はるかに長く、構造化されていない検索における信頼性の間にあります。
OpenAIは、答えを簡潔に検証できる難問セットとしてBrowseCompを導入しました。専門家が作成したプロンプトは、通常の検索では解けず、粘り強いブラウジングを必要とするよう設計されていました。
当初のBrowseCompの研究では、1,266問が報告されました。研究条件下で、OpenAI Deep Researchは51.5%、人間の参加者は33.3%を記録しました。
この結果によってBrowseCompが有用だったのは、性能向上の余地が大きく残されていたからです。クエリを言い換え、ページを調査し、手掛かりを結び付け、検索に失敗しても続行できるエージェントが高く評価されました。
Meituanの研究者らによると、BrowseCompでの性能は約10か月の間に、およそ30%から90%超へ上昇しました。この急速な向上によって、ベンチマークの飽和という問題が生じました。
飽和は、すべてのウェブ調査タスクが解決されたことを意味しません。複数の高度なシステムが上限付近に集中すると、そのベンチマークから得られる情報が少なくなることを意味します。
LoHoSearchは、ディープリサーチについて広範な主張を行うモデル開発者に圧力をかけます。それは、進歩が一般的な検索能力を反映しているのか、それとも認識可能なベンチマークのパターンへの適応なのかを問いかけています。
DeepSeek-V4-Flashを用いた比較は、その差を明確に示しています。Meituanの実験で、このモデルはBrowseCompでは58.84%を記録しましたが、LoHoSearchではわずか10.02%でした。
LoHoSearchで正解に至った探索過程では、より多くのツール操作も必要でした。ツール呼び出しの平均回数は、BrowseCompの35回からLoHoSearchの61回へ増加し、相対的に74%増となりました。
中央値はさらに急激に変化し、ツール呼び出し回数が26回から59回へ増加しました。したがって、少数の異常に長い実行だけでは、この差全体を説明できません。
長時間の検索では、問題が累積します。エージェントは、どの候補が不適格だったかを記憶し、証拠を保持し、未充足の条件を追跡し、調査済みの経路に戻らないようにしなければなりません。
また、各検索結果から新しいエンティティが現れる可能性もあります。エージェントは、新たな手掛かりが答えを絞り込むのか、それとも単に調査範囲を広げるだけなのかを判断する必要があります。
このプロセスは、既知の事実を1つ取得するよりも、現実の調査に近いものです。アナリストは多くの場合、不完全な説明、食い違う用語、無関係な複数の情報源に分散した証拠から調査を始めます。
ただし、LoHoSearchは依然としてWikipediaの関係から派生した合成的な構成物です。ビジネス調査、法務レビュー、科学分析、時事情報の検証で見られるすべての難しさを再現しているわけではありません。
その価値は、特定の能力を切り分けて評価する点にあります。エージェントが元の制約を見失うことなく、広範で相互依存的な検索を制御できるかどうかをテストします。
そのため、このベンチマークは基盤モデルだけでなく、エージェントのアーキテクチャにも圧力をかけます。周囲のシステムが証拠を忘れたり、検索を早く打ち切ったりすれば、より強力なモデルでも役には立ちません。
開発者には、明示的な候補追跡、条件単位の検証、永続的な調査メモリが必要になる可能性があります。また、グラフ状の質問を並列ワーカー間で分割する、より優れた方法も必要になるでしょう。
知識労働者にとって、その教訓は実践的です。洗練された回答と複数の引用があっても、エージェントがもっともらしい代替候補をすべて検討したことの証明にはなりません。
調査システムを評価するユーザーは、検索プロセスを確認すべきです。システムが不適格だった経路を保持したか、すべての条件を確認したか、確信度と流暢さを区別したかを問う必要があります。
検索可能なナレッジベースは情報源となる資料を保持できますが、検索だけでは調整の問題は解決しません。エージェントは依然として、証拠を正しく結び付け、検証しなければなりません。
したがって、Meituan LongCatのLoHoSearchベンチマークは競争の構図を捉え直します。重要な指標は、エージェントがブラウジングできるかどうかではなく、何十もの不確かなステップにわたって規律あるブラウジングを継続できるかどうかです。
本当の失敗はコンテキスト管理に現れる
LoHoSearchは、コンテキストウィンドウを長くしても、長期的な調査が自動的に一貫したものになるわけではないことを示唆しています。
評価されたすべてのモデルには、同じ2つの基本ツールが与えられました。検索ツールはキーワードクエリを送信し、ブラウズツールは選択したURLからコンテンツを取得しました。
研究者らはBrowseCompのシステムプロンプトも使用しました。モデルには、入力トークン184,000と出力トークン16,000を含む、200,000トークンのコンテキストが割り当てられました。
これは、相当量の調査履歴を収めるのに十分な容量です。しかし、利用可能なコンテキストと、実際に活用できるメモリは同じではありません。
エージェントは、重複した結果、放棄した仮説、無関係なページのテキストでウィンドウを埋め尽くす可能性があります。その場合、トークンが増えることで、整理すべき問題がさらに大きくなります。
論文では、ReActフレームワーク内でDeepSeek-V4-Flashを使用し、複数のコンテキスト管理戦略をテストしました。ReActは推論ステップとツール操作を交互に実行し、モデルが検索しながら計画を更新できるようにします。
最初の戦略では、トークン使用量がコンテキストウィンドウの80%を超えた後に探索過程を要約しました。その後、圧縮された記録を使用して検索を再開しました。
2つ目の戦略では、以前のツール呼び出しを破棄し、元の質問から再開しました。どちらのアプローチでも、回答を提出する前に検証モジュールを使用できました。
LoHoSearchのベースラインスコアは10.02%でした。要約によって11.31%まで上昇し、履歴の破棄によって12.41%まで上昇しました。
検証を追加すると、さらに大きな改善が見られました。検証付きの要約は15.35%に達し、検証付きの全履歴破棄は16.82%に達しました。
この最高結果は、ベースラインから6.8パーセントポイントの向上を示しています。同じ系統の介入は、論文の比較においてBrowseCompでは14.03ポイントの向上をもたらしました。
この差は、根本的な限界を明らかにしています。探索過程を圧縮すると、後で候補を除外するために必要な証拠まで削除される可能性があります。
履歴を破棄すると、逆の問題が生じます。エージェントはクリーンなコンテキストを得ますが、検索を繰り返し、同じ行き止まりを再発見する可能性があります。
検証モジュールは、早すぎる結論の一部を検出します。しかし、不完全な調査のどこに問題があったのかを必ずしもエージェントに示すわけではありません。
これは、コンテキスト管理がエージェント設計の中心的な課題になりつつある理由を説明する一助となります。長期的な検索には、単に長い記録ではなく、構造化された状態が必要です。
有用な状態表現では、候補エンティティ、裏付けとなる証拠、除外された関係、未解決の条件、情報源の品質を個別に記録するとよいでしょう。通常の会話履歴では、それらが混在しています。
グラフ構造の質問では、この弱点がより明確に表れます。DeepSeek-V4-Flashはこれらの項目で8.01%を記録し、木構造の質問では11.89%でした。
木は複数の枝に分割できます。エージェントは各枝を個別に解き、その結果を統合できます。
グラフには、枝をまたぐ依存関係があります。あるエンティティについて見つかった証拠によって、ほかの複数の手がかりの解釈が変わることがあります。
そのため、以前の結論を消去せずに再検討する必要があります。また、どの主張がどの情報源に依存しているかを把握することも求められます。
これらは、本格的な知識労働ではよく知られた問題です。研究者は適切な文書を収集できても、その内容間の関係を維持できないことがあります。
個人情報システムも、これに関連する課題に直面しています。資料の取り込みは最初の一歩にすぎず、知識のブレンディングは、個々の文脈を損なうことなく、別々の情報源から得た証拠を結び付けます。
エージェント開発者にとって、LoHoSearchはいくつかのアーキテクチャ上の優先事項を示しています。検索履歴は、増え続けるプロンプトではなく、クエリ可能なワークスペースになるべきです。
検証は条件単位で行う必要があります。エージェントは回答を選択する前に、どの要件が未解決のままなのかを示すべきです。
並列検索にも協調が必要です。複数の探索経路によってより広い範囲を調べられますが、それが有効なのは、システムがそれぞれの証拠を比較し、両立しない結論を検出できる場合に限られます。
論文の反復サンプリング実験は、この見方を裏付けています。DeepSeek-V4-Flashによる16件の独立した回答から算出された理論上の合格率は、9.3%から38.3%に上昇しました。
しかし、利用可能な回答を選び出すことは依然として困難でした。信頼度に基づく最良の選択手法でも24.6%にとどまり、達成可能な合格率の上限を下回りました。
したがって、バッチ内のどこかで正しい回答を生成するだけでは不十分です。システムは、もっともらしい選択肢の中からその回答を確実に特定しなければなりません。
34.74%という結果が証明していないこと
LoHoSearchは大きな能力格差を明らかにしていますが、そのリーダーボードをAIシステムの普遍的なランキングとして扱うべきではありません。
研究者らは、複数の主要ファミリーに属する11のモデルを評価しました。GPT-5.5が34.74%で首位となり、DeepSeek-V4-Proが15.99%で続きました。
Claude Opus 4.6は15.62%、Kimi-K2.6は15.53%を記録しました。Gemini 3.1 Proは13.32%、GLM-5.1は12.77%でした。
Claude Opus 4.7は10.29%、DeepSeek-V4-Flashは10.02%でした。LongCat-Flash-Thinking-2601は9.74%を記録しました。
MiniMax-M2.7とMiniMax-M2.5は、それぞれ2.48%と2.29%でした。これらの数値はベンチマーク作成者による実験から得られたものであり、ここでは独立した追試を行っていません。
1位と2位の間にある異例の大差は、調査に値します。これはモデルの能力を反映している可能性がありますが、ツールの挙動やプロバイダー側の実装も結果に影響を与え得ます。
Meituanは、DeepSeek-V4-ProとKimi-K2.6でサービスの不安定性や安全上の拒否が発生したと述べています。これらの問題によって、スコアが押し下げられた可能性があります。
各モデルでは、思考設定もデフォルトのまま使用されました。統一されたプロンプトとコンテキスト上限は比較可能性を高めますが、すべてのシステムにとって最適な設定であることを保証するものではありません。
このベンチマークでは自動判定が使用されています。各回答は、GPT-4.1を用いたBrowseCompプロンプトと、Qwen2.5-32Bを用いたSimpleQAプロンプトによって、それぞれ1回ずつ評価されました。
最終スコアは、この2つの判定の平均です。これにより、単一の判定モデルへの依存は軽減されますが、採点上のノイズがなくなるわけではありません。
回答によっては、意味的には正しくても、参照回答とは異なる表現が使われている場合があります。また、もっともらしいエンティティを挙げていても、隠されたすべての条件を満たしていない場合もあります。
論文では、信頼度の較正誤差が大きいことも報告されています。しかし、一部のモデルは要求された信頼度の形式に従わず、さらなるノイズを生じさせました。
質問の妥当性にも別の制約があります。人間のアノテーターがベンチマークの70.8%について、一意の回答があることを明確に確認しました。
残りの29.2%について、アノテーターは検索しても代替回答を発見できませんでしたが、その存在を決定的に否定することもできませんでした。知識グラフが一意性を保証するのは、その表現の範囲内に限られます。
Wikipediaではリンクが欠落していたり、記述が古かったり、関係性が一貫しない形で説明されていたりすることがあります。レビュアーが発見できなくても、グラフの外部に有効な代替回答が存在する可能性があります。
構築パイプラインでは、DeepSeek-V3.2を使用して難易度のフィルタリングも行っています。このモデルが複数回の試行を通じて正しく回答した質問は除外されました。
この選択は、モデルファミリーに対するバイアスを生み出す可能性があります。残された質問では、DeepSeek-V3.2またはそれに近い検索挙動に固有の失敗パターンが強調されているかもしれません。
静的なベンチマークには、汚染と時間的ドリフトという問題もあります。質問が広く流通すると、モデル開発者が評価、学習、またはプロンプト最適化の過程でそれらに接する可能性があります。
このデータセットには、学習での偶発的な使用を抑止するためのカナリア警告が含まれています。このようなマーカーはデータへの接触を検出する助けになりますが、あらゆる形態の汚染を防げるわけではありません。
さらに、生態学的妥当性という、より広範な問題もあります。LoHoSearchは、複雑に組み合わされた手がかりを満たす1つのエンティティを見つけることを評価します。
専門的な調査では、異なる形式の成果物が重視されることも少なくありません。ユーザーが必要としているのは、留保を付した統合的な分析、根拠を示せる複数の選択肢、または不確実性の説明かもしれません。
LoHoSearchを苦手とするエージェントでも、有用な文書要約を行える場合があります。反対に、ベンチマークの首位モデルでも、実際に稼働しているウェブサイト、非公開データ、または時間依存性の高い主張では失敗する可能性があります。
したがって、このベンチマークはほかの評価を補完するものとして使用すべきです。情報源の品質、事実の一貫性、タスクの完遂度、レイテンシ、人間にとっての有用性を対象とするテストの代わりにはなりません。
その最大の貢献は診断にあります。候補の絞り込み、構造的推論、長時間セッションでの記憶に、制御された負荷をかけます。
34.74%という結果は、これらの能力が依然として不均一である証拠と捉えるのが最適です。1つのモデルがあらゆる調査環境で優位に立つことの証明ではありません。
LoHoSearchの重要性を示す3つの兆候
独立した追試、より強力なエージェントメモリ、更新されたベンチマーク版によって診断的価値が維持されるなら、LoHoSearchは重要なものとなるでしょう。
最初の兆候は、独立した再現です。研究グループとモデルプロバイダーは、使用したツール、プロンプト、アクセス日、推論設定を文書化したうえで、ベンチマークを再実行する必要があります。
追試を通じてランキングが安定していれば、Meituanの中心的な主張はより強固になります。結果が大きく変わるなら、このベンチマークが基礎となるモデル能力だけでなく、実行環境の設定も測定していることを示します。
追試では、自動判定モデルについても調べるべきです。統計的に意味のある結果サンプルを人間がレビューすれば、採点ミスがリーダーボードに重大な影響を与えているかどうかが明らかになります。
2つ目の兆候は、コンテキスト管理アーキテクチャの進歩です。論文で最も効果的だった介入でも、DeepSeek-V4-Flashの改善はわずか6.8パーセントポイントでした。
候補と条件単位の証拠を明示的に維持するシステムは、トランスクリプトの要約を上回るはずです。その結果が得られれば、単に1つのスコアを引き上げるだけでなく、このベンチマークの診断を裏付けることになります。
研究者は、ツール呼び出し、繰り返された検索、放棄された経路、検証の失敗を報告すべきです。精度だけでは、あるアーキテクチャがなぜ長時間の検索をより適切に処理できたのかを示せません。
3つ目の兆候は、ベンチマークの更新です。Meituanによれば、生成パイプラインでは検索空間の大きさと構造的複雑さを調整できるため、更新版の作成にも対応できるはずです。
再生成されたセットにより、改善が未知の構造にも転移するかどうかを検証できます。また、公開された質問が評価対象システムにとって既知になるリスクも軽減できます。
多言語版も、もう1つの重要なテストになります。作成者らは構築プロセスを言語非依存と説明していますが、現在のリリースは英語のみを対象としています。
ベンチマークを翻訳するだけでは不十分です。新しいバージョンでは、言語固有の情報源から関係性を再構築し、異なる検索環境を考慮する必要があります。
オープンなMITライセンスのリリースにより、研究者はデータを精査し、代替の評価環境を構築できます。一方で、この開放性はデータへの接触も加速させるため、更新の必要性がさらに高まります。
開発者は、性能向上がより優れたモデル、サンプリング回数の増加、協調機能の改善のどれによってもたらされたのかに注目すべきです。これらの経路は、コスト、レイテンシ、信頼性に対してそれぞれ異なる影響を及ぼします。
反復サンプリングはすでに、潜在的な改善余地があることを示しています。しかし、合格率と回答選択の間にある差は、計算量を増やしても信頼できる最終結果が保証されないことを証明しています。
企業の購入担当者は、自社のワークフローに類似したタスクでの評価をベンダーに求めるべきです。汎用ベンチマークのスコアは、社内文書、専門用語、検証要件に基づくテストの代わりにはなりません。
知識労働者は、エージェントの出力を単なる回答ではなく、調査の経過として扱うべきです。最も有用なシステムは、未解決の条件と除外された代替案を可視化します。
Meituan LongCatは、LoHoSearchが検索エージェントの最終的なベンチマークであることを示したわけではありません。昨日のベンチマークでの高得点だけでは、今日の信頼性に関する問題を決着させられない理由を示しました。
今後数か月で、ほかのチームが34.74%という上限を再現するか、構造化メモリがそれを突破するか、再生成された質問が引き続き難しいままかが明らかになるはずです。
その結果によって、LoHoSearchが持続的な標準になるのか、一時的なストレステストにとどまるのかが決まります。それまでは、その警告は明白です。流暢なブラウジングは、統制された調査と同じではありません。
検索エージェントを評価するときは、長期にわたる調査の過程で証拠を保持するよう求めてください。すべての条件に裏付けがあるか、除外された候補が除外されたまま維持されているかを確認してください。
次に、何が依然として不確かなのかを説明するようシステムに求めてください。特に、判断が不明瞭または分散した証拠に依存する場合、その挙動は自信に満ちた最後の一文よりも重要です。
Meituan LongCatのLoHoSearchベンチマークは、こうした習慣を開発者がテストできる、難度の高い場を提供します。その長期的な価値は、より広範な研究コミュニティがこれを検証し、拡張し、繰り返し攻略できるかどうかにかかっています。



