Merlin AIモデルベンチマーク:コストは9倍超、精度向上はなし
Merlin Search Technologiesは7つのAIモデルをテストし、顕著な逆転結果を確認した。最も高価なモデルはレポート当たりのコストが9倍を超えたにもかかわらず、引用精度は向上しなかった。
Merlin AIモデルベンチマークでは、すべてのシステムに同じオピオイド訴訟関連文書、2つの調査質問、1つのレポート作成課題を与えた。最も安価かつ高速なモデルが、ベンダーの忠実性指標で首位となった。最も高価なモデルは4位だった。
この結果は、一般的な購入判断の近道に疑問を投げかける。より新しい、またはより高価なフロンティアモデルが、あらゆる専門業務において自動的に最適とは限らない。ただしMerlinは、匿名ラベルがどの製品に対応するかを明らかにしておらず、6モデルは統計的に同率だった。
この調査が測定した品質は、狭い範囲にとどまる。記述が提供文書に遡れるかを確認したものであり、どのレポートが最も強力な法的推論を示したか、最重要の証拠を特定したか、あるいは最善の判断を行ったかは判定していない。
こうした留保は、結果の有用性を損なうどころか高めている。Merlinのテストは、あらゆる案件を高価格モデルへ振り分ける前に、企業がタスク別評価、信頼区間、監査可能な引用を必要とする理由を示している。
Merlin AIモデルベンチマークが実際にテストした内容
Merlinは、管理された1つの法務調査ワークフロー内で7モデルを比較し、その引用と情報源への忠実性を評価した。
同社は、調査・ディスカバリープラットフォームであるAlchemyを通じて、OpenAI、Anthropic、Googleのモデルをテストした。対象にはGPT-6 Astra、GPT-5.6 Sol、GPT-5.6 Terra、Claude Fable 5.1、Claude Opus 5、Claude Sonnet 5、Gemini 3.1 Proが含まれた。
各モデルには、公開されている同一のオピオイド訴訟関連文書群が与えられた。資料はMallinckrodtを扱い、McKesson、Insys、Valeantにも言及していた。
Merlinは顧客データの利用を避けた。この選択により機密保持上の懸念が軽減され、文書群を再利用しやすくなった。一方で、基礎となるレポートは公開され、独立して再現可能なベンチマークパッケージとして提示されたものではない。
モデルは2つの質問に回答した。1つは同社の疼痛管理製品にまたがる問題に関するものだった。もう1つは、社内メモとアナリストのコメントが財務難や信用問題について何を示しているかを問うものだった。
2つ目の質問には意図的な罠があった。一部の信用関連コメントは別企業に関するもので、Mallinckrodtの記録の一部は通常の請求紛争を説明していた。不注意なシステムはこれらを混同し、証拠に裏付けられない財務危機を示唆しかねない。
その後、各モデルは引用付きの完全な調査レポートを作成した。公開された方法論によると、7本のレポート全体で、システムは777件の引用と454件の引用付き文を生成した。
Merlinは評価前に、出力をモデルAからGとして匿名化した。そのため評価者には提供元の名称が渡されなかったが、同社はラベル付けを再構成できるよう、記録されたランダムシードを保持していた。
公開されたスコアカードでも、この匿名化は維持された。読者は結果を比較できるが、モデルDがOpenAI、Anthropic、Googleのいずれの製品だったかを独自に特定することはできない。
モデルDは、低いほど良い忠実性スコアで3.3を記録し首位となった。各レポートを平均37秒で完了し、表示された結果では壊れた引用や誤った参照先の引用はなかった。
モデルCの忠実性スコアは4.1で、平均所要時間は110秒だった。今回の実行で最も高価なシステムであり、モデルDのレポートコストの9倍超を消費した。
モデルEは忠実性スコア4.9で最下位となった。残る6モデルの信頼区間は重なっており、Merlinは見せかけの精密な順位を示すのではなく、統計的に同率として扱った。
この区別は重要である。この研究内では見出しどおりの逆転結果が成立しているが、モデルDが普遍的な精度優位性を持つことを示すものではない。この特定の実行では、はるかに高額な費用を払っても検出可能な忠実性向上は得られなかったことを示している。
最も安価なモデルが、限定的ながら重要なテストで勝利
このベンチマークは、価格を精度の代理指標とみなす考え方を覆すが、ある1つのモデルを普遍的な勝者として特定するものではない。
モデルDは、比較対象の中で最もきれいな引用記録、最短の平均完了時間、最低の運用コストを示した。モデルCは9倍超のコストがかかり、表示スコアカードでは4位だった。
最新の2リリースであるGPT-6 AstraとClaude Fable 5.1はいずれも首位ではなかった。Merlinがラベルの対応表を非公開にしているため、それぞれが正確に何位だったかを一般には確認できない。
この秘匿は購入判断における価値を制限する。法務チームはこの記事を読んで、特定のプロバイダーを確信を持って選ぶことはできない。しかし、最新の高価格オプションを初期設定であらゆるワークロードに割り当てるべきだという前提は退けられる。
結果は、単一の順位では捉えられない差異も明らかにした。モデルAは、幅広さスコア24.9を記録し、最も広範な異なる論点をカバーした。壊れた引用はなかったが、2件の引用は誤った裏付け箇所を指していた。
モデルGは、23.6のスコアでほぼ同等の幅広さを達成した。しかし、確認された93件の主張のうち9件は、読者を誤った段落へ誘導していた。Merlinによると、基礎となる事実は別の箇所に存在していたが、これらの参照をたどる弁護士は自ら探す必要があった。
モデルDはより正確だったが、対象範囲は狭かった。幅広さスコアは15.9にとどまり、モデルAとGを大きく下回った。決定的なテーマを見落とす慎重なレポートは、修正可能な引用ミスが少数ある、より広範なレポートより有用性が低い場合もある。
これがこの調査における中心的な逆転である。最も安価なモデルが忠実性ランキングで首位に立ったが、その勝利によって網羅性、統合、法的判断の価値が失われたわけではない。
調査では、7本のレポートのいずれにも捏造された事実は見つからなかった。Merlinの評価システムの下では、具体的な氏名、数値、日付、引用文はすべて文書コレクションに遡ることができた。
この結果は心強いものだが、タスクの範囲に限定して解釈すべきである。モデルは管理された証拠セットをもとに、Alchemy内で引用付きレポートを作成した。オープンウェブ上の法的調査や、制限のないデータベースからの判例・法源の取得は求められていなかった。
キュレーションされたコレクション内で根拠にとどまるモデルは、記憶に基づいて質問に答えるチャットボットとは異なる問題に直面する。検索制御、引用構造、周辺アプリケーションは、失敗率を大きく変え得る。
先行する学術研究は、その文脈を示している。商用の法務リサーチ製品を評価したStanfordの研究者は、誤っている、または適切な根拠に基づかない回答をハルシネーションと定義した。彼らの法務AI研究では、検索機能だけでは裏付けのない回答をなくせないことが示された。
したがってMerlinの結果は、ベースモデルだけでなくシステム全体に関するものである。Alchemyは文書要約、引用マーカー、プロンプト、レポート構造、検証プロセスを提供した。首位の出力は、この複合的な環境から生まれた。
正しい結論は、安価なモデルが常により正確だということではない。モデル価格だけでは、定義された企業ワークフローでの性能をほとんど示せないということである。
8段階の評価で全引用を検証した方法
Merlinの最も強い貢献は、算術処理がモデルの判断に置き換えられる場面では決定論的な検査を用いる評価パイプラインにある。
プロセスは、モデルの識別情報を隠し、レポートから偶発的な言及を削除することから始まった。以降の段階では、固定された匿名ラベルだけが参照された。
第2段階では、Alchemy自身のソース要約を監査した。各要約には原文書内の段落と接続するマーカーが含まれていたが、一部のマーカーには不具合があった。
監査では、欠陥のある要約セクションが24件見つかった。Merlinは、プラットフォームが不適切なマーカーを提供したことだけが原因で失敗した引用を免責した。これにより、上流のデータエラーについてモデルを不当に減点することを防いだ。
この段階は見落とされやすい。評価では、検索、解析、文書準備が問題を引き起こした場合であっても、目に見える失敗のすべてを言語モデルに帰属させることが多い。
第3段階では、引用を機械的に解決した。コードは、引用された各文書とセクションが存在するか、また引用段落が特定された範囲内にあるかを検査した。
セクションや段落を伴わない単純な文書参照は、失敗した引用ではなく本文として扱われた。このルールにより、過度に積極的な解析によってチェッカーがエラー件数を水増しすることを防いだ。
第4段階では、引用付き文が提供された要約に根拠づけられているかを評価した。ここがAI判定者を使用した最初の段階だった。
Merlinによると、初期バージョンでは、列挙された引用内にないすべての事実を捏造として扱っていた。この手法は、モデルが複数の情報源に基づく文の根拠の一部だけを引用した場合に、統合的な記述を不当に罰していた。
改訂後のシステムは2段階を採用した。まず評価者が、引用された資料内に見つけられない情報を特定した。その後、第2段階で判定を下す前に、より広いコレクションを検索した。
判定結果は、裏付けあり、未引用の情報源、過剰な推論、捏造のいずれかだった。未引用の情報源は、その事実がコレクション内の別の場所には存在することを意味する。過剰な推論は、検証可能な事実を捏造せずに結論が証拠を超えていることを意味する。
捏造には、コレクションのどこにも見つからない具体的な氏名、数値、日付、引用文が含まれた。Merlinは、捏造された詳細が提出書面や顧客向けメモに入り込む可能性があるため、このカテゴリーを3倍重く評価した。
第5段階では、幅広さと反復を測定した。システムは文を意味の数学的表現であるセマンティックベクトルに変換し、各レポートに含まれる独立したアイデアの数を推定した。
この設計は、単に長いだけのレポートに報いることを避けようとした。追加の文が同じ論点を繰り返すだけなら、より長いレポートに自動的な利点はなかった。
第6段階では、スコアと不確実性の範囲を計算した。コストと速度はスコアカードに表示されたが、精度ランキングには影響しなかった。
Merlinは、2つの質問をまたいだリサンプリングを用いて信頼区間を推定した。区間が重なる場合、モデルは同率とされた。そのため、順序付けて表示されているにもかかわらず、7システム中6つが最上位の統計グループに属した。
第7段階では、評価者そのものを評価した。異なるプロバイダーによる追加のAI判定者2つが、フラグ付けされたすべての主張と、合格した主張のサンプルを再確認した。
意見の不一致は多数決で解決した。33件の初期フラグのうち3件が覆され、報告された誤警報率は9%となった。評価者はまた、合格した37件の主張を抜き取り検査し、フラグ付けしたものはなかった。
3つの評価者は、レビュー対象70件の主張のうち58件で完全に一致した。依然として意味のある不一致は残るが、この開示により読者は測定上の不確実性をより明確に把握できる。
第8段階では、文書化されたメモを生成した。AIシステムが本文を下書きし、算出された指標がすべての数値を供給、コードがスコアカードを作成した。
Merlinはまた、すべての批判について、より高い性能を示した比較モデルの名前を挙げるよう求めた。同社の完全な評価レポートには、定義、指標、発見事項ごとの付録が含まれている。
このように決定論的なチェックと範囲を限定したAI判断を組み合わせる手法は、健全な一般原則に沿っている。存在確認、範囲、件数、再現可能な計算にはコードを用いるべきだ。算術では答えられない意味論的な問いについてのみ、確率的な評価器を使う。
これは、組織がテストセット、指標、不確実性、導入条件を文書化すべきだというNISTの勧告にも通じる。AI RMF Coreも、再現可能な評価と導入後の継続的な監視を求めている。
検索可能なナレッジベースを構築するチームにとって、この教訓は訴訟対応にとどまらない。検索層と生成層のいずれも証拠の連鎖を壊し得るため、引用チェックでは両方を検証する必要がある。
なぜこの結果がエンタープライズAIの購買担当者に圧力をかけるのか
このベンチマークは、実際のワークロードを測定する前に一つの高価格モデルへ標準化する買い手に圧力をかける。
企業の調達部門は、しばしばモデルをソフトウェアのエディションのように扱う。より高価、または新しい選択肢は、より強い推論、大きなコンテキストウィンドウ、一般ベンチマークでの高得点を約束するため、安全に見える。
Merlinのテストは、その論理の弱点を示している。一般的な能力の優位性は、文書に根拠を置く調査ワークフローでの優れた性能を保証しない。
この評価課題には、複数の異なる能力が求められた。モデルは要約を読み、異なる企業に関する証拠を分け、通常の紛争を過大に表現せず、製品上の問題を統合し、有用な引用を付けなければならなかった。
あるモデルは引用をきれいに処理した一方で、扱った論点は少なかった。他のモデルは、より多くの異なる論点を見つけたが、引用に関する摩擦も大きかった。適切な選択は、どの誤りがより大きな専門的リスクを生むかによって変わる。
大規模なコレクションの初期レビューでは、速度と幅広い再現率が重視されるかもしれない。法律顧問向けに作成する最終報告では、正確な引用、完全な統合、節度ある結論により大きな比重が置かれる可能性がある。
この違いは、測定された要件に基づいて各タスクへモデルを割り当てるモデルルーティングを支持する。最も安価なシステムを自動的に選ぶことを支持するものではない。
防御可能なルーティング方針は、リスクから始めるべきだ。チームは、タスクが事実抽出、論点発見、長文統合、法的判断、最終的な顧客コミュニケーションのどれを必要とするかを特定する必要がある。
その後、本番環境と同じプロンプト、検索設定、文書条件の下で、代表的な例をテストすべきだ。公開リーダーボードでは、こうした条件を再現できない。
モデルの選択はレビューコストにも影響する。範囲の狭い報告を出す高速なシステムは、見落としたテーマを弁護士が探す必要があり、作業を弁護士側へ戻してしまう可能性がある。引用精度の低い広範なシステムは、レビュー担当者が主張を手作業で追跡しなければならず、別の負担を生む可能性がある。
このベンチマークの運用コスト指標には、こうした下流の労働は含まれていなかった。測定対象はレポート作成時のモデル利用であり、レビュー、修正、承認にかかる総コストではなかった。
法務分野の買い手にとって、この区別は特に重要だ。米国法曹協会のAI倫理意見書は、弁護士が能力、機密保持、コミュニケーション、監督、誠実性、合理的な報酬に関する義務を考慮しなければならないとしている。
モデルが流暢な出力を生成しても、責任が法律顧問から移るわけではない。弁護士には、依頼内容と不正確または裏付けのない記述によって生じるリスクに見合ったレビュー手順が依然として必要だ。
同じ原則は法務以外にも当てはまる。金融アナリスト、コンプライアンスチーム、研究者、プロダクトマネージャーはいずれも、大量の証拠コレクションを意思決定へ圧縮する出力に依存している。
モデルは実在する文書を引用していても、決定的な論点を見落とすことがある。また、妥当な結論に達しながら、誤った箇所を参照することもある。これらは別個の失敗モードであり、別々の指標に値する。
したがって買い手は、単一の複合的な「品質」スコアに抵抗すべきだ。必要なのは、引用の妥当性、主張の根拠付け、網羅性、矛盾の扱い、レイテンシ、人による修正時間といった作業を反映するスコアカードである。
Merlinは、モデルプロバイダーをまたぐ利用者の選択肢も支持している。この立場は、Alchemyが複数のモデルファミリーを提供する同社の商業設計に資するものだ。
それでも、証拠はより限定的な論点を支持している。6つのモデルが忠実性で統計的に同等である一方、速度、広さ、運用コストで異なるなら、すべてのタスクを一つのプロバイダーに固定することは、測定可能なトレードオフを活用しないことになる。
このベンチマークが証明していないこと
これは、モデルの識別情報を非公開にし、意図的に限定した正確性の定義を用いた、ベンダー主導の単一ワークフロー評価だった。
MerlinはAlchemyを開発し、ベンチマークを実施し、採点プロセスを設計し、その解釈を公表した。EDRMは、見解が著者のものであると明記した注記付きでこの記事を再掲載した。
これは作業を無効にするものではない。ただし、読者はこの結果を独立した比較試験ではなく、文書化されたベンダー評価として扱うべきことを意味する。
非公開の正解キーも別の制約を生む。匿名化は評価者をブランドバイアスから守ったが、継続する非公開性は、モデル単位での公の検証を妨げる。
読者は報告された順位を他のベンチマークと比較できない。また、モデルで既知の挙動が、網羅性、速度、引用エラーにおける特定のパターンを説明するかどうかも検証できない。
ベンチマークは、一つの訴訟コレクションから抽出した二つの質問を使用した。二つの質問でも有意義な失敗モードを示すことはできるが、すべてのディスカバリー案件や法分野を代表することはできない。
報告された信頼区間は、この不確実性を認識しようとしている。しかし、二つの質問を再サンプリングしても、契約、規制案件、秘匿特権レビュー、時系列構築、矛盾する証人証言を対象とする、より大規模なテストセットの多様性は生み出せない。
モデルは、一つの構成の下で評価対象となる実行を一度完了したようだ。特に生成設定が異なる表現や証拠選択を許す場合、反復試行によって出力のばらつきが明らかになる可能性がある。
公開資料には、プロンプト、要約の品質、検索上限、モデル構成がもたらすシステム全体への影響を、個別に計算するための十分な情報もない。異なるアプリケーションのハーネスでは順位が変わる可能性がある。
最も重要なのは、忠実性が法的正確性と同義ではなかった点だ。このテストは、記述が情報源までたどれるか、引用が適切な資料を指しているかを測定した。
法的推論の質は採点していない。モデルが最も重要な証拠を特定したか、矛盾を説得力ある形で調整したか、相手方の主張を予見したかも判定していない。
Merlinはこの限界を直接認めている。モデルは、調査報告を有用にする難しい結論を避けながら、慎重に裏付けた事実を列挙することで高評価を得る可能性がある。
検出された捏造がないことについても、慎重さが求められる。これは、評価パイプラインがこれら7件のレポートで特定の作り話の事実を見つけなかったことを意味するに過ぎない。モデル、Alchemy、あるいは法務AI一般について、ハルシネーション率がゼロであることを示すものではない。
システムの失敗率はタスクによって変わる。自由形式の調査、不完全なコレクション、曖昧な質問、敵対的な文書は、統制された統合演習とは異なる圧力を生む。
自動採点自体にも不確実性がある。Merlinの追加評価者は当初のフラグを3件覆しており、単一のモデルを無批判な評価者として扱うべきでない理由を示している。
評価者は、レビューした70件の主張のうち58件について全会一致した。これは相当な一致だが、意味論的な分類には依然として議論の余地があることも示している。
独立した人間による法務レビューがあれば、証拠はより強固になる。分野の専門家は、評価カテゴリーが専門職としての期待に合致するか、裏付けがあるとされた主張が情報源の意味を保っているかを判断できる。
NISTの生成AIプロファイルは、リスクがモデル、アプリケーション、エコシステムの各レベルで異なることを認識しつつ、導入前テストを重視している。Merlinのベンチマークは3層すべてを合わせて評価しているが、完全には切り分けられない。
したがって、この結果は調査を終えることなく購買行動を変えるべきだ。これは価格に基づく選定への反証であり、匿名の低価格モデル一つがフロンティアシステムを置き換えるべきだという証明ではない。
コスト対正確性の逆転を試す三つのシグナル
次の検証点は、Merlinが示した逆転が、より幅広いタスク、独立したレビュー、繰り返されるモデル更新を経ても維持されるかどうかだ。
第一のシグナルは、より大規模な判断ベンチマークである。Merlinは、矛盾する証拠、因果推論、論点の重要性、対立する主張を対象とする別の評価を構築中だとしている。
このテストは重要だ。なぜなら、高価格モデルは引用の仕組みではなく推論能力によって、より高い運用コストを正当化することが多いからだ。低価格モデルがそこでも競争力を維持するなら、フロンティアモデルをデフォルトでルーティングする根拠は大幅に弱まる。
高価格システムが明確な優位を示すなら、現在の結果はタスク特化の一例として見えるだろう。チームは複雑な統合にはフロンティアモデルを確保し、証拠に基づくレポートには低価格システムを使えるようになる。
第二のシグナルは独立した再現である。信頼できる追試では、ライセンスが許す範囲で、プロンプト、設定、モデルバージョン、反復実行、採点コード、再利用可能な文書パッケージを開示すべきだ。
また、プラットフォームベンダーに所属しない人間の法務レビュー担当者も含めるべきである。決定論的なチェック、自動評価者、分野専門家の一致は、手法を強化する。
追試では、採点中の匿名性を保ちつつ、その後にラベルキーを公開することもできる。この設計なら、ブランドバイアスへの保護を維持しながら、買い手に実用的なモデル単位の証拠を提供できる。
第三のシグナルは、モデルとプラットフォームの更新後に生じる性能ドリフトだ。プロバイダーは、モデルスナップショット、推論システム、価格体系を頻繁に改訂する。検索パイプラインや要約プロンプトも変化する。
Merlinは、新規参入モデルにも同じテストを適用するとしている。安定した時系列を公開すれば、順位が持続するのか、単に一つの有利なスナップショットを捉えたものなのかが分かる。
チームは勝者だけを見るべきではない。壊れた引用、誤った参照先、網羅性、評価者間の不一致、レイテンシ、修正時間の変化は、ワークフローが改善しているかを明らかにする。
MerlinのAIモデルベンチマークは、買い手に実践的な課題を残す。抽象的にどのモデルが最良かを問うのはやめるべきだ。作業を定義し、コストの大きい失敗を特定し、自らの証拠に対して統制された評価を実施する。
法務チームにとっては、引用が存在するか、箇所が主張を裏付けているか、レポートが重要な論点を捉えているかを確認することを意味する。また、最終判断について弁護士に責任を持たせ続けることも意味する。
他の知識集約型チームにとっても、問いは似ている。システムは人々が防御可能な意思決定に到達する助けとなるのか、それとも単に流暢な文章を生み出すだけなのか。
9倍のコスト差は印象に残る見出しになる。だが、持続的な教訓はより厳しい。タスクを測定し、証拠の連鎖を監査し、不確実性を含め、モデルまたはワークフローが変わるたびに再テストすることだ。



