top of page

Sakana AIの査読、主要な誤りの73%を検出するも、実際の論文が限界を浮き彫りに

2 時間前
読了時間: 17分

Sakana AIによると、同社の査読システムは論文の主要な主張に影響する意図的に埋め込まれた誤りの73.43%を検出した。しかし、この注目を集める結果は、未改変の研究に対する通常の査読ではなく、人工的な矛盾を対象とした4回の査読によるものだ。

Multi-Layered Reviewと呼ばれるこのシステムは、Sakana AIの新しいベンチマークで3つの自動査読ベースラインを大きく上回った。一方、撤回されたarXiv論文で記録された問題を対象にすると、正確な検出率は16.11%まで低下した。

この差こそが本質だ。Sakana AIの査読は、慎重な複数回の読解が自動的な批評を改善し得る証拠を示している。しかし、LLMが科学研究を確実に検証できることを立証するものではない。

むしろこの研究は、開発者にAI査読者の評価方法を再考するよう促している。人間の評価との一致や説得力のあるフィードバックを生成するだけでは不十分だ。有用な査読者は、主張、手法、実験、証拠を結び付け、それらの矛盾を見つけられなければならない。

Sakana AIの結果は、同社の複雑な過去とも重なる。同社は以前、AIを使って科学論文を生成し、査読を通過することが実際に何を示すのかという疑問に直面した。今回のプロジェクトはその懸念を反転させ、AIが人間による脆弱な研究の検出を支援できるかを問うものだ。

Sakana AIの査読はテストを変える

最も重要な変化は73.43%という結果ではない。AI査読者を、誤りを見つけられるかどうかで評価するという判断だ。

自動査読に関する従来の研究の多くは、類似性を測定してきた。研究者はAIが生成した査読を人間のフィードバックと比較し、スコアの相関やコメントの重複を確認した。

こうしたテストは、システムが査読者らしく振る舞うかを捉える。しかし、論文の中心的な誤りに気付いたかどうかを直接示すものではない。

Sakana AIの査読論文は、検証に焦点を当てた代替手法を提案している。著者らは、誤りの検出が査読における最も重要で、最もリソースを要する機能の一つだと主張する。

チームは、1,164件の改変論文バリアントを含むContradiction Benchmarkを構築した。これらのバリアントは、2025年にACL、AISTATS、CVPR、ICMLで発表された257本の論文と、2024年のNeurIPS論文から作成された。

研究者らは、寛容なCreative Commonsライセンスを持つ論文に対象を限定した。この制約により、原稿の改変と再配布が可能になった。

各論文について、Gemini 2.5 Proが知識グラフを生成した。知識グラフは、主張、手法、証拠、およびそれらの関係を接続されたノードとして表現する。

研究者らは次に、各ノードが主要主張からどれだけ離れているかを測定した。距離がゼロであれば、そのノードは中核的な主張を表す。距離が大きいほど、より周辺的な詳細を表す。

GPT-4.1は、対応するノードと矛盾するように選択された文章を書き換えた。改変されたテキストは元のソースに挿入され、完全なPDFとして再コンパイルされた。

この手順により、研究者らは既知の誤りと既知の位置を得た。また、各誤りが論文の主要な結論をどの程度直接脅かすかを分類することも可能になった。

o3モデルは、生成された査読が各矛盾を検出していたかを判定した。判定プロセスは各例につき10回実行され、研究者らは結果を平均した。

研究によると、クリーンな論文では判定器は99.9%の精度に達した。手作業による分析では、確認された検出に対して86.8%の感度が示され、自動採点が正当な検出を見逃す場合があることが示唆された。

この設定は、モデルが査読者らしく聞こえるかを問うよりも明確なテストを提供する。システムが埋め込まれた矛盾を指摘するか、しないかのどちらかだからだ。

ただし、このベンチマークが測るのは、査読の中でも慎重に定義された一部分に過ぎない。データの捏造、不適切な統計的仮定、隠れた前処理の誤り、再現不可能な実験など、科学的失敗のあらゆる形態を対象としているわけではない。

この区別は重要だ。見出しの数値は、あくまで主要主張の矛盾を指している。科学査読全般における73%の精度と解釈すべきではない。

Sakana AIのMLRシステムがより多くの誤りを見つける理由

Multi-Layered Reviewは、論文を評価する前にモデルへ論文を理解させることで、誤り検出を改善する。

完全版のSakana AI MLRシステムには、Appendix Agent、Literature Review Agent、Review Agentという3つの役割が含まれる。これらのコンポーネントは、統合的な評価を生成する前に、原稿の異なる部分を処理する。

Appendix AgentはClaude Haiku 3.5を使い、本文外の実装および実験の詳細を要約する。このステップは、付録ですでに扱われている欠落をシステムが批判するのを防ぐのに役立つ。

任意のLiterature Review Agentは、Claude Sonnet 4とウェブ検索を使用する。その役割は、原稿を既存研究の中に位置付け、新規性の主張に妥当性があるかを検証することだ。

中心となるReview AgentもClaude Sonnet 4を使用する。最大10ページの本文をPDFとして受け取り、プレーンテキスト抽出では損なわれる可能性がある数式、グラフ、レイアウト情報を保持する。

そのワークフローは、研究論文を読むために定着しているthree-pass methodを踏まえている。第1パスでは、原稿の主要なアイデアについて高レベルのアウトラインを作成する。

第2パスでは、より詳細に読み、これらのアイデアを裏付ける証拠と結び付ける。また、仮定、欠落、弱点を記録する。

第3パスでは、これらのメモを関連する付録および文献の調査結果と統合する。その後、長所、短所、質問、推奨、スコア、アクションリストを作成する。

この一連の流れは、LLM査読ツールでよく見られる失敗に対応する。一つの大きなプロンプトでは、モデルに論文の要約、検証、比較、批評、採点、整形を同時に求めることがある。

モデルは、研究の安定した表現を構築しないまま、洗練された査読を生成するかもしれない。結果にある反証的な証拠を見落としつつ、要旨の主張を繰り返すこともある。

MLRは、理解と評価を分離する。この設計により、モデルは結論と、それを支える手法や実験を結び付けられる中間メモを得る。

ベンチマーク結果は、モデルの選択とワークフローの設計の両方が改善に寄与したことを示唆する。より単純なLLM-Reviewベースライン内でGPT-4.1をClaude Sonnet 4に置き換えると、主要な誤りの検出率は14.56%から35.40%に上昇した。

単一のMLR査読は、同じ種類の中核的な矛盾で60.79%に達した。4件のMLR査読によるアンサンブルでは、検出率が73.43%まで上昇した。

主要主張の誤りで最も優れた競合結果は、AgentReviewによる14.81%だった。AI Reviewerは11.17%、元のLLM-Review構成は14.56%に達した。

測定されたすべての深刻度にわたる矛盾では、4件のMLR査読が40.95%を検出した。競合システムは5.95%から6.50%の間にとどまった。

これらの比較は、絶対的なスコア以上に仕組みを興味深いものにしている。基盤モデルの変更は大きな改善を生み、複数パスの査読設計がさらに改善をもたらした。

つまり、導入側は「マルチエージェント」だけを性能の十分な説明として扱うことはできない。AgentReviewも査読者、著者、エリアチェアの役割を使用しているが、ベンチマーク結果は大幅に低かった。

重要なのは、エージェントが何を行うかだ。一つのタスクを複数のペルソナに分けることと、原稿を証拠を担う構成要素に分解し、繰り返しのパスを通じて理解を構築することは異なる。

MLRはまた、トークン数が多ければ自動的に査読品質が向上するという仮定にも異議を唱える。研究では完全な査読1件あたり189,062入力トークンを使用しており、AI Reviewerの403,654の半分以下だった。

より単純なLLM-Reviewは、長いコンテンツを切り詰めていたこともあり、入力トークンを6,517個しか使用しなかった。このアプローチはリソース消費を抑えた一方で、矛盾を明らかにし得る情報を失った。

したがって有用なトレードオフは、単に小規模か大規模かではない。システムが論文を査読可能なモデルとして構築するために、コンテキストを使っているかどうかだ。

73%という主張はベンチマークの外で縮小する

MLRを自律的な審判として扱うべきではない最も強い証拠は、Sakana AI自身による実際の誤りの評価にある。

研究者らは、撤回されたarXiv論文とそれに関連する撤回コメントに基づくデータセット、WithdrarXiv-Checkを用いてReview Agentをテストした。そのテストセットには211本の論文が含まれる。

この評価は、意図的に埋め込まれた矛盾の検出より難しい。実際の研究上の誤りは、明白な文レベルの衝突を生まずに、仮定、導出、引用、実験にまたがって分散している可能性がある。

著者らはこのテストで文献検索コンポーネントを無効にした。そうしなければ、システムが原稿から問題を発見する代わりに、公開された撤回通知を見つけてしまう可能性があるためだ。

MLRは、記録された撤回理由との正確な一致を16.11%のケースで特定した。実質的に類似した懸念を受け入れる、より柔軟な基準では26.07%に達した。

最も強いベースラインは、正確な一致で9%、類似した一致で18.48%に達した。MLRは依然として比較をリードしたが、合成ベンチマーク上より差ははるかに小さかった。

撤回論文データセットには、主に理論数学および物理学の研究が含まれている。査読システムは機械学習会議の論文を中心に設計されており、直接比較には限界がある。

この領域の不一致を踏まえても、性能差は中心的な限界を明らかにする。埋め込まれた矛盾は、査読者に見つけるべき明確な不一致を与える。実際の欠陥では、証明の再構成、コードの再実行、データの確認、または専門的な領域知識が必要になることが多い。

ベンチマークの著者らは、別の問題も認めている。人間の評価者は50件の合成矛盾を調べ、そのうち34%は隣接する文との一貫した流れを欠いていると判断した。

明らかにAI生成のように聞こえたのは8%に過ぎなかったが、文脈の乱れは依然として検出の手掛かりとなり得る。自動査読者は、根底にある科学がなぜ誤っているかを理解せずとも、文章が適合していないことに気付く可能性がある。

著者らは、これがベンチマークを無効にするのではなく、容易にする要因だと主張する。挿入された誤りの一部に検出可能な不規則性が含まれていたとしても、ベースラインシステムは依然として苦戦した。

この解釈は妥当だが、73.43%の意味を変える。この数値は、管理された矛盾タスクにおける高スコアであり、MLRが投稿論文の重大な誤りをどれほどの頻度で検出するかの推定値ではない。

4件の査読という設定にも注目すべきだ。このアンサンブルでは、4件の独立した査読のいずれかが誤りに言及すれば、その誤りを検出したと数える。

これは、複数の警告シグナルを集めることで網羅性を高められる、著者側のスクリーニングには有用だ。一人の人間の査読者を置き換えるために、一件の自動査読を割り当てる場合との比較は、それほど直接的ではない。

単一のMLR査読による60.79%の主要誤りの結果は、なお大きな意味を持つ。それでも、単一査読の構成では、意図的に埋め込まれた中核的な矛盾のほぼ10件に4件が見逃された。

矛盾が論文の主要主張から離れるほど、性能も低下した。このパターンは知識グラフの深刻度指標を支持する一方、詳細な二次的誤りが依然として困難であることを示している。

したがって研究チームにとっての実用的なユースケースは、投稿前の監査だ。自動システムは、起こり得る不整合をフラグ付けし、人間の注意を脆弱な主張に向けることができる。

ただし、有効性を認証する準備はできていない。警告を受けなかった論文が正しいと仮定することはできず、警告が正当だと仮定することもできない。

人間との一致は有用だが、科学的検証ではない

MLRは人間の査読スコアに似た判断を示すものの、査読者との一致は真実の発見とは別物である。

ICLR 2025への投稿論文では、MLRのスコアは人間のスコアと0.586のピアソン相関を示した。人間同士の基準値は0.742だった。

NeurIPS 2024の論文では、MLRは0.451に達し、人間の基準値0.781と比べられた。ICML 2025では、MLRは0.429に達し、AI Reviewerの0.439をわずかに下回った。

これらの数値は、とりわけ採択論文と不採択論文をほとんど区別できなかったシステムと比べれば、有意な整合性を示している。しかし、人間の判断や自動化された判断が事実として正しいことを示すものではない。

査読には、重要性、明確さ、新規性に関する主観的な問いが含まれる。慎重な2人の査読者が、ある論文は採択に値すると一致しながら、同じ技術的な弱点を見落とすこともあり得る。

Sakana AIの分析では、人間と自動化システムが重視する点にも違いが見られた。MLRは妥当性と実験をより重視した一方で、人間の査読者は明確さと新規性により大きな注意を払った。

この相違は有益になり得る。査読支援ツールは、人間が書くコメントを単に予測するよりも、見落とされている懸念を浮き彫りにするほうが価値を発揮する。

ただし、補完的な着眼点には、それ自体のキャリブレーション問題がある。システムは、本物の方法論上の弱点と、原稿による裏付けのないもっともらしい批判とを区別しなければならない。

この研究のユーザー評価は、その課題を示している。現役研究者らは、MLRの完全なワークフローを用いて38件の査読セッションを実施した。

直接的な同意フィードバックを受けた378件のコメントのうち、ユーザーは81%を受け入れた。提案は94%、長所は92%の同意を得た。

質問は79%、アクションリスト項目は78%だった。弱点は68%で、最も低い同意率となった。

著者は批判に対する中立的な判断者ではないため、不同意が必ずしもシステムの誤りを意味するわけではない。それでも、誤った非難が最も大きな損害を生み得るのは、まさに弱点の指摘である。

数学的な誤りや実験不足を誤って指摘する査読者は、編集上の判断を歪める可能性がある。流暢な文章は、その根拠が支持する以上に、その主張を確実なものに見せてしまう。

人間の査読者も同じ誤りを犯し得る。違いは、自動化では一つの誤った解釈が数千件の投稿論文にわたって複製され得ることだ。

このため、Sakana AIの査読システムは意思決定者よりも、セカンドリーダーとして適している。採否に関する最終権限を与えずに、人間が検討する論点の範囲を広げられる。

このシステムの構造化されたメモは、著者が複雑な証拠を管理する助けにもなり得る。検索可能なナレッジベースをすでに利用しているチームは、主張を実験、引用、未解決の問いに結び付けることで、同様の原則を適用できる。

それは検証を自動化するものではない。人間が証拠の経路を確認しやすくするものだ。

プロンプトインジェクションが自動化のリスクを露呈する

論文を理解する査読者であっても、その論文内に埋め込まれたテキストによって操作される可能性がある。

Sakana AIは、主にICLR 2025へ当初投稿された不採択原稿50本の結論後に隠し指示を追加し、明示的なプロンプトインジェクションをテストした。

プロンプトインジェクションとは、文書内のコンテンツが、その文書を読むモデルを統御する指示を上書きしようとする行為である。悪意ある文章は、自動査読者に弱点を無視するよう命じたり、高いスコアを付けるよう指示したりする可能性がある。

4つの査読システムはすべて、注入されたテキストから強い影響を受けた。MLRは一部の指標で平均スコアの変化が最小だったものの、結果には大きなばらつきがあった。

MLRが操作を明示的に検出できたのは、50本中わずか8本だった。残るケースでは、注入されたコンテンツが敵対的なものとして確実に識別されないまま、査読に影響を及ぼした。

研究者らは、MLRが理解優先のワークフローとマルチモーダル入力によって、ある程度保護されていた可能性を示唆している。Claudeは文書テキストとレンダリング済みページの両方を確認した一方、注入された指示は可視画像には存在しなかった。

この不一致は、隠しテキストが論文に属さない可能性を示すシグナルとなった。しかし、それだけでは一貫して操作を防ぐには不十分だった。

この弱点が重要なのは、査読が信頼できない文書を扱うためである。著者はPDF、ソースファイル、補足資料、引用、場合によってはリンク先のリポジトリも管理している。

ブラウジングやコード実行ツールを備えた自動査読者は、より広い攻撃対象領域に直面する。リンク先ページには指示を含められ、リポジトリには敵対的なコメントを入れられ、補足データには誤解を招くメタデータを隠せる。

学会のポリシーはすでに、LLMの利用には開示と慎重な取り扱いが必要であることを認識している。ICLR reviewer guideは、自動支援よりも人間の責任を上位に置いている。

安全な導入には、文書コンテンツをシステム指示から分離する必要がある。また、ツールを制限し、モデルの行動を記録し、隠しテキストをフラグ付けし、重大な主張には人間の確認を求めなければならない。

こうした統制を講じても、あらゆる形態の操作を解決できるわけではない。明白な指示を含まない文章でも、モデルに影響を与え得る。

著者は比較を選択的に提示したり、失敗した実験を埋もれさせたり、自信に満ちた表現で注意を誘導したりできる。こうした手法は人間の査読者にも影響するが、自動システムは予測可能な盲点を持つ可能性がある。

Sakana AIの以前の研究は、関連する注意点を示している。2025年、同社はAI生成のワークショップ論文が採択された後に撤回し、生成された研究に引用エラーがあったと説明した。

外部の研究者らは、この出来事が自律的な科学能力を示すのか、それともAI出力に対する効果的な人間の選別を示すのかを疑問視した。後の査読分析は、査読を通過することと、信頼できる知識に貢献することの違いを強調した。

MLRは、既知のエラーを用いて査読者をテストすることで、この問題の一部に対処している。しかし、そのインジェクション結果は、同じモデルクラスから構築された評価者が、戦略的に書かれた入力に依然として脆弱であることを示している。

自動化された著者と自動化された査読者は、最終的に互いを相手に最適化する可能性がある。著者は批判を避けられる表現を学び、査読者は採択済みの研究に似たパターンを評価するかもしれない。

独立した検証がなければ、このループは科学を改善せずにスコアだけを改善する可能性がある。

LLM査読ベンチマークの後に注目すべきこと

Sakana AIの結果が有用な研究ツールになるのか、それとも印象的な統制実験にとどまるのかは、3つのシグナルによって決まる。

第1のシグナルは独立した再現である。Sakana AIは、データとコードを即時にアクセス可能な公開リポジトリではなく、要請に応じて提供するとしている。

外部チームは、同じ論文、プロンプト、モデルバージョン、判定手順でベンチマークを再現する必要がある。また、異なる判定モデルをテストし、争いのある検出結果を手作業で監査すべきである。

再現では、再現率と並行して偽陽性も測定すべきだ。システムがもっともらしいが誤った批判を多数生成するなら、より多くのエラーを捉えても価値は限定的である。

第2のシグナルは、自然に生じる欠陥に対する性能である。将来のベンチマークには、検証済みの統計的誤り、裏付けのない因果主張、引用の不備、再現不可能な結果、破綻した証明を含めるべきである。

一部の課題では、PDFだけでなくコードやデータへのアクセスが必要になる。真剣な研究監査者は、実験を実行し、前処理を調査し、報告値と生成された出力を比較する必要があるかもしれない。

16.11%という完全一致の結果は出発点を提供する。将来のシステムが、多様で独立にキュレーションされた論文においてこの割合を高められるなら、実用的な支援を支持する根拠はより強くなる。

第3のシグナルは、学会が強制可能な安全策とともにこれらのシステムを導入するかどうかである。関連する指標には、開示ルール、プライバシー統制、プロンプトインジェクション対策、文書化された人間による監督が含まれる。

査読者に非公開かつ任意の警告を与える限定的な試験は、意思決定を委任せずに拡張支援を試せる。投稿論文を自動採点するシステムは、はるかに大きなリスクを伴う。

研究者は、モデルの変更がSakana AIのMLRシステムにどのような影響を与えるかにも注目すべきである。アブレーションでは、基盤モデルの切り替えが性能向上の大きな割合を占めていたことが示された。

これは保守上の圧力を生む。あるモデルバージョンで検証されたワークフローは、プロバイダーがモデルを更新したりエンドポイントを廃止したりすると、異なる挙動を示す可能性がある。

また、再現性に関する疑問も生じる。同一の公開チェックポイントを維持せずに商用モデルが変更されると、科学的ベンチマークの解釈は難しくなる。

したがって、Beyond Imitationのより深い貢献は方法論にある。このLLM査読ベンチマークは、生成されたコメントが人間のコメントに似ているかどうかよりも、優れた問いを投げかける。

AI査読者は、論文の論理を脅かす具体的な問題を見つけられるのか。

Sakana AIの答えは、統制された条件下では有望であり、実際に撤回された研究では厳しい現実を示している。報告されたテストでは、複数パスによる理解が浅い模倣を明確に上回った。

自動化された権限委譲には、残る隔たりが大きすぎる。実際の論文には、矛盾として自らを明示しないエラーが含まれており、悪意ある論文は査読者を直接操作できる。

開発者は、73.43%という数値を明確な境界を持つベンチマーク結果として扱うべきである。編集者は、自動スコアを出版判断に組み込む前に独立した検証を求めるべきだ。

研究者は今すぐ、このシステムの中心的な考え方を活用できる。AIアシスタントに主要な主張をすべてその証拠に対応付けるよう求め、得られたリンクを確認し、裏付けのない飛躍を一つずつ手作業で調査することだ。

次に決定的となる結果は、また一つの合成的な記録ではない。査読者を誤警報で圧倒したり、原稿内に隠された指示に従ったりすることなく、微妙で自然なエラーを見つける再現済みのシステムである。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page