QED Scienceはプレプリント上位1%を順位付けできると主張する。研究者は信頼すべきか?
QED Scienceは、AIが科学的な質をどのように定義するのかという未解決の疑問を抱えたまま、57,455本の生命科学プレプリントを順位付けし、その上位1%として574本を選出した。
テルアビブのスタートアップである同社は、著者、所属機関、被引用数、ジャーナル名を見ずに、独創性と妥当性を評価するシステムだと述べている。この約束により、QED Scoreは、膨大な文献を読み解くために研究者がしばしば不本意ながら利用している権威性のシグナルに対抗することになる。
Horizon Natureの報道が提起する中心的な問いは、人工知能が人より速く論文を読めるかどうかではない。それは明らかに可能だ。問題は、独立した研究者がその前提を十分に検証する前に、独自仕様のスコアが信頼できるフィルターになり得るかどうかだ。
QED Scienceは1年分のプレプリントを単一の順位リストに変えた
QED Scienceは、科学的なトリアージを「読む」問題から「順位付ける」問題へと変換した。
同社は2026年6月24日、「The 1%」を開始した。これは12カ月間に投稿された、最も独創的で科学的に妥当な生命科学プレプリントの選定だと説明している。
QEDは2025年5月から2026年4月にかけてbioRxivへ投稿された57,455本の原稿を分析した。最終コレクションには574本の論文が含まれ、評価対象集団の上位1%に相当する。
プレプリントとは、ジャーナルの正式な査読前に公開される原稿である。結果を迅速に流通させられる一方、読者は編集上の審査に伴う保証なしに証拠を評価しなければならない。
この速度は価値とリスクの両方を生む。研究者はジャーナル掲載の数カ月前に重要な発見に触れられるが、同時に、誰一人として綿密に評価しきれない量の資料にも直面する。
QEDによれば、その全コーパスを従来型のレビューで検討するには、専門家の作業時間が86万〜103万時間必要になる。同社の検証論文によると、これは研究者400人年以上に相当する。
同社のシステムは数時間で評価を完了した。この差が、とりわけ急速に変化する分野を追う資金提供者、研究チーム、企業にとっての魅力を説明している。
この結果は採否の決定ではない。QEDはThe 1%を、どの原稿に注目すべきかを判断するための早期シグナルと位置付けている。
この違いは重要だ。ジャーナルの編集者は改訂を求め、査読者に意見を求め、開示事項を精査し、致命的な問題を見つければ論文を却下できる。スコアは、別種のプロセスを一つの数字に圧縮する。
QEDの公開リストはbioRxivの生命科学カテゴリにまたがる。神経科学では、評価した11,058本の原稿から83本が選ばれ、細胞生物学では3,408本から55本が選ばれた。
ほかのカテゴリには、ゲノミクス、免疫学、微生物学、がん生物学、バイオインフォマティクス、遺伝学、合成生物学が含まれる。この分布は、分野の規模とQEDの評価の双方を反映している。
QEDは順位付けプロジェクト以外での採用についても報告している。5月31日時点で、同社のプラットフォームは70カ国超、1,500超の機関にまたがる1万超の研究室で利用されていたという。
これらの数値はQEDによるものであり、独立した利用監査によるものではない。それでも、AI支援による原稿評価が実験室レベルの試みにとどまらなくなっていることを示している。
したがってHorizon Natureの問いは、一つのリストを超える。研究者がQEDを使って読むもの、引用するもの、資金提供するもの、開発するものを選ぶなら、その判断は査読が始まる前から注目のあり方を形作り得る。
それが本当の変化だ。QEDは単にプレプリントを要約したのではない。科学的な注目への入口に、自動化されたゲートを提案したのである。
Horizon Natureの議論が今重要な理由
圧力は、研究が現れる速さと専門家が評価できる遅さの隔たりが広がっていることから生じている。
プレプリントサーバーにより、科学者はジャーナルの完全な査読サイクルを待たずに研究成果を共有できる。このモデルは、新たな生物医学的エビデンスへの迅速なアクセスが必要とされた際に、とりわけ目立つようになった。
一方で、身近な選別の仕組みも取り除かれた。新たに投稿されたbioRxiv原稿には、最終的な掲載ジャーナル、確立された被引用記録、完了済みの査読履歴がない。
研究者は不完全なシグナルで補う。研究室、機関、著者、手法、テーマ領域を認識し、ソーシャルな推薦をたどり、専門的ネットワークを通じて浮上するものを精査する。
こうした習慣は時間の節約になるが、権威バイアスを再生産する可能性もある。著名な機関からの研究は、あまり知られていないグループによる同等に強力な研究よりも注目を集めやすい。
QEDはこの弱点を標的にしている。同社のローンチ発表によると、すべての原稿はスコアリング前に匿名化される。
システムは著者名、所属機関、その他の識別情報を取り除く。また、被引用数、掲載媒体、ジャーナルの評判も考慮しない。
QEDの共同創業者兼主任科学者であるOded Rechaviは、科学的な質は研究そのものを通じて判断されるべきだと主張する。ブラインド評価は、評判が証拠の代わりになることを防ぐ意図がある。
この目標にはもっともな根拠がある。人間によるレビューは、機関の地位、職業上の関係、言語、重要な研究を誰が生み出すかについての期待に影響され得る。
しかし、匿名化が自動的に中立性を生むわけではない。原稿には、研究テーマ、機器、データセット、文体、参考文献など、出所に関する間接的なシグナルが含まれ得る。
AIモデルもまた、学習データから関連性を継承し得る。入力から機関名を削除しても、モデル開発の過程で学習されたあらゆる関係性が消えるわけではない。
先行研究は、この区別が重要である理由を示している。2024年の研究は、異なる所属情報を組み合わせた30本の医学抄録でGPT-3.5を検証した。
研究者らは、ランダム化した所属条件にわたり232,500件の個別レビューを生成した。その所属バイアス研究では、機関情報がモデルの判断に影響したことが示された。
QEDの匿名化は、この問題の最も直接的な形に対処している。しかし同社は、外部の人々が残るすべての経路を把握できるだけのシステム詳細を公表していない。
規模の問題も悪化している。生成AIは、技術的な文章の下書き、もっともらしい引用の作成、洗練された原稿の作成に必要な労力を減らした。
これはAI支援を受けたすべての論文が信頼できないことを意味しない。表面的な流暢さが、科学的な質のシグナルとしてさらに弱くなったことを意味する。
bioRxivの共同創業者であるRichard Severは、合成的に作られた科学コンテンツに関する報道で、より暗い可能性を描写した。人工的に作成された論文が本物の発見を圧倒すれば、プレプリントシステムは利用しにくくなる。
その環境では、自動評価はほぼ不可避に見える。編集者と科学者は、無制限に生成される機械製の投稿に、無制限の人間によるレビューで対応することはできない。
QEDは一つの対応策を提示している。AIを使ってあらゆる原稿を分解し、主張を検証し、限られた人間の注意を最も有力な候補に向けるというものだ。
この圧力はまず、文献レビューを行う研究者にかかる。しかし、ジャーナル編集者、資金提供者、バイオテクノロジーチーム、そして初期段階のエビデンスに基づいて意思決定を行うすべての人にも及ぶ。
これらの集団は、より速いフィルタリングを必要としている。同時に、なぜ論文がフィルターを通過したのか、システムが何を見落としたのか、そしてその誤りがどの程度繰り返されるのかを知る必要がある。
順位付けは情報過多を減らせる一方で、新たな影響力の集中を生み出す可能性がある。一つのスコアが広く信頼されるようになれば、スコアリング層での誤りが分野全体の注目を別の方向へ向け得る。
だからこそ、議論は今起きている。科学出版には機械規模のトリアージが必要だが、そのトリアージを検証する基準はなお定まっていない。
QED Scoreが挑むのは権威であり、査読ではない
QEDにとって最も強い主張は、査読を置き換えることではなく、ジャーナルの格付けよりも論文を直接的に検証するという点にある。
QED Scoreは、二つの公表された次元を評価する。独創性は発見が既存の知識をどれだけ前進させるかを測り、妥当性は証拠が原稿の結論を裏付けているかを測る。
同社によれば、そのマルチエージェント・アーキテクチャは、まず各論文をメタ主張、主要な主張、関連する主張、裏付けとなる実験に分解する。
その後、専門化されたAIエージェントが、異なる特徴を並行して検討する。図表の不整合、統計上の弱点、既存文献との矛盾、代替仮説、報告基準上の問題を探す。
検証レイヤーが、フラグが立った問題を再確認する。スコアリングレイヤーが個々の主張を採点し、集約器がそれらの評価を調整済みのパーセンタイルへ統合する。
スコア80は、その原稿が参照コーパスの80%を上回ったことを意味する。論文が正しい確率が80%であることを意味するわけではない。
複雑な判断が見慣れた数字になると、この違いは見失われやすい。パーセンタイルが示すのは相対的な位置であり、絶対的な真実ではない。
QEDはその指標を三つの研究で検証した。第一の研究では、領域専門家がLimited、Satisfactory、Strongのカテゴリに分類した、185人の著者による925本の公表論文を使用した。
スコアリングパイプラインには、これらのラベルは与えられなかった。QEDは、Limited論文と他のカテゴリを区別する際の曲線下面積が0.867だったと報告している。
曲線下面積、すなわちAUCは、システムが二つのクラスをどれだけ適切に区別するかを測る。0.5は偶然による水準を、1.0は完全な分離を表す。
QED Scoresとジャーナル順位データの両方がある795本の論文について、QEDは二つの比較でより強い結果を報告した。Limited論文の識別では、QEDは0.863、ジャーナル順位指標は0.804だった。
Strong論文については、結果はかなり近かった。QEDは0.782、ジャーナル順位指標は0.774と報告している。
第二の研究では、2025年4月のbioRxivプレプリント4,953本を採点した。その後QEDは、それらの論文が最終的にどこで公表されたかを追跡した。
研究者らは、ジャーナル順位が関連付けられた公表版と2,879本のプレプリントを対応付けた。QEDは、自社のプレプリントスコアと最終的なジャーナル順位の間に、0.63のスピアマン相関があったと報告した。
相関は21の分野で異なった。遺伝学では0.78に達した一方、システム生物学では0.39まで低下した。
こうした差異は注目に値する。分野横断の単一のパーセンタイルは、モデル性能、エビデンスの慣行、出版行動における意味のある違いを隠し得る。
第三の研究は、見解の不一致に焦点を当てた。QEDは、自社のスコアがより低順位のジャーナルに掲載された論文を支持した、100組の論文ペアを作成した。
15人の領域専門家が、QED Scoresや掲載媒体を見ずにそのペアをレビューした。同点を除外した後の60件の決定的な選択を含む、70件の確信を持った判断が得られた。
専門家は、その決定的なケースの75%でQEDが支持した論文を選んだ。報告された95%信頼区間は63%から84%だった。
この結果は、掲載媒体の権威が論文レベルの質を誤って表す可能性があるというQEDの主張を支持する。人間の判断なしにQEDが真実を特定できることを立証するものではない。
掲載媒体は、ベンチマークとしても扱いにくい。ジャーナルへの掲載は、新規性、編集方針の範囲、タイミング、提示方法、査読者の確保、戦略的な投稿選択に左右される。
スコアが掲載媒体の順位と相関することは、既存の出版結果との整合性を検証し得る。しかし、それだけでは、システムが出版システムのバイアスから脱却しているという主張を検証することにはならない。
QEDも重要な境界を認めている。同社の方法論では、The 1%は査読の代替ではないとされている。
それが妥当な捉え方だ。QEDは原稿の精査を優先順位付けできるかもしれないが、高いパーセンタイルが臨床判断を正当化したり、科学的な論争に決着をつけたりするべきではない。
したがって、核心となる対立は直接的な評価と、権威に基づく推論の間にある。QEDは、読者がジャーナルの評判を借りるのではなく、主張と証拠を自ら精査すべきかを問いかけている。
QEDのスコアがなお不完全であっても、その問いは有益だ。ジャーナルのブランドは、長らく多くの判断を短い記号に圧縮してきたが、読者はそれを誤用しうる。
慎重に検証されたAIスコアは、もう一つのシグナルになり得る。ただし、それが唯一のシグナルになったり、公的な説明責任がより乏しい新たな権威ラベルになったりしてはならない。
上位1%という主張が証明しないこと
QEDの内部結果は本格的な検証を正当化するが、無条件の信頼を正当化する段階にはまだない。
主な制約は独立性にある。QED Scienceはこのシステムを開発し、検証設計を行い、方法論を公表し、主要な性能数値を報告した。
企業主導の研究も価値ある証拠を提供し得る。しかし、製品の商業的価値が同じ性能主張に依存する場合、独立した再現検証は不可欠になる。
ある外部レビューは、3件すべての検証研究に弱点があると指摘した。この批評は別のAIベースの研究評価サービスを通じて作成されたものであり、決定的な人間による再現検証ではない。
それでも、提起された疑問は具体的だ。review reportは、QEDの研究が完全に独立した確認を提示するのではなく、関連した参照シグナルを共有していると論じている。
第1の研究は、専門家が付与した品質カテゴリーに依存している。第2の研究は、ジャーナル順位を結果指標として用いる。第3の研究は、QEDとジャーナル順位が大きく食い違う事例を選んでいる。
この構造は、QEDが選んだテストにおける一貫性を示すことはできる。しかし、外部の研究者が定義した将来的な意思決定でシステムがどのように機能するかは、なお未解決のままだ。
第2の研究では、ジャーナル順位データを持つ公開版に対応付けられたプレプリントは4,953本中2,879本にとどまった。これは、2,074本の原稿が報告された相関分析の対象外になったことを意味する。
対応付けられなかった論文の一部は後に出版されるかもしれず、必要な指標のない媒体に掲載されるかもしれないし、正式な出版に至らない可能性もある。それらを除外すれば、見かけ上の関係性は変わり得る。
出版はランダムではないため、選択効果は重要だ。優れた研究が未出版のまま残ることもあれば、弱い研究が査読を通過して残ることもある。
第3の研究は説得力のある不一致データを示しているが、意図的に通常とは異なる標本を用いている。研究者は、QEDとジャーナル順位が逆方向を示すためにペアを選定した。
この設計は関連性のある対立を検証する。しかし、通常の論文全体でQEDがより良い選択をする頻度を推定するものではない。
75%という選好結果も、60件の決定的判断に基づく。これは有益な情報ではあるが、The 1%で取り上げられた57,455本の原稿と比べれば小規模だ。
選定リストには別の問題もある。「上位1%」は客観的に聞こえるが、QEDのコーパス、カテゴリー処理、スコアリングのバージョン、選ばれた評価次元に対する相対的な位置づけにすぎない。
独創性と妥当性は価値ある基準だ。しかし、科学者が重視するすべての品質を網羅するものではない。
技術的に妥当な論文でも、対象が限定的だったり重要性が低かったりすることがある。独創的な論文でも、脆弱な測定に依存している場合がある。再現研究は独創性が限定的でも、極めて大きな科学的価値を提供し得る。
倫理、データの利用可能性、方法論の透明性、再現可能性、実用上の重要性、利益相反もまた、読者が結果をどう用いるべきかに影響し得る。
QEDのエージェントはいくつかの関連要因を精査しているが、外部の人々にはそれらの重み付けについて、より高い可視性が必要だ。誤差分析、分野別のキャリブレーション、偽陽性の事例も求められる。
モデルの不透明性は運用上の疑問を生む。QEDは、そのアーキテクチャが複数の大規模言語モデルと独自モデルを組み合わせているとしている。
公開された方法論では、すべての基盤モデル、プロンプト、コンポーネントの重み、更新スケジュールが特定されていない。これらの詳細は再現可能性に影響し得る。
モデル提供者がシステムを変更すれば、同じ原稿でも異なる結果を受け取る可能性がある。重要な用途を支えるには、QEDはバージョン管理されたスコアリングと安定した監査記録を必要とする。
研究はすでに、LLM評価者が社会的バイアスを再現し得ることを示している。大規模な経済学実験では、9,030本の論文に対して27,090件の評価が生成された。
そのpeer-review experimentでは、モデルは品質を識別した一方で、有力な機関、男性著者、著名な経済学者を優遇する傾向が見られた。
QEDのブラインド入力は、こうした影響のいくつかを減らすはずだ。しかし、モデルが馴染み深い手法、人気のトピック、慣習的な論証構造に対する別の選好を学習していないかという問いには答えていない。
このシステムは、モデルにとって解析しやすい原稿を高く評価する可能性もある。主張構造が明確であることは望ましいが、読みやすさが証拠の強さを代替する見えない基準になってはならない。
敵対的な行動も別の懸念だ。著者がスコアリングシステムが何を評価するかを理解すれば、指標に合わせて原稿を最適化する者も現れる。
このパターンは、ランキングが注目を配分する場所ならどこでも見られる。検索エンジン、大学の指標、引用指標、ジャーナルのインパクトファクターはいずれも戦略的行動を促してきた。
したがって、公的なスコアには操作への耐性が必要だ。また、隠れたプロンプト、捏造された引用、重複した証拠、評価者に影響を与えるために設計された文体上の戦術を監視する必要もある。
こうした疑問に独立した回答が得られるまで、研究者はQEDを発見支援ツールとして扱うべきだ。高いスコアは論文をより早く読む理由にはなっても、より早く信じる理由にはならない。
逆も同様に重要だ。低いスコアによって、異例の研究が異議申し立ての手段や明確な説明なしに埋もれてはならない。
科学的主張を追跡するナレッジワーカーにとっては、ランキングを集めることよりも、情報源の文脈を維持することが重要だ。searchable knowledge baseは、論文、批評、更新、相反する証拠をまとめて保存できる。
このワークフローは、スコアを適切な役割に保つ。スコアは基礎となる研究から切り離された判定ではなく、情報源に付随する一つのフィルターとなる。
研究者が信頼すべきかを決める3つのシグナル
信頼は、独立した検証、分野をまたぐ安定した性能、そして科学者が判断を手放さずにスコアを利用するという証拠にかかっている。
第1のシグナルは、QED Scienceの外部にいる研究者が実施する前向きで事前登録された研究だ。独立チームは結果を見る前に評価基準を定義すべきである。
モデルも評価者もまだ見たことのない新しい原稿をテストすべきだ。研究には、出版済み論文、未出版論文、再現研究、ネガティブ結果、意図的に欠陥を含めた投稿を含める必要がある。
外部の専門家は、QEDのラベルを受け取らずに主張と証拠を評価すべきだ。その後、研究者はQEDを人間のパネル、ジャーナルの判断、再現の結果、その後の訂正と比較できる。
単一のベンチマークが完璧なグラウンドトゥルースを提供することはない。真に独立した指標間での一致は、企業主導の比較をもう一つ追加するよりも、QEDの主張を強く裏付けるだろう。
こうした条件下での失敗は、QEDが科学的品質の一般的に信頼できる尺度を提供するという主張を弱める。それでも、より限定的なトリアージ作業には有用であり続けるかもしれない。
第2のシグナルは、時間を通じて透明性を保った分野別の性能だ。QEDはすでに、分野ごとに0.39から0.78の相関を報告している。
今後のリリースでは、各分野について偽陽性のパターン、偽陰性のパターン、キャリブレーションのドリフト、スコアリングの変更を開示すべきだ。集計された精度は、専門領域での弱い性能を隠し得る。
バージョン管理は特に重要だ。すべてのスコアには、システムのバージョン、参照コーパス、評価日、ランキングをめぐる不確実性を示す必要がある。
研究者には、スコアを特定の主張や実験に結び付ける説明も必要だ。追跡可能な推論のないパーセンタイルでは、有意義な訂正を支えられない。
QEDが安定し再現可能な分野別結果を公表すれば、その主張はより強くなる。モデル変更後にスコアが密かに変動するなら、研究者はこのツールを非公式な発見用途に限定すべきだ。
第3のシグナルは、機関がランキングをどのように利用するかだ。閲読の推薦は、資金配分のスクリーニング、採用フィルター、臨床エビデンスの判断よりもリスクが低い。
科学者が見落とされた論文を発見するのに役立つツールは、権威バイアスを減らし得る。同じツールでも、機関がスコアを足切り基準として扱えば、アルゴリズムによる権威を生み出しかねない。
資金提供者やジャーナルがQEDを専門家レビューと併用するのか、それより前に使うのかを注視すべきだ。また、著者が誤りに異議を申し立て、改訂後に再スコアリングを受けられるかも見る必要がある。
最も健全な導入は、人間の責任を維持するものだろう。研究者はQEDを使って論文を特定し、その推論を精査したうえで、基礎となる証拠を評価する。
最も危険な導入は、パーセンタイルの背後に意思決定を隠すことだ。機関は、名前が削除されているためプロセスは中立だと主張しながら、研究を自動的に却下する可能性がある。
Natureの問いには条件付きの答えがある。研究者はQEDの推薦を試す程度には信頼すべきだが、科学的判断を外部委託するほど信頼すべきではない。
QEDは、現実に存在するボトルネックに対して信頼に足る応答を提示した。その規模、ブラインドスコアリング、主張レベルの分析は、慎重な独立検証に値する。
HorizonとNatureの議論には、いま企業外部からの証拠が必要だ。今後数カ月は、事前登録された再現研究、分野別のエラー報告、機関による利用状況の開示に注目したい。
QEDスコアは、最初に読むプレプリントを変えるだろうか。おそらく変えるべきだ。手法と証拠を確認せずに何を信じるかまで変えるだろうか。変えるべきではない。



