top of page

NeurIPS論文リストが早期に出現。採択結果の漏えいを証明するものではない

カンファレンスの進行がまだ完了していないにもかかわらず、GitHub上のファイルにおよそ7,000本の論文が含まれているように見えたことで、NeurIPSは情報漏えい疑惑の対象となった。一部のエントリーには詳細なメタデータが含まれると報じられる一方、匿名化されているものもある。この組み合わせが、同ファイルは採択されたNeurIPS 2026論文を明らかにしているのではないかという憶測を呼んだ。

現時点で入手できる証拠が支持する結論は、より限定的だ。この問題を提起した人物によれば、大規模で一見正確な論文リストは存在する。しかし、ファイルの規模も詳細なエントリーも、それが採択決定を含むことの証明にはならない。

この区別は重要である。カンファレンスのシステムには、重なり合う複数のデータセットが存在する。リストは投稿論文、公開フォーラムの記録、スクレイピングされたメタデータ、取り下げ論文、あるいは非公式のスナップショットを表している可能性がある。それぞれは著者や査読者に異なる意味を持つ。

元の議論では、リストが異例なほど早く公開されたことから、その正当性が問われている。投稿は、問題となっているHTMLファイルを含むGitHubリポジトリを指している。投稿自体は、NeurIPSの声明、内部データベースの記録、あるいは独立して検証された採択フィールドを示していない。

このため、警戒すべき解釈と、はるかに劇的ではない説明との間に隔たりがある。リポジトリは注目を集めるに足るほど具体的に見えるが、公に説明された証拠はその中心的な主張を立証していない。

NeurIPSファイルが実際に示すこと

このリポジトリが示しているのは、誰かが大規模な論文リストを作成したということであり、NeurIPSが採択決定を公開したということではない。

Redditの投稿は、およそ7,000本の論文を含むHTMLファイルについて説明している。一部の論文は匿名化され、他の詳細情報は正確に見えるとしている。これらの観察が、この論争の事実的な基盤である。

しかし、それらはファイルの作成方法を明らかにしない。リポジトリには、公開ページから収集されたスナップショット、別のデータセットからのエクスポート、または複数の情報源を組み合わせた記録が含まれている可能性がある。無許可の情報を含む可能性もあるが、その結論には追加の証拠が必要となる。

投稿論文と採択論文の違いは、とりわけ重要である。主要な機械学習カンファレンスには、最終プログラムに入らない多数の投稿が寄せられる。タイトル、要旨、識別子、著者情報を含むファイルであっても、より早い段階を表している可能性がある。

本物の採択データセットには、決定に固有の証拠が含まれているはずだ。たとえば公式の決定ラベル、発表の割り当て、カメラレディ版のステータス、または公式プログラムとの直接的な一致が挙げられる。公に説明された主張は、それらのシグナルのいずれも確立していない。

したがって、「accepted」という言葉は、証拠が許容する以上の確実性を伴う。早期のリストは論文記録の集合としては実在し得る一方、カンファレンスの採択一覧としては誤っている可能性がある。

リポジトリのファイル名も、認証の根拠にはほとんどならない。誰でもカンファレンスの略称と年を使ってGitHubプロジェクトを作成できる。もっともらしい名称は、NeurIPSとの公式な関係を生み出すものではない。

Gitの履歴は有用な手がかりを与え得るが、それだけで出所を証明することはできない。調査者は最初のコミット、その後の改訂、削除されたファイル、貢献者の身元、タイムスタンプを調べるべきだ。非公開の節目の後に突然追加されたものは、より慎重な精査に値する。

ファイル構造も重要である。公開記録から生成された静的HTMLページには、多くの場合、予測可能なURL、フォーラム識別子、またはシリアライズされたフィールドが残る。内部エクスポートには、公開ページに決して表示されない運用上のフィールドが含まれている可能性がある。

こうした指標にも慎重さが必要だ。スクレイパーは、すでに公開インターフェースを通じて露出していた内部的に見える識別子を保持できる。逆に、誰かがカンファレンスのデータベースに似たフィールドを捏造することもできる。

匿名化されたエントリーと特定可能なエントリーが混在しているとの報告は示唆的だが、結論を出せるものではない。カンファレンスの記録は複数の公開状態を経ることがある。取り下げ、著者による編集済みページ、公開プレプリント、開示設定の変更により、不均一なデータセットが生じ得る。

著者は関連バージョンをarXiv、GitHub、所属機関のページ、個人サイトにも投稿する。収集者は、完全に同一の表現や特徴的な実験の詳細を手がかりに、匿名化されたカンファレンスのタイトルを公開原稿と結び付けられる場合がある。

この種の照合により、データセットが公開情報源から作成された場合でも、特権的な情報に見えることがある。また、カンファレンス自体が何かを公開したかどうかにかかわらず、査読中の匿名性を損なう可能性もある。

したがって中心的な問いは、タイトルがもっともらしく見えるかどうかではない。収集時点で、リポジトリに正当な公開情報源からは入手できない情報が含まれているかどうかである。

この問いに文書化された回答が得られるまでは、このファイルを採択結果の漏えいと呼ぶことは、判明している事実を超えた表現となる。

決定前に7,000本の論文リストが現れ得る理由

最終プログラムが存在するずっと前に、大規模カンファレンスのデータセットが公開投稿インフラから生じることはあり得る。

NeurIPSは、投稿、査読、議論、決定を調整するためにデジタルシステムを利用している。これらのシステムは、採択論文がカンファレンスプログラムの一部になる前に、記録と識別子を割り当てる。

学術的なピアレビューに使われるプラットフォームであるOpenReviewは、記録をノート、招待、グループ、フォーラムとして整理する。フォーラムには投稿論文と関連する議論を格納できるが、それは採択を意味するものではない。

このアーキテクチャは重要な区別を生む。論文記録の存在は、ワークフローの何らかの段階への参加を証明する。権威ある決定記録がそう示さない限り、論文の最終的な結果を特定するものではない。

公式のカンファレンス募集要項は、関連するプロセスの文脈を提供している。対応するOpenReviewの会場ページは、公開記録や公式な公開状態の変更を確認するうえで、より確かな場所である。

第三者によるHTMLファイルは、この権威の連鎖の外側にある。正当なメタデータを複製しつつ、元の情報源が提供していないラベル、並び替え、または結論を加えることができる。

このため、複数のエントリーが正確に見えることは決定的ではない。公開情報から生成されたリストは、ほとんどのフィールドが本物の記録に由来するため、しばしば正確に見える。争点となる部分は、推定に基づく列や見出し一つだけかもしれない。

単純なスクレイパーでも、人が確認できるより速く数千ページを収集できる。また、基盤となるプラットフォームの並び順、識別子、書式を保持することもできる。

収集者はその後、プレプリント、著者プロフィール、研究室のページ、検索結果で記録を補強するかもしれない。そのような補強は、一部のエントリーが著者の詳細を示す一方、他が匿名のままである理由を説明し得る。

その結果できたファイルは、採択決定へのアクセスを必要とせずに、内部のカンファレンス一覧に似たものとなる。その規模は特権的アクセスではなく、自動化を反映している。

匿名性に一貫性がないことには、無害な理由もある。一部の著者は投稿論文を公に宣伝する。他の著者は実名で対応する草稿をアップロードする。特定のタイトルには、容易な相互参照を可能にするほど特徴的な表現が含まれている。

取り下げられた投稿や改訂済みの投稿も、さらなる不一致を生む可能性がある。検索インデックスやキャッシュされたページは、ライブページが変更された後も以前のメタデータを保存していることがある。

これらの説明はいずれも、争点のリポジトリの出所として確認済みのものと扱うべきではない。どの説明を決定的なものとするにも、リポジトリには再現可能な出所分析が必要である。

しかし、それらは「公開情報にしては詳細すぎる」という見方が十分な検証基準ではない理由を示している。公開されている学術メタデータは、カンファレンスプラットフォーム、プレプリントサーバー、コードリポジトリ、個人ページに分散している。

エントリー数も同様に弱い証拠である。数千件の記録は、特に主要カンファレンスにおいて投稿プールと整合する。件数が多いからといって、投稿が採択へと変わるわけではない。

有用な検証としては、安定した識別子を用いてリポジトリを公開会場と照合する方法がある。リポジトリ内のほぼすべての項目が公開投稿記録に対応するなら、スクレイピングという説明の説得力が増す。

次に研究者は、採択決定とされるフィールドを権威ある決定ノートと比較すべきだ。そのようなフィールドが存在しなければ、採択という主張は根拠を失う。

コミットのタイミングも可能性を絞り込める。決定段階より前に収集された記録は、収集者が別途アクセスを得たか予測を行ったのでない限り、後の結果を信頼性高く符号化することはできない。

予測も見落とされがちな可能性である。リポジトリは、査読スコア、議論のシグナル、または著者の評判を用いて論文を順位付け・分類している可能性がある。そのような推定は、カンファレンスの決定データベースに由来しなくても、後から正確に見えることがある。

そのプロセスが匿名性を損なうなら、依然として倫理上の懸念を生む。しかし、それは採択論文が漏えいしたことの証明にはならない。

本当の対立は証拠と推論の間にある

この論争は、警戒すべき推論を、それを支える限られた証拠から切り離せるかどうかを問うている。

この主張の最も強い形は、誰かが採択済みNeurIPS論文の機密リストを入手したというものだ。この解釈は、決定の早期開示と、潜在的な無許可アクセスを意味する。

より弱い形の主張は、公式プログラムが現れる前に、誰かがNeurIPS関連論文の大規模なリストを作成したというものだ。これには公開情報のスクレイピング、データの補強、または不確実な分類が関わっている可能性がある。

どちらの説明でも、印象的なHTMLファイルは作り得る。機密の採択データ侵害を必要とするのは前者だけである。

これが、リポジトリをめぐる主要な緊張関係である。ファイルが一見具体的であるため、読者はより強い解釈が確立済みであるかのように扱いやすい。現時点の検証記録が支持するのは、より弱い観察にとどまる。

信頼できる確認には、3つの問いへの回答が必要だ。第一に、ファイルには明示的な決定情報が含まれているか。第二に、その情報は収集時に非公開だったか。第三に、その出所を権威あるシステムまでたどれるか。

Redditの投稿だけでは、そのいずれにも答えられない。投稿は発見を報告し、コミュニティに検証を求めている。それは調査を始める適切な理由にはなるが、漏えいを断定する根拠にはならない。

リポジトリの管理者は、データソースと生成方法を公開することで状況を明確にできる。再現可能なスクリプトがあれば、すべてのフィールドが公開エンドポイントに由来するかを他者が判断できる。

NeurIPSまたはOpenReviewは、より権威ある回答を提供できる。外部の観察者には利用できないアクセスログ、公開ルール、内部記録と、争点のフィールドを比較できるためだ。

公式の否定にも解釈が必要である。採択決定は公開されていないという声明は、見出しとなっている主張に対応する。一方で、著者情報や非公開メタデータがどのように可視化されたかを、必ずしも説明するものではない。

同様に、リポジトリの削除は告発の証明にはならない。管理者はプライバシー上の懸念、プラットフォームの規則、法的な不確実性、または望まない注目を理由に、コレクションを削除する場合がある。

GitHubの削除通知からは、苦情を申し立てた当事者や法的根拠が判明することがある。しかし、文書がないままリポジトリが消えているというだけでは、ほとんど何も語らない。

独立した研究者は、分析に必要な最小限の証拠のみを保存すべきです。完全なデータセットを再公開すると、特に匿名投稿と実名の著者を結び付ける場合、被害を拡大させるおそれがあります。

この自制は、単なる学術上の礼儀ではありません。匿名査読は、査読者が研究を評価する間、評判による影響を抑えることを目的としています。意思決定が確定する前に匿名性が失われれば、その均衡は変わり得ます。

この状況は著者にとって誤情報のリスクも生みます。論文が非公式のリストに掲載されていることが採択と解釈されるかもしれません。掲載されていないことが不採択と解釈される可能性もあります。

公式決定がない限り、どちらの推論も安全ではありません。研究者は、学会の権限を持たないラベルに基づいて、渡航、広報、採用、リリースの計画を立ててしまう可能性があります。

大学や研究所は、個々のエントリーを確定結果として拡散することを避けるべきです。広報チームは、公式の著者通知またはプログラム公開を待つべきです。

査読者には別のリスクがあります。割り当てられた論文をリポジトリで検索すると、査読プロセスが隠すことを意図した身元が露出する可能性があります。また、外部情報に関する学会の期待に反するおそれもあります。

問われるべき基準は、好奇心を持つ読者がファイルにアクセスできるかどうかではありません。その利用や拡散が、査読プロセスと、そこに研究が掲載されている人々を尊重しているかどうかです。

NeurIPSは、研究行為と学会参加に関する出版倫理リソースを維持しています。公式なインシデント対応ガイダンスが出た場合は、コミュニティのスレッド上の憶測より優先されるべきです。

したがって、慎重な結論は明確です。リポジトリを調査するだけの証拠はありますが、確認済みの採択情報流出と呼ぶには証拠が不十分です。

実際のNeurIPS情報流出が危険にさらすもの

確認された情報流出は、査読の健全性、著者のプライバシー、そして学会の意思決定プロセスへの信頼を脅かすでしょう。

匿名査読は、すべての著者が特定不能であることを保証するものではありません。評価中の無関係な影響を減らすための手続き上の障壁を設けるものです。

匿名投稿と著者を体系的に結び付けるデータセットは、その障壁を弱めます。査読者は評価を終える前に、所属機関の威信、過去の評価、または個人的な関係に触れる可能性があります。

悪意ある行為がなくても、その露出は影響し得ます。著者に関する知識は、新規性、正確性、重要性への期待を無意識のうちに左右する可能性があります。

決定の早期開示は、別の種類の被害を生みます。著者は、正しいステータスおよび付随する条件とともに、公式チャネルを通じて結果を受け取るべきです。

非公式リストには、改訂、条件付きの結果、事務上の保留、訂正が含まれていない可能性があります。そのため、無許可であると同時に不正確であることもあり得ます。

学会側も運用上の圧力に直面します。主催者は、アクセス制御の監査、ログの確認、エクスポートの比較、影響を受けた参加者への通知、虚偽の主張の訂正を行う必要があるかもしれません。

OpenReviewには、メタデータの可視性が会場で設定されたポリシーと一致していたかという疑問が向けられるでしょう。証拠次第で、こうした疑問は実装、設定、またはデータ再利用に関するものになります。

リポジトリのホストは、プライバシーに関する苦情やポリシー違反を評価する必要があるかもしれません。その手続きは学術的な真実を決定するものではありませんが、ファイルへの継続的なアクセスに影響する可能性があります。

最も直接的な圧力を受けるのは著者です。自身の研究を含む可能性があるデータセットを確認するか、無視するか、報告するか、公に議論するかを判断しなければなりません。

最も安全な対応は、非公式なラベルを決定として扱わないことです。著者は、コレクション全体を再配布せずに、関連するURL、コミット識別子、スクリーンショットを記録できます。

真に非公開の情報を見つけた人は、学会の公式連絡先に簡潔な報告を送るべきです。どのフィールドが非公開と思われるのか、また公開情報ではなぜ説明できないのかを説明すべきです。

有用な報告は、観察と結論を区別します。「このエントリーには公開フォーラムでは見えない決定ラベルが含まれている」は、「学会がハッキングされた」よりも対応可能性の高い表現です。

セキュリティチームには再現可能な詳細が必要です。また、主催者が発生源を把握する前に広範な再投稿が露出を拡大し得るため、報告者の自制も必要です。

ファイルに公開記録から組み立てられた投稿のみが含まれている場合、問題の深刻度は下がります。それでも、そのシナリオは大量収集と匿名性の解除に関する疑問を提起します。

情報が公開されているからといって、倫理上の懸念が自動的になくなるわけではありません。散在する情報を組み合わせることで、単一の情報源では観察しにくかった関係が明らかになる可能性があります。

学会ページからコピーされたタイトルは公開情報かもしれません。同じタイトルが実名付きのプレプリントにあれば、それも公開情報かもしれません。両者を結び付けることで、査読期間中に期待される実質的な匿名性が損なわれる可能性があります。

これは「集約効果」と呼ばれることがあります。一見無害な記録も、大規模にリンクされるとセンシティブなものになります。

機械学習は、そのような照合を容易にします。埋め込みモデルは言い換えられたタイトルや要旨を照合でき、検索ツールはプロジェクトページ、コード、プレプリントを結び付けられます。

こうした手法は、非公開データベースへのアクセスを必要としません。それでも、隠されていた身元を明らかにするため、参加者が情報流出と認識する地図を作り出す可能性があります。

この可能性は、ポリシー上の課題を変えます。著者が他所で非常に類似した版を公開している場合、アクセス制御だけでは匿名性を維持できません。

学会は、オープンな科学コミュニケーションと匿名査読の公平性目標のバランスを取らなければなりません。著者にも、プレプリント、発表、コード公開、一般向けのプロモーションに関する、より明確なガイダンスが必要です。

したがって、問題となっているファイルは、採択データベースが侵害されていなかったとしても、より広範な弱点を示しています。学会の匿名性は、隠された著者フィールドだけでなく、ますます規範とタイミングに依存しています。

最も適切な組織的対応は、両方の側面を説明するものでしょう。主催者は、決定が流出したかどうかと、公開メタデータが大規模な身元照合を可能にしたかどうかの両方に対処すべきです。

この区別がなければ、限定的な否定は正当なプライバシー懸念を未解決のままにする可能性があります。過度に広い侵害主張も、不必要な不安を生む可能性があります。

情報流出の主張が成り立つかを決める3つのシグナル

次に信頼できる証拠は、来歴、公式検証、最終プログラムとの比較から得られるはずです。

最初のシグナルは、リポジトリがどのように生成されたかについて文書化された説明です。それは管理者、再現可能な収集ツール、またはGit履歴に対する独立したフォレンジックレビューから得られる可能性があります。

公開情報源によるパイプラインであれば、採択情報流出の主張は弱まります。隠されたエンドポイント、非公開の認証情報、または公開記録から利用できないフィールドがあれば、無許可アクセスへの懸念は強まります。

重要なのは再現可能性です。調査者は、説明されていない手作業に依存せず、代表的なエントリーを情報源からHTML出力まで追跡できるべきです。

2つ目のシグナルは、NeurIPSまたはOpenReviewによる直接の声明です。最も有用な声明は、決定データ、著者の匿名性、関連記録の設定済み可視性に言及するものです。

システムが安全であるという一般的な保証だけでは、明確さに欠けます。この論争は特定のフィールドと時期に関するものなので、有意義な回答はそれらの詳細に対処すべきです。

決定ラベルが露出していたことの確認は、情報流出という解釈を大きく強めます。ファイル内に決定情報が存在しなかったことが確認されれば、他のプライバシー問題が残っていたとしても、その解釈は弱まります。

3つ目のシグナルは、後に公式結果と比較することです。NeurIPSが権威ある決定または最終プログラムを公開すれば、研究者はそのリストが実際に採択を予測していたかを測定できます。

その比較では、公式結果の前に入手可能だったリポジトリ版を使う必要があります。後からの編集が結果を汚染する可能性があるためです。

一致率が高いだけでも、分析が必要です。ファイルにすべての投稿が含まれていた場合、採択論文がその中に現れるのは当然です。掲載されていることは予測を示すものではありません。

調査者は、結果が公開される前にリポジトリが採択論文と不採択論文を区別していたかを検証しなければなりません。また、偽陽性、欠落エントリー、取り下げ、その後の修正も評価すべきです。

ここでは、正確な表現が最も重要です。「論文リスト」と「採択論文リスト」は、数千件のタイトルを共有していても異なる成果物です。

読者は、リポジトリが安定しているかどうかも注視すべきです。削除されたファイル、書き換えられた履歴、新たな説明文書は、管理者が精査にどう対応しているかを示す可能性があります。

変更は、リポジトリの扱いに関する証拠であり、学会への侵害を自動的に示す証拠ではありません。各変更はタイムスタンプとともに保存し、慎重に解釈する必要があります。

開発者や研究チームにとって、当面の教訓は情報源に対する規律です。機械可読な記録は、構造化され、広範で、内部的に整合しているため、権威があるように見えることがあります。

しかし、こうした特徴は来歴を証明しません。洗練されたデータセットであっても、本物のメタデータと、裏付けのない結論を組み合わせている可能性があります。

同様の主張を評価するナレッジワーカーは、情報源を保存し、観察されたフィールドと推測された意味を分け、権威ある確認を待つべきです。検索可能な調査記録があれば、後の訂正が容易になります。

NeurIPSの事案は、利用可能な公開証拠の範囲では未解決のままです。問題のファイルは技術的な検証に値しますが、「採択論文が流出した」という見出しは未確認です。

このリストを使って結果を発表したり、不採択を推測したり、匿名著者を特定したり、裏付けのない非難で学会主催者に圧力をかけたりしてはいけません。代わりに、リポジトリの来歴、公式回答、そして最終的な決定との比較を見守るべきです。

この3つのシグナルによって、話を憶測の域から進めることができます。それらが得られるまでは、責任ある説明はシンプルです。非公式なNeurIPS論文コレクションが早期に登場しましたが、それが実際の採択決定とどのような関係にあるかは確立されていません。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page