QED Science는 사전 공개 논문 상위 1%를 가려낼 수 있다고 주장한다. 연구자들은 이를 신뢰해야 할까?
QED Science는 생명과학 사전 공개 논문 57,455편의 순위를 매겨 그중 574편을 상위 1%로 선정했다. 그러나 이 AI가 과학적 품질을 어떻게 정의하는지를 둘러싼 의문은 여전히 해소되지 않았다.
이 텔아비브 스타트업은 저자, 소속, 인용 횟수, 학술지명을 보지 않은 채 독창성과 타당성을 평가한다고 말한다. 이 약속은 넘쳐나는 문헌을 탐색하기 위해 연구자들이 마지못해 활용해 온 명성 신호와 QED Score를 맞세운다.
Horizon Nature 보도가 제기하는 핵심 질문은 인공지능이 사람보다 논문을 더 빨리 읽을 수 있는지 여부가 아니다. 그것은 분명히 가능하다. 문제는 독립 연구자들이 그 가정을 충분히 검증하기 전에 독점적 점수가 신뢰할 수 있는 필터가 될 수 있느냐는 것이다.
QED Science는 1년치 사전 공개 논문을 하나의 순위 목록으로 만들었다
QED Science는 과학적 선별 작업을 읽기의 문제에서 순위의 문제로 바꿨다.
회사는 2026년 6월 24일 “The 1%”를 출시했다. 이 프로젝트를 12개월 동안 게시된 생명과학 사전 공개 논문 중 가장 독창적이고 과학적으로 타당한 연구를 선정한 목록이라고 설명한다.
QED는 2025년 5월부터 2026년 4월까지 bioRxiv에 제출된 원고 57,455편을 분석했다. 최종 목록에는 해당 평가 모집단의 상위 1%에 해당하는 574편이 포함됐다.
사전 공개 논문은 정식 학술지 동료 심사 전에 공개되는 원고다. 결과를 빠르게 유통할 수 있지만, 독자는 편집 심사와 연관된 보장 없이 증거를 평가해야 한다.
이러한 속도는 가치와 위험을 동시에 낳는다. 연구자들은 학술지 출판 수개월 전에 중요한 발견을 접할 수 있지만, 누구도 면밀히 모두 평가할 수 없을 만큼 많은 자료와 마주한다.
QED는 전체 자료를 통상적 방식으로 검토하려면 전문가 작업 시간 86만~103만 시간이 필요하다고 말한다. 회사의 검증 논문에 따르면 이는 연구자 400년 이상의 노동량에 해당한다.
이 시스템은 평가를 몇 시간 만에 완료했다. 이 차이는 특히 빠르게 변화하는 분야를 추적하는 연구비 지원기관, 연구팀, 기업에 매력적으로 다가오는 이유를 설명한다.
이 결과는 게재 승인 결정이 아니다. QED는 The 1%를 어떤 원고에 주목할지 결정하기 위한 초기 신호로 설명한다.
이 구분은 중요하다. 학술지 편집자는 수정 요청, 심사자 자문, 공개 사항 검토를 거쳐 치명적인 문제가 발견되면 논문을 거절할 수 있다. 점수는 다른 과정을 하나의 숫자로 압축한다.
QED의 공개 목록은 bioRxiv의 생명과학 분야 전반을 아우른다. 신경과학에서는 평가된 원고 11,058편 중 83편이 선정됐고, 세포생물학에서는 3,408편 중 55편이 선정됐다.
그 밖에 유전체학, 면역학, 미생물학, 암생물학, 생물정보학, 유전학, 합성생물학 등이 포함된다. 이 분포는 분야 규모와 QED의 평가를 함께 반영한다.
QED는 이 순위 프로젝트를 넘어선 도입 사례도 보고한다. 5월 31일 기준으로 자사 플랫폼이 70개국 이상, 1,500개 이상의 기관에 속한 1만 개 이상의 연구실에서 사용됐다는 것이다.
이 수치는 독립적인 사용 감사가 아니라 QED가 제시한 것이다. 그럼에도 AI 보조 원고 평가가 실험실 수준의 실험을 넘어 확산되고 있음을 보여준다.
따라서 Horizon Nature의 질문은 하나의 목록을 넘어선다. 연구자들이 QED를 읽을 논문, 인용할 논문, 지원할 연구, 개발할 기술을 선택하는 데 활용한다면, 그 판단은 동료 심사가 시작되기 전부터 관심의 흐름을 형성할 수 있다.
그것이 진정한 변화다. QED는 사전 공개 논문을 단순히 요약한 것이 아니다. 과학적 관심의 입구에 자동화된 관문을 제안했다.
Horizon Nature 논쟁이 지금 중요한 이유
연구가 등장하는 속도와 전문가가 이를 평가할 수 있는 속도 사이의 격차가 커지고 있기 때문이다.
사전 공개 논문 서버는 과학자들이 학술지의 전체 심사 주기를 기다리지 않고 연구 결과를 공유할 수 있게 한다. 이 모델은 연구자들이 새롭게 등장하는 생의학 증거에 빠르게 접근해야 했을 때 특히 두드러졌다.
하지만 익숙한 분류 장치도 사라졌다. 새로 게시된 bioRxiv 원고에는 최종 게재 학술지, 확립된 인용 기록, 완료된 동료 심사 이력이 없다.
연구자들은 불완전한 신호로 이를 보완한다. 연구실, 기관, 저자, 방법론, 주제 분야를 알아보고, 소셜 추천을 따르며, 전문 네트워크를 통해 부각되는 자료를 살핀다.
이런 습관은 시간을 절약할 수 있지만 명성 편향을 재생산할 수도 있다. 유명 기관의 연구는 낯선 연구 그룹의 동등하게 강력한 연구보다 더 쉽게 주목받는다.
QED는 이 약점을 겨냥한다. 출시 발표에 따르면 모든 원고는 채점 전에 익명화된다.
시스템은 저자명, 소속, 그 밖의 식별 정보를 제거한다. 인용 횟수, 출판 매체, 학술지 명성도 고려하지 않는다.
QED 공동 창립자이자 수석 과학자인 Oded Rechavi는 과학적 품질이 연구 자체를 통해 판단돼야 한다고 주장한다. 블라인드 평가는 명성이 증거를 대신하는 일을 막기 위한 것이다.
이 목표에는 신뢰할 만한 근거가 있다. 인간 심사는 기관의 위상, 직업적 관계, 언어, 중요한 연구를 누가 생산하는지에 대한 기대의 영향을 받을 수 있다.
그러나 익명성이 자동으로 중립성을 보장하지는 않는다. 원고에는 연구 주제, 장비, 데이터 세트, 문체, 참고문헌 등 출처에 관한 간접 신호가 담길 수 있다.
AI 모델 역시 학습 데이터에서 연관성을 물려받을 수 있다. 입력에서 기관명을 제거한다고 해서 모델 개발 과정에서 학습된 모든 관계가 사라지는 것은 아니다.
이전 연구는 이러한 구분이 왜 중요한지를 보여줬다. 2024년 한 연구는 서로 다른 소속을 붙인 의학 초록 30개를 GPT-3.5로 테스트했다.
연구진은 무작위 소속 조건에서 개별 리뷰 232,500건을 생성했다. 이들의 소속 편향 연구는 기관 정보가 모델의 판단에 영향을 미친다고 밝혔다.
QED의 익명화는 이 문제의 가장 직접적인 형태를 다룬다. 그러나 회사는 외부인이 남아 있는 모든 경로를 파악할 수 있을 정도의 시스템 세부 정보를 공개하지 않았다.
규모의 문제도 악화되고 있다. 생성형 AI는 기술 문서 초안 작성, 그럴듯한 인용 생성, 매끄러운 원고 작성에 필요한 노력을 줄였다.
그렇다고 AI 보조 논문이 모두 신뢰할 수 없다는 뜻은 아니다. 과학적 품질을 가늠하는 신호로서 표면적인 유창성이 더욱 약해졌다는 의미다.
bioRxiv 공동 창립자인 Richard Sever는 합성 과학 콘텐츠에 관한 보도에서 더 어두운 가능성을 설명했다. 인위적으로 만들어진 논문이 진정한 발견을 압도하면 사전 공개 논문 시스템은 사용하기 더 어려워진다.
그 환경에서 자동화된 평가는 거의 불가피해 보인다. 편집자와 과학자는 무제한으로 생성되는 기계 제작 투고에 무제한의 인간 심사로 대응할 수 없다.
QED는 그 대응의 한 가지 버전을 제시한다. AI를 이용해 모든 원고를 분해하고, 주장을 검증하며, 제한된 인간의 관심을 가장 강력한 후보에게 집중시키는 방식이다.
그 압박은 먼저 문헌 검토를 수행하는 연구자에게 가해진다. 또한 학술지 편집자, 연구비 지원기관, 생명공학팀, 초기 증거를 바탕으로 결정을 내리는 모든 이에게도 미친다.
이들은 더 빠른 필터링이 필요하다. 동시에 왜 논문이 필터를 통과했는지, 시스템이 무엇을 놓쳤는지, 오류가 얼마나 자주 반복되는지도 알아야 한다.
순위는 정보 과부하를 줄일 수 있지만 새로운 영향력 집중을 낳을 수도 있다. 하나의 점수가 널리 신뢰받게 되면, 채점 단계의 오류가 한 분야 전체의 관심을 다른 방향으로 돌릴 수 있다.
그래서 지금 이 논쟁이 등장했다. 과학 출판에는 기계 규모의 선별 작업이 필요하지만, 그러한 선별 작업을 검증하는 기준은 아직 정립되지 않았다.
QED Score는 동료 심사가 아니라 명성에 도전한다
QED에 대한 가장 강력한 근거는 동료 심사를 대체한다는 데 있지 않고, 학술지 순위보다 논문을 더 직접적으로 평가한다는 데 있다.
QED Score는 명시된 두 가지 차원을 평가한다. 독창성은 발견이 기존 지식을 얼마나 발전시키는지 측정하고, 타당성은 증거가 원고의 결론을 뒷받침하는지 측정한다.
회사는 다중 에이전트 아키텍처가 먼저 각 논문을 메타 주장, 주요 주장, 관련 주장, 이를 뒷받침하는 실험으로 분해한다고 말한다.
그다음 전문화된 AI 에이전트들이 서로 다른 특성을 병렬로 검토한다. 그림의 불일치, 통계적 취약점, 기존 문헌과의 충돌, 대안 가설, 보고 기준 문제 등을 찾는다.
검증 계층은 표시된 문제를 다시 확인한다. 채점 계층은 개별 주장에 점수를 매기고, 집계기는 그 평가를 보정된 백분위로 결합한다.
점수 80은 해당 원고가 기준 모집단의 80%보다 높은 순위를 기록했다는 뜻이다. 논문이 옳을 확률이 80%라는 뜻은 아니다.
복잡한 판단이 익숙한 숫자로 바뀌면 이 구분을 놓치기 쉽다. 백분위는 절대적 진실이 아니라 상대적 위치를 설명한다.
QED는 세 가지 연구에서 이 지표를 테스트했다. 첫 번째 연구는 분야 전문가들이 Limited, Satisfactory, Strong 범주로 분류한 185명 저자의 출판 논문 925편을 사용했다.
채점 파이프라인은 이 레이블을 받지 않았다. QED는 Limited 논문을 다른 범주와 구분할 때 곡선 아래 면적이 0.867이었다고 보고한다.
곡선 아래 면적, 즉 AUC는 시스템이 두 범주를 얼마나 잘 구별하는지 측정한다. 0.5는 우연 수준을, 1.0은 완벽한 분리를 나타낸다.
QED Scores와 학술지 순위 데이터를 모두 가진 795편의 논문에서 QED는 두 비교에서 더 강한 결과를 보고했다. Limited 논문을 식별할 때 0.804에 비해 0.863을 기록했다.
Strong 논문의 경우 결과는 훨씬 더 근접했다. QED는 0.782를 보고했으며, 학술지 순위 지표는 0.774였다.
두 번째 연구는 2025년 4월의 bioRxiv 사전 공개 논문 4,953편을 채점했다. QED는 이후 해당 논문들이 최종적으로 어디에 출판됐는지를 추적했다.
연구진은 학술지 순위가 연계된 출판본과 사전 공개 논문 2,879편을 매칭했다. QED는 사전 공개 논문 점수와 최종 학술지 순위 사이의 Spearman 상관계수가 0.63이라고 보고했다.
상관관계는 21개 분야에서 차이를 보였다. 유전학에서는 0.78에 도달했지만 시스템생물학에서는 0.39로 떨어졌다.
이런 차이는 주목할 만하다. 단일한 학제 간 백분위는 모델 성능, 증거 관행, 출판 행동의 의미 있는 차이를 가릴 수 있다.
세 번째 연구는 불일치에 초점을 맞췄다. QED는 자사 점수가 더 낮은 순위의 학술지에 게재된 논문을 선호한 논문 쌍 100개를 만들었다.
15명의 분야 전문가가 QED Scores나 게재 매체를 보지 않은 채 이 논문 쌍을 검토했다. 동점을 제외한 뒤 60건의 결정적 선택을 포함해 70건의 확신 있는 판단을 내렸다.
전문가들은 이 결정적 사례의 75%에서 QED가 선호한 논문을 선택했다. 보고된 95% 신뢰구간은 63%에서 84%였다.
이 결과는 게재 매체의 명성이 논문 수준의 품질을 잘못 나타낼 수 있다는 QED의 주장을 뒷받침한다. 그러나 인간의 판단 없이 QED가 진실을 식별할 수 있다는 점을 입증하지는 않는다.
게재 매체 역시 불편한 벤치마크다. 학술지 게재는 새로움, 편집 범위, 시점, 표현 방식, 심사자 가용성, 전략적 투고 선택에 따라 달라진다.
점수가 학술지 순위와 상관관계를 보인다는 사실은 기존 출판 결과와의 정합성을 검증할 수 있다. 그러나 그것만으로 시스템이 출판 시스템의 편향에서 벗어난다는 주장을 검증할 수는 없다.
QED는 중요한 경계를 인정한다. 방법론 문서는 The 1%가 동료 심사를 대체하는 것은 아니라고 밝힌다.
그것이 합리적인 관점이다. QED는 검토할 원고의 우선순위를 정할 수 있지만, 높은 백분위가 임상 결정을 정당화하거나 과학적 논쟁을 종결해서는 안 된다.
따라서 핵심 경쟁은 직접 평가와 명성에 기반한 추론 사이에 있다. QED는 독자들이 학술지의 명성을 빌려 판단하기보다 주장과 증거를 직접 검토해야 하는지 묻는다.
QED의 점수가 아직 완벽하지 않더라도 이 문제 제기는 유용하다. 학술지 브랜드는 언제나 여러 판단을 하나의 약식 신호로 압축해 왔고, 독자들은 이를 오용할 수 있다.
신중하게 검증된 AI 점수는 또 하나의 신호가 될 수 있다. 그러나 그것이 유일한 신호나, 대중적 책임성이 더 약한 새로운 명성의 표지가 되어서는 안 된다.
상위 1%라는 주장이 입증하지 못하는 것
QED의 내부 결과는 진지한 테스트를 정당화하지만, 아직 무조건적인 신뢰를 정당화하지는 않는다.
가장 큰 한계는 독립성이다. QED Science는 시스템을 개발하고, 검증을 설계하며, 방법론을 공개하고, 핵심 성능 수치를 보고했다.
기업 주도 연구도 가치 있는 증거를 제공할 수 있다. 하지만 제품의 상업적 가치가 동일한 성능 주장에 달려 있을 때는 독립적 재현이 필수적이다.
한 외부 검토는 세 건의 검증 연구 모두에서 약점을 지적했다. 이 비평은 또 다른 AI 기반 연구 평가 서비스를 통해 작성됐으므로, 결정적인 인간 재현 연구는 아니다.
그럼에도 제기된 질문은 구체적이다. 검토 보고서는 QED의 연구들이 완전히 독립적인 확인을 제공하기보다 서로 연관된 참조 신호를 공유한다고 주장한다.
첫 번째 연구는 전문가가 부여한 품질 범주에 의존한다. 두 번째 연구는 학술지 순위를 결과 지표로 사용한다. 세 번째 연구는 QED와 학술지 순위가 크게 엇갈리는 사례를 선택한다.
이 구조는 QED가 선택한 테스트에서의 일관성을 보여줄 수 있다. 그러나 외부 연구자가 정의한 전향적 의사결정에서 시스템이 어떻게 작동하는지는 여전히 열려 있다.
두 번째 연구는 학술지 순위 데이터가 있는 출판본과 사전공개 원고 4,953편 가운데 2,879편만 매칭했다. 즉 2,074편의 원고가 보고된 상관관계 분석에서 제외됐다.
매칭되지 않은 논문 중 일부는 이후 출판될 수도 있고, 필요한 지표가 없는 매체에 게재될 수도 있으며, 정식 출판에 이르지 못할 수도 있다. 이들의 제외는 겉으로 보이는 관계를 바꿀 수 있다.
출판은 무작위가 아니므로 선택 효과가 중요하다. 강한 연구가 미출판 상태로 남을 수 있는 반면, 약한 연구가 심사를 통과할 수도 있다.
세 번째 연구는 설득력 있는 불일치 데이터를 제공하지만, 의도적으로 이례적인 표본을 사용한다. 연구자들은 QED와 학술지 순위가 반대 방향을 가리키는 쌍을 선택했다.
이 설계는 관련성 있는 충돌을 검증한다. 하지만 일반적인 논문 전반에서 QED가 더 나은 선택을 하는 빈도를 추정하지는 않는다.
75% 선호 결과 역시 60건의 결정적 판단에서 나온 것이다. 이는 유익한 정보이지만, The 1%에 포함된 57,455편의 원고와 비교하면 작은 규모다.
선정 목록은 또 다른 문제를 제기한다. “상위 1%”는 객관적으로 들리지만, 여전히 QED의 코퍼스, 범주 처리 방식, 점수 산출 버전, 선택한 평가 차원에 상대적이다.
독창성과 타당성은 가치 있는 기준이다. 하지만 과학자들이 중요하게 여기는 모든 품질을 포괄하지는 않는다.
기술적으로 타당한 논문도 범위가 좁거나 중요성이 낮을 수 있다. 독창적인 논문도 취약한 측정에 의존할 수 있다. 재현 연구는 독창성이 제한적일 수 있지만, 막대한 과학적 가치를 제공할 수 있다.
윤리, 데이터 가용성, 방법론적 투명성, 재현 가능성, 실질적 중요성, 이해상충 역시 독자들이 결과를 활용하는 방식에 영향을 줄 수 있다.
QED의 에이전트는 여러 관련 요소를 검토하지만, 외부인은 이들 요소의 가중치에 대해 더 많은 가시성을 필요로 한다. 오류 분석, 분야별 보정, 거짓 양성 사례도 필요하다.
모델의 불투명성은 운영상의 질문을 낳는다. QED는 자사 아키텍처가 여러 대규모 언어 모델과 독점 모델을 결합한다고 말한다.
공개된 방법론은 모든 기반 모델, 프롬프트, 구성요소 가중치, 업데이트 일정을 밝히지 않는다. 이런 세부사항은 재현 가능성에 영향을 줄 수 있다.
모델 제공업체가 시스템을 변경하면 동일한 원고가 다른 결과를 받을 수 있다. 중요한 용도를 지원하려면 QED는 버전별 점수 체계와 안정적인 감사 기록이 필요하다.
연구는 이미 LLM 평가자가 사회적 편향을 재현할 수 있음을 보여줬다. 한 대규모 경제학 실험은 9,030편의 논문을 대상으로 27,090건의 평가를 생성했다.
그 동료평가 실험은 모델이 품질을 구분했지만, 저명한 기관, 남성 저자, 유명 경제학자를 선호한다는 사실을 발견했다.
QED의 블라인드 입력은 이러한 효과 중 일부를 줄여야 한다. 하지만 모델이 익숙한 방법론, 인기 있는 주제, 관습적인 논증 구조에 대한 다른 선호를 학습했는지에 대해서는 답하지 못한다.
시스템은 모델이 분석하기 쉬운 원고에 보상을 줄 수도 있다. 명확한 주장 구조는 바람직하지만, 가독성이 증거의 강도를 대체하는 보이지 않는 기준이 되어서는 안 된다.
적대적 행위도 또 다른 우려다. 저자들이 점수 시스템이 무엇에 보상하는지 이해하면, 일부는 그 지표에 맞춰 원고를 최적화할 것이다.
이런 패턴은 순위가 주목을 배분하는 곳마다 나타난다. 검색 엔진, 대학 지표, 인용 지표, 학술지 영향력 지수 모두 전략적 행동을 부추겨 왔다.
따라서 공개 점수는 조작에 대한 저항력이 필요하다. 또한 숨겨진 프롬프트, 조작된 인용, 중복 증거, 평가자에게 영향을 미치도록 설계된 문체 전략을 감시해야 한다.
이러한 질문들이 독립적인 답을 얻기 전까지 연구자들은 QED를 탐색 보조 도구로 취급해야 한다. 높은 점수는 논문을 더 빨리 읽어볼 이유가 될 수는 있어도, 더 빨리 믿을 이유가 되어서는 안 된다.
반대의 경우도 마찬가지로 중요하다. 낮은 점수가 이의 제기 경로나 명확한 설명 없이 비관습적 연구를 조용히 묻어버려서는 안 된다.
과학적 주장을 추적하는 지식 노동자에게는 순위를 모으는 것보다 출처 맥락을 유지하는 일이 더 중요하다. 검색 가능한 지식 기반은 논문, 비평, 업데이트, 상충하는 증거를 함께 보존할 수 있다.
이 워크플로는 점수를 본래의 역할에 머물게 한다. 점수는 기저 연구와 분리된 판정이 아니라 출처에 연결된 하나의 필터가 된다.
연구자들이 이를 신뢰해야 하는지를 결정할 세 가지 신호
신뢰는 독립적 검증, 분야 전반에서의 안정적인 성능, 그리고 과학자들이 판단을 포기하지 않고 점수를 사용하는지를 보여주는 증거에 달려 있다.
첫 번째 신호는 QED Science 외부 연구자들이 수행하는 전향적 사전등록 연구다. 독립 팀은 결과를 보기 전에 평가 기준을 정의해야 한다.
그들은 모델과 평가자 모두가 접한 적 없는 새로운 원고를 테스트해야 한다. 연구에는 출판 논문, 미출판 논문, 재현 연구, 부정적 결과, 의도적으로 결함을 넣은 제출물이 포함돼야 한다.
외부 전문가들은 QED의 라벨을 받지 않은 상태에서 주장과 증거를 평가해야 한다. 이후 연구자들은 QED를 인간 패널, 학술지 결정, 재현 결과, 이후의 정정과 비교할 수 있다.
단일 벤치마크가 완벽한 정답을 제공하지는 않는다. 진정으로 독립적인 지표들 사이의 일치는 또 한 번의 기업 주도 비교보다 QED의 주장을 더 강하게 뒷받침할 것이다.
그러한 조건에서의 실패는 QED가 과학적 품질을 전반적으로 신뢰할 수 있게 측정한다는 주장을 약화할 것이다. 그래도 더 좁은 선별 작업에는 유용할 수 있다.
두 번째 신호는 시간에 따른 투명한 분야별 성능이다. QED는 이미 학문 분야별 상관관계가 0.39에서 0.78까지라고 보고했다.
향후 공개에서는 각 분야의 거짓 양성 패턴, 거짓 음성 패턴, 보정 드리프트, 점수 변경을 공개해야 한다. 종합 정확도는 전문 영역에서의 약한 성능을 감출 수 있다.
버전 관리는 특히 중요하다. 모든 점수에는 시스템 버전, 참조 코퍼스, 평가 날짜, 순위의 불확실성이 명시돼야 한다.
연구자들은 점수를 특정 주장과 실험에 연결하는 설명도 필요로 한다. 추적 가능한 추론이 없는 백분위는 의미 있는 정정을 뒷받침할 수 없다.
QED가 안정적이고 재현 가능한 분야별 결과를 공개한다면, 그 주장은 더 강해질 것이다. 모델 변경 후 점수가 조용히 바뀐다면 연구자들은 이 도구를 비공식적 탐색 용도로 제한해야 한다.
세 번째 신호는 기관이 이 순위를 어떻게 사용하는지다. 읽을거리 추천은 연구비 심사, 채용 필터, 임상 증거 결정에 비해 위험도가 낮다.
과학자들이 간과된 논문을 발견하도록 돕는 도구는 명성 편향을 줄일 수 있다. 같은 도구도 기관이 점수를 기준선으로 취급하면 알고리즘적 명성을 만들 수 있다.
연구비 제공기관과 학술지가 QED를 전문가 검토와 함께 사용하는지, 아니면 그 전에 사용하는지 살펴봐야 한다. 저자들이 오류에 이의를 제기하고 수정 후 재평가를 받을 수 있는지도 지켜봐야 한다.
가장 건전한 도입은 인간의 책임을 보존할 것이다. 연구자들은 QED를 이용해 논문을 찾고, 그 추론을 검토한 뒤, 기저 증거를 평가할 것이다.
가장 위험한 도입은 백분위 뒤에 결정을 숨기는 방식이다. 기관은 이름이 제거됐으므로 절차가 중립적이었다고 주장하면서 연구를 자동으로 거절할 수 있다.
Nature의 질문에는 조건부 답이 있다. 연구자들은 QED의 추천을 시험해 볼 만큼은 신뢰해야 하지만, 과학적 판단을 외주 맡길 만큼 신뢰해서는 안 된다.
QED는 실제 병목 현상에 대해 신뢰할 만한 대응을 제시했다. 그 규모, 블라인드 점수 산정, 주장 수준 분석은 신중한 독립 검토를 받을 가치가 있다.
이제 Horizon Nature 논쟁에는 회사 외부의 증거가 필요하다. 향후 몇 달 동안 사전등록된 재현 연구, 분야별 오류 보고, 공개된 기관 사용 사례를 주시해야 한다.
QED 점수가 가장 먼저 읽을 사전공개 원고를 바꿀까? 아마 그래야 할 것이다. 방법과 증거를 확인하지 않은 채 무엇을 믿을지를 바꿀까? 그래서는 안 된다.



