top of page

QED Science twierdzi, że potrafi wskazać najlepszy 1% preprintów. Czy badacze powinni mu zaufać?

11 sie
11 minut(y) czytania

QED Science sklasyfikowało 57 455 preprintów z nauk o życiu i wybrało 574 do swojego najlepszego 1%, mimo nierozstrzygniętych pytań o to, jak jego AI definiuje jakość naukową.

Startup z Tel Awiwu twierdzi, że jego system ocenia oryginalność i wiarygodność, nie widząc autorów, afiliacji, liczby cytowań ani nazw czasopism. Ta obietnica przeciwstawia QED Score sygnałom prestiżu, których badacze już używają — często niechętnie — aby poruszać się po przytłaczającej literaturze.

Kluczowe pytanie, które wynika z materiału Horizon Nature, nie brzmi, czy sztuczna inteligencja potrafi czytać artykuły szybciej niż ludzie. Oczywiście, że potrafi. Chodzi o to, czy zastrzeżona punktacja może stać się godnym zaufania filtrem, zanim niezależni badacze w pełni sprawdzą jej założenia.

QED Science zamieniło rok preprintów w jedną listę rankingową

QED Science przekształciło naukową selekcję wstępną z problemu czytania w problem rankingu.

Firma uruchomiła „The 1%” 24 czerwca 2026 roku. Opisuje projekt jako wybór najbardziej oryginalnych i naukowo wiarygodnych preprintów z nauk o życiu opublikowanych w okresie 12 miesięcy.

QED przeanalizowało 57 455 manuskryptów przesłanych do bioRxiv między majem 2025 a kwietniem 2026 roku. Końcowa kolekcja zawiera 574 artykuły, co odpowiada najlepszemu 1% ocenionej populacji.

Preprint to manuskrypt udostępniony przed formalną recenzją naukową w czasopiśmie. Może szybko rozpowszechniać wyniki, ale czytelnicy muszą oceniać dowody bez pewności związanej z oceną redakcyjną.

Ta szybkość tworzy zarówno wartość, jak i ryzyko. Badacze mogą zetknąć się z ważnymi ustaleniami na wiele miesięcy przed publikacją w czasopiśmie, ale jednocześnie mają do czynienia z większą liczbą materiałów, niż jedna osoba jest w stanie dokładnie ocenić.

QED twierdzi, że konwencjonalna ocena całego jego korpusu wymagałaby od 860 000 do 1 030 000 godzin pracy ekspertów. Według artykułu walidacyjnego firmy odpowiada to ponad 400 osobolatom pracy badawczej.

Jego system ukończył oceny w ciągu kilku godzin. Ta różnica wyjaśnia atrakcyjność rozwiązania, zwłaszcza dla grantodawców, zespołów badawczych i firm monitorujących szybko rozwijające się dziedziny.

Wynik nie jest decyzją o akceptacji. QED opisuje The 1% jako wczesny sygnał pomagający zdecydować, które manuskrypty zasługują na uwagę.

To rozróżnienie ma znaczenie. Redaktor czasopisma może zażądać poprawek, skonsultować się z recenzentami, sprawdzić ujawnienia i odrzucić artykuł po wykryciu krytycznego problemu. Punktacja sprowadza inny proces do jednej liczby.

Publiczna lista QED obejmuje kategorie nauk o życiu w bioRxiv. Neurobiologia dostarcza 83 wybrane artykuły spośród 11 058 ocenionych manuskryptów, podczas gdy biologia komórki — 55 spośród 3 408.

Pozostałe kategorie obejmują genomikę, immunologię, mikrobiologię, biologię nowotworów, bioinformatykę, genetykę i biologię syntetyczną. Rozkład odzwierciedla zarówno wielkość dziedzin, jak i oceny QED.

QED informuje również o zastosowaniu poza projektem rankingowym. Na dzień 31 maja jego platforma obsługiwała ponad 10 000 laboratoriów w ponad 1 500 instytucjach w przeszło 70 krajach.

Dane te pochodzą od QED, a nie z niezależnego audytu wykorzystania. Mimo to pokazują, że wspomagana przez AI ocena manuskryptów wykracza poza eksperyment laboratoryjny.

Pytanie Horizon Nature wykracza zatem poza jedną listę. Jeśli badacze używają QED, aby wybierać, co czytać, cytować, finansować lub rozwijać, jego osądy mogą kształtować uwagę jeszcze przed rozpoczęciem recenzji naukowej.

To jest rzeczywista zmiana. QED nie tylko podsumowało preprinty. Zaproponowało zautomatyzowaną bramkę u wejścia do naukowej uwagi.

Dlaczego debata Horizon Nature ma teraz znaczenie

Presja wynika z rosnącej przepaści między tempem pojawiania się badań a tempem, w jakim eksperci mogą je oceniać.

Serwery preprintów pozwalają naukowcom udostępniać wyniki bez czekania na pełny cykl recenzji czasopisma. Model ten stał się szczególnie widoczny, gdy badacze potrzebowali szybkiego dostępu do pojawiających się dowodów biomedycznych.

Usunął też znany mechanizm sortowania. Nowo opublikowany manuskrypt w bioRxiv nie ma ostatecznego miejsca w czasopiśmie, ugruntowanego dorobku cytowań ani ukończonej historii recenzji naukowej.

Badacze rekompensują to niedoskonałymi sygnałami. Rozpoznają laboratoria, instytucje, autorów, metody i obszary tematyczne. Kierują się rekomendacjami społecznymi i sprawdzają to, co zyskuje rozgłos w sieciach zawodowych.

Takie nawyki mogą oszczędzać czas, ale mogą też odtwarzać uprzedzenia związane z prestiżem. Praca ze słynnej instytucji łatwiej przyciąga uwagę niż równie mocna praca nieznanej grupy.

QED celuje w tę słabość. Jego ogłoszenie premiery mówi, że każdy manuskrypt jest anonimizowany przed oceną.

System usuwa nazwiska autorów, afiliacje i inne informacje identyfikujące. Ignoruje także liczbę cytowań, miejsca publikacji i reputację czasopism.

Oded Rechavi, współzałożyciel i główny naukowiec QED, argumentuje, że jakość naukową należy oceniać na podstawie samej pracy. Ślepa ocena ma zapobiegać zastępowaniu dowodów reputacją.

Cel ten ma wiarygodne podstawy. Na ludzką ocenę mogą wpływać status instytucjonalny, relacje zawodowe, język oraz oczekiwania dotyczące tego, kto tworzy ważne prace.

Anonimowość nie tworzy jednak automatycznie neutralności. Manuskrypt może zawierać pośrednie sygnały dotyczące jego pochodzenia, w tym tematy badawcze, sprzęt, zbiory danych, wzorce pisania i odniesienia.

Model AI może również dziedziczyć skojarzenia ze swoich danych treningowych. Usunięcie nazwy instytucji z danych wejściowych nie usuwa wszystkich relacji poznanych podczas rozwoju modelu.

Wcześniejsze badania pokazały, dlaczego to rozróżnienie ma znaczenie. Badanie z 2024 roku przetestowało GPT-3.5 na 30 abstraktach medycznych zestawionych z różnymi afiliacjami.

Badacze wygenerowali 232 500 indywidualnych recenzji w losowo przydzielonych warunkach afiliacyjnych. Ich badanie stronniczości afiliacyjnej wykazało, że informacje instytucjonalne wpływały na oceny modelu.

Anonimizacja QED odnosi się do najbardziej bezpośredniej wersji tego problemu. Firma nie ujawniła jednak publicznie wystarczającej liczby szczegółów systemu, aby osoby z zewnątrz mogły zmapować wszystkie pozostałe ścieżki.

Problem skali również się nasila. Generatywna AI zmniejszyła wysiłek potrzebny do przygotowania tekstu technicznego, tworzenia wiarygodnie wyglądających cytowań i produkowania dopracowanych manuskryptów.

Nie oznacza to, że każdy artykuł wspomagany przez AI jest niewiarygodny. Oznacza to, że powierzchowna płynność językowa stała się jeszcze słabszym sygnałem jakości naukowej.

Richard Sever, współzałożyciel bioRxiv, opisał w relacjach dotyczących syntetycznych treści naukowych ciemniejszą możliwość. Systemy preprintów stają się trudniejsze w użyciu, gdy spreparowane artykuły przytłaczają autentyczne ustalenia.

Zautomatyzowana ocena wydaje się niemal nieunikniona w takim środowisku. Redaktorzy i naukowcy nie mogą odpowiadać na nieograniczoną liczbę zgłoszeń generowanych przez maszyny nieograniczoną pracą ludzkich recenzentów.

QED oferuje jedną wersję odpowiedzi: wykorzystać AI do rozłożenia każdego manuskryptu na części, przetestowania jego twierdzeń i skierowania ograniczonej uwagi ludzi ku najsilniejszym kandydatom.

Presja najpierw dotyka badaczy prowadzących przeglądy literatury. Dociera także do redaktorów czasopism, grantodawców, zespołów biotechnologicznych i każdego, kto podejmuje decyzje na podstawie wczesnych dowodów.

Grupy te potrzebują szybszego filtrowania. Muszą także wiedzieć, dlaczego artykuł przeszedł przez filtr, co system przeoczył i jak często jego błędy się powtarzają.

Ranking może ograniczać przeciążenie informacyjne, jednocześnie tworząc nową koncentrację wpływu. Jeśli jedna punktacja stanie się powszechnie zaufana, błędy na warstwie oceniania mogą przekierować uwagę w całej dziedzinie.

Dlatego debata pojawiła się właśnie teraz. Publikowanie naukowe potrzebuje selekcji w skali maszynowej, ale standardy walidacji tej selekcji pozostają nieustalone.

QED Score podważa prestiż, a nie recenzję naukową

Najmocniejszy argument za QED nie polega na tym, że zastępuje recenzję naukową, lecz na tym, że bada artykuły bardziej bezpośrednio niż pozycja czasopisma w rankingu.

QED Score ocenia dwa deklarowane wymiary. Oryginalność mierzy, jak daleko dane ustalenie posuwa istniejącą wiedzę, natomiast wiarygodność mierzy, czy dowody wspierają wnioski manuskryptu.

Firma twierdzi, że jej architektura wieloagentowa najpierw rozkłada każdy artykuł na główną tezę, kluczowe twierdzenia, powiązane twierdzenia i wspierające eksperymenty.

Wyspecjalizowani agenci AI badają następnie równolegle różne cechy. Szukają niespójności w rycinach, słabości statystycznych, konfliktów z istniejącą literaturą, alternatywnych hipotez i problemów ze standardami raportowania.

Warstwa weryfikacyjna ponownie sprawdza oznaczone problemy. Warstwa oceniania punktuje poszczególne twierdzenia, a agregator łączy te oceny w skalibrowany percentyl.

Wynik 80 oznacza, że manuskrypt uplasował się wyżej niż 80% korpusu referencyjnego. Nie oznacza, że artykuł ma 80% prawdopodobieństwa, iż jest poprawny.

To rozróżnienie łatwo zatracić, gdy złożony osąd zostaje sprowadzony do znajomej liczby. Percentyle opisują względną pozycję, a nie absolutną prawdę.

QED przetestowało swoją metrykę w trzech badaniach. Pierwsze wykorzystało 925 opublikowanych artykułów od 185 autorów, które eksperci dziedzinowi przypisali do kategorii Ograniczone, Zadowalające lub Mocne.

Proces oceniania nie otrzymał tych etykiet. QED podaje pole pod krzywą wynoszące 0,867 przy rozdzielaniu artykułów Ograniczonych od pozostałych kategorii.

Pole pod krzywą, czyli AUC, mierzy, jak dobrze system rozróżnia dwie klasy. Wartość 0,5 oznacza przypadek, a 1,0 — perfekcyjne rozdzielenie.

Dla 795 artykułów posiadających zarówno QED Scores, jak i dane o rankingu czasopisma QED zgłosiło lepsze wyniki w dwóch porównaniach. Uzyskało 0,863 wobec 0,804 dla identyfikowania artykułów Ograniczonych.

W przypadku artykułów Mocnych wyniki były znacznie bliższe. QED podało 0,782, w porównaniu z 0,774 dla miary rankingu czasopisma.

Drugie badanie oceniło 4 953 preprinty bioRxiv z kwietnia 2025 roku. QED następnie śledziło, gdzie te artykuły zostały ostatecznie opublikowane.

Badacze dopasowali 2 879 preprintów do opublikowanych wersji z powiązanym rankingiem czasopisma. QED podało korelację Spearmana na poziomie 0,63 między ocenami preprintów a późniejszym rankingiem czasopisma.

Korelacja różniła się w 21 dyscyplinach. Osiągnęła 0,78 w genetyce, lecz spadła do 0,39 w biologii systemowej.

Różnice te zasługują na uwagę. Jeden percentyl obejmujący różne dyscypliny może ukrywać istotne zróżnicowanie w skuteczności modelu, konwencjach dotyczących dowodów i zachowaniach publikacyjnych.

Trzecie badanie skoncentrowało się na niezgodnościach. QED utworzyło 100 par artykułów, w których jego wynik faworyzował artykuł opublikowany w niżej sklasyfikowanym czasopiśmie.

Piętnastu ekspertów dziedzinowych oceniło pary bez znajomości QED Scores ani miejsc publikacji. Wydali 70 pewnych osądów, w tym 60 rozstrzygających wyborów po wyłączeniu remisów.

Eksperci wybrali artykuł faworyzowany przez QED w 75% tych rozstrzygających przypadków. Podany 95% przedział ufności wynosił od 63% do 84%.

Wynik ten wspiera argument QED, że prestiż miejsca publikacji może błędnie przedstawiać jakość artykułu na poziomie pojedynczej pracy. Nie dowodzi, że QED potrafi identyfikować prawdę bez ludzkiego osądu.

Miejsce publikacji jest również niewygodnym punktem odniesienia. Umieszczenie pracy w czasopiśmie zależy od nowości, zakresu redakcyjnego, terminu, prezentacji, dostępności recenzentów i strategicznych wyborów dotyczących zgłoszenia.

Wynik korelujący z rankingiem miejsca publikacji może potwierdzać zgodność z istniejącymi wynikami procesu publikacyjnego. Sam w sobie nie może potwierdzić twierdzenia, że system unika uprzedzeń tego systemu.

QED przyznaje istnienie ważnej granicy. Jego metodologia stwierdza, że The 1% nie zastępuje recenzji naukowej.

To rozsądne ujęcie sprawy. QED może nadawać priorytet manuskryptom do analizy, ale wysoki percentyl nie powinien uprawniać do podejmowania decyzji klinicznych ani rozstrzygać sporów naukowych.

Główny spór dotyczy zatem bezpośredniej oceny kontra wnioskowanie oparte na prestiżu. QED pyta, czy czytelnicy powinni analizować twierdzenia i dowody zamiast zapożyczać reputację czasopisma.

To wyzwanie jest użyteczne, nawet jeśli wynik QED pozostaje niedoskonały. Marka czasopisma zawsze sprowadzała wiele ocen do skrótu myślowego, którego czytelnicy mogą niewłaściwie używać.

Starannie zwalidowany wynik AI może stać się kolejnym sygnałem. Nie powinien jednak stać się jedynym sygnałem ani nową etykietą prestiżu o mniejszej publicznej rozliczalności.

Czego nie dowodzi twierdzenie o najlepszym 1%

Wewnętrzne wyniki QED uzasadniają poważne testy, ale jeszcze nie bezwarunkowe zaufanie.

Głównym ograniczeniem jest niezależność. QED Science opracowała system, zaprojektowała walidację, opublikowała metodologię i podała kluczowe wskaźniki skuteczności.

Badania prowadzone przez firmę mogą dostarczać wartościowych dowodów. Niezależna replikacja staje się niezbędna, gdy wartość komercyjna produktu zależy od tych samych deklaracji dotyczących skuteczności.

Jedna zewnętrzna ocena wskazała słabości we wszystkich trzech badaniach walidacyjnych. Krytykę przygotowano za pośrednictwem innej usługi oceny badań opartej na AI, więc nie stanowi ona definitywnej replikacji dokonanej przez ludzi.

Mimo to stawia konkretne pytania. Raport z oceny argumentuje, że badania QED wykorzystują powiązane sygnały referencyjne, zamiast oferować w pełni niezależne potwierdzenie.

Pierwsze badanie opiera się na kategoriach jakości przypisanych przez ekspertów. Drugie wykorzystuje rangę czasopisma jako wynik. Trzecie wybiera przypadki, w których QED i ranga czasopisma zdecydowanie się różnią.

Taka struktura może wykazywać spójność w testach wybranych przez QED. Pozostawia jednak otwartą kwestię, jak system działa w prospektywnych decyzjach zdefiniowanych przez badaczy z zewnątrz.

Drugie badanie dopasowało również tylko 2 879 z 4 953 preprintów do opublikowanych wersji zawierających dane o rankingu czasopisma. Oznacza to, że 2 074 manuskrypty znalazły się poza raportowaną analizą korelacji.

Niektóre niedopasowane artykuły mogą zostać opublikowane później, pojawić się w miejscach bez wymaganej metryki albo nigdy nie trafić do formalnej publikacji. Ich wykluczenie może zmienić pozorną zależność.

Efekty selekcji mają znaczenie, ponieważ publikacja nie jest losowa. Dobra praca może pozostać nieopublikowana, podczas gdy słaba może przetrwać recenzję.

Trzecie badanie dostarcza przekonujących danych o rozbieżnościach, lecz wykorzystuje celowo nietypową próbę. Badacze wybrali pary, ponieważ QED i ranga czasopisma wskazywały przeciwne kierunki.

Taki projekt testuje istotny konflikt. Nie szacuje jednak, jak często QED dokonuje lepszego wyboru wśród zwykłych artykułów.

Wynik 75% preferencji również opiera się na 60 rozstrzygających ocenach. To informacyjne, ale niewiele w porównaniu z 57 455 manuskryptami przedstawionymi w The 1%.

Wybrana lista wprowadza kolejny problem. „Najlepszy 1%” brzmi obiektywnie, lecz nadal jest względny wobec korpusu QED, sposobu obsługi kategorii, wersji punktacji i wybranych wymiarów oceny.

Oryginalność i trafność to wartościowe kryteria. Nie obejmują jednak każdej cechy jakości, na której zależy naukowcom.

Technicznie poprawny artykuł może być wąski lub mało istotny. Oryginalny artykuł może opierać się na kruchych pomiarach. Replikacja może oferować ograniczoną oryginalność, jednocześnie zapewniając ogromną wartość naukową.

Etyka, dostępność danych, przejrzystość metodologiczna, odtwarzalność, praktyczne znaczenie i konflikty interesów również mogą wpływać na to, jak czytelnicy powinni wykorzystywać wynik.

Agenci QED analizują kilka powiązanych czynników, ale osoby z zewnątrz potrzebują większej przejrzystości co do ich wag. Potrzebują także analiz błędów, kalibracji na poziomie dziedzin i przykładów fałszywie pozytywnych wyników.

Nieprzejrzystość modelu rodzi pytania operacyjne. QED twierdzi, że jego architektura łączy wiele dużych modeli językowych z modelami własnościowymi.

Jego publiczna metodologia nie identyfikuje każdego modelu bazowego, promptu, wagi komponentu ani harmonogramu aktualizacji. Te szczegóły mogą wpływać na odtwarzalność.

Jeśli dostawca modelu zmieni system, ten sam manuskrypt może otrzymać inny wynik. QED potrzebowałby wersjonowanej punktacji i stabilnych rejestrów audytowych, aby wspierać użycie o istotnych konsekwencjach.

Badania już wykazały, że ewaluatorzy LLM mogą odtwarzać uprzedzenia społeczne. W dużym eksperymencie ekonomicznym wygenerowano 27 090 ocen dla 9 030 artykułów.

Ten eksperyment z recenzją naukową wykazał, że modele rozróżniały jakość, ale faworyzowały prominentne instytucje, autorów płci męskiej i renomowanych ekonomistów.

Anonimowe dane wejściowe QED powinny ograniczyć kilka z tych efektów. Nie odpowiadają jednak na pytanie, czy model przyswoił inne preferencje dotyczące znanych metod, popularnych tematów lub konwencjonalnych struktur argumentacji.

System może też nagradzać manuskrypty, które są łatwiejsze do przetworzenia przez modele. Jasna struktura twierdzeń jest dobra, ale czytelność nie może stać się niewidzialnym substytutem siły dowodów.

Kolejną obawą jest zachowanie adwersarialne. Gdy autorzy zrozumieją, co nagradza system punktacji, niektórzy będą optymalizować manuskrypty pod kątem tej metryki.

Taki wzorzec pojawia się wszędzie tam, gdzie rankingi rozdzielają uwagę. Wyszukiwarki, metryki uniwersyteckie, miary cytowań i współczynniki wpływu czasopism zachęcały do zachowań strategicznych.

Publiczny wynik musi więc być odporny na manipulację. Wymaga też monitorowania ukrytych promptów, sfabrykowanych cytowań, powielonych dowodów i stylistycznych taktyk mających wpłynąć na ewaluatora.

Badacze powinni traktować QED jako pomoc w odkrywaniu materiałów, dopóki te pytania nie otrzymają niezależnych odpowiedzi. Wysoki wynik może uzasadniać wcześniejsze przeczytanie artykułu, ale nie wcześniejsze uwierzenie mu.

Równie ważna jest sytuacja odwrotna. Niski wynik nie powinien po cichu pogrzebać niekonwencjonalnych badań bez ścieżki odwoławczej lub jasnego wyjaśnienia.

Dla pracowników wiedzy śledzących twierdzenia naukowe utrzymanie kontekstu źródeł jest ważniejsze niż gromadzenie rankingów. Przeszukiwalna baza wiedzy może przechowywać razem artykuły, krytyki, aktualizacje i sprzeczne dowody.

Taki przepływ pracy utrzymuje wynik w jego właściwej roli. Staje się on jednym filtrem przypisanym do źródła, a nie werdyktem oderwanym od podstawowej pracy.

Trzy sygnały zdecydują, czy badacze powinni mu zaufać

Zaufanie będzie zależeć od niezależnej walidacji, stabilnej skuteczności w różnych dziedzinach oraz dowodów, że naukowcy korzystają z wyniku bez rezygnacji z własnej oceny.

Pierwszym sygnałem jest prospektywne, prerejestrowane badanie prowadzone przez badaczy spoza QED Science. Niezależne zespoły powinny określić kryteria oceny przed zobaczeniem wyników.

Powinny testować nowe manuskrypty, z którymi nie zetknęły się ani modele, ani ewaluatorzy. Badanie powinno obejmować opublikowane artykuły, nieopublikowane artykuły, replikacje, wyniki negatywne i celowo wadliwe zgłoszenia.

Zewnętrzni eksperci powinni oceniać twierdzenia i dowody bez otrzymywania etykiet QED. Badacze mogą następnie porównać QED z panelami ludzkimi, decyzjami czasopism, wynikami replikacji i późniejszymi korektami.

Żaden pojedynczy benchmark nie zapewnia doskonałej prawdy referencyjnej. Zgodność między rzeczywiście niezależnymi miarami wzmocniłaby twierdzenie QED bardziej niż kolejne porównanie prowadzone przez firmę.

Niepowodzenie w takich warunkach osłabiłoby twierdzenie, że QED oferuje ogólnie wiarygodną miarę jakości naukowej. Nadal mógłby jednak pozostać użyteczny w węższych zadaniach wstępnej selekcji.

Drugim sygnałem jest przejrzysta skuteczność na poziomie dziedzin w czasie. QED już raportuje korelacje od 0,39 do 0,78 w różnych dyscyplinach.

Przyszłe wydania powinny ujawniać wzorce fałszywie pozytywnych i fałszywie negatywnych wyników, dryf kalibracji oraz zmiany punktacji dla każdej dziedziny. Łączna dokładność może ukrywać słabą skuteczność w wyspecjalizowanych obszarach.

Wersjonowanie ma szczególne znaczenie. Każdy wynik powinien wskazywać wersję systemu, korpus referencyjny, datę oceny i niepewność związaną z rankingiem.

Badacze potrzebują także wyjaśnień łączących wyniki z konkretnymi twierdzeniami i eksperymentami. Percentyl bez możliwego do prześledzenia uzasadnienia nie może wspierać znaczącej korekty.

Jeśli QED opublikuje stabilne, odtwarzalne wyniki na poziomie dziedzin, jego argumentacja stanie się silniejsza. Jeśli wyniki będą zmieniać się po cichu po zmianach modeli, badacze powinni ograniczyć narzędzie do nieformalnego odkrywania materiałów.

Trzecim sygnałem jest sposób, w jaki instytucje wykorzystują ranking. Rekomendacje lektur wiążą się z mniejszą stawką niż selekcja finansowania, filtry rekrutacyjne czy decyzje dotyczące dowodów klinicznych.

Narzędzie pomagające naukowcom odkrywać pomijane artykuły może ograniczać uprzedzenia związane z prestiżem. To samo narzędzie może stworzyć algorytmiczny prestiż, jeśli instytucje będą traktować wynik jako próg odcięcia.

Obserwuj, czy fundatorzy i czasopisma używają QED obok recenzji eksperckiej, czy przed nią. Obserwuj też, czy autorzy mogą kwestionować błędy i uzyskiwać ponowną ocenę po poprawkach.

Najzdrowsze wdrożenie zachowałoby ludzką odpowiedzialność. Badacze wykorzystywaliby QED do identyfikowania artykułów, analizowaliby jego uzasadnienie, a następnie oceniali leżące u podstaw dowody.

Najbardziej ryzykowne wdrożenie ukryłoby decyzje za percentylem. Instytucja mogłaby automatycznie odrzucać pracę, twierdząc, że proces był neutralny, ponieważ usunięto nazwiska.

Pytanie Nature ma warunkową odpowiedź. Badacze powinni ufać QED na tyle, by testować jego rekomendacje, ale nie na tyle, by zlecać mu ocenę naukową.

QED przedstawił wiarygodną odpowiedź na rzeczywiste wąskie gardło. Jego skala, anonimowa punktacja i analiza na poziomie twierdzeń zasługują na staranną niezależną analizę.

Debata Horizon Nature potrzebuje teraz dowodów spoza firmy. W ciągu najbliższych kilku miesięcy warto szukać prerejestrowanej replikacji, raportowania błędów specyficznych dla dziedzin oraz ujawnionego wykorzystania instytucjonalnego.

Czy wynik QED zmieniłby to, który preprint przeczytasz jako pierwszy? Prawdopodobnie powinien. Czy zmieniłby to, w co wierzysz, bez sprawdzenia metod i dowodów? Nie powinien.

 
 

Zacznij bezpłatnie

Asystent AI działający przede wszystkim lokalnie, z funkcją zarządzania wiedzą osobistą

Aby zapewnić lepsze działanie AI,

remio obsługuje obecnie wyłącznie Windows 10+ (x64) i M-Chip Macs.

Twój partner AI w pracy
Zrób więcej z remio

Planuj. Twórz. Dostarczaj.
Wszystko w jednym miejscu.

bottom of page