Recenzja Sakana AI wykrywa 73% kluczowych błędów, ale prawdziwe artykuły pokazują ograniczenia
Sakana AI twierdzi, że jej system recenzowania wykrył 73,43% celowo wprowadzonych błędów wpływających na kluczową tezę artykułu. Ten nagłośniony wynik pochodzi jednak z czterech recenzji syntetycznych sprzeczności, a nie z rutynowych ocen niezmodyfikowanych badań.
System o nazwie Multi-Layered Review w nowym benchmarku Sakana AI wypadł znacznie lepiej niż trzy podstawowe systemy automatycznej recenzji. Jego wskaźnik dokładnego wykrywania spadł jednak do 16,11%, gdy testowano go na udokumentowanych problemach w wycofanych artykułach z arXiv.
Ta różnica stanowi sedno sprawy. Recenzja Sakana AI dostarcza dowodów, że uważne, wieloetapowe czytanie może poprawić automatyczną krytykę. Nie dowodzi jednak, że LLM potrafi niezawodnie weryfikować pracę naukową.
Badanie skłania raczej twórców do ponownego przemyślenia sposobu oceny recenzentów AI. Dopasowanie ocen ludzkich recenzentów lub tworzenie przekonujących komentarzy nie wystarcza. Użyteczny recenzent musi łączyć tezy, metody, eksperymenty i dowody na tyle dobrze, by dostrzegać konflikty między nimi.
Wynik Sakana AI pojawia się również w kontekście złożonej historii. Firma wcześniej wykorzystywała AI do generowania artykułów naukowych i mierzyła się z pytaniami o to, co faktycznie dowodzi przejście przez proces peer review. Jej najnowszy projekt odwraca tę samą kwestię, pytając, czy AI może pomóc ludziom wykrywać słabe badania.
Recenzja Sakana AI zmienia test
Najważniejszą zmianą nie jest wynik 73,43%. Jest nią decyzja, by oceniać recenzentów AI na podstawie tego, czy wykrywają błędy.
Znaczna część wcześniejszych prac nad automatyczną recenzją naukową mierzyła podobieństwo. Badacze porównywali recenzję wygenerowaną przez AI z opiniami ludzi, sprawdzali korelację ocen albo mierzyli pokrywanie się komentarzy.
Takie testy pokazują, czy system zachowuje się jak recenzent. Nie pokazują jednak bezpośrednio, czy zauważył kluczowy błąd w artykule.
Artykuł Sakana AI o peer review proponuje alternatywę skoncentrowaną na weryfikacji. Jego autorzy argumentują, że wykrywanie błędów jest jedną z najważniejszych i najbardziej zasobochłonnych funkcji recenzji naukowej.
Zespół stworzył Contradiction Benchmark, zawierający 1 164 zmodyfikowane warianty artykułów. Warianty pochodziły z 257 prac opublikowanych na ACL, AISTATS, CVPR i ICML w 2025 roku oraz NeurIPS w 2024 roku.
Badacze ograniczyli zbiór do prac objętych liberalnymi licencjami Creative Commons. Ograniczenie to pozwoliło im modyfikować i redystrybuować manuskrypty.
Dla każdego artykułu Gemini 2.5 Pro wygenerował graf wiedzy. Graf wiedzy przedstawia tezy, metody, dowody i relacje między nimi jako połączone węzły.
Następnie badacze zmierzyli odległość każdego węzła od głównej tezy. Odległość równa zero oznaczała, że węzeł reprezentował kluczową tezę. Większe odległości oznaczały coraz bardziej peryferyjne szczegóły.
GPT-4.1 przepisywał wybrane fragmenty tak, by przeczyły odpowiadającym im węzłom. Zmieniony tekst wstawiano do oryginalnego źródła, które następnie ponownie kompilowano do kompletnego PDF-a.
Ta procedura dała badaczom znany błąd i znaną lokalizację. Pozwoliła im też klasyfikować, jak bezpośrednio każdy błąd zagrażał głównemu wnioskowi artykułu.
Model o3 oceniał, czy wygenerowane recenzje wykryły każdą sprzeczność. Proces oceniania uruchamiano dziesięć razy dla każdego przykładu, a badacze uśredniali wyniki.
Według badania na artykułach bez błędów sędzia osiągnął dokładność 99,9%. Analiza ręczna wykazała czułość 86,8% w odniesieniu do potwierdzonych wykryć, co sugeruje, że automatyczna ocena czasem pomijała prawidłowe wskazania.
Taki układ oferuje jaśniejszy test niż pytanie, czy model brzmi jak recenzent. System albo zgłasza wprowadzoną sprzeczność, albo nie.
Benchmark mierzy jednak jeden starannie zdefiniowany aspekt recenzowania. Nie obejmuje wszystkich form błędów naukowych, w tym fałszowania danych, niewłaściwych założeń statystycznych, ukrytych błędów przetwarzania wstępnego czy eksperymentów niemożliwych do odtworzenia.
To rozróżnienie ma znaczenie, ponieważ nagłówek odnosi się konkretnie do sprzeczności w kluczowych tezach. Nie należy go odczytywać jako ogólnego wskaźnika 73% dokładności recenzji naukowej.
Dlaczego system Sakana AI MLR wykrywa więcej błędów
Multi-Layered Review poprawia wykrywanie błędów, zmuszając model do zrozumienia artykułu, zanim go oceni.
Pełny system Sakana AI MLR obejmuje trzy role: Appendix Agent, Literature Review Agent i Review Agent. Komponenty te przetwarzają różne części manuskryptu przed przygotowaniem skonsolidowanej oceny.
Appendix Agent używa Claude Haiku 3.5 do podsumowywania szczegółów implementacji i eksperymentów znajdujących się poza głównym tekstem. Ten krok pomaga uniknąć krytykowania braków, które załącznik już wyjaśnia.
Opcjonalny Literature Review Agent korzysta z Claude Sonnet 4 i wyszukiwania w sieci. Jego zadaniem jest umieszczenie manuskryptu w kontekście istniejących badań oraz sprawdzenie, czy deklaracje dotyczące nowości wydają się uzasadnione.
Centralny Review Agent również wykorzystuje Claude Sonnet 4. Otrzymuje do dziesięciu stron głównego tekstu w PDF-ie, zachowując równania, wykresy i informacje o układzie, które ekstrakcja zwykłego tekstu mogłaby uszkodzić.
Jego proces pracy opiera się na uznanej metodzie trzech przejść podczas lektury artykułów naukowych. Pierwsze przejście tworzy ogólny zarys głównych idei manuskryptu.
Drugie przejście analizuje tekst dokładniej i łączy te idee z dowodami, które je wspierają. Rejestruje również założenia, luki i słabości.
Trzecie przejście łączy te notatki z istotnymi ustaleniami z załącznika i przeglądu literatury. Następnie tworzy zestaw mocnych stron, słabości, pytań, rekomendację, ocenę i listę działań.
Ta sekwencja rozwiązuje częsty problem narzędzi LLM do recenzji. Jeden rozbudowany prompt może prosić model jednocześnie o podsumowanie, weryfikację, porównanie, krytykę, ocenę i sformatowanie artykułu.
Model może przygotować dopracowaną recenzję bez zbudowania stabilnej reprezentacji badania. Może powtarzać tezy z abstraktu, przeoczając dowody przeciwne w wynikach.
MLR oddziela zrozumienie od oceny. Taka konstrukcja dostarcza modelowi pośrednich notatek, które mogą połączyć wniosek z metodą lub eksperymentem go wspierającym.
Wyniki benchmarku sugerują, że do poprawy przyczyniły się zarówno wybór modelu, jak i konstrukcja procesu pracy. Zastąpienie GPT-4.1 modelem Claude Sonnet 4 w prostszym punkcie odniesienia LLM-Review podniosło wykrywanie kluczowych błędów z 14,56% do 35,40%.
Pojedyncza recenzja MLR osiągnęła następnie 60,79% dla tej samej klasy kluczowych sprzeczności. Zespół czterech recenzji MLR podniósł wykrywalność do 73,43%.
Najlepszy konkurencyjny wynik dla błędów w kluczowych tezach wyniósł 14,81% i został osiągnięty przez AgentReview. AI Reviewer uzyskał 11,17%, a oryginalna konfiguracja LLM-Review — 14,56%.
W przypadku sprzeczności o każdym mierzonym poziomie istotności cztery recenzje MLR wykryły 40,95%. Konkurencyjne systemy pozostały w przedziale od 5,95% do 6,50%.
Porównania te czynią mechanizm ciekawszym niż bezwzględny wynik. Zmiana bazowego modelu przyniosła duży wzrost, a wieloetapowa konstrukcja recenzji — kolejny.
Oznacza to, że nabywcy nie mogą traktować określenia „multi-agent” jako wystarczającego wyjaśnienia wyników. AgentReview również wykorzystuje role recenzenta, autora i przewodniczącego obszaru, a mimo to jego wynik benchmarku był znacznie niższy.
Kluczowe pytanie brzmi, co robią agenci. Podzielenie jednego zadania między kilka person różni się od podzielenia manuskryptu na komponenty oparte na dowodach i budowania zrozumienia poprzez powtarzane przejścia.
MLR podważa również założenie, że większa liczba tokenów automatycznie przekłada się na lepszą jakość recenzji. W badaniu wykorzystał 189 062 tokeny wejściowe na pełną recenzję, czyli mniej niż połowę 403 654 tokenów użytych przez AI Reviewer.
Prostszy LLM-Review używał zaledwie 6 517 tokenów wejściowych, częściowo dlatego, że skracał długą treść. Podejście to zużywało mniej zasobów, ale traciło informacje, które mogłyby ujawnić sprzeczności.
Użyteczny kompromis nie polega więc po prostu na wyborze między małym a dużym systemem. Chodzi o to, czy system przeznacza kontekst na zbudowanie modelu artykułu, który można poddać recenzji.
Teza o 73% słabnie poza benchmarkiem
Najmocniejszy argument przeciw traktowaniu MLR jako autonomicznego arbitra pochodzi z własnej oceny rzeczywistych błędów przeprowadzonej przez Sakana AI.
Badacze przetestowali Review Agent na WithdrarXiv-Check, zbiorze danych opartym na wycofanych artykułach z arXiv i powiązanych z nimi komentarzach dotyczących wycofania. Zbiór testowy obejmuje 211 prac.
Ta ocena jest trudniejsza niż wykrywanie celowo wprowadzonych sprzeczności. Rzeczywiste błędy badawcze mogą być rozproszone między założeniami, wyprowadzeniami, cytowaniami i eksperymentami, nie tworząc oczywistego konfliktu na poziomie pojedynczego zdania.
Autorzy wyłączyli dla tego testu komponent wyszukiwania literatury. W przeciwnym razie system mógłby odnaleźć publiczne zawiadomienia o wycofaniu zamiast samodzielnie odkrywać problemy w manuskryptach.
MLR zidentyfikował dokładne dopasowanie do udokumentowanego problemu skutkującego wycofaniem w 16,11% przypadków. Przy bardziej elastycznym standardzie, akceptującym zasadniczo podobną uwagę, osiągnął 26,07%.
Najsilniejszy punkt odniesienia osiągnął 9% dla dokładnych dopasowań i 18,48% dla podobnych dopasowań. MLR nadal prowadził w porównaniu, lecz różnica była znacznie mniejsza niż w syntetycznym benchmarku.
Zbiór danych wycofanych artykułów obejmuje też głównie badania z zakresu matematyki teoretycznej i fizyki. Systemy recenzujące zaprojektowano wokół artykułów konferencyjnych z uczenia maszynowego, co ogranicza bezpośrednią porównywalność.
Nawet przy tej niezgodności dziedzin różnica w wynikach ujawnia kluczowe ograniczenie. Celowo wprowadzone sprzeczności dają recenzentowi wyraźną niezgodność do znalezienia. Rzeczywiste wady często wymagają zrekonstruowania dowodu, ponownego uruchomienia kodu, sprawdzenia danych lub posiadania specjalistycznej wiedzy dziedzinowej.
Autorzy benchmarku przyznają, że istnieje jeszcze jeden problem. Ludzcy oceniający zbadali 50 syntetycznych sprzeczności i stwierdzili, że 34% z nich nie tworzyło spójnego toku z sąsiednimi zdaniami.
Tylko 8% brzmiało w oczywisty sposób jak tekst wygenerowany przez AI, ale zaburzony kontekst nadal może stanowić wskazówkę wykrycia. Automatyczny recenzent może zauważyć, że fragment nie pasuje, nie rozumiejąc, dlaczego leżąca u jego podstaw nauka jest błędna.
Autorzy argumentują, że czyni to benchmark łatwiejszym, a nie nieważnym. Systemy bazowe nadal miały trudności, nawet gdy niektóre wstawione błędy zawierały wykrywalne nieprawidłowości.
Interpretacja ta jest rozsądna, lecz zmienia znaczenie wyniku 73,43%. To wysoki rezultat w kontrolowanym zadaniu wykrywania sprzeczności, a nie szacunek tego, jak często MLR wyłapuje poważne błędy w przesłanych artykułach.
Na uwagę zasługuje również konfiguracja czterech recenzji. Zespół uznaje błąd za wykryty, gdy wspomni o nim którakolwiek z czterech niezależnych recenzji.
Jest to użyteczne w kontroli przed przesłaniem artykułu, gdzie zebranie kilku sygnałów ostrzegawczych może zwiększyć zakres wykrywania. Jest to mniej bezpośrednio porównywalne z przydzieleniem jednej automatycznej recenzji w miejsce jednego ludzkiego recenzenta.
Wynik 60,79% dla kluczowych błędów w pojedynczej recenzji MLR pozostaje znaczący. Mimo to niemal cztery na dziesięć celowo wprowadzonych kluczowych sprzeczności pozostały niewykryte w konfiguracji pojedynczej recenzji.
Wyniki pogarszały się również, gdy sprzeczności znajdowały się dalej od głównej tezy artykułu. Wzorzec ten wspiera miarę istotności opartą na grafie wiedzy, ale pokazuje, że szczegółowe błędy drugorzędne pozostają trudne.
Dla zespołów badawczych praktycznym zastosowaniem jest zatem audyt przed przesłaniem pracy. Automatyczny system może oznaczać możliwe niespójności i kierować ludzką uwagę na podatne tezy.
Nie jest jeszcze gotowy do poświadczania poprawności. Nie można zakładać, że artykuł, który nie otrzymał ostrzeżenia, jest poprawny, ani że ostrzeżenie jest uzasadnione.
Zgodność z oceną ludzi jest użyteczna, ale nie stanowi naukowej weryfikacji
MLR wydaje oceny przypominające wyniki ludzkich recenzji, jednak zgodność z recenzentami pozostaje czymś odrębnym od ustalenia prawdy.
W przypadku zgłoszeń na ICLR 2025 wyniki MLR miały współczynnik korelacji Pearsona 0,586 z ocenami ludzkimi. Referencyjna zgodność między ludźmi wyniosła 0,742.
W przypadku prac z NeurIPS 2024 MLR osiągnął 0,451, wobec ludzkiego poziomu referencyjnego 0,781. Na ICML 2025 MLR uzyskał 0,429, nieznacznie ustępując AI Reviewerowi z wynikiem 0,439.
Liczby te wskazują na istotną zgodność, zwłaszcza w porównaniu z systemami, których oceny ledwie odróżniały prace przyjęte od odrzuconych. Nie dowodzą jednak, że decyzje ludzkie ani automatyczne są faktycznie poprawne.
Recenzowanie naukowe obejmuje subiektywne kwestie dotyczące znaczenia, klarowności i nowatorstwa. Dwóch uważnych recenzentów może uznać, że praca zasługuje na przyjęcie, a jednocześnie przeoczyć tę samą słabość techniczną.
Analiza Sakana AI wykazała również różnice w tym, na co zwracali uwagę ludzie i systemy automatyczne. MLR silniej koncentrował się na poprawności i eksperymentach, podczas gdy ludzcy recenzenci przywiązywali większą wagę do klarowności i nowatorstwa.
Ta rozbieżność może być pomocna. Asystent recenzenta wnosi większą wartość, gdy ujawnia pomijane problemy, niż gdy jedynie przewiduje komentarze, które napisze człowiek.
Uzupełniające się priorytety tworzą jednak własny problem kalibracji. System musi odróżniać rzeczywistą słabość metodologiczną od wiarygodnie brzmiącej krytyki, której nie potwierdza manuskrypt.
Ocena użytkowników w badaniu ilustruje to wyzwanie. Aktywni badacze przeprowadzili 38 sesji recenzowania z pełnym procesem MLR.
Spośród 378 komentarzy, które otrzymały bezpośrednią informację zwrotną o zgodzie, użytkownicy zaakceptowali 81%. Rekomendacje uzyskały 94% zgodności, a mocne strony 92%.
Pytania otrzymały 79%, a pozycje z listy działań 78%. Słabości miały najniższy wskaźnik zgodności — 68%.
Autorzy nie są bezstronnymi sędziami krytyki, więc brak zgody nie musi oznaczać, że system się mylił. Mimo to właśnie w obszarze słabości fałszywe oskarżenia mogą wyrządzić największą szkodę.
Recenzent, który błędnie zarzuca błąd matematyczny lub brakujący eksperyment, może zniekształcić decyzję redakcyjną. Płynny język może sprawić, że taki zarzut wyda się pewniejszy, niż uzasadniają to dowody.
Ludzcy recenzenci mogą popełnić ten sam błąd. Różnica polega na tym, że automatyzacja może powielić jedną błędną interpretację w tysiącach zgłoszeń.
Dlatego system recenzowania Sakana AI lepiej sprawdza się jako drugi czytelnik niż jako decydent. Może poszerzyć zestaw kwestii analizowanych przez człowieka, nie otrzymując ostatecznej władzy nad przyjęciem pracy.
Ustrukturyzowane notatki systemu mogą również pomóc autorom zarządzać złożonym materiałem dowodowym. Zespoły korzystające już z przeszukiwalnej bazy wiedzy mogą zastosować podobną zasadę, łącząc twierdzenia z eksperymentami, cytowaniami i nierozstrzygniętymi pytaniami.
Nie automatyzuje to weryfikacji. Ułatwia ludziom sprawdzanie ścieżki dowodowej.
Prompt injection ujawnia ryzyko automatyzacji
Recenzent, który rozumie pracę, nadal może zostać zmanipulowany przez tekst umieszczony w tej pracy.
Sakana AI przetestowało jawną iniekcję promptów, dodając ukryte instrukcje po zakończeniu 50 odrzuconych manuskryptów, z których większość pierwotnie zgłoszono na ICLR 2025.
Prompt injection występuje, gdy treść wewnątrz dokumentu próbuje nadpisać instrukcje regulujące działanie modelu, który ten dokument czyta. Złośliwy fragment może nakazywać automatycznemu recenzentowi ignorowanie słabości lub przyznanie wysokiej oceny.
Wszystkie cztery systemy recenzujące były silnie podatne na wpływ wstrzykniętego tekstu. MLR wykazał najmniejszą średnią zmianę wyniku według niektórych miar, lecz jego wyniki charakteryzowały się dużą wariancją.
System wyraźnie wykrył manipulację jedynie w 8 z 50 prac. W pozostałych przypadkach wstrzyknięta treść wpływała na recenzję, nie będąc wiarygodnie identyfikowana jako wroga.
Badacze sugerują, że MLR otrzymał pewną ochronę dzięki procesowi opartemu przede wszystkim na rozumieniu treści oraz wejściu multimodalnemu. Claude widział zarówno tekst dokumentu, jak i jego wyrenderowane strony, podczas gdy wstrzyknięta instrukcja nie występowała na widocznym obrazie.
Ta niezgodność dawała systemowi możliwy sygnał, że ukryty tekst nie należy do pracy. Nie wystarczyło to jednak do konsekwentnego zapobiegania manipulacji.
Ta słabość ma znaczenie, ponieważ recenzowanie naukowe obejmuje niezaufane dokumenty. Autorzy kontrolują plik PDF, pliki źródłowe, materiały dodatkowe, cytowania, a czasem także powiązane repozytoria.
Każdy automatyczny recenzent wyposażony w narzędzia do przeglądania internetu lub wykonywania kodu ma szerszą powierzchnię ataku. Powiązana strona może zawierać instrukcje, repozytorium może obejmować adversarialne komentarze, a dane dodatkowe mogą ukrywać mylące metadane.
Polityki konferencji już uznają, że użycie LLM wymaga ujawnienia i ostrożnego postępowania. Przewodnik dla recenzentów ICLR stawia odpowiedzialność człowieka ponad automatyczną pomocą.
Bezpieczne wdrożenie musiałoby odizolować treść dokumentu od instrukcji systemowych. Musiałoby również ograniczać narzędzia, rejestrować działania modelu, oznaczać ukryty tekst i wymagać potwierdzenia przez człowieka w przypadku istotnych twierdzeń.
Nawet te zabezpieczenia nie rozwiązałyby każdej formy manipulacji. Fragment może wpływać na model, nie zawierając oczywistej instrukcji.
Autorzy mogą selektywnie przedstawiać porównania, ukrywać nieudane eksperymenty lub używać pewnego siebie języka, aby kierować uwagą. Techniki te wpływają także na ludzkich recenzentów, lecz systemy automatyczne mogą wykształcić przewidywalne martwe punkty.
Wcześniejsza praca Sakana AI oferuje istotne ostrzeżenie. W 2025 roku firma wycofała wygenerowaną przez AI pracę warsztatową po jej przyjęciu i opisała błędy cytowań w wygenerowanych badaniach.
Badacze spoza firmy kwestionowali, czy epizod ten dowodzi autonomicznych zdolności naukowych, czy raczej skutecznej ludzkiej selekcji wyników AI. Późniejsza analiza recenzji naukowej podkreśliła różnicę między przejściem recenzji a dostarczaniem wiarygodnej wiedzy.
MLR rozwiązuje część tego problemu, testując recenzentów na znanych błędach. Wyniki dotyczące iniekcji pokazują jednak, że ewaluator zbudowany na tej samej klasie modeli pozostaje podatny na strategicznie sformułowane dane wejściowe.
Automatyczni autorzy i automatyczni recenzenci mogliby z czasem optymalizować swoje działania przeciw sobie nawzajem. Autorzy mogliby nauczyć się, jaki język pozwala uniknąć krytyki, podczas gdy recenzenci mogliby nagradzać wzorce przypominające zaakceptowane prace.
Bez niezależnych kontroli ta pętla mogłaby poprawiać wyniki bez poprawiania nauki.
Na co zwracać uwagę po benchmarku recenzji naukowej LLM
Trzy sygnały zdecydują, czy wynik Sakana AI stanie się użytecznym narzędziem badawczym, czy pozostanie imponującym eksperymentem kontrolowanym.
Pierwszym sygnałem jest niezależna replikacja. Sakana AI twierdzi, że dane i kod są dostępne na żądanie, a nie w natychmiast dostępnych publicznych repozytoriach.
Zewnętrzne zespoły muszą odtworzyć benchmark z tymi samymi pracami, promptami, wersjami modeli i procedurą oceniania. Powinny także przetestować różne modele sędziowskie oraz ręcznie audytować sporne wykrycia.
Replikacja powinna mierzyć fałszywie pozytywne wyniki obok czułości. Wykrywanie większej liczby błędów ma ograniczoną wartość, jeśli system generuje również wiele wiarygodnie brzmiących, lecz niepoprawnych krytyk.
Drugim sygnałem jest skuteczność w przypadku naturalnie występujących wad. Przyszłe benchmarki powinny obejmować zweryfikowane błędy statystyczne, niepoparte twierdzenia przyczynowe, błędy cytowań, niereprodukowalne wyniki i wadliwe dowody.
Niektóre zadania będą wymagały dostępu do kodu i danych, a nie wyłącznie do pliku PDF. Poważny audytor badań może potrzebować uruchomić eksperymenty, sprawdzić przetwarzanie wstępne i porównać raportowane wartości z wygenerowanymi wynikami.
Wynik 16,11% dokładnego dopasowania stanowi punkt wyjścia. Jeśli przyszłe systemy podniosą ten wskaźnik dla zróżnicowanych, niezależnie dobranych prac, argument za praktyczną pomocą stanie się silniejszy.
Trzecim sygnałem jest to, czy konferencje wdrożą te systemy z egzekwowalnymi zabezpieczeniami. Istotne wskaźniki obejmują zasady ujawniania użycia, kontrolę prywatności, ochronę przed prompt injection oraz udokumentowany nadzór człowieka.
Ograniczony pilotaż, który daje recenzentom prywatne, opcjonalne ostrzeżenia, sprawdziłby wspomaganie bez delegowania decyzji. System automatycznie oceniający zgłoszenia niósłby znacznie większe ryzyko.
Badacze powinni także obserwować, jak zmiany modeli wpływają na system Sakana AI MLR. Ablacja wykazała, że zmiana modelu bazowego odpowiadała za dużą część poprawy.
Tworzy to presję na utrzymanie systemu. Proces zatwierdzony dla jednej wersji modelu może działać inaczej po tym, jak dostawca zaktualizuje model lub wycofa endpoint.
Rodzą się także pytania o reprodukowalność. Benchmarki naukowe stają się trudniejsze do interpretacji, gdy modele komercyjne zmieniają się bez zachowania identycznych publicznych checkpointów.
Głębszy wkład Beyond Imitation ma zatem charakter metodologiczny. Jego benchmark recenzji naukowej LLM stawia lepsze pytanie niż to, czy generowane komentarze przypominają komentarze ludzkie.
Czy recenzent AI potrafi znaleźć konkretny problem zagrażający rozumowaniu przedstawionemu w pracy?
Odpowiedź Sakana AI jest zachęcająca w warunkach kontrolowanych i otrzeźwiająca w przypadku rzeczywistych wycofanych prac. Wieloetapowe rozumienie wyraźnie przewyższa powierzchowne naśladowanie w raportowanych testach.
Pozostała luka jest zbyt duża, by powierzyć systemowi automatyczną władzę. Rzeczywiste prace zawierają błędy, które nie ujawniają się jako sprzeczności, a złośliwe prace mogą bezpośrednio manipulować recenzentem.
Deweloperzy powinni traktować wynik 73,43% jako rezultat benchmarku o jasno określonych granicach. Redaktorzy powinni domagać się niezależnej walidacji przed włączeniem automatycznych ocen do decyzji publikacyjnych.
Badacze mogą jednak już dziś wykorzystać centralną ideę systemu. Poproście asystenta AI o powiązanie każdego kluczowego twierdzenia z jego dowodami, sprawdźcie powstałe odnośniki i ręcznie zbadajcie każdy niepoparty przeskok.
Kolejnym rozstrzygającym wynikiem nie będzie następny syntetyczny rekord. Będzie nim zreplikowany system, który wykrywa subtelne, naturalnie występujące błędy, nie zasypując recenzentów fałszywymi alarmami ani nie wykonując instrukcji ukrytych w manuskrypcie.



