Rękopisy matematyczne OpenAI zalewają środowisko, a matematycy stawiają opór
OpenAI opublikowało 6 października ponad 700 rękopisów matematycznych, wywołując kryzys weryfikacji przy okazji swojego dotąd największego twierdzenia dotyczącego badań generowanych przez AI.
Rękopisy matematyczne OpenAI obejmują setki powiązanych wyników z teorii liczb, geometrii, topologii, informatyki i innych dziedzin. Powstały za pomocą nieopublikowanego wewnętrznego modelu testowanego na około 4 000 otwartych problemów.
OpenAI przedstawiło zbiór jako wkład w ludzką wiedzę. Wielu matematyków dostrzegło natomiast prywatne laboratorium przenoszące ogromny ciężar recenzji na publiczną społeczność badawczą.
Ten konflikt ma większe znaczenie niż sama liczba rękopisów. Badacze muszą teraz ustalić, które rozumowania są poprawne, które wyniki są oryginalne i które prace zasługują na uwagę. Muszą wykonywać tę pracę, jednocześnie chroniąc własne projekty, studentów i kariery.
Publikacja nastąpiła też wśród nierozstrzygniętych sporów wokół matematyki generowanej przez AI. Wcześniejsze komunikaty OpenAI już rodziły pytania o przypisywanie autorstwa, nieopublikowaną pracę ludzi oraz różnicę między stworzeniem dowodu a budowaniem zrozumienia.
Wspólnotowy blog matematyczny Proofs and Prompts zebrał w ciągu kilku dni ponad 100 reakcji. Odpowiedzi wahały się od entuzjazmu po żal, gniew i zawodowy niepokój.
Sednem sporu nie jest po prostu przeciwstawienie ludzi maszynom. Chodzi o model masowej produkcji wyników proponowany przez OpenAI kontra matematykę jako wolniejszy proces wyjaśniania, krytyki, nauczania i wspólnej własności.
Rękopisy matematyczne OpenAI pojawiły się przed systemem ich recenzji
OpenAI nie opublikowało jednego słynnego dowodu do zbadania przez specjalistów. Wypuściło naraz cały program badawczy.
Firma początkowo opublikowała 722 rękopisy zorganizowane w 372 rodziny wyników. Rodzina może obejmować główny wynik, towarzyszące mu argumenty, konsekwencje i alternatywne dowody.
Obecne publiczne repozytorium wymienia 719 rękopisów w tych samych 372 rodzinach. Ta zmiana pokazuje, że zbiór jest już poprawiany.
OpenAI twierdzi, że artykuły i materiały pomocnicze zostały stworzone przez nieopublikowany wewnętrzny model graniczny. Firma oceniła ten model po tym, jak jej ustalone testy matematyczne stały się zbyt łatwe.
Podczas oceny przedstawiono około 4 000 problemów. OpenAI podaje, że przeciętny wynik zużywał moc obliczeniową porównywalną z trzema godzinami rozumowania ChatGPT Pro.
Liczby te opisują niezwykłą przepustowość. Nie dowodzą jednak, że każdy rękopis jest poprawny, nowatorski, czytelny lub istotny.
OpenAI wyraźnie przyznaje, że zbiór zawiera prace na różnych etapach weryfikacji. Ostrzega również, że niektóre wyniki bez formalizacji mogą zawierać problemy.
Formalizacja przekłada argument na język, który oprogramowanie sprawdzające dowody może zweryfikować linia po linii. OpenAI użyło Lean, języka programowania i asystenta dowodowego zaprojektowanego do tego celu.
Według repozytorium sformalizowano około 42 procent wyników najwyższego poziomu. To znaczący odsetek, lecz większość najważniejszych wyników pozostaje poza tą kategorią weryfikacji.
Nawet pomyślne sprawdzenie w Lean odpowiada tylko na część pytania badawczego. Może potwierdzić zakodowany argument logiczny, zakładając, że definicje i formalne sformułowanie oddają zamierzone twierdzenie.
Nie ustala automatycznie nowości, znaczenia, właściwego przypisania autorstwa ani użytecznego objaśnienia. Oceny te nadal zależą od ludzkiej znajomości literatury.
Repozytorium zawiera także dziesięć skróconych podsumowań rozumowania. Obejmują one wybrane wyniki dotyczące takich tematów jak wykładnik niewymierności pi i mnożenie macierzy.
Dziesięć podsumowań nie może zapewnić intelektualnej mapy setek rodzin wyników. Badacze nadal stają przed nieznanym katalogiem, którego znaczenie bardzo różni się między specjalizacjami.
W swoim oświadczeniu dotyczącym publikacji OpenAI stwierdziło, że chce, aby praca ta rozwijała ludzką wiedzę. Obiecało także protokoły rewizji, instrukcje cytowania i dalsze formalizacje.
Firma oznajmiła, że przyszłe publikacje poprawią cytowania, prezentację wywodu i formę. To zobowiązanie pośrednio uznaje słabości obecnego pakietu.
OpenAI konsultowało się również z niezależną grupą doradczą w Institute for Advanced Study. Konsultacje nie powstrzymały jednak badaczy przed określaniem procesu publikacji jako przytłaczającego.
Skala natychmiast stworzyła centralne napięcie. Model może generować kandydackie wyniki szybciej, niż odpowiedni eksperci są w stanie je przeczytać, umiejscowić w kontekście i wyjaśnić.
Publikacja stała się zatem jedynie pierwszym krokiem. Nierozstrzygnięte pozostaje pytanie, kto ma zapłacić za wszystko, co nastąpi później.
Ciężar weryfikacji został przeniesiony na matematyków
Publikacja czyni uwagę ekspertów rzadkim zasobem, podczas gdy OpenAI zachowuje kontrolę nad modelem, który stworzył tę podaż.
Tradycyjny artykuł trafia do systemu zbudowanego wokół rozpoznawalnych autorów, społeczności dyscyplinarnych, seminariów i recenzji naukowej. Mechanizmy te są niedoskonałe, ale rozdzielają odpowiedzialność.
Autorzy zazwyczaj wyjaśniają swoje metody, odpowiadają na zarzuty, poprawiają niejasne fragmenty i bronią twierdzeń przed kompetentną publicznością. Czytelnicy mogą zapytać, dlaczego dany lemat ma znaczenie lub jak powstał dany pomysł.
Rękopisy matematyczne OpenAI zrywają tę relację. Deklarowanym autorem jest faktycznie firma, a model pozostaje niedostępny dla badaczy z zewnątrz.
Matematyk, który odkryje nieprzejrzysty argument, nie może zapytać systemu, który go wygenerował. Pracownicy OpenAI mogą udzielić wyjaśnień, lecz nie są w stanie odtworzyć każdej wewnętrznej ścieżki rozumowania.
Problem ten staje się poważniejszy wraz ze skalą. Trudna praca może wymagać tygodni lub miesięcy skupionej lektury, nawet gdy została napisana przez ludzkich specjalistów.
Setki prac tworzą problem selekcji jeszcze przed rozpoczęciem weryfikacji. Badacze muszą zdecydować, które twierdzenia są dostatecznie wiarygodne, by uzasadniać poświęcenie ograniczonego czasu.
Niektóre rękopisy dotyczą pytań, które kształtowały całe kariery. Specjaliści nie mogą po prostu zignorować deklarowanego rozwiązania, gdy od wyniku zależą wnioski grantowe, rozprawy doktorskie i przyszłe publikacje.
Tworzy to asymetryczne bodźce. OpenAI korzysta, gdy wynik przetrwa kontrolę, podczas gdy niezależni badacze ponoszą znaczną część kosztów znajdowania błędów.
Enrico Fatighenti argumentował, że źle napisana praca człowieka mogłaby zostać szybko odrzucona. Praca wygenerowana przez AI może natomiast wywierać presję na ekspertów, by odtwarzali jej sens ze względu na postrzegane możliwości modelu.
Tristan Humbert opisał kontakt z materiałem, który uznał za nieczytelny, dotyczącym problemu leżącego w centrum jego rozprawy doktorskiej. Musiał też ponownie rozważyć plany badań podoktorskich.
Reakcje te ujawniają praktyczną konsekwencję zautomatyzowanych badań. Weryfikacja nie staje się darmowa tylko dlatego, że generowanie rękopisów staje się tanie.
Wąskie gardło przesuwa się z tworzenia tekstu do budowania zaufania. Ta zmiana jest już widoczna w oprogramowaniu, gdzie generowanie kodu jest łatwiejsze niż jego recenzowanie, zabezpieczanie i utrzymywanie.
Matematyka stawia jeszcze wyższy standard. Artykuł musi łączyć formalny wynik z istniejącą teorią, istotnymi cytowaniami i zrozumiałym ciągiem idei.
OpenAI twierdzi, że będzie rejestrować rewizje i zachowywać wcześniejsze wersje. Jest to wartościowe dla audytowalności, zwłaszcza gdy rękopisy znikają lub się zmieniają.
Historia wersji nie może zastąpić odpowiedzialnej interakcji naukowej. Badacze nadal potrzebują kogoś zdolnego odpowiadać na szczegółowe pytania o intencje, zależności i powiązane prace.
Reakcje społeczności pokazują, że ten ciężar jest rozłożony nierównomiernie. Specjaliści najbliżej deklarowanego wyniku odczuwają największą presję, by go zbadać.
Ich nagroda pozostaje niepewna. Potwierdzenie pracy OpenAI może wzmocnić twierdzenia firmy, podczas gdy jej skorygowanie może przynieść mniej uznania niż pierwotne ogłoszenie.
Istnieje także problem selekcji. Eksperci mogą priorytetowo traktować spektakularne twierdzenia, podczas gdy mniej głośne, poprawne wyniki otrzymają niewiele uwagi.
Zbiór może zatem zawierać zarówno ważną matematykę, jak i błędy, które pozostaną niezbadane. Skala utrudnia odróżnienie tych rezultatów.
Dlatego liczba rękopisów jest słabą miarą postępu naukowego. Użyteczny wynik potrzebuje weryfikacji, kontekstu, wyjaśnienia i społeczności zdolnej go przejąć.
Obfitość dowodów zderza się z matematycznym rozumieniem
OpenAI stworzyło obfitość dowodów, ale matematycy pytają, czy obfitość tworzy wiedzę, czy jedynie więcej obiektów do przetworzenia.
Kilka reakcji potraktowało publikację jako dowód rzeczywistej zmiany możliwości. Roman Sauer rozpoznał technikę, którą sam opracował, pojawiającą się w rozwiązaniach dwóch bardzo różnych problemów.
Określił te zastosowania jako głęboko twórcze i powiedział, że był oszołomiony. Ta reakcja podważa proste twierdzenie, że rękopisy są jedynie zautomatyzowaną imitacją.
Ben Green miał podobno znaleźć wyniki dotykające znacznej części programu stojącego za dużym grantem badawczym. Opisał aspekty zbioru jako szokujące.
Alvaro Lozano-Robledo podkreślił postęp modelu w kierunku Hipotezy Riemanna, zachowując przy tym ważne rozróżnienie. Wynik quasi-Riemanna byłby znaczący, ale nie rozwiązywałby pierwotnej hipotezy.
To rozróżnienie ma znaczenie w całym katalogu. Rękopis może rozstrzygać szczególny przypadek, poprawiać oszacowanie lub ustanawiać twierdzenie warunkowe, nie rozwiązując słynnego problemu nadrzędnego.
Nagłówki mogą sprowadzać te różnice do frazy „rozwiązane otwarte problemy”. Badacze nie mogą tego robić.
Najmocniejsza pozytywna interpretacja głosi, że AI może obecnie przeszukiwać matematyczne możliwości na skalę niedostępną dla pojedynczych naukowców. Może testować podejścia, łączyć techniki i tworzyć kandydackie argumenty w różnych specjalizacjach.
Ta zdolność mogłaby pomóc matematykom dostrzec powiązania, których inaczej by nie zauważyli. Mogłaby także otworzyć zaniedbane problemy na nowe metody.
Danny Calegari opisał powody do świętowania współpracy ludzi i AI. W jednym projekcie Claude firmy Anthropic napisał kod do matematycznej animacji z muzyczną ścieżką dźwiękową.
Constantin Kogler wyraził entuzjazm wobec pracy z zaawansowanymi modelami i napotykania nowych idei na żądanie. Dla badaczy mających dostęp doświadczenie to może przypominać rozszerzone środowisko twórcze.
Sceptyczna interpretacja zaczyna się tam, gdzie kończy się generowanie. Stephen Wolfram zauważył, że tworzenie ogromnej liczby twierdzeń nie wskazuje, które z nich ludzie uznają za wartościowe.
Matematyczne znaczenie częściowo zależy od gustu. Badacze wybierają pytania, ponieważ odpowiedzi rozjaśniają struktury, łączą dziedziny lub tworzą produktywne nowe problemy.
Model zoptymalizowany do rozwiązywania dostępnych hipotez dziedziczy program badawczy stworzony przez ludzi. Jego sukces może zatem mierzyć zdolność przeszukiwania, nie ustanawiając niezależnego matematycznego osądu.
Johannes Schmitt zaproponował pokrewną interpretację. OpenAI mogło wykorzystywać otwarte problemy przede wszystkim dlatego, że prostsze ewaluacje przestały testować jego modele graniczne.
W tym ujęciu artykuły są rezultatami rozwoju modeli, zanim staną się wkładem w społeczność naukową. Bodźce stojące za tymi działaniami są różne.
Laboratorium chce trudnych benchmarków, mierzalnych postępów i dowodów ogólnego rozumowania. Matematycy chcą wyjaśnień, które koledzy mogą analizować, uczyć i rozwijać.
Rezultat może być technicznie imponujący, a jednocześnie nie wspierać tych społecznych funkcji. To właśnie jest głębszym konfliktem stojącym za rękopisami matematycznymi OpenAI.
Terence Tao miał podobno dostrzec sprytne idee, które mogą okazać się owocne, gdy badacze je przyswoją. Frustrował go również brak osób zdolnych przedstawić i nauczać tę pracę.
Ian Agol porównał to wyzwanie z reakcją na prace Grigorija Perelmana dotyczące hipotezy Poincarégo. Zespoły przez lata rozwijały i wyjaśniały zwięzłe artykuły Perelmana.
To historyczne porównanie ma ograniczenia. Perelman był ludzkim autorem z spójnym programem intelektualnym, a nie systemem tworzącym setki rękopisów.
Mimo to pokazuje ono, że publikacja i wspólnotowe zrozumienie nigdy nie były tym samym. AI zwiększa dystans między nimi, zmieniając skalę.
Pytanie nie brzmi już, czy modele potrafią tworzyć matematykę wyglądającą na poważną. Pilniejsze jest pytanie, czy instytucje potrafią przekształcić ich wyniki w trwałą wiedzę.
Sprzeciw dotyczy karier, uznania autorstwa i kontroli
Wielu matematyków nie odrzuca samej automatyzacji. Odrzucają model publikacji, który może przekształcić kariery bez dzielenia się władzą.
Hugo Duminil-Copin napisał, że spodziewał się, iż maszyny w końcu przewyższą badaczy pod pewnymi względami. Nie spodziewał się, że tak wiele ważnych problemów padnie w ramach jednego ogłoszenia.
Jego reakcja uchwyciła emocjonalną asymetrię wydarzenia. Laboratorium odebrało publikację jako demonstrację, podczas gdy badacze doświadczyli jej jako nagłej zmiany w swoim życiu.
Matt Zaremsky porównał lata starannych postępów do wykopalisk archeologicznych. W jego analogii zamożna firma przyjechała, użyła materiałów wybuchowych, dostarczyła szkielet i odjechała.
Skarga nie polegała na tym, że kompletny szkielet nie miał wartości. Chodziło o to, że proces wymazał powolne odkrywanie, które nadawało pracy znaczenie zawodowe i intelektualne.
Tasmin Chu dokonała podobnego rozróżnienia. Wiedza o tym, czy twierdzenie jest prawdziwe, różni się od posiadania czasu, by osobiście przemyśleć problem.
Dla wielu badaczy takie myślenie nie jest uboczną pracą. To właśnie działalność, która przyciągnęła ich do matematyki.
Doktoranci stają wobec ostrzejszej wersji tego konfliktu. Ich kwalifikacje zależą od tworzenia oryginalnej pracy w ograniczonym czasie.
Rękopis wygenerowany przez AI może bez ostrzeżenia dojść do tego samego pytania. Nawet błędne twierdzenie może zmusić studenta do przekierowania wysiłków, dopóki specjaliści go nie rozstrzygną.
Rekrutacja na stanowiska podoktorskie potęguje niepewność. Kandydaci muszą opisywać przyszłe plany badawcze, lecz duży prywatny model może nagle opublikować twierdzenia dotyczące ich proponowanej agendy.
Starsi badacze mają reputację i sieci kontaktów, które pomagają im się dostosować. Matematycy na początku kariery mają mniejszą ochronę i mogą być oceniani, zanim nowa praca zostanie zweryfikowana.
Uznanie autorstwa tworzy kolejną linię podziału. Rękopisy czerpią z opublikowanej matematyki, istniejących hipotez i technik rozwijanych przez dziesięciolecia ludzkich badań.
OpenAI dostarcza informacje o cytowaniach, lecz właściwe przypisanie autorstwa wymaga czegoś więcej niż wygenerowania bibliografii. Specjaliści muszą ustalić, które idee są rzeczywiście nowe, a które jedynie przeformułowują znane argumenty.
Wcześniejszy spór dotyczący Naviera-Stokesa wzmocnił tę obawę. Badacze twierdzili, że praca OpenAI przecinała się z nieopublikowanymi badaniami ludzi i rodziła pytania o pierwszeństwo.
Obecna publikacja nie dowodzi niewłaściwego postępowania w pojedynczych rękopisach. Wyjaśnia jednak, dlaczego matematycy podeszli do katalogu z ograniczonym zaufaniem.
Henry Wilton skrytykował brak wskazanych ludzkich autorów i szczegółowych informacji o wskaźniku niepowodzeń. Jego zdaniem prezentacja sugerowała, że matematyka nie jest już traktowana jako ludzkie przedsięwzięcie.
OpenAI ujawnia, że podjęto próbę rozwiązania około 4 000 problemów. Opisuje także, jak rękopisy zgrupowano w rodziny wyników.
Te liczby nadal pozostawiają ważne pytania bez odpowiedzi. Czytelnicy nie mogą łatwo odtworzyć kryteriów selekcji, nieudanych podejść, odrzuconych wyników ani ludzkich decyzji stojących za publikacją.
Ta nieprzejrzystość wpływa na to, jak należy interpretować sukces. Model tworzący setki obiecujących wyników z tysięcy prób robi wrażenie, ale sam stosunek niewiele mówi.
Badacze muszą wiedzieć, jak wybierano problemy i jak filtrowano wyniki. Potrzebują także niezależnych testów poprawności i oryginalności.
Najostrzejsza krytyka dotyczy kontroli nad agendą. Martin Bridson ostrzegł przed pozwoleniem laboratoriom AI na decydowanie, które wyniki zasługują na uwagę społeczności.
Nie jest to ryzyko czysto teoretyczne. Badacze już przekierowują czas na czytanie, sprawdzanie i wyjaśnianie pracy wygenerowanej prywatnie.
Ta uwaga może wypierać pytania wybierane ze względu na wartość intelektualną, edukacyjną lub społeczną. Może też nagradzać dziedziny z benchmarkami, które modele potrafią atakować najskuteczniej.
OpenAI twierdzi, że planuje finansować warsztaty, konferencje i specjalne programy poświęcone rozumieniu ważnych wyników wygenerowanych przez AI. Takie wsparcie mogłoby zmniejszyć część obciążenia.
Finansowanie wzmacnia jednak również wpływ firmy na reakcję. Ta sama instytucja tworzy artykuły, kontroluje model i finansuje wysiłki zmierzające do ich interpretacji.
Podstawową kwestią jest zarządzanie. Kto wybiera problemy, weryfikuje twierdzenia, przyznaje uznanie autorstwa i decyduje, kiedy wynik jest gotowy na publiczną uwagę?
Bez wspólnej kontroli obfitość dowodów może przekształcić się w zależność. Matematycy zyskują dostęp do wyników, tracąc wpływ na warunki kształtujące ich dziedzinę.
Co musi się wydarzyć, zanim ta publikacja stanie się matematycznym punktem zwrotnym
Trzy sygnały zdecydują, czy zbiór stanie się trwałym dorobkiem badawczym, czy ogromną, niestabilną demonstracją.
Pierwszym sygnałem jest niezależna weryfikacja. Specjaliści muszą potwierdzić reprezentatywne, najważniejsze wyniki bez polegania wyłącznie na wewnętrznej ocenie OpenAI.
Formalizacje Lean mogą wspierać ten proces. Recenzenci muszą jednak również potwierdzić, że formalne twierdzenia odpowiadają matematycznym twierdzeniom, które czytelnicy uznają za ustalone.
OpenAI powinno nadal publikować formalne artefakty i historie korekt. Zewnętrzne grupy powinny odtwarzać kontrole przy użyciu przejrzystych konfiguracji i udokumentowanych zależności.
Wycofanie lub rewizja kilku rękopisów nie unieważniłaby całego zbioru. Praca naukowa zmienia się w trakcie recenzji.
Wysoki wskaźnik korekt osłabiłby jednak twierdzenia o niezawodności autonomicznych badań. Niski wskaźnik w różnych dziedzinach znacząco je wzmocniłby.
Drugim sygnałem jest to, czy matematycy potrafią przejąć te idee. Oznacza to wygłaszanie wystąpień, pisanie jaśniejszych opracowań, identyfikowanie technik nadających się do ponownego użycia i tworzenie dalszych badań.
Poprawny dowód, którego nikt nie potrafi wyjaśnić, pozostaje trudny do włączenia w żywą dyscyplinę. Może rozstrzygnąć twierdzenie, nie tworząc produktywnego programu badawczego.
Proofs and Prompts zapewnia wczesny zapis tego procesu przyswajania. Zebrane reakcje obejmują techniczny entuzjazm, krytykę dotyczącą konkretnych problemów i refleksję nad konsekwencjami zawodowymi.
Rzut oka na reakcje pokazuje również, dlaczego publiczne relacje nie powinny sprowadzać odpowiedzi do strachu. Badacze nie zgadzają się zarówno co do jakości, jak i znaczenia tej pracy.
Warto obserwować seminaria i niezależne artykuły przeglądowe poświęcone konkretnym rodzinom wyników. Takie materiały pokazałyby, że społeczność potrafi przekształcić rękopisy we wspólne rozumienie.
Brak takiej pracy sugerowałby, że produkcja wyprzedziła przyswajanie. Artykuły mogłyby pozostać technicznie interesujące, lecz kulturowo oderwane.
Trzecim sygnałem jest polityka OpenAI dotycząca udostępniania modeli. Firma twierdzi, że pracuje nad odpowiedzialnym udostępnieniem systemu, który wygenerował wyniki.
Dostęp pozwoliłby badaczom testować nowe problemy, analizować wzorce niepowodzeń i porównywać użycie wspomagające z autonomicznym generowaniem wsadowym.
Ograniczony dostęp utrzymałby obecną nierównowagę. OpenAI pozostałoby głównym producentem, a uniwersytety i niezależni badacze pełniliby rolę dalszych recenzentów.
Użyteczne udostępnienie musi też obejmować wystarczającą ilość szczegółów metodologicznych, aby umożliwić sensowną ocenę. Sam markowy interfejs nie zapewniłby odtwarzalności naukowej.
Konkurencja będzie tu miała znaczenie. Anthropic, Google DeepMind i wyspecjalizowane projekty dowodzenia twierdzeń również rozwijają systemy dla zaawansowanej matematyki.
Różne modele udostępniania mogłyby wywierać presję na OpenAI, by oferowało lepszy dostęp, silniejsze informacje o pochodzeniu lub bardziej rozliczalne praktyki publikacyjne. Mogłyby również zwiększyć problem nadmiaru materiału.
Zewnętrzna analiza porównuje matematykę z rozwojem oprogramowania, gdzie AI szybko przeszła od pomocy do autonomicznej produkcji.
To porównanie jest użyteczne, lecz sukcesu matematycznego nie można mierzyć wyłącznie wynikami. Twierdzenie nie ma testu wdrożeniowego odpowiednika uruchomienia programu w środowisku produkcyjnym.
Jego wartość rozwija się poprzez sprawdzanie dowodu, interpretację, cytowanie, nauczanie i dalsze odkrycia. Procesy te wymagają czasu, nawet gdy argument jest poprawny.
Czytelnicy powinni zatem oprzeć się dwóm przedwczesnym wnioskom. Publikacja nie dowodzi, że setki słynnych problemów zostały definitywnie rozwiązane.
Nie można jej też odrzucić jako pozbawionego znaczenia tekstu wyłącznie dlatego, że matematykom nie podoba się jej prezentacja. Kilku ekspertów wskazało wyniki i techniki, które wydają się naprawdę znaczące.
Rękopisy matematyczne OpenAI stanowią eksperyment z automatyczną publikacją badań w takim samym stopniu, jak eksperyment z rozumowaniem matematycznym. Model wygenerował artykuły, ale instytucje muszą zdecydować, co wydarzy się dalej.
Dla programistów i pracowników wiedzy lekcja wykracza poza matematykę. Tanie generowanie zwiększa wartość recenzji, informacji o pochodzeniu i osądu kontekstowego, a nie ją zmniejsza.
Dla uniwersytetów bezpośrednim zadaniem jest ochrona badaczy na początku kariery przy jednoczesnym tworzeniu niezależnych możliwości weryfikacji. Czekanie, aż każda teza zostanie rozstrzygnięta, pozostawi studentów bez ochrony.
Dla OpenAI standard wykracza teraz poza stworzenie kolejnego katalogu. Firma musi pokazać, że badacze mogą analizować, kwestionować, rozumieć i rozwijać tę pracę, nie stając się nieopłacanymi opiekunami.
Najbliższe miesiące powinny odpowiedzieć na konkretne pytanie: czy te rękopisy stworzą nowe społeczności badawcze, czy też pozostawią ekspertów sortujących kolejkę wyników?
Odpowiedź określi, czy 6 października oznacza nową formę matematycznej współpracy, czy początek kryzysu uwagi.



