top of page

Twierdzenia Anthropic o odkryciach naukowych AI przechodzą trudniejszy test

30 wrz
13 minut(y) czytania

Anthropic twierdzi, że około 950 agentów Claude znalazło wcześniej niescharakteryzowany system enzymatyczny po 21 godzinach przeszukiwania danych genomowych. Twierdzenie Anthropic o odkryciu naukowym przez AI jest istotne, lecz słowo „odkrycie” ma większą wagę niż udane wyszukiwanie w bazie danych.

Claude wybrał nietypową odwrotną transkryptazę, zbadał pobliskie DNA i zauważył powtarzalną strukturę przypominającą część systemu CRISPR. Naukowcy następnie przeanalizowali trop, zaprojektowali pracę laboratoryjną, przeprowadzili wszystkie fizyczne eksperymenty i zinterpretowali uzyskane dowody.

Ten podział pracy tworzy właściwy punkt sporny. Claude najwyraźniej wniósł znaczący wkład intelektualny, jednak odkrycie pozostaje preprintem o nieznanej funkcji biologicznej. Według raportu technicznego Anthropic wyszukiwanie nie doprowadziło też do tej samej obserwacji w dziesięciu dodatkowych kampaniach.

Historia jest zatem większa niż jeden kandydat na enzym. Stawia pytanie, jakie dowody powinny istnieć, zanim firma, czasopismo lub zespół badawczy stwierdzi, że system AI dokonał odkrycia naukowego.

Co właściwie znaleźli Anthropic i Claude

Claude zrobił więcej niż streszczanie artykułów, ale nie przeprowadził niezależnego badania naukowego.

Anthropic utworzył swoją grupę badawczą biologii molekularnej wiosną 2026 roku. Laboratorium w Bay Area łączy obliczeniowe wyszukiwania Claude z fizycznymi eksperymentami prowadzonymi przez naukowców.

Grupa przeszukuje bazy danych genomowych pod kątem niescharakteryzowanych systemów biologicznych. Bazy genomowe zawierają sekwencje DNA organizmów, wirusów i próbek środowiskowych, w tym wiele genów, których funkcje pozostają nieznane.

W swoim pierwszym publicznym projekcie Anthropic poprosił Claude o zbadanie odwrotnych transkryptaz. Odwrotna transkryptaza, czyli RT, to enzym kopiujący RNA do DNA.

Firma twierdzi, że agenci Claude zgromadzili ponad 200 000 sekwencji RT. Zidentyfikowali około 3 500 systemów kandydujących i zawęzili pole do 20 kandydatów przeznaczonych do szczegółowych raportów.

W kampanii wykorzystano około 950 równoległych agentów, trwała ona 21 godzin i zużyła około 210 milionów tokenów. Dane te pochodzą od Anthropic i nie zostały niezależnie zweryfikowane pod względem operacyjnym.

Jeden z agentów Claude zbadał surowe DNA w pobliżu nietypowej RT znalezionej w olbrzymim bakteriofagu. Bakteriofagi to wirusy infekujące bakterie, natomiast olbrzymie fagi mają wyjątkowo duże genomy.

Agent zauważył długą macierz powtarzających się sekwencji DNA obok RT. Zidentyfikował również sąsiedni gen, który może kodować białko partnerskie.

Claude policzył powtórzenia, zbadał odstępy między nimi, porównał układ genomowy ze znanymi systemami i wyszukał powiązaną literaturę. Następnie przekazał kandydata do oceny przez ludzi.

Anthropic nazwał trzyczęściowy układ odwrotnymi transkryptazami związanymi z macierzą, czyli ARTs. System zawiera RT, sąsiedni gen partnerski oraz macierz powtarzających się sekwencji DNA.

Eksperymenty laboratoryjne firmy wykazały, że macierz powtórzeń była transkrybowana do odrębnych krótkich cząsteczek RNA. Obserwacja ta wspiera pogląd, że składniki należą do jednego systemu biologicznego, zamiast przypadkowo zajmować ten sam region.

Anthropic opisuje ten układ jako przypominający CRISPR, ponieważ oba zawierają powtarzające się sekwencje wytwarzające RNA. Jednak podobieństwo na tym poziomie nie ustanawia równoważnej funkcji.

Badacze nie wykazali, że ART tnie DNA, celuje w konkretne sekwencje, edytuje geny ani zapewnia odporność przeciw wirusom. Jego naturalna funkcja pozostaje nieznana.

Firma przedstawiła wynik w swoim ogłoszeniu dotyczącym enzymu z 23 września. Opublikowała również preprint techniczny, a nie artykuł poddany recenzji naukowej.

To rozróżnienie ma znaczenie. Dowody potwierdzają wcześniej niescharakteryzowany układ genomowy i powiązany produkt RNA. Nie uzasadniają jeszcze opisywania ART jako nowego mechanizmu edycji genów.

Wkład Claude wydaje się mimo to bardziej istotny niż zwykłe wyszukiwanie literatury. Kluczowa obserwacja nie została zawarta w początkowym poleceniu Anthropic. Jeden z agentów zdecydował się zbadać otaczające DNA i zinterpretował macierz powtórzeń jako potencjalnie znaczącą.

To najsilniejsza część twierdzenia Anthropic o odkryciu naukowym przez AI. Model nie jedynie uszeregował odpowiedzi dostarczone przez ludzi. Wybrał kierunek, zauważył anomalię i zbudował testowalną hipotezę biologiczną.

Ograniczenia pojawiają się na kolejnym etapie. Ludzie zdecydowali, którą dziedzinę badań eksplorować, stworzyli infrastrukturę agentów, przejrzeli raporty, wybrali najbardziej obiecujący trop i wykonali eksperymenty.

To zdarzenie najlepiej rozumieć jako trop zainicjowany przez AI w systemie odkrywania kontrolowanym przez ludzi. To, czy zasługuje na krótsze określenie „odkrycie AI”, zależy od stosowanego standardu.

Test odkrycia naukowego AI Anthropic

Wiarygodne odkrycie AI wymaga nowości, wkładu przyczynowego, walidacji, odtwarzalności i przejrzystego pochodzenia danych.

Odkrycie naukowe nie jest pojedynczym działaniem. Obejmuje wybór problemu, identyfikację wzorca, zaproponowanie wyjaśnienia, przetestowanie tego wyjaśnienia oraz przekonanie innych badaczy, że wynik jest rzeczywisty.

System AI nie musi wykonywać każdego etapu, aby wnieść wartościowy wkład. Badacze również dzielą pracę naukową między zespoły, instrumenty, bazy danych i wyspecjalizowane laboratoria.

Trudniejsze pytanie dotyczy znaczenia przyczynowego. Czy Claude zmienił przebieg projektu, czy też zautomatyzował kroki, które i tak doprowadziłyby do tego samego wyniku?

Pięć testów może pomóc rozdzielić te możliwości.

Pierwszym testem jest nowość. Wynik powinien dodawać coś, co nie było już dostępne w opublikowanej literaturze ani wyraźnie zakodowane w danych wejściowych.

Anthropic twierdzi, że nie znalazł wcześniejszej publikacji opisującej ART jako trzyczęściowy system w swoim raporcie. Wspiera to nowość w formalnym zapisie naukowym.

Brak w opublikowanej literaturze nie jest jednak tym samym co brak w ludzkiej wiedzy. Badacze rutynowo dysponują nieopublikowanymi wynikami, szkicami manuskryptów, dyskusjami konferencyjnymi i niepełnymi analizami.

Drugim testem jest wkład intelektualny. AI powinno podjąć decyzję, która istotnie zmienia badanie.

Claude spełnia część tego testu. Początkowe polecenie dotyczyło interesujących systemów RT, lecz nie nakazywało agentom odnalezienia definiującej macierzy powtórzeń. Jeden z agentów zdecydował się odczytać pobliskie DNA i oznaczył nieoczekiwaną strukturę.

Ta decyzja ma znaczenie, ponieważ konwencjonalny pipeline wyszukiwania sekwencji mógłby zgromadzić powiązane enzymy bez interpretowania ich otoczenia genomowego. Claude połączył kilka wskazówek w szerszą propozycję biologiczną.

Trzecim testem jest walidacja eksperymentalna. Wzorzec obliczeniowy staje się bardziej przekonujący, gdy fizyczny eksperyment dostarcza dowodów przewidzianych przez hipotezę.

Naukowcy Anthropic znaleźli krótkie produkty RNA związane z macierzą powtórzeń. Wynik ten wzmacnia twierdzenie, że macierz jest biologicznie aktywna.

Pozostaje to jednak wczesną walidacją. Eksperyment nie ustala podstawowej funkcji systemu, jego celu ani roli białka partnerskiego.

Czwartym testem jest odtwarzalność. Inny zespół powinien być w stanie powtórzyć wynik albo proces w udokumentowanych warunkach.

Sekwencje genomowe ART mogą zostać zbadane przez innych naukowców. Niezależne laboratoria mogą również sprawdzić, czy jego powtórzenia wytwarzają RNA.

Proces odkrycia jest mniej odtwarzalny. Anthropic miał podobno ponowić kampanię wyszukiwania dziesięć razy i żadna z tych kampanii nie odkryła ponownie definiującej macierzy.

Odpowiednie loci pojawiały się podczas większości ponownych uruchomień, lecz agenci nie badali DNA powyżej, zawierającego kluczowy wzorzec. Oznacza to, że pierwotny sukces zależał od rzadkiej decyzji badawczej.

Rzadki sukces nadal może być odkryciem. Wiele ludzkich odkryć wiąże się z przypadkiem, ciekawością lub dostrzeżeniem przez badacza czegoś, co inni przeoczyli.

Jednak dziesięć nieudanych powtórzeń osłabia szersze twierdzenie, że Anthropic zbudował niezawodny silnik odkryć. Pokazują one zdolność w jednej trajektorii, a nie niezawodne działanie w powtarzanych kampaniach.

Piątym testem jest pochodzenie danych. Badacze potrzebują zapisów pokazujących, który model otrzymał jakie dane, jakich narzędzi użył, co zmienili ludzie i jak wybrano kandydatów.

Pochodzenie danych jest szczególnie istotne w przypadku modeli językowych, ponieważ ich dane treningowe nie mogą być sprawdzone równie łatwo jak notatnik laboratoryjny. Wynik może wydawać się nowy, nawet gdy powiązane informacje wpłynęły na model niejasną drogą.

Te pięć standardów tworzy bardziej użyteczny opis niż binarny werdykt. Claude wygenerował potencjalnie nowy trop, wniósł istotną obserwację i pomógł ukształtować testowalną hipotezę.

Ludzie dostarczyli cel badawczy, kryteria oceny, dowody laboratoryjne i naukową odpowiedzialność. Ogólny wynik ma charakter współpracy, nawet jeśli konkretny wkład Claude był wyjątkowo autonomiczny.

Te ramy pozwalają także uniknąć niepomocnego wymogu całkowitej niezależności. Naukowcy polegają na instrumentach, kolegach, wcześniejszych publikacjach, oprogramowaniu i wiedzy instytucjonalnej. Systemy AI również będą działać w większych organizacjach badawczych.

Istotnym progiem nie jest to, czy Claude pracował sam. Chodzi o to, czy system wniósł możliwy do prześledzenia wkład, którego eksperci nie określili z góry i który później został poparty dowodami.

Nowość jest teraz najbardziej spornym dowodem

Centralny spór nie dotyczy tego, czy wzorzec DNA istnieje, lecz tego, czy Claude niezależnie dotarł do czegoś, co badacze już wiedzieli.

Po ogłoszeniu ART przez Anthropic biolog obliczeniowy z Uniwersytetu Kopenhaskiego Mario Rodríguez Mestre zakwestionował narrację o oryginalności.

Rodríguez Mestre powiedział, że jego grupa badała powiązane odwrotne transkryptazy i związane z nimi cząsteczki przez około cztery lata. Jego zespół używał nieformalnej nazwy „jumbotrons” dla tych enzymów.

Powiedział również, że członkowie grupy dostarczyli Claude nieopublikowane materiały podczas wykorzystywania modelu do wsparcia badań. Materiały te miały obejmować szkice i informacje eksperymentalne.

Jego obawa była więc konkretna. Claude mógł niezależnie wnioskować na podstawie publicznych danych genomowych albo nieopublikowana praca ludzi mogła wpłynąć na jego wyniki nieznaną drogą.

Anthropic odpowiedział, że nie wiedział o opublikowanej pracy opisującej system ART. Firma stwierdziła również, że Claude nie był trenowany na transkrypcjach klientów, a jej zespół biologii molekularnej nie ma dostępu do tych rozmów.

Sprzeczne relacje, opisane w niezależnym reportażu, nie rozstrzygają kwestii pochodzenia danych.

Nieopublikowana praca Rodrígueza Mestre nie unieważnia automatycznie ustalenia Anthropic. Niezależne grupy badawcze często dochodzą do podobnych wyników, zwłaszcza gdy analizują te same publiczne zbiory danych.

Jego relacja ujawnia słabość obecnych twierdzeń o odkryciach AI. Firma może udokumentować polecenie i transkrypcję agentów, pozostając jednocześnie niezdolną do przedstawienia pełnego opisu informacji osadzonych w modelu podczas jego rozwoju.

Tworzy to kilka odrębnych pytań o nowość.

Nowość publikacyjna pyta, czy wynik pojawia się w formalnej literaturze. Anthropic twierdzi, że nie znalazł wcześniejszego artykułu opisującego kompletny układ ART.

Nowość danych pyta, czy wzorzec był widoczny w istniejących zapisach genomowych. Był, ponieważ Claude znalazł go, przeszukując publiczne dane sekwencyjne.

Nowość interpretacyjna pyta, czy ktokolwiek wcześniej rozpoznał te komponenty jako jeden system biologiczny. Ta kwestia jest sporna.

Nowość modelu pyta, czy Claude wyprowadził tę interpretację podczas kampanii, czy odtworzył wiedzę zdobytą wcześniej. Publicznie dostępne dowody nie dają na to pytanie rozstrzygającej odpowiedzi.

Uznanie naukowe staje się trudne, gdy te kategorie zostają połączone. Wzorzec może być obecny w starych danych, podczas gdy jego interpretacja pozostaje nowa. Drugi zespół może również opublikować ważne, niezależne odkrycie po tym, jak inna grupa dotarła do niego prywatnie.

Spór pokazuje, dlaczego systemy AI wykorzystywane w badaniach potrzebują większej przejrzystości niż dopracowany fragment transkrypcji. Zespoły powinny wskazywać wersje modeli, dostęp do danych, źródła wyszukiwania, interwencje ludzi, filtry kandydatów oraz znane ryzyka wcześniejszej ekspozycji.

Badacze potrzebują również zasad dotyczących pracy poufnej. Naukowcy coraz częściej używają ogólnych asystentów do programowania, redakcji, analizy danych i przeglądu literatury. Potrzebują jasnych gwarancji dotyczących przechowywania, trenowania, wyszukiwania i dostępu organizacyjnego.

Problem wykracza poza Anthropic. Dostawca AI może jednocześnie prowadzić laboratoria, publikować badania i sprzedawać narzędzia naukowcom zewnętrznym. Role te tworzą postrzegany konflikt interesów, nawet jeśli zabezpieczenia techniczne zapobiegają wyciekowi danych.

Zaufanie zależy więc od możliwego do audytu rozdzielenia, a nie wyłącznie od korporacyjnego zaprzeczenia. Dostawcy powinni uczynić swoje mechanizmy kontroli danych na tyle zrozumiałymi, aby zewnętrzni badacze mogli je ocenić.

Zespoły badawcze mogą chronić się, traktując interakcje z AI jako część systemu zarządzania informacją. Prompty, przesłane szkice, wyniki modeli i zasady dostępu powinny znajdować się obok dokumentacji laboratoryjnej w przeszukiwalnej bazie wiedzy.

Ta praktyka nie może ujawnić ukrytych danych treningowych. Może jednak ustalić, czym grupa badawcza się podzieliła, kiedy to zrobiła i który model obsługiwał dany materiał.

Dopóki konkurencyjne badania nie zostaną opublikowane, spór o oryginalność ART pozostaje nierozstrzygnięty. Nie powinien ani przekreślać udokumentowanego zachowania Claude'a podczas wyszukiwania, ani być bagatelizowany jako drobny problem komunikacyjny.

Nowość jest jednym z fundamentów odkrycia. Jeśli badacze nie mogą prześledzić pochodzenia idei wygenerowanej przez AI, nawet najmocniejszy nagłówek pozostanie podatny na podważenie.

Wiarygodność Jest Ważniejsza Niż Jeden Szczęśliwy Przypadek

Jedna udana kampania pokazuje, że Claude może przyczyniać się do odkryć, podczas gdy dziesięć niepowodzeń pokazuje, że Anthropic nie może jeszcze obiecać powtarzalnego procesu.

Nieudane ponowne uruchomienia nie są przypisem. Określają różnicę między efektowną demonstracją a niezawodnym systemem naukowym.

Pierwotna kampania Claude'a badała ogromne drzewo decyzyjne. Agenci wybierali rodziny białek, analizowali sąsiednie fragmenty genomu, odrzucali kandydatów i decydowali, które surowe sekwencje zasługują na bliższą analizę.

Tylko jedna ścieżka obejmowała decydujący wybór, by odczytać odpowiedni DNA znajdujący się powyżej. Model następnie zauważył macierz powtórzeń i powiązał ją z sąsiadującą RT.

Przypomina to ludzką przypadkowość odkryć. Naukowiec może dokonać ważnej obserwacji, ponieważ jedna próbka wyglądała nietypowo albo dlatego, że nieoczekiwany wynik skłonił go do kolejnego testu.

Nauka nie wymaga, aby pierwotny proces myślowy powtarzał się identycznie. Wymaga, aby wynikające z niego twierdzenie przetrwało niezależną weryfikację.

Z tego powodu ART może pozostać interesujący naukowo, nawet jeśli Claude nigdy więcej go nie odkryje. Układ biologiczny nie znika, gdy agent obiera inną ścieżkę.

Nieudane ponowne uruchomienia nadal mają znaczenie dla twierdzeń dotyczących produktu i możliwości. Organizacja nie może planować zdolności badawczych wokół agenta, który odnosi sukcesy nieprzewidywalnie, nie znając wskaźnika jego porażek.

Opisany przez Anthropic lejek pomaga zilustrować problem. Ponad 200 000 RT przekształcono w 3 500 kandydatów, następnie w 20 szczegółowych raportów, po czym nastąpiła pojedyncza definiująca obserwacja.

Pełna ocena wymagałaby czegoś więcej niż zwycięskiego przykładu. Obejmowałaby wyniki fałszywie dodatnie, powielone znane systemy, błędy adnotacji, odrzucone raporty, czas poświęcony przez naukowców na ocenę, zużycie zasobów obliczeniowych i koszty laboratoryjne.

Powinna również uwzględniać negatywne kampanie. Publikowanie wyłącznie udanych wyszukiwań sprawiłoby, że niestabilny system wyglądałby na bardziej niezawodny, niż jest w rzeczywistości.

To luka weryfikacyjna, przed którą stoją autonomiczni agenci badawczy. Modele mogą tworzyć hipotezy znacznie szybciej, niż eksperci są w stanie je sprawdzać.

Anthropic twierdzi, że jedna kampania może wygenerować setki lub tysiące raportów o kandydatach. Każdy dodatkowy raport rywalizuje o uwagę specjalistów, materiały eksperymentalne, czas w laboratorium i ocenę bezpieczeństwa.

Wąskie gardło zatem się przesuwa. AI obniża koszt proponowania możliwości, ale może zwiększać koszt decydowania, którym z nich warto zaufać.

Ta zmiana wpływa na to, co badacze powinni optymalizować. Generowanie większej liczby hipotez jest użyteczne tylko wtedy, gdy system rankingu kieruje ograniczone eksperymenty ku lepszym kandydatom.

Wiarygodny benchmark wykorzystywałby wcześniej ukryte odkrycia lub zbiory danych o znanych wynikach. AI musiałaby identyfikować istotne tropy bez znajomości odpowiedzi, podczas gdy ewaluatorzy mierzyliby czułość, precyzję, koszt i nakład pracy ekspertów.

Badania prospektywne stanowią jeszcze silniejszy test. Zespół może zarejestrować cel badawczy, zamrozić model i system agentowy, opublikować zasady oceny, a następnie rejestrować każdego kandydata przed uzyskaniem wyników eksperymentalnych.

Niezależna replikacja dodałaby kolejną warstwę. Zewnętrzne laboratoria mogłyby testować wybrane tropy, nie wiedząc, które pochodzą od ludzi, a które od AI.

Praktyki te brzmią wymagająco, ponieważ odkrycia naukowe są wymagające. Benchmark chatbota może zaakceptować jedną poprawną odpowiedź. Badania biologiczne muszą mierzyć się z zanieczyszczonymi próbkami, zaszumionymi testami, niepełnymi adnotacjami i alternatywnymi wyjaśnieniami.

Wiarygodność różni się również między etapami. Claude może skutecznie przeszukiwać duże kolekcje sekwencji, lecz być mniej niezawodny przy wyborze kontroli eksperymentalnych lub interpretowaniu niejednoznacznych wyników laboratoryjnych.

Uczciwa ocena powinna przedstawiać te możliwości oddzielnie. Nazywanie całego systemu autonomicznym ukrywa, gdzie ludzie zapewniają osąd, a gdzie model faktycznie radzi sobie dobrze.

Kampania ART obecnie wspiera wąski wniosek. Claude może czasem poruszać się po publicznych danych genomowych, zauważać niewymuszony wzorzec strukturalny i formułować hipotezę wartą przetestowania.

Nie dowodzi, że Claude wielokrotnie odkrywa ważną biologię, zastępuje ekspercką ocenę ani prowadzi kompleksowe badanie laboratoryjne.

Ten węższy wniosek nadal ma znaczenie. Większość praktycznych technologii zaczyna jako możliwości działające niekonsekwentnie, zanim inżynieria uczyni je niezawodnymi.

Kolejnym wyzwaniem Anthropic nie jest stworzenie następnej zapadającej w pamięć transkrypcji. Jest nim przekształcenie rzadkich sukcesów w mierzalne wyniki badań.

Laboratoria AI Zbliżają Się Do Tego Samego Modelu Badawczego

Anthropic dołącza do szerszego wyścigu, którego celem jest połączenie agentów generujących hipotezy z weryfikacją eksperymentalną.

Google opracował AI co-scientist oparty na wielu wyspecjalizowanych agentach. Po otrzymaniu celu badawczego system generuje, krytykuje, klasyfikuje i udoskonala hipotezy.

Opublikowane badanie Co-Scientist opisuje kryteria obejmujące nowość, wiarygodność, testowalność i bezpieczeństwo. Eksperci dziedzinowi nadal definiują cele badawcze i oceniają wyniki.

Wcześniejsze systemy łączyły modele językowe ze sprzętem laboratoryjnym. Agent chemiczny z 2023 roku przeszukiwał dokumentację techniczną, planował procedury i wydawał polecenia zautomatyzowanemu sprzętowi.

Projekty te różnią się pod względem autonomii i zakresu naukowego, lecz dzielą jedną architekturę. AI zajmuje się wyszukiwaniem i planowaniem, narzędzia wykonują pracę obliczeniową, a ludzie lub maszyny przeprowadzają eksperymenty.

Podejście Anthropic pozostaje celowo obsługiwane przez ludzi w fizycznym laboratorium. Firma twierdzi, że jej naukowcy wykonują całą pracę wet-lab, ponieważ projekty obejmują elastyczne procedury, które nie nadają się do pełnej automatyzacji.

Taka konstrukcja zapewnia praktyczne zabezpieczenia. Wykwalifikowani biolodzy mogą odrzucać słabe hipotezy, dostrzegać problemy eksperymentalne i zapobiegać niebezpiecznym lub pozbawionym sensu procedurom.

Komplikuje również przypisywanie zasług. Ludzki osąd pojawia się przed i po wkładzie Claude'a, podczas gdy firma opisuje końcowy rezultat za pomocą pojedynczego określenia odkrycia AI.

Lepszym porównaniem nie jest naukowiec AI kontra naukowiec człowiek. Jest nim jedna organizacja badawcza kontra druga.

Jedna organizacja może zatrudniać pięciu naukowców korzystających z konwencjonalnej bioinformatyki. Druga może zatrudniać pięciu naukowców koordynujących setki sesji z modelami. Ich względna wartość zależy od zweryfikowanych odkryć w przeliczeniu na czas, pieniądze i uwagę ekspertów.

To organizacyjne spojrzenie wskazuje również, kto znajdzie się pod presją.

Platformy bioinformatyczne będą musiały zapewnić bardziej przyjazny dla agentów dostęp do danych sekwencyjnych i narzędzi analitycznych. Firmy zajmujące się automatyzacją laboratoriów będą potrzebować interfejsów zachowujących mechanizmy kontroli, uprawnienia i pełne dzienniki aktywności.

Wydawcy będą potrzebować jaśniejszych deklaracji wkładu. Obecne listy autorów rzadko wyjaśniają, czy model wybrał kierunek badań, zaprojektował eksperyment, przeanalizował dane czy jedynie zredagował tekst.

Uniwersytety będą potrzebować zasad dotyczących materiałów poufnych. Badacze nie mogą oceniać sporów o pierwszeństwo, jeśli polityka instytucjonalna traktuje każdą interakcję z AI jako nieformalną rozmowę.

Agencje finansujące mogą również pytać, czy projekty intensywnie wykorzystujące AI tworzą rzeczywistą wiedzę, czy tylko zalewają recenzentów tanimi hipotezami. Ocena wniosków będzie wymagać mocniejszych dowodów dotyczących zdolności walidacyjnych.

Framework automatyzacji opracowany przez OECD przewidział wiele z tych pytań. Automatyzację nauki należy oceniać w całych przepływach pracy, a nie poprzez izolowane wyniki modeli.

Przewaga konkurencyjna może zatem wynikać z integracji, a nie wyłącznie z inteligencji modelu. Wartościowe systemy potrzebują godnego zaufania dostępu do danych, narzędzi dziedzinowych, możliwości eksperymentalnych i zdyscyplinowanej dokumentacji.

Laboratorium Anthropic zapewnia wszystkie cztery komponenty. Firma może aktualizować instrukcje dla agentów na podstawie tego, które hipotezy jej naukowcy akceptują lub odrzucają.

Ta pętla sprzężenia zwrotnego ma znaczenie komercyjne i naukowe. Firma może przekształcać ekspercki osąd w lepsze procedury dla późniejszych wyszukiwań.

Czyni to także zewnętrzną ocenę ważniejszą. Prywatne laboratorium może obserwować porażki, które nigdy nie stają się publiczne, udoskonalać swój system i ogłaszać wyłącznie najsilniejszy przypadek.

Recenzja naukowa częściowo rozwiązuje tę nierównowagę, lecz konwencjonalna recenzja bada końcowe twierdzenie naukowe. Może nie audytować ekspozycji modelu na dane treningowe, dzienników agentów, lejka selekcji ani odrzuconych kandydatów.

Nowe standardy raportowania powinny obejmować zarówno biologię, jak i proces odkrycia. W przeciwnym razie czytelnicy będą mogli zweryfikować system enzymatyczny, nie mogąc zweryfikować twierdzenia o tym, kto go odkrył.

Trzy Sygnały Zdecydują, Czy Twierdzenie Się Utrzyma

Kolejne dowody muszą wykazać wartość biologiczną, niezależną nowość i powtarzalną wydajność AI.

Pierwszym sygnałem jest funkcjonalna charakterystyka ART.

Obecne eksperymenty Anthropic pokazują, że macierz powtórzeń wytwarza krótkie RNA. Badacze nadal muszą ustalić, co kopiuje RT, co robi sąsiednie białko oraz czy system celuje w inną cząsteczkę.

Dowody na spójną funkcję biologiczną wzmocniłyby naukowe znaczenie wyniku. Nie dowiodłyby automatycznie, że ART działa jak CRISPR.

Programowalna aktywność podniosłaby stawkę jeszcze bardziej. Obecnie jednak żadne dowody nie potwierdzają twierdzeń, że ART edytuje geny lub może stać się platformą biotechnologiczną.

Drugim sygnałem są publikacje grupy z Kopenhagi oraz innych niezależnych badaczy.

Ich wyniki mogą wyjaśnić, czy ten sam system został już wcześniej rozpoznany, jak daleko posunęła się jego charakterystyka oraz czy ich interpretacja jest zgodna z interpretacją Anthropic.

Znaczenie będą miały udokumentowane harmonogramy. Daty wersji roboczych, zapisy eksperymentów, identyfikatory sekwencji, materiały konferencyjne i logi interakcji z Claude mogą odróżnić równoczesne odkrycie od wcześniejszej wiedzy.

Anthropic może wzmocnić swoje stanowisko, przedstawiając szczegółowy opis pochodzenia ustaleń. Powinien on wyjaśniać, z jakich publicznych zasobów korzystali agenci oraz w jaki sposób wykluczono dane klientów.

Jeśli grupy zidentyfikowały system niezależnie, ten epizod będzie przypominał dobrze znany wzorzec naukowy. Wiele zespołów często dochodzi do podobnych wniosków, gdy nowe dane lub narzędzia sprawiają, że problem staje się rozwiązywalny.

Jeśli na Claude wpłynęły nieopublikowane prace, wydarzenie stanie się ostrzeżeniem przed wykorzystywaniem komercyjnych systemów AI do poufnych badań. Wynik naukowy może pozostać ważny, ale jego przypisanie autorstwa znacząco się zmieni.

Trzecim sygnałem jest prospektywna replikacja procesu pracy agentów Anthropic.

Anthropic powinien przeprowadzić dodatkowe poszukiwania w dziedzinach, w których odpowiedzi nie są znane agentom ani oceniającym. Powinien zarejestrować zadanie, zachować wszystkie przebiegi i ujawnić wskaźniki sukcesu.

Najmocniejsze badanie porównałoby agentów Claude z zespołami ekspertów, tradycyjnymi pipeline’ami bioinformatycznymi oraz prostszymi procesami wykorzystującymi modele językowe. Każda grupa otrzymałaby te same dane i ten sam czas na ocenę.

Badacze mogliby następnie mierzyć istotne wyniki: nowe, zweryfikowane tropy, wyniki fałszywie dodatnie, czas do odkrycia, wykorzystanie zasobów obliczeniowych, nakład pracy laboratoryjnej oraz godziny przeglądu eksperckiego.

Powtarzalny sukces wzmocniłby narrację Anthropic o naukowych odkryciach AI. Dalsza zależność od rzadkich, niemożliwych do odtworzenia trajektorii przemawiałaby za węższym opisem: Claude jest użytecznym narzędziem eksploracyjnym.

Tej węższej roli nie należy traktować jako porażki. Instrumenty naukowe mogą przekształcać badania, nie stając się odkrywcami w ludzkim sensie.

Język odkryć ma znaczenie, ponieważ kształtuje finansowanie, oczekiwania społeczne, uznanie naukowe i zaufanie. Firmy zyskują uwagę, gdy przypisują sprawczość swoim modelom, podczas gdy wkład ludzi może zniknąć za nazwą produktu.

Uczciwy standard powinien uznawać znaczący wkład maszyn, nie udając jednocześnie, że otaczająca go instytucja nie istnieje.

Na razie Claude wydaje się przekraczać ważny próg. Dokonał niewymuszonej obserwacji, która zmieniła to, co ludzcy naukowcy zdecydowali się przetestować.

Nie przekroczył jednak wszystkich progów. Funkcja pozostaje nieznana, oryginalność jest kwestionowana, praca oczekuje na recenzję naukową, a powtarzane kampanie nie dostrzegły kluczowej wskazówki.

Najbardziej uzasadniony wniosek jest zatem warunkowy. System AI może otrzymać uznanie za odkrycie, gdy jego nowa, możliwa do prześledzenia decyzja istotnie kształtuje zweryfikowany wynik i wytrzymuje niezależną kontrolę.

Anthropic przedstawił dowody dotyczące decyzji i wstępnej walidacji. Nadal jest winien społeczności naukowej mocniejsze dowody na nowość, pochodzenie ustaleń i powtarzalność.

Czytelnicy powinni obserwować eksperymenty, a nie etykietę. Czy ART zyska jasno określoną funkcję? Czy zewnętrzne laboratoria ją potwierdzą? Czy Claude potrafi generować równie wartościowe tropy w testach prospektywnych?

Odpowiedzi na te pytania zdecydują, czy była to szczęśliwa obserwacja wspomagana przez AI, czy początek niezawodnej metody badawczej. Do tego czasu „AI scientific discovery” powinno opisywać twierdzenie poddawane badaniu, a nie uznane osiągnięcie.

 
 

Zacznij bezpłatnie

Asystent AI działający przede wszystkim lokalnie, z funkcją zarządzania wiedzą osobistą

Aby zapewnić lepsze działanie AI,

remio obsługuje obecnie wyłącznie Windows 10+ (x64) i M-Chip Macs.

Twój partner AI w pracy
Zrób więcej z remio

Planuj. Twórz. Dostarczaj.
Wszystko w jednym miejscu.

bottom of page