Rozwiązanie Cyphral Distich przez Fable 5.1 przechodzi trudny test weryfikacji
Fable 5.1 miał podobno odszyfrować Cyphral Distich w 44 minuty, kończąc zagadkę związaną z książką z 1653 roku. Wynik Fable 5.1 Cyphral Distich wydawał się wyjątkowo przekonujący, ponieważ zaproponowana wiadomość odpowiadała strukturze szyfru i poglądom politycznym jego autora. Następnie badacze przeanalizowali różne zachowane egzemplarze, zakwestionowali dowody i przekształcili prostą historię zwycięstwa w test standardów badań AI.
Raport z 31 sierpnia pochodził od firmy Vals AI zajmującej się ewaluacją AI, a nie od Anthropic ani akademickiego zespołu kryptograficznego. Vals podało, że model Claude przetworzył 176 000 tokenów bez dalszych ingerencji człowieka. Zaproponował prostą regułę indeksowania, która przekształciła 64 liczby w dwuwersową modlitwę popierającą króla Karola II.
Wyjaśnienie to jest wiarygodne, zapadające w pamięć i częściowo odtwarzalne. Jednak wczesna próba replikacji wykazała, że jedna zdigitalizowana kopia z 1653 roku nie zawierała szyfru i wykorzystywała inny tekst źródłowy. Późniejsze badanie zidentyfikowało kolejny zachowany egzemplarz, który podobno zawiera Distich. Spór koncentruje się teraz na wydaniach, dokładnych danych wejściowych oraz na tym, czy każdą odszyfrowaną literę można niezależnie odtworzyć.
Co Fable 5.1 faktycznie odkrył
Kluczowym spostrzeżeniem modelu było to, że kluczem do szyfru wydawała się otaczająca go książka, a nie odrębny alfabet kryptograficzny.
Cyphral Distich sir Thomasa Urquharta zawiera dwa wiersze po 32 liczby. Distich to dwuwiersz, natomiast kryptogram to wiadomość ukryta za pomocą określonej reguły kodowania. Zagadkę omawiano w kontekście historycznym co najmniej od 1899 roku, lecz nie doczekała się powszechnie uznanego rozwiązania.
Według eksperymentu z szyfrem, Fable 5.1 połączył te dwa wiersze po 32 liczby z 32 sekcjami zwanymi Proquiritations. Fragmenty te wyrażają życzenia, pragnienia lub nadzieje Urquharta. Urquhart zwracał też uwagę na liczbę 32 w otaczającym tekście.
Proponowana reguła ma charakter mechaniczny. Dla pierwszej liczby w dowolnym wierszu szyfru czytelnik przechodzi do pierwszej Proquiritation. Liczba wybiera słowo w obrębie tej sekcji, a pierwsza litera tego słowa staje się literą tekstu jawnego. Druga liczba wskazuje drugą Proquiritation i tak dalej, przez wszystkie 32 pozycje.
Zastosowana do obu wierszy reguła tworzy wiadomość proszącą Boga o wsparcie Karola II i uczynienie go najwyższym władcą kraju. Pisownia „Charls” jest zgodna z użyciem z XVII wieku, a nie stanowi oczywistej współczesnej korekty.
Kilka cech czyni proponowane odczytanie przekonującym. Każdy odszyfrowany wiersz zawiera 32 litery, co odpowiada strukturze 32 liczb. Wiersze kończą się rymującymi się słowami, spełniając oczekiwaną formę distichu. Wiadomość odzwierciedla również udokumentowane rojalistyczne przekonania Urquharta.
Kontekst polityczny ma znaczenie, ponieważ Urquhart pisał w okresie po egzekucji Karola I. Gdy ukazały się istotne dzieła, Karol II pozostawał poza władzą. Ukryty apel o jego restaurację pasuje do autora i epoki.
Vals twierdzi, że model dotarł do tej interpretacji po 44 minutach i 176 000 tokenów. Operator, Geby Jaff, miał podobno wskazać ogólny cel i początkowo zachęcić model, lecz nie ingerował podczas udanego przebiegu.
Eksperyment nie był ślepym benchmarkiem z ustalonym z góry celem. Jaff poprosił model o wybranie nierozwiązanego szyfru oferującego odpowiedź, którą można rozsądnie zweryfikować. Odwiódł go też od wyjątkowo trudnych celów, takich jak Kryptos K4.
To rozróżnienie nie unieważnia wyniku, ale zmienia to, co wynik mierzy. Sesja testowała łącznie wybór problemu, badania online, formułowanie hipotez, wytrwałość i samokontrolę. Nie wyodrębniała umiejętności kryptoanalitycznych poprzez kontrolowane porównanie.
Model najwyraźniej przeanalizował kilku kandydatów, zanim zatrzymał się przy zagadce Urquharta. Vals podaje również, że inne czołowe modele nie zdołały uzyskać zweryfikowanego rozwiązania podczas wcześniejszych prób. Firma nie opublikowała pełnego zestawienia wszystkich modeli, promptów, kandydatów i nieudanych przebiegów.
Bez tych informacji liczba 44 minut opisuje jedną udaną ścieżkę. Nie ustala ogólnego prawdopodobieństwa, że Fable 5.1 potrafi rozwiązywać podobne zagadki historyczne.
Mechanizm Fable 5.1 Cyphral Distich jest sednem historii
Istotną zdolnością nie było działanie metodą brute force, lecz połączenie struktury dokumentu, języka i kontekstu historycznego w regułę, którą można przetestować.
Tradycyjne ataki najwyraźniej traktowały liczby jako dane wejściowe zewnętrznego systemu szyfrowego. Badacze rozważali podstawienie, analizę częstotliwości i pokrewne techniki. Takie podejścia zakładają, że sekwencja liczb odwzorowuje litery lub symbole za pomocą odrębnego klucza.
Fable 5.1 potraktował natomiast dokument jako strukturę danych. Zgodne liczby stanowiły początkowy sygnał: 32 ponumerowane pozycje w każdym wierszu i 32 pobliskie Proquiritations. Powtarzający się język życzeń tworzył semantyczne połączenie między poematem wprowadzającym a tymi sekcjami.
Bliżej temu do badań archiwalnych niż do konwencjonalnego łamania kodów. Model musiał odnaleźć istotne źródła, porównać cechy tekstowe, dostrzec numeryczną zgodność, zaproponować procedurę indeksowania i sprawdzić wynik.
Po sformułowaniu reguła brzmi prosto. Ta pozorna prostota nie powinna jednak przesłaniać problemu poszukiwań. Historycy mogą przez lata stosować wyrafinowane metody, przeoczając wskazówkę ukrytą w fizycznej organizacji książki.
Rozwiązanie szyfru przez Fable 5.1 ilustruje zatem użyteczny rodzaj pomocy maszynowej. Modele mogą badać żmudne kombinacje w wielu dokumentach, jednocześnie utrzymując aktywność kilku słabych poszlak. Mogą też pisać skrypty, które przekształcają historyczną hipotezę w kontrole pozycja po pozycji.
Ma to znaczenie wykraczające poza kryptografię rekreacyjną. Podobna praca pojawia się w analizie historycznych map, porównywaniu manuskryptów, przeglądach literatury naukowej, archeologii oprogramowania i śledztwach dotyczących rozproszonych zapisów.
Badacz może mieć tysiące stron, niespójną pisownię, niepełne skany i kilka prawdopodobnych wydań. Trudność często polega na połączeniu właściwego fragmentu źródła z właściwym testem. Modele mogą ograniczyć takie poszukiwania z niepraktycznych do po prostu czasochłonnych.
Komentarze w dyskusji technicznej odzwierciedlały zarówno entuzjazm, jak i ostrożność. Niektórzy czytelnicy opisywali wykorzystanie modeli w zaniedbanych projektach historycznych, których obciążenie związane z wprowadzaniem danych wcześniej czyniło je nierealistycznymi. Inni kwestionowali eksperymentalny mianownik i wiarygodność odpowiedzi wybranej po otwartym przeglądaniu sieci.
Ten podział oddaje rzeczywiste znaczenie sprawy. Wydarzenie nie dowodzi, że modele językowe opanowały badania historyczne. Pokazuje, że potrafią generować poważne kandydatury odkryć w obszarach, którym ludzie poświęcają niewiele uwagi.
Rozróżnienie między wygenerowaniem kandydata a ustanowieniem odkrycia jest kluczowe. Spójna interpretacja to początek badań, a nie ich ostatni etap. Im bardziej przekonująco wygląda interpretacja, tym staranniej należy sprawdzić jej wyprowadzenie.
Jest to szczególnie istotne, gdy model może przeszukiwać internet. Jego dane treningowe lub pobrane strony mogą zawierać zapomniane wskazówki, częściowe rozwiązania albo późniejsze transkrypcje. Vals opisuje zagadkę jako nierozwiązaną, lecz opublikowany opis nie zawiera wystarczających informacji, by skontrolować każdą stronę, do której model uzyskał dostęp.
Pozostawia to kilka wyjaśnień zgodnych z publicznie dostępnymi dowodami. Fable 5.1 mógł samodzielnie stworzyć spostrzeżenie dotyczące indeksowania. Mógł połączyć niejasne wskazówki z historycznych dyskusji. Mógł odnaleźć nierozpoznaną wcześniejszą sugestię. Pełny zapis użytych narzędzi i źródeł pomógłby rozróżnić te możliwości.
Żadna z nich nie czyniłaby proponowanego tekstu jawnego automatycznie błędnym. Wpływałyby jednak na mocniejsze twierdzenie, że model niezależnie rozwiązał problem, który przez stulecia pokonywał ludzi.
Sprawa podkreśla również znaczenie zachowania kontekstu badawczego. Użyteczna przeszukiwalna baza wiedzy powinna przechowywać razem wersje źródeł, notatki i zapisy wyprowadzenia. W przeciwnym razie przekonujący wynik może zostać oddzielony od materiału, który go wytworzył.
Drugi szyfr wzmocnił sprawę i podniósł stawkę
Fable 5.1 miał podobno zastosować tę samą ideę do większego szyfru Urquharta, zapewniając hipotezie mocniejsze wsparcie, ale także ujawniając jej nierozstrzygnięte elementy.
Urquhart pozostawił inną zagadkę liczbową znaną jako Cyphral Octastich. Octastich to ośmiowersowy poemat. Ta druga zagadka pojawia się wraz z The Jewel, dziełem opublikowanym w 1652 roku, i zawiera 285 liczb, jeśli uwzględnić materiał końcowy.
Model miał podobno zauważyć, że The Jewel ma 284 ponumerowane strony. Zaproponował, by każda kolejna liczba szyfru indeksowała słowo na odpowiadającej jej stronie. Pierwsza litera tego słowa staje się jednym znakiem ukrytego poematu.
Wynikiem była większość kolejnej rojalistycznej modlitwy. Jej wersy odnoszą się do Karola II, jego rodziny królewskiej oraz sprzeciwu wobec uzurpowanej władzy. Odtworzony tekst zachowuje schemat ottava rima, ośmiowersowej formy poetyckiej o układzie rymów ABABABCC.
Drugi wynik wykorzystujący pokrewny mechanizm zmniejsza prawdopodobieństwo, że rezultat Distichu powstał wyłącznie w wyniku nieograniczonego dopasowywania wzorców. Obie proponowane wiadomości łączą autor, stanowisko polityczne, forma literacka i konstrukcja indeksowania książki.
Octastich nie jest jednak czystym odszyfrowaniem. Vals zgłosiło dziewięć nieczytelnych liter w piątym wersie. Proponowane wydobycie napotyka również sekwencję „IRSH” tam, gdzie oczekiwano by „IRISH”.
Kolejna komplikacja pojawia się po pozycji 158. Od pozycji 159 udane odczytanie podobno wykorzystuje poprzednią stronę zamiast strony oczekiwanej zgodnie z pierwotną regułą. Vals zasugerowało jako możliwe wyjaśnienia powtórzony wybór strony lub zduplikowany numer druku.
Te nieregularności nie muszą być rozstrzygające. Wczesne druki zawierają warianty pisowni, błędy zecerskie, uszkodzone strony i różnice między zachowanymi egzemplarzami. Współczesne transkrypcje mogą wprowadzać dalsze błędy przez brakujące znaki, łączone słowa i niespójne traktowanie łączników.
Jednak każdy wyjątek zwiększa potrzebę przedstawienia przejrzystych dowodów. Metoda, która zmienia się, gdy tekst staje się trudny, może przejść od odszyfrowania do rekonstrukcji. Badacze muszą zobaczyć, które wybory zostały ustalone przed pojawieniem się tekstu jawnego.
Opis Vals podaje, że 231 z 275 czytelnych pozycji Octastichu odpowiadało pierwszemu właściwemu wystąpieniu słowa na odpowiednich stronach. Kolejne 44 mieściły się w odległości od jednego do trzech słów, podobno z powodu możliwych do zidentyfikowania różnic w transkrypcji.
Ten wzorzec jest intrygujący, lecz opublikowany wpis odwołuje się do wewnętrznych skryptów i plików zamiast udostępniać kompletny pakiet. Czytelnicy nie mogą niezależnie sprawdzić wszystkich 285 współrzędnych, korzystając z dokładnych danych wejściowych opisanych przez model.
Późniejsze badanie dostarczyło dodatkowego wsparcia. Komentator w omówieniu szyfru przez Bruce’a Schneiera cipher coverage poinformował o sprawdzeniu kluczowych pozycji Octastichu względem skanów badawczych fizycznego egzemplarza z Glasgow z 1652 roku.
Ten test podobno odtworzył trudną sekwencję na pozycjach od 149 do 157. Potwierdził również proponowane przesunięcie po pozycji 158 w kolejnych literach. Badacz zastrzegł, że jedna współrzędna zależy od sposobu liczenia wyrazu podzielonego między wiersze.
Przenosi to część twierdzenia dotyczącego Octastich poza tekst jawny, który jedynie brzmi wiarygodnie. Nie kończy jednak weryfikacji. Pełna rekonstrukcja współrzędna po współrzędnej na podstawie zidentyfikowanego fizycznego egzemplarza pozostaje mocniejszym standardem.
Większa zagadka działa więc zarówno jako dowód wspierający, jak i ostrzeżenie. Sugeruje, że Fable 5.1 znalazł autentyczne podobieństwo rodzinne między szyframi Urquharta. Pokazuje też, jak szybko historyczne warianty tekstu mogą skomplikować rozwiązanie, które wydaje się czysto mechaniczne.
Pierwsze obalenie ujawniło problem z wydaniem
Najostrzejsze zastrzeżenie nie ograniczało się do oskarżenia modelu o halucynacje; pokazało, że opublikowane wyjaśnienie nie wytrzymuje konfrontacji z konkretnym zdigitalizowanym egzemplarzem.
Krótko po pojawieniu się wpisu Vals Reticuli opublikował próbę replikacji, korzystając z mikrofilmu British Library oraz transkrypcji EEBO-TCP. Test wykazał dwa poważne konflikty.
Po pierwsze, zbadany egzemplarz z 1653 roku kończył się bez dwóch numerowanych wersów w miejscu opisanym przez Vals. Końcowy materiał obejmował trzydziestą drugą Proquiritation, epigraf, znak końcowy i erratę.
Po drugie, tekst Proquiritation w tym egzemplarzu nie mógł wygenerować kilku liter wymaganych przez deklarowany tekst jawny. Jeden z wyróżnionych przykładów dotyczył litery „K” w słowie „KING”. Odpowiednia sekcja podobno nie zawierała żadnego słowa zaczynającego się na K.
Badacz przetestował 65 kombinacji obejmujących tokenizację, indeksowanie, mapowanie sekcji i wybór liter. Najlepszy wynik podobno dopasował zaledwie osiem z 64 proponowanych liter. Odtwarzalny kod i dowody zostały później umieszczone w publicznym pakiecie replikacyjnym.
Było to istotne zastrzeżenie, ponieważ dotyczyło wyprowadzenia wyniku, a nie wiarygodności zdekodowanego zdania. Rojalistyczny dwuwiersz o właściwej długości i rymie nadal może być błędny, jeśli wskazane indeksy go nie generują.
Początkowo zastrzeżenie wydawało się podważać całą historię. Jeśli szyfru nie było w cytowanej książce, a tekst źródłowy nie zawierał niezbędnych słów, rozwiązanie mogło wynikać ze zmieszania wydań albo niepopartej dowodami rekonstrukcji.
Późniejsze informacje skomplikowały ten werdykt. Badacz komentujący na stronie Schneiera podał, że zachowany egzemplarz z 1653 roku znajdujący się w National Library of Scotland zawiera Distich. Egzemplarz British Library najwyraźniej nie zawiera materiału obecnego w innym egzemplarzu.
Taka różnica jest wiarygodna w druku wczesnonowożytnym. Egzemplarze opisywane jako to samo wydanie mogą zawierać wariantowe arkusze, anulowania, dodane karty, poprawiony tekst lub odmienną historię oprawy. Zdigitalizowany egzemplarz jest dowodem dotyczącym tego egzemplarza, a nie automatycznie wszystkich egzemplarzy z nakładu.
Późniejszy raport stwierdzał również, że mechanizm Distich można odtworzyć względem kolejności Proquiritation zastosowanej w wydaniu z 1834 roku. Sugeruje to, że wczesne obalenie mogło testować prawidłowy, lecz niekompatybilny egzemplarz.
Ten epizod nie czyni obalenia bezużytecznym. Ujawnia poważną słabość oryginalnej publikacji. Vals nie wskazał dokładnego fizycznego ani zdigitalizowanego egzemplarza wystarczająco jasno, aby inny badacz mógł od razu wybrać te same dane wejściowe.
Stwierdzenie, że kryptogram pojawia się na końcu dzieła z 1653 roku, było zbyt szerokie. Niektóre zachowane egzemplarze podobno go nie zawierają. Proquiritations w książce różnią się również brzmieniem lub kolejnością w odpowiednich źródłach.
To problem proweniencji, czyli problem dotyczący pochodzenia artefaktu i sposobu, w jaki się zmieniał. Proweniencja określa, do którego tekstu odnosi się indeks liczbowy. Jedna dodana fraza może przesunąć każdy kolejny numer słowa w sekcji.
Dla zwykłej lektury dwa wydania mogą przekazywać zasadniczo te same idee. Dla szyfru książkowego są to różne obiekty kryptograficzne. Interpunkcja, dzielenie wyrazów, łacińskie frazy i decyzje drukarza mogą zmienić wynik.
Początkowe obalenie i późniejsza korekta przekazują zatem tę samą lekcję. Historyczne ustalenia wspierane przez AI wymagają dokładnych identyfikatorów źródeł. Tytuły i lata publikacji nie wystarczą, gdy metoda zależy od pozycji słów.
Przekonujący tekst jawny nie jest pełną weryfikacją
Rozwiązanie szyfru przez Fable 5.1 ma silne wewnętrzne przesłanki, ale jego publiczna dokumentacja nadal nie spełnia wymogów pełnego niezależnego audytu.
Proponowana wiadomość Distich ma kilka pozornie niezależnych sprawdzianów. Wypełnia dokładnie dwa 32-literowe wersy. Jej końcowe słowa się rymują. Jej polityczny wydźwięk jest zgodny z rojalizmem Urquharta. Jej mechanizm łączy szyfrogram z 32 pobliskimi sekcjami.
Właściwości te czynią przypadkową zbieżność mało prawdopodobną. Sprawiają też, że odpowiedź jest emocjonalnie satysfakcjonująca. Wielowiekowa zagadka staje się łatwa, gdy ktoś zauważa, że sama książka jest kluczem.
Satysfakcja może stać się pułapką weryfikacyjną. Badacze mogą uznać znaczący wynik za dowód, że każdy krok pośredni zadziałał prawidłowo. Modele językowe wzmacniają to ryzyko, ponieważ świetnie tworzą spójne narracje wokół częściowych dowodów.
Najsilniejsza weryfikacja opublikowałaby dokładny identyfikator skanu, transkrypcję dyplomatyczną, zasady tokenizacji oraz wszystkie 64 mapowania pozycji. Transkrypcja dyplomatyczna zachowuje oryginalną pisownię i cechy tekstowe wystarczająco wiernie, by umożliwić mechaniczne sprawdzenie.
Każde mapowanie powinno wskazywać pozycję szyfru, wybraną Proquiritation, indeks numeryczny, otrzymane słowo i wyodrębnioną literę. Niejednoznaczne przypadki powinny być oznaczane, zamiast po cichu normalizowane.
Drugi badacz powinien następnie odtworzyć wynik bez wcześniejszego poznania proponowanego tekstu jawnego. Chroni to przed decyzjami interpretacyjnymi, które nieświadomie zbliżają wynik do oczekiwanej odpowiedzi.
Proces powinien również odróżniać egzemplarz z 1653 roku od zbiorowego wydania z 1834 roku. Jeśli metoda działa tylko względem późniejszej kolejności lub brzmienia, badacze muszą wyjaśnić, jak ten tekst odnosi się do oryginalnego szyfru.
Nierozstrzygnięty szczegół dotyczący liczenia łaciny zasługuje na podobne potraktowanie. Raporty wskazują, że co najmniej jedna współrzędna zależy od traktowania frazy jako jednej jednostki. Decyzja ta wymaga tekstowego lub typograficznego uzasadnienia niezależnego od pożądanej litery.
Vals zastosował ostrożne sformułowanie na początku artykułu, pisząc, że model „wydaje się” rozwiązać szyfr. W innym miejscu nagłówek i prezentacja przyjmują bardziej stanowczy język. To napięcie jest powszechne w relacjach o możliwościach AI.
Nagłówek premiuje jasność, podczas gdy badania wymagają niepewności. Rezultatem jest często silne publiczne twierdzenie otoczone węższymi zastrzeżeniami. Czytelnicy pamiętają rozwiązaną tajemnicę, a nie nierozstrzygnięte dopasowanie źródeł.
Rola Anthropic również powinna pozostać jasna. Fable 5.1 jest modelem Claude, lecz Vals zaprojektował i opisał ten eksperyment. Przeanalizowane tutaj materiały publiczne nie przedstawiają wyniku szyfru jako benchmarku Anthropic ani ustalenia recenzowanego naukowo.
Wydajności modelu nie można oddzielić od otaczającego go systemu agentowego. Dostęp do wyszukiwania, prompty, zarządzanie kontekstem, narzędzia, budżet tokenów oraz kryteria selekcji operatora ukształtowały wynik.
Nazwanie tego uruchomienia autonomicznym byłoby więc przesadą. Żaden człowiek nie interweniował podczas opisywanej 44-minutowej trajektorii, ale człowiek ustalił cel, zachęcał do ambitnego wyboru problemu i ograniczył przestrzeń poszukiwań.
Najtrafniejszy opis brzmi: Vals wywołał w dużej mierze samodzielnie kierowany przebieg badawczy. Model wybrał i zbadał wykonalny historyczny szyfr w granicach zdefiniowanych przez człowieka.
To nadal imponujące. Jest to też bardziej użyteczny opis dla deweloperów i nabywców biznesowych. Rzeczywiste systemy badawcze działają poprzez rusztowania, wyszukiwanie, uprawnienia i przegląd, a nie jako odizolowana odpowiedź czatu.
Otwarte pytanie nie brzmi, czy model wykonał wartościową pracę. Wyraźnie stworzył hipotezę wartą poważnego zbadania. Pytanie brzmi, czy społeczność powinna nazywać tę hipotezę rozwiązanym szyfrem, zanim pełne wyprowadzenie zostanie upublicznione.
Na co badacze powinni zwracać uwagę dalej
Trzy wydarzenia zdecydują, czy stanie się to zweryfikowanym odkryciem historycznym, czy ostrzegawczym przykładem niepełnego raportowania badań AI.
Pierwszym sygnałem jest publiczna rekonstrukcja 64 pozycji Distich powiązana z nazwanym fizycznym egzemplarzem. Dokumentacja powinna obejmować skany lub stabilne odniesienia katalogowe, dokładny tekst sekcji, zasady liczenia oraz wyodrębnione litery.
Jeśli niezależni badacze odtworzą wszystkie 64 litery, podstawowe twierdzenie dotyczące Fable 5.1 Cyphral Distich stanie się znacznie silniejsze. Jeśli rekonstrukcja będzie wymagać powtarzających się wyjątków napędzanych wynikiem, zaufanie powinno spaść.
Drugim sygnałem jest pełny audyt Octastich. Częściowe sprawdzenia względem egzemplarza z Glasgow już wspierają ważne elementy proponowanego mechanizmu. Pozostałym zadaniem jest weryfikacja wszystkich 285 współrzędnych, w tym nieczytelnego obszaru i przesunięcia strony.
Pomyślny audyt miałby znaczenie, ponieważ drugi szyfr oferuje powiązany, lecz większy test. Pokazałby, że model zidentyfikował szerszą praktykę kodowania Urquharta, zamiast dopasować jedno atrakcyjne zdanie.
Niepowodzenie nie przekreśliłoby automatycznie Distich. Zawęziłoby twierdzenie do jednej zagadki i osłabiło argument, że wspólny mechanizm autorski wyjaśnia oba dzieła.
Trzecim sygnałem jest lepsze ujawnianie informacji eksperymentalnych przez Vals lub podobne grupy ewaluacyjne. Użyteczne zapisy obejmowałyby początkowy prompt, rozważane zagadki, nieudane uruchomienia, pełną historię wyszukiwania, ustawienia modelu oraz wygenerowane narzędzia weryfikacyjne.
Ten mianownik ma znaczenie przy interpretowaniu demonstracji modeli z czołówki. Pojedyncza udana sesja wygląda inaczej, jeśli poprzedziły ją dwie nieudane próby, 200 nieudanych prób lub intensywne filtrowanie przez ludzi.
Przejrzyste ujawnienie informacji pomogłoby również odróżnić możliwości modelu od jakości środowiska wykonawczego. Deweloperzy mogliby zbadać, czy przewagę stworzyły wytrwałość, długość kontekstu, strategia wyszukiwania czy kod wygenerowany przez sam model.
Tego przypadku nie należy sprowadzać do rywalizacji między wierzącymi a sceptykami. Wcześni krytycy znaleźli rzeczywistą niezgodność źródeł. Późniejsi badacze znaleźli dowody, że niezgodność odzwierciedlała różnice między egzemplarzami, a nie nieistniejący szyfr.
Oba etapy poprawiły stan wiedzy. Tak wygląda zdrowa weryfikacja, gdy twierdzenia wyprzedzają formalną publikację.
Dla pracowników wiedzy bezpośrednia lekcja jest praktyczna. AI może teraz przekształcać zaniedbane dokumenty w możliwe do sprawdzenia tropy badawcze przy znacznie niższym koszcie. Może porównywać struktury, pisać kod walidacyjny i kontynuować pracę, którą ludzie często porzucają.
Odpowiadający temu obowiązek jest równie praktyczny. Zachowuj dokładne dane wejściowe, rejestruj przekształcenia, oddzielaj obserwacje od interpretacji i wymagaj, by inna osoba odtworzyła istotne wyniki.
Fable 5.1 nie musi zastępować kryptografa, aby mieć znaczenie. Wystarczy, że ujawni hipotezy, których eksperci inaczej nie mieliby czasu badać. Ta rola może zwiększyć ilość materiału archiwalnego analizowanego przez społeczeństwo.
Jednak szybkość nie może zastąpić proweniencji. Odpowiedź powstała w 44 minuty może rozpocząć odkrycie, ale ostateczne twierdzenie należy do wolniejszego procesu, który sprawdza każde źródło i każdą literę.
Kolejnym kamieniem milowym nie jest następna dramatyczna demonstracja modelu. Jest nim nudny, kompletny, niezależnie powtarzalny arkusz roboczy. Jeśli ten zapis potwierdzi proponowany tekst jawny, długa cisza szyfru zakończy się dzięki współpracy między wyszukiwaniem maszynowym a ludzką weryfikacją.
Do tego czasu najtrafniejszy wniosek pozostaje wyważony. Wydaje się, że Fable 5.1 znalazło przekonujący mechanizm Cyphral Distich, a późniejsze dowody odpowiedziały na część początkowej krytyki. Pełny publiczny audyt rozstrzygnie, czy „rozwiązane” jest faktem historycznym, czy atrakcyjną etykietą tymczasową.



