Ibteda Digital Library zachowuje 1 800 rzadkich książek, lecz dziesięć ludzkich poprawek pokonało większą AI
Ibteda Digital Library trafiła do Google News po tym, jak trzech pakistańskich przyjaciół wykonało około 902 000 zdjęć dwoma budżetowymi aparatami Nikon, zachowując rzadkie książki w języku urdu. Ich trwający dekadę wysiłek zaowocował 526 000 fotografii rozkładówek otwartych książek, według relacji z projektu i późniejszych publikacji.
Imponujące liczniki aparatów sprawiły, że historia szybko się rozeszła. Ważniejszy rezultat pojawił się jednak po zakończeniu codziennej digitalizacji. Jeden z członków zespołu przekształcił lata ręcznych edycji w Photoshopie w etykiety treningowe dla sieci neuronowej.
Eksperyment przyniósł niewygodny wniosek dla branży przyzwyczajonej do oczekiwania poprawy dzięki większym modelom i większej ilości danych. Dodatkowe książki treningowe, wejścia o wyższej rozdzielczości i architektura ResNet-50 nie rozwiązały głównego problemu kadrowania. Rozwiązało go dziesięć poprawek wykonanych przez człowieka.
Projekt oznacza więc coś więcej niż wyjątkowo zdeterminowaną operację skanowania. Pokazuje, dlaczego ochrona dziedzictwa kulturowego nie może po prostu przejąć założeń stojących za dużymi komercyjnymi systemami AI. Archiwum musi zachować nietypowe znaki, marginalia, interpunkcję i materialne defekty, które model ogólnego przeznaczenia mógłby uznać za szum.
Stanowi też wyraźny kontrast wobec przemysłowych programów skanowania książek. Niedawne dochodzenia opisują firmy kupujące i destrukcyjnie skanujące drukowane książki na potrzeby treningu AI. Ibteda działała powoli, zachowała fizyczne egzemplarze i udostępniła czytelnikom przynajmniej część powstałej kolekcji.
Liczby stojące za nagłówkiem Google News
Liczniki aparatów opowiadają historię wytrwałości, lecz to niedokończona kolejka przetwarzania wyjaśnia, dlaczego Ibteda musiała zmienić kierunek.
Ibteda powstała około 2015 roku, gdy jej założyciele badali historyczne wydania Diwanu Ghaliba. Mieli trudności ze znalezieniem ważnych tomów, które były wyczerpane, niedostępne w zbiorach uniwersyteckich lub znajdowały się w prywatnych rękach.
Zespół odpowiedział, tworząc własne archiwum w Pakistanie. Nie dysponował instytucjonalnym laboratorium digitalizacji, komercyjnym biurem skanowania ani wydzielonym budżetem na sprzęt. Stanowisko zaczęło się od płaskiego stołu, niedrogich lamp LED Philips, aparatu zamontowanego nad książką oraz szkła odzyskanego z kserokopiarki.
Jedno naciśnięcie spustu rejestrowało obie sąsiadujące strony. Metoda przyspieszała fotografowanie, lecz każde zdjęcie obejmowało również blat stołu, krawędzie stron, cienie w grzbiecie, nierówne marginesy, plamy i odręczne dopiski.
Nikon D5300 ostatecznie zarejestrował około 576 000 wyzwoleń migawki. D3300 dodał około 326 000, co daje powszechnie podawaną łączną liczbę około 902 000. Dane te pochodziły z informacji o migawkach aparatów, a nie z szacunku opartego wyłącznie na liczbie opublikowanych stron.
Zespół sfotografował około 526 000 rozkładówek otwartych książek. Rozkładówka zawiera dwie sąsiadujące strony, dlatego liczby tej nie można traktować ani jako 526 000 ukończonych książek, ani nawet 526 000 gotowych plików stron. Fotografowanie było dopiero pierwszym etapem.
Bardziej szczegółowa relacja projektu podaje, że operatorzy ukończyli 575 729 pojedynczych kadrów stron w 1 765 książkach. To ukończone zadanie stało się podstawą późniejszego eksperymentu z uczeniem maszynowym.
Część publikacji zaokrągla kolekcję do 1 800 książek, podczas gdy obecne opisy biblioteki odnoszą się do znacznie większego katalogu zgromadzonego w ramach szerszej inicjatywy. Te miary opisują różne rzeczy: przetworzone tomy, sfotografowany materiał, zasoby katalogowe i wybory udostępniane przez partnerów.
Przykładowo kolekcja Rekhta podaje, że Ibteda rozpoczęła działalność w 2016 roku, i opisuje katalog przekraczający 5 000 książek oraz 3 miliony stron. Rekhta prezentuje obecnie wybraną część tej szerszej kolekcji, a nie wszystkie surowe lub przetworzone fotografie.
To rozróżnienie ma znaczenie, ponieważ viralowy nagłówek może sugerować ukończoną konwersję każdej sfotografowanej rozkładówki. W rzeczywistości obciążenie związane z przetwarzaniem przerosło zdolność zespołu do utrzymania codziennych działań.
Ibteda miała podobno wygasić rutynową pracę w kwietniu 2026 roku, po niemal dekadzie. Grupie udało się zachować znaczący zasób literatury urdu, ale setki tysięcy zarejestrowanych rozkładówek nadal wymagały starannego przetworzenia.
Aparaty zespołu przetrwały obciążenie znacznie przekraczające to, którego można oczekiwać od improwizowanej inicjatywy społecznościowej. Uwaga ludzi stała się rzadszym zasobem.
Zarejestrowanie książki było najłatwiejsze
Wąskim gardłem Ibtedy nie było robienie zdjęć. Było nim przekształcanie nieregularnych historycznych stron w pliki, którym archiwum może zaufać.
Po każdej ekspozycji operator otwierał fotografię w Photoshopie. Rozdzielał sąsiadujące strony, prostował je, wybierał odpowiednie granice i radził sobie z plamami oraz innymi zakłóceniami wizualnymi.
Nie było to zwykłe wsadowe kadrowanie. Wiele tomów używało nastaliku, płynnego stylu pisma powszechnie kojarzonego z tradycjami literackimi urdu i perskimi. Jego kropki, ukośne formy, zwarte znaki i diakrytyki komplikują automatyczne oczyszczanie.
Mała ciemna plamka może być zabrudzeniem. Może jednak być również istotną kropką zmieniającą literę. Linia przy krawędzi może być przypadkowym cieniem, drukowaną ramką albo odręczną adnotacją wartą zachowania.
Litografie wprowadzały dalszą różnorodność. Strony mogły zawierać nieregularne odbitki, postarzały papier, zniekształconą geometrię, głębokie cienie w grzbiecie, zapiski na marginesach, tabele lub elementy dekoracyjne. Żaden pojedynczy prostokąt nie stanowił właściwego kadru dla każdego tomu.
Operator podejmował też decyzje estetyczne i redakcyjne. Jedna książka mogła wyglądać najlepiej z wąskim marginesem. Inna potrzebowała więcej otaczającej przestrzeni, aby zachować notatki, ślady oprawy lub nietypową drukowaną ramkę.
Te wybory stworzyły ukrytą zmienną. Preferowany margines nie zawsze był widoczny w pikselach. Dwóch kompetentnych archiwistów mogło spojrzeć na tę samą stronę i wybrać nieco inne, ale akceptowalne granice.
Ten problem odróżnia przetwarzanie archiwalne od wielu komercyjnych zadań związanych z obrazem. Aplikacja zakupowa może tolerować drobną normalizację wizualną. System ochrony zasobów nie może beztrosko usuwać znaków tylko dlatego, że przypominają defekty.
Archiwum Ibtedy miało także wspierać przyszłą kontrolę. Według relacji przepływ pracy przechowywał ukończony materiał w puli ZFS, systemie przechowywania danych wykorzystującym sumy kontrolne i powiązane mechanizmy integralności. Manifesty BLAKE3 zapisywały kryptograficzne odciski, które mogły ujawnić późniejsze zmiany plików.
Ten nacisk na możliwość śledzenia ma znaczenie. Estetycznie czysta strona nie jest automatycznie godnym zaufania obiektem archiwalnym. Badacze muszą wiedzieć, że oprogramowanie nie przepisało po cichu źródła.
Ta sama zasada dotyczy współczesnego zarządzania wiedzą. Wyszukiwanie i automatyzacja tworzą wartość tylko wtedy, gdy ludzie mogą prześledzić informacje z powrotem do stabilnego, zrozumiałego materiału źródłowego.
Dla Ibtedy każda godzina zaoszczędzona dzięki automatyzacji niosła odpowiadające jej ryzyko. Model, który poprawnie usunął jedną plamę, lecz usunął gdzie indziej jeden znak urdu, mógł wprowadzić trwały błąd tekstowy.
Projekt potrzebował więc czegoś więcej niż modelu ulepszania obrazu. Potrzebował konserwatywnego systemu, który wiedział, kiedy zaproponować zmianę, kiedy zachować oryginalne piksele i kiedy odesłać stronę z powrotem do człowieka.
Wymóg ten skłonił zespół do zastosowania oddzielnych modeli i reguł przetwarzania dla kadrowania i retuszu. Wyjaśnia też, dlaczego duża liczba historycznych prac w Photoshopie stała się wartościowymi danymi treningowymi.
Dekada edycji w Photoshopie stała się danymi treningowymi
Najbardziej użytecznym zasobem zespołu nie był sprzęt fotograficzny. Był nim zapis 575 729 ludzkich decyzji podjętych podczas zwykłej pracy produkcyjnej.
Każda ukończona strona w Photoshopie kodowała decyzję o tym, gdzie strona się zaczynała i kończyła. Decyzje te nie istniały jednak początkowo jako ustrukturyzowane etykiety gotowe do użycia w uczeniu maszynowym.
Zespół musiał połączyć ukończone strony z ich oryginalnymi fotografiami. Opublikowana dyskusja techniczna opisuje użycie SIFT i MAGSAC podczas tego procesu odzyskiwania.
SIFT, czyli Scale-Invariant Feature Transform, identyfikuje charakterystyczne cechy wizualne, które mogą nadal odpowiadać sobie po zmianach skali lub obrotu. MAGSAC jest metodą odpornej estymacji, która pomaga odrzucać błędne dopasowania podczas dopasowywania geometrii obrazu.
Łącznie techniki te pozwoliły projektowi oszacować, jak ukończona strona odnosiła się do surowego obrazu z aparatu. Konserwatywne reguły akceptacji odfiltrowywały wątpliwe dopasowania, zamiast wymuszać włączenie każdego pliku do zbioru danych.
Uzyskana geometria stała się nadzorem dla modelu przewidującego kadrowanie. W praktyce zespół przekształcił lata ludzkiej edycji w przykłady pokazujące, gdzie operatorzy umieszczali granice stron.
To wartościowy wzorzec dla innych małych archiwów. Organizacja może nie mieć formalnie oznaczonego zbioru danych AI, a jednocześnie posiadać lata edycji, korekt, zatwierdzeń i wyników pracy produkcyjnej. Takie zapisy mogą zawierać bardziej użyteczną wiedzę dziedzinową niż ogólna kolekcja obrazów.
Historyczne dane dotyczące przepływu pracy nie są jednak automatycznie wiarygodne. Mogą obejmować niespójne preferencje operatorów, zmiany standardów, zduplikowane pliki, nieudane edycje i nieudokumentowane wyjątki.
Przypadek Ibtedy był szczególnie trudny, ponieważ część niespójności odzwierciedlała uzasadniony osąd. Wąski kadr mógł być właściwy dla jednego tomu, podczas gdy taki sam margines mógł uszkodzić inny.
Model kadrowania nadal nauczył się widocznej struktury. Potrafił rozpoznawać prawdopodobne granice stron, grzbiety i otaczającą przestrzeń stołu. Zespół stwierdził jednak, że pozostałe błędy były często niemal stałe w obrębie każdej książki.
Ten wzorzec był wymowny. Model nie zawodził po prostu w wykrywaniu stron. Nie trafiał w preferowane przez operatora wcięcie dla konkretnego tomu.
W dyskusji technicznej autor projektu stwierdził, że rozszerzenie treningu z 378 do 572 książek nie poprawiło wyników dla wcześniej niewidzianych tomów. Model ResNet-50 lepiej dopasował dane treningowe, ale jego wyniki na materiale odłożonym do testów pozostały bez zmian.
Zwiększenie rozdzielczości wejściowej do 1 024 pikseli również nie przyniosło oczekiwanej poprawy. Nie rozwiązała problemu także przestrzenna głowica predykcyjna.
Te negatywne wyniki są istotne, ponieważ podważają znany odruch rozwoju AI. Gdy wyniki przestają się poprawiać, zespoły często dodają dane, moc obliczeniową, rozdzielczość lub większą architekturę.
Strategia ta działa, gdy brakujący sygnał istnieje gdzieś w danych wejściowych treningu. Eksperymenty Ibtedy sugerują, że decydująca preferencja nie była widoczna w pikselach nowej książki.
Żaden większy model bazowy nie jest w stanie niezawodnie wywnioskować informacji, których obraz nie zawiera. System potrzebował niewielkiej ilości nowego ludzkiego kontekstu.
Dziesięć poprawek pokonało większą sieć neuronową
Ibteda ulepszyła model kadrowania, kalibrując go dla każdej książki, zamiast prosić większą sieć o odgadnięcie niewidocznej preferencji.
Dla nowego tomu operator poprawiał dziesięć przewidzianych kadrów. System porównywał te poprawki z pierwotnymi przewidywaniami i obliczał medianę reszt, czyli typowe przesunięcie między wynikiem maszyny a ludzką preferencją.
Następnie stosował tę korektę do pozostałych stron książki. Strony w obrębie jednego tomu zwykle miały wspólne wymiary papieru, styl druku, geometrię oprawy i pożądany przez operatora margines.
Projekt podaje, że ta kalibracja podniosła wskaźnik pass@80 z 0,71 do 0,83 dla woluminów spoza zbioru treningowego. Pass@80 oznaczał odsetek książek, w których co najmniej 80 procent stron spełniało kryteria akceptacji projektu.
Ten wzrost wynikał z dziesięciu korekt wykonanych przez operatora, a nie z zastosowania większego modelu. Wspiera to praktyczną formę automatyzacji z udziałem człowieka, w której osoba dostarcza ograniczoną liczbę przykładów, aby ukierunkować system dla konkretnej partii materiału.
Mechanizm jest skromny w porównaniu z uniwersalnym modelem wizyjnym. Właśnie dlatego pasuje do tego zadania. Jest ukierunkowany na stabilne, charakterystyczne dla danej książki odchylenie, którego model nie może bezpośrednio zaobserwować.
System nie eliminuje archiwisty. Przenosi uwagę archiwisty na początek woluminu, a następnie konsekwentnie stosuje tę ocenę na kolejnych stronach.
Podejście to ogranicza również koszt porażki. Jeśli kalibracja wygląda na błędną, operator może przerwać przetwarzanie danego woluminu. W pełni autonomiczny system mógłby powielać ten sam subtelny błąd kadrowania na setkach stron, zanim ktokolwiek go zauważy.
Wynik ma znaczenie wykraczające poza książki. Wiele procesów pracy z dokumentami zawiera preferencje powiązane z klientem, projektem, kolekcją, instrumentem lub okresem sprawozdawczym. Te preferencje często nie są obecne w surowej treści.
Model ogólny może identyfikować widoczną strukturę, podczas gdy garść korekt zapewnia lokalną politykę działania. Takie połączenie może przewyższać większy model trenowany na niezgodnych ze sobą preferencjach.
Prace Ibteda nad retuszem realizowano według równie ostrożnej filozofii. U-Net, architektura neuronowa zaprojektowana do segmentacji obrazu na poziomie pikseli, identyfikował obszary kandydackie zawierające plamy, pieczęcie lub niepożądane znaki.
Model zajmował się wyłącznie wykrywaniem. Klasyczne procedury OpenCV rekonstruowały fakturę papieru wewnątrz zatwierdzonej maski, podczas gdy piksele poza tym obszarem pozostawały niezmienione.
Etykiety treningowe wykorzystywały trzy stany: REMOVE, KEEP i IGNORE. REMOVE oznaczał ślady uznane za bezpieczne do usunięcia. KEEP chronił treść przypominającą szum, lecz należącą do dokumentu. IGNORE wyłączał niejednoznaczne obszary z treningu.
Autor projektu podał, że bardziej rygorystyczne etykietowanie zwiększyło współczynnik intersection-over-union dla znaków z 0,56 do 0,60. Intersection-over-union mierzy nakładanie się przewidzianego obszaru z jego celem oznaczonym przez człowieka.
Co ważniejsze, bardziej rygorystyczny proces miał podobno ograniczyć fałszywe usuwanie urdujskich znaków diakrytycznych do zera w ocenianym materiale. Zespół traktował usunięcie dowolnego znaku diakrytycznego jako weto dla wdrożenia, niezależnie od średniego wyniku modelu.
Ta zasada oddaje kluczową zasadę ochrony dziedzictwa. Wysoka zagregowana metryka nie może usprawiedliwiać usunięcia znaczącego tekstu. Jedna porażka o znaczeniu kulturowym może mieć większe znaczenie niż tysiące prawidłowo oczyszczonych pikseli.
Ten model ochrony dziedzictwa podważa niszczące skanowanie
Ibteda wykorzystała AI, aby przedłużyć życie archiwum, podczas gdy przemysłowe programy skanowania często optymalizują proces pod kątem jak najszybszego pozyskiwania tekstu.
Kontrast stał się wyraźniejszy w sierpniu 2026 roku. Dochodzenia informowały, że firmy technologiczne kupowały fizyczne książki, usuwały ich oprawy, skanowały strony i wyrzucały pozostałości.
Akta sądowe wcześniej wykazały, że Anthropic kupił i destrukcyjnie zeskanował miliony książek podczas tworzenia wewnętrznej biblioteki badawczej. Anthropic stwierdził, że jego programy pozyskiwania nie były ukierunkowane na książki rzadkie ani antykwaryczne.
Nowsze doniesienia koncentrowały się na Amazon. Śledzona przesyłka miała podobno dotrzeć do placówki Amazon, gdzie pracownicy odcinali grzbiety książek przed skanowaniem. Amazon nie udzielił publicznych odpowiedzi dotyczących pełnej skali programu ani sposobu wykorzystania zeskanowanego tekstu.
Dochodzenie dotyczące przemysłowego skanowania wzbudziło obawy księgarzy, ponieważ niektóre zakupione tytuły wydawały się trudno dostępne. Dowody nie potwierdzają, że każdy hurtowy nabywca celowo wybiera unikatowe lub niezastąpione egzemplarze.
Mimo to podstawowa zachęta jest jasna. Duzi twórcy AI chcą znacznych ilości długich tekstów napisanych przez ludzi. Usunięcie oprawy książki pozwala pojedynczym stronom szybko przechodzić przez automatyczny skaner.
Ibteda miała przeciwny cel. Jej fizyczne książki były obiektami kultury, a nie tymczasowymi pojemnikami na tekst treningowy. Projekt musiał zachować układ, pismo odręczne, artefakty druku i inne świadectwa wykraczające poza same słowa.
To rozróżnienie wpływa na każdą decyzję inżynieryjną. Destrukcyjne skanowanie priorytetowo traktuje szybkość, płaskie strony i czyste wydobywanie tekstu. Archiwalne obrazowanie musi równoważyć czytelność z wiernością materialną.
Ibteda udostępniła również dostęp zamiast zamykać skany wewnątrz zastrzeżonego procesu szkolenia. Wybór materiałów jest widoczny za pośrednictwem Rekhta, a powiązane materiały zachowano w kolekcji Internet Archive.
Otwarty dostęp nie rozwiązuje wszystkich kwestii praw autorskich ani opieki nad zbiorami. Digitalizacja materiałów niedostępnych w druku może wiązać się ze złożonymi kwestiami praw, prywatności i własności. Archiwa społecznościowe nadal potrzebują zasad regulujących dostęp, wycofywanie materiałów, oczekiwania darczyńców i wrażliwe zapisy.
Przepływ pracy Ibteda nie dowodzi też, że każda delikatna książka może bezpiecznie wytrzymać kontakt ze szklaną płytą dociskową. Wymagania konserwatorskie różnią się zależnie od oprawy, stanu papieru, atramentu i wartości historycznej. Niektóre woluminy wymagają profesjonalnych kołysek, niższego nacisku lub specjalistycznego obrazowania.
Wyniki uczenia maszynowego systemu pozostają również rezultatami zgłaszanymi przez sam projekt. Kod i wagi były nadal poddawane przeglądowi archiwalnemu, gdy autor omawiał je publicznie. Niezależne zespoły nie odtworzyły jeszcze całego procesu dla różnych pism i kolekcji.
Metryki ewaluacyjne odzwierciedlają własne kryteria akceptacji Ibteda. Inne archiwum mogłoby wybrać inne marginesy, progi błędów lub definicje niedopuszczalnej zmiany tekstu.
Te ograniczenia nie przekreślają wkładu projektu. Określają, co musi się wydarzyć, zanim inni uznają ten przepływ pracy za przenośny standard ochrony dziedzictwa.
Najmocniejsze twierdzenie jest węższe niż nagłówek Google News. Ibteda znalazła obiecujący sposób odzyskiwania nadzoru z historycznych edycji i łączenia ogólnych predykcji z kalibracją człowieka dla każdej książki.
Co archiwiści i zespoły AI powinni obserwować w następnej kolejności
Wartość projektu zależy teraz od odtwarzalności, testów międzykolekcyjnych i dowodów, że jego zabezpieczenia wytrzymują rutynowe użycie.
Pierwszym sygnałem będzie publiczne wydanie techniczne. Zespół opisał receptury treningowe, progi odzyskiwania etykiet, reguły routingu oraz kontrakt odtwarzalności. Udostępnienie kodu, wag, próbek ewaluacyjnych lub starannie zarządzanego zbioru danych pozwoliłoby innym zbadać te szczegóły.
Przydatne wydanie musi obejmować trudne przykłady, a nie tylko udane strony. Badacze potrzebują cieni w grzbiecie, odręcznych notatek, gęstego pisma nastaliq, uszkodzonych litografii, pieczęci, obramowań oraz stron, w których automatyzację odrzucono.
Niezależne odtworzenie wzmocniłoby główne ustalenie projektu. Jeśli inne zespoły również odkryją, że kilka lokalnych korekt przewyższa bezrefleksyjne skalowanie modelu, wynik może wpłynąć na wiele wyspecjalizowanych systemów dokumentowych.
Brak możliwości odtworzenia również byłby pouczający. Poprawa może zależeć od zestawu do rejestracji obrazu Ibteda, konsekwencji operatorów, formatów książek lub konkretnej metryki akceptacji.
Drugim sygnałem są testy w różnych instytucjach i dla różnych pism. Ochrona dziedzictwa urdu jest głównym przypadkiem użycia projektu, lecz podobne wyzwania występują w zbiorach perskich, arabskich, osmańsko-tureckich i południowoazjatyckich manuskryptów.
Próby międzykolekcyjne powinny mierzyć więcej niż nakładanie się kadrów. Powinny analizować utracone znaki diakrytyczne, zmienione marginalia, nieprawidłową kolejność stron, przypadkowe usuwanie tekstu, czas operatora, wskaźniki odrzucenia i koszt przeglądu błędów.
Najcenniejszy benchmark oddzielałby widoczną geometrię od preferencji redakcyjnych. Taka konstrukcja mogłaby sprawdzić, czy kalibracja działa, ponieważ uchwytuje rzeczywisty wzorzec na poziomie woluminu, zamiast kompensować osobliwości jednego zbioru danych.
Trzecim sygnałem jest wdrożenie operacyjne. Obiecujący model nie usuwa automatycznie zaległości. Archiwa potrzebują interfejsów do wprowadzania korekt, przeglądania niepewnych stron, śledzenia transformacji i przywracania oryginałów.
Operatorzy powinni móc dokładnie zobaczyć, co zmienił model. Potrzebują również niezmiennych obrazów źródłowych oraz zapisanych parametrów dla każdej strony pochodnej.
Rozdzielenie przez Ibteda wykrywania neuronowego od ograniczonej rekonstrukcji stanowi użyteczny punkt wyjścia. Ogranicza miejsca, w których mogą zachodzić zmiany, i tworzy wyraźniejszą granicę audytu niż nieograniczone generowanie obrazu.
Przyszłe eksperymenty mogą testować restaurację opartą na dyfuzji, w której model generatywny wypełnia uszkodzone obszary. Takie podejście mogłoby tworzyć wizualnie przekonujący papier, lecz zespoły archiwalne potrzebowałyby gwarancji, że poza zatwierdzoną maską nie dochodzi do zmian.
Realistyczny standard powinien zatem nagradzać wstrzymanie się od decyzji. Systemom trzeba pozwolić stwierdzić, że strona jest niejednoznaczna i wymaga udziału człowieka. Wysokie wskaźniki automatyzacji są mniej wartościowe, gdy ukrywają nieodwracalne błędy tekstowe.
Projekt oferuje też szerszą lekcję dla zespołów tworzących produkty AI. Wiedza dziedzinowa często ujawnia się jako korekty, wyjątki i preferencje gromadzone podczas rzeczywistej pracy. Traktowanie tych śladów jako ustrukturyzowanej informacji zwrotnej może być skuteczniejsze niż ciągłe powiększanie modelu.
Dla archiwistów kolejnym krokiem nie jest zastępowanie osądu. Jest nim określenie, gdzie dziesięć starannych decyzji może bezpiecznie poprowadzić kolejne tysiąc stron.
Dla czytelników, którzy odkryli Ibteda za pośrednictwem Google News, liczba aparatów stanowi imponujący punkt wejścia. Trwałe pytanie brzmi, czy instytucje przetestują, sfinansują i odtworzą ten przepływ pracy, zanim podobne kolekcje znikną na niedostępnych półkach lub w prywatnych zbiorach danych treningowych.
Zapoznaj się z dostępną kolekcją Ibteda, porównaj przetworzoną stronę z jej materialną złożonością i obserwuj zapowiedzi publicznego wydania technicznego. Jeśli inne archiwum zdoła odtworzyć wzrost kalibracji z 0,71 do 0,83, jednocześnie chroniąc każdy znaczący znak, ten niewielki projekt dostarczy czegoś, czego większe systemy AI często nie dostrzegają: automatyzacji, która dostosowuje się do ludzkiego osądu, nie usuwając dowodów, które ten osąd miał chronić.



