Ibteda Digital Library préserve 1 800 livres rares, mais dix corrections humaines surpassent une IA plus grande
Ibteda Digital Library a atteint Google News après que trois amis pakistanais ont effectué environ 902 000 déclenchements avec deux appareils Nikon bon marché tout en préservant des livres rares en ourdou. Leur effort de dix ans a produit 526 000 photographies de doubles pages ouvertes, selon un récit du projet et des reportages ultérieurs.
Les impressionnants compteurs des appareils ont fait circuler l’histoire. Pourtant, le résultat le plus important est arrivé après l’arrêt du travail quotidien de numérisation. Un membre de l’équipe a transformé des années de retouches manuelles dans Photoshop en étiquettes d’entraînement pour un réseau de neurones.
Cette expérience a produit un constat embarrassant pour un secteur habitué à attendre des gains de modèles plus grands et de davantage de données. Ajouter des livres d’entraînement, utiliser des entrées en plus haute résolution et adopter une architecture ResNet-50 n’a pas résolu le problème central de recadrage. Dix corrections d’un opérateur humain y sont parvenues.
Le projet représente donc bien plus qu’une opération de numérisation exceptionnellement déterminée. Il montre pourquoi la préservation culturelle ne peut pas simplement importer les hypothèses qui sous-tendent les grands systèmes d’IA commerciaux. Une archive doit préserver les marques inhabituelles, les notes marginales, la ponctuation et les défauts matériels qu’un modèle généraliste pourrait classer comme du bruit.
Il offre également un contraste saisissant avec les programmes industriels de numérisation de livres. Des enquêtes récentes décrivent des entreprises achetant et numérisant de manière destructive des livres imprimés pour entraîner l’IA. Ibteda a travaillé lentement, préservé les volumes physiques et rendu au moins une partie de la collection obtenue accessible aux lecteurs.
Les chiffres derrière le titre de Google News
Les compteurs des appareils racontent une histoire d’endurance, mais la file de traitement inachevée explique pourquoi Ibteda a dû changer de cap.
Ibteda a commencé vers 2015, lorsque ses fondateurs recherchaient des éditions historiques du Diwan de Ghalib. Ils avaient du mal à trouver des volumes importants, épuisés, inaccessibles dans les collections universitaires ou détenus par des particuliers.
L’équipe a réagi en construisant sa propre archive au Pakistan. Elle ne disposait ni d’un laboratoire institutionnel de numérisation, ni d’un bureau de numérisation commercial, ni d’un budget dédié à l’équipement. Son dispositif reposait sur une table plate, des lampes LED Philips bon marché, un appareil photo monté au-dessus du livre et une vitre récupérée sur un photocopieur.
Un seul déclenchement capturait les deux pages en vis-à-vis. Cette méthode accélérait la prise de vue, mais chaque image contenait aussi le plateau de la table, les bords des pages, les ombres de la reliure, des marges inégales, des taches et des ajouts manuscrits.
Le Nikon D5300 a fini par accumuler environ 576 000 déclenchements. Le D3300 en a ajouté environ 326 000, portant le total couramment rapporté à près de 902 000. Ces chiffres proviennent des données de déclenchement associées aux appareils, et non d’une estimation fondée uniquement sur le nombre de pages publiées.
L’équipe a photographié environ 526 000 doubles pages ouvertes. Une double page contient deux pages en vis-à-vis ; ce nombre ne peut donc pas être interprété comme 526 000 livres achevés, ni même comme 526 000 fichiers de pages finalisés. La photographie n’était que la première étape.
Le récit plus détaillé du projet indique que les opérateurs ont terminé 575 729 recadrages de pages individuelles répartis sur 1 765 livres. Ce travail achevé est devenu la base de l’expérience ultérieure d’apprentissage automatique.
Certains articles arrondissent la collection à 1 800 livres, tandis que les descriptions actuelles de la bibliothèque évoquent un catalogue bien plus vaste réuni dans le cadre de l’initiative élargie. Ces mesures décrivent des réalités différentes : volumes traités, matériel photographié, fonds du catalogue et sélections hébergées par des partenaires.
Par exemple, la collection Rekhta indique qu’Ibteda a commencé en 2016 et décrit un catalogue de plus de 5 000 livres et 3 millions de pages. Rekhta présente actuellement une sélection de cette collection plus large, plutôt que l’ensemble des photographies brutes ou traitées.
Cette distinction importe, car le titre viral peut laisser entendre que chaque double page photographiée a été entièrement convertie. En réalité, la charge de traitement a dépassé la capacité de l’équipe à maintenir des opérations quotidiennes.
Ibteda aurait progressivement arrêté son travail régulier en avril 2026, après près d’une décennie. Le groupe avait réussi à préserver un corpus substantiel de littérature ourdoue, mais des centaines de milliers de doubles pages capturées exigeaient encore un traitement minutieux.
Les appareils de l’équipe avaient résisté bien au-delà de la charge de travail attendue d’une opération communautaire improvisée. L’attention humaine est devenue la ressource la plus rare.
Capturer un livre était la partie facile
Le goulot d’étranglement d’Ibteda n’était pas la prise de photographies. C’était la transformation de pages historiques irrégulières en fichiers auxquels une archive pouvait se fier.
Après chaque exposition, un opérateur ouvrait la photographie dans Photoshop. Il séparait les pages en vis-à-vis, les redressait, sélectionnait des limites appropriées et traitait les taches ou d’autres interférences visuelles.
Il ne s’agissait pas d’un simple recadrage par lots. De nombreux volumes utilisaient le nastaliq, un style d’écriture fluide couramment associé aux traditions littéraires ourdoue et persane. Ses points, ses formes diagonales, ses marques compactes et ses diacritiques compliquent le nettoyage automatisé.
Une petite tache sombre pouvait être de la saleté. Elle pouvait aussi être un point significatif modifiant une lettre. Une ligne près du bord pouvait être une ombre accidentelle, une bordure imprimée ou une annotation manuscrite digne d’être préservée.
Les lithographies ajoutaient encore davantage de variations. Les pages pouvaient présenter des impressions irrégulières, du papier vieilli, une géométrie déformée, des ombres profondes dans la reliure, des notes marginales, des tableaux ou des éléments décoratifs. Aucun rectangle unique ne représentait le bon recadrage pour chaque volume.
L’opérateur faisait aussi des choix esthétiques et éditoriaux. Un livre pouvait être plus réussi avec une marge étroite. Un autre nécessitait davantage d’espace autour de la page afin de conserver des notes, des traces de reliure ou une bordure imprimée inhabituelle.
Ces choix ont créé une variable cachée. La marge préférée n’était pas toujours visible dans les pixels. Deux archivistes compétents pouvaient examiner la même page et choisir des limites acceptables légèrement différentes.
Ce problème distingue le traitement archivistique de nombreuses tâches d’imagerie commerciale. Une application d’achat peut tolérer une normalisation visuelle mineure. Un système de préservation ne peut pas supprimer désinvoltement des marques simplement parce qu’elles ressemblent à des défauts.
L’archive d’Ibteda devait également permettre une inspection future. Le flux de travail stockait apparemment les documents achevés dans un pool ZFS, un système de stockage qui utilise des sommes de contrôle et des fonctions d’intégrité associées. Des manifestes BLAKE3 enregistraient des empreintes cryptographiques capables de révéler des modifications ultérieures des fichiers.
Cette importance accordée à la traçabilité est essentielle. Une page à l’apparence nette n’est pas automatiquement un objet archivistique fiable. Les chercheurs doivent savoir qu’un logiciel n’a pas réécrit silencieusement la source.
Le même principe s’applique à la gestion moderne des connaissances. La recherche et l’automatisation ne créent de la valeur que lorsque les personnes peuvent remonter l’information jusqu’à des sources stables et compréhensibles.
Pour Ibteda, chaque heure économisée grâce à l’automatisation comportait un risque correspondant. Un modèle qui effaçait correctement une tache mais supprimait ailleurs une marque en ourdou pouvait introduire une erreur textuelle permanente.
Le projet nécessitait donc plus qu’un modèle d’amélioration d’image. Il lui fallait un système prudent, capable de savoir quand proposer une modification, quand préserver les pixels originaux et quand renvoyer une page à une personne.
Cette exigence a conduit l’équipe à mettre en place des modèles et des règles de traitement distincts pour le recadrage et la retouche. Elle explique aussi pourquoi un grand volume de travail historique dans Photoshop est devenu de précieuses données d’entraînement.
Une décennie de retouches Photoshop est devenue des données d’entraînement
L’actif le plus réutilisable de l’équipe n’était pas son matériel photo. C’était l’historique de 575 729 décisions humaines prises pendant le travail de production ordinaire.
Chaque page finalisée dans Photoshop encodait une décision sur l’endroit où la page commençait et se terminait. Toutefois, ces décisions n’existaient pas initialement sous la forme d’étiquettes structurées prêtes pour l’apprentissage automatique.
L’équipe a dû relier les pages finalisées à leurs photographies d’origine. Sa discussion technique publiée décrit l’utilisation de SIFT et de MAGSAC au cours de ce processus de récupération.
SIFT, ou Scale-Invariant Feature Transform, identifie des caractéristiques visuelles distinctives qui peuvent encore correspondre après des changements d’échelle ou de rotation. MAGSAC est une méthode d’estimation robuste qui aide à écarter les correspondances incorrectes tout en ajustant la géométrie de l’image.
Ensemble, ces techniques ont permis au projet d’estimer la relation entre une page finalisée et l’image brute capturée par l’appareil. Des règles d’acceptation prudentes ont filtré les correspondances douteuses au lieu de forcer chaque fichier dans le jeu de données.
La géométrie obtenue est devenue une supervision pour un modèle de prédiction du recadrage. En pratique, l’équipe a transformé des années de retouches humaines en exemples montrant où les opérateurs avaient placé les limites des pages.
Il s’agit d’un schéma précieux pour d’autres petites archives. Une organisation peut ne pas disposer d’un jeu de données d’IA officiellement étiqueté tout en possédant des années de retouches, corrections, validations et résultats de production. Ces archives peuvent renfermer davantage de connaissances utiles propres au domaine qu’une collection d’images générique.
Toutefois, les données issues de flux de travail historiques ne sont pas automatiquement fiables. Elles peuvent inclure des préférences incohérentes entre opérateurs, des changements de normes, des fichiers dupliqués, des retouches ratées et des exceptions non documentées.
Le cas d’Ibteda était particulièrement difficile parce qu’une partie de cette incohérence représentait un jugement légitime. Un recadrage étroit pouvait être correct pour un volume, tandis que la même marge pouvait en endommager un autre.
Le modèle de recadrage a néanmoins appris la structure visible. Il pouvait reconnaître les limites probables des pages, les reliures et l’espace de table environnant. Pourtant, l’équipe a constaté que ses erreurs restantes étaient souvent presque constantes au sein de chaque livre.
Ce schéma était révélateur. Le modèle ne se contentait pas d’échouer à détecter les pages. Il ne parvenait pas à reproduire le retrait préféré par l’opérateur pour un volume donné.
Dans une discussion technique, l’auteur du projet a indiqué que l’extension de l’entraînement de 378 à 572 livres n’avait pas amélioré les performances sur des volumes non vus. Un modèle ResNet-50 s’ajustait mieux aux données d’entraînement, mais restait stable sur le matériel mis de côté.
Augmenter la résolution d’entrée à 1 024 pixels n’a pas non plus permis d’obtenir le gain attendu. Une tête de prédiction spatiale n’a pas davantage résolu le problème.
Ces résultats négatifs comptent, car ils remettent en question un réflexe familier du développement de l’IA. Lorsque les performances stagnent, les équipes ajoutent souvent des données, de la puissance de calcul, de la résolution ou une architecture plus grande.
Cette stratégie fonctionne lorsque le signal manquant existe quelque part dans les entrées d’entraînement. Les expériences d’Ibteda suggèrent que la préférence décisive n’était pas visible dans les pixels d’un nouveau livre.
Aucune architecture plus grande ne peut déduire de manière fiable une information que l’image ne contient pas. Le système nécessitait une petite quantité de nouveau contexte humain.
Dix corrections surpassent un réseau de neurones plus grand
Ibteda a amélioré son modèle de recadrage en l’étalonnant pour chaque livre, plutôt qu’en demandant à un réseau plus grand de deviner une préférence invisible.
Pour un nouveau volume, un opérateur corrigeait dix recadrages prédits. Le système comparait ces corrections à ses prédictions initiales et calculait le résidu médian, c’est-à-dire l’écart typique entre la sortie de la machine et la préférence humaine.
Il appliquait ensuite cet ajustement aux pages restantes du livre. Les pages d’un même volume partageaient généralement des dimensions de papier, un style d’impression, une géométrie de reliure et la marge souhaitée par l’opérateur.
Le projet indique que cet étalonnage a fait passer sa mesure pass@80 de 0,71 à 0,83 sur des volumes mis de côté pour l’évaluation. Pass@80 représentait la part des livres pour lesquels au moins 80 % des pages satisfaisaient aux critères d’acceptation du projet.
Ce gain provenait de dix corrections effectuées par un opérateur, et non d’un modèle plus vaste. Il soutient une forme pragmatique d’automatisation avec humain dans la boucle, où une personne fournit un nombre limité d’exemples qui guident le système pour un lot précis.
Le mécanisme est modeste en comparaison d’un modèle de vision généraliste. C’est précisément pourquoi il convient à cette tâche. Il cible le biais stable, propre à chaque livre, que le modèle ne peut pas observer directement.
Le système n’élimine pas l’archiviste. Il concentre son attention sur le début d’un volume, puis applique ce jugement de manière cohérente aux pages suivantes.
Cette approche limite également le coût d’un échec. Si l’étalonnage semble erroné, l’opérateur peut interrompre le traitement de ce volume. Un système entièrement autonome pourrait répéter la même erreur subtile de recadrage sur des centaines de pages avant que quelqu’un ne la remarque.
Le résultat a des implications au-delà des livres. De nombreux flux de travail documentaires comportent des préférences liées à un client, un projet, une collection, un instrument ou une période de référence. Ces préférences sont souvent absentes du contenu brut.
Un modèle généraliste peut identifier une structure visible, tandis qu’une poignée de corrections fournit une politique locale. Cette combinaison peut surpasser un modèle plus grand entraîné sur des préférences incompatibles.
Le travail de retouche d’Ibteda suivait une philosophie tout aussi prudente. Un U-Net, une architecture neuronale conçue pour la segmentation d’images au niveau des pixels, identifiait les régions candidates contenant des taches, des tampons ou des marques indésirables.
Le modèle ne gérait que la détection. Des routines OpenCV classiques reconstruisaient la texture du papier à l’intérieur du masque approuvé, tandis que les pixels situés hors de cette zone restaient inchangés.
Les annotations d’entraînement utilisaient trois états : REMOVE, KEEP et IGNORE. REMOVE désignait les marques considérées comme pouvant être effacées sans risque. KEEP protégeait le contenu qui ressemblait à du bruit mais appartenait au document. IGNORE excluait les régions ambiguës de l’entraînement.
L’auteur du projet a indiqué qu’un étiquetage plus strict avait fait passer l’intersection sur union des marques de 0,56 à 0,60. L’intersection sur union mesure le chevauchement entre une région prédite et sa cible annotée par un humain.
Plus important encore, le processus plus strict aurait réduit à zéro la suppression erronée de diacritiques ourdous dans le matériel évalué. L’équipe considérait tout diacritique effacé comme un veto au déploiement, quel que soit le score moyen du modèle.
Cette règle résume un principe central de la préservation. Une métrique agrégée élevée ne peut justifier la suppression d’un texte porteur de sens. Une défaillance culturellement significative peut compter davantage que des milliers de pixels correctement nettoyés.
Ce modèle de préservation remet en cause la numérisation destructive
Ibteda a utilisé l’IA pour prolonger la vie d’une archive, tandis que les programmes de numérisation industriels cherchent souvent à acquérir du texte aussi rapidement que possible.
Le contraste s’est accentué en août 2026. Des enquêtes ont indiqué que des entreprises technologiques achetaient des livres physiques, en retiraient les reliures, numérisaient les pages et jetaient les restes.
Des documents judiciaires avaient déjà montré qu’Anthropic avait acheté et numérisé de manière destructive des millions de livres lors de la constitution d’une bibliothèque de recherche interne. Anthropic a déclaré que ses programmes d’acquisition ne ciblaient pas les livres rares ou anciens.
Des reportages plus récents se sont concentrés sur Amazon. Un envoi suivi serait arrivé dans une installation Amazon où des employés coupaient les dos des livres avant leur numérisation. Amazon n’a pas répondu publiquement sur l’ampleur totale du programme ni sur l’usage qui serait fait des textes numérisés.
L’enquête sur la numérisation industrielle a suscité des inquiétudes chez les libraires, car certains titres achetés semblaient rares. Les éléments disponibles n’établissent pas que tous les acheteurs en gros ciblent intentionnellement des exemplaires uniques ou irremplaçables.
L’incitation sous-jacente reste néanmoins claire. Les grands développeurs d’IA recherchent des quantités importantes d’écrits humains de longue forme. Retirer la reliure d’un livre permet aux pages individuelles de passer rapidement dans un scanner automatisé.
Ibteda faisait face à l’objectif inverse. Ses livres physiques étaient des objets culturels, et non de simples contenants temporaires de texte d’entraînement. Le projet devait préserver la mise en page, les annotations manuscrites, les artefacts d’impression et d’autres éléments de preuve au-delà des mots.
Cette distinction influe sur chaque décision d’ingénierie. La numérisation destructive privilégie la vitesse, les pages à plat et l’extraction propre du texte. L’imagerie archivistique doit concilier lisibilité et fidélité matérielle.
Ibteda a également distribué l’accès au lieu d’enfermer les numérisations dans un pipeline d’entraînement propriétaire. Une sélection est visible via Rekhta, tandis que du matériel associé a été préservé dans la collection Internet Archive.
L’accès ouvert ne résout pas toutes les questions de droit d’auteur ou de responsabilité patrimoniale. La numérisation de matériel épuisé peut soulever des questions complexes de droits, de confidentialité et de propriété. Les archives communautaires ont toujours besoin de politiques régissant l’accès, les retraits, les attentes des donateurs et les documents sensibles.
Le flux de travail d’Ibteda ne prouve pas non plus que chaque livre fragile peut supporter sans risque une vitre de numérisation. Les exigences de conservation varient selon la reliure, l’état du papier, l’encre et la valeur historique. Certains volumes nécessitent des berceaux professionnels, une pression moindre ou une imagerie spécialisée.
Les conclusions du système en matière d’apprentissage automatique restent également des résultats rapportés par le projet. Le code et les poids faisaient encore l’objet d’un examen archivistique lorsque l’auteur les a présentés publiquement. Des équipes indépendantes n’ont pas encore reproduit l’ensemble du pipeline sur différents systèmes d’écriture et collections.
Les métriques d’évaluation reflètent les propres critères d’acceptation d’Ibteda. Une autre archive pourrait choisir des marges, des seuils d’erreur ou des définitions différentes d’une modification textuelle inacceptable.
Ces limites n’effacent pas la contribution. Elles définissent ce qui doit se produire avant que d’autres ne considèrent ce flux de travail comme une norme de préservation transférable.
L’affirmation la plus solide est plus restreinte que le titre de Google News. Ibteda a trouvé une voie prometteuse pour récupérer de la supervision à partir de modifications historiques et combiner des prédictions générales avec un étalonnage humain par livre.
Ce que les archivistes et les équipes d’IA devraient surveiller ensuite
La valeur du projet dépend désormais de sa reproductibilité, de tests intercollections et de preuves que ses garde-fous résistent à un usage courant.
Le premier signal serait une publication technique publique. L’équipe a décrit des recettes d’entraînement, des seuils de récupération des annotations, des règles de routage et un contrat de reproduction. La publication du code, des poids, d’échantillons d’évaluation ou d’un jeu de données soigneusement encadré permettrait à d’autres d’examiner ces détails.
Une publication utile doit inclure des exemples difficiles, et pas uniquement des pages réussies. Les chercheurs ont besoin d’ombres dans la gouttière, de notes manuscrites, de Nastaliq dense, de lithographies endommagées, de tampons, de bordures et de pages pour lesquelles l’automatisation a été rejetée.
Une reproduction indépendante renforcerait la conclusion centrale du projet. Si d’autres équipes découvrent elles aussi que quelques corrections locales surpassent l’augmentation indiscriminée de l’échelle des modèles, le résultat pourrait influencer de nombreux systèmes documentaires spécialisés.
L’impossibilité de le reproduire resterait également instructive. L’amélioration pourrait dépendre du dispositif de capture d’Ibteda, de la cohérence des opérateurs, des formats de livres ou de la métrique d’acceptation particulière.
Le deuxième signal serait des tests menés dans plusieurs institutions et systèmes d’écriture. La préservation de l’ourdou constitue le cas d’usage central du projet, mais des défis similaires existent dans les collections de manuscrits persans, arabes, ottomans turcs et sud-asiatiques.
Les essais intercollections devraient mesurer davantage que le chevauchement des recadrages. Ils devraient examiner les diacritiques perdus, les marginalia modifiées, l’ordre incorrect des pages, les suppressions accidentelles de texte, le temps des opérateurs, les taux de rejet et le coût de l’examen des échecs.
Le benchmark le plus utile séparerait la géométrie visible de la préférence éditoriale. Cette conception permettrait de déterminer si l’étalonnage fonctionne parce qu’il capture un véritable motif au niveau du volume plutôt que de compenser les particularités d’un jeu de données.
Le troisième signal serait l’adoption opérationnelle. Un modèle prometteur ne résorbe pas automatiquement un arriéré. Les archives ont besoin d’interfaces permettant de saisir des corrections, d’examiner les pages incertaines, de retracer les transformations et de restaurer les originaux.
Les opérateurs devraient pouvoir voir exactement ce que le modèle a modifié. Ils ont également besoin d’images sources immuables et de paramètres enregistrés pour chaque page dérivée.
La séparation, chez Ibteda, entre détection neuronale et reconstruction contrainte offre un point de départ utile. Elle limite les zones où des changements peuvent se produire et crée une frontière d’audit plus claire que la génération d’images sans restriction.
De futures expériences pourraient tester une restauration fondée sur la diffusion, dans laquelle un modèle génératif remplit les régions endommagées. Cette approche pourrait produire un papier visuellement convaincant, mais les équipes archivistiques auraient besoin de garanties contre toute modification hors d’un masque approuvé.
Une norme réaliste devrait donc récompenser l’abstention. Les systèmes doivent pouvoir signaler qu’une page est ambiguë et requiert une personne. Des taux d’automatisation élevés ont moins de valeur lorsqu’ils masquent des erreurs textuelles irréversibles.
Le projet offre également une leçon plus large aux équipes produit d’IA. L’expertise métier apparaît souvent sous la forme de corrections, d’exceptions et de préférences accumulées durant le travail réel. Traiter ces traces comme des retours structurés peut être plus efficace que d’agrandir continuellement un modèle.
Pour les archivistes, la prochaine étape n’est pas de remplacer le jugement humain. Il s’agit d’identifier les endroits où dix décisions attentives peuvent guider en toute sécurité les mille pages suivantes.
Pour les lecteurs qui ont découvert Ibteda via Google News, les chiffres liés à la caméra constituent un point d’entrée impressionnant. La question durable est de savoir si les institutions testeront, financeront et reproduiront le flux de travail avant que des collections similaires ne disparaissent dans des rayonnages inaccessibles ou des jeux de données d’entraînement privés.
Consultez la collection Ibteda disponible, comparez une page traitée à sa complexité matérielle et surveillez une publication technique publique. Si une autre archive peut reproduire le gain d’étalonnage de 0,71 à 0,83 tout en protégeant chaque marque porteuse de sens, ce petit projet aura apporté quelque chose que les systèmes d’IA plus vastes négligent souvent : une automatisation qui s’adapte au jugement humain sans effacer les éléments de preuve que ce jugement visait à préserver.



