top of page

Ibteda Digital Library preserva 1.800 libros raros, pero diez correcciones humanas superan a una IA más grande

31 ago
14 min de lectura

Ibteda Digital Library llegó a Google News después de que tres amigos pakistaníes acumularan unos 902.000 clics con dos cámaras Nikon económicas mientras preservaban libros raros en urdu. Su esfuerzo de una década produjo 526.000 fotografías de dobles páginas abiertas, según un relato del proyecto y reportajes posteriores.

Las llamativas cifras de las cámaras hicieron que la historia se difundiera. Sin embargo, el resultado más importante llegó después de que cesara el trabajo diario de digitalización. Un miembro del equipo convirtió años de ediciones manuales en Photoshop en etiquetas de entrenamiento para una red neuronal.

Ese experimento arrojó una conclusión incómoda para una industria acostumbrada a esperar mejoras de modelos más grandes y más datos. Añadir libros de entrenamiento, usar entradas de mayor resolución y adoptar una arquitectura ResNet-50 no resolvió el problema central del recorte. Diez correcciones de un operador humano sí lo hicieron.

Por tanto, el proyecto representa más que una operación de escaneo excepcionalmente perseverante. Muestra por qué la preservación cultural no puede limitarse a importar los supuestos de los grandes sistemas comerciales de IA. Un archivo debe conservar marcas inusuales, notas marginales, puntuación y defectos materiales que un modelo general podría clasificar como ruido.

También ofrece un contraste contundente con los programas industriales de escaneo de libros. Investigaciones recientes describen a empresas que compran y escanean destructivamente libros impresos para entrenar IA. Ibteda trabajó despacio, conservó los volúmenes físicos y puso al menos parte de la colección resultante a disposición de los lectores.

Las cifras detrás del titular de Google News

Las cifras de las cámaras cuentan una historia de perseverancia, pero la cola de procesamiento sin terminar explica por qué Ibteda tuvo que cambiar de rumbo.

Ibteda comenzó alrededor de 2015, cuando sus fundadores investigaban ediciones históricas del Diwan de Ghalib. Les costaba localizar volúmenes importantes que estaban agotados, eran inaccesibles en colecciones universitarias o se encontraban en manos privadas.

El equipo respondió creando su propio archivo en Pakistán. No contaba con un laboratorio institucional de digitalización, un servicio comercial de escaneo ni un presupuesto específico para equipos. Su montaje comenzó con una mesa plana, luces LED Philips económicas, una cámara instalada sobre el libro y un cristal recuperado de una fotocopiadora.

Una sola pulsación del obturador capturaba ambas páginas enfrentadas. Ese método aceleró la fotografía, pero cada imagen también contenía la superficie de la mesa, los bordes de las páginas, sombras en el lomo, márgenes desiguales, manchas y añadidos manuscritos.

La Nikon D5300 acumuló finalmente cerca de 576.000 disparos de obturador. La D3300 añadió unos 326.000, lo que elevó el total habitualmente citado a aproximadamente 902.000. Estas cifras procedían de los datos del obturador asociados a las cámaras, no de una estimación basada únicamente en el número de páginas publicadas.

El equipo fotografió unas 526.000 dobles páginas abiertas. Una doble página contiene dos páginas enfrentadas, por lo que la cifra no puede interpretarse como 526.000 libros completados ni siquiera como 526.000 archivos de página terminados. La fotografía era solo la primera etapa.

El relato más detallado del proyecto indica que los operadores terminaron 575.729 recortes individuales de páginas en 1.765 libros. Ese trabajo completado se convirtió en la base del posterior experimento de aprendizaje automático.

Algunos reportajes redondean la colección a 1.800 libros, mientras que las descripciones actuales de la biblioteca se refieren a un catálogo mucho mayor, reunido mediante la iniciativa más amplia. Estas mediciones describen cosas distintas: volúmenes procesados, material fotografiado, fondos del catálogo y selecciones alojadas por socios.

Por ejemplo, la colección de Rekhta indica que Ibteda comenzó en 2016 y describe un catálogo de más de 5.000 libros y 3 millones de páginas. Actualmente, Rekhta presenta una selección de esa colección más amplia, en lugar de todas las fotografías sin procesar o procesadas.

Esta distinción importa porque el titular viral puede dar a entender que se completó la conversión de todas las dobles páginas fotografiadas. En realidad, la carga de procesamiento superó la capacidad del equipo para mantener las operaciones diarias.

Según se informó, Ibteda redujo gradualmente su trabajo rutinario en abril de 2026 tras casi una década. El grupo logró preservar un importante conjunto de literatura en urdu, pero cientos de miles de dobles páginas capturadas aún requerían un procesamiento minucioso.

Las cámaras del equipo habían resistido una carga de trabajo muy superior a la esperada para una operación comunitaria improvisada. La atención humana se convirtió en el recurso más escaso.

Capturar un libro era la parte fácil

El cuello de botella de Ibteda no era tomar fotografías. Era convertir páginas históricas irregulares en archivos en los que un archivo pudiera confiar.

Después de cada toma, un operador abría la fotografía en Photoshop. El operador separaba las páginas enfrentadas, las enderezaba, seleccionaba los límites adecuados y trataba manchas u otras interferencias visuales.

No se trataba de un recorte por lotes convencional. Muchos volúmenes utilizaban Nastaliq, un estilo de escritura fluido asociado habitualmente a las tradiciones literarias urdu y persa. Sus puntos, formas diagonales, marcas compactas y diacríticos complican la limpieza automatizada.

Una pequeña mota oscura podría ser suciedad. También podría ser un punto significativo que cambia una letra. Una línea cerca del borde podría ser una sombra accidental, un borde impreso o una anotación manuscrita que merece conservarse.

Las litografías añadían más variación. Las páginas podían contener impresiones irregulares, papel envejecido, geometría deformada, sombras profundas en el lomo, escritura marginal, tablas o elementos decorativos. Ningún rectángulo único representaba el recorte correcto para todos los volúmenes.

El operador también tomaba decisiones estéticas y editoriales. Un libro podía verse mejor con un margen estrecho. Otro necesitaba más espacio alrededor para conservar notas, evidencia de la encuadernación o un borde impreso inusual.

Estas decisiones creaban una variable oculta. El margen preferido no siempre era visible en los píxeles. Dos archivistas competentes podían observar la misma página y seleccionar límites aceptables ligeramente distintos.

Ese problema distingue el procesamiento archivístico de muchas tareas comerciales de imagen. Una aplicación de compras puede tolerar una normalización visual menor. Un sistema de preservación no puede eliminar marcas sin más solo porque se parezcan a defectos.

El archivo de Ibteda también debía permitir inspecciones futuras. Según se informa, el flujo de trabajo almacenaba el material terminado en un pool ZFS, un sistema de almacenamiento que utiliza sumas de verificación y funciones relacionadas de integridad. Los manifiestos BLAKE3 registraban huellas criptográficas que podían revelar cambios posteriores en los archivos.

Este énfasis en la trazabilidad es importante. Una página de aspecto limpio no se convierte automáticamente en un objeto archivístico fiable. Los investigadores deben saber que el software no reescribió silenciosamente la fuente.

El mismo principio se aplica a la moderna gestión del conocimiento. La búsqueda y la automatización solo generan valor cuando las personas pueden rastrear la información hasta materiales fuente estables y comprensibles.

Para Ibteda, cada hora ahorrada mediante automatización implicaba un riesgo correspondiente. Un modelo que eliminara correctamente una mancha, pero borrara una marca en urdu en otro lugar, podría introducir un error textual permanente.

Por ello, el proyecto necesitaba más que un modelo de mejora de imágenes. Necesitaba un sistema conservador que supiera cuándo proponer un cambio, cuándo conservar los píxeles originales y cuándo devolver una página a una persona.

Ese requisito llevó al equipo a desarrollar modelos y reglas de procesamiento separados para el recorte y el retoque. También explica por qué un gran volumen de trabajo histórico en Photoshop se convirtió en datos de entrenamiento valiosos.

Una década de ediciones en Photoshop se convirtió en datos de entrenamiento

El activo más reutilizable del equipo no era su hardware de cámaras. Era el registro de 575.729 decisiones humanas tomadas durante el trabajo de producción habitual.

Cada página terminada en Photoshop codificaba una decisión sobre dónde empezaba y terminaba la página. Sin embargo, esas decisiones inicialmente no existían como etiquetas estructuradas listas para el aprendizaje automático.

El equipo tuvo que conectar las páginas terminadas con sus fotografías originales. Su explicación técnica publicada describe el uso de SIFT y MAGSAC durante ese proceso de recuperación.

SIFT, o Scale-Invariant Feature Transform, identifica rasgos visuales distintivos que pueden seguir coincidiendo después de cambios de escala o rotación. MAGSAC es un método de estimación robusta que ayuda a descartar coincidencias incorrectas al ajustar la geometría de la imagen.

Juntas, estas técnicas permitieron al proyecto estimar cómo se relacionaba una página terminada con la imagen en bruto de la cámara. Las reglas conservadoras de aceptación filtraban las coincidencias dudosas en vez de forzar cada archivo dentro del conjunto de datos.

La geometría resultante se convirtió en supervisión para un modelo de predicción de recortes. En términos prácticos, el equipo transformó años de edición humana en ejemplos que mostraban dónde los operadores habían situado los límites de página.

Este es un patrón valioso para otros archivos pequeños. Una organización puede carecer de un conjunto de datos de IA formalmente etiquetado, pero poseer años de ediciones, correcciones, aprobaciones y resultados de producción. Esos registros pueden contener más conocimiento útil del dominio que una colección genérica de imágenes.

Sin embargo, los datos históricos de flujo de trabajo no son automáticamente fiables. Pueden incluir preferencias inconsistentes de los operadores, cambios de estándares, archivos duplicados, ediciones fallidas y excepciones sin documentar.

El caso de Ibteda resultaba especialmente desafiante porque parte de la inconsistencia representaba un criterio legítimo. Un recorte estrecho podía ser correcto para un volumen, mientras que el mismo margen podía dañar otro.

El modelo de recorte aún aprendió la estructura visible. Podía reconocer límites probables de las páginas, lomos y espacio de mesa alrededor. Sin embargo, el equipo descubrió que los errores restantes solían ser casi constantes dentro de cada libro.

Ese patrón fue revelador. El modelo no estaba simplemente fallando al detectar páginas. Estaba pasando por alto el margen interior preferido por el operador para un volumen concreto.

En una discusión técnica, el autor del proyecto afirmó que ampliar el entrenamiento de 378 a 572 libros no mejoró el rendimiento en volúmenes no vistos. Un modelo ResNet-50 se ajustaba mejor a los datos de entrenamiento, pero permanecía estable en el material reservado.

Aumentar la resolución de entrada a 1.024 píxeles tampoco desbloqueó la mejora esperada. Una capa de predicción espacial tampoco resolvió el problema.

Estos resultados negativos importan porque desafían un reflejo habitual en el desarrollo de IA. Cuando el rendimiento se estanca, los equipos suelen añadir datos, capacidad de cómputo, resolución o una arquitectura mayor.

Esa estrategia funciona cuando la señal que falta existe en alguna parte de las entradas de entrenamiento. Los experimentos de Ibteda sugieren que la preferencia decisiva no era visible en los píxeles de un libro nuevo.

Ninguna arquitectura más grande puede inferir de forma fiable información que la imagen no contiene. El sistema requería una pequeña cantidad de contexto humano nuevo.

Diez correcciones superaron a una red neuronal más grande

Ibteda mejoró su modelo de recorte calibrándolo para cada libro, no pidiendo a una red más grande que adivinara una preferencia invisible.

Para un volumen nuevo, un operador corregía diez recortes predichos. El sistema comparaba esas correcciones con sus predicciones originales y calculaba el residuo mediano, es decir, el desplazamiento típico entre la salida de la máquina y la preferencia humana.

Después aplicaba ese ajuste a las páginas restantes del libro. Las páginas de un mismo volumen solían compartir dimensiones de papel, estilo de impresión, geometría de encuadernación y el margen deseado por el operador.

El proyecto informa que esta calibración elevó su medida pass@80 de 0,71 a 0,83 en volúmenes reservados para evaluación. Pass@80 representaba la proporción de libros en los que al menos el 80 por ciento de las páginas cumplía los criterios de aceptación del proyecto.

Esa mejora provino de diez correcciones realizadas por operadores, no de un modelo más grande. Respalda una forma práctica de automatización con supervisión humana, en la que una persona aporta ejemplos limitados que guían al sistema a través de un lote específico.

El mecanismo es modesto en comparación con un modelo de visión de propósito general. Precisamente por eso se ajusta a la tarea. Se centra en el sesgo estable a nivel de libro que el modelo no puede observar directamente.

El sistema no elimina al archivero. Traslada la atención del archivero al inicio de un volumen y luego aplica ese criterio de forma coherente en las páginas posteriores.

Este enfoque también limita el costo de los fallos. Si la calibración parece incorrecta, el operador puede detener el procesamiento de ese volumen. Un sistema totalmente autónomo podría repetir el mismo error sutil de recorte en cientos de páginas antes de que alguien lo detecte.

El resultado tiene implicaciones más allá de los libros. Muchos flujos de trabajo documentales contienen preferencias vinculadas a un cliente, proyecto, colección, instrumento o período de informes. Esas preferencias a menudo no aparecen en el contenido sin procesar.

Un modelo general puede identificar la estructura visible, mientras que un puñado de correcciones proporciona una política local. Esa combinación puede superar a un modelo más grande entrenado con preferencias incompatibles.

El trabajo de retoque de Ibteda siguió una filosofía igualmente conservadora. Una U-Net, una arquitectura neuronal diseñada para la segmentación de imágenes a nivel de píxel, identificó regiones candidatas que contenían manchas, sellos o marcas no deseadas.

El modelo solo se encargaba de la detección. Rutinas clásicas de OpenCV reconstruían la textura del papel dentro de la máscara aprobada, mientras que los píxeles fuera de esa área permanecían sin cambios.

Las etiquetas de entrenamiento utilizaban tres estados: REMOVE, KEEP e IGNORE. REMOVE identificaba marcas consideradas seguras de borrar. KEEP protegía contenido que se parecía al ruido, pero pertenecía al documento. IGNORE excluía regiones ambiguas del entrenamiento.

El autor del proyecto informó que un etiquetado más estricto elevó la intersección sobre unión de las marcas de 0,56 a 0,60. La intersección sobre unión mide el solapamiento entre una región predicha y su objetivo etiquetado por humanos.

Más importante aún, el proceso más estricto supuestamente redujo a cero la eliminación errónea de diacríticos urdu en el material evaluado. El equipo consideró que cualquier diacrítico borrado era motivo para vetar el despliegue, independientemente de la puntuación media del modelo.

Esa regla recoge un principio central de la preservación. Una métrica agregada elevada no puede justificar la eliminación de texto significativo. Un fallo culturalmente importante puede importar más que miles de píxeles correctamente limpiados.

Este modelo de preservación cuestiona la digitalización destructiva

Ibteda utilizó IA para prolongar la vida de un archivo, mientras que los programas de digitalización industrial suelen optimizar la adquisición de texto lo más rápido posible.

El contraste se hizo más marcado durante agosto de 2026. Investigaciones informaron que empresas tecnológicas estaban comprando libros físicos, retirando sus encuadernaciones, escaneando las páginas y desechando los restos.

Registros judiciales mostraron anteriormente que Anthropic compró y escaneó destructivamente millones de libros mientras reunía una biblioteca interna de investigación. Anthropic ha dicho que sus programas de adquisición no se dirigían a libros raros o antiguos.

Informes más recientes se centraron en Amazon. Según se informó, un envío rastreado llegó a una instalación de Amazon donde los trabajadores cortaron los lomos de los libros antes de escanearlos. Amazon no ofreció respuestas públicas sobre la escala completa del programa ni sobre cómo se utilizaría el texto escaneado.

La investigación sobre digitalización industrial generó preocupación entre los libreros porque algunos títulos adquiridos parecían escasos. La evidencia no establece que todos los compradores al por mayor apunten intencionalmente a ejemplares únicos o irremplazables.

Aun así, el incentivo subyacente es claro. Los grandes desarrolladores de IA desean cantidades sustanciales de escritura humana de formato largo. Quitar la encuadernación de un libro permite que las páginas individuales pasen rápidamente por un escáner automatizado.

Ibteda tenía el objetivo opuesto. Sus libros físicos eran objetos culturales, no contenedores temporales de texto para entrenamiento. El proyecto necesitaba preservar la maquetación, la escritura a mano, los artefactos de impresión y otras evidencias más allá de las palabras.

Esa distinción afecta cada decisión de ingeniería. La digitalización destructiva prioriza la velocidad, las páginas planas y la extracción limpia de texto. La imagen archivística debe equilibrar la legibilidad con la fidelidad material.

Ibteda también distribuyó el acceso en lugar de encerrar los escaneos dentro de una canalización propietaria de entrenamiento. Una selección es visible a través de Rekhta, mientras que material relacionado se ha preservado mediante la colección de Internet Archive.

El acceso abierto no resuelve todas las cuestiones de derechos de autor o custodia. Digitalizar material agotado puede implicar asuntos complejos de derechos, privacidad y propiedad. Los archivos comunitarios todavía necesitan políticas que regulen el acceso, las retiradas, las expectativas de los donantes y los registros sensibles.

Tampoco el flujo de trabajo de Ibteda demuestra que todos los libros frágiles puedan tolerar con seguridad una platina de vidrio. Los requisitos de conservación varían según la encuadernación, el estado del papel, la tinta y el valor histórico. Algunos volúmenes requieren cunas profesionales, menor presión o sistemas de imagen especializados.

Los hallazgos de aprendizaje automático del sistema también siguen siendo resultados informados por el propio proyecto. El código y los pesos aún estaban bajo revisión archivística cuando el autor habló públicamente de ellos. Equipos independientes todavía no han reproducido toda la canalización en diferentes escrituras y colecciones.

Las métricas de evaluación reflejan los propios criterios de aceptación de Ibteda. Otro archivo podría elegir márgenes, umbrales de error o definiciones distintas de un cambio textual inaceptable.

Estas limitaciones no eliminan la contribución. Definen lo que debe ocurrir antes de que otros traten el flujo de trabajo como un estándar de preservación transferible.

La afirmación más sólida es más acotada que el titular de Google News. Ibteda encontró una forma prometedora de recuperar supervisión a partir de ediciones históricas y combinar predicciones generales con calibración humana por libro.

Lo que archivistas y equipos de IA deberían observar a continuación

El valor del proyecto depende ahora de la reproducibilidad, las pruebas entre colecciones y la evidencia de que sus salvaguardas resisten el uso cotidiano.

La primera señal es una publicación técnica pública. El equipo ha descrito recetas de entrenamiento, umbrales de recuperación de etiquetas, reglas de enrutamiento y un contrato de reproducción. Publicar código, pesos, muestras de evaluación o un conjunto de datos cuidadosamente gestionado permitiría a otros examinar esos detalles.

Una publicación útil debe incluir ejemplos difíciles, no solo páginas exitosas. Los investigadores necesitan sombras de canal, notas manuscritas, Nastaliq denso, litografías dañadas, sellos, bordes y páginas en las que se rechazó la automatización.

Una reproducción independiente reforzaría el hallazgo central del proyecto. Si otros equipos también descubren que unas pocas correcciones locales superan al escalado indiscriminado de modelos, el resultado podría influir en muchos sistemas documentales especializados.

Que no se reprodujera también sería informativo. La mejora podría depender del equipo de captura de Ibteda, la coherencia de los operadores, los formatos de los libros o una métrica de aceptación concreta.

La segunda señal son las pruebas entre instituciones y escrituras. La preservación del urdu es el caso de uso central del proyecto, pero desafíos relacionados aparecen en colecciones de manuscritos persas, árabes, turcos otomanos y del sur de Asia.

Los ensayos entre colecciones deberían medir más que el solapamiento de recortes. Deberían examinar diacríticos perdidos, marginalia alterada, orden incorrecto de páginas, eliminación accidental de texto, tiempo de los operadores, tasas de rechazo y el costo de revisar los fallos.

El benchmark más valioso separaría la geometría visible de la preferencia editorial. Ese diseño podría comprobar si la calibración funciona porque captura un verdadero patrón a nivel de volumen, en lugar de compensar las particularidades de un conjunto de datos.

La tercera señal es la adopción operativa. Un modelo prometedor no elimina automáticamente un atraso acumulado. Los archivos necesitan interfaces para introducir correcciones, revisar páginas inciertas, rastrear transformaciones y restaurar originales.

Los operadores deberían poder ver exactamente qué cambió el modelo. También necesitan imágenes fuente inmutables y parámetros registrados para cada página derivada.

La separación de Ibteda entre detección neuronal y reconstrucción restringida ofrece un punto de partida útil. Limita dónde pueden producirse los cambios y crea un límite de auditoría más claro que la generación de imágenes sin restricciones.

Los experimentos futuros podrían probar restauración basada en difusión, en la que un modelo generativo rellena regiones dañadas. Ese enfoque podría producir papel visualmente convincente, pero los equipos archivísticos necesitarían garantías contra cambios fuera de una máscara aprobada.

Por tanto, un estándar realista debería recompensar la abstención. Los sistemas deben poder decir que una página es ambigua y requiere a una persona. Las altas tasas de automatización tienen menos valor cuando ocultan errores textuales irreversibles.

El proyecto también ofrece una lección más amplia para los equipos de producto de IA. La experiencia en un dominio suele aparecer como correcciones, excepciones y preferencias acumuladas durante el trabajo real. Tratar esos rastros como retroalimentación estructurada puede ser más eficaz que ampliar continuamente un modelo.

Para los archivistas, el siguiente paso no es sustituir el criterio. Es identificar dónde diez decisiones cuidadosas pueden guiar con seguridad las siguientes mil páginas.

Para los lectores que descubrieron Ibteda a través de Google News, los recuentos de cámaras son un punto de entrada impresionante. La pregunta duradera es si las instituciones probarán, financiarán y reproducirán el flujo de trabajo antes de que colecciones similares desaparezcan en estanterías inaccesibles o conjuntos de datos privados de entrenamiento.

Busque la colección Ibteda disponible, compare una página procesada con su complejidad material y esté atento a una publicación técnica pública. Si otro archivo puede reproducir la mejora de calibración de 0,71 a 0,83 mientras protege cada marca significativa, este pequeño proyecto habrá aportado algo que los sistemas de IA más grandes suelen pasar por alto: automatización que se adapta al criterio humano sin borrar la evidencia que ese criterio pretendía preservar.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page