top of page

Ibteda Digital Library Preserva 1.800 Livros Raros, mas Dez Correções Humanas Superam uma IA Maior

A Ibteda Digital Library chegou ao Google News depois que três amigos paquistaneses fizeram cerca de 902.000 cliques com duas câmeras Nikon econômicas enquanto preservavam livros raros em urdu. Seu esforço de uma década produziu 526.000 fotografias de livros abertos, segundo um relato do projeto e reportagens posteriores.

As impressionantes contagens das câmeras ajudaram a história a se espalhar. Ainda assim, o resultado mais importante surgiu após o fim do trabalho diário de digitalização. Um integrante da equipe transformou anos de edições manuais no Photoshop em rótulos de treinamento para uma rede neural.

O experimento trouxe uma conclusão incômoda para um setor condicionado a esperar ganhos com modelos maiores e mais dados. Livros adicionais para treinamento, entradas de maior resolução e uma arquitetura ResNet-50 não resolveram o problema central de recorte. Dez correções feitas por um operador humano resolveram.

Assim, o projeto representa mais do que uma operação de digitalização incomumente determinada. Ele mostra por que a preservação cultural não pode simplesmente importar as premissas dos grandes sistemas comerciais de IA. Um arquivo precisa preservar marcas incomuns, anotações nas margens, pontuação e defeitos materiais que um modelo generalista poderia classificar como ruído.

Ele também oferece um contraste marcante com programas industriais de digitalização de livros. Investigações recentes descrevem empresas comprando e digitalizando destrutivamente livros impressos para treinamento de IA. A Ibteda trabalhou lentamente, preservou os volumes físicos e disponibilizou ao menos parte da coleção resultante aos leitores.

Os Números por Trás da Manchete no Google News

As contagens das câmeras contam uma história de resistência, mas a fila de processamento inacabada explica por que a Ibteda precisou mudar de rumo.

A Ibteda começou por volta de 2015, quando seus fundadores pesquisavam edições históricas do Diwan de Ghalib. Eles tiveram dificuldade para localizar volumes importantes que estavam esgotados, inacessíveis em coleções universitárias ou em posse de particulares.

A equipe respondeu construindo seu próprio arquivo no Paquistão. Não dispunha de laboratório institucional de digitalização, empresa comercial de escaneamento nem orçamento dedicado para equipamentos. Sua estrutura começou com uma mesa plana, luzes LED Philips baratas, uma câmera montada acima do livro e vidro reaproveitado de uma fotocopiadora.

Um único disparo capturava as duas páginas opostas. Esse método acelerava a fotografia, mas cada imagem também continha a mesa, as bordas das páginas, sombras na lombada, margens irregulares, manchas e acréscimos manuscritos.

A Nikon D5300 acabou acumulando aproximadamente 576.000 acionamentos do obturador. A D3300 acrescentou cerca de 326.000, levando o total comumente informado a aproximadamente 902.000. Esses números vieram de dados de obturador associados às câmeras, e não de uma estimativa baseada apenas no número de páginas publicadas.

A equipe fotografou cerca de 526.000 aberturas de livros. Uma abertura contém duas páginas opostas, portanto o número não pode ser tratado como 526.000 livros concluídos nem mesmo como 526.000 arquivos finais de páginas. A fotografia foi apenas a primeira etapa.

O relato mais detalhado do projeto diz que os operadores concluíram 575.729 recortes individuais de páginas em 1.765 livros. Esse trabalho concluído se tornou a base do experimento posterior de aprendizado de máquina.

Algumas coberturas arredondam a coleção para 1.800 livros, enquanto as descrições atuais da biblioteca se referem a um catálogo muito maior, reunido pela iniciativa mais ampla. Essas medidas descrevem coisas diferentes: volumes processados, material fotografado, acervo catalogado e seleções hospedadas por parceiros.

Por exemplo, a coleção Rekhta informa que a Ibteda começou em 2016 e descreve um catálogo com mais de 5.000 livros e 3 milhões de páginas. Atualmente, a Rekhta apresenta uma parte selecionada dessa coleção mais ampla, e não todas as fotografias brutas ou processadas.

Essa distinção importa porque a manchete viral pode sugerir uma conversão concluída de cada abertura fotografada. Na realidade, a carga de processamento superou a capacidade da equipe de manter as operações diárias.

A Ibteda teria encerrado o trabalho rotineiro em abril de 2026, após quase uma década. O grupo preservou com sucesso um conjunto substancial de literatura em urdu, mas centenas de milhares de aberturas capturadas ainda exigiam processamento cuidadoso.

As câmeras da equipe resistiram muito além da carga de trabalho esperada de uma operação comunitária improvisada. A atenção humana tornou-se o recurso mais escasso.

Capturar um Livro Era a Parte Fácil

O gargalo da Ibteda não era tirar fotografias. Era transformar páginas históricas irregulares em arquivos nos quais um acervo pudesse confiar.

Após cada exposição, um operador abria a fotografia no Photoshop. O operador separava as páginas opostas, endireitava-as, selecionava limites adequados e lidava com manchas ou outras interferências visuais.

Isso não era um simples recorte em lote. Muitos volumes usavam Nastaliq, um estilo de escrita fluido comumente associado às tradições literárias em urdu e persa. Seus pontos, formas diagonais, marcas compactas e diacríticos complicam a limpeza automatizada.

Uma pequena mancha escura poderia ser sujeira. Também poderia ser um ponto significativo que altera uma letra. Uma linha próxima à borda poderia ser uma sombra acidental, uma borda impressa ou uma anotação manuscrita digna de preservação.

As litografias acrescentavam ainda mais variação. As páginas podiam conter impressões irregulares, papel envelhecido, geometria deformada, sombras profundas na lombada, escrita nas margens, tabelas ou elementos decorativos. Nenhum retângulo único representava o recorte correto para todos os volumes.

O operador também tomava decisões estéticas e editoriais. Um livro poderia ficar melhor com uma margem estreita. Outro precisava de mais espaço ao redor para reter anotações, evidências da encadernação ou uma borda impressa incomum.

Essas escolhas criaram uma variável oculta. A margem preferida nem sempre era visível nos pixels. Dois arquivistas competentes poderiam observar a mesma página e selecionar limites aceitáveis ligeiramente diferentes.

Esse problema separa o processamento arquivístico de muitas tarefas comerciais de imagem. Um aplicativo de compras pode tolerar uma pequena normalização visual. Um sistema de preservação não pode remover marcas casualmente apenas porque se parecem com defeitos.

O arquivo da Ibteda também precisava apoiar inspeções futuras. O fluxo de trabalho teria armazenado o material concluído em um pool ZFS, um sistema de armazenamento que usa checksumming e recursos relacionados de integridade. Manifestos BLAKE3 registravam impressões criptográficas que poderiam revelar alterações posteriores nos arquivos.

Essa ênfase na rastreabilidade é importante. Uma página de aparência limpa não é automaticamente um objeto arquivístico confiável. Pesquisadores precisam saber que o software não reescreveu silenciosamente a fonte.

O mesmo princípio se aplica à moderna gestão do conhecimento. A busca e a automação criam valor apenas quando as pessoas conseguem rastrear a informação até um material-fonte estável e compreensível.

Para a Ibteda, cada hora economizada pela automação trazia um risco correspondente. Um modelo que removesse corretamente uma mancha, mas apagasse uma marca em urdu em outro ponto, poderia introduzir um erro textual permanente.

Portanto, o projeto precisava de mais do que um modelo de aprimoramento de imagens. Precisava de um sistema conservador que soubesse quando propor uma mudança, quando preservar os pixels originais e quando devolver uma página a uma pessoa.

Essa exigência levou a equipe a criar modelos e regras de processamento separados para recorte e retoque. Ela também explica por que um grande volume de trabalho histórico no Photoshop se tornou dado de treinamento valioso.

Uma Década de Edições no Photoshop Virou Dados de Treinamento

O ativo mais reutilizável da equipe não era o hardware das câmeras. Era o registro de 575.729 decisões humanas tomadas durante o trabalho rotineiro de produção.

Cada página concluída no Photoshop codificava uma decisão sobre onde a página começava e terminava. No entanto, essas decisões inicialmente não existiam como rótulos estruturados prontos para aprendizado de máquina.

A equipe precisou conectar as páginas concluídas às suas fotografias originais. Sua discussão técnica publicada descreve o uso de SIFT e MAGSAC durante esse processo de recuperação.

SIFT, ou Scale-Invariant Feature Transform, identifica características visuais distintas que ainda podem corresponder após mudanças de escala ou rotação. MAGSAC é um método robusto de estimativa que ajuda a rejeitar correspondências incorretas ao ajustar a geometria da imagem.

Juntas, essas técnicas permitiram que o projeto estimasse como uma página concluída se relacionava com a imagem bruta da câmera. Regras conservadoras de aceitação filtravam correspondências questionáveis em vez de forçar cada arquivo para dentro do conjunto de dados.

A geometria resultante tornou-se supervisão para um modelo de previsão de recorte. Em termos práticos, a equipe converteu anos de edição humana em exemplos que mostravam onde os operadores haviam colocado os limites das páginas.

Esse é um padrão valioso para outros pequenos arquivos. Uma organização pode não ter um conjunto de dados de IA formalmente rotulado, mas possuir anos de edições, correções, aprovações e resultados de produção. Esses registros podem conter mais conhecimento útil do domínio do que uma coleção genérica de imagens.

No entanto, dados de fluxos de trabalho históricos não são automaticamente confiáveis. Eles podem incluir preferências inconsistentes de operadores, mudanças de padrões, arquivos duplicados, edições malsucedidas e exceções não documentadas.

O caso da Ibteda era especialmente desafiador porque parte da inconsistência representava julgamento legítimo. Um recorte estreito poderia estar correto para um volume, enquanto a mesma margem poderia danificar outro.

O modelo de recorte ainda aprendeu a estrutura visível. Ele conseguia reconhecer limites prováveis das páginas, lombadas e o espaço da mesa ao redor. Ainda assim, a equipe descobriu que seus erros restantes eram frequentemente quase constantes dentro de cada livro.

Esse padrão foi revelador. O modelo não estava simplesmente falhando em detectar páginas. Ele deixava de captar o recuo preferido pelo operador para um volume específico.

Em uma discussão técnica, o autor do projeto disse que ampliar o treinamento de 378 para 572 livros não melhorou o desempenho em volumes não vistos. Um modelo ResNet-50 se ajustou melhor aos dados de treinamento, mas permaneceu estável no material reservado para teste.

Aumentar a resolução de entrada para 1.024 pixels também não trouxe o ganho esperado. Uma camada de previsão espacial tampouco resolveu o problema.

Esses resultados negativos importam porque desafiam um reflexo comum no desenvolvimento de IA. Quando o desempenho estagna, as equipes frequentemente adicionam dados, capacidade computacional, resolução ou uma arquitetura maior.

Essa estratégia funciona quando o sinal ausente existe em algum lugar das entradas de treinamento. Os experimentos da Ibteda sugerem que a preferência decisiva não era visível nos pixels de um novo livro.

Nenhuma arquitetura maior consegue inferir de forma confiável informações que a imagem não contém. O sistema precisava de uma pequena quantidade de novo contexto humano.

Dez Correções Superaram uma Rede Neural Maior

A Ibteda melhorou seu modelo de recorte calibrando-o para cada livro, não pedindo a uma rede maior que adivinhasse uma preferência invisível.

Para um novo volume, um operador corrigia dez recortes previstos. O sistema comparava essas correções com suas previsões originais e calculava o resíduo mediano, ou seja, o deslocamento típico entre a saída da máquina e a preferência humana.

Em seguida, aplicava esse ajuste às páginas restantes do livro. As páginas de um mesmo volume geralmente compartilhavam dimensões do papel, estilo de impressão, geometria da encadernação e a margem desejada pelo operador.

O projeto relata que essa calibração elevou sua medida pass@80 de 0,71 para 0,83 em volumes reservados para teste. Pass@80 representava a proporção de livros em que pelo menos 80% das páginas atendiam aos critérios de aceitação do projeto.

Esse ganho veio de dez correções feitas por operadores, não de um modelo maior. Ele sustenta uma forma prática de automação com participação humana, na qual uma pessoa fornece exemplos limitados que orientam o sistema em um lote específico.

O mecanismo é modesto em comparação com um modelo de visão de uso geral. É exatamente por isso que se adequa à tarefa. Ele mira o viés estável no nível do livro que o modelo não consegue observar diretamente.

O sistema não elimina o arquivista. Ele desloca a atenção do arquivista para o início de um volume e, em seguida, aplica esse julgamento de forma consistente às páginas posteriores.

Essa abordagem também limita o custo das falhas. Se a calibração parecer incorreta, o operador pode interromper o processamento daquele volume. Um sistema totalmente autônomo poderia repetir o mesmo erro sutil de recorte em centenas de páginas antes que alguém percebesse.

O resultado tem implicações que vão além dos livros. Muitos fluxos de trabalho com documentos contêm preferências vinculadas a um cliente, projeto, coleção, instrumento ou período de relatório. Essas preferências muitas vezes estão ausentes do conteúdo bruto.

Um modelo geral pode identificar estruturas visíveis, enquanto algumas correções fornecem uma política local. Essa combinação pode superar um modelo maior treinado com preferências incompatíveis.

O trabalho de retoque de Ibteda seguiu uma filosofia igualmente conservadora. Uma U-Net, arquitetura neural projetada para segmentação de imagens em nível de pixel, identificava regiões candidatas contendo manchas, carimbos ou marcas indesejadas.

O modelo lidava apenas com a detecção. Rotinas clássicas do OpenCV reconstruíam a textura do papel dentro da máscara aprovada, enquanto os pixels fora dessa área permaneciam inalterados.

Os rótulos de treinamento usavam três estados: REMOVE, KEEP e IGNORE. REMOVE identificava marcas consideradas seguras para apagar. KEEP protegia conteúdo que se assemelhava a ruído, mas pertencia ao documento. IGNORE excluía regiões ambíguas do treinamento.

O autor do projeto relatou que uma rotulagem mais rigorosa elevou a interseção sobre união das marcas de 0,56 para 0,60. A interseção sobre união mede a sobreposição entre uma região prevista e seu alvo rotulado por humanos.

Mais importante, o processo mais rigoroso teria reduzido a remoção indevida de diacríticos em urdu a zero no material avaliado. A equipe tratou qualquer diacrítico apagado como um veto à implantação, independentemente da pontuação média do modelo.

Essa regra captura um princípio central de preservação. Uma métrica agregada elevada não pode justificar a exclusão de texto significativo. Uma falha culturalmente relevante pode importar mais do que milhares de pixels corretamente limpos.

Este Modelo de Preservação Desafia a Digitalização Destrutiva

Ibteda usou IA para prolongar a vida de um acervo, enquanto programas de digitalização industrial frequentemente buscam adquirir texto o mais rápido possível.

O contraste se tornou mais nítido em agosto de 2026. Investigações relataram que empresas de tecnologia compravam livros físicos, removiam suas encadernações, digitalizavam as páginas e descartavam os restos.

Registros judiciais já haviam mostrado que a Anthropic comprou e digitalizou destrutivamente milhões de livros ao montar uma biblioteca interna de pesquisa. A Anthropic afirmou que seus programas de aquisição não visavam livros raros ou antigos.

Reportagens mais recentes se concentraram na Amazon. Uma remessa rastreada teria chegado a uma instalação da Amazon, onde trabalhadores cortavam lombadas de livros antes da digitalização. A Amazon não forneceu respostas públicas sobre a escala total do programa nem sobre como o texto digitalizado seria usado.

A investigação sobre digitalização industrial levantou preocupações entre livreiros porque alguns títulos comprados pareciam escassos. As evidências não estabelecem que todos os compradores em massa visem intencionalmente cópias únicas ou insubstituíveis.

Ainda assim, o incentivo subjacente é claro. Grandes desenvolvedores de IA querem quantidades substanciais de escrita humana em formato longo. Remover a encadernação de um livro permite que páginas individuais passem rapidamente por um scanner automatizado.

Ibteda enfrentava o objetivo oposto. Seus livros físicos eram objetos culturais, não recipientes temporários de texto para treinamento. O projeto precisava preservar layout, manuscritos, artefatos de impressão e outras evidências além das palavras.

Essa distinção afeta todas as decisões de engenharia. A digitalização destrutiva prioriza velocidade, páginas planas e extração limpa de texto. A geração de imagens para arquivo deve equilibrar legibilidade e fidelidade material.

Ibteda também distribuiu o acesso em vez de bloquear as digitalizações dentro de um pipeline proprietário de treinamento. Uma seleção está visível por meio do Rekhta, enquanto material relacionado foi preservado na coleção do Internet Archive.

O acesso aberto não resolve todas as questões de direitos autorais ou gestão responsável. Digitalizar material fora de catálogo pode envolver questões complexas de direitos, privacidade e propriedade. Arquivos comunitários ainda precisam de políticas que regulem acesso, remoções, expectativas dos doadores e registros sensíveis.

Tampouco o fluxo de trabalho de Ibteda prova que todo livro frágil pode suportar com segurança uma placa de vidro. Os requisitos de conservação variam conforme a encadernação, o estado do papel, a tinta e o valor histórico. Alguns volumes exigem suportes profissionais, menor pressão ou geração de imagens especializada.

As descobertas de aprendizado de máquina do sistema também continuam sendo resultados relatados pelo próprio projeto. O código e os pesos ainda estavam sob revisão arquivística quando o autor os discutiu publicamente. Equipes independentes ainda não reproduziram todo o pipeline em diferentes escritas e coleções.

As métricas de avaliação refletem os próprios critérios de aceitação de Ibteda. Outro arquivo poderia escolher margens, limites de erro ou definições diferentes para uma alteração textual inaceitável.

Essas limitações não apagam a contribuição. Elas definem o que precisa acontecer antes que outros tratem o fluxo de trabalho como um padrão de preservação transferível.

A afirmação mais forte é mais restrita do que a manchete do Google News. Ibteda encontrou uma maneira promissora de recuperar supervisão a partir de edições históricas e combinar previsões gerais com calibração humana por livro.

O Que Arquivistas e Equipes de IA Devem Observar a Seguir

O valor do projeto agora depende de reprodutibilidade, testes entre coleções e evidências de que suas salvaguardas resistem ao uso rotineiro.

O primeiro sinal é uma divulgação técnica pública. A equipe descreveu receitas de treinamento, limites de recuperação de rótulos, regras de encaminhamento e um contrato de reprodução. A disponibilização de código, pesos, amostras de avaliação ou um conjunto de dados cuidadosamente governado permitiria que outros examinassem esses detalhes.

Uma divulgação útil deve incluir exemplos difíceis, não apenas páginas bem-sucedidas. Pesquisadores precisam de sombras de lombada, anotações manuscritas, Nastaliq denso, litografias danificadas, carimbos, bordas e páginas em que a automação foi rejeitada.

A reprodução independente fortaleceria a descoberta central do projeto. Se outras equipes também constatarem que algumas correções locais superam a ampliação indiscriminada de modelos, o resultado poderá influenciar muitos sistemas especializados de documentos.

A incapacidade de reproduzi-lo ainda seria informativa. A melhoria poderia depender do equipamento de captura de Ibteda, da consistência dos operadores, dos formatos dos livros ou de uma métrica de aceitação específica.

O segundo sinal é o teste entre instituições e escritas. A preservação do urdu é o caso de uso central do projeto, mas desafios relacionados surgem em coleções de persa, árabe, turco otomano e manuscritos do sul da Ásia.

Testes entre coleções devem medir mais do que a sobreposição de recortes. Eles devem examinar diacríticos perdidos, marginalia alterada, ordem incorreta das páginas, remoção acidental de texto, tempo dos operadores, taxas de rejeição e o custo de revisar falhas.

O benchmark mais valioso separaria a geometria visível da preferência editorial. Esse desenho poderia testar se a calibração funciona porque captura um padrão real no nível do volume, em vez de compensar peculiaridades de um conjunto de dados.

O terceiro sinal é a adoção operacional. Um modelo promissor não elimina automaticamente um acúmulo de trabalho. Arquivos precisam de interfaces para inserir correções, revisar páginas incertas, rastrear transformações e restaurar originais.

Os operadores devem poder ver exatamente o que o modelo alterou. Eles também precisam de imagens-fonte imutáveis e parâmetros registrados para cada página derivada.

A separação feita por Ibteda entre detecção neural e reconstrução restrita oferece um ponto de partida útil. Ela limita onde as alterações podem ocorrer e cria um limite de auditoria mais claro do que a geração irrestrita de imagens.

Experimentos futuros podem testar restauração baseada em difusão, na qual um modelo generativo preenche regiões danificadas. Essa abordagem poderia produzir papel visualmente convincente, mas as equipes de arquivo precisariam de garantias contra alterações fora de uma máscara aprovada.

Portanto, um padrão realista deve recompensar a abstenção. Os sistemas precisam poder dizer que uma página é ambígua e requer uma pessoa. Altas taxas de automação são menos valiosas quando ocultam erros textuais irreversíveis.

O projeto também oferece uma lição mais ampla para equipes de produto de IA. A expertise de domínio frequentemente aparece como correções, exceções e preferências acumuladas durante o trabalho real. Tratar esses rastros como feedback estruturado pode ser mais eficaz do que ampliar continuamente um modelo.

Para os arquivistas, o próximo passo não é substituir o julgamento. É identificar onde dez decisões cuidadosas podem orientar com segurança as próximas mil páginas.

Para leitores que descobriram Ibteda pelo Google News, as contagens de câmeras são um ponto de entrada impressionante. A questão duradoura é se as instituições testarão, financiarão e reproduzirão o fluxo de trabalho antes que coleções semelhantes desapareçam em prateleiras inacessíveis ou conjuntos de dados privados de treinamento.

Procure a coleção Ibteda disponível, compare uma página processada com sua complexidade material e acompanhe uma divulgação técnica pública. Se outro arquivo conseguir reproduzir o ganho de calibração de 0,71 para 0,83 enquanto protege cada marca significativa, este pequeno projeto terá entregado algo que sistemas maiores de IA frequentemente deixam escapar: automação que se adapta ao julgamento humano sem apagar as evidências que esse julgamento buscava preservar.

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page