Ibteda Digital Library preserva 1.800 libri rari, ma dieci correzioni umane superano un'AI più grande
Ibteda Digital Library è arrivata su Google News dopo che tre amici pakistani hanno effettuato circa 902.000 scatti con due fotocamere Nikon economiche, preservando libri rari in urdu. Il loro impegno decennale ha prodotto 526.000 fotografie di doppie pagine aperte, secondo un resoconto del progetto e successive notizie.
L'impressionante numero di scatti ha dato risonanza alla storia. Eppure, il risultato più importante è arrivato dopo l'interruzione del lavoro quotidiano di digitalizzazione. Un membro del team ha trasformato anni di modifiche manuali in Photoshop in etichette di addestramento per una rete neurale.
L'esperimento ha prodotto una conclusione scomoda per un settore abituato ad aspettarsi miglioramenti da modelli più grandi e più dati. Altri libri per l'addestramento, input a risoluzione più elevata e un'architettura ResNet-50 non hanno risolto il problema centrale del ritaglio. Ci sono riuscite dieci correzioni di un operatore umano.
Il progetto rappresenta quindi più di un'operazione di scansione insolitamente determinata. Mostra perché la conservazione culturale non può semplicemente importare le assunzioni alla base dei grandi sistemi di AI commerciali. Un archivio deve preservare segni insoliti, note a margine, punteggiatura e difetti materiali che un modello generico potrebbe classificare come rumore.
Offre inoltre un netto contrasto con i programmi industriali di scansione dei libri. Recenti inchieste descrivono aziende che acquistano e scansionano in modo distruttivo libri stampati per addestrare l'AI. Ibteda ha lavorato lentamente, ha preservato i volumi fisici e ha reso disponibile ai lettori almeno una parte della collezione risultante.
I numeri dietro il titolo di Google News
I conteggi delle fotocamere raccontano una storia di tenacia, ma è la coda di elaborazione incompleta a spiegare perché Ibteda abbia dovuto cambiare direzione.
Ibteda è nata intorno al 2015, quando i suoi fondatori stavano studiando edizioni storiche del Diwan di Ghalib. Faticavano a reperire volumi importanti fuori catalogo, inaccessibili nelle collezioni universitarie o detenuti privatamente.
Il team ha risposto creando il proprio archivio in Pakistan. Non disponeva di un laboratorio istituzionale di digitalizzazione, di un servizio commerciale di scansione o di un budget dedicato alle attrezzature. Il suo sistema iniziale comprendeva un tavolo piano, economiche luci LED Philips, una fotocamera montata sopra il libro e un vetro recuperato da una fotocopiatrice.
Un singolo scatto catturava entrambe le pagine affiancate. Questo metodo accelerava la fotografia, ma ogni immagine includeva anche il piano del tavolo, i bordi delle pagine, le ombre della rilegatura, margini irregolari, macchie e aggiunte manoscritte.
La Nikon D5300 ha infine accumulato circa 576.000 azionamenti dell'otturatore. La D3300 ne ha aggiunti circa 326.000, portando il totale comunemente riportato a circa 902.000. Queste cifre derivano dai dati dell'otturatore associati alle fotocamere, non da una stima basata soltanto sul numero di pagine pubblicate.
Il team ha fotografato circa 526.000 doppie pagine aperte. Una doppia pagina contiene due pagine affiancate, quindi il numero non può essere considerato come 526.000 libri completati né come 526.000 file di pagina finalizzati. La fotografia era soltanto la prima fase.
Il resoconto più dettagliato del progetto afferma che gli operatori hanno completato 575.729 ritagli di singole pagine in 1.765 libri. Questo lavoro completato è diventato la base per il successivo esperimento di machine learning.
Alcune coperture giornalistiche arrotondano la collezione a 1.800 libri, mentre le descrizioni attuali della biblioteca fanno riferimento a un catalogo molto più ampio, assemblato attraverso l'iniziativa nel suo complesso. Queste misurazioni descrivono cose diverse: volumi elaborati, materiale fotografato, fondi catalogati e selezioni ospitate da partner.
Per esempio, la collezione Rekhta afferma che Ibteda è iniziata nel 2016 e descrive un catalogo che supera i 5.000 libri e i 3 milioni di pagine. Rekhta presenta attualmente una porzione selezionata di questa collezione più ampia, anziché ogni fotografia grezza o elaborata.
Questa distinzione è importante perché il titolo virale può far pensare a una conversione completata di ogni doppia pagina fotografata. In realtà, il carico di elaborazione ha superato la capacità del team di sostenere le operazioni quotidiane.
Secondo quanto riportato, Ibteda ha ridotto le attività ordinarie nell'aprile 2026, dopo quasi un decennio. Il gruppo aveva preservato con successo un notevole corpus di letteratura urdu, ma centinaia di migliaia di doppie pagine acquisite richiedevano ancora un'elaborazione accurata.
Le fotocamere del team avevano resistito ben oltre il carico di lavoro atteso da un'operazione comunitaria improvvisata. L'attenzione umana è diventata la risorsa più scarsa.
Acquisire un libro era la parte facile
Il collo di bottiglia di Ibteda non era scattare fotografie. Era trasformare pagine storiche irregolari in file di cui un archivio potesse fidarsi.
Dopo ogni esposizione, un operatore apriva la fotografia in Photoshop. L'operatore separava le pagine affiancate, le raddrizzava, selezionava i confini appropriati e gestiva macchie o altre interferenze visive.
Non si trattava di un normale ritaglio in batch. Molti volumi usavano il Nastaliq, uno stile di scrittura fluido comunemente associato alle tradizioni letterarie urdu e persiane. I suoi punti, le forme diagonali, i segni compatti e i diacritici complicano la pulizia automatizzata.
Un piccolo puntino scuro poteva essere sporco. Poteva anche essere un punto significativo che cambia una lettera. Una linea vicino al bordo poteva essere un'ombra accidentale, un bordo stampato o un'annotazione manoscritta degna di essere preservata.
Le litografie aggiungevano ulteriore variabilità. Le pagine potevano contenere impressioni irregolari, carta invecchiata, geometrie deformate, profonde ombre nella rilegatura, scritte a margine, tabelle o elementi decorativi. Nessun singolo rettangolo rappresentava il ritaglio corretto per ogni volume.
L'operatore compiva anche scelte estetiche ed editoriali. Un libro poteva apparire migliore con un margine stretto. Un altro richiedeva più spazio circostante per conservare note, tracce della rilegatura o un insolito bordo stampato.
Queste scelte hanno creato una variabile nascosta. Il margine preferito non era sempre visibile nei pixel. Due archivisti competenti potevano osservare la stessa pagina e selezionare confini accettabili leggermente diversi.
Questo problema distingue l'elaborazione archivistica da molte attività di imaging commerciale. Un'applicazione per lo shopping può tollerare una lieve normalizzazione visiva. Un sistema di conservazione non può rimuovere con leggerezza segni soltanto perché assomigliano a difetti.
L'archivio di Ibteda doveva anche supportare future verifiche. Secondo quanto riportato, il flusso di lavoro archiviava il materiale completato in un pool ZFS, un sistema di archiviazione che usa checksum e funzioni di integrità correlate. I manifesti BLAKE3 registravano impronte crittografiche in grado di rilevare successive modifiche ai file.
Questa enfasi sulla tracciabilità è importante. Una pagina dall'aspetto pulito non è automaticamente un oggetto archivistico affidabile. I ricercatori devono sapere che il software non ha riscritto silenziosamente la fonte.
Lo stesso principio si applica al moderno knowledge management. Ricerca e automazione creano valore soltanto quando le persone possono ricondurre le informazioni a materiali di origine stabili e comprensibili.
Per Ibteda, ogni ora risparmiata grazie all'automazione comportava un rischio corrispondente. Un modello che eliminava correttamente una macchia ma rimuoveva altrove un segno urdu poteva introdurre un errore testuale permanente.
Il progetto aveva quindi bisogno di qualcosa di più di un modello di miglioramento delle immagini. Aveva bisogno di un sistema conservativo, capace di sapere quando proporre una modifica, quando preservare i pixel originali e quando rimandare una pagina a una persona.
Questa esigenza ha portato il team verso modelli separati e regole di elaborazione distinte per il ritaglio e il ritocco. Spiega anche perché un grande volume di lavoro storico in Photoshop sia diventato prezioso materiale di addestramento.
Un decennio di modifiche in Photoshop è diventato materiale di addestramento
La risorsa più riutilizzabile del team non era l'hardware delle fotocamere. Era la traccia di 575.729 decisioni umane prese durante il normale lavoro di produzione.
Ogni pagina completata in Photoshop codificava una scelta su dove la pagina iniziasse e finisse. Tuttavia, tali decisioni non esistevano inizialmente come etichette strutturate pronte per il machine learning.
Il team ha dovuto collegare le pagine completate alle fotografie originali. La sua discussione tecnica pubblicata descrive l'uso di SIFT e MAGSAC durante questo processo di recupero.
SIFT, o Scale-Invariant Feature Transform, identifica caratteristiche visive distintive che possono continuare a corrispondere dopo variazioni di scala o rotazione. MAGSAC è un metodo di stima robusto che aiuta a scartare corrispondenze errate durante l'adattamento della geometria dell'immagine.
Insieme, queste tecniche hanno consentito al progetto di stimare come una pagina completata fosse collegata all'immagine grezza della fotocamera. Regole di accettazione conservative filtravano le corrispondenze dubbie anziché forzare ogni file nel dataset.
La geometria risultante è diventata supervisione per un modello di previsione del ritaglio. In termini pratici, il team ha trasformato anni di modifiche umane in esempi che mostravano dove gli operatori avessero collocato i confini delle pagine.
Questo è un modello prezioso per altri piccoli archivi. Un'organizzazione può non disporre di un dataset AI formalmente etichettato pur possedendo anni di modifiche, correzioni, approvazioni e output di produzione. Questi archivi possono contenere conoscenze di dominio più utili di una raccolta generica di immagini.
Tuttavia, i dati dei flussi di lavoro storici non sono automaticamente affidabili. Possono includere preferenze incoerenti degli operatori, cambiamenti negli standard, file duplicati, modifiche fallite ed eccezioni non documentate.
Il caso di Ibteda era particolarmente impegnativo perché alcune incoerenze rappresentavano un giudizio legittimo. Un ritaglio stretto poteva essere corretto per un volume, mentre lo stesso margine poteva danneggiarne un altro.
Il modello di ritaglio ha comunque appreso la struttura visibile. Poteva riconoscere probabili confini delle pagine, rilegature e spazio circostante del tavolo. Tuttavia, il team ha scoperto che gli errori residui erano spesso quasi costanti all'interno di ciascun libro.
Questo schema era rivelatore. Il modello non stava semplicemente fallendo nel rilevare le pagine. Non coglieva il margine interno preferito dall'operatore per un determinato volume.
In una discussione tecnica, l'autore del progetto ha affermato che l'espansione dell'addestramento da 378 a 572 libri non ha migliorato le prestazioni su volumi non osservati. Un modello ResNet-50 si adattava meglio ai dati di addestramento, ma restava invariato sul materiale riservato alla valutazione.
Anche l'aumento della risoluzione di input a 1.024 pixel non è riuscito a ottenere il miglioramento atteso. Nemmeno una testa di previsione spaziale ha risolto il problema.
Questi risultati negativi sono importanti perché mettono in discussione un riflesso familiare nello sviluppo dell'AI. Quando le prestazioni ristagnano, i team spesso aggiungono dati, capacità di calcolo, risoluzione o un'architettura più grande.
Questa strategia funziona quando il segnale mancante esiste da qualche parte negli input di addestramento. Gli esperimenti di Ibteda suggeriscono che la preferenza decisiva non fosse visibile nei pixel di un nuovo libro.
Nessuna architettura più grande può inferire in modo affidabile informazioni che l'immagine non contiene. Il sistema richiedeva una piccola quantità di nuovo contesto umano.
Dieci correzioni superano una rete neurale più grande
Ibteda ha migliorato il suo modello di ritaglio calibrandolo per ciascun libro, non chiedendo a una rete più grande di indovinare una preferenza invisibile.
Per un nuovo volume, un operatore correggeva dieci ritagli previsti. Il sistema confrontava tali correzioni con le previsioni originali e calcolava il residuo mediano, ossia lo scostamento tipico tra l'output della macchina e la preferenza umana.
Applicava poi tale regolazione alle pagine restanti del libro. Le pagine di uno stesso volume condividevano solitamente dimensioni della carta, stile di stampa, geometria della rilegatura e il margine desiderato dall'operatore.
Il progetto riferisce che questa calibrazione ha aumentato la misura pass@80 da 0,71 a 0,83 su volumi esclusi dall'addestramento. Pass@80 rappresentava la quota di libri per cui almeno l'80 per cento delle pagine soddisfaceva i criteri di accettazione del progetto.
Il miglioramento è derivato da dieci correzioni dell'operatore, non da un modello più grande. Sostiene una forma pratica di automazione human-in-the-loop, in cui una persona fornisce un numero limitato di esempi che guidano il sistema attraverso uno specifico lotto.
Il meccanismo è modesto rispetto a un modello di visione per uso generale. È proprio per questo che si adatta al compito. Mira al bias stabile a livello di libro che il modello non può osservare direttamente.
Il sistema non elimina l'archivista. Sposta l'attenzione dell'archivista all'inizio di un volume, quindi applica quel giudizio in modo coerente alle pagine successive.
Questo approccio limita anche il costo del fallimento. Se la calibrazione sembra errata, l'operatore può interrompere l'elaborazione di quel volume. Un sistema completamente autonomo potrebbe ripetere lo stesso sottile errore di ritaglio su centinaia di pagine prima che qualcuno se ne accorga.
Il risultato ha implicazioni che vanno oltre i libri. Molti flussi di lavoro documentali contengono preferenze legate a un cliente, progetto, collezione, strumento o periodo di rendicontazione. Tali preferenze sono spesso assenti dal contenuto grezzo.
Un modello generale può identificare la struttura visibile, mentre una manciata di correzioni fornisce una politica locale. Questa combinazione può superare un modello più grande addestrato su preferenze incompatibili.
Il lavoro di ritocco di Ibteda ha seguito una filosofia altrettanto prudente. Una U-Net, un'architettura neurale progettata per la segmentazione delle immagini a livello di pixel, ha identificato regioni candidate contenenti macchie, timbri o segni indesiderati.
Il modello gestiva soltanto il rilevamento. Le routine classiche di OpenCV ricostruivano la texture della carta all'interno della maschera approvata, mentre i pixel esterni a quell'area restavano invariati.
Le etichette di addestramento utilizzavano tre stati: REMOVE, KEEP e IGNORE. REMOVE identificava i segni considerati sicuri da eliminare. KEEP proteggeva contenuti simili al rumore ma appartenenti al documento. IGNORE escludeva dall'addestramento le regioni ambigue.
L'autore del progetto ha riferito che un'etichettatura più rigorosa ha aumentato l'intersezione sull'unione dei segni da 0,56 a 0,60. L'intersezione sull'unione misura la sovrapposizione tra una regione prevista e il suo obiettivo etichettato da un essere umano.
Ancora più importante, il processo più rigoroso avrebbe ridotto a zero la rimozione errata dei segni diacritici urdu nel materiale valutato. Il team ha trattato qualsiasi diacritico cancellato come un veto al deployment, indipendentemente dal punteggio medio del modello.
Questa regola coglie un principio centrale della conservazione. Un'elevata metrica aggregata non può giustificare la cancellazione di testo significativo. Un singolo fallimento culturalmente rilevante può contare più di migliaia di pixel puliti correttamente.
Questo modello di conservazione mette in discussione la scansione distruttiva
Ibteda ha usato l'AI per prolungare la vita di un archivio, mentre i programmi di scansione industriale spesso ottimizzano l'acquisizione del testo nel minor tempo possibile.
Il contrasto è diventato più netto nell'agosto 2026. Alcune indagini hanno riferito che aziende tecnologiche acquistavano libri fisici, ne rimuovevano le rilegature, ne scansionavano le pagine e scartavano ciò che restava.
I documenti giudiziari avevano precedentemente mostrato che Anthropic aveva acquistato e scansionato in modo distruttivo milioni di libri durante la creazione di una biblioteca di ricerca interna. Anthropic ha dichiarato che i suoi programmi di acquisizione non prendevano di mira libri rari o antiquari.
Resoconti più recenti si sono concentrati su Amazon. Secondo quanto riferito, una spedizione tracciata è arrivata a una struttura Amazon dove i lavoratori tagliavano i dorsi dei libri prima della scansione. Amazon non ha fornito risposte pubbliche sulla scala completa del programma né su come sarebbe stato utilizzato il testo scansionato.
L'indagine sulla scansione industriale ha sollevato preoccupazioni tra i librai perché alcuni titoli acquistati sembravano rari. Le prove non stabiliscono che ogni acquirente all'ingrosso prenda di mira intenzionalmente copie uniche o insostituibili.
Tuttavia, l'incentivo di fondo è chiaro. I grandi sviluppatori di AI vogliono quantità sostanziali di testi umani in formato lungo. Rimuovere la rilegatura di un libro consente alle singole pagine di passare rapidamente attraverso uno scanner automatizzato.
Ibteda perseguiva l'obiettivo opposto. I suoi libri fisici erano oggetti culturali, non contenitori temporanei di testo per l'addestramento. Il progetto doveva preservare impaginazione, manoscritti, artefatti di stampa e altre prove oltre alle parole.
Questa distinzione influenza ogni decisione ingegneristica. La scansione distruttiva privilegia velocità, pagine piatte ed estrazione pulita del testo. L'imaging archivistico deve bilanciare leggibilità e fedeltà materiale.
Ibteda ha inoltre distribuito l'accesso anziché bloccare le scansioni in una pipeline proprietaria di addestramento. Una selezione è visibile tramite Rekhta, mentre materiale correlato è stato conservato attraverso la collezione Internet Archive.
L'accesso aperto non risolve ogni questione relativa a copyright o custodia. La digitalizzazione di materiale fuori catalogo può comportare complesse questioni di diritti, privacy e proprietà. Gli archivi comunitari necessitano comunque di politiche che disciplinino accesso, rimozioni, aspettative dei donatori e documenti sensibili.
Né il flusso di lavoro di Ibteda dimostra che ogni libro fragile possa tollerare in sicurezza una lastra di vetro. I requisiti di conservazione variano in base a rilegatura, stato della carta, inchiostro e valore storico. Alcuni volumi richiedono culle professionali, pressione minore o imaging specializzato.
Anche i risultati di machine learning del sistema restano risultati riferiti dal progetto. Il codice e i pesi erano ancora sottoposti a revisione archivistica quando l'autore ne ha parlato pubblicamente. Team indipendenti non hanno ancora riprodotto l'intera pipeline su scritture e collezioni diverse.
Le metriche di valutazione riflettono i criteri di accettazione di Ibteda. Un altro archivio potrebbe scegliere margini, soglie di errore o definizioni differenti di modifica testuale inaccettabile.
Queste limitazioni non cancellano il contributo. Definiscono ciò che deve accadere prima che altri considerino il flusso di lavoro uno standard di conservazione trasferibile.
L'affermazione più solida è più circoscritta del titolo di Google News. Ibteda ha trovato un modo promettente per recuperare supervisione dalle modifiche storiche e combinare previsioni generali con calibrazione umana per libro.
Cosa dovrebbero osservare ora archivisti e team AI
Il valore del progetto dipende ora dalla riproducibilità, dai test su più collezioni e dalle prove che le sue salvaguardie resistano all'uso ordinario.
Il primo segnale è un rilascio tecnico pubblico. Il team ha descritto ricette di addestramento, soglie per il recupero delle etichette, regole di instradamento e un contratto di riproduzione. La pubblicazione di codice, pesi, campioni di valutazione o di un dataset attentamente regolamentato consentirebbe ad altri di esaminare tali dettagli.
Un rilascio utile deve includere esempi difficili, non solo pagine riuscite. I ricercatori hanno bisogno di ombre nel margine interno, note manoscritte, Nastaliq denso, litografie danneggiate, timbri, bordi e pagine in cui l'automazione è stata respinta.
Una riproduzione indipendente rafforzerebbe il risultato centrale del progetto. Se anche altri team scoprissero che poche correzioni locali superano una scalabilità indiscriminata del modello, il risultato potrebbe influenzare molti sistemi documentali specializzati.
Anche l'impossibilità di riprodurlo sarebbe informativa. Il miglioramento potrebbe dipendere dall'apparato di acquisizione di Ibteda, dalla coerenza degli operatori, dai formati dei libri o da una particolare metrica di accettazione.
Il secondo segnale è il test tra istituzioni e scritture. La conservazione dell'urdu è il caso d'uso centrale del progetto, ma sfide correlate emergono nelle collezioni di manoscritti persiani, arabi, turchi ottomani e dell'Asia meridionale.
Le prove tra collezioni dovrebbero misurare più della sovrapposizione dei ritagli. Dovrebbero esaminare diacritici perduti, marginalia alterati, ordine errato delle pagine, rimozione accidentale del testo, tempo degli operatori, tassi di rifiuto e costo della revisione dei fallimenti.
Il benchmark più prezioso separerebbe la geometria visibile dalla preferenza editoriale. Tale progettazione potrebbe verificare se la calibrazione funziona perché cattura un vero schema a livello di volume, anziché compensare le peculiarità di un dataset.
Il terzo segnale è l'adozione operativa. Un modello promettente non elimina automaticamente un arretrato. Gli archivi hanno bisogno di interfacce per inserire correzioni, rivedere pagine incerte, tracciare le trasformazioni e ripristinare gli originali.
Gli operatori dovrebbero poter vedere esattamente cosa ha modificato il modello. Hanno inoltre bisogno di immagini sorgente immutabili e parametri registrati per ogni pagina derivata.
La separazione di Ibteda tra rilevamento neurale e ricostruzione vincolata offre un utile punto di partenza. Limita i punti in cui possono avvenire modifiche e crea un confine di audit più chiaro rispetto alla generazione di immagini senza restrizioni.
Esperimenti futuri potrebbero testare il restauro basato sulla diffusione, in cui un modello generativo riempie le regioni danneggiate. Questo approccio potrebbe produrre carta visivamente convincente, ma i team archivistici avrebbero bisogno di garanzie contro modifiche al di fuori di una maschera approvata.
Uno standard realistico dovrebbe pertanto premiare l'astensione. I sistemi devono poter affermare che una pagina è ambigua e richiede una persona. Alti tassi di automazione hanno meno valore quando nascondono errori testuali irreversibili.
Il progetto offre anche una lezione più ampia per i team di prodotto AI. L'esperienza di dominio emerge spesso come correzioni, eccezioni e preferenze accumulate durante il lavoro reale. Trattare queste tracce come feedback strutturato può essere più efficace che ingrandire continuamente un modello.
Per gli archivisti, il passo successivo non è sostituire il giudizio. È identificare dove dieci decisioni attente possano guidare in sicurezza le successive mille pagine.
Per i lettori che hanno scoperto Ibteda tramite Google News, il numero di fotocamere è un punto di ingresso impressionante. La questione duratura è se le istituzioni testeranno, finanzieranno e riprodurranno il flusso di lavoro prima che collezioni simili scompaiano in scaffali inaccessibili o dataset privati di addestramento.
Cercate la collezione Ibteda disponibile, confrontate una pagina elaborata con la sua complessità materiale e tenete d'occhio un rilascio tecnico pubblico. Se un altro archivio riuscirà a riprodurre il miglioramento della calibrazione da 0,71 a 0,83 proteggendo ogni segno significativo, questo piccolo progetto avrà offerto qualcosa che i sistemi AI più grandi spesso non colgono: un'automazione che si adatta al giudizio umano senza cancellare le prove che quel giudizio era destinato a preservare.



