top of page

L'acquisto di libri giapponesi per l'AI fa crescere di 5 volte le vendite dell'usato, ma i libri potrebbero non tornare

2 ore fa
Tempo di lettura: 13 min

Secondo quanto riportato, l'acquisto di libri giapponesi per l'AI ha portato alcune librerie dell'usato a registrare vendite giornaliere cinque volte superiori al normale. Questo inatteso boom porta con sé una possibilità inquietante: molti dei libri acquistati potrebbero essere scansionati, smembrati e rimossi definitivamente dalla circolazione.

Secondo fonti giornalistiche giapponesi citate da Tom’s Hardware, i negozi hanno ricevuto ordini di centinaia di libri in un'unica soluzione. Diversi acquirenti apparentemente separati indirizzerebbero gli ordini verso lo stesso centro logistico nella prefettura di Okayama. Una spedizione documentata riguardava 50 tonnellate di libri giapponesi inviate negli Stati Uniti.

Gli acquirenti non sono stati identificati pubblicamente e l'operatore logistico ha rifiutato di rispondere alle domande. Nessuna prova disponibile dimostra che ogni ordine sia collegato a un'azienda di AI. Tuttavia, lo schema di acquisto ricorda un processo documentato utilizzato da Anthropic negli Stati Uniti.

Quel processo prevedeva l'acquisto di libri fisici, la rimozione delle rilegature, la scansione di ogni pagina e la conservazione di copie digitali ricercabili. Le pagine stampate venivano poi distrutte. Un giudice federale ha successivamente trattato questa modalità di scansione fisica in modo diverso dall'acquisizione, da parte di Anthropic, di milioni di libri digitali piratati.

Il conflitto centrale è quindi più ampio di un insolito picco di vendite. Le librerie giapponesi ricevono oggi entrate benvenute, mentre ricercatori e lettori potrebbero trovarsi di fronte a una carenza domani. La transazione preserva le informazioni all'interno di un database privato, ma potrebbe distruggere la copia pubblica che le ha fornite.

Il boom dei libri usati in Giappone ha un acquirente non identificato

L'aumento delle vendite riportato è reale a livello dei negozi, ma lo scopo e l'identità degli acquirenti all'ingrosso restano da confermare.

Il Giappone dispone di un mercato dei libri di seconda mano profondo e variegato. Comprende catene nazionali, rivenditori specializzati, negozi di quartiere e venditori online con inventari distribuiti tra diversi magazzini. Questa distribuzione rende il mercato utile per assemblare rapidamente un corpus ampio.

Un corpus è una grande raccolta di testi utilizzata per la ricerca, l'analisi o l'addestramento dell'AI. I libri stampati offrono materiale curato e scritto da esseri umani, spesso non disponibile tramite il normale crawling del web. I libri più vecchi precedono inoltre la diffusione online di testi generati dalle macchine.

La più recente attività di acquisto sembra concentrarsi proprio su questo tipo di materiale. Secondo il resoconto iniziale sugli ordini all'ingrosso, i negozi hanno segnalato giornate in cui le vendite online sono cresciute di cinque volte. Alcuni hanno ricevuto ordini di centinaia di libri, anziché i normali carrelli dalle dimensioni tipiche dei consumatori.

Anche la varietà dei temi solleva interrogativi. Romanzi e fumetti guidano tradizionalmente molti ordini dei consumatori, ma gli acquisti riportati spaziavano tra filosofia, storia politica, medicina, diritto e storia sociale. Un esempio riguardava libri sulla vita e la cultura durante il periodo Edo.

Questa ampiezza somiglia più alla costruzione di un dataset che al collezionismo personale. Un lettore segue normalmente autori, generi, periodi o specifiche domande di ricerca. Un acquirente di dati trae vantaggio dalla diversità, da metadati puliti e da volumi sufficienti a migliorare la copertura statistica.

Secondo quanto riportato, gli ordini provenivano da più account. Eppure molti di quegli account richiedevano la consegna a un unico centro logistico nella prefettura di Okayama. Questa destinazione comune è un indizio importante, anche se non identifica il cliente finale.

Un centro logistico potrebbe consolidare libri per l'esportazione, la rivendita, lo stoccaggio, l'elaborazione da parte di biblioteche o la digitalizzazione. Secondo quanto riferito, l'operatore ha rifiutato di spiegare il proprio ruolo. Senza fatture, contratti o clienti nominati, attribuire gli ordini a uno specifico sviluppatore di AI sarebbe speculazione.

La spedizione da 50 tonnellate offre un contesto storico più solido. I media giapponesi hanno descritto registrazioni di quel volume inviato negli Stati Uniti per scansioni associate ad Anthropic. Ciò non dimostra che Anthropic abbia effettuato gli attuali ordini di Okayama.

Analogamente, una società straniera non identificata avrebbe contattato un negozio del Giappone occidentale per acquisire decine di migliaia di libri. Tale richiesta mostra una domanda estera su scala industriale. Lascia comunque irrisolti lo scopo e l'identità dell'acquirente.

Questa distinzione è importante. Le prove consentono di riferire che sono in corso sospetti acquisti all'ingrosso. Consentono anche di esprimere preoccupazione che alcuni libri vengano raccolti per una scansione distruttiva. Non consentono di descrivere ogni vendita come un acquisto confermato da parte di Anthropic.

La conclusione più accurata è più circoscritta. L'acquisto di libri giapponesi per l'AI sembra aver raggiunto una scala che il normale comportamento al dettaglio non riesce a spiegare facilmente. L'instradamento e la selezione dei soggetti meritano attenzione prima che i libri scompaiano in una catena di fornitura opaca.

Perché le aziende di AI vogliono ancora libri fisici

I libri fisici risolvono un problema di qualità dei dati che gli sviluppatori di AI su scala web hanno contribuito a creare, offrendo al tempo stesso agli acquirenti una filiera di acquisizione più chiara delle biblioteche pirata.

I grandi modelli linguistici apprendono schemi statistici da enormi raccolte di testi. La qualità di tali testi influenza quanto bene un modello gestisce ragionamento, stile, vocabolario specialistico e relazioni fattuali. I libri offrono argomentazioni lunghe e strutturate che le brevi pagine web raramente eguagliano.

I libri coprono anche conoscenze che non sono mai diventate liberamente accessibili online. Storie locali, manuali specialistici, opere accademiche, traduzioni più vecchie e titoli fuori catalogo possono esistere solo su carta. Le raccolte in lingua giapponese sono particolarmente preziose per migliorare i modelli oltre l'inglese.

La tempistica riflette anche la crescente preoccupazione per la contaminazione da dati sintetici. Da quando l'AI generativa è diventata ampiamente disponibile, le pagine scritte dalle macchine si sono moltiplicate sul web. I crawler possono ora acquisire testi prodotti da modelli precedenti, inclusi errori e schemi stilistici ripetitivi.

I libri scritti da esseri umani offrono un'alternativa più pulita. È improbabile che opere pubblicate prima del boom dell'AI generativa contengano output di moderni chatbot. Il loro processo di pubblicazione spesso includeva editing, verifica dei fatti e un'organizzazione coerente.

Ciò non significa che ogni libro stampato sia accurato o utile. Significa che i libri offrono una fonte relativamente densa di linguaggio umano intenzionale. Per gli sviluppatori di AI in competizione sulle prestazioni multilingue, tale materiale può essere difficile da sostituire.

Gli atti giudiziari mostrano quanto Anthropic attribuisse valore ai libri. Nella sentenza sul fair use del 2025, il giudice William Alsup ha scritto che l'azienda considerava i libri una strada conveniente verso un modello linguistico di primo livello.

Anthropic ha inizialmente ottenuto copie digitali da diverse fonti. Il tribunale ha rilevato che aveva scaricato 196.640 libri da Books3, almeno cinque milioni da Library Genesis e almeno due milioni da PiLiMi.

Secondo la sentenza, queste raccolte contenevano copie non autorizzate. Anthropic ha mantenuto una biblioteca centrale permanente anche quando determinati libri non venivano selezionati per una miscela di addestramento. Questa decisione ha creato un'esposizione legale distinta dall'addestramento dei modelli stesso.

L'azienda ha poi seguito una strada di acquisizione fisica. Nel 2024 ha assunto Tom Turvey, che in precedenza aveva guidato le partnership per il progetto di scansione dei libri di Google. Il suo incarico comprendeva l'ottenimento di una raccolta di libri estremamente ampia senza ripetere i precedenti problemi legali.

Anthropic ha acquistato milioni di libri fisici, molti dei quali usati. Appaltatori hanno rimosso le rilegature, separato le pagine, scansionato i volumi e convertito le immagini in testo leggibile dalle macchine. L'azienda ha conservato i file digitali risultanti.

Questo flusso di lavoro spiega perché i mercati dell'usato siano attraenti. Le copie usate possono essere reperite da molti venditori e il loro acquisto crea una registrazione convenzionale della transazione. Gli acquirenti possono inoltre selezionare le edizioni usando gli International Standard Book Number, o ISBN.

Un ISBN identifica una particolare edizione e formato di un libro. Aiuta gli acquirenti a evitare acquisti duplicati, collegare le scansioni ai metadati e monitorare dettagli di lingua o pubblicazione. Queste capacità contano quando l'ordine comprende migliaia di titoli non correlati.

La scansione distruttiva è più rapida rispetto alla fotografia individuale di pagine rilegate. Una volta rimossa la costa, i fogli sciolti possono passare attraverso scanner ad alta velocità. Il riconoscimento ottico dei caratteri converte poi le immagini delle pagine in testo ricercabile.

Il processo scambia la conservazione con la produttività. Un volume raro e un comune tascabile possono entrare nello stesso flusso meccanico, a meno che qualcuno non li separi prima. Il dataset finale sopravvive, ma l'oggetto acquistato no.

Questo meccanismo rende plausibile che gli ordini giapponesi siano acquisizioni legate all'AI. Non dimostra il collegamento. Tuttavia, la domanda di testo giapponese pulito, unita a un flusso di lavoro industriale documentato, offre ai proprietari delle librerie ragionevoli motivi di preoccupazione.

L'acquisto di libri giapponesi per l'AI trasforma le entrate in un rischio per la conservazione

L'inversione fondamentale è semplice: un acquisto che aiuta una libreria può comunque indebolire il mercato librario che ha reso possibile quella vendita.

Per un venditore, una giornata con vendite quintuplicate è normalmente una buona notizia. Le librerie dell'usato operano con spazi limitati, domanda irregolare e inventari che possono restare invenduti per anni. Gli ordini all'ingrosso liberano capacità di stoccaggio e trasformano scorte lente in entrate.

Molti libri acquisiti potrebbero anche essere comuni copie in eccesso. Distruggere un comune tascabile non cancella il suo contenuto dal mondo. I negozi eliminano regolarmente inventario danneggiato o indesiderato quando i costi di conservazione superano la domanda probabile.

La preoccupazione cresce quando gli acquirenti comprano in base ai metadati anziché alla rarità. Un ampio sistema di acquisizione può trattare uno studio locale fuori catalogo come qualsiasi altro ISBN. Potrebbe non riconoscere che la copia elencata è una delle pochissime ancora disponibili.

Una volta scansionato, il libro fisico potrebbe essere ridotto in pasta di carta. Il suo testo potrebbe rimanere accessibile soltanto all'interno di un archivio aziendale privato. Biblioteche, ricercatori, collezionisti e futuri lettori non otterrebbero automaticamente accesso a quella versione digitale.

Questo risultato differisce da un progetto di conservazione. Le biblioteche digitalizzano materiali fragili per estenderne l'accesso, conservando gli originali quando possibile. Un corpus privato per l'AI è progettato principalmente per migliorare modelli commerciali, non per fungere da archivio pubblico.

La distinzione incide anche sulla verifica. I ricercatori hanno bisogno di edizioni stabili, immagini delle pagine, note, illustrazioni e contesto fisico. Il semplice testo estratto può omettere annotazioni a margine, impaginazione, tipografia, grafici e segni della storia di un'edizione.

L'editoria giapponese rende la questione particolarmente delicata. Molte opere hanno tirature limitate e non ricevono mai edizioni digitali. Storie regionali e testi tecnici più vecchi possono scomparire dal mercato senza attirare l'attenzione nazionale.

Le librerie dell'usato fungono da rete informale di conservazione. I loro scaffali mantengono disponibili collezioni private indesiderate finché un altro lettore non le trova. Rimuovere libri in quantità industriali modifica questa rete, anche quando ogni singolo acquisto è legale.

La pressione è distribuita in modo diseguale. Le grandi catene possono rifornire i titoli popolari da molte filiali. I piccoli venditori specializzati possono custodire inventari distintivi che hanno richiesto decenni per essere assemblati. Un singolo ordine ampio può cambiare permanentemente ciò che quei negozi offrono.

Questo non rende gli acquisti all’ingrosso intrinsecamente impropri. I proprietari hanno il diritto di vendere le proprie scorte, e molti hanno bisogno di quei ricavi. Anche gli acquirenti hanno ragioni legittime per digitalizzare i libri, tra cui accessibilità, ricerca, attività accademica e tecnologia linguistica.

Il problema è l’assenza di una scelta informata. Una libreria può credere di rifornire lettori, biblioteche o collezionisti. Se invece l’acquirente intende smantellare ogni volume, il venditore non può applicare i propri criteri di conservazione.

Alcuni proprietari potrebbero rifiutare ordini di questo tipo per materiali rari. Altri potrebbero applicare prezzi diversi, trattenere una copia o chiedere che i libri rari siano sottoposti a scansione non distruttiva. Non possono prendere queste decisioni quando gli intermediari nascondono l’uso finale.

L’acquisto di libri giapponesi per l’AI crea quindi un fallimento informativo del mercato. I venditori conoscono titoli e quantità, ma potrebbero non conoscere la destinazione o lo scopo. Gli acquirenti conoscono il processo previsto, ma possono distribuire gli ordini tra più account.

Il risultato è un trasferimento di valore a breve termine. Le librerie ricevono denaro, mentre l’acquirente ottiene sia un oggetto fisico sia il controllo esclusivo dei suoi contenuti digitalizzati. Il pubblico può perdere l’accesso senza rendersi conto che si è verificata una perdita.

Ecco perché questa vicenda non riguarda semplicemente aziende di AI che pagano per dati di addestramento. Il pagamento risolve una questione relativa all’acquisizione. Non risolve la conservazione, la trasparenza, le licenze o il valore sociale della continua circolazione.

L’acquisto del libro non risolve la questione del copyright

La proprietà di una copia fisica e il permesso di riprodurne il testo sono diritti distinti, mentre l’addestramento dell’AI resta oggetto di contesa legale tra diverse giurisdizioni.

Un acquirente può di norma rivendere, prestare, modificare o distruggere un libro acquistato legalmente. Il diritto d’autore limita comunque la creazione e l’uso di copie dell’espressione protetta. La scansione per l’AI mette questi due principi in tensione diretta.

Nel caso di Anthropic, il tribunale federale ha separato l’acquisizione dall’addestramento. Il giudice Alsup ha ritenuto trasformativo, alla luce dei fatti sottoposti al suo esame, l’uso da parte dell’azienda di libri ottenuti legalmente per l’addestramento. La sentenza non ha creato un’esenzione universale per ogni sistema di AI.

Il giudice ha inoltre distinto le scansioni fisiche di Anthropic dai download effettuati da biblioteche pirata. L’acquisto di copie cartacee e la loro conversione per uso interno hanno ricevuto un trattamento più favorevole. Conservare milioni di file consapevolmente piratati no.

Questa differenza è uno dei motivi per cui i libri fisici hanno ora un valore strategico. Un acquisto documentato può ridurre una categoria di rischio legale. Non elimina le rivendicazioni relative a riproduzione, danno al mercato, trasparenza dei dati o legislazioni nazionali diverse.

Anthropic ha successivamente accettato di risolvere le rivendicazioni relative alle sue copie piratate. La proposta di accordo riguardava circa 500.000 opere e imponeva la distruzione dei file originali ottenuti dalle biblioteche digitali contestate.

L’accordo sul copyright non ha stabilito che la scansione distruttiva fosse di per sé illegale. Ha evidenziato come i metodi di acquisizione possano essere rilevanti anche quando i tribunali considerano trasformativo l’addestramento dei modelli.

Autori ed editori restano scettici rispetto alle ampie rivendicazioni sull’addestramento. L’Authors Guild ha monitorato circa una dozzina di cause statunitensi sul copyright riguardanti libri e altro materiale protetto. Tra i convenuti figurano Anthropic, OpenAI, Microsoft, Meta, Nvidia, Google, Bloomberg e Databricks.

Queste cause sull’AI ancora pendenti riguardano dataset, modelli, attori e teorie giuridiche differenti. Una sentenza non può essere applicata automaticamente a tutte. Anche gli appelli potrebbero modificare le interpretazioni attuali.

Il Giappone aggiunge un ulteriore sistema giuridico all’analisi. Il diritto d’autore giapponese contiene disposizioni che possono consentire l’analisi delle informazioni in condizioni definite. La loro applicazione dipende dallo scopo, dalla fruizione dell’opera e dal potenziale danno ai titolari dei diritti.

Una spedizione internazionale può coinvolgere più fasi e giurisdizioni. Un libro può essere acquistato in Giappone, consolidato a Okayama, scansionato negli Stati Uniti e utilizzato da un’azienda attiva a livello globale. Ogni passaggio solleva questioni fattuali diverse.

Le attuali notizie non rivelano tali contratti. Non identificano neppure chi selezioni i titoli, chi possieda le scansioni o se gli editori ricevano pagamenti di licenza. Queste lacune impediscono conclusioni definitive sulla legalità.

La stessa cautela si applica alla distruzione. Le notizie sul precedente flusso di lavoro di Anthropic mostrano che la scansione distruttiva su larga scala esiste. Non dimostrano che tutti i libri instradati attraverso il centro di Okayama saranno ridotti in pasta di carta.

Alcuni potrebbero essere rivenduti dopo un’acquisizione di immagini non distruttiva. Altri potrebbero essere conservati o trattati per la normale esportazione. Finché un acquirente, un fornitore logistico, uno scanner o un documento di spedizione non fornirà maggiori dettagli, la destinazione finale rimane un’affermazione.

Questa incertezza non dovrebbe interrompere l’indagine. La definisce. L’articolo più solido non è quello che indica un colpevole non comprovato, ma quello che identifica i documenti necessari per verificare l’affermazione.

Le librerie possono conservare informazioni sugli account, liste degli ordini, etichette di spedizione e corrispondenza insolita. I documenti di esportazione possono stabilire destinazioni e pesi. I fornitori di servizi di scansione possono divulgare le politiche di conservazione senza rivelare dati protetti dei clienti.

Anche editori e autori possono chiedere se i dataset in lingua giapponese acquisiti di recente siano concessi in licenza. Gli sviluppatori di modelli descrivono sempre più i metodi di sicurezza e le risorse di calcolo. L’acquisizione dei dati di addestramento resta molto meno trasparente.

La battaglia legale continuerà, ma la trasparenza può migliorare prima che i tribunali forniscano risposte definitive. Gli acquirenti possono dichiarare il proprio scopo, proteggere le copie rare e offrire ai titolari dei diritti informazioni significative. Nessuno di questi passaggi richiede di esporre l’architettura del modello.

Le prossime prove devono arrivare dalla catena di approvvigionamento

Tre segnali determineranno se si tratta di una temporanea anomalia del commercio al dettaglio o di un trasferimento industriale dell’editoria giapponese in archivi privati di AI.

Il primo segnale è l’identificazione dell’acquirente finale. Più account di acquisto non dimostrano l’esistenza di più clienti quando tutte le spedizioni convergono in un’unica struttura. Contratti o documentazione di esportazione potrebbero collegare quella struttura a un’azienda di scansione o a uno sviluppatore di AI.

Un cliente confermato rafforzerebbe la teoria dell’acquisizione per l’AI. Prove di normale esportazione, rivendita a biblioteche o archiviazione commerciale la indebolirebbero. Entrambi gli esiti sostituirebbero il sospetto con una catena di custodia verificabile.

Il secondo segnale è il trattamento dei libri rari. I venditori dovrebbero monitorare se gli acquirenti selezionano duplicati comuni o rastrellano ogni ISBN corrispondente. Gli ordini contenenti opere accademiche fuori catalogo e storia regionale meritano particolare attenzione.

Un acquirente che escluda le copie rare ridurrebbe la preoccupazione per la conservazione. La scansione non distruttiva la ridurrebbe ulteriormente. Un processo che distrugga libri senza vagliare la rarità sosterrebbe i timori di una perdita culturale permanente.

Il terzo segnale è la divulgazione da parte degli sviluppatori di AI. Le aziende possono dichiarare se stanno acquistando collezioni cartacee giapponesi, se i fornitori distruggono gli originali e come gestiscono il copyright. Il silenzio lascerà agli intermediari e alle librerie l’onere reputazionale.

Gli sviluppatori potrebbero anche spiegare se le scansioni rimangono private o se sostengono una copia pubblica di conservazione. Un corpus privato offre valore commerciale a un’unica azienda. Un archivio accessibile può preservare almeno parte del beneficio per lettori e ricercatori.

Questi segnali contano oltre il Giappone. Anche librai europei e americani hanno segnalato insoliti ordini all’ingrosso associati alla domanda di dati per l’addestramento dell’AI. Un modello internazionale ripetibile suggerirebbe un settore coordinato di approvvigionamento dei dati, anziché un collezionismo isolato.

Cambierebbe anche il quadro competitivo. Gli sviluppatori di modelli un tempo competevano soprattutto per capacità di calcolo, talento ingegneristico e dataset su scala internet. Ora competono per conoscenze umane curate che non sono già circolate liberamente online.

Questa competizione colloca i librai in una posizione insolita. Non sono più soltanto rivenditori al servizio dei lettori. I loro cataloghi possono diventare infrastrutture di dati a monte per aziende con budget molto maggiori e scarsa visibilità pubblica.

I proprietari non devono rifiutare ogni vendita all’ingrosso. Possono introdurre garanzie senza rinunciare a nuove entrate. Tali garanzie potrebbero includere revisioni delle quantità, controlli sulla rarità, dichiarazioni degli acquirenti e approvazioni separate per l’uso distruttivo.

Anche i marketplace possono segnalare account coordinati che condividono le stesse destinazioni. Un ordine di grandi volumi che copra materie accademiche non correlate non è necessariamente abusivo. Rimane comunque un’informazione utile per i venditori che decidono se liberare inventario raro.

Biblioteche, editori e università dovrebbero monitorare gli stessi schemi. L’improvvisa scomparsa di titoli specializzati può influire sulla ricerca molto prima che le statistiche ufficiali di circolazione rivelino una carenza. Liste di controllo condivise potrebbero identificare prima le opere vulnerabili.

Anche i lettori hanno un ruolo. Chiunque venda una collezione ereditata dovrebbe chiedersi se il materiale unico appartenga a una biblioteca o a un archivio prima di scegliere l’acquirente all’ingrosso più rapido. Una volta che una copia rara entra in un processo distruttivo, la decisione non può essere annullata.

L’immediato aumento delle vendite giapponesi potrebbe attenuarsi quando l’attuale obiettivo di acquisizione sarà completato. In tal caso, i negozi potrebbero sperimentare il rovesciamento temuto dai proprietari. I ricavi aumentano durante la raccolta, poi diminuiscono perché l’inventario desiderabile è più difficile da sostituire.

La questione più duratura riguarda chi controlla la conoscenza risultante. Un libro scansionato può migliorare strumenti linguistici, sistemi di ricerca e accesso per le persone con disabilità. Questi benefici non richiedono segretezza né distruzione non necessaria.

L’acquisto di libri giapponesi per l’AI dovrebbe quindi essere giudicato da ciò che accade dopo l’acquisto. Le opere rare sono protette? I creatori sono informati? I ricercatori possono accedere alle copie conservate? L’acquirente accetta una responsabilità pubblica?

Finché non emergeranno queste risposte, la conclusione responsabile resta prudente. Gli ordini all’ingrosso sono documentati attraverso i resoconti delle librerie, mentre il collegamento con l’AI è fortemente suggerito ma verificato in modo incompleto. Il rischio diventa irreversibile solo quando i libri entrano nello scanner.

Osservate la catena di approvvigionamento di Okayama, il destino dei titoli fuori catalogo e le comunicazioni dei principali sviluppatori di modelli. Questi tre segnali mostreranno se un boom del commercio al dettaglio si è trasformato in un trasferimento nascosto della memoria culturale.

 
 

Inizia gratis

Un assistente IA local-first con gestione della conoscenza personale

Per una migliore esperienza con l’IA,

al momento remio supporta solo Windows 10+ (x64) e M-Chip Macs.

Il tuo partner AI al lavoro
Fai di più con remio

Pianifica. Crea. Consegna.
Tutto in un unico posto.

bottom of page