top of page

La compra japonesa de libros para IA multiplica por cinco las ventas de tiendas de segunda mano, pero los libros podrían no volver

hace 59 minutos
14 min de lectura

Según informes, la compra de libros japoneses para IA ha llevado a algunas librerías de segunda mano a quintuplicar sus ventas diarias habituales. El inesperado auge conlleva una inquietante posibilidad. Muchos de los libros adquiridos podrían ser escaneados, desarmados y retirados de la circulación para siempre.

Las tiendas han recibido pedidos de cientos de libros de una sola vez, según informes japoneses citados por Tom’s Hardware. Varios compradores aparentemente distintos habrían dirigido sus pedidos al mismo centro logístico de la prefectura de Okayama. Un envío documentado consistió en 50 toneladas de libros japoneses enviadas a Estados Unidos.

Los compradores no han sido identificados públicamente, y el operador logístico declinó responder preguntas. Ninguna prueba disponible demuestra que todos los pedidos estén vinculados a una empresa de IA. Sin embargo, el patrón de compra se parece a un proceso documentado que Anthropic utilizó en Estados Unidos.

Ese proceso compraba libros físicos, retiraba sus encuadernaciones, escaneaba cada página y conservaba copias digitales consultables. Las páginas impresas eran luego destruidas. Posteriormente, un juez federal trató esa vía de escaneo físico de manera distinta a la adquisición por parte de Anthropic de millones de libros digitales pirateados.

Por tanto, el conflicto central es mayor que un inusual repunte de ventas. Las librerías japonesas reciben hoy ingresos bienvenidos, mientras investigadores y lectores afrontan una posible escasez mañana. La transacción preserva información dentro de una base de datos privada, pero puede destruir el ejemplar público que la proporcionó.

El auge de los libros de segunda mano en Japón tiene un comprador no identificado

El aumento de ventas reportado es real a nivel de tienda, pero el propósito y la identidad de los compradores al por mayor siguen sin confirmarse.

Japón cuenta con un mercado de libros de segunda mano profundo y variado. Incluye cadenas nacionales, distribuidores especializados, tiendas de barrio y vendedores en línea con inventarios repartidos entre almacenes. Esa distribución hace que el mercado sea útil para reunir rápidamente un corpus amplio.

Un corpus es una gran colección de textos utilizada para búsqueda, análisis o entrenamiento de IA. Los libros impresos ofrecen material editado y escrito por humanos que a menudo no está disponible mediante el rastreo web convencional. Los libros más antiguos también son anteriores a la expansión del texto generado por máquinas en internet.

La actividad de compra más reciente parece centrarse precisamente en ese tipo de material. Según el relato inicial sobre pedidos masivos, las tiendas informaron de días en los que las ventas en línea se quintuplicaron. Algunas recibieron pedidos de cientos de libros, en lugar de cestas habituales del tamaño de un consumidor.

La mezcla de temas también plantea interrogantes. Las novelas y los cómics suelen encabezar muchos pedidos de consumidores, pero las compras reportadas abarcaron filosofía, historia política, medicina, derecho e historia social. Un ejemplo incluía libros sobre la vida y la cultura durante el período Edo.

Esa amplitud se parece menos al coleccionismo personal y más a la construcción de conjuntos de datos. Un lector suele seguir autores, géneros, períodos o preguntas de investigación concretas. Un comprador de datos se beneficia de la diversidad, los metadatos limpios y un volumen suficiente para mejorar la cobertura estadística.

Los pedidos habrían llegado a través de múltiples cuentas. Sin embargo, muchas de esas cuentas solicitaron la entrega a un único centro logístico en la prefectura de Okayama. Ese destino común es una pista importante, aunque no identifica al cliente final.

Un centro logístico podría consolidar libros para exportación, reventa, almacenamiento, procesamiento bibliotecario o digitalización. Según los informes, el operador declinó explicar su función. Sin facturas, contratos o clientes identificados, atribuir los pedidos a un desarrollador concreto de IA sería especulativo.

El envío de 50 toneladas ofrece un contexto histórico más sólido. Informes japoneses describieron registros de ese volumen enviado a Estados Unidos para escaneo vinculado con Anthropic. Esto no establece que Anthropic realizara los pedidos actuales de Okayama.

Del mismo modo, una empresa extranjera no identificada habría contactado a una tienda del oeste de Japón para adquirir decenas de miles de libros. Esa consulta demuestra una demanda internacional a escala industrial. Aun así, deja sin resolver el propósito y la identidad del comprador.

Esta distinción importa. La evidencia respalda informar de que se están produciendo compras masivas sospechosas. También respalda la preocupación de que algunos libros estén siendo reunidos para un escaneo destructivo. No respalda describir cada venta como una compra confirmada de Anthropic.

La conclusión más precisa es más limitada. La compra japonesa de libros para IA parece haber alcanzado una escala que el comportamiento minorista ordinario difícilmente puede explicar. La ruta de envío y la selección temática justifican un escrutinio antes de que los libros desaparezcan en una cadena de suministro opaca.

Por qué las empresas de IA siguen queriendo libros físicos

Los libros físicos resuelven un problema de calidad de datos que los desarrolladores de IA a escala web ayudaron a crear, al tiempo que ofrecen a los compradores una vía de adquisición más clara que las bibliotecas piratas.

Los modelos de lenguaje de gran tamaño aprenden patrones estadísticos a partir de enormes colecciones de texto. La calidad de ese texto afecta a la capacidad de un modelo para manejar razonamiento, estilo, vocabulario especializado y relaciones factuales. Los libros ofrecen argumentos largos y estructurados que las páginas web breves rara vez igualan.

Los libros también cubren conocimientos que nunca estuvieron libremente accesibles en internet. Historias locales, manuales especializados, obras académicas, traducciones antiguas y títulos descatalogados pueden existir solo en papel. Las colecciones en japonés son especialmente valiosas para mejorar los modelos más allá del inglés.

El momento también refleja una creciente preocupación por la contaminación de datos sintéticos. Desde que la IA generativa se volvió ampliamente disponible, las páginas escritas por máquinas se han multiplicado en la web. Los rastreadores ahora pueden ingerir texto producido por modelos anteriores, incluidos errores y patrones estilísticos repetitivos.

Los libros escritos por humanos ofrecen una alternativa más limpia. Es poco probable que las obras publicadas antes del auge de la IA generativa contengan resultados de chatbots modernos. Su proceso de publicación a menudo incluyó edición, verificación de datos y una organización coherente.

Eso no significa que todos los libros impresos sean precisos o útiles. Significa que los libros ofrecen una fuente relativamente densa de lenguaje humano deliberado. Para los desarrolladores de IA que compiten en rendimiento multilingüe, ese material puede ser difícil de reemplazar.

Los registros judiciales muestran cuánto valoraba Anthropic los libros. En el fallo de uso legítimo de 2025, el juez William Alsup escribió que la empresa veía los libros como una vía rentable hacia un modelo de lenguaje de primer nivel.

Anthropic obtuvo inicialmente copias digitales de varias fuentes. El tribunal determinó que descargó 196.640 libros de Books3, al menos cinco millones de Library Genesis y al menos dos millones de PiLiMi.

Según el fallo, esas colecciones contenían copias no autorizadas. Anthropic mantuvo una biblioteca central permanente incluso cuando determinados libros no eran seleccionados para una mezcla de entrenamiento. Esa decisión creó exposición legal separada del entrenamiento del modelo en sí.

Posteriormente, la empresa recurrió a una vía de adquisición física. En 2024, contrató a Tom Turvey, quien anteriormente dirigió las asociaciones del proyecto de escaneo de libros de Google. Su tarea consistía en obtener una colección de libros extremadamente amplia sin repetir los problemas legales anteriores.

Anthropic compró millones de libros físicos, muchos de ellos usados. Los contratistas retiraron las encuadernaciones, separaron las páginas, las escanearon y convirtieron las imágenes en texto legible por máquinas. La empresa conservó los archivos digitales resultantes.

Este flujo de trabajo explica por qué los mercados de segunda mano son atractivos. Las copias usadas pueden obtenerse de muchos vendedores, y comprarlas crea un registro convencional de transacción. Los compradores también pueden dirigirse a ediciones concretas mediante los International Standard Book Numbers, o ISBN.

Un ISBN identifica una edición y formato específicos de un libro. Ayuda a los compradores a evitar compras duplicadas, vincular escaneos con metadatos y rastrear detalles de idioma o publicación. Esas capacidades importan cuando el pedido contiene miles de títulos no relacionados.

El escaneo destructivo es más rápido que fotografiar individualmente páginas encuadernadas. Una vez retirado el lomo, las hojas sueltas pueden pasar por escáneres de alta velocidad. El reconocimiento óptico de caracteres convierte después las imágenes de las páginas en texto consultable.

El proceso intercambia preservación por rendimiento. Un volumen raro y un libro de bolsillo común pueden entrar en el mismo flujo mecánico salvo que alguien los separe antes. El conjunto de datos final sobrevive, pero el objeto adquirido no.

Este mecanismo hace plausibles los pedidos japoneses como adquisiciones relacionadas con IA. No demuestra la conexión. Aun así, la demanda de texto japonés limpio, combinada con un flujo de trabajo industrial documentado, da a los propietarios de librerías motivos razonables de preocupación.

La compra japonesa de libros para IA convierte los ingresos en un riesgo para la preservación

La inversión central es sencilla: una compra que ayuda a una librería aún puede debilitar el mercado del libro que hizo posible la venta.

Para un vendedor, un día con ventas quintuplicadas suele ser una buena noticia. Las librerías de segunda mano operan con espacio limitado, una demanda desigual y un inventario que puede permanecer sin vender durante años. Los pedidos masivos liberan capacidad de almacenamiento y convierten existencias de lenta rotación en ingresos.

Muchos de los libros adquiridos también pueden ser ejemplares excedentes ordinarios. Destruir un libro de bolsillo común no borra su contenido del mundo. Las tiendas descartan rutinariamente inventario dañado o no deseado cuando los costes de preservación superan la demanda probable.

La preocupación aumenta cuando los compradores adquieren por metadatos en lugar de por escasez. Un gran sistema de adquisición puede tratar un estudio local descatalogado como cualquier otro ISBN. Podría no reconocer que el ejemplar listado es uno de los pocos que siguen disponibles.

Una vez escaneado, el libro físico podría convertirse en pulpa. Su texto podría seguir siendo accesible solo dentro de un repositorio corporativo privado. Bibliotecas, investigadores, coleccionistas y futuros lectores no obtendrían automáticamente acceso a esa versión digital.

Ese resultado difiere de un proyecto de preservación. Las bibliotecas digitalizan materiales frágiles para ampliar el acceso y conservar los originales cuando es posible. Un corpus privado de IA está diseñado principalmente para mejorar modelos comerciales, no para servir como archivo público.

La distinción también afecta a la verificación. Los investigadores necesitan ediciones estables, imágenes de páginas, notas, ilustraciones y contexto físico. El texto simple extraído puede omitir anotaciones marginales, diseño, tipografía, gráficos y señales de la historia de una edición.

La publicación japonesa hace que el asunto sea especialmente sensible. Muchas obras tienen tiradas limitadas y nunca reciben ediciones digitales. Las historias regionales y los textos técnicos antiguos pueden desaparecer del mercado sin atraer atención nacional.

Las librerías de segunda mano funcionan como una red informal de preservación. Sus estanterías mantienen disponibles colecciones privadas no deseadas hasta que otro lector las encuentra. Retirar libros en cantidades industriales cambia esa red, incluso cuando cada compra individual es legal.

La presión se distribuye de manera desigual. Las grandes cadenas pueden reponer títulos populares desde muchas sucursales. Los pequeños vendedores especializados pueden conservar inventarios distintivos que tardaron décadas en reunir. Un único pedido amplio puede cambiar permanentemente lo que ofrecen esas tiendas.

Esto no hace que las compras al por mayor sean inherentemente impropias. Los propietarios tienen derecho a vender sus existencias, y muchos necesitan esos ingresos. Los compradores también tienen razones legítimas para digitalizar libros, entre ellas la accesibilidad, la búsqueda, la investigación académica y la tecnología lingüística.

El problema es la ausencia de una decisión informada. Una librería puede creer que está abasteciendo a lectores, bibliotecas o coleccionistas. Si el comprador pretende en cambio desmantelar cada volumen, el vendedor no puede aplicar sus propios criterios de preservación.

Algunos propietarios podrían rechazar esos pedidos cuando se trata de material escaso. Otros podrían cobrar de forma diferente, conservar un ejemplar o exigir que los libros raros se digitalicen sin dañarlos. No pueden tomar esas decisiones cuando los intermediarios ocultan el uso final.

La compra de libros japoneses para IA crea, por tanto, una falla de información en el mercado. Los vendedores conocen los títulos y las cantidades, pero pueden no conocer el destino ni el propósito. Los compradores conocen el proceso previsto, pero pueden distribuir los pedidos entre varias cuentas.

El resultado es una transferencia de valor a corto plazo. Las librerías reciben efectivo, mientras que el comprador obtiene tanto un objeto físico como el control exclusivo sobre su contenido digitalizado. El público puede perder acceso sin darse cuenta de que se ha producido una pérdida.

Por eso esta historia no trata simplemente de empresas de IA que pagan por datos de entrenamiento. El pago resuelve una cuestión sobre la adquisición. No resuelve la preservación, la transparencia, las licencias ni el valor social de mantener los libros en circulación.

Comprar el libro no resuelve la cuestión de los derechos de autor

La propiedad de un ejemplar físico y el permiso para reproducir su texto son derechos distintos, mientras que el entrenamiento de IA sigue siendo objeto de disputa legal en distintas jurisdicciones.

Por lo general, un comprador puede revender, prestar, modificar o destruir un libro adquirido legalmente. La legislación sobre derechos de autor sigue limitando la creación y el uso de copias de la expresión protegida. La digitalización para IA enfrenta directamente estos dos principios.

En el caso de Anthropic, el tribunal federal separó la adquisición del entrenamiento. El juez Alsup consideró transformativo el uso por parte de la empresa de libros obtenidos legalmente para entrenamiento, según los hechos examinados. La resolución no creó una exención universal para todos los sistemas de IA.

El juez también distinguió los escaneos físicos de Anthropic de sus descargas de bibliotecas piratas. La compra de ejemplares impresos y su conversión para uso interno recibió un trato más favorable. Conservar millones de archivos pirateados a sabiendas no lo recibió.

Esa diferencia es una de las razones por las que los libros físicos tienen ahora valor estratégico. Una compra documentada puede reducir una categoría de riesgo legal. No elimina reclamaciones relacionadas con la reproducción, el daño al mercado, la transparencia de los datos o las distintas leyes nacionales.

Anthropic aceptó posteriormente resolver las reclamaciones relacionadas con sus copias pirateadas. El acuerdo propuesto abarcaba unas 500.000 obras estimadas y exigía destruir los archivos originales obtenidos de las bibliotecas digitales impugnadas.

El acuerdo sobre derechos de autor no estableció que la digitalización destructiva fuera en sí misma ilegal. Puso de relieve cómo los métodos de adquisición pueden importar incluso cuando los tribunales consideran transformativo el entrenamiento de modelos.

Los autores y editores siguen siendo escépticos ante las amplias reivindicaciones sobre el entrenamiento. El Authors Guild ha registrado aproximadamente una docena de casos estadounidenses de derechos de autor relacionados con libros y otros materiales protegidos. Entre los demandados figuran Anthropic, OpenAI, Microsoft, Meta, Nvidia, Google, Bloomberg y Databricks.

Esos casos pendientes sobre IA abordan distintos conjuntos de datos, modelos, demandantes y teorías legales. Una sentencia no puede aplicarse automáticamente a todos ellos. Las apelaciones también pueden modificar las interpretaciones actuales.

Japón añade otro sistema legal al análisis. La legislación japonesa sobre derechos de autor contiene disposiciones que pueden permitir el análisis de información en determinadas condiciones. Su aplicación depende del propósito, del disfrute de la obra y del posible perjuicio para los titulares de derechos.

Un envío internacional puede implicar varias etapas y jurisdicciones. Un libro puede comprarse en Japón, consolidarse en Okayama, digitalizarse en Estados Unidos y ser utilizado por una empresa que opera globalmente. Cada paso plantea distintas cuestiones fácticas.

La información disponible actualmente no revela esos contratos. Tampoco identifica quién selecciona los títulos, quién posee los escaneos ni si los editores reciben pagos por licencias. Esas lagunas impiden extraer conclusiones firmes sobre la legalidad.

La misma cautela se aplica a la destrucción. Los informes sobre el flujo de trabajo anterior de Anthropic muestran que existe la digitalización destructiva a gran escala. No demuestran que todos los libros enviados a través del centro de Okayama vayan a ser convertidos en pulpa.

Algunos podrían revenderse tras una digitalización no destructiva. Otros podrían almacenarse o procesarse para una exportación ordinaria. Hasta que un comprador, proveedor logístico, empresa de digitalización o registro de envío aporte más detalles, el destino final seguirá siendo una alegación.

Esa incertidumbre no debería poner fin a la investigación. La define. El artículo más sólido no es el que señala a un culpable sin respaldo, sino el que identifica los registros necesarios para comprobar la afirmación.

Las librerías pueden conservar información de cuentas, listas de pedidos, etiquetas de envío y correspondencia inusual. Los registros de exportación pueden establecer destinos y pesos. Los contratistas de digitalización pueden revelar políticas de preservación sin divulgar datos protegidos de clientes.

Los editores y autores también pueden preguntar si los conjuntos de datos recientemente adquiridos en japonés cuentan con licencia. Los desarrolladores de modelos describen cada vez más sus métodos de seguridad y recursos computacionales. La adquisición de datos de entrenamiento sigue siendo mucho menos transparente.

La batalla legal continuará, pero la transparencia puede mejorar antes de que los tribunales emitan respuestas definitivas. Los compradores pueden revelar su propósito, proteger los ejemplares escasos y ofrecer a los titulares de derechos información significativa. Ninguna de esas medidas requiere revelar la arquitectura del modelo.

Las próximas pruebas deben proceder de la cadena de suministro

Tres señales determinarán si se trata de una anomalía temporal del comercio minorista o de una transferencia industrial de la edición japonesa a archivos privados de IA.

La primera señal es la identificación del comprador final. Varias cuentas de compra no demuestran que haya varios clientes cuando todos los envíos convergen en una única instalación. Los contratos o la documentación de exportación podrían vincular esa instalación con una empresa de digitalización o un desarrollador de IA.

Un cliente confirmado reforzaría la teoría de adquisición para IA. Las pruebas de exportación ordinaria, reventa a bibliotecas o archivado comercial la debilitarían. Cualquiera de los dos resultados sustituiría la sospecha por una cadena de custodia responsable.

La segunda señal es el tratamiento de los libros escasos. Los vendedores deberían seguir si los compradores seleccionan duplicados comunes o acaparan todos los ISBN coincidentes. Los pedidos que incluyan investigaciones agotadas e historia regional merecen especial atención.

Un comprador que excluya los ejemplares escasos reduciría la preocupación por la preservación. La digitalización no destructiva la reduciría aún más. Un proceso que destruye libros sin evaluar su rareza respaldaría los temores de una pérdida cultural permanente.

La tercera señal es la divulgación por parte de los desarrolladores de IA. Las empresas pueden declarar si están comprando colecciones impresas japonesas, si los contratistas destruyen los originales y cómo gestionan los derechos de autor. El silencio dejará a intermediarios y librerías con la carga reputacional.

Los desarrolladores también podrían explicar si los escaneos permanecen privados o respaldan una copia pública de preservación. Un corpus privado ofrece valor comercial a una empresa. Un archivo accesible puede preservar al menos parte del beneficio para lectores e investigadores.

Estas señales importan más allá de Japón. Libreros europeos y estadounidenses también han informado de pedidos inusuales al por mayor asociados con la demanda de datos para el entrenamiento de IA. Un patrón internacional repetible sugeriría una industria coordinada de obtención de datos, en lugar de un coleccionismo aislado.

También cambiaría el panorama competitivo. Los desarrolladores de modelos competían antes principalmente por capacidad informática, talento de ingeniería y conjuntos de datos a escala de internet. Ahora compiten por conocimiento humano seleccionado que aún no ha circulado libremente en línea.

Esa competencia coloca a los libreros en una posición desconocida. Ya no son solo minoristas que atienden a lectores. Sus catálogos pueden convertirse en infraestructura de datos aguas arriba para empresas con presupuestos mucho mayores y escasa visibilidad pública.

Los propietarios no necesitan rechazar todas las ventas al por mayor. Pueden introducir salvaguardas sin renunciar a nuevos ingresos. Esas salvaguardas podrían incluir revisiones de cantidades, comprobaciones de rareza, declaraciones del comprador y aprobación separada para usos destructivos.

Los mercados también pueden señalar cuentas coordinadas que comparten destinos. Un pedido de gran volumen que abarque materias académicas no relacionadas no es necesariamente abusivo. Aun así, es información útil para los vendedores que deciden si liberar inventario escaso.

Las bibliotecas, editoriales y universidades deberían observar los mismos patrones. La desaparición repentina de títulos especializados puede afectar a la investigación mucho antes de que las estadísticas oficiales de circulación revelen una escasez. Las listas de vigilancia compartidas podrían identificar antes las obras vulnerables.

Los lectores también tienen un papel. Cualquiera que venda una colección heredada debería preguntarse si el material único pertenece a una biblioteca o archivo antes de elegir al comprador masivo más rápido. Una vez que un ejemplar raro entra en procesamiento destructivo, la decisión no puede revertirse.

El aumento inmediato de las ventas japonesas puede desvanecerse cuando se complete el objetivo de adquisición actual. De ser así, las tiendas podrían experimentar la reversión que temen los propietarios. Los ingresos aumentan durante la recopilación, pero luego caen porque el inventario deseable es más difícil de reponer.

La cuestión más duradera se refiere a quién controla el conocimiento resultante. Un libro digitalizado puede mejorar las herramientas lingüísticas, los sistemas de búsqueda y el acceso para las personas con discapacidad. Esos beneficios no requieren secretismo ni destrucción innecesaria.

Por tanto, la compra de libros japoneses para IA debe juzgarse por lo que ocurre después de la compra. ¿Se protegen las obras escasas? ¿Se informa a los creadores? ¿Pueden los investigadores acceder a ejemplares preservados? ¿Acepta el comprador la rendición de cuentas pública?

Hasta que surjan esas respuestas, la conclusión responsable debe seguir siendo cautelosa. Los pedidos al por mayor están documentados mediante las cuentas de las librerías, mientras que la conexión con la IA está fuertemente sugerida, pero verificada de forma incompleta. El riesgo se vuelve irreversible solo cuando los libros entran en el escáner.

Observe la cadena de suministro de Okayama, el destino de los títulos agotados y las divulgaciones de los principales desarrolladores de modelos. Esas tres señales mostrarán si un auge minorista se convirtió en una transferencia oculta de memoria cultural.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page