top of page

Compra Japonesa de Livros para IA Impulsiona Sebos em 5x, mas os Livros Podem Não Voltar

há 58 minutos
13 min de leitura

A compra japonesa de livros para IA teria elevado as vendas diárias de alguns sebos a cinco vezes o nível normal. O surpreendente boom traz uma possibilidade incômoda. Muitos dos livros adquiridos podem ser digitalizados, desmontados e retirados de circulação para sempre.

As lojas receberam pedidos de centenas de livros de uma só vez, segundo reportagem japonesa citada pela Tom’s Hardware. Vários compradores aparentemente distintos teriam direcionado seus pedidos ao mesmo centro logístico na província de Okayama. Uma remessa documentada envolveu 50 toneladas de livros japoneses enviadas aos Estados Unidos.

Os compradores não foram identificados publicamente, e a operadora logística recusou-se a responder perguntas. Nenhuma evidência disponível prova que todos os pedidos estejam ligados a uma empresa de IA. Ainda assim, o padrão de compra se assemelha a um processo documentado que a Anthropic utilizou nos Estados Unidos.

Esse processo comprava livros físicos, removia suas encadernações, digitalizava todas as páginas e mantinha cópias digitais pesquisáveis. As páginas impressas eram então destruídas. Posteriormente, um juiz federal tratou essa rota de digitalização física de forma diferente da aquisição, pela Anthropic, de milhões de livros digitais pirateados.

O conflito central, portanto, é maior do que um pico incomum de vendas. As livrarias japonesas recebem uma receita bem-vinda hoje, enquanto pesquisadores e leitores podem enfrentar escassez amanhã. A transação preserva informações dentro de um banco de dados privado, mas pode destruir o exemplar público que as forneceu.

O Boom dos Sebos Japoneses Tem um Comprador Não Identificado

O aumento relatado nas vendas é real no nível das lojas, mas a finalidade e a identidade dos compradores em massa continuam sem confirmação.

O Japão tem um mercado de livros usados profundo e diversificado. Ele inclui redes nacionais, vendedores especializados, lojas de bairro e vendedores online com estoques distribuídos por armazéns. Essa distribuição torna o mercado útil para reunir rapidamente um corpus amplo.

Um corpus é uma grande coleção de textos usada para busca, análise ou treinamento de IA. Livros impressos oferecem material editado e escrito por humanos, muitas vezes indisponível por meio de rastreamento comum da web. Livros mais antigos também antecedem a disseminação de texto gerado por máquinas online.

A atividade de compra mais recente parece estar concentrada exatamente nesse tipo de material. Segundo o relato inicial de pedidos em massa, lojas relataram dias em que as vendas online aumentaram cinco vezes. Algumas receberam pedidos envolvendo centenas de livros, em vez das cestas comuns de consumidores.

A variedade de temas também levanta dúvidas. Romances e quadrinhos tradicionalmente lideram muitos pedidos de consumidores, mas as compras relatadas abrangiam filosofia, história política, medicina, direito e história social. Um exemplo envolvia livros sobre a vida e a cultura durante o período Edo.

Essa amplitude parece menos uma coleção pessoal e mais a construção de um conjunto de dados. Um leitor geralmente segue autores, gêneros, períodos ou questões específicas de pesquisa. Um comprador de dados se beneficia de diversidade, metadados limpos e volume suficiente para melhorar a cobertura estatística.

Os pedidos teriam sido feitos por múltiplas contas. Ainda assim, muitas dessas contas solicitaram entrega em um único centro logístico na província de Okayama. Esse destino comum é uma pista importante, embora não identifique o cliente final.

Um centro logístico pode consolidar livros para exportação, revenda, armazenamento, processamento por bibliotecas ou digitalização. A operadora teria se recusado a explicar seu papel. Sem faturas, contratos ou clientes nomeados, atribuir os pedidos a um desenvolvedor específico de IA seria especulação.

A remessa de 50 toneladas oferece um contexto histórico mais sólido. A reportagem japonesa descreveu registros desse volume sendo enviado aos Estados Unidos para digitalização associada à Anthropic. Isso não estabelece que a Anthropic tenha feito os atuais pedidos de Okayama.

Da mesma forma, uma empresa estrangeira não identificada teria procurado uma loja no oeste do Japão sobre a aquisição de dezenas de milhares de livros. Essa consulta demonstra demanda externa em escala industrial. Ainda assim, deixa sem solução a finalidade e a identidade do comprador.

Essa distinção importa. As evidências sustentam a informação de que compras suspeitas em massa estão ocorrendo. Elas também sustentam a preocupação de que alguns livros estejam sendo reunidos para digitalização destrutiva. Não sustentam descrever cada venda como uma compra confirmada da Anthropic.

A conclusão mais precisa é mais restrita. A compra japonesa de livros para IA parece ter alcançado uma escala que o comportamento comum do varejo não explica facilmente. O direcionamento das remessas e a seleção de temas justificam escrutínio antes que os livros desapareçam em uma cadeia de suprimentos opaca.

Por Que Empresas de IA Ainda Querem Livros Físicos

Livros físicos resolvem um problema de qualidade de dados que desenvolvedores de IA em escala web ajudaram a criar, ao mesmo tempo em que oferecem aos compradores uma trilha de aquisição mais clara do que bibliotecas piratas.

Grandes modelos de linguagem aprendem padrões estatísticos a partir de enormes coleções de texto. A qualidade desse texto afeta o desempenho de um modelo em raciocínio, estilo, vocabulário especializado e relações factuais. Os livros oferecem argumentos longos e estruturados que páginas curtas da web raramente igualam.

Os livros também abrangem conhecimentos que nunca se tornaram livremente acessíveis online. Histórias locais, manuais especializados, obras acadêmicas, traduções antigas e títulos esgotados podem existir apenas em papel. Coleções em língua japonesa são especialmente valiosas para aprimorar modelos além do inglês.

O momento também reflete uma preocupação crescente com a contaminação por dados sintéticos. Desde que a IA generativa se tornou amplamente disponível, páginas escritas por máquinas se multiplicaram pela web. Rastreadores agora podem ingerir texto produzido por modelos anteriores, incluindo erros e padrões estilísticos repetitivos.

Livros de autoria humana oferecem uma alternativa mais limpa. Obras publicadas antes do boom da IA generativa dificilmente contêm resultados de chatbots modernos. Seu processo de publicação frequentemente incluiu edição, checagem de fatos e organização consistente.

Isso não significa que todo livro impresso seja preciso ou útil. Significa que os livros oferecem uma fonte relativamente densa de linguagem humana deliberada. Para desenvolvedores de IA que competem em desempenho multilíngue, esse material pode ser difícil de substituir.

Registros judiciais mostram o quanto a Anthropic valorizava os livros. Na decisão de fair use de 2025, o juiz William Alsup escreveu que a empresa via os livros como uma rota economicamente eficiente para um modelo de linguagem de primeira linha.

A Anthropic inicialmente obteve cópias digitais de várias fontes. O tribunal concluiu que ela baixou 196.640 livros do Books3, pelo menos cinco milhões do Library Genesis e pelo menos dois milhões do PiLiMi.

Essas coleções continham cópias não autorizadas, segundo a decisão. A Anthropic manteve uma biblioteca central permanente mesmo quando livros específicos não eram selecionados para uma mistura de treinamento. Essa decisão criou exposição jurídica separada do próprio treinamento do modelo.

A empresa posteriormente buscou uma rota de aquisição física. Em 2024, contratou Tom Turvey, que anteriormente liderou parcerias para o projeto de digitalização de livros do Google. Sua tarefa envolvia obter uma coleção extremamente ampla de livros sem repetir os problemas jurídicos anteriores.

A Anthropic comprou milhões de livros físicos, muitos deles usados. Contratados removeram as encadernações, separaram as páginas, digitalizaram-nas e converteram as imagens em texto legível por máquina. A empresa reteve os arquivos digitais resultantes.

Esse fluxo de trabalho explica por que os mercados de segunda mão são atraentes. Cópias usadas podem ser obtidas de muitos vendedores, e comprá-las cria um registro convencional da transação. Os compradores também podem direcionar edições usando Números Padrão Internacionais de Livro, ou ISBNs.

Um ISBN identifica uma edição e formato específicos de um livro. Ele ajuda os compradores a evitar compras duplicadas, conectar digitalizações a metadados e acompanhar detalhes de idioma ou publicação. Essas capacidades importam quando o pedido contém milhares de títulos não relacionados.

A digitalização destrutiva é mais rápida do que fotografar individualmente páginas encadernadas. Depois que a lombada é removida, folhas soltas podem passar por scanners de alta velocidade. O reconhecimento óptico de caracteres então converte as imagens das páginas em texto pesquisável.

O processo troca preservação por capacidade de processamento. Um volume raro e uma brochura comum podem entrar no mesmo fluxo mecânico, a menos que alguém os separe antes. O conjunto de dados final sobrevive, mas o objeto comprado não.

Esse mecanismo torna plausível que os pedidos japoneses sejam aquisições relacionadas à IA. Não prova a ligação. Ainda assim, a demanda por texto japonês limpo, combinada a um fluxo industrial documentado, dá aos donos de livrarias motivos razoáveis para preocupação.

Compra Japonesa de Livros para IA Transforma Receita em Risco de Preservação

A inversão central é simples: uma compra que ajuda uma livraria ainda pode enfraquecer o mercado de livros que tornou a venda possível.

Para um vendedor, um dia com vendas cinco vezes maiores normalmente é uma boa notícia. Sebos operam com espaço limitado, demanda irregular e estoque que pode permanecer sem venda por anos. Pedidos em massa liberam capacidade de armazenamento e convertem estoque de baixa rotatividade em receita.

Muitos livros adquiridos também podem ser exemplares excedentes comuns. Destruir uma brochura comum não apaga seu conteúdo do mundo. As lojas descartam rotineiramente estoque danificado ou indesejado quando os custos de preservação excedem a demanda provável.

A preocupação cresce quando compradores adquirem por metadados, e não por raridade. Um grande sistema de aquisição pode tratar um estudo local esgotado como qualquer outro ISBN. Ele pode não reconhecer que o exemplar listado é um dos poucos ainda disponíveis.

Depois de digitalizado, o livro físico pode ser transformado em polpa. Seu texto pode permanecer acessível apenas dentro de um repositório corporativo privado. Bibliotecas, pesquisadores, colecionadores e futuros leitores não obteriam automaticamente acesso a essa versão digital.

Esse resultado difere de um projeto de preservação. Bibliotecas digitalizam materiais frágeis para ampliar o acesso, preservando os originais quando possível. Um corpus privado de IA é concebido principalmente para aprimorar modelos comerciais, e não para servir como arquivo público.

A distinção também afeta a verificação. Pesquisadores precisam de edições estáveis, imagens de páginas, notas, ilustrações e contexto físico. Texto simples extraído pode omitir anotações marginais, diagramação, tipografia, gráficos e sinais da história de uma edição.

A publicação japonesa torna a questão particularmente sensível. Muitas obras têm tiragens limitadas e nunca recebem edições digitais. Histórias regionais e textos técnicos antigos podem desaparecer do mercado sem atrair atenção nacional.

Sebos funcionam como uma rede informal de preservação. Suas prateleiras mantêm coleções particulares indesejadas disponíveis até que outro leitor as encontre. Remover livros em quantidades industriais altera essa rede, mesmo quando cada compra individual é legal.

A pressão é distribuída de forma desigual. Grandes redes podem repor títulos populares a partir de muitas filiais. Pequenos vendedores especializados podem manter estoques distintos que levaram décadas para reunir. Um único pedido amplo pode mudar permanentemente o que essas lojas oferecem.

Isso não torna a compra em massa inerentemente imprópria. Proprietários têm o direito de vender seus livros, e muitos precisam dessa receita. Compradores também têm motivos legítimos para digitalizar livros, incluindo acessibilidade, busca, pesquisa acadêmica e tecnologia de linguagem.

O problema é a ausência de escolha informada. Uma livraria pode acreditar que está atendendo leitores, bibliotecas ou colecionadores. Se o comprador pretende desmontar cada volume, o vendedor não pode aplicar seus próprios critérios de preservação.

Alguns proprietários poderiam recusar esses pedidos quando se trata de material escasso. Outros poderiam cobrar de forma diferente, reter um exemplar ou exigir que livros raros recebam digitalização não destrutiva. Eles não podem tomar essas decisões quando intermediários ocultam o uso final.

A compra de livros japoneses por empresas de IA, portanto, cria uma falha de informação no mercado. Os vendedores conhecem os títulos e as quantidades, mas podem não saber o destino ou a finalidade. Os compradores conhecem o processo pretendido, mas podem distribuir os pedidos entre várias contas.

O resultado é uma transferência de valor de curto prazo. As livrarias recebem dinheiro, enquanto o comprador obtém tanto um objeto físico quanto o controle exclusivo sobre seu conteúdo digitalizado. O público pode perder acesso sem perceber que houve uma perda.

É por isso que a história não trata simplesmente de empresas de IA pagando por dados de treinamento. O pagamento resolve uma questão sobre a aquisição. Não resolve a preservação, a transparência, o licenciamento nem o valor social da circulação contínua.

Comprar o Livro Não Resolve a Questão dos Direitos Autorais

A propriedade de uma cópia física e a permissão para reproduzir seu texto são direitos distintos, enquanto o treinamento de IA continua juridicamente contestado em diferentes jurisdições.

Em geral, um comprador pode revender, emprestar, alterar ou destruir um livro comprado legalmente. A lei de direitos autorais ainda limita a criação e o uso de cópias da expressão protegida. A digitalização para IA coloca esses dois princípios em tensão direta.

No caso da Anthropic, o tribunal federal separou aquisição de treinamento. O juiz Alsup considerou transformativo, diante dos fatos apresentados, o uso pela empresa de livros obtidos legalmente para treinamento. A decisão não criou uma isenção universal para todos os sistemas de IA.

O juiz também distinguiu as digitalizações físicas da Anthropic de seus downloads de bibliotecas piratas. A compra de exemplares impressos e sua conversão para uso interno recebeu tratamento mais favorável. Manter milhões de arquivos sabidamente pirateados não recebeu.

Essa diferença é uma das razões pelas quais os livros físicos agora têm valor estratégico. Uma compra documentada pode reduzir uma categoria de risco jurídico. Ela não elimina reivindicações envolvendo reprodução, dano ao mercado, transparência de dados ou diferentes leis nacionais.

A Anthropic posteriormente concordou em resolver reivindicações relacionadas às suas cópias pirateadas. O acordo proposto abrangia cerca de 500.000 obras e exigia a destruição dos arquivos originais obtidos das bibliotecas digitais contestadas.

O acordo de direitos autorais não estabeleceu que a digitalização destrutiva fosse, por si só, ilegal. Ele destacou como os métodos de aquisição podem importar mesmo quando os tribunais consideram o treinamento de modelos transformativo.

Autores e editoras continuam céticos em relação a alegações amplas sobre treinamento. A Authors Guild acompanhou cerca de uma dúzia de processos americanos de direitos autorais envolvendo livros e outros materiais protegidos. Entre os réus estão Anthropic, OpenAI, Microsoft, Meta, Nvidia, Google, Bloomberg e Databricks.

Esses casos pendentes de IA tratam de diferentes conjuntos de dados, modelos, autores, demandantes e teses jurídicas. Uma decisão não pode ser aplicada automaticamente a todos eles. Recursos também podem alterar as interpretações atuais.

O Japão acrescenta outro sistema jurídico à análise. A lei japonesa de direitos autorais contém disposições que podem permitir a análise de informações sob condições definidas. Sua aplicação depende da finalidade, da fruição da obra e do possível dano aos titulares de direitos.

Uma remessa internacional pode envolver várias etapas e jurisdições. Um livro pode ser comprado no Japão, consolidado em Okayama, digitalizado nos Estados Unidos e usado por uma empresa que opera globalmente. Cada etapa cria questões factuais diferentes.

As reportagens atuais não revelam esses contratos. Também não identificam quem seleciona os títulos, quem é proprietário das digitalizações ou se as editoras recebem pagamentos de licenciamento. Essas lacunas impedem conclusões firmes sobre a legalidade.

A mesma cautela se aplica à destruição. Reportagens sobre o fluxo de trabalho anterior da Anthropic mostram que a digitalização destrutiva em grande escala existe. Elas não provam que todos os livros encaminhados pelo centro de Okayama serão transformados em polpa.

Alguns poderiam ser revendidos após uma digitalização não destrutiva. Outros poderiam ser armazenados ou processados para exportação comum. Até que um comprador, fornecedor de logística, empresa de digitalização ou registro de envio forneça mais detalhes, o destino final permanece uma alegação.

Essa incerteza não deve encerrar a investigação. Ela define a investigação. O artigo mais forte não é aquele que nomeia um culpado sem evidências, mas o que identifica os registros necessários para testar a alegação.

As livrarias podem reter informações de contas, listas de pedidos, etiquetas de envio e correspondências incomuns. Registros de exportação podem estabelecer destinos e pesos. Empresas contratadas de digitalização podem divulgar políticas de preservação sem revelar dados protegidos de clientes.

Editoras e autores também podem perguntar se conjuntos de dados recém-adquiridos em língua japonesa são licenciados. Desenvolvedores de modelos descrevem cada vez mais métodos de segurança e recursos computacionais. A aquisição de dados de treinamento permanece muito menos transparente.

A disputa jurídica continuará, mas a transparência pode melhorar antes que os tribunais apresentem respostas definitivas. Compradores podem divulgar sua finalidade, proteger exemplares escassos e oferecer aos titulares de direitos informações significativas. Nenhuma dessas medidas exige expor a arquitetura do modelo.

As Próximas Evidências Devem Vir da Cadeia de Suprimentos

Três sinais determinarão se esta é uma anomalia temporária no varejo ou uma transferência industrial da produção editorial japonesa para arquivos privados de IA.

O primeiro sinal é a identificação do comprador final. Várias contas de compra não comprovam vários clientes quando todas as remessas convergem para uma única instalação. Contratos ou documentação de exportação poderiam conectar essa instalação a uma empresa de digitalização ou desenvolvedora de IA.

Um cliente confirmado reforçaria a teoria de aquisição para IA. Evidências de exportação comum, revenda a bibliotecas ou arquivamento comercial a enfraqueceriam. Qualquer um dos resultados substituiria a suspeita por uma cadeia de custódia responsabilizável.

O segundo sinal é o tratamento de livros escassos. Vendedores deveriam acompanhar se compradores selecionam duplicatas comuns ou levam todos os exemplares correspondentes a cada ISBN. Pedidos contendo obras acadêmicas esgotadas e história regional merecem atenção especial.

Um comprador que exclua cópias escassas reduziria a preocupação com preservação. A digitalização não destrutiva a reduziria ainda mais. Um processo que destrói livros sem triagem de raridade sustentaria os temores de perda cultural permanente.

O terceiro sinal é a divulgação por parte de desenvolvedores de IA. As empresas podem informar se estão comprando coleções impressas japonesas, se contratados destroem os originais e como lidam com direitos autorais. O silêncio deixará intermediários e livrarias arcando com o ônus reputacional.

Os desenvolvedores também poderiam explicar se as digitalizações permanecem privadas ou apoiam uma cópia pública de preservação. Um corpus privado oferece valor comercial a uma empresa. Um arquivo acessível pode preservar pelo menos algum benefício para leitores e pesquisadores.

Esses sinais importam além do Japão. Livreiros europeus e americanos também relataram pedidos incomuns em massa associados à demanda por dados de treinamento de IA. Um padrão internacional repetível sugeriria uma indústria coordenada de obtenção de dados, e não colecionismo isolado.

Isso também mudaria o cenário competitivo. Os desenvolvedores de modelos antes competiam principalmente por capacidade computacional, talento de engenharia e conjuntos de dados na escala da internet. Agora competem por conhecimento humano selecionado que ainda não circulou livremente online.

Essa competição coloca os livreiros em uma posição desconhecida. Eles não são mais apenas varejistas que atendem leitores. Seus catálogos podem se tornar infraestrutura de dados a montante para empresas com orçamentos muito maiores e pouca visibilidade pública.

Os proprietários não precisam rejeitar toda venda em massa. Eles podem introduzir salvaguardas sem abrir mão de novas receitas. Essas salvaguardas podem incluir revisões de quantidade, verificações de raridade, declarações do comprador e aprovação separada para uso destrutivo.

Os marketplaces também podem sinalizar contas coordenadas que compartilham destinos. Um pedido de alto volume em áreas acadêmicas não relacionadas não é necessariamente abusivo. Ainda assim, é uma informação útil para vendedores que decidem se liberam inventário escasso.

Bibliotecas, editoras e universidades deveriam observar os mesmos padrões. Um desaparecimento repentino de títulos especializados pode afetar a pesquisa muito antes que estatísticas oficiais de circulação revelem uma escassez. Listas de acompanhamento compartilhadas poderiam identificar obras vulneráveis mais cedo.

Os leitores também têm um papel. Qualquer pessoa que venda uma coleção herdada deveria perguntar se materiais únicos pertencem a uma biblioteca ou arquivo antes de escolher o comprador em massa mais rápido. Quando uma cópia rara entra em processamento destrutivo, a decisão não pode ser revertida.

O aumento imediato das vendas japonesas pode desaparecer quando a atual meta de aquisição for concluída. Se isso acontecer, as lojas poderão experimentar a reversão que os proprietários temem. A receita sobe durante a coleta, depois cai porque o estoque desejável é mais difícil de repor.

A questão mais duradoura diz respeito a quem controla o conhecimento resultante. Um livro digitalizado pode melhorar ferramentas de linguagem, sistemas de busca e o acesso para pessoas com deficiência. Esses benefícios não exigem sigilo nem destruição desnecessária.

A compra de livros japoneses para IA deve, portanto, ser avaliada pelo que acontece após a compra. Obras escassas são protegidas? Os criadores são informados? Pesquisadores podem acessar cópias preservadas? O comprador aceita responsabilidade pública?

Até que essas respostas surjam, a conclusão responsável permanece cautelosa. Os pedidos em massa são documentados por relatos de livrarias, enquanto a conexão com IA é fortemente sugerida, mas verificada de forma incompleta. O risco se torna irreversível apenas quando os livros entram no scanner.

Acompanhe a cadeia de suprimentos de Okayama, o destino de títulos esgotados e as divulgações dos principais desenvolvedores de modelos. Esses três sinais mostrarão se um boom no varejo se transformou em uma transferência oculta de memória cultural.

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page