A demanda por dados de treinamento está mudando o mercado de livros usados, com compras em massa em sebos para alimentar modelos de IA. Entenda os riscos e oportunidades para empresas.
Introdução: quando a inteligência artificial encontra os sebos
O avanço acelerado da inteligência artificial (IA) tem gerado uma demanda sem precedentes por dados de treinamento. Enquanto gigantes como OpenAI e Google disputam contratos bilionários com editoras e veículos de mídia, um fenômeno mais silencioso ocorre nos sebos: compradores misteriosos adquirem milhares de livros usados, muitas vezes com a intenção de digitalizá-los em massa para alimentar modelos de linguagem. Essa prática, que ganhou destaque em documentos do caso Anthropic, levanta questões urgentes sobre propriedade intelectual, ética e governança corporativa.
O que aconteceu
De acordo com o Diário do Centro do Mundo, livreiros de diversas regiões relatam pedidos incomuns: clientes que compram centenas ou até milhares de livros de uma só vez, sem se importar com o conteúdo específico. Em alguns casos, os compradores pedem que os livros sejam enviados diretamente para centros de digitalização. Documentos do caso Anthropic, que envolvem a empresa de IA, revelam que a digitalização de obras protegidas por direitos autorais é feita de forma destrutiva: os livros são cortados ou desmontados para acelerar o escaneamento, o que inviabiliza sua revenda.
Essa prática não é isolada. A The New York Times já havia reportado que empresas de IA estão comprando bibliotecas inteiras de sebos e bibliotecas universitárias para treinar seus modelos. A justificativa é a necessidade de dados diversificados e de alta qualidade, especialmente em domínios como literatura, direito e medicina, onde os textos disponíveis online são escassos ou de baixa qualidade.
Por que isso importa para empresas
Para executivos, esse fenômeno sinaliza uma mudança profunda na economia dos dados. A IA não depende apenas de dados públicos da internet; ela busca ativamente fontes físicas e analógicas. Isso tem implicações diretas para empresas que possuem acervos documentais, bibliotecas corporativas ou mesmo arquivos históricos. Se esses materiais não forem protegidos, podem ser alvo de coleta não autorizada, gerando riscos legais e competitivos.
Além disso, a prática de digitalização destrutiva levanta alertas sobre a sustentabilidade das fontes de dados. Empresas que dependem de conteúdo licenciado podem enfrentar escassez de dados ou aumento de custos, à medida que os detentores de direitos autorais se tornam mais vigilantes. A recente onda de processos contra empresas de IA, como o caso Anthropic, mostra que o uso não autorizado de obras protegidas pode resultar em multas milionárias e danos à reputação.
Impacto para cibersegurança, governança, IA ou continuidade
Do ponto de vista de cibersegurança, a digitalização em massa de livros pode introduzir vulnerabilidades. Os arquivos digitalizados, muitas vezes armazenados em servidores com proteção inadequada, podem ser alvo de ataques cibernéticos. Além disso, a falta de controle sobre o que está sendo digitalizado pode expor informações confidenciais, caso os livros contenham anotações ou dados sensíveis.
Na governança, a questão central é a conformidade com as leis de direitos autorais. Empresas que utilizam dados de treinamento sem a devida autorização podem enfrentar sanções regulatórias, como as previstas na Lei Geral de Proteção de Dados (LGPD) e na legislação de propriedade intelectual. A governança de dados deve incluir políticas claras sobre a aquisição e o uso de dados, incluindo a verificação da origem e da licença de qualquer material utilizado em projetos de IA.
Para a continuidade de negócios, a escassez de dados de qualidade pode se tornar um gargalo. Empresas que dependem de IA para tomada de decisão precisam garantir que seus modelos sejam treinados com dados éticos e legais. A interrupção no fornecimento de dados, seja por ações judiciais ou por esgotamento de fontes, pode afetar a operação e a inovação.
Leitura executiva da WSVP
A corrida da IA está criando um novo tipo de 'corrida do ouro', onde os dados são o novo petróleo. No entanto, a forma como esses dados são obtidos pode determinar o sucesso ou o fracasso das empresas no longo prazo. A WSVP recomenda que os executivos vejam esse fenômeno como um alerta para revisar suas estratégias de dados e propriedade intelectual.
Empresas que possuem acervos físicos ou digitais devem considerar a implementação de medidas de proteção, como a digitalização preventiva com controle de acesso e a marca d'água em documentos sensíveis. Além disso, é fundamental estabelecer parcerias com detentores de direitos autorais para garantir o licenciamento adequado de dados, evitando riscos legais.
A transparência também é crucial. As empresas devem documentar a origem de todos os dados usados em seus modelos de IA, não apenas para cumprir regulamentações, mas também para construir confiança com clientes e investidores. A reputação de uma empresa pode ser severamente danificada se for descoberto que ela utiliza dados obtidos ilegalmente.
Recomendações práticas
- Auditoria de dados: Realize uma auditoria completa de todos os dados utilizados em projetos de IA, verificando a origem e a licença de cada conjunto de dados.
- Política de propriedade intelectual: Desenvolva uma política interna clara sobre o uso de dados de terceiros, incluindo procedimentos para obtenção de autorização e pagamento de royalties.
- Proteção de acervos: Se sua empresa possui bibliotecas ou arquivos físicos, implemente medidas de segurança para evitar a coleta não autorizada, como controle de acesso e monitoramento de visitantes.
- Digitalização responsável: Se a digitalização for necessária, faça-a de forma não destrutiva e com o devido licenciamento, preservando os originais.
- Monitoramento legal: Acompanhe as decisões judiciais relacionadas ao uso de dados para IA, como o caso Anthropic, e ajuste suas práticas conforme a jurisprudência evolui.
- Educação e treinamento: Capacite equipes jurídicas e de tecnologia sobre as implicações legais e éticas do uso de dados em IA.
Fontes consultadas
Este rascunho foi produzido com apoio de inteligência artificial e ainda requer revisão humana antes da publicação.


