Estudo do Epoch AI estima que o estoque de texto público de alta qualidade seja de cerca de 300 trilhões de tokens, com previsão de esgotamento total entre 2026 e 2032. OpenAI e Anthropic estão pagando de US$ 10 mil a US$ 300 mil por arquivos internos de startups, incluindo chats do Slack, e mails, históricos de cód...
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What are the key details about OpenAI and Anthropic purchasing internal corporate data — including employee chats, emails, video recordings,. Article summary: I'll research this thoroughly across multiple angles. Topic tags: general, education, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
A internet pública está ficando sem texto limpo escrito por humanos, e os principais laboratórios de IA do mundo estão correndo atrás de uma nova fonte de combustível: suas comunicações corporativas internas. OpenAI e Anthropic estão comprando agressivamente mensagens do Slack de funcionários, e-mails, gravações de vídeo e históricos de código de startups — pagando até US$ 300 mil por negócio em um mercado silencioso, mas que cresce rapidamente, de dados de interação humana proprietários.
A investida em dados corporativos é impulsionada por um problema matemático simples e inevitável. A estimativa mais citada, do grupo de pesquisa Epoch AI, coloca o estoque total de texto público de alta qualidade gerado por humanos em aproximadamente 300 trilhões de tokens (intervalo de confiança de 90%: 100 trilhões a 1.000 trilhões) . Nas taxas atuais de consumo de treinamento de ponta, prevê-se que essa oferta se esgote entre 2026 e 2032, com uma estimativa mediana de 2028
. Algumas análises sugerem que o texto humano de alta qualidade na web aberta pode ser de apenas 15 a 20 trilhões de tokens, empurrando o esgotamento para 2026
. A PBS informou no final de 2025 que a "corrida do ouro" por dados de treinamento de chatbots poderia acabar em 2026
.
À medida que esse teto se aproxima, OpenAI e Anthropic voltaram sua atenção para um tesouro até então inexplorado: dados de colaboração corporativa interna . Registros de interações humanas ao vivo — e-mails contendo negociações, transcrições de reuniões com tomada de decisão em tempo real e tópicos do Slack mostrando dinâmicas autênticas de local de trabalho — oferecem o tipo de dado conversacional orgânico que se tornou escasso na web pública rastreada.
Um novo ecossistema de empresas intermediárias surgiu para intermediar essas transações sensíveis. Dois nomes aparecem com mais frequência: Mercor e SimpleClosure .
As taxas de mercado mais amplas, relatadas pela Reuters em 2024, oferecem uma noção do valor por unidade: aproximadamente US$ 0,001 por palavra para texto, US$ 1 a US$ 2 por imagem, US$ 2 a US$ 4 por vídeo curto e US$ 100 a US$ 300 por hora de filme ou vídeo mais longo .
A SimpleClosure, uma empresa de encerramento de startups, processou quase 100 dessas transações no último ano, com pagamentos variando de US$ 10.000 a US$ 100.000 por empresa . A plataforma "Asset Hub" da empresa ajuda os fundadores a limpar informações de identificação pessoal (PII) dos dados antes de licenciá-los — embora a eficácia e a consistência dessa anonimização permaneçam incertas e sejam um ponto crescente de controvérsia .
A extensão que as empresas de IA estão dispostas a ir para garantir dados de treinamento foi exposta no caso extraordinário do Projeto Panamá, o programa interno secreto da Anthropic para construir um enorme conjunto de dados de treinamento de livros .
O projeto tinha duas frentes. Primeiro, a Anthropic comprou livros impressos físicos, cortou suas encadernações e os escaneou destrutivamente página por página, convertendo-os em PDFs pesquisáveis e descartando os originais de papel. A meta: converter até 2 milhões de livros em seis meses . Um memorando interno aconselhava o uso de um codinome "porque não queremos que seja sabido que estamos trabalhando nisso" .
Em segundo lugar, a empresa baixou mais de 7 milhões de arquivos de e-books pirateados de bibliotecas paralelas, incluindo LibGen e Pirate Library Mirror . Essa segunda frente levou a uma ação coletiva movida em 2024 pelos autores Andrea Bartz, Kirk Wallace Johnson e Charles Graeber, que acusaram a Anthropic de usar quase meio milhão de livros pirateados para treinar o Claude .
Em 20 de julho de 2026, um juiz federal em São Francisco aprovou um acordo de US$ 1,5 bilhão — o maior pagamento por direitos autorais da história dos EUA . Mais de 500.000 autores e editoras fizeram parte da ação coletiva e receberão estimados US$ 3.000 por obra elegível .
Crucialmente, o tribunal traçou uma distinção legal que tem grandes implicações para o treinamento de IA. Usar e-books pirateados foi considerado infração e desencadeou o acordo. Mas comprar livros impressos físicos e escaneá-los destrutivamente internamente para treinamento foi considerado como potencialmente se qualificando como uso justo (fair use), porque cada cópia física foi substituída por uma única cópia digital em um processo que o tribunal chamou de "extremamente transformador" . Os US$ 1,5 bilhão cobriram a responsabilidade pelos livros pirateados; o programa de destruição física não foi penalizado .
À medida que as empresas correm para monetizar dados internos, questões significativas permanecem. A eficácia da anonimização de dados por corretores como a SimpleClosure é incerta e um ponto crescente de controvérsia . Mensagens do Slack e e-mails de funcionários contêm informações profundamente pessoais e confidenciais, e não está claro se as técnicas atuais de remoção são suficientes para evitar a reidentificação.
Enquanto isso, os custos de treinamento estão disparando. Uma única execução de treinamento em escala GPT-4 já pode custar US$ 100 milhões ou mais . À medida que os dados públicos de alta qualidade se esgotam, os custos combinados de licenciamento de dados corporativos proprietários, pagamento de acordos históricos como os US$ 1,5 bilhão da Anthropic e a construção de pipelines de dados sintéticos estão todos aumentando dramaticamente. O mercado mais amplo de conjuntos de dados de treinamento de IA deve crescer rapidamente, de estimados US$ 3,6 bilhões em 2025 para US$ 23 bilhões até 2034, à medida que o licenciamento de texto humano se torna uma classe de ativos formalizada .
Para usuários individuais, o cenário mudou. No final de 2025, tanto a OpenAI quanto a Anthropic alteraram suas políticas padrão para permitir o treinamento em chats de nível de consumo (ChatGPT Free e Plus, Claude Free, Pro e Max), a menos que os usuários optem ativamente por não participar . Clientes empresariais e de API permanecem excluídos do treinamento por padrão, sob Acordos de Processamento de Dados (DPA) contratuais
.
A mensagem é clara: na corrida para alimentar a fome insaciável de dados gerados por humanos da IA, as fronteiras entre o público e o privado, o pessoal e o comercial, estão sendo redesenhadas — um arquivo do Slack de cada vez.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
Estudo do Epoch AI estima que o estoque de texto público de alta qualidade seja de cerca de 300 trilhões de tokens, com previsão de esgotamento total entre 2026 e 2032.
Estudo do Epoch AI estima que o estoque de texto público de alta qualidade seja de cerca de 300 trilhões de tokens, com previsão de esgotamento total entre 2026 e 2032. OpenAI e Anthropic estão pagando de US$ 10 mil a US$ 300 mil por arquivos internos de startups, incluindo chats do Slack, e mails, históricos de código e gravações de reuniões.
O 'Projeto Panamá', da Anthropic, envolveu a destruição e digitalização de milhões de livros para treinar o Claude, resultando em um acordo de US$ 1,5 bilhão por violação de direitos autorais.