
Create a landscape editorial hero image for this Studio Global article: What are the key details about OpenAI and Anthropic purchasing internal corporate data — including employee chats, emails, video recordings,. Article summary: I'll research this thoroughly across multiple angles. Topic tags: general, education, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
El internet público se está quedando sin texto humano limpio y los laboratorios de inteligencia artificial más importantes del mundo están buscando una nueva fuente de combustible: tus comunicaciones internas corporativas. OpenAI y Anthropic están comprando agresivamente mensajes de Slack de empleados, correos electrónicos, grabaciones de video e historiales de código de startups —pagando hasta 300.000 dólares por acuerdo— en un mercado silencioso pero de rápido crecimiento para datos de interacción humana propietarios.
El impulso hacia los datos corporativos está motivado por un simple e inevitable problema matemático. La estimación más citada, del grupo de investigación Epoch AI, sitúa el stock total de texto público de alta calidad generado por humanos en aproximadamente 300 billones de tokens (intervalo de confianza del 90%: 100 billones a 1.000 billones) . A los ritmos actuales de consumo de entrenamiento de frontera, se proyecta que ese suministro se agotará entre 2026 y 2032, con una estimación mediana de 2028
. Algunos análisis sugieren que el texto humano de alta calidad en la web abierta puede ser de solo 15 a 20 billones de tokens, lo que adelantaría el agotamiento a 2026
. PBS informó a finales de 2025 que la "fiebre del oro" por los datos de entrenamiento de chatbots podría terminarse en 2026
.
A medida que ese techo se acerca, OpenAI y Anthropic han dirigido su atención a un tesoro previamente sin explotar: los datos de colaboración corporativa interna . Los registros de interacciones humanas en vivo —correos electrónicos que contienen negociaciones, transcripciones de reuniones con toma de decisiones en tiempo real e hilos de Slack que muestran dinámicas auténticas en el lugar de trabajo— ofrecen el tipo de datos conversacionales orgánicos que se han vuelto escasos en la web pública rastreada.
Ha surgido un nuevo ecosistema de empresas intermediarias para intermediar estas transacciones sensibles. Dos nombres aparecen con mayor frecuencia: Mercor y SimpleClosure .
Las tarifas generales del mercado, reportadas por Reuters en 2024, ofrecen una idea del valor por unidad: aproximadamente $0.001 por palabra para texto, $1 a $2 por imagen, $2 a $4 por video corto y $100 a $300 por hora de película o video más largo .
SimpleClosure, una empresa de cierre de startups, ha procesado casi 100 transacciones de este tipo en el último año, con pagos que van de 10.000 a 100.000 dólares por empresa . La plataforma "Asset Hub" de la firma ayuda a los fundadores a eliminar la información de identificación personal (IIP) de los datos antes de licenciarlos, aunque la efectividad y consistencia de esa anonimización siguen siendo inciertas y un punto de controversia creciente .
Los extremos a los que las empresas de IA están dispuestas a llegar para asegurar datos de entrenamiento quedaron al descubierto en el extraordinario caso del Proyecto Panamá, el programa interno secreto de Anthropic para construir un conjunto masivo de datos de entrenamiento de libros .
El proyecto tenía dos vías. Primero, Anthropic compró libros impresos físicos, cortó sus encuadernaciones y los escaneó destructivamente página por página, convirtiéndolos en PDFs buscables y descartando los originales en papel. El objetivo: convertir hasta 2 millones de libros en seis meses . Un memorando interno aconsejaba usar un nombre en clave "porque no queremos que se sepa que estamos trabajando en esto" .
En segundo lugar, la empresa descargó más de 7 millones de archivos de libros electrónicos pirateados de bibliotecas fantasma como LibGen y Pirate Library Mirror . Esa vía condujo a una demanda colectiva presentada en 2024 por los autores Andrea Bartz, Kirk Wallace Johnson y Charles Graeber, quienes acusaron a Anthropic de usar casi medio millón de libros pirateados para entrenar a Claude .
El 20 de julio de 2026, un juez federal en San Francisco aprobó un acuerdo de 1.500 millones de dólares —el mayor pago conocido por derechos de autor en la historia de EE. UU. . Más de 500.000 autores y editores formaban parte de la demanda colectiva y recibirán un estimado de 3.000 dólares por obra elegible .
Crucialmente, el tribunal trazó una distinción legal que tiene implicaciones importantes para el entrenamiento de IA. El uso de libros electrónicos pirateados fue infractor y desencadenó el acuerdo. Pero la compra de libros impresos físicos y su escaneo destructivo interno para el entrenamiento fue considerado potencialmente como uso justo, porque cada copia física fue reemplazada por una sola copia digital en un proceso que el tribunal calificó de "extremadamente transformador" . Los 1.500 millones de dólares cubrieron la responsabilidad por los libros pirateados; el programa de destrucción física no fue penalizado .
A medida que las empresas se apresuran a monetizar los datos internos, quedan preguntas significativas. La efectividad de la anonimización de datos por parte de intermediarios como SimpleClosure es incierta y un punto de controversia creciente . Los mensajes de Slack y correos electrónicos de los empleados contienen información profundamente personal y sensible, y no está claro si las técnicas actuales de eliminación son suficientes para prevenir la reidentificación.
Mientras tanto, los costos de entrenamiento se están disparando. Una sola ejecución de entrenamiento a escala de GPT-4 puede costar ya 100 millones de dólares o más . A medida que se agotan los datos públicos de alta calidad, los costos combinados de licenciar datos corporativos propietarios, pagar acuerdos históricos como los 1.500 millones de dólares de Anthropic y construir tuberías de datos sintéticos están escalando dramáticamente. Se proyecta que el mercado más amplio de conjuntos de datos de entrenamiento de IA crecerá rápidamente, de un estimado de 3.600 millones de dólares en 2025 a 23.000 millones de dólares para 2034, a medida que la concesión de licencias de texto humano se convierta en una clase de activo formalizada .
Para los usuarios individuales, el panorama ha cambiado. A finales de 2025, tanto OpenAI como Anthropic cambiaron sus políticas predeterminadas para permitir el entrenamiento en chats de nivel de consumidor (ChatGPT Free y Plus, Claude Free, Pro y Max) a menos que los usuarios se opongan activamente . Los clientes empresariales y de API permanecen excluidos del entrenamiento por defecto bajo los Acuerdos de Procesamiento de Datos contractuales
.
El mensaje es claro: en la carrera por alimentar el hambre insaciable de la IA por datos generados por humanos, los límites entre lo público y lo privado, lo personal y lo comercial, se están redibujando, un archivo de Slack a la vez.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Epoch AI estima que el stock de texto público de alta calidad es de unos 300 billones de tokens, con fecha de agotamiento prevista entre 2026 y 2032 (mediana: 2028).
Epoch AI estima que el stock de texto público de alta calidad es de unos 300 billones de tokens, con fecha de agotamiento prevista entre 2026 y 2032 (mediana: 2028). OpenAI y Anthropic están pagando entre 10.000 y 300.000 dólares por archivos de Slack, correos electrónicos, grabaciones de videoconferencias e historiales de código de startups.
Un acuerdo de $1.500 millones por el 'Proyecto Panamá' de Anthropic establece un precedente: escanear libros comprados es uso justo, pero descargar libros pirateados es ilegal.