По мере приближения к этому потолку, OpenAI и Anthropic обратили внимание на ранее нетронутый ресурс: внутренние корпоративные данные . Записи реальных человеческих взаимодействий — электронные письма с переговорами, стенограммы встреч с принятием решений в реальном времени и цепочки сообщений в Slack, показывающие подлинную динамику рабочего процесса, — предлагают тот органический разговорный материал, который стал дефицитом на «вычищенном» публичном вебе.
Для посредничества в этих деликатных сделках возникла целая новая экосистема. Два названия встречаются чаще всего: Mercor и SimpleClosure .
Более широкие рыночные ставки, опубликованные Reuters в 2024 году, дают представление о ценности за единицу: примерно $0,001 за слово для текста, $1–$2 за изображение, $2–$4 за короткое видео и $100–$300 за час более длинного фильма или записи .
SimpleClosure, фирма, специализирующаяся на ликвидации стартапов, провела почти 100 таких транзакций за последний год, выплачивая от $10 000 до $100 000 за компанию . Её платформа «Asset Hub» помогает основателям очищать данные от личной информации (PII) перед лицензированием, хотя эффективность и последовательность такой анонимизации остаются неопределёнными и становятся предметом растущих споров .
Масштабы, на которые готовы идти AI-компании ради получения обучающих данных, были обнажены в неординарном деле «Проект Панама» — секретной внутренней программе Anthropic по созданию массивного набора книг для обучения .
У проекта было два направления. Во-первых, Anthropic закупала печатные книги, разрезала их переплёты и деструктивно сканировала страницу за страницей, преобразуя их в поисковые PDF и выбрасывая бумажные оригиналы. Цель: оцифровать до 2 миллионов книг за шесть месяцев . Во внутренней памятке рекомендовалось использовать кодовое название, «потому что мы не хотим, чтобы стало известно, что мы работаем над этим» .
Во-вторых, компания загрузила более 7 миллионов пиратских файлов электронных книг из теневых библиотек, включая LibGen и Pirate Library Mirror . Это направление привело к коллективному иску, поданному в 2024 году авторами Андреа Бартц, Кирком Уоллесом Джонсоном и Чарльзом Гребером, которые обвинили Anthropic в использовании почти полумиллиона пиратских книг для обучения Claude .
20 июля 2026 года федеральный судья в Сан-Франциско утвердил мировое соглашение на $1,5 миллиарда — крупнейшую известную выплату по авторским правам в истории США . Более 500 000 авторов и издателей были частью коллективного иска, и они получат примерно $3000 за каждую подходящую работу .
Ключевой момент: суд провёл юридическое различие, имеющее огромные последствия для обучения ИИ. Использование пиратских электронных книг было признано нарушением и повлекло за собой урегулирование. Но покупка физических печатных книг с их деструктивным сканированием для внутреннего обучения была признана потенциально подпадающей под добросовестное использование (fair use), поскольку каждая физическая копия заменялась одной цифровой копией в процессе, который суд назвал «чрезвычайно трансформативным» . $1,5 миллиарда покрыли ответственность за пиратские книги; программа физического уничтожения не была наказана .
Пока компании спешат монетизировать внутренние данные, остаются серьёзные вопросы. Эффективность анонимизации данных брокерами, такими как SimpleClosure, неопределённа и становится предметом растущих споров . Slack-сообщения и электронные письма сотрудников содержат глубоко личную и чувствительную информацию, и неясно, достаточны ли текущие методы очистки для предотвращения повторной идентификации.
Тем временем затраты на обучение стремительно растут. Один тренировочный прогон модели масштаба GPT-4 может стоить $100 миллионов и более . По мере исчерпания качественных общедоступных данных, совокупные затраты на лицензирование проприетарных корпоративных данных, выплату рекордных отчислений, таких как $1,5 млрд Anthropic, и создание синтетических данных — все они резко возрастают. Прогнозируется, что более широкий рынок наборов данных для обучения ИИ будет быстро расти: с $3,6 миллиарда в 2025 году до $23 миллиардов к 2034 году, поскольку лицензирование человеческого текста становится формальным классом активов .
Для обычных пользователей ландшафт изменился. С конца 2025 года и OpenAI, и Anthropic изменили свою политику по умолчанию, разрешив обучение на пользовательских чатах потребительского уровня (ChatGPT Free и Plus, Claude Free, Pro и Max), если пользователи активно не откажутся от этого . Корпоративные и API-клиенты по умолчанию исключены из обучения в соответствии с договорными соглашениями об обработке данных (DPA)
.
Послание ясно: в гонке за удовлетворение ненасытного аппетита ИИ к человеческим данным границы между публичным и частным, личным и коммерческим перерисовываются — один Slack-архив за раз.