По данным СМИ, нескольких подрядчиков отстранили за использование ИИ при оценке ответов ChatGPT: Project Lily должен собирать независимые человеческие предпочтения, а не суждения модели. В Project Lily сотни рецензентов читают и оценивают реальные диалоги с ChatGPT; при этом в более широкой системе оценочных конвейе...
ОпубликовалОтредактировано с помощью GPT-5.6 TerraИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: Why did OpenAI fire contractors working on Project Lily for using AI tools to evaluate anonymized ChatGPT conversations, how do its more tha. Article summary: OpenAI reportedly removed contractors who used generative AI to produce the judgments because Project Lily’s purpose is to collect independent human preferences. AI-written evaluations would turn a human-feedback pipelin. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Project Lily, о котором рассказал 404 Media, — это система человеческой проверки, где подрядчики оценивают ответы ChatGPT, чтобы улучшать последующее поведение модели. Именно этим, вероятно, и объясняется отстранение работников, которые использовали генеративный ИИ для самих оценок: ценность таких данных состоит в независимом человеческом суждении. Если вердикт выдаёт модель, конвейер уже не измеряет предпочтения людей в чистом виде. 19
20
Рецензентам показывают реальные запросы к ChatGPT, а в отдельных случаях — полные диалоги. Они кратко описывают намерение пользователя, сопоставляют варианты ответов и ставят оценки по шкале от 1 до 7. В одном задании может быть до четырёх вариантов ответа. В центре внимания не только фактологическая точность, но и поведение модели: тон, чрезмерная угодливость, а также неоправданно «человеческие» заявления от имени чат-бота. 8
19
Такие оценки превращаются в данные о предпочтениях: структурированную запись о том, какой ответ человек считает более удачным в конкретном контексте. Для настройки модели на желаемое поведение эти данные полезны лишь тогда, когда оценки последовательны, осмысленны и независимы.
Как сообщалось, в Project Lily участвуют сотни внешних рецензентов. Их набирают через Crossing Hurdles, а выплаты проводит Mercor; один из участников говорил о ставке выше 50 долларов в час. Отдельно в материалах о более широкой системе оценок OpenAI упоминается свыше 10 000 подрядчиков — эту цифру не следует считать численностью одного лишь Project Lily. 19
6
Автоматический оценщик может работать быстро и быть полезным для внутренних тестов. Но он отвечает не на тот же вопрос, что и человек, выражающий своё предпочтение. Модель склонна воспроизводить закономерности, усвоенные во время обучения, и может отдавать предпочтение знакомым формулировкам, стилю или предпосылкам.
Если выводы модели — особенно близкой по устройству к той, которую оценивают, — регулярно используются для поощрения будущих ответов, возникает замкнутый цикл:
Это не означает, что любая автоматическая оценка обязательно ухудшает модель. Она может быть полезна, если подтверждена сравнением с человеческими оценками и применяется в чётко заданных пределах. Но подмена ею работы, специально заказанной как источник человеческих предпочтений, ослабляет независимость обучающего сигнала. Судя по сообщениям, именно поэтому такая практика была запрещена.
Согласно публикациям, руководителям предписывали не полагаться на детекторы ИИ-текста вроде GPTZero. Вместо этого им предлагалось вручную изучать рабочие паттерны и сами тексты: обращать внимание на слишком однообразные формулировки, характерные знаки препинания или форматирование, а также неправдоподобно быстрое выполнение заданий. 6
У этого подхода есть очевидное ограничение: ни один из таких признаков сам по себе не доказывает, что работник использовал ИИ. Опытный рецензент может писать быстро, а сходство формулировок — быть следствием общей инструкции. Поэтому подобные сигналы могут быть поводом для проверки, но не должны автоматически считаться достаточным доказательством для отстранения от проекта.
Организации обычно не публикуют подробные правила против обхода контроля: точный чек-лист легко превратить в инструкцию по уклонению. Исполнители могли бы менять формулировки, намеренно делать паузы или варьировать оформление, продолжая при этом передавать суждения нейросети.
Однако закрытость создаёт и обратный риск. Когда работник не понимает, как принято решение о качестве его работы, ошибки сложнее оспорить. Устойчивая система контроля должна сочетать конфиденциальные методы обнаружения с ясными правилами, документированием решений и реальной возможностью подать апелляцию или исправить ошибку.
Как сообщалось, Mercor заявила, что использование ИИ для выполнения этой оценочной работы нарушает правила, а подтверждённые случаи ведут к немедленному отстранению от соответствующего проекта. Запрет, по данным публикаций, распространялся и на более широкую ИИ-помощь — в том числе на инструменты для написания отзывов и комментариев. 6
40
Сообщение о намеренно плохих оценках подчёркивает более общую проблему: обратная связь не становится надёжной автоматически лишь потому, что её отправил человек. Рецензент может спешить, неверно понять критерии, гнаться за количеством выполненных задач, действовать недобросовестно или пытаться обойти непрозрачную систему контроля.
Это вопрос не только технологий, но и стимулов. Разработчику нужны взвешенные и добросовестные оценки, которые предсказывают лучшее поведение модели в реальном использовании. Подрядчик же может быть прежде всего мотивирован скоростью, закрытием заданий и отсутствием претензий со стороны контроля. Когда эти стимулы расходятся, данные становятся шумными или систематически искажёнными.
Человеческая оценка особенно важна там, где вывод зависит от контекста, субъективен или плохо проверяется автоматически. Но лучше всего она работает не как простой поток одиночных баллов, а как система взаимных проверок. Практические меры могут включать:
Главный вывод прост: обучение на предпочтениях настолько надёжно, насколько надёжен процесс их формирования. Люди не являются автоматической гарантией качества, а оценки, сгенерированные ИИ, нельзя без последствий выдавать за независимую человеческую обратную связь, если цель — понять, что действительно ценят пользователи.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
По данным СМИ, нескольких подрядчиков отстранили за использование ИИ при оценке ответов ChatGPT: Project Lily должен собирать независимые человеческие предпочтения, а не суждения модели.
По данным СМИ, нескольких подрядчиков отстранили за использование ИИ при оценке ответов ChatGPT: Project Lily должен собирать независимые человеческие предпочтения, а не суждения модели. В Project Lily сотни рецензентов читают и оценивают реальные диалоги с ChatGPT; при этом в более широкой системе оценочных конвейеров OpenAI, согласно сообщениям, задействовано свыше 10 000 подрядчиков.
История показывает, что «человеческая обратная связь» сама по себе не гарантирует качества: нужны калибровка рецензентов, перекрёстные проверки и контроль стимулов.