За повідомленнями медіа, підрядників усунули за використання ШІ під час оцінювання ChatGPT, оскільки Project Lily має збирати незалежні людські судження, а не згенерований моделлю фідбек. У межах Project Lily сотні підрядників читають і оцінюють реальні діалоги з ChatGPT; водночас у ширших конвеєрах оцінювання OpenA...
ОпублікувавВідредаговано за допомогою GPT-5.6 TerraЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: Why did OpenAI fire contractors working on Project Lily for using AI tools to evaluate anonymized ChatGPT conversations, how do its more tha. Article summary: OpenAI reportedly removed contractors who used generative AI to produce the judgments because Project Lily’s purpose is to collect independent human preferences. AI-written evaluations would turn a human-feedback pipelin. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Project Lily, про який повідомило видання 404 Media, — це система людського оцінювання, де підрядники аналізують відповіді ChatGPT, щоб поліпшувати подальшу поведінку моделі. Саме цим пояснюється повідомлене усунення виконавців, які застосовували генеративний ШІ для такої оцінки: цінність цих даних полягає в незалежному людському судженні. Якщо висновок формує модель, процес уже не дає змоги чітко виміряти, що насправді обирають люди. 19
20
Учасникам показують реальні запити до ChatGPT, а інколи й цілі діалоги. Вони стисло описують намір користувача, порівнюють варіанти відповідей і виставляють оцінки за шкалою від 1 до 7. За даними журналістів, в одному завданні може бути до чотирьох варіантів відповіді. Основна увага приділяється поведінковим рисам — тону, надмірній догідливості (сикофантності) та надто «людським» твердженням моделі, а не лише фактичній точності. 8
19
Такі оцінки можуть перетворюватися на дані про вподобання: структурований запис того, яку відповідь людина вважає кращою за певних обставин. Вони корисні для налаштування моделі лише тоді, коли судження є достатньо послідовними, поінформованими й незалежними.
За повідомленнями, до Project Lily залучені сотні зовнішніх рецензентів. Їх нібито набирають через Crossing Hurdles, а виплати здійснює Mercor; один із рецензентів розповів про ставку понад 50 доларів США за годину. Окремо повідомлялося, що в ширших конвеєрах оцінювання OpenAI працює понад 10 000 підрядників — цю цифру не слід трактувати як розмір саме Project Lily. 19
6
ШІ-оцінювач може працювати швидко й бути корисним у внутрішньому тестуванні, але він відповідає на інше запитання, ніж людина, яка висловлює власну перевагу. Модель схильна відтворювати закономірності, засвоєні під час навчання, і може надавати перевагу відповідям зі знайомими формулюваннями, стилем або припущеннями.
Якщо результат роботи моделі — або близької до неї моделі — раз за разом використовується для винагородження майбутніх відповідей, може виникнути петля зворотного зв’язку:
Це не означає, що кожне використання ШІ для оцінювання неодмінно погіршує модель. Автоматизоване оцінювання може бути корисним, якщо його результати перевірено на відповідність людським судженням і застосування має чіткі межі. Але підміна ним завдання, замовленого саме для збору людських уподобань, послаблює незалежність навчального сигналу — і це, ймовірно, є причиною повідомленої заборони.
Повідомляється, що керівникам не радили покладатися на детектори ШІ-текстів на кшталт GPTZero. Натомість їм пропонували аналізувати робочі патерни та самі тексти вручну: звертати увагу на надмірно одноманітні формулювання, пунктуацію чи форматування, а також неправдоподібно швидке виконання завдань. 6
У такого підходу є очевидне обмеження: жодна з цих ознак сама по собі не доводить використання ШІ. Швидкий автор може бути просто досвідченим, а схожі формулювання — наслідком спільних інструкцій. Тому відповідальне застосування таких сигналів потребує процедури, яка відрізняє привід для додаткової перевірки від достатніх підстав для усунення людини з проєкту.
Організації зазвичай не публікують детальні критерії протидії маніпуляціям: точний перелік стає інструкцією з обходу контролю. Виконавці могли б змінювати стиль, навмисно робити паузи або форматувати текст інакше, водночас фактично передаючи оцінювання моделі.
Втім, закритість створює інший ризик. Коли працівник не розуміє, як саме ухвалили рішення про якість його роботи, помилку важче оскаржити. Стійка система контролю доброчесності має поєднувати конфіденційні методи виявлення з чіткими правилами, документуванням рішень і реальною можливістю апеляції або виправлення.
За даними медіа, Mercor заявила, що застосування ШІ для виконання таких оціночних завдань порушує її політику, а підтверджені випадки ведуть до негайного усунення з відповідного проєкту. Повідомлялося також, що правила ширше забороняли ШІ-допомогу, зокрема інструменти для написання відгуків чи коментарів. 6
40
Повідомлення про навмисно неякісні оцінки показують головне: «людський зворотний зв’язок» не стає надійним автоматично лише тому, що його внесла людина. Рецензент може поспішати, неправильно зрозуміти критерії, гнатися за кількістю виконаних завдань, діяти недобросовісно або намагатися пристосуватися до непрозорої системи контролю якості.
Це питання стимулів не меншою мірою, ніж технологій. Розробнику моделі потрібні виважені, добросовісні оцінки, які передбачають кращу поведінку системи в реальному використанні. Для підрядника ж винагорода може більше залежати від швидкості, кількості закритих завдань або уникнення відбракування. Коли ці стимули розходяться, дані стають шумними або систематично викривленими.
Людська перевірка важлива там, де оцінка залежить від контексту, є суб’єктивною або складно перевіряється автоматично. Але вона найкраще працює як система взаємних перевірок, а не як простий потік одиничних балів. Практичні запобіжники можуть включати:
Головний висновок простий: навчання на людських перевагах настільки надійне, наскільки надійний процес формування цих переваг. Людські рецензенти не є автоматичною гарантією якості, а судження, згенеровані ШІ, не можуть безпосередньо замінити незалежний людський зворотний зв’язок, якщо мета — зрозуміти, що люди насправді цінують.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
За повідомленнями медіа, підрядників усунули за використання ШІ під час оцінювання ChatGPT, оскільки Project Lily має збирати незалежні людські судження, а не згенерований моделлю фідбек.
За повідомленнями медіа, підрядників усунули за використання ШІ під час оцінювання ChatGPT, оскільки Project Lily має збирати незалежні людські судження, а не згенерований моделлю фідбек. У межах Project Lily сотні підрядників читають і оцінюють реальні діалоги з ChatGPT; водночас у ширших конвеєрах оцінювання OpenAI, за даними медіа, задіяно понад 10 000 підрядників.
Історія показує ключову проблему вирівнювання ШІ: оцінка, поставлена людиною, не обов’язково є уважною або незалежною, тому системам навчання потрібні перевірки якості, а не лише велика кількість рецензентів.