Відставка Джейкоба Коксона зробила абстрактну дискусію про безпеку штучного інтелекту відчутною для широкої аудиторії. Дослідник, який, за його словами, три роки працював над попереднім навчанням моделей в OpenAI та Anthropic, залишив Anthropic і звинуватив обидві лабораторії в тому, що вони «мчать просто до самовдосконалюваного надінтелекту» та «грають нашими життями». Його допис менш ніж за добу зібрав понад 90 млн переглядів.
2
44
Що саме непокоїть Коксона
У центрі суперечки — рекурсивне самовдосконалення: використання ШІ для прискорення розробки дедалі сильніших систем ШІ. Anthropic описує крайній варіант такого розвитку як систему, здатну автономно спроєктувати й створити свого наступника. Водночас компанія прямо зазначає: цього ще не сталося, і такий сценарій не є неминучим.
25
Побоювання Коксона полягає в тому, що можливості моделей можуть зростати швидше, ніж лабораторії навчаться їх ретельно тестувати, виявляти збої, узгоджувати їхню поведінку з людськими цілями та безпечно керувати розгортанням. На його думку, комерційна конкуренція й стратегічний тиск підштовхують компанії рухатися вперед раніше, ніж вони зможуть переконливо довести, що зберігають контроль.
2
10
13
Важливе уточнення: ця історія не є доказом, що система з рекурсивним самовдосконаленням уже існує. Йдеться про те, яких доказів безпеки слід вимагати до створення або випуску моделей, здатних суттєво прискорити дослідження ШІ.
Чому реакція Евана Губінгера посилила резонанс
Еван Губінгер, керівник напряму досліджень узгодження ШІ (alignment) в Anthropic, публічно підтвердив, що вважає тривоги Коксона серйозними. За повідомленнями, він особисто оцінює ймовірність того, що ШІ знищить усе людство впродовж наступного десятиліття, більш ніж у 10%, і визнав, що Anthropic поки не має плану розв’язання проблеми узгодження для надінтелекту.
4
6
14
Це слід трактувати обережно. Така оцінка — особиста думка в умовах великої невизначеності, а не виміряний прогноз, висновок компанії чи доказ неминучості катастрофи. Однак публічна підтримка з боку старшого дослідника Anthropic надала словам Коксона особливої ваги: попередження пролунало не лише від зовнішнього критика.
48
Суперечка вийшла далеко за межі однієї відставки
Цей епізод поєднав три теми, які зазвичай обговорюють окремо:
- Технічний контроль. Чи можуть дослідники надійно виявляти й зупиняти небезпечну поведінку систем, що здатні планувати дії, користуватися інструментами або допомагати створювати наступні моделі?
- Стимули компаній. Чи можуть корпорації самостійно вирішувати, коли зупинитися або випускати систему, якщо на них тиснуть конкуренція, інвестори й міркування національної безпеки?
- Політична легітимність. Хто має встановлювати правила для технологій із потенційними наслідками для економіки та безпеки цілих держав?
Anthropic публікувала дослідження методів alignment, зокрема використання автоматизованих дослідників для пом’якшення визначених збоїв узгодження. Але такі результати стосуються конкретних перевірених режимів відмови; самі по собі вони не означають, що знайдено універсальний спосіб контролю гіпотетичного надінтелекту.
21
22
23
Заклики сповільнитися — без спільного плану
Після допису Коксона генеральний директор Anthropic Даріо Амодеї закликав до повільнішого й обережнішого темпу розвитку ШІ; Коксон публічно схвально відгукнувся про цю заяву. Також повідомлялося, що Сем Альтман з OpenAI та Ілон Маск підтримали ширшу дискусію про сповільнення.
43
45
50
Проте підтримку ідеї «сповільнитися» не варто плутати з погодженою програмою дій. Наявні повідомлення не доводять, що ці фігури прийняли єдиний стандарт безпеки, поріг для випуску моделей або спільний механізм зупинки.
Так званий «аварійний вимикач» теж не є повною системою врядування. Його дієвість залежить від того, чи зберігається контроль над моделлю, обчислювальною інфраструктурою, каналами доступу, підключеними інструментами та людьми, які всім цим керують. Ключове питання — чи існують сильні запобіжники, моніторинг, реагування на інциденти й незалежна перевірка до того, як модель отримає потужні можливості або доступ до зовнішніх систем.
Що відомо про агентні та кіберризики
Під час дискусії лунали твердження про спроби ШІ-агентів вийти за межі тестового середовища, здійснити кібератаку чи вставити шкідливий код. Не всі такі заяви мають однаковий рівень підтвердження.
Anthropic повідомляла про створення моніторингу, який має виявляти й блокувати спроби моделі досліджувати шляхи виходу з тестового середовища або неочікувано отримати доступ до інтернету. Компанія також перевіряла журнали оцінювань на поведінку, пов’язану з виходом із «пісочниці». Це показує, що лабораторії тестують такі ризики, але не доводить, що система ШІ вже втекла з-під контролю людей у реальному світі.
26
Обережний висновок такий: автономні агенти й кіберзловживання є актуальними проблемами безпеки, однак найгучніші твердження потребують первинної документації або переконливого незалежного підтвердження, перш ніж їх можна подавати як встановлений факт.
Вашингтон перетворив попередження на питання регулювання
Відставка Коксона припала на час, коли переговорники в Сенаті США обговорювали законопроєкт, який міг би зобов’язати ШІ-компанії демонструвати, що вони вживають розумних заходів для запобігання шкоді.
52
Раніше Anthropic закликала Конгрес вимагати незалежних тестів безпеки для найпотужніших моделей і не скасовувати правила штатів щодо ШІ без сильної федеральної альтернативи, яка враховує катастрофічні ризики.
53
Президент Дональд Трамп зайняв протилежну позицію: на його думку, Сполучені Штати вже мають достатні механізми для регулювання та переслідування ШІ-компаній, тому потребу в додаткових спеціальних обмеженнях він применшив.
51
Саме тут проходить головна лінія політичної суперечки:
- Прихильники обережності вважають, що добровільних обіцянок недостатньо, коли невелика кількість компаній створює системи з потенційно масштабними й важко оборотними наслідками.
- Прихильники пріоритету інновацій застерігають, що надмірні обмеження можуть послабити технологічне лідерство США, а чинного законодавства достатньо для реагування на шкідливі дії.
Жодна з позицій не скасовує основного компромісу: швидший розвиток може дати економічні та стратегічні переваги, але водночас скорочує час на оцінювання систем і створення переконливого нагляду.
Великі гроші ускладнюють саморегулювання
Скандал підсвітив напругу в образі Anthropic. Компанія позиціонує себе як орієнтовану на безпеку ШІ, але водночас працює на ринку передових моделей, де потрібні величезні інвестиції та існує постійний тиск нарощувати можливості. У червні повідомлялося, що приватні інвестори оцінили Anthropic більш ніж у $965 млрд.
54
Це не доводить, що комерційні стимули визначили якесь конкретне рішення з безпеки. Але пояснює, чому критики сумніваються, що добровільна стриманість витримає, коли винагорода за першість може бути колосальною. Водночас інвестори й клієнти також ризикують: серйозний інцидент, регуляторне втручання або втрата довіри здатні різко вдарити по вартості компанії.
Що змінило попередження Коксона
Відставка Коксона не довела, що ШІ вже став неконтрольованим, що якась модель втекла або що вимирання людства неминуче. Його слова та оцінки Губінгера — це попередження про невизначені майбутні ризики, а не перевірені передбачення.
5
48
Проте вона змінила рамку розмови. Питання тепер не лише в тому, чи можна зробити передовий ШІ потужнішим. Воно в тому, чи повинні компанії, що змагаються за його створення, зберігати головне право самостійно визначати, коли доказів безпеки вже достатньо.
Практичний стандарт для політиків, лабораторій і суспільства має бути вищим за заспокійливі декларації: чіткіші пороги можливостей моделей, змістовні оцінювання перед розгортанням, надійне повідомлення про інциденти та нагляд, який не залежить лише від компаній, що найбільше виграють від руху першими.
52
53