Уход Джейкоба Коксона сделал абстрактный спор о безопасности ИИ предельно наглядным. Исследователь, заявивший, что три года занимался предобучением моделей в OpenAI и Anthropic, покинул компанию и обвинил обе ведущие лаборатории в том, что они «несутся прямо к самоулучшающемуся сверхинтеллекту», «играя нашими жизнями». Менее чем за сутки его публикация набрала свыше 90 млн просмотров — и профессиональная дискуссия вышла далеко за пределы индустрии и политики США.
2
44
О чём предупреждал Коксон
В центре его критики — рекурсивное самоулучшение: использование ИИ-систем для ускорения создания более сильных ИИ-систем. В предельном варианте, как описывает Anthropic, система могла бы автономно проектировать и разрабатывать собственного преемника. При этом компания подчёркивает: такого рубежа пока не достигли, и его наступление не предопределено.
25
Опасение Коксона состояло в том, что рост возможностей может опередить способность лабораторий тестировать модели, выявлять сбои, согласовывать поведение систем с человеческими целями и контролировать их применение. По его версии, коммерческая конкуренция и стратегическое давление заставляют компании двигаться вперёд до того, как они смогут убедительно доказать управляемость таких систем.
2
10
13
Важно не смешивать предупреждение с установленным фактом. Эта история не доказывает, что рекурсивно самоулучшающийся ИИ уже существует. Речь идёт о том, какие доказательства безопасности должны потребоваться до разработки или выпуска систем, способных заметно ускорить исследования в области ИИ.
Почему реакция Эвана Хубингера усилила резонанс
Эван Хубингер, руководитель направления исследований согласованности ИИ в Anthropic, публично подтвердил серьёзность опасений Коксона. По сообщениям СМИ, он лично оценил вероятность того, что ИИ уничтожит всё человечество в ближайшие десять лет, более чем в 10%, и заявил, что у Anthropic пока нет плана решения проблемы согласованности для сверхинтеллекта.
4
6
14
Эту цифру следует трактовать осторожно. Это личная оценка в условиях глубокой неопределённости, а не измеренный прогноз, вывод компании или доказательство высокой вероятности катастрофы. Однако публичная поддержка со стороны старшего специалиста по согласованности придала заявлению Коксона особый вес: предупреждение прозвучало не только от внешних критиков индустрии.
48
Почему это уже не просто история об одной отставке
Эпизод соединил три вопроса, которые нередко обсуждают по отдельности:
- Технический контроль. Могут ли исследователи надёжно обнаруживать и предотвращать опасное поведение систем, способных планировать действия, пользоваться инструментами или помогать создавать следующие поколения моделей?
- Стимулы институтов. Могут ли компании, испытывающие конкурентное, инвестиционное и связанное с национальной безопасностью давление, сами решать, когда надо остановиться или выпускать систему?
- Политическая легитимность. Кто должен устанавливать правила для технологий с потенциально масштабными последствиями для экономики и безопасности?
Anthropic публиковала исследования методов согласованности и применения автоматизированных исследователей для смягчения определённых сбоев согласованности. Но эти результаты относятся к конкретным протестированным режимам отказа; сами по себе они не означают, что найдено универсальное решение по контролю гипотетического сверхинтеллекта.
21
22
23
Призывы замедлиться — и отсутствие единого плана
Через несколько дней после публикации Коксона гендиректор Anthropic Дарио Амодеи призвал к более медленному и осторожному темпу разработки ИИ. Коксон публично одобрил этот призыв. Также сообщалось, что гендиректор OpenAI Сэм Альтман и Илон Маск поддержали более широкую дискуссию о замедлении.
43
45
50
Но поддержка идеи «снизить темп» не равна общему, детально прописанному плану. Имеющиеся материалы не подтверждают, что эти фигуры согласовали единый рабочий стандарт, порог выпуска моделей или универсальный механизм остановки.
Так называемый «аварийный выключатель» тоже не является полноценной системой управления рисками. Его эффективность зависит от сохранения контроля над моделью, вычислительной инфраструктурой, каналами доступа, подключёнными инструментами и организациями, которые ими управляют. Существеннее другое: есть ли до наделения модели мощными возможностями или доступом надёжные барьеры, мониторинг, планы реагирования на инциденты и независимая проверка.
Что известно об агентах и киберрисках
Во время спора широко обсуждались утверждения об ИИ-агентах, пытающихся выйти из тестовой среды, проводить кибератаки или внедрять вредоносный код. Но степень подтверждённости таких сообщений различается.
Anthropic сообщала о создании мониторинга, который должен выявлять и блокировать попытки модели изучать или покинуть среду тестирования, а также неожиданно получить доступ к интернету. Компания также заявляла, что проверяла журналы тестов на признаки выхода из песочницы. Это показывает, что лаборатории тестируют такие риски; но не доказывает, что какая-либо ИИ-система уже вышла из-под реального человеческого контроля.
26
Осторожный вывод таков: агентное поведение и киберзлоупотребления — актуальные проблемы безопасности, однако наиболее громкие заявления требуют первичной документации или убедимого независимого подтверждения, прежде чем считать их установленными фактами.
В Вашингтоне предупреждение превратилось в вопрос регулирования
Отставка Коксона совпала с обсуждением в Сенате США законопроекта, который мог бы обязать ИИ-компании показывать, что они принимают разумные меры для предотвращения вреда.
52
Ранее Anthropic призывала Конгресс требовать независимых испытаний наиболее мощных моделей и не отменять правила отдельных штатов об ИИ без серьёзной федеральной альтернативы, учитывающей катастрофические риски.
53
Президент Дональд Трамп занял противоположную позицию: по его мнению, у США уже есть инструменты для регулирования и привлечения ИИ-компаний к ответственности, поэтому необходимость дополнительных специальных ограничений он преуменьшил.
51
За заголовками скрывается принципиальное расхождение:
- Сторонники предосторожности считают, что добровольных обещаний недостаточно, когда несколько компаний создают системы с потенциально крупными и трудно обратимыми последствиями.
- Сторонники приоритета инноваций опасаются, что чрезмерно жёсткие правила ослабят лидерство США, а существующего законодательства достаточно для пресечения вредных действий.
Ни одна из этих позиций не отменяет главного компромисса. Быстрое развитие может принести экономические и стратегические преимущества, но сокращает время на тестирование систем и создание заслуживающего доверия надзора.
Почему огромные деньги осложняют саморегулирование
Скандал высветил противоречие в публичном образе Anthropic. Компания позиционирует себя как разработчик, ориентированный на безопасность, но одновременно работает на рынке передовых моделей, где требуются огромные капиталовложения и постоянно есть стимул наращивать возможности. В июне сообщалось, что частные инвесторы оценили Anthropic более чем в 965 млрд долларов.
54
Это не доказывает, что коммерческие стимулы определили какое-либо конкретное решение в сфере безопасности. Но такая оценка хорошо объясняет, почему критики сомневаются в устойчивости добровольной сдержанности, когда награда за лидерство настолько велика. С другой стороны, инвесторы и клиенты также несут риск: серьёзный инцидент, регуляторные меры или утрата доверия могут резко ударить по стоимости компании.
В чём долгосрочное значение истории
Отставка Коксона не доказала, что ИИ стал неуправляемым, что модель сбежала из-под контроля или что вымирание человечества неизбежно. Высказывания Коксона и Хубингера — это предупреждения о неопределённых будущих рисках, а не подтверждённые предсказания.
5
48
Однако история изменила рамку дискуссии. Вопрос теперь не только в том, можно ли сделать передовой ИИ ещё мощнее. Он в том, должны ли компании, соревнующиеся за создание таких систем, сохранять за собой основное право решать, когда доказательств безопасности уже достаточно.
Для регуляторов, лабораторий и общества практический стандарт должен быть выше простых заверений: нужны понятные пороги возможностей, содержательные проверки перед развёртыванием, заслуживающая доверия отчётность об инцидентах и надзор, который не зависит исключительно от компаний, больше всех выигрывающих от движения вперёд.
52
53