Стороны также планируют обмениваться информацией, передовыми практиками и рамочными подходами к управлению ИИ. Это помогает связать технические тесты с практическими решениями: какие угрозы проверять, какие пороги риска устанавливать, кому предоставлять доступ к модели и как действовать после обнаружения серьёзной уязвимости.
Такой подход шире, чем простое сравнение моделей по бенчмаркам. Даже сильный результат в тесте не означает готовность системы к работе в государственном секторе или на объектах инфраструктуры, если отсутствуют мониторинг, понятные процедуры раскрытия проблем, ограничения полномочий и человеческий контроль.
Третье направление — изучение правил доверенного доступа к frontier-моделям. Идея заключается в поэтапной доступности: высокоэффективные системы должны оставаться доступными для легитимных исследований и полезной работы, но не распространяться без мер защиты, соответствующих их возможностям и рискам.
Иными словами, соглашение выстраивает целую цепочку безопасности: сначала систему проверяют, затем обмениваются результатами, при необходимости ограничивают доступ и закрепляют ответственность правилами управления.
Невыпущенная модель Anthropic Claude Mythos Preview наглядно демонстрирует двойственное назначение передового ИИ. Anthropic утверждает, что компания и примерно 50 партнёров Project Glasswing использовали модель для обнаружения более 10 000 уязвимостей высокой или критической степени в системно значимом программном обеспечении. Компания также сообщала, что Mythos способен находить и эксплуатировать уязвимости, включая ранее неизвестные уязвимости типа zero-day, в популярных операционных системах и браузерах.
Такая возможность может принести пользу защите: исследователи получают шанс найти слабое место раньше злоумышленников. Но при широком или недостаточно контролируемом распространении она способна сократить путь от обнаружения уязвимости до её эксплуатации. Именно поэтому Anthropic оставила Mythos в режиме ограниченного доступа через Project Glasswing, а не выпустила модель публично.
При этом доступные материалы не доказывают, что именно Claude Mythos стал причиной или непосредственным поводом для соглашения Сингапура и Microsoft от 12 июня. Корректнее рассматривать Mythos как пример быстро меняющейся среды рисков, на фоне которой особенно нужны системная оценка, контролируемый доступ и понятные правила управления.
Project Glasswing сам по себе служит инструментом управления риском. Anthropic предоставила доступ определённой группе партнёров для оборонительных задач, вместо того чтобы открыть модель всем пользователям. Это ограничивает потенциальный ущерб и одновременно позволяет специалистам изучать реальные возможности системы.
Ограниченного доступа, конечно, недостаточно для полноценной системы безопасности: нужны проверка участников, мониторинг, защищённое обращение с данными и ответственное раскрытие уязвимостей. Но этот подход хорошо иллюстрирует логику «доверенного доступа», которую изучают IMDA и Microsoft: права пользователя должны зависеть от возможностей модели и уровня риска, а frontier-система не должна восприниматься как обычный публичный программный продукт.
Обнаружение проблемы — только начало процесса. Агентство кибербезопасности Сингапура рекомендовало организациям устанавливать исправления для уязвимостей критической и высокой степени, включать многофакторную аутентификацию на интерфейсах и шлюзах, а также пересматривать избыточные права доступа. Эти меры уменьшают возможности атакующих, пока компании расследуют проблему и устраняют её.
Данные также не позволяют безоговорочно говорить, что примерно 10 000 находок Mythos были массово исправлены. Согласно одной более поздней оценке, разработчикам программного обеспечения сообщили о 1 596 уязвимостях, но исправлены были только 97. Это не означает, что проект не принёс защитной пользы, однако заявления о том, что «многие» найденные проблемы уже устранены, следует воспринимать осторожно.
Практический вывод очевиден: безопасность ИИ — это не только способность модели находить риски. Нужен полный процесс — от обнаружения и ответственного раскрытия до приоритизации исправлений и снижения уязвимости систем на период, пока устранение проблемы не завершено.
Microsoft привносит опыт разработки передовых моделей, работы с корпоративной инфраструктурой и практического управления оценкой ИИ-систем и доступом к ним. Однако заявленная область соглашения шире одной модели Microsoft: речь идёт о подходах к проверке безопасности и контролируемому доступу к frontier-моделям в целом.
Предоставленные материалы не подтверждают как формальные части этого соглашения более конкретные утверждения о собственной модели Microsoft MAI, доступе к моделям OpenAI и Anthropic через Azure AI Foundry или аналогичных договорённостях с британским Институтом безопасности ИИ и американским Центром стандартов и инноваций в области ИИ. Представлять эти детали как обязательства, закреплённые в сингапурско-американском меморандуме, не следует.
В совокупности соглашение выстраивает практическую последовательность действий:
В этом и состоит значение меморандума. Он сам по себе не делает передовой ИИ безопасным и не устраняет риски, на которые указывает Claude Mythos. Но он связывает техническую оценку с управлением доступом и практикой кибербезопасности — чтобы высокая способность модели не принималась автоматически за доказательство её готовности к реальному применению.